El modelo Qwen3-TTS-12Hz-0.6B-Base es un sistema de conversión de texto a voz diseñado para funcionar 100% en local, permitiendo la clonación de voz con solo tres segundos de audio de referencia. Utiliza un proceso de generación de audio a 12 Hz para replicar timbres exactos en diez idiomas distintos de manera fluida y natural.
Al operar sin conexión, esta herramienta garantiza privacidad absoluta al no enviar datos a la nube y ofrece una velocidad de procesamiento inmediata. Su capacidad políglota y su funcionamiento fuera de línea lo convierten en una solución segura y versátil para la generación de contenido hablado.
La verdad es que su calidad de audio me ha impresionado, así que os recomiendo probalo.
Clonamos repositorio de GitHub:
cd
git clone -b qwen3-tts-sample https://github.com/john-rocky/litert-samples.git
cd litert-samples/compiled_model_api/text_to_speech_lm/pythonpip install ml_dtypes
pip install -r requirements.txt
Ya estaría Listo para utilizar
Desde la ruta ~/litert-samples/compiled_model_api/text_to_speech_lm/pythonpip install ml_dtypes ejecutamos el siguiente comando:
python synthesize.py --text "Hola esto es un texto a voz desde mi PC con Qwen3-TTS." --language Spanish --output hola.wav
Qwen3-TTS on LiteRT (CPU).
options:
-h, --help show this help message and exit
--text TEXT Text to speak.
--output OUTPUT Output wav path.
--model_dir MODEL_DIR Local model dir; downloads from Hugging Face if omitted.
--language LANGUAGE "auto" or one of: chinese, english, french, german, italian, japanese, korean, portuguese, russian, spanish
--speaker SPEAKER Speaker x-vector .npy; defaults to the bundled demo voice.
--talker {int4,fp32} Talker variant. fp32 is bit-exact vs the PyTorch reference under --greedy.
--greedy Deterministic greedy decoding instead of sampling.
--seed SEED Sampling seed.
--threads THREADS XNNPACK threads for talker/codec.
Necesitas ~3 segundos de tu voz en un archivo .wav (mono o estéreo, cualquier sample rate). Ejemplo: audio.wav.
Crearemos primero el archivo archivo .npy , que es un archivo de datos de NumPy, el formato estándar que usa Python para guardar matrices, vectores o embeddings. En el caso de Qwen3‑TTS el .npy contiene tu voz clonada en forma de un vector numérico.
python ../conversion/extract_speaker_embedding.py \
audio.wav mi_voz.npy
Ahora ya puedo utilizar mi voz clonada con:
python synthesize.py \
--text "Hola, esta es mi voz clonada." \
--language Spanish \
--speaker mi_voz.npy \
--output hola_clonada.wavPublicado el lunes, 27 de julio de 2026
Powered by wdblog

Este obra está bajo una licencia de Creative Commons Reconocimiento-NoComercial-CompartirIgual 4.0 Internacional.