<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>TTS on SoloSoft</title><link>https://www.solosoft.dev/es/tags/tts/</link><description>Recent content in TTS on SoloSoft</description><generator>Hugo</generator><language>es-es</language><atom:link href="https://www.solosoft.dev/es/tags/tts/index.xml" rel="self" type="application/rss+xml"/><item><title>ChatTTS: Modelo de Voz a Texto Conversacional Open-Source para Dialogo Natural</title><link>https://www.solosoft.dev/es/post/chattts-text-to-speech-2026/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/chattts-text-to-speech-2026/</guid><description>&lt;p&gt;La tecnologia de texto a voz ha avanzado dramaticamente en los ultimos anos, pero persiste una brecha entre las voces sinteticas y la cadencia natural de la conversacion humana. La mayoria de los modelos TTS producen voz clara y limpia que suena inequivocamente artificial — perfectamente enunciada, pero carente de las pausas, la respiracion, la risa y la variacion tonal que hacen que el dialogo se sienta real. &lt;strong&gt;ChatTTS&lt;/strong&gt; apunta directamente a esta brecha, ofreciendo un modelo de codigo abierto disenado desde cero para el habla conversacional en lugar de la narracion o el anuncio.&lt;/p&gt;
&lt;p&gt;Desarrollado por el equipo de 2noise, ChatTTS ha ganado rapidamente traccion en la comunidad de codigo abierto por su capacidad de producir voz que suena genuinamente humana. El modelo fue entrenado en mas de 30,000 horas de datos de audio conversacional, priorizando deliberadamente los patrones de dialogo natural sobre la calidad de grabacion pristina que caracteriza a la mayoria de los conjuntos de datos TTS comerciales. El resultado es un modelo que rie, pausa, se desvanece y varıa su tono y ritmo de maneras que se sienten notablemente organicas.&lt;/p&gt;</description></item><item><title>CosyVoice: Modelo de Generacion de Voz Multilingue Open-Source de Alibaba con 20K Estrellas</title><link>https://www.solosoft.dev/es/post/cosyvoice-tts-2026/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/cosyvoice-tts-2026/</guid><description>&lt;p&gt;La tecnologia de generacion de voz ha visto un progreso notable, pero la mayoria de los modelos open-source de texto a voz (TTS) aun luchan con una compensacion fundamental: calidad versus cobertura de idiomas. &lt;strong&gt;CosyVoice&lt;/strong&gt;, desarrollado por el equipo &lt;a href="https://github.com/FunAudioLLM/CosyVoice"&gt;FunAudioLLM&lt;/a&gt; de Alibaba, rompe esta barrera ofreciendo generacion de voz de calidad de produccion en 9 idiomas y mas de 18 dialectos chinos.&lt;/p&gt;
&lt;p&gt;Con mas de 20,000 estrellas en GitHub, CosyVoice se ha convertido en una solucion de referencia para desarrolladores e investigadores que necesitan sintesis de voz multilingue con capacidades avanzadas como clonacion de voz zero-shot, control de emociones y generacion guiada por instrucciones. A diferencia de las APIs comerciales de TTS que cobran por caracter y limitan la personalizacion, CosyVoice es completamente open-source y auto-alojable.&lt;/p&gt;</description></item><item><title>edge-tts: TTS en Python Usando el Servicio Online de Microsoft Edge</title><link>https://www.solosoft.dev/es/post/edge-tts-2026/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/edge-tts-2026/</guid><description>&lt;p&gt;La conversión de texto a voz de alta calidad generalmente requiere costosas APIs en la nube o complejas configuraciones de modelos locales. Edge-TTS, creado por rany2, adopta un enfoque ingenioso: aprovecha el servicio TTS en línea integrado en Microsoft Edge, proporcionando acceso gratuito a cientos de voces naturales en docenas de idiomas.&lt;/p&gt;
&lt;p&gt;La herramienta es un simple CLI de Python que convierte texto a archivos de audio usando las mismas voces de TTS neuronal que alimentan la función de lectura en voz alta del navegador Microsoft Edge. Soporta SSML, ajuste de voz y generación de subtítulos, lo que la hace mucho más potente de lo que su simple propósito sugiere, como solución gratuita y de código abierto.&lt;/p&gt;</description></item><item><title>GPT-SoVITS: Clonacion de Voz con Pocos Ejemplos con Solo 1 Minuto de Datos de Voz</title><link>https://www.solosoft.dev/es/post/gpt-sovits-voice-cloning-2026/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/gpt-sovits-voice-cloning-2026/</guid><description>&lt;p&gt;GPT-SoVITS es un sistema de clonacion de voz y texto a voz de codigo abierto desarrollado por &lt;a href="https://github.com/RVC-Boss/GPT-SoVITS"&gt;RVC-Boss&lt;/a&gt; que ha causado sensacion en la comunidad de audio IA. La capacidad destacada del proyecto es la clonacion de voz con pocos ejemplos que requiere solo 1 minuto de datos de voz para entrenar un modelo de voz convincente, con capacidades zero-shot usando tan solo 5-10 segundos de audio de referencia. Soportando chino, ingles, japones y coreano, GPT-SoVITS combina el poder del modelado autoregresivo basado en GPT con la fidelidad espectral de SoVITS (Sintesis de Voz Cantada con Refinamiento Iterativo usando un Sinkhorn basado en Transformer).&lt;/p&gt;</description></item><item><title>Higgs Audio: Modelo Fundamental de Texto a Audio Open-Source de Boson AI</title><link>https://www.solosoft.dev/es/post/higgs-audio-generation-2026/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/higgs-audio-generation-2026/</guid><description>&lt;p&gt;La tecnología de texto a voz ha avanzado dramáticamente en los últimos años, pasando de una síntesis robótica y monótona a una generación de voz notablemente natural. &lt;strong&gt;Higgs Audio&lt;/strong&gt; de Boson AI representa el estado del arte en generación de audio de código abierto, ofreciendo un modelo fundamental de texto a audio que produce un habla indistinguible de las grabaciones humanas en múltiples voces, idiomas y registros emocionales.&lt;/p&gt;
&lt;p&gt;Lo que distingue a Higgs Audio de los sistemas TTS anteriores es su escala y arquitectura. Preentrenado en más de 10 millones de horas de datos de audio diversos &amp;ndash; mucho más que cualquier modelo TTS de código abierto anterior &amp;ndash; Higgs Audio ha aprendido toda la riqueza y variedad del habla humana. Puede generar habla expresiva con emoción, énfasis y ritmo apropiados, clonar una voz a partir de solo unos segundos de audio, producir diálogos multi-locutor con voces distintas e incluso transferir estilos de habla entre voces.&lt;/p&gt;</description></item><item><title>IndexTTS-vLLM: Texto a Voz Acelerado de Código Abierto con Inferencia vLLM</title><link>https://www.solosoft.dev/es/post/index-tts-vllm-2026/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/index-tts-vllm-2026/</guid><description>&lt;p&gt;IndexTTS-vLLM es una versión acelerada del sistema de texto a voz IndexTTS que porta el pipeline de inferencia del modelo a vLLM. El resultado es una aceleración de 2.5-3.5x en inferencia TTS, habilitando síntesis de voz en tiempo real con clonación de voz zero-shot y mezcla de audio multi-personaje en GPUs de consumo.&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;Repositorio&lt;/strong&gt;: &lt;a href="https://github.com/Ksuriuri/index-tts-vllm"&gt;github.com/Ksuriuri/index-tts-vllm&lt;/a&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="comparación-de-rendimiento"&gt;Comparación de Rendimiento&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Capacidad&lt;/th&gt;
 &lt;th&gt;IndexTTS Original&lt;/th&gt;
 &lt;th&gt;IndexTTS-vLLM&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Motor de inferencia&lt;/td&gt;
 &lt;td&gt;Implementación personalizada&lt;/td&gt;
 &lt;td&gt;vLLM (PagedAttention)&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Velocidad relativa&lt;/td&gt;
 &lt;td&gt;1x (línea base)&lt;/td&gt;
 &lt;td&gt;2.5-3.5x&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Factor tiempo real (RTX 4090)&lt;/td&gt;
 &lt;td&gt;~0.4x&lt;/td&gt;
 &lt;td&gt;~1.2-1.5x&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Inferencia por lotes&lt;/td&gt;
 &lt;td&gt;Limitada&lt;/td&gt;
 &lt;td&gt;Procesamiento continuo eficiente&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Uso de memoria&lt;/td&gt;
 &lt;td&gt;Mayor por solicitud&lt;/td&gt;
 &lt;td&gt;Optimizado via PagedAttention&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;

&lt;figure class="mermaid-wrapper not-prose" role="img" aria-label="Mermaid diagram"&gt;
 &lt;div class="mermaid-container"&gt;
 &lt;pre class="mermaid"&gt;flowchart LR
 A[Texto de Entrada] --&amp;gt; B[Codificador de Texto\nFonemizador y Tokenizador]
 B --&amp;gt; C[Motor de Inferencia vLLM\nGeneración de Tokens de Audio]
 C --&amp;gt; D[Decodificador de Audio\nTokens a Forma de Onda]
 D --&amp;gt; E[Audio de Salida\nWAV / MP3]

 F[Referencia de Voz\nMuestra de Audio] --&amp;gt; G[Codificador de Voz]
 G --&amp;gt; C&lt;/pre&gt;
 &lt;script type="application/mermaid"&gt;flowchart LR
 A[Texto de Entrada] --&gt; B[Codificador de Texto\nFonemizador y Tokenizador]
 B --&gt; C[Motor de Inferencia vLLM\nGeneración de Tokens de Audio]
 C --&gt; D[Decodificador de Audio\nTokens a Forma de Onda]
 D --&gt; E[Audio de Salida\nWAV / MP3]

 F[Referencia de Voz\nMuestra de Audio] --&gt; G[Codificador de Voz]
 G --&gt; C&lt;/script&gt;
 &lt;/div&gt;
&lt;/figure&gt;&lt;h2 id="aceleración-por-hardware"&gt;Aceleración por Hardware&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Hardware&lt;/th&gt;
 &lt;th&gt;Original (RTF)&lt;/th&gt;
 &lt;th&gt;vLLM (RTF)&lt;/th&gt;
 &lt;th&gt;Aceleración&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;RTX 4090 (24GB)&lt;/td&gt;
 &lt;td&gt;2.5x (0.4x real)&lt;/td&gt;
 &lt;td&gt;0.67x (1.5x real)&lt;/td&gt;
 &lt;td&gt;3.7x&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;RTX 3090 (24GB)&lt;/td&gt;
 &lt;td&gt;3.0x (0.33x real)&lt;/td&gt;
 &lt;td&gt;0.85x (1.18x real)&lt;/td&gt;
 &lt;td&gt;3.5x&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;RTX 4070 (12GB)&lt;/td&gt;
 &lt;td&gt;3.5x (0.29x real)&lt;/td&gt;
 &lt;td&gt;1.1x (0.91x real)&lt;/td&gt;
 &lt;td&gt;3.2x&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;A100 (80GB)&lt;/td&gt;
 &lt;td&gt;2.0x (0.5x real)&lt;/td&gt;
 &lt;td&gt;0.5x (2.0x real)&lt;/td&gt;
 &lt;td&gt;4.0x&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="calidad-de-voz"&gt;Calidad de Voz&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Dimensión&lt;/th&gt;
 &lt;th&gt;Calificación&lt;/th&gt;
 &lt;th&gt;Notas&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Naturalidad&lt;/td&gt;
 &lt;td&gt;Muy Alta&lt;/td&gt;
 &lt;td&gt;Competitiva con TTS comercial&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Fidelidad de clonación&lt;/td&gt;
 &lt;td&gt;Alta&lt;/td&gt;
 &lt;td&gt;Efectiva desde 5-10s de referencia&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Prosodia y entonación&lt;/td&gt;
 &lt;td&gt;Buena&lt;/td&gt;
 &lt;td&gt;Artefactos ocasionales&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Soporte multi-idioma&lt;/td&gt;
 &lt;td&gt;Chino (mejor), Inglés, Japonés&lt;/td&gt;
 &lt;td&gt;Cobertura en expansión&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="faq"&gt;FAQ&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;Qué es IndexTTS-vLLM?&lt;/strong&gt; Versión acelerada de IndexTTS usando vLLM para inferencia ~3x más rápida, soportando clonación de voz zero-shot y mezcla multi-personaje.&lt;/p&gt;</description></item><item><title>MLX-Audio: Libreria de TTS, STT y STS Optimizada para Apple Silicon</title><link>https://www.solosoft.dev/es/post/mlx-audio-apple-silicon-2026/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/mlx-audio-apple-silicon-2026/</guid><description>&lt;p&gt;Los Macs con Apple Silicon equipados con chips de la serie M &amp;ndash; desde el M1 hasta el ultimo M4 Ultra &amp;ndash; poseen una potencia computacional extraordinaria, particularmente para cargas de trabajo de aprendizaje automatico. Su arquitectura de memoria unificada permite que los modelos accedan a grandes cantidades de memoria rapida sin los cuellos de botella de la transferencia tradicional de datos CPU-GPU. &lt;strong&gt;MLX-Audio&lt;/strong&gt;, una libreria Python de codigo abierto construida sobre el framework MLX de Apple, esta disenada especificamente para explotar esta ventaja de hardware en todo lo relacionado con audio AI.&lt;/p&gt;
&lt;p&gt;MLX-Audio proporciona una interfaz unificada para conversion de texto a voz, voz a texto y voz a voz, soportando docenas de modelos desde Whisper de OpenAI (para transcripcion) hasta Kokoro y VoiceCraft (para sintesis). Reune capacidades que tipicamente estan dispersas en multiples librerias y frameworks, todas optimizadas para ejecutarse eficientemente en hardware Mac.&lt;/p&gt;</description></item><item><title>VoxCPM2: Sintesis de Voz Multilingue Sin Tokenizador de OpenBMB</title><link>https://www.solosoft.dev/es/post/voxcpm-tts-2026/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/voxcpm-tts-2026/</guid><description>&lt;p&gt;VoxCPM2 es un modelo de texto a voz (TTS) sin tokenizador desarrollado por &lt;a href="https://www.openbmb.cn/"&gt;OpenBMB&lt;/a&gt;, una comunidad de investigacion de IA de codigo abierto afiliada a la Universidad Tsinghua y la Academia de Inteligencia Artificial de Beijing (BAAI). Con 2 mil millones de parametros, VoxCPM2 representa un cambio de paradigma en la sintesis de voz al operar directamente sobre representaciones continuas de voz, eliminando la necesidad de tokenizadores de audio discretos que normalmente degradan la calidad de la voz.&lt;/p&gt;
&lt;p&gt;El modelo soporta mas de 30 idiomas con capacidades que abarcan clonacion de voz zero-shot, diseno de voz (creacion de voces completamente nuevas a partir de descripciones textuales) e inferencia de transmision en tiempo real. VoxCPM2 se ha convertido rapidamente en uno de los modelos TTS de codigo abierto mas comentados de 2026, compitiendo directamente con ofertas comerciales como ElevenLabs y OpenAI TTS, mientras permanece disponible gratuitamente bajo la licencia Apache 2.0.&lt;/p&gt;</description></item></channel></rss>