<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>VLLM on SoloSoft</title><link>https://www.solosoft.dev/es/tags/vllm/</link><description>Recent content in VLLM on SoloSoft</description><generator>Hugo</generator><language>es-es</language><lastBuildDate>Fri, 01 May 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.solosoft.dev/es/tags/vllm/index.xml" rel="self" type="application/rss+xml"/><item><title>IndexTTS-vLLM: Texto a Voz Acelerado de Código Abierto con Inferencia vLLM</title><link>https://www.solosoft.dev/es/post/index-tts-vllm-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/index-tts-vllm-2026/</guid><description>&lt;p&gt;IndexTTS-vLLM es una versión acelerada del sistema de texto a voz IndexTTS que porta el pipeline de inferencia del modelo a vLLM. El resultado es una aceleración de 2.5-3.5x en inferencia TTS, habilitando síntesis de voz en tiempo real con clonación de voz zero-shot y mezcla de audio multi-personaje en GPUs de consumo.&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;Repositorio&lt;/strong&gt;: &lt;a href="https://github.com/Ksuriuri/index-tts-vllm"&gt;github.com/Ksuriuri/index-tts-vllm&lt;/a&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="comparación-de-rendimiento"&gt;Comparación de Rendimiento&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Capacidad&lt;/th&gt;
 &lt;th&gt;IndexTTS Original&lt;/th&gt;
 &lt;th&gt;IndexTTS-vLLM&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Motor de inferencia&lt;/td&gt;
 &lt;td&gt;Implementación personalizada&lt;/td&gt;
 &lt;td&gt;vLLM (PagedAttention)&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Velocidad relativa&lt;/td&gt;
 &lt;td&gt;1x (línea base)&lt;/td&gt;
 &lt;td&gt;2.5-3.5x&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Factor tiempo real (RTX 4090)&lt;/td&gt;
 &lt;td&gt;~0.4x&lt;/td&gt;
 &lt;td&gt;~1.2-1.5x&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Inferencia por lotes&lt;/td&gt;
 &lt;td&gt;Limitada&lt;/td&gt;
 &lt;td&gt;Procesamiento continuo eficiente&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Uso de memoria&lt;/td&gt;
 &lt;td&gt;Mayor por solicitud&lt;/td&gt;
 &lt;td&gt;Optimizado via PagedAttention&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;

&lt;figure class="mermaid-wrapper not-prose" role="img" aria-label="Mermaid diagram"&gt;
 &lt;div class="mermaid-container"&gt;
 &lt;pre class="mermaid"&gt;flowchart LR
 A[Texto de Entrada] --&amp;gt; B[Codificador de Texto\nFonemizador y Tokenizador]
 B --&amp;gt; C[Motor de Inferencia vLLM\nGeneración de Tokens de Audio]
 C --&amp;gt; D[Decodificador de Audio\nTokens a Forma de Onda]
 D --&amp;gt; E[Audio de Salida\nWAV / MP3]

 F[Referencia de Voz\nMuestra de Audio] --&amp;gt; G[Codificador de Voz]
 G --&amp;gt; C&lt;/pre&gt;
 &lt;script type="application/mermaid"&gt;flowchart LR
 A[Texto de Entrada] --&gt; B[Codificador de Texto\nFonemizador y Tokenizador]
 B --&gt; C[Motor de Inferencia vLLM\nGeneración de Tokens de Audio]
 C --&gt; D[Decodificador de Audio\nTokens a Forma de Onda]
 D --&gt; E[Audio de Salida\nWAV / MP3]

 F[Referencia de Voz\nMuestra de Audio] --&gt; G[Codificador de Voz]
 G --&gt; C&lt;/script&gt;
 &lt;/div&gt;
&lt;/figure&gt;&lt;h2 id="aceleración-por-hardware"&gt;Aceleración por Hardware&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Hardware&lt;/th&gt;
 &lt;th&gt;Original (RTF)&lt;/th&gt;
 &lt;th&gt;vLLM (RTF)&lt;/th&gt;
 &lt;th&gt;Aceleración&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;RTX 4090 (24GB)&lt;/td&gt;
 &lt;td&gt;2.5x (0.4x real)&lt;/td&gt;
 &lt;td&gt;0.67x (1.5x real)&lt;/td&gt;
 &lt;td&gt;3.7x&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;RTX 3090 (24GB)&lt;/td&gt;
 &lt;td&gt;3.0x (0.33x real)&lt;/td&gt;
 &lt;td&gt;0.85x (1.18x real)&lt;/td&gt;
 &lt;td&gt;3.5x&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;RTX 4070 (12GB)&lt;/td&gt;
 &lt;td&gt;3.5x (0.29x real)&lt;/td&gt;
 &lt;td&gt;1.1x (0.91x real)&lt;/td&gt;
 &lt;td&gt;3.2x&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;A100 (80GB)&lt;/td&gt;
 &lt;td&gt;2.0x (0.5x real)&lt;/td&gt;
 &lt;td&gt;0.5x (2.0x real)&lt;/td&gt;
 &lt;td&gt;4.0x&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="calidad-de-voz"&gt;Calidad de Voz&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Dimensión&lt;/th&gt;
 &lt;th&gt;Calificación&lt;/th&gt;
 &lt;th&gt;Notas&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Naturalidad&lt;/td&gt;
 &lt;td&gt;Muy Alta&lt;/td&gt;
 &lt;td&gt;Competitiva con TTS comercial&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Fidelidad de clonación&lt;/td&gt;
 &lt;td&gt;Alta&lt;/td&gt;
 &lt;td&gt;Efectiva desde 5-10s de referencia&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Prosodia y entonación&lt;/td&gt;
 &lt;td&gt;Buena&lt;/td&gt;
 &lt;td&gt;Artefactos ocasionales&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Soporte multi-idioma&lt;/td&gt;
 &lt;td&gt;Chino (mejor), Inglés, Japonés&lt;/td&gt;
 &lt;td&gt;Cobertura en expansión&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="faq"&gt;FAQ&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;Qué es IndexTTS-vLLM?&lt;/strong&gt; Versión acelerada de IndexTTS usando vLLM para inferencia ~3x más rápida, soportando clonación de voz zero-shot y mezcla multi-personaje.&lt;/p&gt;</description></item><item><title>vLLM: Inferencia de LLMs de Alto Rendimiento con PagedAttention</title><link>https://www.solosoft.dev/es/post/vllm-inference-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/vllm-inference-2026/</guid><description>&lt;p&gt;Serving LLMs in production is fundamentally a memory management problem. The KV cache — the set of attention key-value pairs stored during generation — grows with each token produced. For a 70B parameter model serving multiple concurrent requests, the KV cache consumes hundreds of megabytes per sequence. Poor memory management means wasted GPU memory, lower throughput, and higher cost per token.&lt;/p&gt;
&lt;p&gt;vLLM solves this with PagedAttention, a breakthrough that applies operating system virtual memory concepts to LLM inference. By managing the KV cache in fixed-size blocks (pages) rather than contiguous memory regions, vLLM eliminates fragmentation — the dominant memory waste in naive inference — and achieves near-perfect memory utilization. The result is 2-4x higher throughput than any previous open-source inference engine.&lt;/p&gt;</description></item></channel></rss>