<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Reconocimiento De Voz on SoloSoft</title><link>https://www.solosoft.dev/es/tags/reconocimiento-de-voz/</link><description>Recent content in Reconocimiento De Voz on SoloSoft</description><generator>Hugo</generator><language>es-es</language><atom:link href="https://www.solosoft.dev/es/tags/reconocimiento-de-voz/index.xml" rel="self" type="application/rss+xml"/><item><title>Faster-Whisper: Reconocimiento de Voz 4x Más Rápido con CTranslate2</title><link>https://www.solosoft.dev/es/post/faster-whisper-asr-2026/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/faster-whisper-asr-2026/</guid><description>&lt;p&gt;El modelo Whisper de OpenAI fue un gran avance en el reconocimiento automático de voz (ASR), demostrando que el entrenamiento supervisado a gran escala podía producir un modelo con capacidades robustas de transcripción multilingüe. Sin embargo, la implementación estándar de PyTorch dejaba un rendimiento significativo sin explotar. &lt;strong&gt;Faster-Whisper&lt;/strong&gt;, desarrollado por SYSTRAN, aborda esta brecha mediante una reimplementación basada en CTranslate2 que logra mejoras dramáticas de velocidad.&lt;/p&gt;
&lt;p&gt;CTranslate2 es un motor de inferencia específicamente optimizado para modelos Transformer, que soporta cuantización INT8 y FP16, operaciones matriciales optimizadas para CPU y decodificación eficiente de búsqueda de haz. Al reimplementar la arquitectura de Whisper en este motor, Faster-Whisper logra mejoras de velocidad de 3-4x mientras reduce el consumo de memoria aproximadamente a la mitad.&lt;/p&gt;</description></item><item><title>MLX-Audio: Libreria de TTS, STT y STS Optimizada para Apple Silicon</title><link>https://www.solosoft.dev/es/post/mlx-audio-apple-silicon-2026/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/mlx-audio-apple-silicon-2026/</guid><description>&lt;p&gt;Los Macs con Apple Silicon equipados con chips de la serie M &amp;ndash; desde el M1 hasta el ultimo M4 Ultra &amp;ndash; poseen una potencia computacional extraordinaria, particularmente para cargas de trabajo de aprendizaje automatico. Su arquitectura de memoria unificada permite que los modelos accedan a grandes cantidades de memoria rapida sin los cuellos de botella de la transferencia tradicional de datos CPU-GPU. &lt;strong&gt;MLX-Audio&lt;/strong&gt;, una libreria Python de codigo abierto construida sobre el framework MLX de Apple, esta disenada especificamente para explotar esta ventaja de hardware en todo lo relacionado con audio AI.&lt;/p&gt;
&lt;p&gt;MLX-Audio proporciona una interfaz unificada para conversion de texto a voz, voz a texto y voz a voz, soportando docenas de modelos desde Whisper de OpenAI (para transcripcion) hasta Kokoro y VoiceCraft (para sintesis). Reune capacidades que tipicamente estan dispersas en multiples librerias y frameworks, todas optimizadas para ejecutarse eficientemente en hardware Mac.&lt;/p&gt;</description></item></channel></rss>