<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Inferencia on SoloSoft</title><link>https://www.solosoft.dev/es/tags/inferencia/</link><description>Recent content in Inferencia on SoloSoft</description><generator>Hugo</generator><language>es-es</language><lastBuildDate>Fri, 07 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.solosoft.dev/es/tags/inferencia/index.xml" rel="self" type="application/rss+xml"/><item><title>AMD adquiere Taalas: grabando pesos de LLM en silicio a 17.000 tokens/segundo</title><link>https://www.solosoft.dev/es/post/amd-adquiere-taalas-modelos-grabados-en-silicio/</link><pubDate>Fri, 07 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/amd-adquiere-taalas-modelos-grabados-en-silicio/</guid><description>&lt;h1 id="amd-adquiere-taalas-grabando-pesos-de-llm-en-silicio-a-17000-tokenssegundo"&gt;AMD adquiere Taalas: grabando pesos de LLM en silicio a 17.000 tokens/segundo&lt;/h1&gt;
&lt;p&gt;El 6 de agosto de 2026, AMD anunció la adquisición de &lt;strong&gt;Taalas&lt;/strong&gt;, la startup de chips IA de Toronto que aplica el enfoque más radical a la inferencia: &lt;strong&gt;graba los pesos de los modelos directamente en el silicio&lt;/strong&gt;. El resultado es un chip que sirve Llama 3.1 8B de Meta a &lt;strong&gt;17.000 tokens por segundo&lt;/strong&gt; — 48-73x más rápido que las GPU insignia de Nvidia a una décima parte de la energía.&lt;/p&gt;
&lt;p&gt;Es la respuesta de AMD al acuerdo de 20.000 millones de dólares de Nvidia con Groq — y señala que la guerra del hardware IA se ha movido del entrenamiento a la &lt;em&gt;inferencia&lt;/em&gt;.&lt;/p&gt;</description></item><item><title>Gemma.cpp: El Motor de Inferencia C++ Ligero de Google para Modelos Gemma</title><link>https://www.solosoft.dev/es/post/gemma-cpp-inference-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/gemma-cpp-inference-2026/</guid><description>&lt;p&gt;El panorama de la inferencia de LLM ha sido moldeado en gran medida por dos enfoques: frameworks pesados como PyTorch con aceleracion GPU completa, o motores altamente optimizados pero complejos como llama.cpp que soportan cientos de arquitecturas de modelo. &lt;strong&gt;Gemma.cpp&lt;/strong&gt; toma un tercer camino deliberado: un motor C++ ligero y de dependencias minimas construido especificamente para la familia de modelos Gemma de Google, priorizando la claridad del codigo y la portabilidad sobre la maxima cobertura de funciones.&lt;/p&gt;
&lt;p&gt;Gemma.cpp es el motor de inferencia oficial de Google para sus modelos abiertos Gemma, disenado por el mismo equipo que creo los modelos. En lugar de ser un framework de inferencia de proposito general, Gemma.cpp esta enfocado con precision de laser en ejecutar las arquitecturas Gemma de manera eficiente en una amplia gama de hardware, desde servidores en la nube hasta dispositivos moviles.&lt;/p&gt;</description></item><item><title>Xorbits Inference: Plataforma de Servicio LLM Escalable</title><link>https://www.solosoft.dev/es/post/xorbits-inference-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/xorbits-inference-2026/</guid><description>&lt;p&gt;Desplegar modelos de lenguaje grandes en produccion es un desafio fundamentalmente diferente a entrenarlos. El entrenamiento requiere clusters masivos y semanas de computo, pero puede tolerar procesamiento por lotes y rendimiento variable. La inferencia en produccion requiere latencia consistente de sub-segundo, escalado elastico para manejar picos de trafico, gestion de multiples modelos en diferentes configuraciones de hardware y observabilidad en cada solicitud. La brecha entre un modelo entrenado y una infraestructura de servicio de grado de produccion es enorme.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Xorbits Inference (Xinference)&lt;/strong&gt; llena esta brecha con una plataforma de codigo abierto construida especificamente para servicio LLM escalable. Originalmente desarrollado como parte del ecosistema Xorbits para procesamiento distribuido de datos, Xinference ha crecido hasta convertirse en una de las plataformas de servicio de modelos de codigo abierto mas completas disponibles. Soporta una amplia gama de arquitecturas de modelos &amp;ndash; desde LLMs y modelos de embedding hasta modelos de vision-lenguaje y audio &amp;ndash; y proporciona las herramientas operativas necesarias para ejecutarlos de manera confiable a escala.&lt;/p&gt;</description></item></channel></rss>