AMD adquiere Taalas: grabando pesos de LLM en silicio a 17.000 tokens/segundo
El 6 de agosto de 2026, AMD anunció la adquisición de Taalas, la startup de chips IA de Toronto que aplica el enfoque más radical a la inferencia: graba los pesos de los modelos directamente en el silicio. El resultado es un chip que sirve Llama 3.1 8B de Meta a 17.000 tokens por segundo — 48-73x más rápido que las GPU insignia de Nvidia a una décima parte de la energía.
Es la respuesta de AMD al acuerdo de 20.000 millones de dólares de Nvidia con Groq — y señala que la guerra del hardware IA se ha movido del entrenamiento a la inferencia.
Qué es Taalas
Fundada en 2023 y con sede en Toronto, Taalas está liderada por Ljubisa Bajic, ex ejecutivo de AMD y ex CEO de Tenstorrent. La compañía salió del stealth en febrero de 2026 con su primer chip de prueba, el HC1, fabricado en el proceso de 6nm de TSMC.
El acuerdo, anunciado al cierre del mercado del jueves, es una adquisición real (no un acquihire), con términos no revelados. Se espera que cierre en Q4 2026, sujeto a aprobación regulatoria. Bajic y el equipo se unirán a la organización de IA de AMD bajo el SVP Vamsi Boppana.
“Fundamos Taalas para repensar la inferencia IA desde cero, construyendo el hardware alrededor del modelo.” — Ljubisa Bajic, cofundador y CEO de Taalas
MSIC: el modelo es el ordenador
La tecnología de Taalas abandona el principio central de la computación moderna — la separación entre software y hardware de propósito general. En lugar de una GPU que carga pesos desde memoria, Taalas usa herramientas EDA propietarias para traducir la arquitectura y los pesos de una red neuronal directamente a un layout de transistores personalizado. El dataflow del modelo queda cableado entre elementos de cómputo; los pesos se hornean literalmente en las capas metálicas.
Esto convierte a los chips de Taalas en Circuitos Integrados Específicos de Modelo (MSIC) — y es por qué el HC1 es fundamentalmente distinto de las GPU, los LPU de Groq (dataflow programable) y los motores wafer-scale de Cerebras:
| Característica | GPU Nvidia | Groq LPU | Cerebras | Taalas MSIC |
|---|---|---|---|---|
| Arquitectura | Propósito general | Dataflow programable | Dataflow wafer-scale | ASIC específico de modelo |
| Almacenamiento de pesos | HBM externa | SRAM on-chip | SRAM on-chip | Grabados en silicio |
| Programabilidad | Cualquier modelo | Cualquier modelo | Cualquier modelo | Solo un modelo |
| Cuello de botella | Ancho de banda HBM | Capacidad SRAM | Huella de silicio | Ninguno (sin fetch de pesos) |
Un procesador Taalas tiene dos regiones:
- Mask-ROM recall fabric — donde los pesos se graban permanentemente (una sola capa metálica)
- SRAM recall fabric — estado dinámico en runtime: KV caches y adaptadores LoRA
Los números: benchmarks del HC1
| Sistema | Tokens/seg (Llama 3.1 8B) | vs HC1 |
|---|---|---|
| Taalas HC1 | 17.000 | — |
| Sistema Cerebras | ~1.981 | 8,5x más lento |
| Nvidia B200 | 353 | 48x más lento |
| Nvidia H200 | 230 | 73x más lento |
Taalas también afirma 90% menos consumo de energía que soluciones GPU, y un ciclo de desarrollo de ~1 semana de diseño + ~2 meses de fabricación. Financiación total: 219M$ (169M$ en la última ronda).
Las advertencias honestas: son cifras propias de Taalas, no verificadas independientemente. El titular de 17.000 tok/s depende de cuantización agresiva, que conlleva tradeoffs de calidad (potencialmente más alucinaciones) que el marketing de AMD no aborda. Y el HC1 solo ejecuta un modelo: Llama 3.1 8B.
La hoja de ruta HC2: escalando a modelos frontera
El chip de segunda generación HC2 (previsto para verano 2026) apunta a 20 mil millones de parámetros por chip. ¿Modelos más grandes? Solo distribuye entre chips con paralelismo de pipeline:
- 50 aceleradores HC2 → sirven un modelo de billón de parámetros
- DeepSeek-671B necesitaría ~30 tape-outs
Compara con los sistemas LPX de Nvidia, que necesitarían varias docenas de GPU y al menos 2.000 LPU de Groq para servir el mismo modelo.
La estrategia de AMD: inferencia desagregada de primera parte
AMD planea combinar racks Helios basados en Instinct con silicio Taalas en una arquitectura desagregada:
- Prefill (procesamiento de prompts pesado) → GPU Instinct
- Decode (generación de tokens) → aceleradores Taalas
- Orquestado por ROCm, parte del stack completo (Instinct + EPYC + Helios + ROCm)
Esto replica la estrategia de Groq de Nvidia — pero con una diferencia crucial: AMD posee todo el stack. Sin fees de partnership, sin dependencia de terceros. AMD trabajaba antes con Cerebras en un diseño desagregado similar; Taalas lo trae a casa.
“AMD está construyendo una plataforma IA full-stack que da a los clientes la flexibilidad de desplegar la solución de cómputo correcta para cada carga de trabajo IA.” — Vamsi Boppana, SVP, AMD AI Group
El tradeoff del bloqueo de modelo
La pega: una vez desplegado, te quedas con ese modelo. Cualquier cambio mayor que un adaptador LoRA requiere un re-spin físico de los chips. Con modelos nuevos casi cada mes, los clientes deben estar muy seguros de su elección.
La mitigación de Taalas: como solo las capas superiores llevan el modelo, un re-spin cambia solo 2 de ~100 capas metálicas — reduciendo el tiempo a ~2 meses y siendo 100x menos caro que entrenar un modelo frontera. La economía funciona mejor para modelos estables y maduros ejecutándose a escala masiva de producción.
Qué significa para la economía de la inferencia
Este acuerdo es más grande que una adquisición. Confirma tres cambios:
- La inferencia es el nuevo campo de batalla. Los analistas proyectan que la demanda de inferencia superará al entrenamiento por 118x en 2026 y reclamará el 75% de todo el cómputo IA en 2030. Ahí está el dinero — y la competencia.
- El test-time scaling se vuelve viable. Los modelos de razonamiento (o1, DeepSeek-R1) logran inteligencia “pensando más”, consumiendo 10-100x más tokens. Si AMD reduce el coste de token 10-20x, los desarrolladores pueden permitirse cadenas de razonamiento mucho más profundas.
- Los agentes IA se abaratan. Los loops agénticos (asistentes de código, sistemas multiagente) corren iterativamente y consumen muchos tokens. La generación de tokens barata y rápida es lo que los hace prácticos a escala.
Para los desarrolladores, la conclusión práctica: deja de calcular la inferencia como una curva lineal de coste de GPU. El silicio dedicado para modelos abiertos populares está llegando — y con OpenAI, Anthropic y Meta como clientes de Instinct, un GPT o Claude en hardware híbrido Instinct-Taalas es perfectamente plausible.
Conclusión
AMD adquiriendo Taalas es la señal más clara de que el silicio de inferencia de función fija es una necesidad competitiva, no un nicho. La tecnología es radical, los benchmarks son llamativos (con advertencias) y el tradeoff del bloqueo de modelo es real. Pero si aunque sea una fracción de la inferencia de producción se asienta en modelos estables, grabarlos en silicio a 17.000 tokens/segundo reformará la economía de cada aplicación IA construida encima.
無程式碼也能輕鬆打造專業LINE官方帳號!一鍵導入模板,讓AI助你行銷加分!