AI

AMD adquiere Taalas: grabando pesos de LLM en silicio a 17.000 tokens/segundo

AMD está adquiriendo Taalas, la startup de Toronto que graba los pesos de los modelos directamente en el silicio — su chip HC1 sirve Llama 3.1 8B a 17.000 tokens/seg, 48-73x más rápido que las GPU de Nvidia. Cómo funciona la tecnología MSIC, por qué la compró AMD y qué significa para los costes de inferencia.

Keeping this site alive takes effort — your support means everything.
無程式碼也能輕鬆打造專業LINE官方帳號!一鍵導入模板,讓AI助你行銷加分! 無程式碼也能輕鬆打造專業LINE官方帳號!一鍵導入模板,讓AI助你行銷加分!
AMD adquiere Taalas: grabando pesos de LLM en silicio a 17.000 tokens/segundo

Conclusiones clave

  • AMD acordó adquirir Taalas (06-08-2026), una startup de Toronto cuyos chips graban los pesos de los modelos directamente en el silicio — un circuito integrado específico de modelo (MSIC) que promete acelerar la inferencia un orden de magnitud.
  • El chip HC1 de Taalas sirve Llama 3.1 8B de Meta a 17.000 tokens/segundo — 48-73x más rápido que las GPU H200/B200 de Nvidia y 8,5x más rápido que Cerebras, usando solo 1/10 de la energía.
  • Los chips usan dos regiones: mask-ROM (pesos grabados) y SRAM (KV caches + adaptadores LoRA). El HC2 de este verano duplica la capacidad a 20B parámetros por chip; 50 chips sirven un modelo de billón de parámetros.
  • El gran tradeoff: los MSIC están bloqueados a un solo modelo — cualquier actualización mayor que un LoRA requiere re-spin, aunque solo cambian 2 de 100 capas metálicas, reduciendo el tiempo a ~2 meses.
  • AMD planea combinar silicio de Taalas con GPU Instinct en racks Helios (prefill en GPU + decode en Taalas), replicando el acuerdo de 20.000M$ de Nvidia con Groq — señal de que el silicio de inferencia dedicado ya es una necesidad competitiva.

Respuestas clave

¿Qué es Taalas y qué significa la adquisición de AMD?

Taalas es una startup de chips de inferencia IA de Toronto fundada en 2023 por Ljubisa Bajic (ex ejecutivo de AMD y ex CEO de Tenstorrent). El 6 de agosto de 2026, AMD anunció un acuerdo definitivo para adquirirla — una adquisición real, no un acquihire (términos no revelados), que se espera cerrar en Q4 2026 sujeto a aprobación regulatoria. AMD planea integrar la tecnología de Taalas con sus GPU Instinct en sistemas Helios, creando plataformas de inferencia desagregada de primera parte.

¿Cómo funciona grabar los pesos de un modelo en silicio?

En lugar de una GPU de propósito general que carga pesos desde memoria HBM, Taalas usa herramientas EDA para traducir la arquitectura y los pesos de una red neuronal directamente a un layout de transistores personalizado. El dataflow del modelo queda cableado y los pesos se graban literalmente en las capas metálicas. Los chips tienen dos regiones: mask-ROM (pesos grabados permanentemente) y SRAM (KV caches dinámicos y adaptadores LoRA). Esto elimina la carga de pesos desde HBM — el principal cuello de botella y consumo de energía en GPU.

¿Qué tan rápido es realmente el chip HC1 de Taalas?

Taalas afirma 17.000 tokens/segundo en Llama 3.1 8B (TSMC 6nm) — 48x más rápido que Nvidia B200 (353 tok/s), 73x más rápido que H200 (230 tok/s) y 8,5x más rápido que Cerebras (~1.981 tok/s), con aproximadamente 1/10 de la energía. Advertencias: son cifras propias de Taalas (no verificadas independientemente), el benchmark depende de cuantización agresiva (tradeoffs de calidad, posiblemente más alucinaciones) y el chip solo ejecuta Llama 3.1 8B.

¿Cuál es la desventaja de los chips específicos de modelo?

Una vez desplegado, un MSIC queda bloqueado permanentemente a una versión de modelo. Cualquier cambio mayor que un adaptador LoRA requiere un re-spin físico del chip. La salsa secreta de Taalas lo suaviza: solo cambian 2 de ~100 capas metálicas, permitiendo un turnaround de ~2 meses — y grabar un modelo cuesta 100x menos que entrenar un modelo frontera. Pero con modelos nuevos cada mes, los clientes deben estar muy seguros de su elección.

¿Cómo se compara con el acuerdo de Nvidia con Groq?

En diciembre, Nvidia firmó un acuerdo de licencia de ~20.000M$ con Groq para usar sus LPU en la etapa de decode (generación de tokens) junto a sus GPU. AMD eligió adquirir Taalas directamente — misma estrategia desagregada (GPU hace el prefill pesado, silicio especializado hace la generación rápida), pero verticalmente integrada y de primera parte, totalmente controlada y suministrada por AMD con orquestación ROCm.

AMD adquiere Taalas: grabando pesos de LLM en silicio a 17.000 tokens/segundo

El 6 de agosto de 2026, AMD anunció la adquisición de Taalas, la startup de chips IA de Toronto que aplica el enfoque más radical a la inferencia: graba los pesos de los modelos directamente en el silicio. El resultado es un chip que sirve Llama 3.1 8B de Meta a 17.000 tokens por segundo — 48-73x más rápido que las GPU insignia de Nvidia a una décima parte de la energía.

Es la respuesta de AMD al acuerdo de 20.000 millones de dólares de Nvidia con Groq — y señala que la guerra del hardware IA se ha movido del entrenamiento a la inferencia.

Qué es Taalas

Fundada en 2023 y con sede en Toronto, Taalas está liderada por Ljubisa Bajic, ex ejecutivo de AMD y ex CEO de Tenstorrent. La compañía salió del stealth en febrero de 2026 con su primer chip de prueba, el HC1, fabricado en el proceso de 6nm de TSMC.

El acuerdo, anunciado al cierre del mercado del jueves, es una adquisición real (no un acquihire), con términos no revelados. Se espera que cierre en Q4 2026, sujeto a aprobación regulatoria. Bajic y el equipo se unirán a la organización de IA de AMD bajo el SVP Vamsi Boppana.

“Fundamos Taalas para repensar la inferencia IA desde cero, construyendo el hardware alrededor del modelo.” — Ljubisa Bajic, cofundador y CEO de Taalas

MSIC: el modelo es el ordenador

La tecnología de Taalas abandona el principio central de la computación moderna — la separación entre software y hardware de propósito general. En lugar de una GPU que carga pesos desde memoria, Taalas usa herramientas EDA propietarias para traducir la arquitectura y los pesos de una red neuronal directamente a un layout de transistores personalizado. El dataflow del modelo queda cableado entre elementos de cómputo; los pesos se hornean literalmente en las capas metálicas.

Esto convierte a los chips de Taalas en Circuitos Integrados Específicos de Modelo (MSIC) — y es por qué el HC1 es fundamentalmente distinto de las GPU, los LPU de Groq (dataflow programable) y los motores wafer-scale de Cerebras:

CaracterísticaGPU NvidiaGroq LPUCerebrasTaalas MSIC
ArquitecturaPropósito generalDataflow programableDataflow wafer-scaleASIC específico de modelo
Almacenamiento de pesosHBM externaSRAM on-chipSRAM on-chipGrabados en silicio
ProgramabilidadCualquier modeloCualquier modeloCualquier modeloSolo un modelo
Cuello de botellaAncho de banda HBMCapacidad SRAMHuella de silicioNinguno (sin fetch de pesos)

Un procesador Taalas tiene dos regiones:

  • Mask-ROM recall fabric — donde los pesos se graban permanentemente (una sola capa metálica)
  • SRAM recall fabric — estado dinámico en runtime: KV caches y adaptadores LoRA

Los números: benchmarks del HC1

SistemaTokens/seg (Llama 3.1 8B)vs HC1
Taalas HC117.000
Sistema Cerebras~1.9818,5x más lento
Nvidia B20035348x más lento
Nvidia H20023073x más lento

Taalas también afirma 90% menos consumo de energía que soluciones GPU, y un ciclo de desarrollo de ~1 semana de diseño + ~2 meses de fabricación. Financiación total: 219M$ (169M$ en la última ronda).

Las advertencias honestas: son cifras propias de Taalas, no verificadas independientemente. El titular de 17.000 tok/s depende de cuantización agresiva, que conlleva tradeoffs de calidad (potencialmente más alucinaciones) que el marketing de AMD no aborda. Y el HC1 solo ejecuta un modelo: Llama 3.1 8B.

La hoja de ruta HC2: escalando a modelos frontera

El chip de segunda generación HC2 (previsto para verano 2026) apunta a 20 mil millones de parámetros por chip. ¿Modelos más grandes? Solo distribuye entre chips con paralelismo de pipeline:

  • 50 aceleradores HC2 → sirven un modelo de billón de parámetros
  • DeepSeek-671B necesitaría ~30 tape-outs

Compara con los sistemas LPX de Nvidia, que necesitarían varias docenas de GPU y al menos 2.000 LPU de Groq para servir el mismo modelo.

La estrategia de AMD: inferencia desagregada de primera parte

AMD planea combinar racks Helios basados en Instinct con silicio Taalas en una arquitectura desagregada:

  • Prefill (procesamiento de prompts pesado) → GPU Instinct
  • Decode (generación de tokens) → aceleradores Taalas
  • Orquestado por ROCm, parte del stack completo (Instinct + EPYC + Helios + ROCm)

Esto replica la estrategia de Groq de Nvidia — pero con una diferencia crucial: AMD posee todo el stack. Sin fees de partnership, sin dependencia de terceros. AMD trabajaba antes con Cerebras en un diseño desagregado similar; Taalas lo trae a casa.

“AMD está construyendo una plataforma IA full-stack que da a los clientes la flexibilidad de desplegar la solución de cómputo correcta para cada carga de trabajo IA.” — Vamsi Boppana, SVP, AMD AI Group

El tradeoff del bloqueo de modelo

La pega: una vez desplegado, te quedas con ese modelo. Cualquier cambio mayor que un adaptador LoRA requiere un re-spin físico de los chips. Con modelos nuevos casi cada mes, los clientes deben estar muy seguros de su elección.

La mitigación de Taalas: como solo las capas superiores llevan el modelo, un re-spin cambia solo 2 de ~100 capas metálicas — reduciendo el tiempo a ~2 meses y siendo 100x menos caro que entrenar un modelo frontera. La economía funciona mejor para modelos estables y maduros ejecutándose a escala masiva de producción.

Qué significa para la economía de la inferencia

Este acuerdo es más grande que una adquisición. Confirma tres cambios:

  1. La inferencia es el nuevo campo de batalla. Los analistas proyectan que la demanda de inferencia superará al entrenamiento por 118x en 2026 y reclamará el 75% de todo el cómputo IA en 2030. Ahí está el dinero — y la competencia.
  2. El test-time scaling se vuelve viable. Los modelos de razonamiento (o1, DeepSeek-R1) logran inteligencia “pensando más”, consumiendo 10-100x más tokens. Si AMD reduce el coste de token 10-20x, los desarrolladores pueden permitirse cadenas de razonamiento mucho más profundas.
  3. Los agentes IA se abaratan. Los loops agénticos (asistentes de código, sistemas multiagente) corren iterativamente y consumen muchos tokens. La generación de tokens barata y rápida es lo que los hace prácticos a escala.

Para los desarrolladores, la conclusión práctica: deja de calcular la inferencia como una curva lineal de coste de GPU. El silicio dedicado para modelos abiertos populares está llegando — y con OpenAI, Anthropic y Meta como clientes de Instinct, un GPT o Claude en hardware híbrido Instinct-Taalas es perfectamente plausible.

Conclusión

AMD adquiriendo Taalas es la señal más clara de que el silicio de inferencia de función fija es una necesidad competitiva, no un nicho. La tecnología es radical, los benchmarks son llamativos (con advertencias) y el tradeoff del bloqueo de modelo es real. Pero si aunque sea una fracción de la inferencia de producción se asienta en modelos estables, grabarlos en silicio a 17.000 tokens/segundo reformará la economía de cada aplicación IA construida encima.