Inferencia
- AI
AMD adquiere Taalas: grabando pesos de LLM en silicio a 17.000 tokens/segundo
AMD está adquiriendo Taalas, la startup de Toronto que graba los pesos de los modelos directamente en el silicio — su chip HC1 sirve Llama 3.1 8B a 17.000 tokens/seg, …
- IA
Xorbits Inference: Plataforma de Servicio LLM Escalable
Desplegar modelos de lenguaje grandes en produccion es un desafio fundamentalmente diferente a entrenarlos. El entrenamiento requiere clusters...
- IA
Gemma.cpp: El Motor de Inferencia C++ Ligero de Google para Modelos Gemma
El panorama de la inferencia de LLM ha sido moldeado en gran medida por dos enfoques: frameworks pesados como PyTorch con aceleracion GPU completa, o...