Inferencia

  1. AMD adquiere Taalas: grabando pesos de LLM en silicio a 17.000 tokens/segundo

    AMD está adquiriendo Taalas, la startup de Toronto que graba los pesos de los modelos directamente en el silicio — su chip HC1 sirve Llama 3.1 8B a 17.000 tokens/seg, …

    AI
  2. Xorbits Inference: Plataforma de Servicio LLM Escalable

    Desplegar modelos de lenguaje grandes en produccion es un desafio fundamentalmente diferente a entrenarlos. El entrenamiento requiere clusters...

    IA
  3. Gemma.cpp: El Motor de Inferencia C++ Ligero de Google para Modelos Gemma

    El panorama de la inferencia de LLM ha sido moldeado en gran medida por dos enfoques: frameworks pesados como PyTorch con aceleracion GPU completa, o...

    IA