Quantization

  1. TensorRT-LLM: La Biblioteca de Codigo Abierto de NVIDIA para Inferencia de LLM Optimizada

    Implementar modelos de lenguaje grandes en produccion requiere mas que solo cargar pesos en una GPU. Para lograr rendimiento y latencia aceptables...

    IA
  2. MLX LM: Inferencia y Ajuste Fino de LLMs en Apple Silicon

    The promise of running LLMs locally on a MacBook has been seductive but incomplete. Ollama and llama.cpp made it possible, but performance left room...

    IA
  3. ik_llama.cpp: Fork of llama.cpp with IQ4_NL and Advanced Quantization

    The ecosystem around llama.cpp has produced numerous forks, each exploring different optimization strategies for running LLMs efficiently on consumer...

    IA
  4. GPTQModel: Kit de Cuantizacion de LLM Listo para Produccion para GPU y CPU

    Los modelos de lenguaje grandes son potentes, pero su tamano los hace costosos de implementar. Un modelo de 70 mil millones de parametros en...

    IA
  5. ExLlamaV3: Motor de Inferencia de LLM de Alto Rendimiento

    Ejecutar modelos de lenguaje grandes en hardware de consumo requiere motores de inferencia eficientes que expriman cada gota de rendimiento de la...

    Código Abierto
  6. bitsandbytes: Biblioteca Esencial de Cuantización k-bit para Entrenamiento e Inferencia de LLM

    Los modelos de lenguaje grandes han superado con creces la capacidad de memoria del hardware de consumo. Un modelo de 70 mil millones de parámetros...

    IA