Quantization
- IA
TensorRT-LLM: La Biblioteca de Codigo Abierto de NVIDIA para Inferencia de LLM Optimizada
Implementar modelos de lenguaje grandes en produccion requiere mas que solo cargar pesos en una GPU. Para lograr rendimiento y latencia aceptables...
- IA
MLX LM: Inferencia y Ajuste Fino de LLMs en Apple Silicon
The promise of running LLMs locally on a MacBook has been seductive but incomplete. Ollama and llama.cpp made it possible, but performance left room...
- IA
ik_llama.cpp: Fork of llama.cpp with IQ4_NL and Advanced Quantization
The ecosystem around llama.cpp has produced numerous forks, each exploring different optimization strategies for running LLMs efficiently on consumer...
- IA
GPTQModel: Kit de Cuantizacion de LLM Listo para Produccion para GPU y CPU
Los modelos de lenguaje grandes son potentes, pero su tamano los hace costosos de implementar. Un modelo de 70 mil millones de parametros en...
- Código Abierto
ExLlamaV3: Motor de Inferencia de LLM de Alto Rendimiento
Ejecutar modelos de lenguaje grandes en hardware de consumo requiere motores de inferencia eficientes que expriman cada gota de rendimiento de la...
- IA
bitsandbytes: Biblioteca Esencial de Cuantización k-bit para Entrenamiento e Inferencia de LLM
Los modelos de lenguaje grandes han superado con creces la capacidad de memoria del hardware de consumo. Un modelo de 70 mil millones de parámetros...