DPO

  1. TRL: Hugging Face's Transformer Reinforcement Learning Library

    The alignment of large language models with human preferences is one of the most important challenges in AI development. TRL (huggingface/trl on...

    Código Abierto
  2. DPO: Optimizacion Directa de Preferencias para el Alineamiento de LLM sin RL

    Durante la mayor parte de la historia del alineamiento de modelos de lenguaje grandes, el paradigma dominante ha sido el Aprendizaje por Refuerzo a...

    IA