PPO

  1. TRL: Hugging Face's Transformer Reinforcement Learning Library

    The alignment of large language models with human preferences is one of the most important challenges in AI development. TRL (huggingface/trl on...

    Código Abierto
  2. TinyZero: Reproduciendo el Razonamiento de DeepSeek R1-Zero con RL por Menos de $30

    DeepSeek R1-Zero fue ampliamente considerado un gran avance cuando se lanzó en enero de 2025. El modelo demostró que el aprendizaje por refuerzo puro...

    Código Abierto