Razonamiento

  1. X-R1: Exploración Open-Source de Modelos de Razonamiento

    El descubrimiento de que los modelos de lenguaje podían desarrollar capacidades de razonamiento sofisticadas a través del aprendizaje por refuerzo --...

    IA
  2. TinyZero: Reproduciendo el Razonamiento de DeepSeek R1-Zero con RL por Menos de $30

    DeepSeek R1-Zero fue ampliamente considerado un gran avance cuando se lanzó en enero de 2025. El modelo demostró que el aprendizaje por refuerzo puro...

    Código Abierto