<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>PPO on SoloSoft</title><link>https://www.solosoft.dev/es/tags/ppo/</link><description>Recent content in PPO on SoloSoft</description><generator>Hugo</generator><language>es-es</language><lastBuildDate>Fri, 01 May 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.solosoft.dev/es/tags/ppo/index.xml" rel="self" type="application/rss+xml"/><item><title>TinyZero: Reproduciendo el Razonamiento de DeepSeek R1-Zero con RL por Menos de $30</title><link>https://www.solosoft.dev/es/post/tinyzero-r1-reproduction-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/tinyzero-r1-reproduction-2026/</guid><description>&lt;p&gt;DeepSeek R1-Zero fue ampliamente considerado un gran avance cuando se lanzó en enero de 2025. El modelo demostró que el aprendizaje por refuerzo puro podía producir razonamiento avanzado de cadena de pensamiento, autocorrección y sorprendentes &amp;ldquo;momentos ajá&amp;rdquo;. TinyZero de Jiayi Pan rompe por completo esa suposición.&lt;/p&gt;
&lt;p&gt;TinyZero es una reproducción mínima y de código abierto de la metodología DeepSeek R1-Zero que se ejecuta en una sola GPU por menos de $30 en costos de cómputo en la nube. Usando el framework veRL, TinyZero aplica PPO a modelos base pequeños como Qwen-2.5-1.5B-Instruct y Qwen-2.5-7B.&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;Repositorio&lt;/strong&gt;: &lt;a href="https://github.com/Jiayi-Pan/TinyZero"&gt;github.com/Jiayi-Pan/TinyZero&lt;/a&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="comparación"&gt;Comparación&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Aspecto&lt;/th&gt;
 &lt;th&gt;TinyZero&lt;/th&gt;
 &lt;th&gt;DeepSeek R1-Zero&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Modelo Base&lt;/td&gt;
 &lt;td&gt;Qwen-2.5-1.5B / 7B&lt;/td&gt;
 &lt;td&gt;DeepSeek-V3 (671B)&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Framework&lt;/td&gt;
 &lt;td&gt;veRL (código abierto)&lt;/td&gt;
 &lt;td&gt;Propietario&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Costo de Entrenamiento&lt;/td&gt;
 &lt;td&gt;Menos de $30&lt;/td&gt;
 &lt;td&gt;Millones de dólares&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;GPU&lt;/td&gt;
 &lt;td&gt;Una sola GPU&lt;/td&gt;
 &lt;td&gt;Grandes clusters&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Algoritmo RL&lt;/td&gt;
 &lt;td&gt;PPO&lt;/td&gt;
 &lt;td&gt;GRPO&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Comportamientos Emergentes&lt;/td&gt;
 &lt;td&gt;Auto-verificación, reflexión, &amp;ldquo;momentos ajá&amp;rdquo;&lt;/td&gt;
 &lt;td&gt;Auto-verificación, reflexión, &amp;ldquo;momentos ajá&amp;rdquo;&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="comportamientos-emergentes"&gt;Comportamientos Emergentes&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Comportamiento&lt;/th&gt;
 &lt;th&gt;Qwen-2.5-0.5B&lt;/th&gt;
 &lt;th&gt;Qwen-2.5-1.5B&lt;/th&gt;
 &lt;th&gt;Qwen-2.5-7B&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Auto-verificación&lt;/td&gt;
 &lt;td&gt;Raro&lt;/td&gt;
 &lt;td&gt;Frecuente&lt;/td&gt;
 &lt;td&gt;Consistente&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Retroceso&lt;/td&gt;
 &lt;td&gt;Ausente&lt;/td&gt;
 &lt;td&gt;Ocasional&lt;/td&gt;
 &lt;td&gt;Frecuente&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;CoT Extendido (&amp;gt;200 tokens)&lt;/td&gt;
 &lt;td&gt;No&lt;/td&gt;
 &lt;td&gt;Sí&lt;/td&gt;
 &lt;td&gt;Sí&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Exploración multi-estrategia&lt;/td&gt;
 &lt;td&gt;No&lt;/td&gt;
 &lt;td&gt;Raro&lt;/td&gt;
 &lt;td&gt;Frecuente&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;&amp;ldquo;Momento ajá&amp;rdquo;&lt;/td&gt;
 &lt;td&gt;No&lt;/td&gt;
 &lt;td&gt;Ocasional&lt;/td&gt;
 &lt;td&gt;Sí&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Costo (A100 80GB)&lt;/td&gt;
 &lt;td&gt;~$5&lt;/td&gt;
 &lt;td&gt;~$15&lt;/td&gt;
 &lt;td&gt;~$30&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="arquitectura"&gt;Arquitectura&lt;/h2&gt;

&lt;figure class="mermaid-wrapper not-prose" role="img" aria-label="Mermaid diagram"&gt;
 &lt;div class="mermaid-container"&gt;
 &lt;pre class="mermaid"&gt;flowchart LR
 A[Modelo Base&amp;lt;br/&amp;gt;Qwen-2.5] --&amp;gt; B[Tarea de Cuenta Regresiva&amp;lt;br/&amp;gt;Prompt]
 B --&amp;gt; C[Modelo Genera&amp;lt;br/&amp;gt;Respuesta con CoT]
 C --&amp;gt; D[Cálculo de Recompensa&amp;lt;br/&amp;gt;Correcto = &amp;#43;1, Incorrecto = 0]
 D --&amp;gt; E[Actualización PPO&amp;lt;br/&amp;gt;mediante veRL]
 E --&amp;gt; B&lt;/pre&gt;
 &lt;script type="application/mermaid"&gt;flowchart LR
 A[Modelo Base&lt;br/&gt;Qwen-2.5] --&gt; B[Tarea de Cuenta Regresiva&lt;br/&gt;Prompt]
 B --&gt; C[Modelo Genera&lt;br/&gt;Respuesta con CoT]
 C --&gt; D[Cálculo de Recompensa&lt;br/&gt;Correcto = +1, Incorrecto = 0]
 D --&gt; E[Actualización PPO&lt;br/&gt;mediante veRL]
 E --&gt; B&lt;/script&gt;
 &lt;/div&gt;
&lt;/figure&gt;&lt;h2 id="costos"&gt;Costos&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Componente&lt;/th&gt;
 &lt;th&gt;Modelo 1.5B&lt;/th&gt;
 &lt;th&gt;Modelo 7B&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;GPU Nube&lt;/td&gt;
 &lt;td&gt;~$1.10/hora&lt;/td&gt;
 &lt;td&gt;~$1.10/hora&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Pasos de entrenamiento&lt;/td&gt;
 &lt;td&gt;~200&lt;/td&gt;
 &lt;td&gt;~300&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Tiempo&lt;/td&gt;
 &lt;td&gt;~6 horas&lt;/td&gt;
 &lt;td&gt;~24 horas&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;&lt;strong&gt;Total estimado&lt;/strong&gt;&lt;/td&gt;
 &lt;td&gt;&lt;strong&gt;~$7&lt;/strong&gt;&lt;/td&gt;
 &lt;td&gt;&lt;strong&gt;~$27&lt;/strong&gt;&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="faq"&gt;FAQ&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;Qué es TinyZero?&lt;/strong&gt; Reproducción mínima de código abierto de DeepSeek R1-Zero que demuestra razonamiento emergente en modelos de 1.5B parámetros por menos de $30.&lt;/p&gt;</description></item><item><title>TRL: Hugging Face's Transformer Reinforcement Learning Library</title><link>https://www.solosoft.dev/es/post/trl-rlhf-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/trl-rlhf-2026/</guid><description>&lt;p&gt;The alignment of large language models with human preferences is one of the most important challenges in AI development. &lt;strong&gt;TRL&lt;/strong&gt; (huggingface/trl on GitHub) &amp;ndash; Hugging Face&amp;rsquo;s Transformer Reinforcement Learning library &amp;ndash; provides a comprehensive toolkit for tackling this challenge, implementing the full spectrum of RLHF (Reinforcement Learning from Human Feedback) algorithms in a production-ready, well-documented package.&lt;/p&gt;
&lt;p&gt;Developed by Hugging Face&amp;rsquo;s research team, TRL has become the standard library for LLM alignment training, with over 10,000 GitHub stars and widespread adoption across both academia and industry. It supports PPO, DPO, KTO, and several other preference optimization algorithms, each offering different trade-offs between training complexity, computational cost, and alignment effectiveness.&lt;/p&gt;</description></item></channel></rss>