<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>VeRL on SoloSoft</title><link>https://www.solosoft.dev/es/tags/verl/</link><description>Recent content in VeRL on SoloSoft</description><generator>Hugo</generator><language>es-es</language><lastBuildDate>Fri, 01 May 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.solosoft.dev/es/tags/verl/index.xml" rel="self" type="application/rss+xml"/><item><title>TinyZero: Reproduciendo el Razonamiento de DeepSeek R1-Zero con RL por Menos de $30</title><link>https://www.solosoft.dev/es/post/tinyzero-r1-reproduction-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/tinyzero-r1-reproduction-2026/</guid><description>&lt;p&gt;DeepSeek R1-Zero fue ampliamente considerado un gran avance cuando se lanzó en enero de 2025. El modelo demostró que el aprendizaje por refuerzo puro podía producir razonamiento avanzado de cadena de pensamiento, autocorrección y sorprendentes &amp;ldquo;momentos ajá&amp;rdquo;. TinyZero de Jiayi Pan rompe por completo esa suposición.&lt;/p&gt;
&lt;p&gt;TinyZero es una reproducción mínima y de código abierto de la metodología DeepSeek R1-Zero que se ejecuta en una sola GPU por menos de $30 en costos de cómputo en la nube. Usando el framework veRL, TinyZero aplica PPO a modelos base pequeños como Qwen-2.5-1.5B-Instruct y Qwen-2.5-7B.&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;Repositorio&lt;/strong&gt;: &lt;a href="https://github.com/Jiayi-Pan/TinyZero"&gt;github.com/Jiayi-Pan/TinyZero&lt;/a&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="comparación"&gt;Comparación&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Aspecto&lt;/th&gt;
 &lt;th&gt;TinyZero&lt;/th&gt;
 &lt;th&gt;DeepSeek R1-Zero&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Modelo Base&lt;/td&gt;
 &lt;td&gt;Qwen-2.5-1.5B / 7B&lt;/td&gt;
 &lt;td&gt;DeepSeek-V3 (671B)&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Framework&lt;/td&gt;
 &lt;td&gt;veRL (código abierto)&lt;/td&gt;
 &lt;td&gt;Propietario&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Costo de Entrenamiento&lt;/td&gt;
 &lt;td&gt;Menos de $30&lt;/td&gt;
 &lt;td&gt;Millones de dólares&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;GPU&lt;/td&gt;
 &lt;td&gt;Una sola GPU&lt;/td&gt;
 &lt;td&gt;Grandes clusters&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Algoritmo RL&lt;/td&gt;
 &lt;td&gt;PPO&lt;/td&gt;
 &lt;td&gt;GRPO&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Comportamientos Emergentes&lt;/td&gt;
 &lt;td&gt;Auto-verificación, reflexión, &amp;ldquo;momentos ajá&amp;rdquo;&lt;/td&gt;
 &lt;td&gt;Auto-verificación, reflexión, &amp;ldquo;momentos ajá&amp;rdquo;&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="comportamientos-emergentes"&gt;Comportamientos Emergentes&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Comportamiento&lt;/th&gt;
 &lt;th&gt;Qwen-2.5-0.5B&lt;/th&gt;
 &lt;th&gt;Qwen-2.5-1.5B&lt;/th&gt;
 &lt;th&gt;Qwen-2.5-7B&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Auto-verificación&lt;/td&gt;
 &lt;td&gt;Raro&lt;/td&gt;
 &lt;td&gt;Frecuente&lt;/td&gt;
 &lt;td&gt;Consistente&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Retroceso&lt;/td&gt;
 &lt;td&gt;Ausente&lt;/td&gt;
 &lt;td&gt;Ocasional&lt;/td&gt;
 &lt;td&gt;Frecuente&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;CoT Extendido (&amp;gt;200 tokens)&lt;/td&gt;
 &lt;td&gt;No&lt;/td&gt;
 &lt;td&gt;Sí&lt;/td&gt;
 &lt;td&gt;Sí&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Exploración multi-estrategia&lt;/td&gt;
 &lt;td&gt;No&lt;/td&gt;
 &lt;td&gt;Raro&lt;/td&gt;
 &lt;td&gt;Frecuente&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;&amp;ldquo;Momento ajá&amp;rdquo;&lt;/td&gt;
 &lt;td&gt;No&lt;/td&gt;
 &lt;td&gt;Ocasional&lt;/td&gt;
 &lt;td&gt;Sí&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Costo (A100 80GB)&lt;/td&gt;
 &lt;td&gt;~$5&lt;/td&gt;
 &lt;td&gt;~$15&lt;/td&gt;
 &lt;td&gt;~$30&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="arquitectura"&gt;Arquitectura&lt;/h2&gt;

&lt;figure class="mermaid-wrapper not-prose" role="img" aria-label="Mermaid diagram"&gt;
 &lt;div class="mermaid-container"&gt;
 &lt;pre class="mermaid"&gt;flowchart LR
 A[Modelo Base&amp;lt;br/&amp;gt;Qwen-2.5] --&amp;gt; B[Tarea de Cuenta Regresiva&amp;lt;br/&amp;gt;Prompt]
 B --&amp;gt; C[Modelo Genera&amp;lt;br/&amp;gt;Respuesta con CoT]
 C --&amp;gt; D[Cálculo de Recompensa&amp;lt;br/&amp;gt;Correcto = &amp;#43;1, Incorrecto = 0]
 D --&amp;gt; E[Actualización PPO&amp;lt;br/&amp;gt;mediante veRL]
 E --&amp;gt; B&lt;/pre&gt;
 &lt;script type="application/mermaid"&gt;flowchart LR
 A[Modelo Base&lt;br/&gt;Qwen-2.5] --&gt; B[Tarea de Cuenta Regresiva&lt;br/&gt;Prompt]
 B --&gt; C[Modelo Genera&lt;br/&gt;Respuesta con CoT]
 C --&gt; D[Cálculo de Recompensa&lt;br/&gt;Correcto = +1, Incorrecto = 0]
 D --&gt; E[Actualización PPO&lt;br/&gt;mediante veRL]
 E --&gt; B&lt;/script&gt;
 &lt;/div&gt;
&lt;/figure&gt;&lt;h2 id="costos"&gt;Costos&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Componente&lt;/th&gt;
 &lt;th&gt;Modelo 1.5B&lt;/th&gt;
 &lt;th&gt;Modelo 7B&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;GPU Nube&lt;/td&gt;
 &lt;td&gt;~$1.10/hora&lt;/td&gt;
 &lt;td&gt;~$1.10/hora&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Pasos de entrenamiento&lt;/td&gt;
 &lt;td&gt;~200&lt;/td&gt;
 &lt;td&gt;~300&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Tiempo&lt;/td&gt;
 &lt;td&gt;~6 horas&lt;/td&gt;
 &lt;td&gt;~24 horas&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;&lt;strong&gt;Total estimado&lt;/strong&gt;&lt;/td&gt;
 &lt;td&gt;&lt;strong&gt;~$7&lt;/strong&gt;&lt;/td&gt;
 &lt;td&gt;&lt;strong&gt;~$27&lt;/strong&gt;&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="faq"&gt;FAQ&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;Qué es TinyZero?&lt;/strong&gt; Reproducción mínima de código abierto de DeepSeek R1-Zero que demuestra razonamiento emergente en modelos de 1.5B parámetros por menos de $30.&lt;/p&gt;</description></item><item><title>VeRL: Framework de Aprendizaje por Refuerzo de ByteDance para LLMs</title><link>https://www.solosoft.dev/es/post/verl-rl-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/verl-rl-2026/</guid><description>&lt;p&gt;La frontera más emocionante en la investigación de grandes modelos de lenguaje en 2025-2026 no ha sido hacer los modelos más grandes. Ha sido hacerlos más inteligentes a través del aprendizaje por refuerzo. DeepSeek-R1 demostró que el entrenamiento RL &amp;ndash; específicamente GRPO (Optimización de Política Relativa a Grupo) &amp;ndash; puede mejorar drásticamente las capacidades de razonamiento de un modelo, permitiendo razonamiento de cadena de pensamiento, autocorrección y resolución estructurada de problemas que rivaliza con modelos mucho más grandes. ByteDance, una de las empresas de tecnología más grandes del mundo y creadora de TikTok y Douyin, ha estado aplicando estas mismas técnicas a escala para entrenar sus propios modelos. VeRL es el framework detrás de ese esfuerzo.&lt;/p&gt;</description></item></channel></rss>