<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Razonamiento on SoloSoft</title><link>https://www.solosoft.dev/es/tags/razonamiento/</link><description>Recent content in Razonamiento on SoloSoft</description><generator>Hugo</generator><language>es-es</language><lastBuildDate>Fri, 01 May 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.solosoft.dev/es/tags/razonamiento/index.xml" rel="self" type="application/rss+xml"/><item><title>TinyZero: Reproduciendo el Razonamiento de DeepSeek R1-Zero con RL por Menos de $30</title><link>https://www.solosoft.dev/es/post/tinyzero-r1-reproduction-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/tinyzero-r1-reproduction-2026/</guid><description>&lt;p&gt;DeepSeek R1-Zero fue ampliamente considerado un gran avance cuando se lanzó en enero de 2025. El modelo demostró que el aprendizaje por refuerzo puro podía producir razonamiento avanzado de cadena de pensamiento, autocorrección y sorprendentes &amp;ldquo;momentos ajá&amp;rdquo;. TinyZero de Jiayi Pan rompe por completo esa suposición.&lt;/p&gt;
&lt;p&gt;TinyZero es una reproducción mínima y de código abierto de la metodología DeepSeek R1-Zero que se ejecuta en una sola GPU por menos de $30 en costos de cómputo en la nube. Usando el framework veRL, TinyZero aplica PPO a modelos base pequeños como Qwen-2.5-1.5B-Instruct y Qwen-2.5-7B.&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;Repositorio&lt;/strong&gt;: &lt;a href="https://github.com/Jiayi-Pan/TinyZero"&gt;github.com/Jiayi-Pan/TinyZero&lt;/a&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="comparación"&gt;Comparación&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Aspecto&lt;/th&gt;
 &lt;th&gt;TinyZero&lt;/th&gt;
 &lt;th&gt;DeepSeek R1-Zero&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Modelo Base&lt;/td&gt;
 &lt;td&gt;Qwen-2.5-1.5B / 7B&lt;/td&gt;
 &lt;td&gt;DeepSeek-V3 (671B)&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Framework&lt;/td&gt;
 &lt;td&gt;veRL (código abierto)&lt;/td&gt;
 &lt;td&gt;Propietario&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Costo de Entrenamiento&lt;/td&gt;
 &lt;td&gt;Menos de $30&lt;/td&gt;
 &lt;td&gt;Millones de dólares&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;GPU&lt;/td&gt;
 &lt;td&gt;Una sola GPU&lt;/td&gt;
 &lt;td&gt;Grandes clusters&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Algoritmo RL&lt;/td&gt;
 &lt;td&gt;PPO&lt;/td&gt;
 &lt;td&gt;GRPO&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Comportamientos Emergentes&lt;/td&gt;
 &lt;td&gt;Auto-verificación, reflexión, &amp;ldquo;momentos ajá&amp;rdquo;&lt;/td&gt;
 &lt;td&gt;Auto-verificación, reflexión, &amp;ldquo;momentos ajá&amp;rdquo;&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="comportamientos-emergentes"&gt;Comportamientos Emergentes&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Comportamiento&lt;/th&gt;
 &lt;th&gt;Qwen-2.5-0.5B&lt;/th&gt;
 &lt;th&gt;Qwen-2.5-1.5B&lt;/th&gt;
 &lt;th&gt;Qwen-2.5-7B&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Auto-verificación&lt;/td&gt;
 &lt;td&gt;Raro&lt;/td&gt;
 &lt;td&gt;Frecuente&lt;/td&gt;
 &lt;td&gt;Consistente&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Retroceso&lt;/td&gt;
 &lt;td&gt;Ausente&lt;/td&gt;
 &lt;td&gt;Ocasional&lt;/td&gt;
 &lt;td&gt;Frecuente&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;CoT Extendido (&amp;gt;200 tokens)&lt;/td&gt;
 &lt;td&gt;No&lt;/td&gt;
 &lt;td&gt;Sí&lt;/td&gt;
 &lt;td&gt;Sí&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Exploración multi-estrategia&lt;/td&gt;
 &lt;td&gt;No&lt;/td&gt;
 &lt;td&gt;Raro&lt;/td&gt;
 &lt;td&gt;Frecuente&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;&amp;ldquo;Momento ajá&amp;rdquo;&lt;/td&gt;
 &lt;td&gt;No&lt;/td&gt;
 &lt;td&gt;Ocasional&lt;/td&gt;
 &lt;td&gt;Sí&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Costo (A100 80GB)&lt;/td&gt;
 &lt;td&gt;~$5&lt;/td&gt;
 &lt;td&gt;~$15&lt;/td&gt;
 &lt;td&gt;~$30&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="arquitectura"&gt;Arquitectura&lt;/h2&gt;

&lt;figure class="mermaid-wrapper not-prose" role="img" aria-label="Mermaid diagram"&gt;
 &lt;div class="mermaid-container"&gt;
 &lt;pre class="mermaid"&gt;flowchart LR
 A[Modelo Base&amp;lt;br/&amp;gt;Qwen-2.5] --&amp;gt; B[Tarea de Cuenta Regresiva&amp;lt;br/&amp;gt;Prompt]
 B --&amp;gt; C[Modelo Genera&amp;lt;br/&amp;gt;Respuesta con CoT]
 C --&amp;gt; D[Cálculo de Recompensa&amp;lt;br/&amp;gt;Correcto = &amp;#43;1, Incorrecto = 0]
 D --&amp;gt; E[Actualización PPO&amp;lt;br/&amp;gt;mediante veRL]
 E --&amp;gt; B&lt;/pre&gt;
 &lt;script type="application/mermaid"&gt;flowchart LR
 A[Modelo Base&lt;br/&gt;Qwen-2.5] --&gt; B[Tarea de Cuenta Regresiva&lt;br/&gt;Prompt]
 B --&gt; C[Modelo Genera&lt;br/&gt;Respuesta con CoT]
 C --&gt; D[Cálculo de Recompensa&lt;br/&gt;Correcto = +1, Incorrecto = 0]
 D --&gt; E[Actualización PPO&lt;br/&gt;mediante veRL]
 E --&gt; B&lt;/script&gt;
 &lt;/div&gt;
&lt;/figure&gt;&lt;h2 id="costos"&gt;Costos&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Componente&lt;/th&gt;
 &lt;th&gt;Modelo 1.5B&lt;/th&gt;
 &lt;th&gt;Modelo 7B&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;GPU Nube&lt;/td&gt;
 &lt;td&gt;~$1.10/hora&lt;/td&gt;
 &lt;td&gt;~$1.10/hora&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Pasos de entrenamiento&lt;/td&gt;
 &lt;td&gt;~200&lt;/td&gt;
 &lt;td&gt;~300&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Tiempo&lt;/td&gt;
 &lt;td&gt;~6 horas&lt;/td&gt;
 &lt;td&gt;~24 horas&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;&lt;strong&gt;Total estimado&lt;/strong&gt;&lt;/td&gt;
 &lt;td&gt;&lt;strong&gt;~$7&lt;/strong&gt;&lt;/td&gt;
 &lt;td&gt;&lt;strong&gt;~$27&lt;/strong&gt;&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="faq"&gt;FAQ&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;Qué es TinyZero?&lt;/strong&gt; Reproducción mínima de código abierto de DeepSeek R1-Zero que demuestra razonamiento emergente en modelos de 1.5B parámetros por menos de $30.&lt;/p&gt;</description></item><item><title>X-R1: Exploración Open-Source de Modelos de Razonamiento</title><link>https://www.solosoft.dev/es/post/x-r1-reasoning-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/x-r1-reasoning-2026/</guid><description>&lt;p&gt;El descubrimiento de que los modelos de lenguaje podían desarrollar capacidades de razonamiento sofisticadas a través del aprendizaje por refuerzo &amp;ndash; sin demostraciones humanas &amp;ndash; fue uno de los resultados más sorprendentes en la investigación de IA de 2024 y 2025. DeepSeek R1 mostró que los modelos entrenados con RL podían aprender a pensar paso a paso, produciendo razonamiento de cadena de pensamiento que mejoraba dramáticamente el rendimiento en tareas matemáticas, lógicas y de codificación. &lt;strong&gt;X-R1&lt;/strong&gt; es un proyecto open-source que explora estas técnicas, con el objetivo de reproducir, comprender y extender el paradigma de razonamiento a través de RL.&lt;/p&gt;</description></item></channel></rss>