<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Aprendizaje Por Refuerzo on SoloSoft</title><link>https://www.solosoft.dev/es/tags/aprendizaje-por-refuerzo/</link><description>Recent content in Aprendizaje Por Refuerzo on SoloSoft</description><generator>Hugo</generator><language>es-es</language><atom:link href="https://www.solosoft.dev/es/tags/aprendizaje-por-refuerzo/index.xml" rel="self" type="application/rss+xml"/><item><title>OpenManus-RL: Ajuste con Aprendizaje por Refuerzo para Agentes LLM</title><link>https://www.solosoft.dev/es/post/openmanus-rl-agents-2026/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/openmanus-rl-agents-2026/</guid><description>&lt;p&gt;OpenManus-RL es un proyecto de investigacion de codigo abierto en la interseccion del aprendizaje por refuerzo y los sistemas de agentes LLM, desarrollado colaborativamente por &lt;a href="https://ulab-uiuc.github.io/"&gt;Ulab-UIUC&lt;/a&gt; (Universidad de Illinois en Urbana-Champaign) y &lt;a href="https://github.com/geekan/MetaGPT"&gt;MetaGPT&lt;/a&gt;. El proyecto proporciona un marco integral para el ajuste con aprendizaje por refuerzo de agentes basados en LLM, con implementaciones de GRPO (Optimizacion de Politica Relativa a Grupos), ajuste fino supervisado (SFT) y estrategias avanzadas de despliegue disenadas especificamente para tareas agenciales.&lt;/p&gt;
&lt;p&gt;A medida que los agentes LLM se vuelven cada vez mas capaces de razonamiento complejo de multiples pasos y uso de herramientas, la necesidad de optimizacion especifica con aprendizaje por refuerzo ha crecido dramaticamente. OpenManus-RL aborda esto proporcionando un pipeline modular y reproducible para entrenar agentes en tareas especificas de agente, con soporte integrado para entornos diversos incluyendo ingenieria de software (SWE-Bench), navegacion web (WebArena) y uso general de herramientas.&lt;/p&gt;</description></item><item><title>Robot de tenis de mesa Ace： el desafiante al campeón mundial creado por Sony AI</title><link>https://www.solosoft.dev/es/trends/2026-04-23-table-tennis-playing-robot-on-track-to-becoming-wo/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/trends/2026-04-23-table-tennis-playing-robot-on-track-to-becoming-wo/</guid><description>&lt;h2 id="cómo-logra-ace-vencer-a-jugadores-humanos-análisis-de-los-tres-avances-tecnológicos"&gt;¿Cómo logra Ace vencer a jugadores humanos? Análisis de los tres avances tecnológicos&lt;/h2&gt;
&lt;p&gt;El éxito de Ace no es el triunfo de una sola tecnología, sino la integración sistémica de tres innovaciones clave: sensores de eventos, aprendizaje por refuerzo sin modelo y hardware de alta velocidad. La colaboración de estas tres tecnologías permite al robot percibir en tiempo real, tomar decisiones rápidas y ejecutar con precisión.&lt;/p&gt;
&lt;h3 id="sensores-de-eventos-solo-rastrean-cambios-clave-eficiencia-multiplicada-por-cien"&gt;Sensores de eventos: solo rastrean cambios clave, eficiencia multiplicada por cien&lt;/h3&gt;
&lt;p&gt;Las cámaras tradicionales capturan decenas de imágenes completas por segundo, pero el sensor de eventos de Ace solo registra los cambios dinámicos en la escena, como la velocidad de la pelota, el efecto y el punto de caída. Esta estrategia de &amp;ldquo;solo lo esencial&amp;rdquo; reduce drásticamente la cantidad de datos a procesar, permitiendo al robot concentrarse en seguir la trayectoria. El equipo de Sony AI afirma que la latencia de esta tecnología es de solo unos 20 milisegundos, muy por debajo de los 230 ms de tiempo de reacción de un atleta humano.&lt;/p&gt;</description></item><item><title>TinyZero: Reproduciendo el Razonamiento de DeepSeek R1-Zero con RL por Menos de $30</title><link>https://www.solosoft.dev/es/post/tinyzero-r1-reproduction-2026/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/tinyzero-r1-reproduction-2026/</guid><description>&lt;p&gt;DeepSeek R1-Zero fue ampliamente considerado un gran avance cuando se lanzó en enero de 2025. El modelo demostró que el aprendizaje por refuerzo puro podía producir razonamiento avanzado de cadena de pensamiento, autocorrección y sorprendentes &amp;ldquo;momentos ajá&amp;rdquo;. TinyZero de Jiayi Pan rompe por completo esa suposición.&lt;/p&gt;
&lt;p&gt;TinyZero es una reproducción mínima y de código abierto de la metodología DeepSeek R1-Zero que se ejecuta en una sola GPU por menos de $30 en costos de cómputo en la nube. Usando el framework veRL, TinyZero aplica PPO a modelos base pequeños como Qwen-2.5-1.5B-Instruct y Qwen-2.5-7B.&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;Repositorio&lt;/strong&gt;: &lt;a href="https://github.com/Jiayi-Pan/TinyZero"&gt;github.com/Jiayi-Pan/TinyZero&lt;/a&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="comparación"&gt;Comparación&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Aspecto&lt;/th&gt;
 &lt;th&gt;TinyZero&lt;/th&gt;
 &lt;th&gt;DeepSeek R1-Zero&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Modelo Base&lt;/td&gt;
 &lt;td&gt;Qwen-2.5-1.5B / 7B&lt;/td&gt;
 &lt;td&gt;DeepSeek-V3 (671B)&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Framework&lt;/td&gt;
 &lt;td&gt;veRL (código abierto)&lt;/td&gt;
 &lt;td&gt;Propietario&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Costo de Entrenamiento&lt;/td&gt;
 &lt;td&gt;Menos de $30&lt;/td&gt;
 &lt;td&gt;Millones de dólares&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;GPU&lt;/td&gt;
 &lt;td&gt;Una sola GPU&lt;/td&gt;
 &lt;td&gt;Grandes clusters&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Algoritmo RL&lt;/td&gt;
 &lt;td&gt;PPO&lt;/td&gt;
 &lt;td&gt;GRPO&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Comportamientos Emergentes&lt;/td&gt;
 &lt;td&gt;Auto-verificación, reflexión, &amp;ldquo;momentos ajá&amp;rdquo;&lt;/td&gt;
 &lt;td&gt;Auto-verificación, reflexión, &amp;ldquo;momentos ajá&amp;rdquo;&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="comportamientos-emergentes"&gt;Comportamientos Emergentes&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Comportamiento&lt;/th&gt;
 &lt;th&gt;Qwen-2.5-0.5B&lt;/th&gt;
 &lt;th&gt;Qwen-2.5-1.5B&lt;/th&gt;
 &lt;th&gt;Qwen-2.5-7B&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Auto-verificación&lt;/td&gt;
 &lt;td&gt;Raro&lt;/td&gt;
 &lt;td&gt;Frecuente&lt;/td&gt;
 &lt;td&gt;Consistente&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Retroceso&lt;/td&gt;
 &lt;td&gt;Ausente&lt;/td&gt;
 &lt;td&gt;Ocasional&lt;/td&gt;
 &lt;td&gt;Frecuente&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;CoT Extendido (&amp;gt;200 tokens)&lt;/td&gt;
 &lt;td&gt;No&lt;/td&gt;
 &lt;td&gt;Sí&lt;/td&gt;
 &lt;td&gt;Sí&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Exploración multi-estrategia&lt;/td&gt;
 &lt;td&gt;No&lt;/td&gt;
 &lt;td&gt;Raro&lt;/td&gt;
 &lt;td&gt;Frecuente&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;&amp;ldquo;Momento ajá&amp;rdquo;&lt;/td&gt;
 &lt;td&gt;No&lt;/td&gt;
 &lt;td&gt;Ocasional&lt;/td&gt;
 &lt;td&gt;Sí&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Costo (A100 80GB)&lt;/td&gt;
 &lt;td&gt;~$5&lt;/td&gt;
 &lt;td&gt;~$15&lt;/td&gt;
 &lt;td&gt;~$30&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="arquitectura"&gt;Arquitectura&lt;/h2&gt;

&lt;figure class="mermaid-wrapper not-prose" role="img" aria-label="Mermaid diagram"&gt;
 &lt;div class="mermaid-container"&gt;
 &lt;pre class="mermaid"&gt;flowchart LR
 A[Modelo Base&amp;lt;br/&amp;gt;Qwen-2.5] --&amp;gt; B[Tarea de Cuenta Regresiva&amp;lt;br/&amp;gt;Prompt]
 B --&amp;gt; C[Modelo Genera&amp;lt;br/&amp;gt;Respuesta con CoT]
 C --&amp;gt; D[Cálculo de Recompensa&amp;lt;br/&amp;gt;Correcto = &amp;#43;1, Incorrecto = 0]
 D --&amp;gt; E[Actualización PPO&amp;lt;br/&amp;gt;mediante veRL]
 E --&amp;gt; B&lt;/pre&gt;
 &lt;script type="application/mermaid"&gt;flowchart LR
 A[Modelo Base&lt;br/&gt;Qwen-2.5] --&gt; B[Tarea de Cuenta Regresiva&lt;br/&gt;Prompt]
 B --&gt; C[Modelo Genera&lt;br/&gt;Respuesta con CoT]
 C --&gt; D[Cálculo de Recompensa&lt;br/&gt;Correcto = +1, Incorrecto = 0]
 D --&gt; E[Actualización PPO&lt;br/&gt;mediante veRL]
 E --&gt; B&lt;/script&gt;
 &lt;/div&gt;
&lt;/figure&gt;&lt;h2 id="costos"&gt;Costos&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Componente&lt;/th&gt;
 &lt;th&gt;Modelo 1.5B&lt;/th&gt;
 &lt;th&gt;Modelo 7B&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;GPU Nube&lt;/td&gt;
 &lt;td&gt;~$1.10/hora&lt;/td&gt;
 &lt;td&gt;~$1.10/hora&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Pasos de entrenamiento&lt;/td&gt;
 &lt;td&gt;~200&lt;/td&gt;
 &lt;td&gt;~300&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Tiempo&lt;/td&gt;
 &lt;td&gt;~6 horas&lt;/td&gt;
 &lt;td&gt;~24 horas&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;&lt;strong&gt;Total estimado&lt;/strong&gt;&lt;/td&gt;
 &lt;td&gt;&lt;strong&gt;~$7&lt;/strong&gt;&lt;/td&gt;
 &lt;td&gt;&lt;strong&gt;~$27&lt;/strong&gt;&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="faq"&gt;FAQ&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;Qué es TinyZero?&lt;/strong&gt; Reproducción mínima de código abierto de DeepSeek R1-Zero que demuestra razonamiento emergente en modelos de 1.5B parámetros por menos de $30.&lt;/p&gt;</description></item><item><title>Verifiers: Libreria Modular de Entornos RL para Entrenar Agentes LLM</title><link>https://www.solosoft.dev/es/post/verifiers-rl-environments-2026/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/verifiers-rl-environments-2026/</guid><description>&lt;p&gt;Verifiers es una libreria Python modular desarrollada por &lt;a href="https://github.com/PrimeIntellect-ai/verifiers"&gt;PrimeIntellect-ai&lt;/a&gt; que proporciona un marco integral para crear entornos de aprendizaje por refuerzo adaptados al entrenamiento de agentes LLM. Disenada para investigadores y profesionales que trabajan en alineacion de LLM basada en RL y optimizacion de agentes, Verifiers ofrece una API limpia y componible con componentes para analizar salidas de modelos, evaluar respuestas contra rubricas, calcular recompensas y ejecutar bucles de entrenamiento basados en GRPO.&lt;/p&gt;
&lt;p&gt;La libreria aborda una necesidad creciente en la comunidad de investigacion de IA: a medida que los metodos basados en RL como GRPO, PPO y el muestreo por rechazo se convierten en estandar para el ajuste fino de LLM, los investigadores necesitan componentes de entorno estandarizados y reutilizables en lugar de construir infraestructura de entrenamiento desde cero para cada experimento. Verifiers proporciona exactamente esto &amp;ndash; un kit de herramientas modular donde los entornos se ensamblan a partir de bloques de construccion intercambiables.&lt;/p&gt;</description></item><item><title>X-R1: Exploración Open-Source de Modelos de Razonamiento</title><link>https://www.solosoft.dev/es/post/x-r1-reasoning-2026/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/x-r1-reasoning-2026/</guid><description>&lt;p&gt;El descubrimiento de que los modelos de lenguaje podían desarrollar capacidades de razonamiento sofisticadas a través del aprendizaje por refuerzo &amp;ndash; sin demostraciones humanas &amp;ndash; fue uno de los resultados más sorprendentes en la investigación de IA de 2024 y 2025. DeepSeek R1 mostró que los modelos entrenados con RL podían aprender a pensar paso a paso, produciendo razonamiento de cadena de pensamiento que mejoraba dramáticamente el rendimiento en tareas matemáticas, lógicas y de codificación. &lt;strong&gt;X-R1&lt;/strong&gt; es un proyecto open-source que explora estas técnicas, con el objetivo de reproducir, comprender y extender el paradigma de razonamiento a través de RL.&lt;/p&gt;</description></item></channel></rss>