<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>OpenBMB on SoloSoft</title><link>https://www.solosoft.dev/es/tags/openbmb/</link><description>Recent content in OpenBMB on SoloSoft</description><generator>Hugo</generator><language>es-es</language><lastBuildDate>Fri, 01 May 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.solosoft.dev/es/tags/openbmb/index.xml" rel="self" type="application/rss+xml"/><item><title>MiniCPM-o: LLM Multimodal de Codigo Abierto para Vision, Voz y Texto</title><link>https://www.solosoft.dev/es/post/minicpm-o-multimodal-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/minicpm-o-multimodal-2026/</guid><description>&lt;p&gt;Los modelos de IA multimodales que pueden procesar simultaneamente vision, voz y texto representan la vanguardia de la inteligencia artificial. GPT-4o de OpenAI demostro el potencial de este enfoque, pero su naturaleza cerrada ha dejado a la comunidad de codigo abierto corriendo para ponerse al dia. &lt;strong&gt;MiniCPM-o&lt;/strong&gt;, desarrollado por OpenBMB (derivado del laboratorio NLP de la Universidad de Tsinghua), ha logrado un hito notable: supera a GPT-4o en benchmarks de comprension de imagen unica mientras iguala o supera en tareas de voz, todo en un paquete de codigo abierto.&lt;/p&gt;
&lt;p&gt;El proyecto en &lt;a href="https://github.com/OpenBMB/MiniCPM-o"&gt;github.com/OpenBMB/MiniCPM-o&lt;/a&gt; representa una serie de LLM multimodales que extienden la impresionante relacion rendimiento-tamano de la familia MiniCPM al dominio multimodal. MiniCPM-o soporta interaccion de voz full-duplex, lo que significa que puede escuchar y hablar simultaneamente, como una conversacion natural, junto con comprension de imagenes, reconocimiento optico de caracteres y capacidades de dialogo de multiples turnos.&lt;/p&gt;</description></item><item><title>VoxCPM2: Sintesis de Voz Multilingue Sin Tokenizador de OpenBMB</title><link>https://www.solosoft.dev/es/post/voxcpm-tts-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/voxcpm-tts-2026/</guid><description>&lt;p&gt;VoxCPM2 es un modelo de texto a voz (TTS) sin tokenizador desarrollado por &lt;a href="https://www.openbmb.cn/"&gt;OpenBMB&lt;/a&gt;, una comunidad de investigacion de IA de codigo abierto afiliada a la Universidad Tsinghua y la Academia de Inteligencia Artificial de Beijing (BAAI). Con 2 mil millones de parametros, VoxCPM2 representa un cambio de paradigma en la sintesis de voz al operar directamente sobre representaciones continuas de voz, eliminando la necesidad de tokenizadores de audio discretos que normalmente degradan la calidad de la voz.&lt;/p&gt;
&lt;p&gt;El modelo soporta mas de 30 idiomas con capacidades que abarcan clonacion de voz zero-shot, diseno de voz (creacion de voces completamente nuevas a partir de descripciones textuales) e inferencia de transmision en tiempo real. VoxCPM2 se ha convertido rapidamente en uno de los modelos TTS de codigo abierto mas comentados de 2026, compitiendo directamente con ofertas comerciales como ElevenLabs y OpenAI TTS, mientras permanece disponible gratuitamente bajo la licencia Apache 2.0.&lt;/p&gt;</description></item></channel></rss>