<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Visión Por Computadora on SoloSoft</title><link>https://www.solosoft.dev/es/tags/visi%C3%B3n-por-computadora/</link><description>Recent content in Visión Por Computadora on SoloSoft</description><generator>Hugo</generator><language>es-es</language><atom:link href="https://www.solosoft.dev/es/tags/visi%C3%B3n-por-computadora/index.xml" rel="self" type="application/rss+xml"/><item><title>Filtraciones de Apple： Cuatro estilos de montura en prueba para las gafas inteli</title><link>https://www.solosoft.dev/es/trends/2026-04-20-leak-apple-testing-four-distinct-frame-styles-for-/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/trends/2026-04-20-leak-apple-testing-four-distinct-frame-styles-for-/</guid><description>&lt;h2 id="por-qué-apple-elige-definir-sus-gafas-inteligentes-comenzando-por-el-estilo-de-montura"&gt;¿Por qué Apple elige definir sus gafas inteligentes comenzando por el &amp;ldquo;estilo de montura&amp;rdquo;?&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;Respuesta directa: porque Apple sabe muy bien que, para que las gafas inteligentes tengan éxito, la condición primordial es &amp;ldquo;que la gente quiera usarlas fuera de casa&amp;rdquo;.&lt;/strong&gt; Por muy impresionante que sea la tecnología, si el aspecto es voluminoso y no se ajusta a la estética diaria, está destinado a ser solo un juguete para un nicho de entusiastas. A partir de los cuatro estilos filtrados —rectangular audaz, rectangular delgado, clásico redondo/ovalado, ovalado compacto— se puede ver que la estrategia de Apple es cubrir todo el espectro de preferencias de los usuarios, desde lo profesional empresarial y las declaraciones de moda hasta lo clásico y discreto. Esta no es una opción de diseño arbitraria, sino una matriz estratégica de productos segmentada meticulosamente en el mercado.&lt;/p&gt;</description></item><item><title>GOT-OCR2.0: Teoría General de OCR Hacia OCR-2.0 con Modelo Unificado de Extremo a Extremo</title><link>https://www.solosoft.dev/es/post/got-ocr2-general-ocr-2026/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/got-ocr2-general-ocr-2026/</guid><description>&lt;p&gt;El Reconocimiento Óptico de Caracteres ha sido un problema resuelto durante décadas, para documentos escaneados limpios con texto sencillo. Pero el mundo real del contenido visual es mucho más desordenado y diverso. Ecuaciones matemáticas con notación compleja, tablas con estructuras de celdas irregulares, partituras musicales con símbolos especializados y texto de escenas en letreros y etiquetas desafían todos los enfoques tradicionales de OCR que asumen texto limpio y lineal sobre fondos uniformes.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;GOT-OCR2.0&lt;/strong&gt; (Teoría General de OCR, versión 2.0), desarrollado por investigadores de Ucas-HaoranWei, representa un cambio de paradigma hacia lo que los autores llaman OCR-2.0. En lugar de la tubería tradicional de módulos de detección, segmentación y reconocimiento encadenados, GOT-OCR2.0 es un único modelo de extremo a extremo con 580 millones de parámetros que mapea directamente píxeles de imagen a salida de texto estructurado.&lt;/p&gt;</description></item><item><title>LayoutParser: Toolkit Unificado de Código Abierto para Análisis de Imágenes de Documentos</title><link>https://www.solosoft.dev/es/post/layout-parser-document-ai-2026/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/layout-parser-document-ai-2026/</guid><description>&lt;p&gt;&lt;strong&gt;LayoutParser&lt;/strong&gt; fue construido para acabar con el caos del procesamiento de documentos. Este toolkit de aprendizaje profundo de código abierto proporciona una &lt;strong&gt;interfaz unificada&lt;/strong&gt; para tareas de análisis de imágenes de documentos.&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;Repositorio&lt;/strong&gt;: &lt;a href="https://github.com/Layout-Parser/layout-parser"&gt;github.com/Layout-Parser/layout-parser&lt;/a&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="capacidades-clave"&gt;Capacidades Clave&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Capacidad&lt;/th&gt;
 &lt;th&gt;Descripción&lt;/th&gt;
 &lt;th&gt;Opciones de Backend&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Detección de Diseño&lt;/td&gt;
 &lt;td&gt;Detectar regiones (texto, tablas, figuras)&lt;/td&gt;
 &lt;td&gt;Detectron2, TensorFlow, ADQ&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;OCR&lt;/td&gt;
 &lt;td&gt;Extraer texto de regiones detectadas&lt;/td&gt;
 &lt;td&gt;Tesseract, motores personalizados&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Zoo de Modelos&lt;/td&gt;
 &lt;td&gt;Modelos preentrenados&lt;/td&gt;
 &lt;td&gt;PubLayNet, Prima, Newspaper&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="inicio-rápido"&gt;Inicio Rápido&lt;/h2&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pip install layoutparser
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="nn"&gt;layoutparser&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="nn"&gt;lp&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;image&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;lp&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;load_image&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;document.png&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;model&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;lp&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;DetectionModel&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;lp://PubLayNet/faster_rcnn_r50_fpn&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;result&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;detect&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;image&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;lp&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;draw_box&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;image&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;result&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;box_width&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;5&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;show&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h2 id="zoo-de-modelos"&gt;Zoo de Modelos&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Dataset&lt;/th&gt;
 &lt;th&gt;Modelos Disponibles&lt;/th&gt;
 &lt;th&gt;Tipos de Región&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;PubLayNet&lt;/td&gt;
 &lt;td&gt;Faster R-CNN, Mask R-CNN, RetinaNet&lt;/td&gt;
 &lt;td&gt;Texto, Título, Tabla, Figura, Lista&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Prima&lt;/td&gt;
 &lt;td&gt;Faster R-CNN, Mask R-CNN&lt;/td&gt;
 &lt;td&gt;Texto, Imagen, Tabla, Gráfico&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Newspaper&lt;/td&gt;
 &lt;td&gt;Faster R-CNN&lt;/td&gt;
 &lt;td&gt;Texto, Foto, Ilustración, Mapa&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="integración-ocr"&gt;Integración OCR&lt;/h2&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;ocr_agent&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;lp&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;TesseractAgent&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;text_blocks&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;ocr_agent&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;detect&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;image&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;table_blocks&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="n"&gt;b&lt;/span&gt; &lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;b&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;result&lt;/span&gt; &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="n"&gt;b&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;type&lt;/span&gt; &lt;span class="o"&gt;==&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;Table&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;block&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;table_blocks&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;text&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;ocr_agent&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;detect&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;block&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;crop&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;image&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nb"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;text&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h2 id="faq"&gt;FAQ&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;Qué es LayoutParser?&lt;/strong&gt; Toolkit Python de código abierto para análisis de imágenes de documentos, unificando detección de diseño, OCR y zoo de modelos.&lt;/p&gt;</description></item></channel></rss>