<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Análisis De Documentos on SoloSoft</title><link>https://www.solosoft.dev/es/tags/an%C3%A1lisis-de-documentos/</link><description>Recent content in Análisis De Documentos on SoloSoft</description><generator>Hugo</generator><language>es-es</language><lastBuildDate>Fri, 01 May 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.solosoft.dev/es/tags/an%C3%A1lisis-de-documentos/index.xml" rel="self" type="application/rss+xml"/><item><title>GOT-OCR2.0: Teoría General de OCR Hacia OCR-2.0 con Modelo Unificado de Extremo a Extremo</title><link>https://www.solosoft.dev/es/post/got-ocr2-general-ocr-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/got-ocr2-general-ocr-2026/</guid><description>&lt;p&gt;El Reconocimiento Óptico de Caracteres ha sido un problema resuelto durante décadas, para documentos escaneados limpios con texto sencillo. Pero el mundo real del contenido visual es mucho más desordenado y diverso. Ecuaciones matemáticas con notación compleja, tablas con estructuras de celdas irregulares, partituras musicales con símbolos especializados y texto de escenas en letreros y etiquetas desafían todos los enfoques tradicionales de OCR que asumen texto limpio y lineal sobre fondos uniformes.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;GOT-OCR2.0&lt;/strong&gt; (Teoría General de OCR, versión 2.0), desarrollado por investigadores de Ucas-HaoranWei, representa un cambio de paradigma hacia lo que los autores llaman OCR-2.0. En lugar de la tubería tradicional de módulos de detección, segmentación y reconocimiento encadenados, GOT-OCR2.0 es un único modelo de extremo a extremo con 580 millones de parámetros que mapea directamente píxeles de imagen a salida de texto estructurado.&lt;/p&gt;</description></item><item><title>LayoutParser: Toolkit Unificado de Código Abierto para Análisis de Imágenes de Documentos</title><link>https://www.solosoft.dev/es/post/layout-parser-document-ai-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/layout-parser-document-ai-2026/</guid><description>&lt;p&gt;&lt;strong&gt;LayoutParser&lt;/strong&gt; fue construido para acabar con el caos del procesamiento de documentos. Este toolkit de aprendizaje profundo de código abierto proporciona una &lt;strong&gt;interfaz unificada&lt;/strong&gt; para tareas de análisis de imágenes de documentos.&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;Repositorio&lt;/strong&gt;: &lt;a href="https://github.com/Layout-Parser/layout-parser"&gt;github.com/Layout-Parser/layout-parser&lt;/a&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="capacidades-clave"&gt;Capacidades Clave&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Capacidad&lt;/th&gt;
 &lt;th&gt;Descripción&lt;/th&gt;
 &lt;th&gt;Opciones de Backend&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Detección de Diseño&lt;/td&gt;
 &lt;td&gt;Detectar regiones (texto, tablas, figuras)&lt;/td&gt;
 &lt;td&gt;Detectron2, TensorFlow, ADQ&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;OCR&lt;/td&gt;
 &lt;td&gt;Extraer texto de regiones detectadas&lt;/td&gt;
 &lt;td&gt;Tesseract, motores personalizados&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Zoo de Modelos&lt;/td&gt;
 &lt;td&gt;Modelos preentrenados&lt;/td&gt;
 &lt;td&gt;PubLayNet, Prima, Newspaper&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="inicio-rápido"&gt;Inicio Rápido&lt;/h2&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pip install layoutparser
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="nn"&gt;layoutparser&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="nn"&gt;lp&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;image&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;lp&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;load_image&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;document.png&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;model&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;lp&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;DetectionModel&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;lp://PubLayNet/faster_rcnn_r50_fpn&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;result&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;detect&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;image&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;lp&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;draw_box&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;image&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;result&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;box_width&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;5&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;show&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h2 id="zoo-de-modelos"&gt;Zoo de Modelos&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Dataset&lt;/th&gt;
 &lt;th&gt;Modelos Disponibles&lt;/th&gt;
 &lt;th&gt;Tipos de Región&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;PubLayNet&lt;/td&gt;
 &lt;td&gt;Faster R-CNN, Mask R-CNN, RetinaNet&lt;/td&gt;
 &lt;td&gt;Texto, Título, Tabla, Figura, Lista&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Prima&lt;/td&gt;
 &lt;td&gt;Faster R-CNN, Mask R-CNN&lt;/td&gt;
 &lt;td&gt;Texto, Imagen, Tabla, Gráfico&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Newspaper&lt;/td&gt;
 &lt;td&gt;Faster R-CNN&lt;/td&gt;
 &lt;td&gt;Texto, Foto, Ilustración, Mapa&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="integración-ocr"&gt;Integración OCR&lt;/h2&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;ocr_agent&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;lp&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;TesseractAgent&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;text_blocks&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;ocr_agent&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;detect&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;image&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;table_blocks&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="n"&gt;b&lt;/span&gt; &lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;b&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;result&lt;/span&gt; &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="n"&gt;b&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;type&lt;/span&gt; &lt;span class="o"&gt;==&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;Table&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;block&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;table_blocks&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;text&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;ocr_agent&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;detect&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;block&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;crop&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;image&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nb"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;text&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h2 id="faq"&gt;FAQ&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;Qué es LayoutParser?&lt;/strong&gt; Toolkit Python de código abierto para análisis de imágenes de documentos, unificando detección de diseño, OCR y zoo de modelos.&lt;/p&gt;</description></item><item><title>RapidLayout: Análisis de Diseño de Documentos Open-Source para Chino e Inglés</title><link>https://www.solosoft.dev/es/post/rapidlayout-document-analysis-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/rapidlayout-document-analysis-2026/</guid><description>&lt;p&gt;El análisis de diseño de documentos es el primer paso crítico en cualquier tubería de comprensión de documentos. Antes de que el OCR pueda extraer texto, antes de que las tablas puedan analizarse, y antes de que el contenido pueda clasificarse, el sistema necesita entender &lt;em&gt;dónde&lt;/em&gt; están las cosas en la página. &lt;strong&gt;RapidLayout&lt;/strong&gt;, una biblioteca de código abierto del equipo RapidAI, aborda este desafío con un enfoque en contenido documental tanto en chino como en inglés.&lt;/p&gt;
&lt;p&gt;Desarrollado como parte del ecosistema más amplio de RapidAI — que incluye motores OCR, herramientas de reconocimiento de tablas y modelos de detección de texto — RapidLayout proporciona un enfoque modular e independiente del backend para el análisis de diseño. En lugar de limitar a los usuarios a un único marco de inferencia, soporta OnnxRuntime, OpenVINO y entornos de ejecución C++ especializados para CPU y GPU, lo que lo hace adecuado para todo, desde dispositivos periféricos hasta implementaciones en servidores.&lt;/p&gt;</description></item></channel></rss>