<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>OCR on SoloSoft</title><link>https://www.solosoft.dev/es/tags/ocr/</link><description>Recent content in OCR on SoloSoft</description><generator>Hugo</generator><language>es-es</language><lastBuildDate>Fri, 01 May 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.solosoft.dev/es/tags/ocr/index.xml" rel="self" type="application/rss+xml"/><item><title>GOT-OCR2.0: Teoría General de OCR Hacia OCR-2.0 con Modelo Unificado de Extremo a Extremo</title><link>https://www.solosoft.dev/es/post/got-ocr2-general-ocr-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/got-ocr2-general-ocr-2026/</guid><description>&lt;p&gt;El Reconocimiento Óptico de Caracteres ha sido un problema resuelto durante décadas, para documentos escaneados limpios con texto sencillo. Pero el mundo real del contenido visual es mucho más desordenado y diverso. Ecuaciones matemáticas con notación compleja, tablas con estructuras de celdas irregulares, partituras musicales con símbolos especializados y texto de escenas en letreros y etiquetas desafían todos los enfoques tradicionales de OCR que asumen texto limpio y lineal sobre fondos uniformes.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;GOT-OCR2.0&lt;/strong&gt; (Teoría General de OCR, versión 2.0), desarrollado por investigadores de Ucas-HaoranWei, representa un cambio de paradigma hacia lo que los autores llaman OCR-2.0. En lugar de la tubería tradicional de módulos de detección, segmentación y reconocimiento encadenados, GOT-OCR2.0 es un único modelo de extremo a extremo con 580 millones de parámetros que mapea directamente píxeles de imagen a salida de texto estructurado.&lt;/p&gt;</description></item><item><title>LayoutParser: Toolkit Unificado de Código Abierto para Análisis de Imágenes de Documentos</title><link>https://www.solosoft.dev/es/post/layout-parser-document-ai-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/layout-parser-document-ai-2026/</guid><description>&lt;p&gt;&lt;strong&gt;LayoutParser&lt;/strong&gt; fue construido para acabar con el caos del procesamiento de documentos. Este toolkit de aprendizaje profundo de código abierto proporciona una &lt;strong&gt;interfaz unificada&lt;/strong&gt; para tareas de análisis de imágenes de documentos.&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;Repositorio&lt;/strong&gt;: &lt;a href="https://github.com/Layout-Parser/layout-parser"&gt;github.com/Layout-Parser/layout-parser&lt;/a&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="capacidades-clave"&gt;Capacidades Clave&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Capacidad&lt;/th&gt;
 &lt;th&gt;Descripción&lt;/th&gt;
 &lt;th&gt;Opciones de Backend&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Detección de Diseño&lt;/td&gt;
 &lt;td&gt;Detectar regiones (texto, tablas, figuras)&lt;/td&gt;
 &lt;td&gt;Detectron2, TensorFlow, ADQ&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;OCR&lt;/td&gt;
 &lt;td&gt;Extraer texto de regiones detectadas&lt;/td&gt;
 &lt;td&gt;Tesseract, motores personalizados&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Zoo de Modelos&lt;/td&gt;
 &lt;td&gt;Modelos preentrenados&lt;/td&gt;
 &lt;td&gt;PubLayNet, Prima, Newspaper&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="inicio-rápido"&gt;Inicio Rápido&lt;/h2&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pip install layoutparser
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="nn"&gt;layoutparser&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="nn"&gt;lp&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;image&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;lp&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;load_image&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;document.png&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;model&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;lp&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;DetectionModel&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;lp://PubLayNet/faster_rcnn_r50_fpn&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;result&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;detect&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;image&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;lp&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;draw_box&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;image&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;result&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;box_width&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;5&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;show&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h2 id="zoo-de-modelos"&gt;Zoo de Modelos&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Dataset&lt;/th&gt;
 &lt;th&gt;Modelos Disponibles&lt;/th&gt;
 &lt;th&gt;Tipos de Región&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;PubLayNet&lt;/td&gt;
 &lt;td&gt;Faster R-CNN, Mask R-CNN, RetinaNet&lt;/td&gt;
 &lt;td&gt;Texto, Título, Tabla, Figura, Lista&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Prima&lt;/td&gt;
 &lt;td&gt;Faster R-CNN, Mask R-CNN&lt;/td&gt;
 &lt;td&gt;Texto, Imagen, Tabla, Gráfico&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Newspaper&lt;/td&gt;
 &lt;td&gt;Faster R-CNN&lt;/td&gt;
 &lt;td&gt;Texto, Foto, Ilustración, Mapa&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="integración-ocr"&gt;Integración OCR&lt;/h2&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;ocr_agent&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;lp&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;TesseractAgent&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;text_blocks&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;ocr_agent&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;detect&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;image&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;table_blocks&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="n"&gt;b&lt;/span&gt; &lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;b&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;result&lt;/span&gt; &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="n"&gt;b&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;type&lt;/span&gt; &lt;span class="o"&gt;==&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;Table&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;block&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;table_blocks&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;text&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;ocr_agent&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;detect&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;block&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;crop&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;image&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nb"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;text&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h2 id="faq"&gt;FAQ&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;Qué es LayoutParser?&lt;/strong&gt; Toolkit Python de código abierto para análisis de imágenes de documentos, unificando detección de diseño, OCR y zoo de modelos.&lt;/p&gt;</description></item><item><title>Marker: Conversión Open-Source de PDF a Markdown con Aprendizaje Profundo</title><link>https://www.solosoft.dev/es/post/marker-pdf-conversion-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/marker-pdf-conversion-2026/</guid><description>&lt;p&gt;Los documentos PDF siguen siendo uno de los formatos más comunes para la distribución de conocimiento, sin embargo, están entre los más difíciles de procesar programáticamente. Las tablas que cruzan páginas, los diseños multicolumna, las ecuaciones matemáticas, los encabezados y pies de página conspiran para derrotar a las herramientas de extracción simples. &lt;strong&gt;Marker&lt;/strong&gt; aborda este desafío con un enfoque de aprendizaje profundo que comprende la estructura del documento como lo haría un lector humano &amp;ndash; reconociendo patrones visuales de diseño, no solo siguiendo el orden del texto.&lt;/p&gt;
&lt;p&gt;Creado por el equipo de datalab-to, Marker se basa en avances recientes en visión por computadora y comprensión de documentos para producir salida Markdown de alta calidad a partir de entradas PDF. A diferencia de los convertidores PDF tradicionales que dependen de reglas heurísticas o extracción de texto posicional, Marker utiliza modelos de redes neuronales entrenados en miles de páginas de documentos anotadas para comprender la semántica del diseño, detectar tablas y ecuaciones, y reconstruir el orden de lectura previsto.&lt;/p&gt;</description></item><item><title>MinerU: Analisis de PDFs y Extraccion de Datos Open-Source</title><link>https://www.solosoft.dev/es/post/mineru-pdf-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/mineru-pdf-2026/</guid><description>&lt;p&gt;PDF is the universal format for document distribution, but it is arguably the worst format for data extraction. PDFs store visual layouts — coordinates, fonts, and rendering instructions — not semantic structure. Paragraphs, tables, lists, and headings exist only as visual arrangements of text fragments. Every developer who has tried to extract structured data from a PDF knows the frustration of losing table structure, mangled text order, and jumbled multi-column layouts.&lt;/p&gt;
&lt;p&gt;MinerU, developed by OpenDataLab, addresses this problem with a comprehensive open-source document parsing pipeline. It extracts text, tables, formulas, and images from PDFs with high structural fidelity, producing clean Markdown or structured JSON output. For organizations building RAG systems, knowledge bases, or data processing pipelines, MinerU fills the critical gap between raw PDF files and machine-readable content.&lt;/p&gt;</description></item><item><title>olmOCR: El Kit de Herramientas Open-Source de AI2 para Conversion de PDF a Markdown para Datos de Entrenamiento LLM</title><link>https://www.solosoft.dev/es/post/olmocr-pdf-toolkit-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/olmocr-pdf-toolkit-2026/</guid><description>&lt;p&gt;Convertir PDFs a texto limpio y legible por maquina a escala es uno de los desafios fundamentales en la preparacion de datasets LLM. Los parseadores de PDF tradicionales luchan con disenos complejos, tablas y contenido mixto, mientras que los servicios comerciales de OCR son costosos a escala. &lt;strong&gt;olmOCR&lt;/strong&gt; de Allen AI (AI2) resuelve este problema utilizando un Modelo de Lenguaje y Vision de 7B parametros que convierte paginas PDF en Markdown limpio con notable precision y eficiencia de costos.&lt;/p&gt;
&lt;p&gt;La idea clave detras de olmOCR es tratar la conversion de PDF como una tarea de vision-lenguaje en lugar de un problema de extraccion de texto.&lt;/p&gt;</description></item><item><title>PaddleOCR: El Kit de Herramientas OCR Ultraligero de Baidu con Soporte para 80+ Idiomas</title><link>https://www.solosoft.dev/es/post/paddleocr-ocr-toolkit-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/paddleocr-ocr-toolkit-2026/</guid><description>&lt;p&gt;PaddleOCR es el kit de herramientas de reconocimiento optico de caracteres (OCR) ultraligero de grado industrial de Baidu construido sobre el marco de aprendizaje profundo &lt;a href="https://github.com/PaddlePaddle/Paddle"&gt;PaddlePaddle&lt;/a&gt;. Como uno de los proyectos de OCR de codigo abierto mas populares en GitHub, PaddleOCR ha evolucionado a traves de multiples versiones importantes &amp;ndash; ahora en PP-OCRv5 para deteccion y reconocimiento de texto, PP-StructureV3 para analisis integral de documentos y PP-ChatOCRv4 para inteligencia documental impulsada por LLM.&lt;/p&gt;
&lt;p&gt;Lo que distingue a PaddleOCR es su combinacion de precision, velocidad y amplitud. El modelo PP-OCRv5 logra una precision de ultima generacion mientras mantiene un tamano de modelo inferior a 15 MB para el pipeline completo de deteccion y reconocimiento. El soporte abarca mas de 80 idiomas, y el kit de herramientas incluye todo, desde deteccion y reconocimiento de texto hasta analisis de diseno de documentos, extraccion de tablas e incluso respuestas a preguntas basadas en LLM sobre documentos.&lt;/p&gt;</description></item><item><title>PDF-Extract-Kit: Kit Integral de Extracción de Contenido PDF</title><link>https://www.solosoft.dev/es/post/pdf-extract-kit-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/pdf-extract-kit-2026/</guid><description>&lt;p&gt;Los PDFs siguen siendo el formato más común para el intercambio de documentos, pero extraer contenido estructurado de ellos es notoriamente difícil. PDF-Extract-Kit, desarrollado por OpenDataLab, combina modelos de aprendizaje profundo con métodos tradicionales basados en reglas para extraer texto, tablas, fórmulas e imágenes con precisión excepcional.&lt;/p&gt;
&lt;p&gt;El kit aborda el desafío completo de la extracción de PDFs. Los documentos escaneados se procesan con OCR, los PDFs digitales usan extracción directa de texto, los diseños complejos se analizan con modelos de detección de diseño y las fórmulas matemáticas se analizan con reconocimiento especializado de ecuaciones. La salida es Markdown o JSON estructurado que preserva la estructura lógica del documento.&lt;/p&gt;</description></item><item><title>RapidLayout: Análisis de Diseño de Documentos Open-Source para Chino e Inglés</title><link>https://www.solosoft.dev/es/post/rapidlayout-document-analysis-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/rapidlayout-document-analysis-2026/</guid><description>&lt;p&gt;El análisis de diseño de documentos es el primer paso crítico en cualquier tubería de comprensión de documentos. Antes de que el OCR pueda extraer texto, antes de que las tablas puedan analizarse, y antes de que el contenido pueda clasificarse, el sistema necesita entender &lt;em&gt;dónde&lt;/em&gt; están las cosas en la página. &lt;strong&gt;RapidLayout&lt;/strong&gt;, una biblioteca de código abierto del equipo RapidAI, aborda este desafío con un enfoque en contenido documental tanto en chino como en inglés.&lt;/p&gt;
&lt;p&gt;Desarrollado como parte del ecosistema más amplio de RapidAI — que incluye motores OCR, herramientas de reconocimiento de tablas y modelos de detección de texto — RapidLayout proporciona un enfoque modular e independiente del backend para el análisis de diseño. En lugar de limitar a los usuarios a un único marco de inferencia, soporta OnnxRuntime, OpenVINO y entornos de ejecución C++ especializados para CPU y GPU, lo que lo hace adecuado para todo, desde dispositivos periféricos hasta implementaciones en servidores.&lt;/p&gt;</description></item><item><title>Surya: Sistema Open-Source Multilingüe de OCR y Comprensión de Documentos</title><link>https://www.solosoft.dev/es/post/surya-ocr-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/surya-ocr-2026/</guid><description>&lt;p&gt;El Reconocimiento Óptico de Caracteres es una de las aplicaciones más antiguas de la visión por computadora, pero los motores OCR tradicionales han luchado por mantenerse al día con las demandas modernas. Los documentos de hoy son más diversos en diseño, multilingües en contenido y variables en calidad que nunca antes. &lt;strong&gt;Surya&lt;/strong&gt; representa un enfoque moderno para OCR, construido sobre arquitecturas de aprendizaje profundo que manejan la complejidad de los documentos del mundo real con una precisión que los motores tradicionales no pueden igualar.&lt;/p&gt;
&lt;p&gt;Desarrollado por el equipo de datalab-to (el mismo grupo detrás de Marker), Surya está diseñado tanto como un sistema OCR independiente como un componente para pipelines de procesamiento de documentos más grandes. Proporciona tres capacidades principales: detección de texto (encontrar dónde está el texto en una página), reconocimiento de texto (leer lo que dice) y análisis de diseño (comprender la estructura del documento). La arquitectura unificada significa que un solo modelo maneja texto en docenas de sistemas de escritura e idiomas.&lt;/p&gt;</description></item></channel></rss>