<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>PDF Parsing on SoloSoft</title><link>https://www.solosoft.dev/es/tags/pdf-parsing/</link><description>Recent content in PDF Parsing on SoloSoft</description><generator>Hugo</generator><language>es-es</language><lastBuildDate>Fri, 01 May 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.solosoft.dev/es/tags/pdf-parsing/index.xml" rel="self" type="application/rss+xml"/><item><title>MinerU: Analisis de PDFs y Extraccion de Datos Open-Source</title><link>https://www.solosoft.dev/es/post/mineru-pdf-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/mineru-pdf-2026/</guid><description>&lt;p&gt;PDF is the universal format for document distribution, but it is arguably the worst format for data extraction. PDFs store visual layouts — coordinates, fonts, and rendering instructions — not semantic structure. Paragraphs, tables, lists, and headings exist only as visual arrangements of text fragments. Every developer who has tried to extract structured data from a PDF knows the frustration of losing table structure, mangled text order, and jumbled multi-column layouts.&lt;/p&gt;
&lt;p&gt;MinerU, developed by OpenDataLab, addresses this problem with a comprehensive open-source document parsing pipeline. It extracts text, tables, formulas, and images from PDFs with high structural fidelity, producing clean Markdown or structured JSON output. For organizations building RAG systems, knowledge bases, or data processing pipelines, MinerU fills the critical gap between raw PDF files and machine-readable content.&lt;/p&gt;</description></item><item><title>Open Parse: Analizador de Documentos Visual para Pipelines RAG Listos para LLM</title><link>https://www.solosoft.dev/es/post/open-parse-document-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/open-parse-document-2026/</guid><description>&lt;p&gt;El ecosistema RAG (Generacion Aumentada por Recuperacion) ha madurado rapidamente, pero un cuello de botella persiste: basura entra, basura sale. La mayoria de las herramientas de analisis de documentos alimentan texto sin procesar a los pipelines LLM sin entender la estructura visual del documento, produciendo fragmentos que separan los encabezados de su contenido, dividen tablas entre paginas y pierden la jerarquia semantica que hace legibles los documentos. &lt;strong&gt;Open Parse&lt;/strong&gt; de Filimoa resuelve este problema desde la raiz.&lt;/p&gt;
&lt;p&gt;Open Parse es un analizador de documentos visual que analiza la disposicion real de cada pagina antes de extraer texto. En lugar de tratar un PDF como un flujo de caracteres, identifica bloques de texto, columnas, encabezados, limites de tablas y leyendas de figuras utilizando tecnicas de vision por computadora. La salida preserva la estructura semantica del documento como Markdown estructurado, listo para estrategias de fragmentacion que realmente tienen sentido para la recuperacion.&lt;/p&gt;</description></item></channel></rss>