<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Web Scraping on SoloSoft</title><link>https://www.solosoft.dev/es/tags/web-scraping/</link><description>Recent content in Web Scraping on SoloSoft</description><generator>Hugo</generator><language>es-es</language><lastBuildDate>Fri, 01 May 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.solosoft.dev/es/tags/web-scraping/index.xml" rel="self" type="application/rss+xml"/><item><title>Douyin TikTok Download API: Herramienta Open-Source Asincrona de Scraping de Datos de Redes Sociales</title><link>https://www.solosoft.dev/es/post/douyin-tiktok-download-api-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/douyin-tiktok-download-api-2026/</guid><description>&lt;p&gt;&lt;a href="https://github.com/Evil0ctal/Douyin_TikTok_Download_API"&gt;Douyin TikTok Download API&lt;/a&gt; es una herramienta asincrona open-source de alto rendimiento para scrapear y descargar contenido de cuatro importantes plataformas de redes sociales chinas e internacionales: &lt;strong&gt;Douyin&lt;/strong&gt;, &lt;strong&gt;TikTok&lt;/strong&gt;, &lt;strong&gt;Kuaishou&lt;/strong&gt; y &lt;strong&gt;Bilibili&lt;/strong&gt;. Creada por el desarrollador &lt;strong&gt;Evil0ctal&lt;/strong&gt;, el proyecto ha obtenido mas de 5,100 estrellas en GitHub y sirve como solucion de referencia para investigadores, creadores de contenido y desarrolladores que necesitan acceso programatico a datos de plataformas de video corto.&lt;/p&gt;
&lt;p&gt;A diferencia de las extensiones de navegador o scripts de descarga simples, este proyecto proporciona un &lt;strong&gt;backend REST API&lt;/strong&gt; completo con una &lt;strong&gt;interfaz de usuario web&lt;/strong&gt;, lo que lo hace adecuado tanto para pipelines automatizados como para uso interactivo. Maneja las medidas anti-scraping cada vez mas sofisticadas empleadas por estas plataformas, incluidos los algoritmos de firma X-Bogus y A_Bogus que Douyin y TikTok utilizan para proteger sus API.&lt;/p&gt;</description></item><item><title>LLM Scraper: Extraer Datos Estructurados de Páginas Web Usando LLMs</title><link>https://www.solosoft.dev/es/post/llm-scraper-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/llm-scraper-2026/</guid><description>&lt;p&gt;El web scraping tradicional se basa en selectores CSS y expresiones XPath frágiles que se rompen en cuanto un sitio actualiza su marcado. LLM Scraper adopta un enfoque fundamentalmente diferente: utiliza grandes modelos de lenguaje para comprender el contenido de la página semánticamente y extraer exactamente los datos que necesitas como JSON estructurado.&lt;/p&gt;
&lt;p&gt;Creado por mishushakov, esta herramienta de código abierto cierra la brecha entre el HTML no estructurado y los pipelines de datos estructurados. En lugar de escribir y mantener selectores, defines un esquema tipado de lo que quieres extraer y el LLM se encarga del resto.&lt;/p&gt;
&lt;h2 id="capacidades-principales"&gt;Capacidades Principales&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Capacidad&lt;/th&gt;
 &lt;th&gt;Descripción&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Análisis semántico&lt;/td&gt;
 &lt;td&gt;El LLM entiende el contenido de la página en lugar de coincidir patrones&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Esquema tipado&lt;/td&gt;
 &lt;td&gt;Define la estructura exacta de datos que quieres extraer&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Procesamiento por lotes&lt;/td&gt;
 &lt;td&gt;Maneja múltiples páginas eficientemente&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Salida multi-formato&lt;/td&gt;
 &lt;td&gt;JSON, CSV o formatos personalizados&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Soporte headless&lt;/td&gt;
 &lt;td&gt;Renderizado opcional del navegador para sitios con JavaScript&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="flujo-de-trabajo-de-scraping"&gt;Flujo de Trabajo de Scraping&lt;/h2&gt;

&lt;figure class="mermaid-wrapper not-prose" role="img" aria-label="Mermaid diagram"&gt;
 &lt;div class="mermaid-container"&gt;
 &lt;pre class="mermaid"&gt;flowchart LR
 A[URL Objetivo] --&amp;gt; B[Obtener HTML]
 B --&amp;gt; C[Extracción de Contenido]
 C --&amp;gt; D[Análisis LLM]
 D --&amp;gt; E[Coincidencia de Esquema]
 E --&amp;gt; F[JSON Estructurado]
 F --&amp;gt; G[Salida]&lt;/pre&gt;
 &lt;script type="application/mermaid"&gt;flowchart LR
 A[URL Objetivo] --&gt; B[Obtener HTML]
 B --&gt; C[Extracción de Contenido]
 C --&gt; D[Análisis LLM]
 D --&gt; E[Coincidencia de Esquema]
 E --&gt; F[JSON Estructurado]
 F --&gt; G[Salida]&lt;/script&gt;
 &lt;/div&gt;
&lt;/figure&gt;&lt;p&gt;El flujo de trabajo obtiene el HTML de las URLs que proporcionas, extrae el contenido principal, envía la definición del esquema junto con el contenido al LLM y devuelve JSON estructurado que coincide con el esquema.&lt;/p&gt;</description></item><item><title>ScrapeGraphAI: Web Scraping Impulsado por LLM con Lógica de Grafos</title><link>https://www.solosoft.dev/es/post/scrapegraph-ai-scraping-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/scrapegraph-ai-scraping-2026/</guid><description>&lt;p&gt;El web scraping tradicional es frágil. Un scraper construido alrededor de selectores CSS y expresiones XPath se rompe en el momento en que el sitio web objetivo actualiza su estructura HTML. Mantener scrapers a escala se convierte en un juego constante de ponerse al día con los cambios de diseño, reestructurar selectores y volver a probar tuberías. &lt;strong&gt;ScrapeGraphAI&lt;/strong&gt; adopta un enfoque fundamentalmente diferente: en lugar de codificar reglas de extracción, utiliza LLMs para comprender el contenido de la página semánticamente y extraer los datos que realmente deseas.&lt;/p&gt;
&lt;p&gt;La idea central es que un LLM — dado el contenido renderizado de una página y una descripción de lo que extraer — puede identificar la información relevante sin conocer la estructura CSS de la página. Esto hace que los scrapers de ScrapeGraphAI sean resistentes a los cambios de diseño. Un rediseño del sitio web que rompería un scraper tradicional apenas se nota: el LLM simplemente lee el nuevo diseño y encuentra la misma información.&lt;/p&gt;</description></item><item><title>Trafilatura: Extraccion de Texto Web Open-Source para Datasets LLM e Investigacion</title><link>https://www.solosoft.dev/es/post/trafilatura-text-extraction-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/trafilatura-text-extraction-2026/</guid><description>&lt;p&gt;Extraer texto limpio y estructurado de paginas web es una tarea fundamental para conjuntos de datos de entrenamiento LLM, corpus de investigacion y pipelines de analisis de contenido. &lt;strong&gt;Trafilatura&lt;/strong&gt; se ha convertido en el estandar de oro para esta tarea &amp;ndash; una libreria Python que alcanza consistentemente el F-Score mas alto entre las herramientas de extraccion de texto open-source, manteniendose ligera, rapida y facil de integrar.&lt;/p&gt;
&lt;p&gt;Desarrollado por Adrien Barbaresi en la Academia de Ciencias y Humanidades de Berlin-Brandenburgo, Trafilatura va mas alla de la simple conversion de HTML a texto. Identifica el area de contenido principal de una pagina web, elimina navegacion, encabezados, pies de pagina, anuncios y barras laterales, y devuelve solo el contenido textual significativo. Sus capacidades de rastreo le permiten seguir enlaces recursivamente dentro de un dominio, construyendo corpus de texto completos a partir de sitios web enteros.&lt;/p&gt;</description></item></channel></rss>