OpenDataLab

  1. PDF-Extract-Kit: Comprehensive PDF Content Extraction Toolkit

    PDFs remain the most common format for document exchange, but extracting structured content from them is notoriously difficult. PDF-Extract-Kit...

    Open Source
  2. MinerU: Open-Source PDF Document Parsing and Data Extraction

    PDF is the universal format for document distribution, but it is arguably the worst format for data extraction. PDFs store visual layouts —...

    AI