Beschreibung

github.com/docling-project ist ein Open-Source-Toolkit, das PDFs, Office-Dokumente, HTML und weitere Formate parst und für generative KI aufbereitet; es entstand bei IBM Research Zürich.

🛡️ Datenschutz: Open-Source-Projekt, das bei IBM Research Zürich entstand und von der LF AI & Data Foundation gehostet wird. Als lokal installierbare Bibliothek verarbeitet es Dokumente auf eigener Infrastruktur; eine zentrale Datenverarbeitung durch einen Anbieter findet dabei nicht statt, bei der Anbindung externer Modelle gelten deren Bedingungen.

Das Tool richtet sich an Entwickler und Forschende, die Dokumente für RAG, Agenten und Datenpipelines zuverlässig in strukturierte Formate überführen wollen.

Tool-Details & Features

💰 Preise: Open Source unter MIT-Lizenz, kostenlos nutzbar.

⚙️ Technik: Python-Bibliothek (ab Python 3.10) mit PDF-Analyse, Tabellenstrukturerkennung, OCR und Unterstützung von Vision-Sprachmodellen.

👥 Zielgruppe: Entwickler, Datenteams und Forschung.

🔗 Integrationen: Integrationen mit LangChain, LlamaIndex, CrewAI und Haystack.

📊 Funktionen: Parsing von PDF, DOCX, PPTX, XLSX, HTML und EPUB, Tabellenerkennung, OCR, Export nach Markdown, HTML, JSON und DocTags.

Vor- & Nachteile

✅ Vorteile: Freie MIT-Lizenz und Hosting durch eine Stiftung; fertige Integrationen für gängige KI-Frameworks.

❌ Nachteile: Erfordert Programmierkenntnisse und eigene Rechenressourcen; keine fertige Oberfläche für Endnutzer.

Für wen geeignet?

Perfekt für Entwicklerteams, die Dokumente lizenzfrei und lokal für KI-Workflows aufbereiten wollen.

  • Keine Kommentare vorhanden.
  • Rezension erstellen

    KI-Radar24 Assistent Findet passende KI-Tools & beantwortet Fragen

    Zuletzt aktualisiert am 07.10.2026