Beschreibung
github.com/datalab-to/marker ist ein Open-Source-Werkzeug von Datalab, das PDFs, Bilder, Office-Dateien, HTML und EPUB mithilfe von KI-Modellen in Markdown, JSON, HTML oder Chunks umwandelt.
🛡️ Datenschutz: Anbieter Datalab; Sitzland und Zertifizierungen sind nicht öffentlich dokumentiert. Das Werkzeug läuft lokal auf eigener Hardware (GPU, CPU oder MPS), sodass Dokumente bei lokaler Nutzung nicht an Dritte gesendet werden; beim optionalen LLM-Modus mit externen Anbietern gelten deren Bedingungen, bei der gehosteten Datalab-Plattform sollte vorab ein AVV geprüft werden.
Das Tool richtet sich an Entwickler und Datenteams, die Dokumente für Sprachmodelle, Suche oder Wissensdatenbanken aufbereiten wollen.
Tool-Details & Features
💰 Preise: Open Source: Code unter Apache 2.0, Modellgewichte unter modifizierter Open-Rail-M-Lizenz (kostenfrei für Forschung, private Nutzung und kleine Startups); kommerzielle Lizenz und gehostete API nutzungsbasiert über Datalab.
⚙️ Technik: Python-Werkzeug mit Layout-, Tabellen- und Formelerkennung; optional ein LLM-Modus mit Gemini, Claude, OpenAI oder Ollama für schwierige Dokumente.
👥 Zielgruppe: Entwickler, Forschende und KI-Teams.
🔗 Integrationen: Python-Bibliothek und Kommandozeile; optional Anbindung an Sprachmodelle; gehostete Plattform unter datalab.to.
📊 Funktionen: Konvertierung nach Markdown, JSON, HTML und Chunks, Tabellen- und Formelformatierung, Entfernen von Kopf- und Fußzeilen, Bildextraktion, Hybrid-Modus mit LLM.
Vor- & Nachteile
✅ Vorteile: Lokal und kostenlos nutzbar; breite Eingabeformate und für Sprachmodelle geeignete Ausgaben.
❌ Nachteile: Gewichte unterliegen Lizenzgrenzen für kommerzielle Nutzung; Einrichtung erfordert technische Kenntnisse.
Für wen geeignet?
Perfekt für Entwicklerteams, die Dokumente lokal und flexibel für KI-Anwendungen in Markdown umwandeln wollen.

Rezension erstellen