Beschreibung
github.com/datalab-to/surya ist ein Open-Source-OCR-System von Datalab auf Basis eines Vision-Sprachmodells mit rund 650 Millionen Parametern für Texterkennung, Layoutanalyse, Lesereihenfolge und Tabellenerkennung in Dokumenten.
🛡️ Datenschutz: Anbieter Datalab; Sitzland und Zertifizierungen sind nicht öffentlich dokumentiert. Das Modell kann lokal betrieben werden, sodass Dokumente bei lokaler Nutzung die eigene Infrastruktur nicht verlassen; bei der gehosteten Datalab-Plattform sollte vorab ein AVV geprüft werden.
Das Tool richtet sich an Entwickler und Forschende, die mehrsprachige OCR und Dokumentenanalyse in eigene Anwendungen einbinden wollen.
Tool-Details & Features
💰 Preise: Open Source: Code unter Apache 2.0, Modellgewichte unter modifizierter Open-Rail-M-Lizenz (kostenfrei für Forschung, private Nutzung und kleine Startups); kommerzielle Lizenz und gehostete Plattform über Datalab.
⚙️ Technik: Installation per pip; benötigt vllm (NVIDIA-GPU) oder llama.cpp (CPU, Apple Silicon) als Inferenz-Backend.
👥 Zielgruppe: Entwickler, Forschende und KI-Teams.
🔗 Integrationen: Kommandozeilenwerkzeuge und Python-API; gehostete Plattform mit Playground unter datalab.to.
📊 Funktionen: OCR in über 90 Sprachen, Layoutanalyse für Überschriften, Tabellen, Bilder und Gleichungen, Lesereihenfolge, Tabellenstruktur mit HTML-Ausgabe, LaTeX-Formelerkennung.
Vor- & Nachteile
✅ Vorteile: Starke Mehrsprachigkeit bei moderatem Ressourcenbedarf; lokal betreibbar.
❌ Nachteile: Gewichte unterliegen Lizenzgrenzen für kommerzielle Nutzung; Einrichtung eines Inferenz-Backends erfordert technische Kenntnisse.
Für wen geeignet?
Perfekt für Entwicklerteams, die mehrsprachige Texterkennung und Layoutanalyse lokal in eigene Dokumenten-Pipelines einbauen wollen.

Rezension erstellen