Beschreibung

github.com/ggml-org/whisper.cpp ist whisper.cpp, eine C/C++-Implementierung des Spracherkennungsmodells Whisper von OpenAI, die ohne externe Abhängigkeiten auf vielen Geräten Sprache in Text umwandelt.

🛡️ Datenschutz: Open-Source-Projekt ohne eigenen Cloud-Dienst; ein Firmensitz ist auf den geprüften Seiten nicht genannt (Sitz nicht öffentlich dokumentiert). Laut Repository erfolgt die gesamte Berechnung lokal ohne Cloud-Anbindung und funktioniert auch offline, sodass Audiodaten das eigene Gerät nicht verlassen müssen.

Das Tool richtet sich an Entwickler und technisch versierte Anwender, die Spracherkennung lokal und ressourcenschonend in Anwendungen einbauen wollen.

Tool-Details & Features

💰 Preise: Kostenlos unter der MIT-Lizenz; Kosten für Hardware fallen selbst an.

⚙️ Technik: Modelllogik in nur zwei Dateien (whisper.h, whisper.cpp) auf Basis der GGML-Bibliothek; Rechnen mit F16/F32, Ganzzahl-Quantisierung zur Speicherersparnis, Beschleunigung per Metal, CUDA, ROCm, Vulkan, Core ML, OpenVINO sowie CPU-Optimierungen; Modelle von tiny (ca. 75 MiB) bis large (ca. 2,9 GiB). Nur Inferenz, kein Training.

👥 Zielgruppe: Entwickler, Embedded- und Mobile-Entwickler sowie Anwender mit Datenschutzanforderungen.

🔗 Integrationen: Plattformen: macOS, iOS, Android, Linux, Windows, WebAssembly, Raspberry Pi, Docker; Bindings aus der Community für Rust, JavaScript, Go, Python, Ruby, Java und .NET; HTTP-Server mit OpenAI-kompatibler API.

📊 Funktionen: Transkription von Audiodateien, Echtzeit-Verarbeitung von Audioströmen, Spracherkennung mit Mehrsprachen- und englischen Modellen, Sprachaktivitätserkennung, Sprachbefehle, Beispiele für mobile Apps und Browser.

Vor- & Nachteile

✅ Vorteile: Vollständig lokal nutzbar, breite Plattform- und Hardwareunterstützung, kleine Modelle für schwache Geräte, freie Lizenz.

❌ Nachteile: Nur Inferenz und kein Training oder Feintuning; Einbindung erfordert Entwickler-Know-how; Erkennungsqualität hängt vom gewählten Modell ab, größere Modelle benötigen deutlich mehr Speicher.

Für wen geeignet?

Perfekt für Entwickler und Teams, die Transkription oder Sprachsteuerung lokal betreiben und ohne Cloud-Anbieter umsetzen wollen.

  • Keine Kommentare vorhanden.
  • Rezension erstellen

    KI-Radar24 Assistent Findet passende KI-Tools & beantwortet Fragen

    Zuletzt aktualisiert am 07.10.2026