Beschreibung
CosyVoice ist ein auf Sprachmodellen basierendes Text-to-Speech-System von FunAudioLLM für mehrsprachige Sprachsynthese mit Zero-Shot-Stimmklonierung; die aktuelle Version Fun-CosyVoice 3.0 erschien im Dezember 2025.
🛡️ Datenschutz: Das Projekt ist Open Source und lässt sich selbst betreiben; ein Anbieter-Sitz ist auf den geprüften Seiten nicht dokumentiert. Das Modell Fun-CosyVoice3 steht laut Hugging Face unter Apache 2.0. Bei lokalem Betrieb bleibt die Verarbeitung auf der eigenen Hardware, soweit belegt; Stimmklonierung erfordert eine rechtliche Prüfung der Einwilligung der betroffenen Personen.
Das Tool richtet sich an Entwickler und Forschende, die Sprachsynthese in mehreren Sprachen selbst hosten und anpassen wollen.
Tool-Details & Features
💰 Preise: Kostenlos als Open-Source-Software; Hardwarekosten fallen separat an.
⚙️ Technik: Modell mit 0,5 Milliarden Parametern in Version 3.0; Streaming mit einer Latenz von rund 150 ms; Aussprachekontrolle über Pinyin und Phoneme.
👥 Zielgruppe: Entwickler und Forschende im Sprachbereich.
🔗 Integrationen: GitHub-Repository und Hugging Face; Details zu Drittintegrationen sind nicht geprüft.
📊 Funktionen: Neun Sprachen (darunter Deutsch, Englisch, Französisch, Spanisch) und über 18 chinesische Dialekte, sprachübergreifende Stimmklonierung, Streaming in beide Richtungen, Steuerung von Emotion, Tempo und Lautstärke per Anweisung.
Vor- & Nachteile
✅ Vorteile: Mehrsprachig inklusive Deutsch; niedrige Latenz; offene Lizenz für Modell und Code.
❌ Nachteile: Technische Einrichtung nötig; Missbrauchsrisiko bei Stimmklonierung; Hardwarebedarf je nach Modell; Leistungswerte stammen von den Entwicklern.
Für wen geeignet?
Perfekt für Entwicklerteams, die eine offene, mehrsprachige Sprachsynthese mit Stimmklonierung lokal einsetzen wollen.

Rezension erstellen