Beschreibung

CosyVoice ist ein auf Sprachmodellen basierendes Text-to-Speech-System von FunAudioLLM für mehrsprachige Sprachsynthese mit Zero-Shot-Stimmklonierung; die aktuelle Version Fun-CosyVoice 3.0 erschien im Dezember 2025.

🛡️ Datenschutz: Das Projekt ist Open Source und lässt sich selbst betreiben; ein Anbieter-Sitz ist auf den geprüften Seiten nicht dokumentiert. Das Modell Fun-CosyVoice3 steht laut Hugging Face unter Apache 2.0. Bei lokalem Betrieb bleibt die Verarbeitung auf der eigenen Hardware, soweit belegt; Stimmklonierung erfordert eine rechtliche Prüfung der Einwilligung der betroffenen Personen.

Das Tool richtet sich an Entwickler und Forschende, die Sprachsynthese in mehreren Sprachen selbst hosten und anpassen wollen.

Tool-Details & Features

💰 Preise: Kostenlos als Open-Source-Software; Hardwarekosten fallen separat an.

⚙️ Technik: Modell mit 0,5 Milliarden Parametern in Version 3.0; Streaming mit einer Latenz von rund 150 ms; Aussprachekontrolle über Pinyin und Phoneme.

👥 Zielgruppe: Entwickler und Forschende im Sprachbereich.

🔗 Integrationen: GitHub-Repository und Hugging Face; Details zu Drittintegrationen sind nicht geprüft.

📊 Funktionen: Neun Sprachen (darunter Deutsch, Englisch, Französisch, Spanisch) und über 18 chinesische Dialekte, sprachübergreifende Stimmklonierung, Streaming in beide Richtungen, Steuerung von Emotion, Tempo und Lautstärke per Anweisung.

Vor- & Nachteile

✅ Vorteile: Mehrsprachig inklusive Deutsch; niedrige Latenz; offene Lizenz für Modell und Code.

❌ Nachteile: Technische Einrichtung nötig; Missbrauchsrisiko bei Stimmklonierung; Hardwarebedarf je nach Modell; Leistungswerte stammen von den Entwicklern.

Für wen geeignet?

Perfekt für Entwicklerteams, die eine offene, mehrsprachige Sprachsynthese mit Stimmklonierung lokal einsetzen wollen.

  • Keine Kommentare vorhanden.
  • Rezension erstellen

    KI-Radar24 Assistent Findet passende KI-Tools & beantwortet Fragen

    Zuletzt aktualisiert am 07.10.2026