CosyVoice2

Premium

Null-Schuss mehrsprachiges Sprachklonen mit Streaming-Unterstützung

Fast Geschwindigkeit
Very Good Qualität
Nein Klonen
5 Sprachen

Über CosyVoice2

CosyVoice2 ist ein Sprachsynthesemodell der nächsten Generation von FunAudioLLM (Alibaba). Es liefert ein natürlich klingendes Null-Schuß-Gespräche-Klonen über mehrere Sprachen mit Streaming-Fähigkeit für Anwendungen mit geringer Latenz. Es basiert auf einem endlichen skalaren Quantisierungsansatz und erreicht eine ausgezeichnete Sprachgleichung mit nur wenigen Sekunden Referenz-Audio.

Hauptmerkmale

Null-schnelle Stimme Klonen

Klonen Sie jede Stimme von 3-10 Sekunden Referenz-Audio mit hoher Treue.

Mehrsprachig

Unterstützt Chinesisch, Englisch, Japanisch, Koreanisch und Kantonesisch mit cross-lingualer Synthese.

Unterstützung für Streaming

Low-Latenz-Streaming-Modus für Echtzeit-Anwendungen und interaktive Systeme.

Natürliche Prosodie

Fortschrittliche Prosody-Modellierung erzeugt natürlich klingende Sprache mit entsprechender Intonation.

Anwendungsfälle

Mehrsprachige Inhalte Sprachassistenten in Echtzeit Sprachenübergreifende Synchronisation Personalisierte Sprachanwendungen

Wie man verwendet CosyVoice2

  1. 1

    Melde dich an und beantrage kostenlose Kredite

    Erstellen Sie ein kostenloses TextToSpeechAI-Konto, um Ihre Starter-Gutschriften zu beanspruchen, oder versuchen Sie es zuerst mit der Demo. Keine GPU oder lokale CosyVoice2 Installation ist erforderlich - alles läuft auf unserer Infrastruktur.

  2. 2

    Wählen Sie CosyVoice2 und fügen Sie einen Referenzclip hinzu

    Wählen Sie CosyVoice2 als Ihre Engine und laden Sie dann eine saubere 3-10 zweite Referenzaufnahme der Stimme, die Sie klonen möchten. CosyVoice2 extrahiert die Lautsprechereigenschaften für das Null-Schuss-Multilingual Klonen.

  3. 3

    Geben Sie Ihren Text in einer beliebigen unterstützten Sprache ein

    Geben Sie Ihr Skript in Chinesisch, Englisch, Japanisch, Koreanisch oder Kantonesisch ein. CosyVoice2 unterstützt die cross-linguale Synthese, sodass die geklonte Stimme eine andere Sprache als den Referenzclip sprechen kann.

  4. 4

    Erzeugen der Rede

    Klicken Sie auf erzeugen und CosyVoice2 synthetisiert natürliche, mehrsprachige Sprache in der geklonten Stimme, in der Regel innerhalb von Sekunden für kurze Text. Premium-Tier-Nutzung kostet 25 Credits pro 1.000 Zeichen.

  5. 5

    API herunterladen oder verwenden

    Laden Sie die fertige Audio als MP3 oder WAV aus Ihrer Geschichte herunter oder automatisieren Sie CosyVoice2 Voice Klonen im Maßstab über die TextToSpeechAI REST API.

CosyVoice2 API

Sprachprogrammatik mit der TextToSpeechAI REST API generieren.

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "CosyVoice2 liefert natürliche mehrsprachige Sprache mit Null\u002DSchuß\u002DStimme Klonen Fähigkeit.",
    "voice": "en_US-lessac-medium"
  }'

Häufig gestellte Fragen

CosyVoice2 ist ein Text-zu-Sprechen- und Sprachklonmodell der nächsten Generation von FunAudioLLM (Alibaba). Es unterstützt das Null-Schuß-Gespräche-Klonen aus nur wenigen Sekunden Referenz-Audio und kann natürliche Sprache in Chinesisch, Englisch, Japanisch, Koreanisch und Kantonesisch synthetisieren. Auf TextToSpeechAI können Sie CosyVoice2 im Browser ohne lokale Einrichtung ausführen.

Ja, CosyVoice2 ist voll Apache 2.0 lizenziert - sowohl der Code als auch das Modellgewicht. Dadurch ist es sicher, in kommerziellen Produkten, bezahlten Inhalten und Kunden arbeiten ohne Lizenzgebühren oder nicht-kommerzielle Einschränkungen zu verwenden.

CosyVoice2 unterstützt fünf Sprachen: Chinesisch (Mandarin), Englisch, Japanisch, Koreanisch und Kantonesisch. Es behandelt auch die cross-linguale Synthese, so dass Sie eine Stimme aus einer Aufnahme in einer Sprache klonen und Sprache in einer anderen erzeugen können.

Geben Sie 3-10 Sekunden saubere Referenz-Audio des Ziellautsprechers. CosyVoice2 extrahiert die Lautsprechereigenschaften mit einem endlichen skalaren Quantisierungsansatz und erzeugt dann neue Sprache in dieser geklonten Stimme über eine der unterstützten Sprachen. Es ist kein Modelltraining oder Feinabstimmung erforderlich.

CosyVoice2 ist eines der stärkeren mehrsprachigen Klonmodelle, das die Identität des Lautsprechers auch bei der Erzeugung von Sprache in einer anderen Sprache als dem Referenzclip bewahrt. Es produziert natürliche Prosodie und Intonation, die es für linguistische Synchronisation und lokalisierte Inhalte gut geeignet macht.

Ja. CosyVoice2 ist ein schnelles Modell und beinhaltet einen Streaming-Modus, der Audio mit geringer Latenz produziert, so dass es für Sprachassistenten und interaktive Anwendungen geeignet ist. Auf TextToSpeechAI Generationen in der Regel in Sekunden für Kurztext komplett.

CosyVoice2 benötigt für das 0.5B-Parametermodell etwa 4-6GB VRAM, daher empfiehlt sich beim Selfhosting eine GPU mit 6GB oder mehr. Bei TextToSpeechAI läuft das Modell auf unserer GPU-Infrastruktur, sodass Sie keine eigene Hardware benötigen.

CosyVoice2 ist ein Premium-Tier-Modell und kostet 25 Credits pro 1.000 Zeichen Text. Jedes neue Konto erhält kostenlose Starter-Gutschriften, so dass Sie CosyVoice2 Voice Klonen versuchen können, bevor Sie sich für einen bezahlten Plan entscheiden.

Beide sind Premium-Sprachklon-Engines. GPT-SoVITS erreicht oft die höchste Rohgleichheit für eine einzelne Zielstimme, während CosyVoice2 stärker für mehrsprachiges und cross-linguales Klonen ist und einen Low-Latenz-Streaming-Modus hinzufügt. Wählen Sie CosyVoice2, wenn Sie eine geklonte Stimme benötigen, um mehrere Sprachen zu sprechen.

Beide bieten hochwertiges Null-Schuß-Sprachklonen. CosyVoice2 unterstützt mehr Sprachen (5 versus 2) und fügt Streaming für Echtzeit-Nutzung hinzu, während F5-TTS für nur Englisch-Workloads etwas schneller sein kann. CosyVoice2 ist für mehrsprachige Projekte in der Regel die bessere Passform.

Mit TextToSpeechAI können Sie CosyVoice2 Generationen in gängigen Formaten wie MP3 und WAV exportieren. Sie können die Datei direkt von Ihrer Historienseite herunterladen oder programmatisch über die TextToSpeechAI API abrufen.

Ja. Sie können CosyVoice2 mit der kostenlosen Demo und Ihren kostenlosen Starter-Credits auf TextToSpeechAI testen, ohne etwas zu installieren. Melden Sie sich einfach an, laden Sie einen kurzen Referenzclip hoch, geben Sie Ihren Text in jede unterstützte Sprache ein und generieren Sie.

Technical Specs

  • Generation Speed Fast
  • Output Quality Very Good
  • Voice Cloning Supported
  • Languages 5
  • GPU VRAM 4-6GB
  • Credits/1000 chars 25

Try CosyVoice2 Now

Generate your first audio free. No credit card required.

Start Free