VIERTEL

Standard

Schnelles Ende-zu-Ende-TTS mit natürlicher Sprache

Very Fast Geschwindigkeit
Good Qualität
Nein Klonen
10 Sprachen

Über VIERTEL

VITS (Variational Inference with adversarial Learning for End-to-End Text-to-Speech) ist ein schnelles, durchgängig neuronales TTS-Modell, das eine natürliche Sprache erzeugt. Es kombiniert Variations-Autoencoder mit adversarialen Trainings für effiziente Synthese. VITS ist hervorragend für die Batch-Verarbeitung und Anwendungen, die sowohl Qualität als auch Geschwindigkeit erfordern.

Hauptmerkmale

Schnelle Synthese

End-to-End-Architektur für schnelle Spracherzeugung.

Batch-Verarbeitung

Mehrere Texte effizient gleichzeitig verarbeiten.

Natürliche Sprache

VAE+GAN Training erzeugt natürliche Prosodie und Rhythmus.

Mehrsprachiger Redner

Ein Modell unterstützt mehrere Lautsprecherstimmen.

Effizient

Geringer Speicherfußabdruck mit guter Leistung.

Quelle öffnen

MIT lizenziert für jeden Anwendungsfall.

Anwendungsfälle

Stapel-Audio-Generierung E-Learning-Plattformen Nachrichtenleser Automatisierte Ankündigungen IVR-Systeme Inhalt mit hohem Volumen

VIERTEL Voices

View All 109
LJSpeech (English Female)
EN
VCTK Speaker 225 (English Female)
EN
VCTK Speaker 226 (English Male)
EN
VCTK Speaker 227 (English Male)
EN
VCTK Speaker 228 (English Female)
EN
VCTK Speaker 229
EN
VCTK Speaker 230
EN
VCTK Speaker 231
EN
VCTK Speaker 232
EN
VCTK Speaker 233
EN
VCTK Speaker 234
EN
VCTK Speaker 236
EN

Wie man verwendet VIERTEL

  1. 1

    Melde dich kostenlos an oder probiere die Demo aus

    Erstellen Sie ein kostenloses TextToSpeechAI-Konto, um Starter-Credits zu erhalten, oder nutzen Sie die on-page-Demo, um VITS vor der Anmeldung zu hören.

  2. 2

    Wählen Sie eine VITS-Stimme oder einen Lautsprecher

    Durchsuchen Sie die Sprachbibliothek und wählen Sie eine mit dem VITS-Abzeichen markierte Stimme. Mit der Mehrsprechen-VITS-Bibliothek, einschließlich des VCTK-Lautsprecher-Sets, können Sie aus vielen verschiedenen Stimmen auswählen.

  3. 3

    Geben Sie Ihren Text ein

    Geben Sie den gewünschten Text in den Editor ein oder fügen Sie ihn ein. VITS verarbeitet lange Passagen gut und ist ideal für Batch- und High-Volume-Inhalte.

  4. 4

    Erzeugen des Audios

    Klicken Sie auf erzeugen, um Sprache mit VITS zu synthetisieren. Da VITS sehr schnell und Standard-Tier (10 Credits pro 1000 Zeichen) ist, Ergebnisse schnell zu niedrigen Kosten zurück.

  5. 5

    API herunterladen oder verwenden

    Laden Sie das fertige Audio als MP3, WAV oder OGG herunter oder rufen Sie die gleiche VITS-Stimme über die TextToSpeechAI REST API auf, um die Erzeugung in Ihrer eigenen Anwendung zu automatisieren.

VIERTEL API

Sprachprogrammatik mit der TextToSpeechAI REST API generieren.

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "VITS liefert schnelle, natürliche Sprachausgabe für Anwendungen mit hohem Volumen.",
    "voice": "vits-ljspeech"
  }'

Häufig gestellte Fragen

VITS (Variational Inference with adversarial learning for end-to-end Text-to-Speech) ist ein end-to-end neuronales TTS-Modell, das einen variationalen Autoencoder mit gegnerischem GAN-Training verbindet. Es erzeugt in einem einzigen Pass eine natürliche Sprache, die es schnell und effizient macht. Sie können VITS kostenlos auf TextToSpeechAI ausprobieren.

Ja, VITS ist Open Source unter der MIT-Lizenz, so unterstützt es die volle kommerzielle Nutzung ohne Einschränkungen. Es ist weit verbreitet in kommerziellen Produkten und Dienstleistungen verwendet. Auf TextToSpeechAI, VITS kostet 10 Credits pro 1000 Zeichen auf der Standard-Ebene.

TextToSpeechAI bietet eine große Multi-Lautsprecher VITS-Bibliothek, einschließlich der VCTK-Sprachgarnitur mit Dutzenden von verschiedenen englischen Lautsprechern. Ein einzelnes VITS-Modell kann viele Lautsprecher aufnehmen, so dass Sie aus vielen verschiedenen Stimmen ohne Schalten von Motoren wählen können.

Die VITS-Unterstützung hängt vom geschulten Modell ab. Die üblichen VITS-Modelle umfassen Englisch, Chinesisch, Japanisch, Koreanisch, Deutsch, Französisch und andere Hauptsprachen, mit mehrsprachiger englischer Berichterstattung aus dem VCTK-Datensatz.

VITS ist sehr schnell und erzeugt Sprache in Echtzeit oder schneller auf einer GPU. Seine durchgängige Architektur vermeidet die verschiedenen Verarbeitungsstufen anderer Modelle, weshalb VITS gut für die Batch- und High-Volume-Synthese geeignet ist.

Nein, VITS unterstützt das Klonen von Stimmen nicht. Es verwendet vortrainierte Multi-Lautsprecher-Modelle, anstatt eine Zielstimme aus einem Sample zu kopieren. Zum Klonen von Stimmen auf TextToSpeechAI verwenden Sie stattdessen F5-TTS oder GPT-SoVITS.

VITS produziert hochwertiges Audio mit natürlicher Prosody und Rhythmus. Obwohl es nicht auf dem Niveau von StyleTTS 2 oder Tortoise ist, bietet es eine ausgezeichnete Qualität für seine Geschwindigkeit, vor allem für die Batch-Verarbeitung.

VITS ist speichersparend und benötigt typischerweise nur wenige GB VRAM (ca. 4 GB). Es läuft bequem auf Verbraucher-GPUs, und auf TextToSpeechAI erfolgt die Rendering auf unseren Servern, so dass Sie keine eigene Hardware benötigen.

VITS und Piper sind beide schnell, MIT-lizenzierte Standard-Tier-Motoren auf TextToSpeechAI. Piper ist die leichteste und schnellste Option, während VITS bietet eine große Multi-Lautsprecher-Bibliothek (einschließlich VCKK) mit etwas natürlicher Prosody. Weder unterstützt Stimme Klonen.

VITS ist ein Standard-Tier-Motor, kostet 10 Credits pro 1000 Zeichen. Dies ist unsere niedrigste Preisklasse dank der effizienten, schnellen Natur des VITS-Modells.

VITS erzeugt Audio bei 22050Hz nativ. Durch TextToSpeechAI können Sie MP3, WAV oder OGG Formate anfordern, mit automatischer Konvertierung für Sie behandelt.

Melden Sie sich auf TextToSpeechAI an, um kostenlose Starter-Gutschriften zu erhalten, dann wählen Sie eine VITS-Stimme aus, geben Sie Ihren Text ein und erzeugen Sie Audio. Sie können die Demo auch verwenden, um VITS zu hören, bevor Sie ein Konto erstellen, und auf VITS über unsere REST API zugreifen, sobald Sie sich anmelden.

Technical Specs

  • Generation Speed Very Fast
  • Output Quality Good
  • Voice Cloning Not Supported
  • Languages 10
  • GPU VRAM 1-2GB
  • Credits/1000 chars 10

Try VIERTEL Now

Generate your first audio free. No credit card required.

Start Free