VITS

Standard

Hurtig slut-til-ende TTS med naturlig tale

Very Fast Hastighed
Good Kvalitet
Nej Kloning
1 Sprog

Om VITS

VITS (Variational Inference med modstræbende læring for end-to-end Text-to-Speech) er en hurtig, end-to-end neural TTS-model, der gener naturlig klingende tale. Den kombinerer variations autoencodere med adversarial træning for effektiv syntese. VITS er fremragende til batchbehandling og applikationer, der kræver både kvalitet og hastighed.

Nøglefunktioner

Hurtig syntese

Ende-til-ende arkitektur til hurtig tale generation.

Batchforarbejdning

Behandle flere tekster samtidigt.

Naturlig tale

VAE+GAN træning producerer naturlig prosody og rytme.

Multi- højttaler

Enkelt model understøtter flere højttaler stemmer.

Effektiv

Lav hukommelse fodaftryk med god ydeevne.

Open source

MIT licenseret til enhver brug case.

Brugstilfælde

Batch- lyd- generation E-Learning-platforme Nyhedslæsere Automatiske meddelelser IVR-systemer Indhold i høj volumen

VITS Voices

View All 109
LJSpeech (English Female)
EN
VCTK Speaker 225 (English Female)
EN
VCTK Speaker 226 (English Male)
EN
VCTK Speaker 227 (English Male)
EN
VCTK Speaker 228 (English Female)
EN
VCTK Speaker 229
EN
VCTK Speaker 230
EN
VCTK Speaker 231
EN
VCTK Speaker 232
EN
VCTK Speaker 233
EN
VCTK Speaker 234
EN
VCTK Speaker 236
EN

Hvordan man bruger VITS

  1. 1

    Gratis tilmelding

    Opret en gratis TextToSpeechAI konto for at få startkreditter.

  2. 2

    Vælg en VITS-stemme eller højttaler

    Gennemse stemmebiblioteket og vælg en stemme markeret med VITS-skiltet. Multi-højttaler VITS biblioteket, herunder VCTK højttaler sæt, lader dig vælge fra mange forskellige stemmer.

  3. 3

    Indtast din tekst

    Indtast eller indsæt den tekst, du ønsker talt ind i editoren. VITS håndterer lange passager godt og er ideel til batch og højt volumen indhold.

  4. 4

    Generér lyden

    Klik på generere for at syntetisere tale med VITS. Fordi VITS er meget hurtig og Standard-tier (10 kreditter pr 1000 tegn), resultater returnere hurtigt til lave omkostninger.

  5. 5

    Download eller brug API'en

    Download den færdige lyd som MP3, WAV, eller OGG, eller ring til den samme VITS stemme gennem TextToSpeechAI REST API til at automatisere generation i din egen ansøgning.

VITS API

Generer tale programmatisk ved hjælp af TextToSpeechAI REST API.

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "VITS leverer hurtig, naturlig tale til høj volumen applikationer.",
    "voice": "vits-ljspeech"
  }'

Ofte stillede spørgsmål

VITS (Variational Inference med modstræbende læring til ende-til-ende Text-to-Speech) er en ende-til-ende neural TTS-model, der kombinerer en variational autoencoder med modsociering GAN-træning. Den gener naturlig klingende tale i et enkelt pas, hvilket gør det hurtigt og effektivt. Du kan prøve VITS gratis på TextToSpeechAI.

Ja, VITS er open source under MIT-licensen, så det understøtter fuld kommerciel brug uden begrænsninger. Det er meget udbredt i kommercielle produkter og tjenester. På TextToSpeechAI, VITS koster 10 kreditter pr 1000 tegn på Standard-niveau.

TextToSpeechAI tilbyder et stort multi-højttaler VITS bibliotek, herunder VCTK stemmesæt med snesevis af forskellige engelsktalende. En enkelt VITS model kan være vært mange højttalere, så du kan vælge mellem mange forskellige stemmer uden at skifte motorer.

VITS stemmer på TextToSpeechAI er engelsk, trukket fra LJSpeech og VCTK højttaler sæt. For andre sprog, bruge Piper eller Bark stemmer.

VITS er meget hurtig, gener tale i realtid eller hurtigere på en GPU. Dens ende-til-ende arkitektur undgår de mange procesfaser i andre modeller, hvilket er grunden til VITS er velegnet til batch og høj-volumen syntese.

Nej, VITS understøtter ikke stemmekloning. Den bruger prætrænede multihøjttalermodeller frem for at kopiere en målstemme fra en prøve. Til stemmekloning bruges klonstemmeværktøjet, som kører Chatterbox.

VITS producerer god lydkvalitet med naturlig prosody og rytme. Selvom det ikke er på niveau med StylettTS 2 eller Tortoise, det tilbyder fremragende kvalitet for sin hastighed, især til batch forarbejdning.

VITS er hukommelseseffektiv, typisk kun behøver et par GB VRAM (ca. 4GB). Det kører komfortabelt på forbruger GPU'er, og på TextToSpeechAI alle rendering sker på vores servere, så du ikke har brug for nogen hardware af din egen.

VITS og Piper er både hurtige, MIT-licens motorer på TextToSpeechAI. Piper er den letteste mulighed og koster 1 kredit pr 1.000 tegn, mens VITS (10 kreditter pr 1.000 tegn) tilbyder et stort multi-højttaler bibliotek (herunder VCTK) med lidt mere naturlig prosody. Ingen understøtter stemmekloning.

VITS er en standardmotor, der koster 10 point per 1000 tegn. Kun Piper, med 1 kredit per 1.000 tegn, koster mindre.

VITS gener lyd på 22050Hz indbygget. Gennem TextToSpeechAI kan du anmode om MP3, WAV, eller OGG formater, med automatisk konvertering håndteres for dig.

Tilmeld dig på TextToSpeechAI for at modtage gratis startpoint, og vælg derefter en VITS-stemme, indtast din tekst og generere lyd. Du kan også få adgang til VITS via vores REST API, når du tilmelder dig.

Technical Specs

  • Generation Speed Very Fast
  • Output Quality Good
  • Voice Cloning Not Supported
  • Languages 1
  • GPU VRAM 1-2GB
  • Credits/1000 chars 10

Try VITS Now

Generate your first audio free. No credit card required.

Start Free