VIT

Standard

Raske TTS-enheter med naturlig tale

Very Fast Hastighet
Good Kvalitet
Nei Kloning
1 Språk

Om VIT

VITS (Variativ inferens med antagonistisk læring for ende- til- ende tekst- til- tale) er en rask, ende- til- ende nevral TTS- modell som lager naturlig lydertalende tale. Den kombinerer variasjons- autoencodere med antagonistisk trening for effektiv syntese. VITS er fremragende for satsvis behandling og anvendelser som krever både kvalitet og hastighet.

Nøkkelfunksjoner

Rask syntese

Ende-til-ende-arkitektur for rask talegenerering.

Partibehandling

Bearbeide flere tekster på en effektiv måte samtidig.

Naturlig tale

VAE+GAN-opplæringen gir naturlig prosodi og rytme.

Flertaler

En enkel modell støtter flere høyttalerrøyster.

Effektiv

Lavt minneavtrykk med god ytelse.

Åpne kildekode

MIT lisensiert for alle brukstilfeller.

Brukstilfeller

Lag satsvis lyd E-læringsplattformer Nyhetslesere Automatiske meldinger IVR-systemer Høyt alkoholinnhold

VIT Voices

View All 109
LJSpeech (English Female)
EN
VCTK Speaker 225 (English Female)
EN
VCTK Speaker 226 (English Male)
EN
VCTK Speaker 227 (English Male)
EN
VCTK Speaker 228 (English Female)
EN
VCTK Speaker 229
EN
VCTK Speaker 230
EN
VCTK Speaker 231
EN
VCTK Speaker 232
EN
VCTK Speaker 233
EN
VCTK Speaker 234
EN
VCTK Speaker 236
EN

Bruksmåte VIT

  1. 1

    Registrer deg gratis

    Opprett en gratis TextToSpeechAI- konto for å få startpoeng.

  2. 2

    Velg en VITS-tale eller høyttaler

    Bla gjennom talebiblioteket og velg en stemme merket med VITS- skiltet. Med VCTK- høyttaleren kan du velge mellom mange forskjellige stemmer.

  3. 3

    Skriv inn teksten

    Skriv inn eller lim inn teksten du vil ha snakket inn i redigeringen. VITS håndterer lange avsnitt godt og er ideell for satsvis og høyt innhold.

  4. 4

    Lag lyd

    Trykk på Lag for å syntesere tale med VITS. Fordi VITS er svært raskt og Standard- nivå (10 kredittvurderinger pr. 1000 tegn), så returnerer resultatene raskt til lav kostnad.

  5. 5

    Last ned eller bruk API

    Last ned den ferdige lyden som MP3, WAV eller OGG, eller ring opp den samme VITS-stemmen gjennom TextToSpeechAI REST API for å automatisere generering i ditt eget program.

VIT API

Generer taleprogrammatisk ved å bruke TextToSpeechAI REST API.

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "VITS leverer en rask, naturlig tale for anvendelser i store serier.",
    "voice": "vits-ljspeech"
  }'

Ofte stilte spørsmål

VITS (Variativ inferens med antagonistisk læring for ende- til- ende tekst- til- tale) er en ende- til- ende nevral TTS- modell som kombinerer en variasjons- autoencoder med antagonistisk GAN- trening. Det gener naturlig lyder i et enkelt gjennomgangsløp, som gjør det raskt og effektivt. Du kan prøve med at VITS er fritt på TextToSpeechAI.

Ja, VITS er åpen kildekode under MIT- lisensen, så den støtter full kommersiell bruk uten begrensninger. Den brukes i stor grad i kommersielle produkter og tjenester. Den TextToSpeechAI koster VIT 10 kreditter pr. 1000 tegn på standardnivået.

TextToSpeechAI tilbyr et stort VITS- bibliotek med flere høyttalere, medregnet VCTK- stemmesettet med dusinvis av forskjellige engelsktalere. En enkelt VITS- modell kan være vert for mange høyttalere, så du kan velge mellom mange forskjellige stemmer uten å bytte motor.

VITS stemmer på TextToSpeechAI er engelsk, tegnet fra LJSpeech og VCTK høyttaleren. Bruk Piper eller Bark- stemmer for andre språk.

VITS er veldig rask, lager tale i sanntid eller raskere på en GPU. Slutt- til- slutt- arkitekturen unngår flere prosesser i andre modeller, derfor passer VITS godt til satsvis og høyvolumsyntese.

Nei, VITS støtter ikke stemmekloning. Den bruker for- trenede flertalermodeller i stedet for å kopiere en mål stemme fra et utvalg. Bruk Klone Voice- verktøyet, som kjører Chatterbox for stemmekloning.

VITS lager lyd av god kvalitet med naturlig prosodi og rytme. Selv om det ikke er på nivå med StyleTTS 2 eller Tortoise, så gir det fremragende kvalitet for hastigheten, spesielt for satsvis behandling.

VITS er minneeffektivt, og trenger typisk bare noen få GB VRAM (rundt 4 GB). Det kjører komfortabelt på GPU- er for forbrukere, og på TextToSpeechAI skjer all opptegning på våre tjenere så du ikke trenger egen maskinvare.

VITS og Piper er både raske og MIT- lisensierte motorer på TextToSpeechAI. Piper er det letteste valget og koster 1 kreditt pr. 1000 tegn, mens VITS (10 kreditter pr. 1000 tegn) tilbyr et stort bibliotek med flere høyttalere (medregnet VCTK) med litt mer naturlig prosodi. Heller ikke støtte for stemmekloning.

VITS er en motor på standardnivå, som koster 10 kreditter pr. 1000 tegn. Bare Piper, med 1 kreditt pr. 1000 tegn, koster mindre.

VITS lager lyd med 22050Hz fra et sted. Gjennom TextToSpeechAI du kan spørre etter MP3, WAV eller OGG- formater, med automatisk konvertering håndtert for deg.

Registrer deg på TextToSpeechAI for å motta gratis startpoeng, og velg så en VITS- stemme, skriv inn teksten og lag lyd. Du kan også få tilgang til VITS gjennom vårt REST- API når du melder deg inn.

Technical Specs

  • Generation Speed Very Fast
  • Output Quality Good
  • Voice Cloning Not Supported
  • Languages 1
  • GPU VRAM 1-2GB
  • Credits/1000 chars 10

Try VIT Now

Generate your first audio free. No credit card required.

Start Free