VITS

Standard

Kiire lõpp-lõpp TTS loodusliku kõnega

Very Fast Kiirus
Good Kvaliteet
Ei. Kloonimine
10 Keeled

Info VITS

VITS (Variational Inference with advanced lõpe for end-to-end text-to-Speech) on kiire, otsast lõpuni neuraalne TTS mudel, mis tekitab loomulik kõlav kõne. See ühendab variational autoencoders võistlev koolitus tõhus süntees. VITS on suurepärane partii töötlemise ja rakenduste nõuab nii kvaliteeti ja kiirust.

Põhijooned

Kiire kokkuvõte

Lõpp-to-end arhitektuur kõne kiire põlvkonna.

Partii töötlemine

Töötleb mitut teksti üheaegselt tõhusalt.

Loomulik kõne

VAE+GAN-koolitus annab loomuliku prosoodia ja rütmi.

Mitmehäälne kõlar

Üks mudel toetab mitut kõlari häält.

Tõhus

Vähene mälu jalajälg hea jõudlusega.

Avatud lähtekoodiga

MIT litsentseeritud igaks kasutusjuhtumiks.

Kasutuskastid

Audio genereerimise pakktöötlus E-õppe platvormid Uudiste lugejad Automaatne teadaanne IVR süsteemid Kõrge helitugevus

VITS Voices

View All 109
LJSpeech (English Female)
EN
VCTK Speaker 225 (English Female)
EN
VCTK Speaker 226 (English Male)
EN
VCTK Speaker 227 (English Male)
EN
VCTK Speaker 228 (English Female)
EN
VCTK Speaker 229
EN
VCTK Speaker 230
EN
VCTK Speaker 231
EN
VCTK Speaker 232
EN
VCTK Speaker 233
EN
VCTK Speaker 234
EN
VCTK Speaker 236
EN

Kuidas kasutada VITS

  1. 1

    Registreeru tasuta või proovi demo

    Loo tasuta TextToSpeechAI konto saada starter krediiti, või kasutada on-lehekülje demo kuulda VITS enne registreerumist.

  2. 2

    Vali VITS hääl või kõlar

    Vaata hääleraamatut ja vali VITS-märgiga hääl. Mitmehäälne VITS-i teek, kaasa arvatud VCTK-i kõneleja, võimaldab valida paljudest erinevatest häältest.

  3. 3

    Sisesta tekst

    Kirjuta või aseta tekst, mida soovid redaktorisse rääkida. VITS tegeleb pikkade lõikudega hästi ning sobib ideaalselt partii ja suure mahuga sisu jaoks.

  4. 4

    Audio genereerimine

    Klõpsa kõne sünteesimiseks VITS-iga. Kuna VITS on väga kiire ja standardtasemel (10 krediiti 1000 tähemärgi kohta), siis on tulemused kiiresti ja odavalt tagasi.

  5. 5

    API allalaadimine või kasutamine

    Lae valmis heli MP3, WAV, või OGG, või helista sama VITS hääl TextToSpeechAI REST API automatiseerida põlvkonna oma rakenduses.

VITS API

Loo kõne programmeeritult kasutades TextToSpeechAI REST API.

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "VITS pakub kiiret loomulikku kõnet suuremahulistele rakendustele.",
    "voice": "vits-ljspeech"
  }'

Korduma kippuvad küsimused

VITS (Variational Inference with advariarial studies for end-to-end text-to-Speech) on lõputu neuraal TTS mudel, mis ühendab variational autoencoder koos võistlevate GAN koolitus. See tekitab loomulik kõlav kõne ühes pass, mis teeb selle kiire ja tõhus. Võite proovida VITS tasuta TextToSpeechAI.

Jah, VITS on avatud lähtekoodiga MIT litsentsi, nii et see toetab täielikku ärilist kasutamist piiranguteta. Seda kasutatakse laialdaselt kommertstoodete ja teenuste. TextToSpeechAI, VITS maksab 10 krediiti 1000 tähemärki Standard tase.

TextToSpeechAI pakub suurt mitme kõlariga VITS raamatukogu, sealhulgas VCTK hääl seatud kümneid erinevaid inglise kõlarid. Üks VITS mudel võib võõrustada palju kõlarid, nii et saate valida paljude erinevate häälte ilma mootorid.

VITS-i toetus sõltub koolitatud mudelist. Ühised VITS-mudelid hõlmavad inglise, hiina, jaapani, korea, saksa, prantsuse ja muid peamisi keeli, millel on mitmekeelse inglise keele oskus VCTK andmekogumist.

VITS on väga kiire, tekitades kõne reaalajas või kiiremini GPU. Selle otsast lõpuni arhitektuuri väldib mitu töötlemise etapid teiste mudelite, mistõttu VITS sobib hästi partii ja suuremahulise sünteesi.

Ei, VITS ei toeta hääle kloonimist. Selle asemel, et kopeerida proovist sihthäält, kasutatakse eeltreenitud mitmekõne mudeleid. TextToSpeechAI. aastal kloonimiseks kasuta F5-TTS või GPT-Sovetti.

VITS toodab kvaliteetset heli loomuliku prosoodia ja rütmiga. Kuigi see ei ole tasemel StyleTTS 2 või Tortoise, pakub see suurepärast kvaliteeti oma kiirust, eriti partii töötlemise.

VITS on mälutõhus, tavaliselt vaja ainult mõned GB VRAM (umbes 4GB). See töötab mugavalt tarbija GPU, ja TextToSpeechAI kõik renderdamine toimub meie serverid, nii et sa ei vaja riistvara oma.

VITS ja Piper on nii kiire, MIT-litsentsiga Standard-tier mootorid TextToSpeechAI. Piper on kergeim ja kiireim võimalus, samas kui VITS pakub suurt mitme-kõlar raamatukogu (sh VCTK) veidi loomulikum prosoodia. Samuti ei toeta hääl kloonimine.

VITS on standardtaseme mootor, mis maksab 10 krediiti 1000 tähemärgi kohta. See on meie madalaim hinnatase tänu VITS-mudeli tõhusale ja kiirele iseloomule.

VITS genereerib audio 22050Hz natively. Läbi TextToSpeechAI saate taotleda MP3, WAV, või OGG formaate, automaatse konverteerimise töödeldud teile.

Registreeru TextToSpeechAI saada tasuta starter krediiti, siis vali VITS hääl, sisesta oma teksti ja luua heli. Võite kasutada ka demo kuulda VITS enne konto loomist, ja juurdepääsu VITS kaudu meie REST API kui olete registreerunud.

Technical Specs

  • Generation Speed Very Fast
  • Output Quality Good
  • Voice Cloning Not Supported
  • Languages 10
  • GPU VRAM 1-2GB
  • Credits/1000 chars 10

Try VITS Now

Generate your first audio free. No credit card required.

Start Free