VITS

Standard

Kiire lõpp-lõpp TTS loodusliku kõnega

Very Fast Kiirus
Good Kvaliteet
Ei. Kloonimine
1 Keeled

Info VITS

VITS (Variational Inference with advanced lõpe for end-to-end text-to-Speech) on kiire, otsast lõpuni neuraalne TTS mudel, mis tekitab loomulik kõlav kõne. See ühendab variational autoencoders võistlev koolitus tõhus süntees. VITS on suurepärane partii töötlemise ja rakenduste nõuab nii kvaliteeti ja kiirust.

Põhijooned

Kiire kokkuvõte

Lõpp-to-end arhitektuur kõne kiire põlvkonna.

Partii töötlemine

Töötleb mitut teksti üheaegselt tõhusalt.

Loomulik kõne

VAE+GAN-koolitus annab loomuliku prosoodia ja rütmi.

Mitmehäälne kõlar

Üks mudel toetab mitut kõlari häält.

Tõhus

Vähene mälu jalajälg hea jõudlusega.

Avatud lähtekoodiga

MIT litsentseeritud igaks kasutusjuhtumiks.

Kasutuskastid

Audio genereerimise pakktöötlus E-õppe platvormid Uudiste lugejad Automaatne teadaanne IVR süsteemid Kõrge helitugevus

VITS Voices

View All 109
LJSpeech (English Female)
EN
VCTK Speaker 225 (English Female)
EN
VCTK Speaker 226 (English Male)
EN
VCTK Speaker 227 (English Male)
EN
VCTK Speaker 228 (English Female)
EN
VCTK Speaker 229
EN
VCTK Speaker 230
EN
VCTK Speaker 231
EN
VCTK Speaker 232
EN
VCTK Speaker 233
EN
VCTK Speaker 234
EN
VCTK Speaker 236
EN

Kuidas kasutada VITS

  1. 1

    Registreeru tasuta

    Loo tasuta TextToSpeechAI konto saada starter krediiti.

  2. 2

    Vali VITS hääl või kõlar

    Vaata hääleraamatut ja vali VITS-märgiga hääl. Mitmehäälne VITS-i teek, kaasa arvatud VCTK-i kõneleja, võimaldab valida paljudest erinevatest häältest.

  3. 3

    Sisesta tekst

    Kirjuta või aseta tekst, mida soovid redaktorisse rääkida. VITS tegeleb pikkade lõikudega hästi ning sobib ideaalselt partii ja suure mahuga sisu jaoks.

  4. 4

    Audio genereerimine

    Klõpsa kõne sünteesimiseks VITS-iga. Kuna VITS on väga kiire ja standardtasemel (10 krediiti 1000 tähemärgi kohta), siis on tulemused kiiresti ja odavalt tagasi.

  5. 5

    API allalaadimine või kasutamine

    Lae valmis heli MP3, WAV, või OGG, või helista sama VITS hääl TextToSpeechAI REST API automatiseerida põlvkonna oma rakenduses.

VITS API

Loo kõne programmeeritult kasutades TextToSpeechAI REST API.

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "VITS pakub kiiret loomulikku kõnet suuremahulistele rakendustele.",
    "voice": "vits-ljspeech"
  }'

Korduma kippuvad küsimused

VITS (Variational Inference with advariarial studies for end-to-end text-to-Speech) on lõputu neuraal TTS mudel, mis ühendab variational autoencoder koos võistlevate GAN koolitus. See tekitab loomulik kõlav kõne ühes pass, mis teeb selle kiire ja tõhus. Võite proovida VITS tasuta TextToSpeechAI.

Jah, VITS on avatud lähtekoodiga MIT litsentsi, nii et see toetab täielikku ärilist kasutamist piiranguteta. Seda kasutatakse laialdaselt kommertstoodete ja teenuste. TextToSpeechAI, VITS maksab 10 krediiti 1000 tähemärki Standard tase.

TextToSpeechAI pakub suurt mitme kõlariga VITS raamatukogu, sealhulgas VCTK hääl seatud kümneid erinevaid inglise kõlarid. Üks VITS mudel võib võõrustada palju kõlarid, nii et saate valida paljude erinevate häälte ilma mootorid.

VITS hääled TextToSpeechAI on inglise keeles, mis on tõmmatud LJSpeechi ja VCTK kõlarite komplektist. Teiste keelte puhul kasuta Piperi või Barki hääli.

VITS on väga kiire, tekitades kõne reaalajas või kiiremini GPU. Selle otsast lõpuni arhitektuuri väldib mitu töötlemise etapid teiste mudelite, mistõttu VITS sobib hästi partii ja suuremahulise sünteesi.

Ei, VITS ei toeta hääle kloonimist. See kasutab pigem eelnevalt koolitatud mitmekõnelise mudeli kui kopeerib proovist sihthääle. Hääle kloonimiseks kasutage Clone Voice'i tööriista, mis töötab Chatterbox'is.

VITS toodab kvaliteetset heli loomuliku prosoodia ja rütmiga. Kuigi see ei ole tasemel StyleTTS 2 või Tortoise, pakub see suurepärast kvaliteeti oma kiirust, eriti partii töötlemise.

VITS on mälutõhus, tavaliselt vaja ainult mõned GB VRAM (umbes 4GB). See töötab mugavalt tarbija GPU, ja TextToSpeechAI kõik renderdamine toimub meie serverid, nii et sa ei vaja riistvara oma.

VITS ja Piper on nii kiire, MIT-litsentsiga mootorid TextToSpeechAI. Piper on kergeim võimalus ja maksab 1 krediit 1000 tähemärki, samas kui VITS (10 krediiti 1000 tähemärgi kohta) pakub suurt mitme-kõlar raamatukogu (sh VCTK) veidi loomulikum prosoodia. Samuti ei toeta hääl kloonimine.

VITS on standardtaseme mootor, mis maksab 10 krediiti 1000 tähemärgi kohta. Ainult Piper, 1 krediit 1000 tähemärgi kohta, maksab vähem.

VITS genereerib audio 22050Hz natively. Läbi TextToSpeechAI saate taotleda MP3, WAV, või OGG formaate, automaatse konverteerimise töödeldud teile.

Registreeruge TextToSpeechAI saada tasuta starter krediiti, seejärel valige VITS hääl, sisestage oma teksti ja luua heli. Samuti saab kasutada VITS kaudu meie REST API kui olete registreerunud.

Technical Specs

  • Generation Speed Very Fast
  • Output Quality Good
  • Voice Cloning Not Supported
  • Languages 1
  • GPU VRAM 1-2GB
  • Credits/1000 chars 10

Try VITS Now

Generate your first audio free. No credit card required.

Start Free