VITS

Standard

Gyors végkifejletű TTS természetes beszédtel

Very Fast Sebesség
Good Minőség
Nem. Klónozás
1 Nyelvek

About VITS

VITS (Variational Inverence with anversarial learning for end-to-end Text-to-Speech) egy gyors, végponttól végpontig terjedő neurális TTS modell, amely természetes hangzású beszédet generál. Ez egyesíti a variációs autoenkoderek és a hatékony szintézist célzó ellenző képzés. VITS kiválóan alkalmas a gyártási folyamatokra és alkalmazásokra, amelyek minőségre és sebességre egyaránt igényelnek.

Kulcsfontosságú jellemzők

Gyorsszintézis

Vége az építészetnek a gyors beszédekért.

Gy. sz.:

A szövegeket hatékonyan egyszerre kell feldolgozni.

Természetes beszéd

A VAE+GAN képzés természetes proszódiát és ritmust eredményez.

Több hangszóró

Egy modell több hangszóró hangját támogatja.

Hatékony

Alacsony memória lábnyom jó teljesítménysel.

Nyílt forrás

MIT engedélyezve bármilyen felhasználási esetre.

Esetek használata

Gy. sz.: hangnemezés E-tanulási platformok Hírolvasók Automatizált bejelentések IVR rendszerek Nagy sűrűségű tartalom

VITS Voices

View All 109
LJSpeech (English Female)
EN
VCTK Speaker 225 (English Female)
EN
VCTK Speaker 226 (English Male)
EN
VCTK Speaker 227 (English Male)
EN
VCTK Speaker 228 (English Female)
EN
VCTK Speaker 229
EN
VCTK Speaker 230
EN
VCTK Speaker 231
EN
VCTK Speaker 232
EN
VCTK Speaker 233
EN
VCTK Speaker 234
EN
VCTK Speaker 236
EN

Hogyan kell alkalmazni? VITS

  1. 1

    Regisztrálj ingyen!

    Hozzon létre egy ingyenes TextToSpeechAI fiókot, hogy kezdés krediteket kapjon.

  2. 2

    Válasszon VITS hangot vagy hangszórót

    Böngésszen a hangkönyvtár és válassza ki a hang jelölt VITS jelvény. A több hangszórós VITS könyvtár, beleértve a VCTK hangszóró készlet, lehetővé teszi, hogy válasszon a sok különböző hangok.

  3. 3

    Írja be a szöveget

    Írja be vagy illessze be a kívánt szöveget a szerkesztőbe. VITS kezeli a hosszú szakaszokat jól, és ideális a tétel és nagy mennyiségű tartalom.

  4. 4

    Hang generálása

    Kattintson a generáláshoz szintetizálja beszéd VITS. Mivel a VITS nagyon gyors és Standard-tier (10 kredit 1000 karakterenként), eredmények gyorsan visszatérnek alacsony áron.

  5. 5

    Az API letöltése vagy használata

    Töltse le a kész audio MP3, WAV, vagy OGG, vagy hívja ugyanazt a VITS hangot keresztül a TextToSpeechAI REST API automatizálja generáció saját alkalmazás.

VITS API

A beszéd programszerű generálása a TextToSpeechAI REST API használatával.

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "A VITS gyors, természetes beszédet biztosít a nagy volumenű alkalmazásokhoz.",
    "voice": "vits-ljspeech"
  }'

Gyakran ismételt kérdések

VITS (Variational Inference with anversarial learning for end-to-end Text-to-Speech) is a end-to-end neural TTS modell, amely kombinálja a variációs autoencoder és az ellenfél GAN képzés. Ez generál természetes hangzású beszéd egyetlen passz, ami gyors és hatékony. Megpróbálhatja VITS ingyenes TextToSpeechAI.

Igen, a VITS nyílt forráskódú az MIT licenc alatt, így korlátozások nélkül támogatja a teljes kereskedelmi felhasználást. Széles körben használják kereskedelmi termékek és szolgáltatások. A TextToSpeechAI, VITS költségek 10 kredit 1000 karakter a Standard Tier.

TextToSpeechAI kínál egy nagy több hangszórós VITS könyvtár, beleértve a VCTK hangkészlet több tucat különböző angol hangszórók. Egyetlen VITS modell lehet a fogadó sok hangszóró, így lehet választani a különböző hangok nélkül kapcsolja be a motorokat.

A VITS hangok TextToSpeechAI angol, az LJSpeech és VCTK hangszórók. Más nyelvekre, használja Piper vagy Bark hangokat.

A VITS nagyon gyors, valós időben vagy gyorsabban generál beszédeket egy GPU-n. Végtől-végig architektúrája elkerüli a különböző más modellek feldolgozási szakaszait, ezért a VITS jól alkalmas a gyártási és nagy volumenű szintézisre.

Nem, a VITS nem támogatja a hang klónozást, hanem a Chatterboxot működtető Clone Voice eszközt használja, ahelyett, hogy célba vett hangot másolna a mintából.

A VITS jó minőségű hangokat gyárt természetes proszódiával és ritmussal. Bár nem a StyletTS 2 vagy a Tortoise szintjén van, kiváló minőséget kínál a sebességéhez, különösen a gyártási tételek feldolgozásához.

VITS memória-hatékony, jellemzően csak néhány GB VRAM (körülbelül 4GB). Kényelmesen fut a fogyasztó GPU-k, és a TextToSpeechAI minden renderelés történik a szervereinken, így nincs szükség semmilyen hardver saját.

A VITS és Piper gyors, MIT-licensed motorok TextToSpeechAI. Piper a legkönnyebb lehetőség és költségek 1 hitel 1000 karakterenként, míg VITS (10 kredit 1000 karakterenként) kínál egy nagy több hangszórós könyvtár (beleértve a VCTK) valamivel természetesebb proszódiával. Sem támogatja a hang klónozás.

VITS egy szabványos motor, 10 kredit per 1000 karakter. Csak Piper, 1 hitel per 1000 karakter, kevesebbe kerül.

A VITS 22050Hz-en generál hangokat. TextToSpeechAI-en keresztül MP3, WAV vagy OGG formátumokat kérhet, automatikus konverzióval.

Regisztráljon a TextToSpeechAI, hogy kap ingyenes kezdő kreditek, majd válasszon egy VITS hang, írja be a szöveget, és létrehoz egy hang. Ön is hozzáférhet VITS a REST API-val, ha regisztrál.

Technical Specs

  • Generation Speed Very Fast
  • Output Quality Good
  • Voice Cloning Not Supported
  • Languages 1
  • GPU VRAM 1-2GB
  • Credits/1000 chars 10

Try VITS Now

Generate your first audio free. No credit card required.

Start Free