VITS

Standard

Rychlé ukončení TTS s přírodním projevem

Very Fast Rychlost
Good Kvalita
Ne. Klonování
1 Jazyky

O aplikaci VITS

VITS (Variational Inference with adversarial learning for end-to-end Text-to-Speech) je rychlý, konečný neurální TTS model, který vytváří přirozený zvuk řeči. Spojuje variace autoenkodéry s adversarial školením pro efektivní syntézu. VITS je vynikající pro dávkové zpracování a aplikace vyžadující jak kvalitu, tak rychlost.

Klíčové vlastnosti

Rychlá syntéza

Konec-konec architektura pro rychlé vytváření řeči.

Zpracování šarže

Efektivně zpracováváme více textů současně.

Přírodní mluva

Výcvik VAE+GAN vytváří přírodní prosodu a rytmus.

Víceproudový reproduktor

Jeden model podporuje více hlasových mluvčích.

Efektivní

Nízká paměťová stopa s dobrým výkonem.

Otevřít zdroj

MIT je držitelem licence pro případ jakéhokoliv použití.

Pouzdra na použití

Generace hlasitosti E-Učení platformy Čtečky novinek Automatická oznámení Systémy IVR Vysoký obsah volumu

VITS Voices

View All 109
LJSpeech (English Female)
EN
VCTK Speaker 225 (English Female)
EN
VCTK Speaker 226 (English Male)
EN
VCTK Speaker 227 (English Male)
EN
VCTK Speaker 228 (English Female)
EN
VCTK Speaker 229
EN
VCTK Speaker 230
EN
VCTK Speaker 231
EN
VCTK Speaker 232
EN
VCTK Speaker 233
EN
VCTK Speaker 234
EN
VCTK Speaker 236
EN

Jak se používá VITS

  1. 1

    Zaregistrujte se zdarma

    Vytvořte si zdarma TextToSpeechAI účet pro získání startovní kreditů.

  2. 2

    Vyberte VITS hlas nebo reproduktor

    Prohlédněte si hlasovou knihovnu a zvolte hlas označený odznakem VITS. Multi-speaker VITS knihovna, včetně VCTK reproduktor set, vám umožní vybrat z mnoha různých hlasů.

  3. 3

    Zadejte svůj text

    Zadejte nebo vložte text, který chcete do editoru mluvit. VITS dobře zvládá dlouhé pasáže a je ideální pro dávkové a velkoobjemové obsahy.

  4. 4

    Generovat zvuk

    Klikněte na tlačítko generovat syntetizovat řeč s VITS. Protože VITS je velmi rychlé a Standard-tier (10 kreditů na 1000 znaků), výsledky se rychle vrátí za nízké náklady.

  5. 5

    Stáhnout nebo použít API

    Stáhněte si hotový zvuk jako MP3, WAV, nebo OGG, nebo volejte stejný VITS hlas přes TextToSpeechAI REST API automatizovat generaci ve své vlastní aplikaci.

VITS API

Generovat řeč programově pomocí TextToSpeechAI REST API.

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "VITS přináší rychlou, přirozenou řeč pro velkoobjemové aplikace.",
    "voice": "vits-ljspeech"
  }'

Často kladené otázky

VITS (Variational Inference with adversarial learning for end-to-end Text-to-Speech) je model koncového nervu TTS, který kombinuje variační autoenkodér s adversarial GAN školení. Vytváří přirozený zvuk řeči v jednom průchodu, který dělá to rychle a efektivně. Můžete vyzkoušet VITS zdarma na TextToSpeechAI.

Ano, VITS je otevřený zdroj pod licencí MIT, takže podporuje úplné komerční využití bez omezení. Je široce používán v komerčních produktech a službách. Na TextToSpeechAI, VITS stojí 10 kreditů na 1000 znaků na standardní úrovni.

TextToSpeechAI nabízí velkou multi-reproduktorovou VITS knihovnu, včetně hlasové VCTK sady s desítkami různých anglických reproduktorů. Jeden model VITS může hostit mnoho reproduktorů, takže si můžete vybrat z mnoha různých hlasů bez spínání motorů.

Hlasy VITS na TextToSpeechAI jsou anglicky, čerpané ze sad reproduktorů LJSpeech a VCTK. Pro jiné jazyky použijte Piper nebo Bark hlasy.

VITS je velmi rychlý, generuje řeč v reálném čase nebo rychleji na GPU. Jeho konečná architektura se vyhýbá několika fázím zpracování jiných modelů, a proto je VITS vhodný pro dávkové a velkoobjemové syntézy.

Ne, VITS nepodporuje klonování hlasu. Používá předtrénované multi-reproduktorové modely, spíše než kopírování cílového hlasu ze vzorku. Pro klonování hlasu použijte nástroj Clone Voice, který běží Chatterbox.

VITS produkuje kvalitní zvuk s přírodním prosodiem a rytmem. I když není na úrovni StyletTS 2 nebo Tortoise, nabízí vynikající kvalitu pro svou rychlost, zejména pro zpracování šarží.

VITS je paměťově efektivní, obvykle potřebuje jen několik GB VRAM (kolem 4GB). Je pohodlně provozován na spotřebitelských GPU a na TextToSpeechAI se na našich serverech odehrává všechna renderování, takže nepotřebujete žádný vlastní hardware.

VITS i Piper jsou oba rychlé, MIT-licencované motory na TextToSpeechAI. Piper je nejlehčí možnost a stojí 1 úvěr na 1000 znaků, zatímco VITS (10 kreditů na 1000 znaků) nabízí velkou multi-reproduktor knihovna (včetně VCTK) s mírně přirozenější prosodou. Ani podporuje klonování hlasu.

VITS je standardní motor, který stojí 10 kreditů na 1000 znaků. Jen Piper, při 1 úvěru na 1000 znaků, stojí méně.

VITS generuje zvuk na 22050Hz nativně. Přes TextToSpeechAI můžete požádat MP3, WAV, nebo OGG formáty, s automatickou konverzi zvládnuté pro vás.

Zaregistrujte se na TextToSpeechAI získat zdarma starter kreditů, pak vyberte VITS hlas, zadejte svůj text a vygenerujte zvuk. Můžete také přístup VITS prostřednictvím našeho REST API, jakmile se zaregistrujete.

Technical Specs

  • Generation Speed Very Fast
  • Output Quality Good
  • Voice Cloning Not Supported
  • Languages 1
  • GPU VRAM 1-2GB
  • Credits/1000 chars 10

Try VITS Now

Generate your first audio free. No credit card required.

Start Free