Dia

Ultra

TTS orientované na dialog s hlasovým klonováním a neverbálními zvuky

Medium Rychlost
Excellent Kvalita
Ano. Klonování
1 Jazyky

O aplikaci Dia

Dia od Nari Labs je parametrem 1,6B zaměřeným na dialog text-to-speech model. Vyniká při vytváření přirozené konverzační řeč s podporou nonverbální zvuky jako smích, vzdych a kašel. Dia podporuje multi-výkřikové library a hlasové klonování od 5-10 sekund referenčního zvuku, což je ideální pro vytváření realistických rozhovorů a hlasové postavy.

Klíčové vlastnosti

Generace dialogu

Vytvořit přirozené multi-mluvčí rozhovory s výraznými hlasy a obrat-ber.

Neverbální zvuky

Přidejte [smích], [povzdechne], [kašle], (vzdechy) pro přirozený paralinguistický výraz.

Hlasové klonování

Klonujte hlas z 5-10 sekund referenčního zvuku pro osobní projev.

Přírodní konverzace

1.6B parametry produkují vysoce přírodní konverzační prosodu a intonaci.

Pouzdra na použití

Generace dialogu a rozhovorů Výroba audioknih s více znaky Hlasy postavy hry Podcast a tvorba obsahu

Jak se používá Dia

  1. 1

    Zaregistrujte se zdarma nebo otevřete demo

    Vytvořte zdarma TextToSpeechAI účet pro nárok na startovací kredity, nebo otevřít demo no-signup vyzkoušet Dia dialog hned.

  2. 2

    Vyberte Dia motor

    V palubní desce TTS vyberte Dia ze seznamu motorů. Dia je model s dialogem orientovaný na ultra-tier s podporou více reproduktorů a hlasového clonění.

  3. 3

    Napsat dialogový skript s značkami

    Složte svůj rozhovor pomocí [S1] a [S2], aby označil každý řečník otočit, a kapka v nonverbal značky, jako [smích], [povzdechne], [kašle], nebo (vzdechy) kde chcete přírodní reakce.

  4. 4

    Generovat zvuk

    Kliknutím na tlačítko generovat odeslat svůj Dia skript do našich hostovaných GPU. Dia překreslí dvou-speaker dialog s přejímáním a vaše neverbal značky do jediného zvukového souboru.

  5. 5

    Stáhnout nebo zavolat API

    Stáhněte si hotový dialog ve zvoleném formátu, nebo jej automatizujte tím, že napíšete stejný skript [S1]/[S2] do API TextToSpeechAI s vaším účtem.

Dia API

Generovat řeč programově pomocí TextToSpeechAI REST API.

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "[S1] Ahoj tam! Jak se dnes máte? [S2] Vedu si skvěle, díky za optání!",
    "voice": "en_US-lessac-medium"
  }'

Často kladené otázky

Dia je parametrem 1,6B orientovaným na dialog text-to-speech modelem z Nari Labs. Specializuje se na generování přirozené konverzační řeči s podporou pro více reproduktorů, nonverbální zvuky a hlasové klonování.

Ano, Dia má plnou licenci Apache 2.0 - jak kód, tak i hmotnost modelu. Lze ji volně používat v komerčních aplikacích.

V současné době Dia podporuje pouze angličtinu. Model je optimalizován pro přírodní anglicky konverzační řeč.

Dia vyžaduje přibližně 10GB VRAM pro model parametru 1.6B. GPU s minimálně 12GB je doporučeno pro pohodlný provoz. Na TextToSpeechAI to vše běží na našich hostovaných GPU, takže nepotřebujete žádný vlastní hardware.

Ano - dialog je přesně to, pro co je Dia postavena. Střídáním [S1] a [S2] se otáčí ve vašem skriptu, Dia TTS produkuje plynulý dvou-mluvčí rozhovor s výraznými hlasy a realistickým zatáčením, kterého je těžší dosáhnout pomocí jedno-reproduktorů TTS modelů.

Předepište každý řádek vašeho skriptu [S1] nebo [S2] označit, kdo mluví. Dia přiřadí konzistentní hlas ke každému znaménku a přepínače mezi nimi, jak se konverzace pohybuje, tak [S1] a [S2] jednat jako dva znaky ve vašem dialogu.

Ano. Dia podporuje klonování hlasu zhruba z 5-10 sekund čistého referenčního zvuku, takže vám umožní použít specifický hlas pro reproduktor. Můžete kombinovat klonování s [S1]/[S2] tagy, takže každý znak v dialogu zní jako hlas, který jste naklonovali.

Dia vykresluje [smích], [povzdechne], [kašle] a (vzdechy) jako přirozené paralinguistické zvuky, které jsou v sobě zapleteny do řeči, spíše než mluvená slova. Umístěte značku, kde chcete reakci - například "[S1] To je k popukání [smích]" - aby se dialog cítil více lidsky.

Dia i Bark podporují expresivní neverbální zvuky, ale Dia je účelně postavena pro více reproduktorový dialog s [S1]/[S2] braní a hlasové klonování. Vyberte Dia pro realistické rozhovory a charakter práce; Bark je lepší, když potřebujete širší jazykové pokrytí v jednohlasém vyprávění.

Dia je ultra-tier motor, takže stojí 50 kreditů na 1000 znaků generované řeči. ultra tier odráží větší 1.6B model a ~10GB paměti GPU, které používá pro vysoce kvalitní dialog.

Ano. Nové TextToSpeechAI účty zahrnují zdarma starter kredity, a tam je demo můžete spustit bez přihlášení. To je dost na vytvoření krátké Dia dialog s [S1]/[S2] značky před rozhodnutím o placeném plánu.

Ano. Jakmile máte API žeton ze stránky vašeho účtu, můžete odeslat Dia dialog skripty - včetně [S1]/[S2] otáčí a značky jako [smích] - do API TextToSpeechAI REST a stáhnout výsledný audio programově.

Technical Specs

  • Generation Speed Medium
  • Output Quality Excellent
  • Voice Cloning Supported
  • Languages 1
  • GPU VRAM 10GB
  • Credits/1000 chars 50

Try Dia Now

Generate your first audio free. No credit card required.

Start Free