Диа

Ultra

Диалогово ориентиран TTS с гласово клониране и невербални звуци

Medium Скорост
Excellent Качество
Да. Клониране
1 Езици

За Диа

Dia by Nari Labs е модел 1.6B с фокус на диалог на текст-то-шпик. Тя е отлична при генерирането на естествена разговорна реч с подкрепа на невербални звуци като смях, въздишки и кашлица. Dia поддържа мултизвук диалог и клониране на глас от 5-10 секунди референтен звук, което го прави идеален за създаване на реалистични разговори и характерни гласове.

Ключови характеристики

Създаване на диалог

Генерирайте естествени мулти-говорители разговори с различни гласове и превръщане.

Невербални звукове

Добавете [смее], [въздишки], [кашлица], (въздишки) за естествен паралингуистическо изразяване.

Гласово клониране

Клонирайте всеки глас от 5-10 секунди референтна звукова връзка за персонализирана реч.

Естествен разговор

1.6B параметри произвеждат високо естествени разговорни прозиинтнация.

Случаи на употреба

Поколение на диалог и разговор Производство на аудиокниги с множество символи Гласове на играта Подкаст и създаване на съдържание

Как да използвате Диа

  1. 1

    Запишете се безплатно или отворите демото

    Създайте безплатен TextToSpeechAI акаунт, за да поискате стартер кредити, или да отворите демо без регистрация, за да опитате Диа диалог веднага.

  2. 2

    Избор на двигател Dia

    В TTS табло изберете Dia от списъка на двигателите. Dia е диалог-ориентиран, ултра-тие модел с многоговорител и глас-клониране подкрепа.

  3. 3

    Запис на скрипт с тагове

    Съставете разговора си с помощта на [S1] и [S2], за да отбележите всеки оратор завъртане, и да падне в невербални тагове като [смее], [въздишки], [кашлица] или (въздишки) където искате естествени реакции.

  4. 4

    Създаване на звука

    Кликнете върху генериране, за да изпратите вашия диа скрипт до нашия домакин GPUs. Dia прави двузвучен диалог с изобличаване и вашите невербални тагове в един аудио файл.

  5. 5

    Изтеглете или се обадите на API

    Изтеглете окончателния диалог във вашия избран формат или го автоматично публикувайте същият [S1]/[S2] скрипт на TextToSpeechAI API със вашия акаунт.

Диа АПИ

Генериране на речна програма с помощта на TextToSpeechAI REST API.

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "Здравейте, как сте днес?",
    "voice": "en_US-lessac-medium"
  }'

Често задавани въпроси

Dia е 1.6B параметър, ориентиран на диалог текстово-то-шпик модел от Nari Labs. Тя е специализирана в генерирането на естествена разговорна реч с подкрепа за многократни говорители, невербални звуци и клониране на гласа.

Да, Диа е напълно апачи 2.0 лицензирани - както код, така и модел тежести. Тя може да се използва свободно в търговски приложения.

В момента Dia поддържа само английски. Моделът е оптимизален за естествен английски разговор.

Dia изисква приблизително 10GB VRAM за своя модел на параметр 1.6B. GPU с поне 12GB се препоръчва за комфортна работа. На TextToSpeechAI от това се провеждат всички на нашите домакинани GPU, така че не се нуждаете от хардуер от собствена.

Да - диалогът е точно за какво е изграден Диа. С промяна [S1] и [S2] завърта във вашия сценарий, Dia TTS произвежда течен двуговорител с различни гласове и реалистичен обратен процес, който е по-трудно да се постигне с единични модели TTS.

Префикс на всеки ред от вашия скрипт с [S1] или [S2], за да отбележите кой говори. Dia присвоява последователен глас на всеки таг и превключва между тях, докато разговорът се движи, така че [S1] и [S2] действат като двата символа в диалога ви.

Да. Dia поддържа клониране на гласа от около 5-10 секунди чист референтен звук, позволявайки ви повторно да използвате специфичен глас за говорител. Можете да комбинирате клониране с [S1]/[S2] таго всеки символ в диалог звучи като гласът, който клонирате.

Диа прави [смее се], [въздишки], [кашлица] и (въздишки) като естествени паралингуистичен звук в речта, а не говорещи думи. Поставете етикет, където искате реакцията - например "[S1] Това е смешно [смее се]" - да направите диалогът да се чувства по-човешко.

И Диа и Барк подкрепят изразителни невербални звуци, но Диа е изграден за многоговорителски диалог с [S1]/[S2] обръщане на глас и клониране. Изберете Диа за реалистичен двуличен разговор и работа с характер; Барк е по-добре, когато се нуждаете от по-широко езиково покритие в едногласна разказване.

Dia е ултра-тиер двигател, така че струва 50 кредита на 1000 символа на генерирана реч. Ултра-тил отразява по-големия 1.6B модел и ~10GB на GPU паметта, която използва за висококачествено диалог.

Да. Нови TextToSpeechAI акаунти включват безплатни стартер кредитима демо можете да се стартира без да се регистрира. Това е достатъчно за създаване на къс Диа диалог с [S1]/[S2] тагове преди да решите за платен план.

Да. След като имате API жетон от вашата страница на сметката, можете да представите Dia dialog скрипти - включително [S1]/[S2] завъртания и етикети като [смее се] - на TextToSpeechAI REST API и изтеглите резултатите аудио програмно.

Technical Specs

  • Generation Speed Medium
  • Output Quality Excellent
  • Voice Cloning Supported
  • Languages 1
  • GPU VRAM 10GB
  • Credits/1000 chars 50

Try Диа Now

Generate your first audio free. No credit card required.

Start Free