দিন

Ultra

ভয়েস ক্লোনিং এবং অবাক্যগত শব্দ সহ ডায়ালগ-উদ্দেশ্যক TTS

Medium গতি
Excellent গুণমান
হ্যাঁ ক্লোনিং
1 ভাষা

পরিচিতি দিন

ing the ability to generate dialogues from 1000-1500 characters, and is capable of generating 1000-2000 characters per second. Dia is the first text-to-speech model to use the 1.6B parameter, and is the first text-to-speech model to use the 1.6B parameter. Dia is the first text-to-speech model to use the 1.6B parameter,

প্রধান বৈশিষ্ট্য

ডায়ালগ তৈরি করো

আলাদা কণ্ঠ এবং ধাপে ধাপে গ্রহণের সাথে প্রাকৃতিক মাল্টি-স্পিকার কথোপকথন তৈরি করুন।

অবাক্যগত শব্দ

স্বাভাবিক ভাষাগত অভিব্যক্তির জন্য [হাসি], [শ্বাসকষ্ট], [কাশির শব্দ], (শ্বাসকষ্ট) যোগ করুন।

শব্দের ক্লোন

ব্যক্তিগতকৃত কথা বলার জন্য রেফারেন্স অডিও থেকে ৫-১০ সেকেন্ডের যেকোন শব্দ ক্লোন করুন।

স্বাভাবিক কথাবার্তা

১.৬বি প্যারামিটার উচ্চ প্রাকৃতিক কথোপকথন প্রসডি এবং ইটোনেশন উৎপাদন করে।

ব্যবহারের ক্ষেত্রে

ডায়ালগ এবং কথোপকথন উৎপাদন একাধিক অক্ষর সহ অডিওবই উৎপাদন খেলার চরিত্রের শব্দ পডকাস্ট এবং বিষয়বস্তু সৃষ্টি

ব্যবহারের নিয়ম দিন

  1. 1

    বিনামূল্যে নিবন্ধন করুন অথবা ডেমো খুলুন

    Create a free TextToSpeechAI account to claim your starter credits, or open the no-signup demo to try Dia dialogue right away.

  2. 2

    Dia ইঞ্জিন নির্বাচন করুন

    TTS ড্যাশবোর্ডে ইঞ্জিন তালিকা থেকে Dia নির্বাচন করুন। Dia হল ডায়ালগ-অনুকূল, বহু-স্পিকার এবং ভয়েস-ক্লোনিং সমর্থন সহ অতিরিক্ত-স্তর মডেল।

  3. 3

    ট্যাগ সহ একটি ডায়ালগ স্ক্রিপ্ট লিখুন

    প্রতিটি বক্তার বার্তা চিহ্নিত করতে [S1] এবং [S2] ব্যবহার করে আপনার কথাবার্তা লিখুন এবং অবাক্যগত ট্যাগ যেমন [হাসি], [শ্বাস], [কাশি] অথবা (শ্বাসকষ্ট) যেখানে আপনি স্বাভাবিক প্রতিক্রিয়া চান সেখানে ছেড়ে দিন।

  4. 4

    অডিও তৈরি করুন

    আমাদের হোস্টকৃত GPU-তে Dia স্ক্রিপ্ট প্রেরণ করতে তৈরি করুন ক্লিক করুন। Dia টুর্নামেন্ট-এর সাথে দুই স্পিকারের ডায়ালগ এবং আপনার অবাক্যগত ট্যাগগুলিকে একটি অডিও ফাইলে রূপান্তর করে।

  5. 5

    API ডাউনলোড অথবা কল করুন

    আপনার পছন্দের ফরম্যাটে সম্পূর্ণ ডায়ালগ ডাউনলোড করুন, অথবা আপনার অ্যাকাউন্ট টোকেন সহ TextToSpeechAI API-এ একই [S1]/[S2] স্ক্রিপ্ট পোস্ট করে স্বয়ংক্রিয়ভাবে এটি সম্পন্ন করুন।

দিন অ্যাপলিকেশন প্রযুক্তিগত তথ্যের সংগ্রহস্থল (API)

TextToSpeechAI REST API ব্যবহার করে প্রোগ্রামিং দ্বারা বাক্যের উৎপাদন করুন।

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "[এস১] হ্যালো! আজকে আপনারা কেমন আছেন? [হাসি] [এস২] আমি খুব ভাল আছি, জিজ্ঞাসা করার জন্য ধন্যবাদ!",
    "voice": "en_US-lessac-medium"
  }'

প্রায়শ জিজ্ঞাসিত প্রশ্ন

Dia Nari Labs থেকে একটি ১.৬ বিট প্যারামিটার ডায়ালগ-উদ্দেশ্যিত টেক্সট-টু-স্পিক মডেল। এটি একাধিক স্পিকার, অবাক্যগত শব্দ এবং ভয়েস ক্লোনিং সমর্থন সহকারে প্রাকৃতিক কথোপকথন ভাষা তৈরিতে বিশেষজ্ঞ।

হ্যাঁ, Dia সম্পূর্ণভাবে Apache 2.0-এর লাইসেন্সপ্রাপ্ত - কোড এবং মডেল উভয়ই। এটি বাণিজ্যিক অ্যাপ্লিকেশনে মুক্তভাবে ব্যবহার করা যেতে পারে।

বর্তমানে Dia শুধুমাত্র ইংরেজি সমর্থন করে । মডেলটি স্বাভাবিক ইংরেজি কথোপকথনের জন্য উন্নত করা হয়েছে ।

Dia requires approximately 10GB of VRAM for its 1.6B parameter model. A GPU with at least 12GB is recommended for comfortable operation. On TextToSpeechAI all of this runs on our hosted GPUs, so you do not need any hardware of your own.

হ্যাঁ - ডায়ালগ হচ্ছে ঠিক যে Dia তৈরি করা হয়েছে জন্য । আপনার স্ক্রিপ্ট মধ্যে বদলে [S1] এবং [S2] ধাক্কা দিয়ে, Dia TTS একটি ঝরনা দুই- স্পিকার কথাবার্তা সঙ্গে আলাদা কণ্ঠস্বর এবং বাস্তবিক ধাক্কা- নেওয়া, যা একক- স্পিকার TTS মডেল সঙ্গে অর্জন কঠিন.

আপনার স্ক্রিপ্ট-এর প্রতিটি লাইন [S1] অথবা [S2] দ্বারা পূর্ববর্তী চিহ্নিত করুন যে কে কথা বলছে। Dia প্রতিটি ট্যাগকে একটি স্থায়ী কন্ঠ নির্ধারণ করে এবং কথাবার্তা চলাকালীন তাদের মধ্যে পরিবর্তন করে, তাই [S1] এবং [S2] আপনার ডায়ালগের দুইটি অক্ষর হিসাবে কাজ করে।

হ্যাঁ। Dia প্রায় ৫-১০ সেকেন্ডের পরিষ্কার রেফারেন্স অডিও থেকে শব্দ ক্লোনিং সমর্থন করে, আপনাকে স্পিকারের জন্য একটি নির্দিষ্ট শব্দ পুনরায় ব্যবহার করতে দেয়। আপনি [S1]/[S2] ট্যাগগুলির সাথে ক্লোনিং একত্রিত করতে পারেন যাতে ডায়ালগের প্রতিটি অক্ষর আপনার ক্লোন করা শব্দের মতো শোনায়।

ডায়া [হাসি], [শ্বাসকষ্ট], [কাশি] এবং (শ্বাসকষ্ট) শব্দের পরিবর্তে স্বাভাবিক শব্দের মতো শব্দের মধ্যে ঢুকিয়ে দেয়। যেখানে আপনি প্রতিক্রিয়া চান সেখানে একটি ট্যাগ স্থাপন করুন - উদাহরণস্বরূপ "[S1] এটা মজার [হাসি]" - যাতে কথাবার্তাটি আরও মানবিক অনুভূতি তৈরি করে।

Dia এবং Bark উভয়ই অবাচক শব্দ সমর্থন করে, কিন্তু Dia [S1]/[S2] বার গ্রহণ এবং ভয়েস ক্লোনিং সহ বহু-স্পিকার ডায়ালগ জন্য উদ্দেশ্য নির্মিত। বাস্তব দুজনের কথাবার্তা এবং চরিত্র কাজের জন্য Dia বেছে নিন; Bark একটি ভাল ফিট যখন আপনার একক-কণ্ঠের বর্ণনাতে বিস্তৃত ভাষা কভারেজ প্রয়োজন।

Dia একটি আল্ট্রা-টিয়ার ইঞ্জিন, তাই এটির খরচ প্রতি ১০০০ অক্ষর তৈরি করা কথার জন্য ৫০ ক্রেডিট। আল্ট্রা-টিয়ার বড় ১.৬বি মডেল এবং ~১০ জিবি GPU মেমরি উচ্চমানের ডায়ালগ ব্যবহারের জন্য ব্যবহার করে।

Yes. New TextToSpeechAI accounts include free starter credits, and there is a demo you can run without signing up. That is enough to generate a short Dia dialogue with [S1]/[S2] tags before deciding on a paid plan.

Yes. Once you have an API token from your account page you can submit Dia dialogue scripts - including [S1]/[S2] turns and tags like [laughs] - to the TextToSpeechAI REST API and download the resulting audio programmatically.

Technical Specs

  • Generation Speed Medium
  • Output Quality Excellent
  • Voice Cloning Supported
  • Languages 1
  • GPU VRAM 10GB
  • Credits/1000 chars 50

Try দিন Now

Generate your first audio free. No credit card required.

Start Free