স্টাইল ২

Ultra

স্টাইল ট্রান্সফার সহ মানব-স্তরের টেক্সট-টু-স্পিকার

Moderate গতি
Excellent গুণমান
না ক্লোনিং
1 ভাষা

পরিচিতি স্টাইল ২

StyleTTS 2 achieves human-level text-to-speech synthesis through style diffusion and adversarial training. It generates highly natural speech that rivals real human recordings. StyleTTS 2 represents the state-of-the-art in TTS quality and naturalness.

প্রধান বৈশিষ্ট্য

মানব-স্তরের গুণমান

অন্ধ পরীক্ষায় মানুষের রেকর্ড থেকে আলাদা করা যায় না এমন কথাবার্তা তৈরি করে।

এক্সপ্রেশনাল স্টাইল

মডেলদের কথা বলার স্টাইল, তাই লেখার সাথে সাথে তাদের বক্তব্যের ধরন পরিবর্তিত হয়।

প্রাকৃতিক প্রসোডি

ডিফোশন ভিত্তিক মডেলিং এর সাথে পরিপূর্ণ রীতি, চাপ এবং ইটোনেশন।

স্টুডিও শব্দ

শব্দ লাইব্রেরীতে প্রস্তুত StyleTTS ২ শব্দের মধ্যে থেকে বেছে নিন ।

দ্রুত অনুমান

স্বয়ংক্রিয়ভাবে হ্রাসশীল মডেলের চেয়ে দ্রুততর, কিন্তু গুণগতমান বজায় রাখা।

ওপেন সোর্স

এমআইটি লাইসেন্সের সাথে সম্পূর্ণ বাণিজ্যিক ব্যবহারের অধিকার।

ব্যবহারের ক্ষেত্রে

অডিও বই পেশাদার ভয়েস- ওভার চলচ্চিত্র এবং টিভি উৎপাদন উচ্চমানের বিজ্ঞাপন পডকাস্ট উৎপাদন শব্দের অভিনয়

স্টাইল ২ Voices

View All 6
StyleTTS2 Default
EN
StyleTTS2 Expressive
EN
StyleTTS2 Fast
EN
StyleTTS2 Natural
EN
StyleTTS2 Neutral
EN
StyleTTS2 Quality
EN

ব্যবহারের নিয়ম স্টাইল ২

  1. 1

    বিনামূল্যে নিবন্ধন করুন

    স্টার্টার ক্রেডিট পেতে একটি বিনামূল্যে TextToSpeechAI অ্যাকাউন্ট তৈরি করুন।

  2. 2

    StyleTTS2 ইঞ্জিন বেছে নিন

    শব্দ লাইব্রেরী থেকে একটি StyleTTS2 শব্দ বাছাই করুন ।

  3. 3

    আপনার লেখা লিখুন

    আপনি যে স্ক্রিপ্টটি বর্ণনা করতে চান তা টাইপ অথবা পেস্ট করুন । StyleTTS2 ইংরেজি ভাষায় অসাধারণ এবং দীর্ঘ অংশে প্রাকৃতিক শব্দভাণ্ডার, জোর এবং উচ্চারণ প্রদান করে ।

  4. 4

    অডিও তৈরি করুন

    ক্লিক করুন এবং TextToSpeechAI আপনার StyleTTS2 অডিও GPU এ রেন্ডার করবে। অতিরিক্ত স্তরের StyleTTS2-এর খরচ প্রতি ১০০০ অক্ষর ৫০ ক্রেডিট।

  5. 5

    API ডাউনলোড অথবা ব্যবহার করুন

    MP3, WAV, অথবা OGG হিসাবে শেষ StyleTTS2 অডিও ডাউনলোড করুন, অথবা স্বয়ংক্রিয়ভাবে উৎপাদন করার জন্য আপনার StyleTTS2 শব্দের সাথে TextToSpeechAI API কল করুন।

স্টাইল ২ অ্যাপলিকেশন প্রযুক্তিগত তথ্যের সংগ্রহস্থল (API)

TextToSpeechAI REST API ব্যবহার করে প্রোগ্রামিং দ্বারা বাক্যের উৎপাদন করুন।

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "স্টাইলটিটিএস ২ এমনভাবে স্বাভাবিকভাবে কথা বলে যে, এটি পেশাদার মানুষের রেকর্ডিংয়ের সাথে প্রতিদ্বন্দ্বিতা করে।",
    "voice": "styletts2-default"
  }'

প্রায়শ জিজ্ঞাসিত প্রশ্ন

StyleTTS2 একটি state- of- the- art টেক্সট- টু- স্পিচ মডেল যা মানব- স্তর বক্তৃতা সংশ্লেষণ অর্জন করে। এটি ব্যবহার করে স্টাইল ডিফ্যুশন এবং প্রতিদ্বন্দ্বী প্রশিক্ষণ তৈরি করতে বক্তৃতা যে অন্ধ শ্রবণ পরীক্ষাতে বাস্তব মানব রেকর্ড থেকে প্রায় অবিচ্ছিন্ন। আপনি TextToSpeechAI এ StyleTTS2 বিনামূল্যে চেষ্টা করতে পারেন।

স্টাইলটিটিএস২ TextToSpeechAI-এ উপলব্ধ সর্বোচ্চ মানের টিটিএস অডিও উৎপাদন করে। আনুষ্ঠানিক মূল্যায়নে এটি মানব-স্তরের রেটিং পেয়েছে এমওএস (মধ্যম মতামত স্কোর) পরীক্ষায়, যেখানে শ্রবণকারীরা প্রায়শই এটিকে একজন বাস্তব মানব স্পিকার থেকে আলাদা করতে পারে না। এটি আমাদের আল্ট্রা স্তর টর্টোইজ এর সাথে এই কারণে বসেছে।

TextToSpeechAI-এ নয়। StyleTTS2-এর শব্দ এখানে লাইব্রেরির তৈরি শব্দ। শব্দ ক্লোন করার জন্য Clone Voice টুল ব্যবহার করুন, যা Chatterbox চালায়।

হ্যাঁ। স্টাইলটিটিএস২ এমআইটি লাইসেন্সের অধীনে প্রকাশিত হয়েছে, যা কোন রয়্যালটি ছাড়াই বাণিজ্যিক ব্যবহারের অনুমতি দেয়। এটি অডিওবুক, বিজ্ঞাপন, চলচ্চিত্র এবং অন্যান্য পেশাদার স্টাইলটিটিএস২ প্রকল্পের জন্য নিরাপদ।

StyleTTS2 মূলত ইংরেজি সমর্থন করে, যেহেতু মডেলটি ইংরেজি ডাটাসেটের উপর প্রশিক্ষিত হয়েছিল । অন্যান্য ভাষার জন্য, পাইপার বা বার্ক শব্দ, অথবা একটি ক্লোন করা শব্দ ব্যবহার করুন ।

StyleTTS2-র প্রজন্মের গতি মাঝারি ধরনের। এটি Tortoise-এর মতো স্বয়ংক্রিয়ভাবে পুনরাবৃত্তিমূলক মডেলের চেয়ে অনেক দ্রুত, কিন্তু Piper-এর মতো হালকা ইঞ্জিনের চেয়ে ধীর। এর উচ্চমানের গুণমান এবং কম্পিউটার খরচের কারণে StyleTTS2-র মূল্য নির্ধারণ করা হয়েছে আমাদের আল্ট্রা স্তর থেকে, বাস্তব-সময়ের মডেলের চেয়ে।

StyleTTS2-এর জন্য অনুমান করার জন্য প্রায় ৪-৬GB VRAM প্রয়োজন। এটি Bark বা Tortoise-এর চেয়ে বেশি মেমরি-সমৃদ্ধ এবং উচ্চমানের আউটপুট উৎপাদন করে। TextToSpeechAI-এ সমস্ত StyleTTS2 প্রসেসিং আমাদের GPU-তে চলছে, তাই আপনার নিজের কোন হার্ডওয়্যারের প্রয়োজন নেই।

StyleTTS2 একটি আল্ট্রা-টিয়ার মডেল এবং TextToSpeechAI-এ প্রতি ১০০০ অক্ষরের জন্য ৫০ ক্রেডিট খরচ হয়। এই প্রাইম মূল্য তার মানব-স্তরের গুণমান এবং GPU সম্পদের প্রয়োজন প্রতিফলিত করে। তুলনামূলকভাবে, VITS-এর মতো আদর্শ মডেলের জন্য প্রতি ১০০০ অক্ষরের জন্য ১০ ক্রেডিট খরচ হয় এবং পাইপার-এর জন্য প্রতি ১০০০ অক্ষরের জন্য ১ ক্রেডিট খরচ হয়।

উভয়ই আল্ট্রা স্তর (প্রতি ১০০০ অক্ষর ৫০ ক্রেডিট) এবং ইংরেজি । স্টাইল টি- টি- এস ২ অনেক দ্রুত, যখন টর্টোইজ দীর্ঘ পাসওয়ার্ডে কিছুটা বেশি স্বাভাবিকভাবে শোনাতে পারে । যখন আপনার অনেক ক্লিপ প্রয়োজন হয় তখন স্টাইল টি- টি- এস ২ এবং সময়ের অভাবে টর্টোইজ বেছে নিন ।

StyleTTS2 generates high-quality audio at 24kHz. Through TextToSpeechAI you can download the result as MP3, WAV, or OGG, and we use high-quality encoding so the exceptional StyleTTS2 quality is preserved in the final file.

হ্যাঁ । StyleTTS2 কথা বলার হার সংশোধন সমর্থন করে, এবং লাইব্রেরির প্রতিটি শব্দের নিজস্ব বিতরণ আছে, তাই একটি ভিন্ন শব্দ বেছে নেওয়া প্রসোডি পরিবর্তন করে ।

আমাদের লাইব্রেরী থেকে একটি StyleTTS2 শব্দ নির্বাচন করুন, তারপর আপনার API অনুরোধের মধ্যে সেই শব্দটি রেফারেন্স করুন। TextToSpeechAI সমস্ত GPU প্রসেসিং পরিচালনা করে এবং আপনার প্রাইম StyleTTS2 অডিও সহ একটি ডাউনলোড ইউআরএল ফিরিয়ে দেয়।

Technical Specs

  • Generation Speed Moderate
  • Output Quality Excellent
  • Voice Cloning Not Supported
  • Languages 1
  • GPU VRAM 4-6GB
  • Credits/1000 chars 50

Try স্টাইল ২ Now

Generate your first audio free. No credit card required.

Start Free