سبک TTS ۲

Ultra

متن به گفتار سطح انسانی با انتقال سبکName

Moderate سرعت
Excellent کیفیت
نه شبیه‌سازی
1 زبانها

در مورد سبک TTS ۲

StyleTTS 2 achieves human-level text-to-speech synthesis through style diffusion and adversarial training. It generates highly natural speech that rivals real human recordings. StyleTTS 2 represents the state-of-the-art in TTS quality and naturalness.

ویژگیهای کلیدی

کیفیت سطح انسانی

این روش در آزمایش‌های کور، صدایی تولید می‌کند که از صدای انسان قابل تشخیص نیست.

سبک بیانی

این روش به گونه‌ای طراحی شده‌است که با استفاده از متن، به صورت طبیعی به متن ترجمه شود.

نظم طبیعی

ریتم کامل، استرس و نت با مدل‌سازی مبتنی بر انتشار.

صداهای استودیو

از صداهای آماده StyleTTS ۲ در کتابخانه صدا انتخاب کنید.

استنتاج سریع

سرعت بالاتر از مدل‌های خودبازگشتی با حفظ کیفیت.

منبع باز

این نرم‌افزار با مجوز MIT و با تمام حقوق تجاری منتشر شده‌است.

موارد استفاده

کتاب‌های صوتی Premium حرفه‌ای تولید فیلم و تلویزیون تبلیغات بالا تولید پادکست صداگذاری

سبک TTS ۲ Voices

View All 6
StyleTTS2 Default
EN
StyleTTS2 Expressive
EN
StyleTTS2 Fast
EN
StyleTTS2 Natural
EN
StyleTTS2 Neutral
EN
StyleTTS2 Quality
EN

چطور استفاده شود سبک TTS ۲

  1. 1

    ثبت نام مجانی

    یک حساب رایگان TextToSpeechAI ایجاد کنید تا اعتبار اولیه را دریافت کنید.

  2. 2

    برگزیدن موتور StyleTTS2

    از کتابخانه صداها ، صدای StyleTTS2 را برگزینید.

  3. 3

    وارد کردن متن

    متنی را که می‌خواهید گوینده باشد ، تایپ یا چسبانید. StyleTTS2 در انگلیسی عالی است و در گذرگاه‌های طولانی ، نظم طبیعی ، تأکید و نت را ارائه می‌دهد.

  4. 4

    تولید صدا

    کلیک کنید تولید و TextToSpeechAI صدای StyleTTS2 شما را در GPU نمایش می‌دهد. StyleTTS2 فوق‌العاده سطحی ۵۰ کرون برای هر ۱۰۰۰ کاراکتر هزینه دارد.

  5. 5

    دانلود یا استفاده از API

    فایل صوتی StyleTTS2 را به صورت MP3، WAV یا OGG دانلود کنید یا API TextToSpeechAI را با صدای StyleTTS2 خود برای تولید خودکار صدا فراخوانی کنید.

سبک TTS ۲ API

این برنامه با استفاده از TextToSpeechAI REST API تولید می‌شود.

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "StyleTTS2 صدایی طبیعی تولید می‌کند که با ضبط حرفه‌ای انسان رقابت می‌کند.",
    "voice": "styletts2-default"
  }'

پرسشهای متداول

StyleTTS2 یک مدل متن به گفتار پیشرفته است که ترکیب گفتار سطح انسانی را به دست می‌آورد. از انتشار سبک و آموزش رقابتی برای تولید گفتاری که در آزمون‌های گوش دادن نابینا ، از ضبط واقعی انسان قابل تشخیص نیست ، استفاده می‌کند. می‌توانید StyleTTS2 را به صورت رایگان در TextToSpeechAI امتحان کنید.

StyleTTS2 بالاترین کیفیت صدای TTS را تولید می‌کند که در TextToSpeechAI موجود است. در ارزیابی‌های رسمی ، در آزمون‌های MOS (نمره میانگین نظر) به رتبه‌های سطح انسانی رسید ، با شنوندگانی که اغلب قادر به تشخیص آن از یک سخنران انسانی واقعی نیستند. به همین دلیل ، در سطح Ultra ما در کنار Tortoise قرار دارد.

نه در TextToSpeechAI. صداهای StyleTTS2 در اینجا صداهای آماده از کتابخانه هستند. برای شبیه‌سازی صدا ، از ابزار صدای شبیه‌سازی استفاده کنید ، که Chatterbox را اجرا می‌کند.

بله. StyleTTS2 تحت مجوز MIT آزاد شده است ، که اجازه استفاده تجاری کامل بدون حق امتیاز را می‌دهد. این باعث می‌شود که برای کتاب‌های صوتی ، تبلیغات ، فیلم و دیگر پروژه‌های حرفه ای StyleTTS2 که حقوق اهمیت دارد ایمن باشد.

StyleTTS2 در درجه اول از انگلیسی پشتیبانی می‌کند ، زیرا مدل بر روی داده‌ساختارهای انگلیسی آموزش داده شده است. برای زبان‌های دیگر ، از صداهای Piper یا Bark ، یا یک صدای شبیه‌سازی شده استفاده کنید.

StyleTTS2 سرعت تولید متوسطی دارد. از مدلهای خودبازگشتی مانند Tortoise سریعتر است ، اما از موتورهای سبک مانند Piper کندتر است. به دلیل کیفیت بالا و هزینه محاسباتی ، StyleTTS2 به جای مدل زمان واقعی ، در سطح فوق‌العاده ما قیمت‌گذاری می‌شود.

StyleTTS2 برای استنتاج حدود ۴-۶ گیگابایت VRAM نیاز دارد. در حالی که خروجی با کیفیت بالاتری تولید می‌کند، حافظه آن نسبت به Bark یا Tortoise کارآمدتر است. در TextToSpeechAI تمام پردازش‌های StyleTTS2 بر روی GPUهای ما اجرا می‌شوند، بنابراین نیازی به سخت‌افزار خودتان ندارید.

StyleTTS2 یک مدل Ultra-tier است و هزینه ۵۰ کرید برای هر ۱۰۰۰ کاراکتر در TextToSpeechAI است. این قیمت بالا کیفیت سطح انسانی و منابع GPU مورد نیاز را نشان می‌دهد. در مقایسه، مدل‌های استاندارد مانند VITS هزینه ۱۰ کرید برای هر ۱۰۰۰ کاراکتر و Piper هزینه ۱ کرید برای هر ۱۰۰۰ کاراکتر است.

هر دو سطح فوق‌العاده هستند (۵۰ امتیاز در ۱۰۰۰ کاراکتر) و انگلیسی. StyleTTS2 خیلی سریعتر است ، در حالی که Tortoise می‌تواند در گذرگاه‌های طولانی کمی طبیعی‌تر به نظر برسد. StyleTTS2 را هنگامی که به کلیپ‌های زیادی نیاز دارید و Tortoise را هنگامی که زمان محدودیتی ندارد ، انتخاب کنید.

StyleTTS2 صدای با کیفیت بالا را در ۲۴ کیلوهرتز تولید می‌کند. از طریق TextToSpeechAI می‌توانید نتیجه را به صورت MP3 ، WAV یا OGG بارگیری کنید ، و از کدگذاری با کیفیت بالا استفاده می‌کنیم ، بنابراین کیفیت فوق‌العاده StyleTTS2 در پرونده نهایی حفظ می‌شود.

بله. StyleTTS2 از تنظیمات سرعت گفتار پشتیبانی می‌کند و هر صدا در کتابخانه ارائه خود را دارد، بنابراین انتخاب صدای متفاوت، پرود را تغییر می‌دهد.

یک صدای StyleTTS2 را از کتابخانه انتخاب کنید، سپس آن صدا را در درخواست‌های API خود ارجاع دهید. TextToSpeechAI تمام پردازش‌های GPU را انجام می‌دهد و یک URL دانلود را با صدای Premium StyleTTS2 باز می‌گرداند.

Technical Specs

  • Generation Speed Moderate
  • Output Quality Excellent
  • Voice Cloning Not Supported
  • Languages 1
  • GPU VRAM 4-6GB
  • Credits/1000 chars 50

Try سبک TTS ۲ Now

Generate your first audio free. No credit card required.

Start Free