انداز

Ultra

انسانی سطح کا متن سے بولنے والا

Moderate رفتار
Excellent معيار
نہیں کلوننگ
1 زبانیں

متعلقہ انداز

StyleTTS 2 achieves human-level text-to-speech synthesis through style diffusion and adversarial training. It generates highly natural speech that rivals real human recordings. StyleTTS 2 represents the state-of-the-art in TTS quality and naturalness.

کلیدی خصوصیات

انسانی سطح کی صفت

اندھی ٹیسٹ میں انسانی ریکارڈ سے غیر قابل ممتاز بات پیدا کرتا ہے.

انداز

ماڈل بولنے کی انداز تو تحویل فطری طور پر متن کے ساتھ مختلف ہے.

فطري نظم

مکمل ریتمی، دباؤ، اور diffusion-based موڈلنگ کے ساتھ انٹنیشن.

سٹوڈیو آوازیں

آواز لائبريري ميں تيار کئے گئے StyleTTS2 آوازوں سے انتخاب کريں

جلدي حصول

کیفیت کو برقرار رکھتے ہوئے autoregressive ماڈل سے تیز.

اوپن سورس

ایم آئی ٹی لائسنس کے ساتھ مکمل تجارتی استعمال کے حقوق.

استعمال کے حالات

پرائم آڈیو بک پرو فا ئل ويز اوور فلم اور ٹی وی پرو ڈکشن اعلیٰ سطحی اشتہارات پوڈکاسٹ پروڈیوس آواز

انداز Voices

View All 6
StyleTTS2 Default
EN
StyleTTS2 Expressive
EN
StyleTTS2 Fast
EN
StyleTTS2 Natural
EN
StyleTTS2 Neutral
EN
StyleTTS2 Quality
EN

استعمال کيونکر کريں انداز

  1. 1

    مفت میں رجسٹر کریں

    شروع کريٹيز حاصل کر نے کے ليے مفت TextToSpeechAI اڪاؤنٹ بنا ئيں

  2. 2

    سٹائلTTS2 انجن منتخب کريں

    آواز لائبريري سے StyleTTS2 آواز منتخب کريں

  3. 3

    آپ کا متن داخل کریں

    اس ليکبڑ کو پسٹ کريں يا ٹائپ کريں جو آپ بيان کر نے چا هيتے هيں StyleTTS2 انگريزي ميں ممتاز هے اور طويل گزيده ميں طبيعي پراسو ڈي ، دباؤ اور انطوانے ميں عطا کر تا هے

  4. 4

    آڈیو بناؤ

    جنرائز کريں اور TextToSpeechAI آپ کا StyleTTS2 آ ڊيو GPU پر رنڈ کريں Ultra-tier StyleTTS2 پر 50 کريڈٹ 1000 حروف

  5. 5

    API ڈائون لوڈ کریں یا استعمال کریں

    MP3, WAV, or OGG کے طور پر ختم شدہ StyleTTS2 آڈیو ڈائون لوڈ کریں، يا آپ کو آپ کو خودکار بنانے کے ليے آپ کی StyleTTS2 آواز کے ساتھ TextToSpeechAI API کو بلايں

انداز API

TextToSpeechAI REST API کے استعمال سے پروگرامنگ کے طور پر بولي پيدا کريں

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "StyleTTS2 بات کو اتنی قدرتی بناتا ہے، یہ پیشہ ور انسانی ریکارڈنگ کے مقابلے میں ہے.",
    "voice": "styletts2-default"
  }'

بار بار پوچھے گئے سوالات

StyleTTS2 ایک جديد متن سے کلام ماڈل هے جو انساني سطح پر کلام کي سنتز کو حاصل کر تا هے اس ميں انداز کے تقسيم اور مقابلي تربيت کا استعمال کئے جا تا هے جو اندھا سننے کے ٹیسٹ ميں حقيقي انساني ريجيو کي ميزاني سے تما ش کر نے کے ليے غير قابل تمييز کلام پيدا کر تا هے آپ TextToSpeechAI پر StyleTTS2 کو مفت ميں آزما سکتے هيں

StyleTTS2 TextToSpeechAI پر دستیاب سب سے اعلیٰ کیفیت کے TTS اوڈيو کا پیداوار کرتا ہے. رسمی جائزے میں اس نے MOS (میانی راءِ سکوئر) ٹیسٹ پر انسانی سطح کی درجہ بندی حاصل کی، سننے والے اکثر اسے ایک حقیقی انسانی اسپیکر سے الگ کرنے میں نا قادر ہوتے ہیں. یہ اس وجہ کے لیے Tortoise کے ساتھ ہمارے الٹرا ٹائر میں بیٹھتا ہے.

TextToSpeechAI پر نہیں StyleTTS2 آوازیں یہاں لائبرري سے تيار کيے جا چکے آوازیں هے آواز کي کلوننگ کے ليے CloneVoice ٹول استعمال کريں جو Chatterbox کو چلاتا هے

جی ہاں StyleTTS2 MIT لا ئسنس کے تحت آزاد کیا گیا ہے جو کہ مکمل تجارتی استعمال کو اجازت دیتا ہے اور کوئی روایات نہیں ہے. یہ اسے آڈیو بک، اشتہار، فلم اور دیگر پیشہ ورانہ StyleTTS2 پروجیکٹوں کے لیے محفوظ بناتا ہے جہاں حقوق اہم ہیں.

StyleTTS2 اصل میں انگريزي کو مدد ديتا هے ، جو ماڈل انگريزي ڈیٹاسٹ پر تربيت کريں گيا هے دوسرے زبانوں کے ليے ، پيپر يا بارک آواز يا کلون آواز استعمال کريں

StyleTTS2 کی متوسط نسل کی رفتار ہے یہ Tortoise جیسے autoregressive ماڈل سے بہت تیز ہے لیکن Piper جیسے ہلے وزن انجن سے سست ہے اس کی پرائمی کیفیت اور کمپیوٹ لاگت کی وجہ سے StyleTTS2 کو ایک ریئل ٹائم ماڈل کی بجائے ہمارے الٹرا ٹیئر میں قیمت دی جاتی ہے

StyleTTS2 کو انفریشن کے لیے VRAM کے تقریباً 4-6GB کی ضرورت ہوتی ہے یہ Bark یا Tortoise سے زیادہ میمورے کو موثر بناتا ہے جبکہ اعلیٰ معیار کے خروجی کو پیدا کرتا ہے TextToSpeechAI پر سب StyleTTS2 پروسیسنگ ہمارے GPUs پر چلتا ہے، تو آپ کو اپنے ہیڈروڈ کی ضرورت نہیں ہے

StyleTTS2 ایک الٹرا-تیئر ماڈل ہے اور TextToSpeechAI پر ہر 1000 حروف کے لئے 50 کریڈٹ کی قیمت ہے۔ یہ پرائم قیمت انسانی سطح کی کیفیت اور GPU کے وسائل کی ضرورت کو ظاہر کرتی ہے۔ مقابلے کے طور پر، VITS جیسے معیاری ماڈل ہر 1000 حروف کے لئے 10 کریڈٹ کی قیمت رکھتے ہیں اور Piper ہر 1000 حروف کے لئے 1 کریڈٹ کی قیمت رکھتا ہے۔

دوئي يونٹرا ٹائر (50 کرڈٹس پر 1000 حروف) اور انگريزي هے StyleTTS2 بہت جلدي هے ، جب کہ Tortoise طويل فاصلے پر اتنا ئي طبيعي آواز دے سکتا هے StyleTTS2 کو منتخب کريں جب آپ کو بہت سے کلپز کي ضرورت هے اور Tortoise کو جب وقت کو محدودي نہيں هے

StyleTTS2 24kHz پر اعلیٰ معیار کی اوڈيو پیدا کرتا ہے. TextToSpeechAI کے ذریعے آپ MP3, WAV, or OGG کے طور پر نتیجے کو ڈاؤن لوڈ کر سکتے ہیں اور ہم اعلیٰ معیار کی کوڈنگ استعمال کرتے ہیں تاکہ غیر معمولی StyleTTS2 کی کیفیت آخری فائلیں میں محفوظ ہو جائے.

ہاں StyleTTS2 بولنے کے ريٹ کي تعديل کو مدد ديتا هے اور لائبرري ميں ہر آواز کو خودي دليے ميں هے ، تو مختلف آواز کو منتخب کر نے سے پرو زودي ميں تبديلي آ تا هے

ہمارے لائبریری سے ایک StyleTTS2 آواز منتخب کریں، پھر آپ کے API درخواستوں میں اس آواز کا حوالہ دیں. TextToSpeechAI تمام GPU پروسیسنگ کو ہینڈل کرتا ہے اور آپ کے پرائم StyleTTS2 آڈیو کے ساتھ ایک ڈاؤن لوڈ URL واپس کرتا ہے.

Technical Specs

  • Generation Speed Moderate
  • Output Quality Excellent
  • Voice Cloning Not Supported
  • Languages 1
  • GPU VRAM 4-6GB
  • Credits/1000 chars 50

Try انداز Now

Generate your first audio free. No credit card required.

Start Free