الشكل 2

Ultra

تحويل النص إلى كلمة على المستوى البشري مع نقل الأسلوب

Moderate السرعة
Excellent النوعية
لا الاستنساخ
1 اللغات

حول الشكل 2

StyleTTS 2 achieves human-level text-to-speech synthesis through style diffusion and adversarial training. It generates highly natural speech that rivals real human recordings. StyleTTS 2 represents the state-of-the-art in TTS quality and naturalness.

السمات الرئيسية

النوعية على المستوى البشري

ينتج صوتاً لا يمكن تمييزه عن التسجيلات البشرية في الاختبارات العمياء.

أسلوب تعبيري

نمط التحدث النماذج لذلك التسليم يختلف بطبيعة الحال مع النص.

الصوت الطبيعي

الإيقاع المثالي، والتوتر، والنغمة مع النمذجة القائمة على الانتشار.

منظمة صوت استوديو

اختار من StyleTTS 2 الأصوات الجاهزة في مكتبة الأصوات.

الاستدلال السريع

أسرع من النماذج ذاتية التراجع مع الحفاظ على الجودة.

المصدر المفتوح

ترخيص من معهد ماساتشوستس للتكنولوجيا بحقوق الاستخدام التجاري الكاملة.

حالات الاستخدام

كتب سمعية عالية الجودة صوتيات مهنية إنتاج الأفلام والتلفزيون الإعلانات العالية الجودة إنتاج البرامج الصوتية التمثيل الصوتي

الشكل 2 Voices

View All 6
StyleTTS2 Default
EN
StyleTTS2 Expressive
EN
StyleTTS2 Fast
EN
StyleTTS2 Natural
EN
StyleTTS2 Neutral
EN
StyleTTS2 Quality
EN

كيف تستخدم الشكل 2

  1. 1

    انضم مجانا

    إنشاء حساب مجاني TextToSpeechAI للحصول على أرصدة البدء.

  2. 2

    اختار محرك StyleTTS2

    اختر صوت StyleTTS2 من مكتبة الأصوات.

  3. 3

    أدخل نصك

    لصق أو كتابة النص الذي تريد أن يقال. StyleTTS2 يتفوق في اللغة الإنجليزية ويقدم الصوت الطبيعي، والتشديد، والنبرة عبر المقاطع الطويلة.

  4. 4

    توليد الصوت

    انقر على إنشاء و TextToSpeechAI يعرض صوت StyleTTS2 الخاص بك على GPU.

  5. 5

    تنزيل أو استخدام API

    تحميل الصوت StyleTTS2 النهائي كMP3، WAV، أو OGG، أو استدعاء TextToSpeechAI API مع صوتك StyleTTS2 لجعل توليد آلي.

الشكل 2 ألف - استعراض البرنامج

توليد الكلام البرمجي باستخدام TextToSpeechAI REST API.

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "StyleTTS 2 ينتج كلمته طبيعية جدا، انها تنافس التسجيلات البشرية المهنية.",
    "voice": "styletts2-default"
  }'

الأسئلة المتكررة

StyleTTS2 هو نموذج متقدم لتحويل النص إلى صوت يحقق تركيب الكلام على المستوى البشري. وهو يستخدم نشر الأسلوب والتدريب التنافسي لإنتاج صوت لا يمكن تمييزه تقريباً عن التسجيلات البشرية الحقيقية في اختبارات الاستماع العمياء. يمكنك تجربة StyleTTS2 مجاناً على TextToSpeechAI.

ينتج StyleTTS2 أعلى جودة TTS صوتية متاحة على TextToSpeechAI. في التقييمات الرسمية بلغت تقييمات المستوى البشري على MOS (متوسط تقييم الرأي) اختبارات، مع المستمعين غالبا لا يمكن تمييزها من متحدث بشري حقيقي. يجلس في طبقتنا Ultra إلى جانب Tortoise لذلك السبب.

لا على TextToSpeechAI. الأصوات StyleTTS2 هنا هي أصوات جاهزة من المكتبة. لاستنساخ الصوت، استخدم أداة Clone Voice، التي تقوم بتشغيل Chatterbox.

نعم، تم إطلاق StyleTTS2 تحت ترخيص MIT المتساهل، والذي يسمح بالاستخدام التجاري الكامل بدون حقوق الملكية. وهذا يجعله آمناً للكتب السمعية، والإعلانات، والأفلام، ومشاريع StyleTTS2 المهنية الأخرى حيث الحقوق مهمة.

StyleTTS2 يدعم اللغة الإنجليزية في المقام الأول، حيث تم تدريب النموذج على مجموعات البيانات الإنجليزية. بالنسبة للغات الأخرى، استخدم أصوات Piper أو Bark، أو صوت مستنسخ.

StyleTTS2 لديه سرعة توليد معتدلة. إنه أسرع بكثير من النماذج ذاتية التراجع مثل Tortoise ولكن أبطأ من المحركات الخفيفة مثل Piper. بسبب نوعيته العالية وتكاليف الحساب، StyleTTS2 يتم تسعيره في طبقتنا Ultra بدلا من كنموذج الوقت الحقيقي.

يتطلب StyleTTS2 حوالي 4-6GB من VRAM للاستدلال. إنه أكثر كفاءة في الذاكرة من Bark أو Tortoise بينما ينتج مخرجات ذات جودة أعلى. على TextToSpeechAI كل StyleTTS2 المعالجة تعمل على وحدة المعالجة المركزية، لذلك لا تحتاج إلى أي معدات الخاصة بك.

StyleTTS2 هو نموذج Ultra-tier وتكلفة 50 أرصدة لكل 1000 كلمة على TextToSpeechAI. أن التسعير الأعلى يعكس نوعيته على المستوى البشري وموارد GPU المطلوبة. مقارنة، النماذج القياسية مثل VITS تكلفة 10 أرصدة لكل 1000 كلمة وPiper تكلفة 1 أرصدة لكل 1000 كلمة.

كلاهما من المستوى العالي (50 نقطة لكل 1000 كلمة) واللغة الإنجليزية. StyleTTS2 أسرع بكثير، بينما Tortoise يمكن أن يبدو أكثر طبيعية قليلا على المقاطع الطويلة. اختر StyleTTS2 عندما تحتاج إلى العديد من المقاطع و Tortoise عندما لا يكون الوقت قيدًا.

ينتج StyleTTS2 صوتاً عالي الجودة بمعدل 24 كيلو هرتز. ومن خلال TextToSpeechAI يمكنك تحميل النتيجة في شكل MP3 أو WAV أو OGG، ونحن نستخدم ترميزاً عالي الجودة بحيث يتم الحفاظ على جودة StyleTTS2 الاستثنائية في الملف النهائي.

نعم، StyleTTS2 يدعم تعديلات سرعة الكلام، وكل صوت في المكتبة لديه تسليمه الخاص، لذلك اختيار صوت مختلف يغير النغمة.

اختار صوت StyleTTS2 من مكتبتنا، ثم ارجع إلى ذلك الصوت في طلبات API الخاصة بك. TextToSpeechAI يتعامل مع جميع معالجة GPU ويرجع URL للتنزيل مع صوت StyleTTS2 الأعلى.

Technical Specs

  • Generation Speed Moderate
  • Output Quality Excellent
  • Voice Cloning Not Supported
  • Languages 1
  • GPU VRAM 4-6GB
  • Credits/1000 chars 50

Try الشكل 2 Now

Generate your first audio free. No credit card required.

Start Free