الشكل 2

Ultra

تحويل النص إلى كلمة على المستوى البشري مع نقل الأسلوب

Moderate السرعة
Excellent النوعية
نعم الاستنساخ
1 اللغات

حول الشكل 2

s. StyleTTS 2 is a

السمات الرئيسية

النوعية على المستوى البشري

ينتج صوتاً لا يمكن تمييزه عن التسجيلات البشرية في الاختبارات العمياء.

نقل الأسلوب

نقل أسلوب الكلام من أي عينة سمعية مرجعية.

الصوت الطبيعي

الإيقاع المثالي، والتوتر، والنغمة مع النمذجة القائمة على الانتشار.

استنساخ الصوت

استنساخ الأصوات بدقة و طبيعية استثنائية

الاستدلال السريع

أسرع من النماذج ذاتية التراجع مع الحفاظ على الجودة.

المصدر المفتوح

ترخيص من معهد ماساتشوستس للتكنولوجيا بحقوق الاستخدام التجاري الكاملة.

حالات الاستخدام

كتب سمعية عالية الجودة صوتيات مهنية إنتاج الأفلام والتلفزيون الإعلانات العالية الجودة إنتاج البرامج الصوتية التمثيل الصوتي

الشكل 2 Voices

View All 6
StyleTTS2 Default
EN
StyleTTS2 Expressive
EN
StyleTTS2 Fast
EN
StyleTTS2 Natural
EN
StyleTTS2 Neutral
EN
StyleTTS2 Quality
EN

كيف تستخدم الشكل 2

  1. 1

    انضم مجانا أو ابدأ العرض

    إنشاء حساب مجاني TextToSpeechAI للحصول على ائتمانات البدء، أو استخدام الصفحة الرئيسية للاستماع إلى StyleTTS2 دون التسجيل.

  2. 2

    اختار محرك StyleTTS2

    اختار صوت StyleTTS2 من مكتبة الأصوات. لاستنساخ صوت، قم بتحميل مقطع مرجعي لمدة 10-30 ثانية وسوف يقوم StyleTTS2 بنقل أسلوبه.

  3. 3

    أدخل نصك

    لصق أو كتابة النص الذي تريد أن يقال. StyleTTS2 يتفوق في اللغة الإنجليزية ويقدم الصوت الطبيعي، والتشديد، والنبرة عبر المقاطع الطويلة.

  4. 4

    توليد الصوت

    انقر على إنشاء و TextToSpeechAI يعرض صوت StyleTTS2 الخاص بك على GPU.

  5. 5

    تنزيل أو استخدام API

    تحميل الصوت StyleTTS2 النهائي كMP3، WAV، أو OGG، أو استدعاء TextToSpeechAI API مع صوتك StyleTTS2 لجعل توليد آلي.

الشكل 2 ألف - استعراض البرنامج

توليد الكلام البرمجي باستخدام TextToSpeechAI REST API.

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "StyleTTS 2 ينتج كلمته طبيعية جدا، انها تنافس التسجيلات البشرية المهنية.",
    "voice": "styletts2-default"
  }'

الأسئلة المتكررة

StyleTTS2 هو نموذج متقدم لتحويل النص إلى صوت يحقق تركيب الكلام على المستوى البشري. وهو يستخدم نشر الأسلوب والتدريب التنافسي لإنتاج صوت لا يمكن تمييزه تقريباً عن التسجيلات البشرية الحقيقية في اختبارات الاستماع العمياء. يمكنك تجربة StyleTTS2 مجاناً على TextToSpeechAI.

ينتج StyleTTS2 أعلى جودة TTS صوتية متاحة على TextToSpeechAI. في التقييمات الرسمية بلغت تقييمات المستوى البشري على MOS (متوسط تقييم الرأي) اختبارات، مع المستمعين غالبا لا يمكن تمييزها من متحدث بشري حقيقي. يجلس في طبقتنا Ultra إلى جانب Tortoise لذلك السبب.

نعم، StyleTTS2 يدعم استنساخ الصوت من خلال نقل الأسلوب. إنه لا يستخرج فقط النغمة ولكن أنماط الكلام، الإيقاع، والخصائص العاطفية من مقطع مرجعي. يوفر 10-30 ثانية من الصوت الواضح لأكثر نسخة StyleTTS2 دقة.

نعم، تم إطلاق StyleTTS2 تحت ترخيص MIT المتساهل، والذي يسمح بالاستخدام التجاري الكامل بدون حقوق الملكية. وهذا يجعله آمناً للكتب السمعية، والإعلانات، والأفلام، ومشاريع StyleTTS2 المهنية الأخرى حيث الحقوق مهمة.

StyleTTS2 يدعم اللغة الإنجليزية في المقام الأول، حيث تم تدريب النموذج على مجموعات البيانات الإنجليزية. إذا كنت بحاجة إلى جودة مماثلة عبر لغات متعددة، فF5-TTS على TextToSpeechAI هو ملائم أفضل بينما لا يزال يدعم استنساخ الصوت.

StyleTTS2 لديه سرعة توليد معتدلة. إنه أسرع بكثير من النماذج ذاتية التراجع مثل Tortoise ولكن أبطأ من المحركات الخفيفة مثل Piper. بسبب نوعيته العالية وتكاليف الحساب، StyleTTS2 يتم تسعيره في طبقتنا Ultra بدلا من كنموذج الوقت الحقيقي.

يتطلب StyleTTS2 حوالي 4-6GB من VRAM للاستدلال. إنه أكثر كفاءة في الذاكرة من Bark أو Tortoise بينما ينتج مخرجات ذات جودة أعلى. على TextToSpeechAI كل StyleTTS2 المعالجة تعمل على وحدة المعالجة المركزية، لذلك لا تحتاج إلى أي معدات الخاصة بك.

StyleTTS2 هو نموذج Ultra-tier وتكلفة 50 أرصدة لكل 1000 كلمة على TextToSpeechAI. أن التسعير الأعلى يعكس نوعية المستوى البشري وموارد GPU المطلوبة. النماذج القياسية مثل بايب تكلفة 10 أرصدة لكل 1000 كلمة للمقارنة.

اختار StyleTTS2 عندما تكون جودة الصوت الإنجليزية الخام هي الأولوية العليا و تريد النتيجة الأكثر طبيعية. اختار F5-TTS عندما تحتاج إلى تركيب متعدد اللغات سريع مع استنساخ الصوت. كلاهما يدعم الاستنساخ، ولكن StyleTTS2 هو المستوى العالي (50 نقطة) بينما F5-TTS هو المستوى الأعلى (25 نقطة).

ينتج StyleTTS2 صوتاً عالي الجودة بمعدل 24 كيلو هرتز. ومن خلال TextToSpeechAI يمكنك تحميل النتيجة في شكل MP3 أو WAV أو OGG، ونحن نستخدم ترميزاً عالي الجودة بحيث يتم الحفاظ على جودة StyleTTS2 الاستثنائية في الملف النهائي.

نعم. يدعم StyleTTS2 تعديلات سرعة الكلام، وتصميم نقل الأسلوب يسمح لك بتشكيل النغمة من خلال اختيار مقاطع مرجعية مختلفة. اختيار الصوت مع الإيقاع والمشاعر التي تريد تمنحك التحكم الدقيق على تسليم StyleTTS2.

اختار صوت StyleTTS2 من مكتبتنا أو تحميل صوت مرجعي لإنشاء صوت مستنسخ، ثم الإشارة إلى ذلك الصوت في طلبات API. TextToSpeechAI يتعامل مع جميع معالجة GPU ويرجع URL التنزيل مع صوت StyleTTS2 الأعلى.

Technical Specs

  • Generation Speed Moderate
  • Output Quality Excellent
  • Voice Cloning Supported
  • Languages 1
  • GPU VRAM 4-6GB
  • Credits/1000 chars 50

Try الشكل 2 Now

Generate your first audio free. No credit card required.

Start Free