يوم

Ultra

تحويل النصوص إلى لغة مباشرة موجه نحو الحوار مع استنساخ الصوت والأصوات غير اللفظية

Medium السرعة
Excellent النوعية
نعم الاستنساخ
1 اللغات

حول يوم

ing the most accurate text-to-speech results for the most complex texts. Dia is a 1.6B parameter text-to-speech model that is designed to generate natural conversational speech with support for nonverbal sounds like laughter, sighs, and coughs. It excels at generating the most accurate text-to-speech results for the most complex texts. Dia is a 1.6B parameter text-to-speech model that

السمات الرئيسية

جيل الحوار

توليد محادثات طبيعية متعددة المتحدثين بأصوات مختلفة وتناوب.

الأصوات غير اللفظية

تضاف عبارة [ضحك]، [انتفاخ]، [سعال]، (تنفس) للتعبير الطبيعي عن التعبيرات الشبه اللغوية.

استنساخ الصوت

استنساخ أي صوت من 5-10 ثوان من السمع المرجعي للكلام الشخصي.

محادثة طبيعية

البارامترات 1.6B تنتج صوت طبيعي جدا في المحادثة ونغمة.

حالات الاستخدام

توليد الحوار والمحادثة إنتاج كتب مسموعة بشخصيات متعددة أصوات شخصيات الألعاب البودكاست وإنشاء المحتوى

كيف تستخدم يوم

  1. 1

    انضم مجانا أو افتح العرض

    إنشاء حساب مجاني TextToSpeechAI للمطالبة ببدء ائتمانات، أو فتح العرض التجريبي بدون التسجيل لتجربة حوار ديانا على الفور.

  2. 2

    انتقِ محرك Dia

    في لوحة التحكم لترجمة النصوص إلى صوت، اختر Dia من قائمة المحركات. Dia هو نموذج ذو طبقة فائقة موجهة نحو الحوار مع دعم متعدد المتحدثين واستنساخ الصوت.

  3. 3

    كتابة نص حوار مع علامات

    ضع محادثتك باستخدام [S1] و [S2] لتحديد كل دور للمتحدث، وأسقط علامات غير لفظية مثل [ضحك]، [انتفاخ]، [سعال]، أو (تنفس) حيث تريد ردود فعل طبيعية.

  4. 4

    توليد الصوت

    انقر على إنشاء لإرسال نص ديّا الخاص بك إلى وحدات المعالجة الرسومية المستضافة لدينا. تعرض ديّا حوار المتحدثين مع التناوب وعلاماتك غير اللفظية في ملف صوتيّ واحد.

  5. 5

    تنزيل أو استدعاء البرنامج المساعد

    تحميل الحوار المنتهي في الشكل الذي اخترته، أو أتمتة ذلك عن طريق نشر نفس [S1] / [S2] النص إلى TextToSpeechAI API مع رمز حسابك.

يوم ألف - استعراض البرنامج

توليد الكلام البرمجي باستخدام TextToSpeechAI REST API.

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "مرحباً كيف حالك اليوم؟ [ضحك] [س2] أنا بخير، شكراً على سؤالك",
    "voice": "en_US-lessac-medium"
  }'

الأسئلة المتكررة

ديّا هو نموذج 1.6B من مختبرات ناري لتحويل النص إلى كلمة يركز على الحوار، وهو متخصص في توليد كلمة محادثة طبيعية مع دعم للمتحدثين المتعددين، والأصوات غير اللفظية، واستنساخ الصوت.

نعم، ديا مرخصة بالكامل من قبل Apache 2.0 - كل من الشفرة والنموذج، ويمكن استخدامها بحرية في التطبيقات التجارية.

ويدعم برنامج ديا حاليا اللغة الإنكليزية فقط، وقد تم تحسين النموذج للغة الإنكليزية الطبيعية.

يتطلب Dia حوالي 10GB من VRAM لنموذجه 1.6B. يوصى بمعالج رسوميات بحجم 12GB على الأقل للتشغيل المريح. على TextToSpeechAI كل هذا يعمل على معالجات رسومياتنا المستضافة، لذلك لا تحتاج إلى أي معدات خاصة بك.

نعم - الحوار هو بالضبط ما تم بناءه لـ ديّا. من خلال التناوب بين [S1] و [S2] في كتابتك، ينتج ديّا TTS محادثة متدفقة بين متحدثين اثنين بأصوات متميزة ودور واقعي، وهو أمر أصعب تحقيقه مع نماذج TTS ذات متحدث واحد.

ضع في مقدمة كل سطر من نصك [S1] أو [S2] لتحديد من يتحدث. وتعطي ديا صوتاً ثابتاً لكل علامة وتتحول بينهما مع حركة المحادثة، لذا [S1] و[S2] يعملان كشخصين في حوارك.

نعم. يدعم ديّا استنساخ الصوت من حوالي 5-10 ثوان من الصوت المرجعي النظيف، مما يسمح لك بإعادة استخدام صوت محدد لمتحدث. يمكنك الجمع بين الاستنساخ مع علامات [S1]/[S2] بحيث يبدو كل شخصية في حوار مثل الصوت الذي استنسخته.

ديا تترجم [ضحك]، [انتعاش]، [سعال]، و (تنفس) كأصوات طبيعية شبه لغوية منسوجة في الخطاب بدلاً من الكلمات المنطوقة. ضع علامة على المكان الذي تريد أن يحدث فيه رد الفعل - على سبيل المثال "[S1] هذا مضحك [ضحك]" - لجعل الحوار يبدو أكثر إنسانية.

كل من ديّا وبارك يدعمان الأصوات غير اللفظية التعبيرية، ولكن ديّا مصنوعة خصيصاً للحوار بين متحدثين متعددين مع [S1]/[S2] التناوب واستنساخ الصوت. اختار ديّا للمحادثات الواقعية بين شخصين وعمل الشخصيات؛ وبارك هو ملائم أفضل عندما تحتاج إلى تغطية لغة أوسع في السرد بصوت واحد.

إن دي آي آي محرك ذو طبقة فائقة، لذا فهو يكلف 50 نقطة لكل 1000 حرف من الكلام المولد. ويعكس المستوى الفائق النموذج الأكبر 1.6B وذاكرة وحدة المعالجة الرسومية التي تستخدمها للحوار العالي الجودة والتي تبلغ نحو 10 جيجا بايت.

نعم. تتضمن حسابات TextToSpeechAI الجديدة ائتمانات بدء مجانية، وهناك عرض يمكنك تشغيله دون التسجيل. وهذا يكفي لإنتاج حوار ديّا قصير مع علامات [S1]/[S2] قبل اتخاذ قرار بشأن خطة مدفوعة.

نعم، بمجرد أن تحصل على رمز API من صفحة حسابك، يمكنك تقديم نصوص حوار Dia - بما في ذلك [S1]/[S2] تحولات وعلامات مثل [ضحك] - إلى TextToSpeechAI REST API وتحميل الصوت الناتج عن ذلك برنامجيا.

Technical Specs

  • Generation Speed Medium
  • Output Quality Excellent
  • Voice Cloning Supported
  • Languages 1
  • GPU VRAM 10GB
  • Credits/1000 chars 50

Try يوم Now

Generate your first audio free. No credit card required.

Start Free