المناطق

Ultra

استنساخ الصوت التعبيري مع التحكم في العواطف والأسلوب

Medium السرعة
Excellent النوعية
نعم الاستنساخ
5 اللغات

حول المناطق

s. It supports voice cloning from 5-30 seconds of reference audio and can modulate the emotional tone of generated audios. It supports voice cloning from 5-30 seconds of reference audio and can modulate the emotional tone of generated audios. It supports voice cloning from 5-30 seconds of reference audio and can modulate the emotional tone of generated audios to create

السمات الرئيسية

التحكم في المشاعر

التحكم في مشاعر الكلام: السعادة، الحزن، الغضب، الخوف، المفاجأة، الإشمئزاز، والحياد.

استنساخ الصوت

استنساخ أي صوت من 5-30 ثانية من السمعي المرجعي مع الصدق العالي.

الخطاب التعبيري

تنتج البارامترات 1.6B حديثا تعبيريا للغاية مع تقديم عاطفي دقيق.

تعدد اللغات

يدعم اللغة الإنجليزية واليابانية والصينية والفرنسية والألمانية.

حالات الاستخدام

إنشاء محتوى يعبر عن العواطف أصوات شخصيات الألعاب مع العواطف سرد الكتب السمعية مع المزاج تجارب صوتية تفاعلية

كيف تستخدم المناطق

  1. 1

    تسجيل أو فتح العرض

    إنشاء حساب مجاني TextToSpeechAI للحصول على ائتمانات البدء، أو استخدام البيان العملي لا التسجيل لتجربة زونوس على الفور.

  2. 2

    اختار محرك زونوس

    انقر على زر "Zonos" من قائمة الصوت والنموذج. لاستنساخ صوت، قم بتحميل 5-30 ثانية من الصوت المرجعي النظيف حتى يمكن لـ"Zonos" أن يطابق المتحدث.

  3. 3

    أدخل نصك

    كتابة أو لصق النص الذي تريد أن يقال. زونوس يعمل عبر الإنجليزية، الياباني، الصيني، الفرنسي، الألمانية.

  4. 4

    اختار مشاعرك و تولد

    اختار واحد من سبعة مشاعر زونوس - محايد، السعادة، الحزن، الغضب، الخوف، المفاجأة، أو الإشمئزاز - ثم انقر على توليد لجعل كلمة تعبيرية في ذلك المزاج.

  5. 5

    تنزيل أو استخدام API

    تشغيل وتنزيل الصوت المنتهي، أو استدعاء نفس محرك زونوس برمجية من خلال REST API TextToSpeechAI لعمليات التدفق الآلية.

المناطق ألف - استعراض البرنامج

توليد الكلام البرمجي باستخدام TextToSpeechAI REST API.

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "\u0022زونوس\u0022 ينتج كلماته التعبيرية المذهلة مع التحكم العاطفي الدقيق",
    "voice": "en_US-lessac-medium"
  }'

الأسئلة المتكررة

(زونوس) هو نموذج لتحويل النص إلى صوت من (زيفرا) ببارامترات 1.6 بليون نقطة، وهو متخصص في توليد صوت تعبيري مع التحكم في المشاعر بصورة دقيقة واستنساخ الصوت بصورة دقيقة، ويعمل على (TextToSpeechAI) كمحرك ذو طبقة فائقة لأكثر الصوتيات غموضاً وغنيةً بالمشاعر.

نعم، يصدر زونوس تحت ترخيص أباشي 2.0 لكل من شفرته وأوزان نماذجه، وبالتالي يمكن استخدامه بحرية في المنتجات التجارية دون قيود تتعلق بالنسب أو غير تجارية. وهذا يجعله آمناً للتطبيقات المدفوعة الأجر، وعمل العملاء، والمحتوى الممول.

يعرض زونوس سبع حالات عاطفية - محايدة، سعادة، حزن، غضب، خوف، مفاجأة، وامتصاص - التي تختارها قبل توليدها. ويشترط النموذج تسليمه على المشاعر المختارة، وتغيير النبرة، والوتيرة، والنبرة بحيث يمكن أن تبدو الجملة نفسها سعيدة أو غاضبة. وهذا يجعل زونوس مثاليا لأصوات الشخصيات والحوار الذي يحتاج إلى مزاج محدد.

يدعم زونوس سبع خيارات عاطفية: الحياد، والسعادة، والحزن، والغضب، والخوف، والمفاجأة، والانزعاج. يمكنك اختيار واحد لكل جيل لتحديد النبرة العاطفية للمقطع الكامل.

نعم، تقوم زونوس باستنساخ صوت من 5 إلى 30 ثانية فقط من الصوت المرجعي، واستخراج خصائص المتحدث وإعادة إنتاجها في كلمة جديدة. ويمكنك الجمع بين الاستنساخ وأي من المشاعر السبعة لجعل الصوت المستنسخ يبدو سعيداً، غاضبا، أو خائفا.

يتعامل زونوس مع خمس لغات: الإنجليزية، اليابانية، الصينية، الفرنسية، الألمانية. التحكم في المشاعر واستنساخ الصوت يعملان عبر كل هذه اللغات.

يقوم زونوس بالعمل بسرعة متوسطة بسبب حجمه 1.6B، ويقوم بتداول العرض الخام لتحقيق مخرج ممتاز وعالي التعبير. والجودة من بين أفضلها للكلمات العاطفية والمستنسخة، لذا فهي مناسبة للإنتاج الصوتي النهائي بدلاً من توليد الوقت الحقيقي بالجملة.

تحتاج زونوس إلى 8 جيجا بايت أو أكثر من ذاكرة العرض لنموذجها 1.6B. يوصى بمعالج رسوميات بـ 10 جيجا بايت على الأقل للتشغيل المريح عند الجمع بين استنساخ الصوت والتحكم في المشاعر. على TextToSpeechAI كل هذا يعمل على خلفية المعالج الرسوميات، لذلك لا تحتاج إلى معدات خاصة بك.

إن زونوس محرك ذو طبقة فائقة، ويتم رسومه بقيمة 50 نقطة لكل 1000 حرف. ويعكس الطبقة الفائقة نموذجه الكبير وقدراته المتقدمة في مجال العواطف والاستنساخ، وهو نفس المستوى الذي يمثله StyleTTS2، و Tortoise، و OpenVoice.

كل منهما يقدم أسلوب ومشاعر التحكم مع استنساخ الصوت. زونوس يوفر سبع حالات مشاعر منفصلة و 1.6B حديثة البنية التحتية، في حين أوبن فويس يوفر أساليب صوت مثل صديق، سعيد، وهمس مع استنساخ فوري سريع جدا. اختار زونوس عندما تريد اختيار المشاعر الصريحة وأقصى قدر من التعبير؛ اختار أوبن فويس لخفيف، وسريعة تحول الصوت.

يقوم برك بإضافة علامات تعبيرية مثل [ضحك] و [تنفس] ولكنه يقدم استنساخ محدود، ويركز ديّا على الحوار بين متحدثين متعددين مع أصوات غير لفظية. ويركز زونوس على اختيار المشاعر الصريحة بالإضافة إلى استنساخ الصوت الواحد القوي، مما يعطيك تحكماً دقيقاً على مزاج كل مقطع. اختار المحرك الذي يتوافق معك سواء كنت بحاجة إلى علامات المشاعر، أو تحولات الحوار، أو المشاعر القابلة للاختيار.

نعم، حسابات TextToSpeechAI الجديدة تحصل على ائتمانات بدء مجانية، ويسمح لك العرض التجريبي بإنشاء عينة صوتية دون التسجيل، وهذا كافٍ لاختبار تحكم زونوس في المشاعر واستنساخ الصوت قبل شراء ائتمانات إضافية.

Technical Specs

  • Generation Speed Medium
  • Output Quality Excellent
  • Voice Cloning Supported
  • Languages 5
  • GPU VRAM 8GB+
  • Credits/1000 chars 50

Try المناطق Now

Generate your first audio free. No credit card required.

Start Free