تكنولوجيا المعلومات والاتصالات

Standard

تحويل النصوص من نقطة إلى نقطة بسرعة مع الكلام الطبيعي

Very Fast السرعة
Good النوعية
لا الاستنساخ
10 اللغات

حول تكنولوجيا المعلومات والاتصالات

-efficient, and highly-efficient neural TTS model that generates natural-sounding speech. It combines variational autoencoders with autoencoders that are capable of generating variations in the text-to-speech sequence. VITS is a

السمات الرئيسية

التوليف السريع

بنية من البداية إلى النهاية لتوليد الكلام السريع.

التجهيز بالدفعات

تجهيز نصوص متعددة بكفاءة في وقت واحد.

الكلام الطبيعي

وينتج التدريب على VAE+GAN نغمة طبيعية وإيقاعاً طبيعياً.

متحدثون متعددون

النموذج الوحيد يدعم أصوات المتحدثين المتعددة.

فعالة

ذاكرة منخفضة مع أداء جيد.

المصدر المفتوح

MIT مرخصة لأي حالة استخدام.

حالات الاستخدام

توليد الصوت مناهج التعلم الإلكتروني قارئ الأخبار الإعلانات الآلية نظم الاستجابة الهاتفية المتكاملة المحتوى الكبير الحجم

تكنولوجيا المعلومات والاتصالات Voices

View All 109
LJSpeech (English Female)
EN
VCTK Speaker 225 (English Female)
EN
VCTK Speaker 226 (English Male)
EN
VCTK Speaker 227 (English Male)
EN
VCTK Speaker 228 (English Female)
EN
VCTK Speaker 229
EN
VCTK Speaker 230
EN
VCTK Speaker 231
EN
VCTK Speaker 232
EN
VCTK Speaker 233
EN
VCTK Speaker 234
EN
VCTK Speaker 236
EN

كيف تستخدم تكنولوجيا المعلومات والاتصالات

  1. 1

    تسجيل مجاني أو تجربة العرض

    إنشاء حساب مجاني TextToSpeechAI للحصول على ائتمانات البدء، أو استخدام العرض على الصفحة للاستماع إلى VITS قبل التسجيل.

  2. 2

    اختار صوتاً أو متحدثاً من نظام المعلومات الجغرافية

    تصفح مكتبة الأصوات واختار صوتاً يحمل شارة VITS. مكتبة VITS متعددة المتحدثين، بما في ذلك مجموعة مكبرات الصوت VCTK، تسمح لك بالاختيار من بين العديد من الأصوات المتميزة.

  3. 3

    أدخل نصك

    يكتب أو يصطف النص الذي تريد أن يقال في المحرر. VITS يتعامل مع المقاطع الطويلة جيدا وهو مثالي للمحتوى الكمي والكبير الحجم.

  4. 4

    توليد الصوت

    ونظرا لأن نظام VITS سريع جدا وذو مستوى معياري (10 وحدات لكل 000 1 حرف)، فإن النتائج تعود بسرعة وبتكلفة منخفضة.

  5. 5

    تنزيل أو استخدام API

    تحميل الصوت النهائي كMP3، WAV، أو OGG، أو استدعاء نفس صوت VITS من خلال REST API TextToSpeechAI لجعل توليد الصوت آليا في تطبيقك الخاص.

تكنولوجيا المعلومات والاتصالات ألف - استعراض البرنامج

توليد الكلام البرمجي باستخدام TextToSpeechAI REST API.

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "وتقدم هذه التكنولوجيا لغة سريعة وطبيعية للتطبيقات الكبيرة الحجم.",
    "voice": "vits-ljspeech"
  }'

الأسئلة المتكررة

VITS (الاستدلال التبايني مع التعلم المنافس للنص إلى الكلام من النهاية إلى النهاية) هو نموذج TTS عصبي من النهاية إلى النهاية يجمع بين المشفر الذاتي التبايني مع التدريب المنافس ل GAN. إنه يولد كلام طبيعي في مرحلة واحدة، مما يجعله سريعاً وفعالاً. يمكنك تجربة VITS مجاناً على TextToSpeechAI.

نعم، VITS مفتوح المصدر تحت ترخيص MIT، لذلك يدعم الاستخدام التجاري الكامل دون قيود. وهو يستخدم على نطاق واسع في المنتجات والخدمات التجارية. على TextToSpeechAI، VITS تكلفة 10 أرصدة لكل 1000 كلمة على المستوى القياسي.

يقدم TextToSpeechAI مكتبة VITS كبيرة متعددة المتحدثين، بما في ذلك مجموعة الأصوات VCTK مع العشرات من المتحدثين الإنجليزية المتميزة. نموذج واحد من VITS يمكن أن يستضيف العديد من المتحدثين، لذلك يمكنك اختيار من العديد من الأصوات المختلفة دون تغيير المحركات.

ويعتمد دعم نظام المعلومات الجغرافية على النموذج المدرب، وتشمل النماذج المشتركة لنظام المعلومات الجغرافية اللغة الإنكليزية والصينية واليابانية والكورية والألمانية والفرنسية وغيرها من اللغات الرئيسية، مع تغطية اللغة الإنكليزية المتعددة الناطقين من مجموعة بيانات نظام المعلومات الجغرافية.

إن نظام VITS سريع للغاية، حيث ينتج الكلام في الوقت الحقيقي أو أسرع من ذلك على وحدة المعالجة المركزية الرسومية. ويتجنب بنيانها من النهاية إلى النهاية مراحل المعالجة المتعددة للنماذج الأخرى، ولهذا السبب فإن نظام VITS مناسب بشكل جيد للتوليف في دفعات وفي أحجام كبيرة.

لا، VITS لا يدعم استنساخ الصوت. إنه يستخدم نماذج متعددة المتحدثين مدربة مسبقاً بدلاً من نسخ صوت مستهدف من عينة. لاستنساخ الصوت على TextToSpeechAI، استخدم F5-TTS أو GPT-SoVITS بدلاً من ذلك.

وينتج نظام VITS صوتاً جيداً النوعية بصوت طبيعي وإيقاع طبيعي، ورغم أنه ليس على مستوى نظام StyleTTS 2 أو Tortoise، فإنه يوفر جودة ممتازة لسرعة تشغيله، وخاصة في تجهيز المجموعات.

إن VITS فعال في استخدام الذاكرة، ولا يحتاج عادة إلا إلى بضعة جيجابايت من ذاكرة VRAM (حوالي 4 جيجابايت). وهو يعمل بشكل مريح على وحدات المعالجة الرسومية الاستهلاكية، وعلى TextToSpeechAI يحدث كل التمثيل على خوادمنا، لذا فلا تحتاج إلى أي معدات خاصة بك.

VITS وPiper هما محركان سريعا، مرخص من MIT Standard-tier على TextToSpeechAI. Piper هو الخيار الأخف والأسرع، بينما VITS يقدم مكتبة كبيرة متعددة المتحدثين (بما في ذلك VCTK) مع صوت طبيعي أكثر قليلا. لا يدعم أي منهما استنساخ الصوت.

ويعتبر نظام VITS محركاً من المستوى القياسي، بتكلفة 10 أرصدة لكل 1000 حرف، وهو أدنى مستوى تسعيري لدينا بفضل الطبيعة الكفؤة والسريعة لنموذج نظام VITS.

ينتج VITS الصوت على 22050 هرتز أصلاً. من خلال TextToSpeechAI يمكنك طلب MP3، WAV، أو OGG، مع التحويل الآلي الذي يتعامل معك.

انضم إلى TextToSpeechAI للحصول على ائتمانات بدء مجانية، ثم اختر صوت VITS، وأدخل نصك، وصنع الصوت. يمكنك أيضا استخدام العرض للاستماع إلى VITS قبل إنشاء حساب، والوصول إلى VITS من خلال API REST الخاص بنا بمجرد التسجيل.

Technical Specs

  • Generation Speed Very Fast
  • Output Quality Good
  • Voice Cloning Not Supported
  • Languages 10
  • GPU VRAM 1-2GB
  • Credits/1000 chars 10

Try تكنولوجيا المعلومات والاتصالات Now

Generate your first audio free. No credit card required.

Start Free