ویتس

Standard

TTS سریع پایان به پایان با گفتار طبیعی

Very Fast سرعت
Good کیفیت
نه شبیه‌سازی
1 زبانها

در مورد ویتس

-efficient, and highly-efficient neural TTS model that generates natural-sounding speech. It combines variational autoencoders with adversarial learning for

ویژگیهای کلیدی

ترکیب سریع

معماری پایان به پایان برای تولید سریع گفتار.

پردازش دسته ای

این برنامه می‌تواند چندین برنامه را همزمان اجرا کند.

گفتار طبیعی

آموزش VAE+GAN تولید نظم و ریتم طبیعی را فراهم می‌کند.

چند بلندگو

این مدل از چند صدای مختلف پشتیبانی می‌کند.

کارآمد

حافظه با کیفیت پایین با عملکرد خوب.

منبع باز

هر نوع استفاده از آن ممنوع است.

موارد استفاده

تولید صوتی دسته بسترهای یادگیری الکترونیکی خوانندگان خبرName اعلامیه‌های خودکار سیستم‌های IVR محتوای حجم بالا

ویتس Voices

View All 109
LJSpeech (English Female)
EN
VCTK Speaker 225 (English Female)
EN
VCTK Speaker 226 (English Male)
EN
VCTK Speaker 227 (English Male)
EN
VCTK Speaker 228 (English Female)
EN
VCTK Speaker 229
EN
VCTK Speaker 230
EN
VCTK Speaker 231
EN
VCTK Speaker 232
EN
VCTK Speaker 233
EN
VCTK Speaker 234
EN
VCTK Speaker 236
EN

چطور استفاده شود ویتس

  1. 1

    ثبت نام مجانی

    یک حساب رایگان TextToSpeechAI ایجاد کنید تا اعتبار اولیه را دریافت کنید.

  2. 2

    انتخاب صدا یا بلندگوهای VITS

    در کتابخانه صداها جستجو کنید و صدایی را که با نشان VITS نشان داده شده است ، انتخاب کنید. کتابخانه VITS چند بلندگو ، از جمله مجموعه بلندگوهای VCTK ، به شما اجازه می‌دهد که از میان صداهای متمایز زیادی انتخاب کنید.

  3. 3

    وارد کردن متن

    متنی را که می‌خواهید در ویرایشگر خوانده شود ، تایپ یا چسبانید. VITS ، گذرگاه‌های طولانی را به خوبی مدیریت می‌کند و برای محتوای دسته و حجم بالا ایده‌آل است.

  4. 4

    تولید صدا

    برای ساخت گفتار با VITS ، تولید را فشار دهید. چون VITS بسیار سریع و سطح استاندارد است (۱۰ امتیاز در ۱۰۰۰ نویسه)، نتایج سریعاً با هزینه کم برمی‌گردند.

  5. 5

    دانلود یا استفاده از API

    فایل صوتی نهایی را به صورت MP3، WAV یا OGG دانلود کنید یا همان صدای VITS را از طریق API REST TextToSpeechAI برای خودکارسازی تولید در برنامه خود فراخوانی کنید.

ویتس API

این برنامه با استفاده از TextToSpeechAI REST API تولید می‌شود.

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "VITS ارائه سخنرانی سریع و طبیعی برای برنامه‌های حجم بالا است.",
    "voice": "vits-ljspeech"
  }'

پرسشهای متداول

VITS (استنتاج متغیر با یادگیری رقابتی برای متن به گفتار پایان به پایان) یک مدل TTS عصبی پایان به پایان است که یک کدگذار خودکار متغیر را با آموزش GAN رقابتی ترکیب می‌کند. در یک گذر، گفتار طبیعی را تولید می‌کند ، که آن را سریع و کارآمد می‌کند. شما می‌توانید VITS را در TextToSpeechAI رایگان امتحان کنید.

بله ، VITS منبع باز تحت مجوز MIT است ، بنابراین از استفاده تجاری کامل بدون محدودیت پشتیبانی می‌کند. این به‌طور گسترده در محصولات و خدمات تجاری استفاده می‌شود. در TextToSpeechAI ، VITS هزینه ۱۰ کرید برای ۱۰۰۰ کاراکتر در سطح استاندارد دارد.

TextToSpeechAI یک کتابخانه بزرگ چند بلندگو VITS را ارائه می‌دهد ، از جمله مجموعه صدا VCTK با دهها بلندگوهای انگلیسی متمایز. یک مدل VITS واحد می‌تواند چندین بلندگو را میزبانی کند ، بنابراین می‌توانید از میان صداهای مختلف بدون تغییر موتورها انتخاب کنید.

صداهای VITS در TextToSpeechAI انگلیسی هستند ، که از مجموعه‌های بلندگوهای LJSpeech و VCTK گرفته شده‌اند. برای زبان‌های دیگر ، از صداهای Piper یا Bark استفاده کنید.

معماری پایان به پایان آن از مراحل پردازش چند گانه مدل‌های دیگر جلوگیری می‌کند، که به همین دلیل VITS برای ترکیب بسته و حجم بالا مناسب است.

نه ، VITS از شبیه‌سازی صدا پشتیبانی نمی‌کند. به جای رونوشت صدای هدف از نمونه ، از مدل‌های چند بلندگو پیش‌آموزی شده استفاده می‌کند. برای شبیه‌سازی صدا ، از ابزار صدای شبیه‌سازی استفاده کنید ، که Chatterbox را اجرا می‌کند.

VITS صدای با کیفیت خوب با ریتم و قافیه طبیعی تولید می‌کند. در حالی که در سطح StyleTTS 2 یا Tortoise نیست ، کیفیت عالی برای سرعت خود را ارائه می‌دهد ، به ویژه برای پردازش دسته ای.

VITS حافظه مؤثر است، معمولاً فقط نیاز به چند GB از VRAM (در حدود ۴GB) دارد. به راحتی در GPUهای مصرف‌کننده اجرا می‌شود، و در TextToSpeechAI تمام رندرها در سرورهای ما رخ می‌دهد، بنابراین نیازی به سخت‌افزار خود ندارید.

VITS و Piper هر دو موتورهای سریع MIT-licensed در TextToSpeechAI هستند. Piper سبک‌ترین گزینه است و هزینهٔ آن ۱ کرون در هر ۱۰۰۰ کاراکتر است، در حالی که VITS (۱۰ کرون در هر ۱۰۰۰ کاراکتر) یک کتابخانهٔ بزرگ چندزبانه (شامل VCTK) با یک کمی بیشتر از نظم طبیعی را ارائه می‌دهد.

VITS موتوری استاندارد است که هزینه آن ۱۰ کرید در هر ۱۰۰۰ کاراکتر است. تنها Piper با هزینه ۱ کرید در هر ۱۰۰۰ کاراکتر هزینه کمتری دارد.

VITS صدا را در ۲۲۰۵۰ هرتز تولید می‌کند. از طریق TextToSpeechAI می‌توانید فرمت‌های MP3 ، WAV یا OGG را درخواست کنید ، با تبدیل خودکار برای شما.

برای دریافت اعتبار رایگان در TextToSpeechAI ثبت نام کنید، سپس یک صدای VITS را انتخاب کنید، متن خود را وارد کنید و صدا را تولید کنید. همچنین می‌توانید به VITS از طریق API REST ما دسترسی داشته باشید.

Technical Specs

  • Generation Speed Very Fast
  • Output Quality Good
  • Voice Cloning Not Supported
  • Languages 1
  • GPU VRAM 1-2GB
  • Credits/1000 chars 10

Try ویتس Now

Generate your first audio free. No credit card required.

Start Free