جعبه گفتگو

Premium

شبیه‌سازی صدای Zero-shot با سخنرانی بیانی در ۲۳ زبان

Fast سرعت
Very Good کیفیت
آره شبیه‌سازی
23 زبانها

در مورد جعبه گفتگو

[Translation temporarily unavailable. Please try again.]

ویژگیهای کلیدی

شبیه‌سازی صدای Zero-Shot

هر صدایی را از چند ثانیه صدا کپی کنید - آموزش لازم نیست.

زبان ۲.

از عربی تا چینی، که بیشتر زبانهای بزرگ دنیا را پوشش می‌دهد.

برچسبهای بیانگر

اضافه کردن [خنده]، [سرفه]، [خنده] برای صداهای طبیعی پارازبانی.

استنتاج سریع

تاخیر زیر ۲۰۰ مگابیت با توربو برای برنامه‌های زمان واقعی.

موارد استفاده

شبیه‌سازی صدا برای ایجاد محتوا کاربردهای صدای چندزبانهName طراحی صدای شخصیت‌ها برای بازی‌ها دستیارهای شخصی صدا

چطور استفاده شود جعبه گفتگو

  1. 1

    ثبت نام یا باز کردن نمایش

    Create a free TextToSpeechAI account to claim 200 starter credits, or use the on-page demo to try Chatterbox without signing in.

  2. 2

    انتخاب Chatterbox و اضافه کردن ویدئو مرجع

    موتور Chatterbox را انتخاب کنید ، سپس یک کلیپ صوتی کوتاه (چند ثانیه) از صدایی که می‌خواهید شبیه‌سازی کنید را بارگذاری کنید. Chatterbox Zero- Shot آن را بلافاصله شبیه‌سازی می‌کند — آموزش لازم نیست.

  3. 3

    وارد کردن متن با برچسبهای اختیاری

    متن را تایپ یا کپی کنید تا در هر یک از ۲۳ زبان پشتیبانی شده صحبت کنید و برچسب‌های [خنده]، [سرفه]، یا [خنده] را در هر جایی که صداهای طبیعی پارازبانی را می‌خواهید، بگذارید.

  4. 4

    تولید گفتار

    Click generate and TextToSpeechAI renders your text in the cloned Chatterbox voice on hosted GPU infrastructure, spending 25 credits per 1,000 characters.

  5. 5

    دانلود یا استفاده از API

    فایل صوتی نهایی را دانلود کنید یا تولید خودکار را از طریق API REST TextToSpeechAI در api.texttospeechai.com با استفاده از توکن حساب خود انجام دهید.

جعبه گفتگو API

این برنامه با استفاده از TextToSpeechAI REST API تولید می‌شود.

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "چاترباکس می‌تواند صدای شما را از چند ثانیه صدا کپی کند و به ۲۳ زبان صحبت کند.",
    "voice": "en_US-lessac-medium"
  }'

پرسشهای متداول

این نرم‌افزار می‌تواند هر صدایی را از چند ثانیه صدای مرجع بازسازی کند و سخنرانی طبیعی و بیانی را در ۲۳ زبان بدون هیچ آموزشی برای هر صدا تولید کند.

بله ، Chatterbox کاملاً تحت مجوز MIT است — هم کد و هم وزن مدل — بنابراین می‌توانید آزادانه از آن در محصولات تجاری استفاده کنید. صدای تولید شده شامل یک علامت آبی عصبی اختیاری است که می‌تواند غیرفعال شود ، و هیچ حق امتیازی برای استفاده وجود ندارد.

شما یک کلیپ مرجع کوتاه از هر صدا را ارائه می‌دهید (چند ثانیه کافی است) و Chatterbox آن صدا را استخراج می‌کند و سبک را در یک بلندگو جایگزین می‌کند. سپس سخنرانی جدیدی را در آن صدا بدون تنظیم دقیق یا گام آموزشی تولید می‌کند، که به معنی «شلیک صفر» است.

Chatterbox برچسب‌های خطی ویژه را در متن شما می‌خواند تا صداهای غیرکلامی طبیعی را اضافه کند: [laugh] خنده را وارد می‌کند ، [cough] سرفه را وارد می‌کند ، و [chuckle] خنده نرم را وارد می‌کند. فقط برچسب را در جایی که صدا را می‌خواهید قرار دهید ، برای مثال « این خنده دار است [laugh] اما جدی...».

برچسب را مستقیماً در متن ورودی خود در جایی که صدا باید رخ دهد ، با بقیه جمله احاطه شده ، تایپ کنید. Chatterbox صدای پارازبانی را در صدای شبیه سازی شده ، با تلفیق آن با گفتار اطراف ، به گونه ای که به جای تلفیق ، خود به خود به نظر برسد ، نمایش می‌دهد.

چترباکس از ۲۳ زبان پشتیبانی می‌کند که شامل عربی، دانمارکی، آلمانی، یونانی، انگلیسی، اسپانیایی، فنلاندی، فرانسوی، عبری، هندی، ایتالیایی، ژاپنی، کره‌ای، مالزیایی، هلندی، نروژی، لهستانی، پرتغالی، روسی، سوئدی، سواحلی، ترکی و چینی است.

Chatterbox به سرعت در یک GPU گفتار تولید می‌کند، و نسخه توربو به تأخیر زیر ۲۰۰ms برای استفاده مکالمه در زمان واقعی می‌رسد. کیفیت بسیار خوب است، با بازتولید طبیعی و صادقانه صدا حتی از کلیپ‌های مرجع کوتاه.

Chatterbox needs roughly 4-8GB of VRAM depending on the variant, with the Turbo model running comfortably in about 4GB. On TextToSpeechAI you do not need any local GPU - generation runs on our hosted infrastructure.

Chatterbox یک موتور سطح بالا است که هزینه ۲۵ کرید برای هر ۱۰۰۰ کاراکتر دارد. حساب‌های جدید ۲۰۰ کرید رایگان برای آزمایش شبیه‌سازی صدا دریافت می‌کنند، و شما فقط کرید را برای متنی که در واقع تولید می‌کنید خرج می‌کنید.

هر دو از شبیه‌سازی صدای صفر-شلیک پشتیبانی می‌کنند، اما Chatterbox زبان‌های بسیار بیشتری را پوشش می‌دهد (۲۳ در مقابل ۲) و برچسب‌های پارازبانی بیانی را اضافه می‌کند. F5-TTS می‌تواند کمی طبیعی‌تر از زبان انگلیسی باشد، بنابراین Chatterbox را برای شبیه‌سازی چندزبانه و صداهای بیانی انتخاب کنید، و F5-TTS را برای وفاداری فقط انگلیسی.

هر دو شبیه‌سازی صدای با کیفیت بالا را ارائه می‌دهند. Chatterbox از ۲۳ زبان و برچسب‌های بیانی در خط پشتیبانی می‌کند، در حالی که OpenVoice کنترل‌های سبک صدا (دوست‌داشتنی، غمگین، عصبانی و بیشتر) را اضافه می‌کند که Chatterbox ندارند. Chatterbox را برای پوشش گسترده زبان و OpenVoice را هنگامی که به سبک صدای احساسی صریح نیاز دارید انتخاب کنید.

Yes. Sign up for a free TextToSpeechAI account to receive 200 starter credits, or use the on-page demo to hear Chatterbox without signing in. Upload a short reference clip, type your text, and generate a cloned voice in seconds.

Technical Specs

  • Generation Speed Fast
  • Output Quality Very Good
  • Voice Cloning Supported
  • Languages 23
  • GPU VRAM 4-8GB
  • Credits/1000 chars 25

Try جعبه گفتگو Now

Generate your first audio free. No credit card required.

Start Free