پوسته

Premium

سخنرانی هوش مصنوعی بیانی با احساسات و جلوه‌های صوتی

Slow سرعت
Very Good کیفیت
نه شبیه‌سازی
13 زبانها

در مورد پوسته

-text-to-audio (TTS) effects. Bark is a

ویژگیهای کلیدی

بیان احساسی

صدای او با صدای خنده، گریه، گریه کردن و گاهی گریه کردن همراه است.

نشانگرهای احساسی

از [خنده] استفاده کنيد، [تنها]، براي تاکید از حروف بزرگ استفاده کنيد، و... براي ترديد.

چندزبانه

این زبان دارای ۱۳ حرف و تلفظ است.

موسیقی و جلوه‌های آن

می‌تواند موسیقی ساده و صداهای محیطی را تولید کند.

تنظیمات پیش‌فرض بلندگو

تعدادی از خوانندگان با سبک‌های مختلف به این سبک می‌پردازند.

منبع باز

این نرم‌افزار با مجوز MIT و با تمام حقوق تجاری استفاده می‌شود.

موارد استفاده

محاورۀ نویسه محتوای پویانمایی گویندگی کتاب صوتی بازی صدا پروژه‌های خلاقانه دستیارهای بیانی

پوسته Voices

View All 130
Bark Chinese Speaker 0
ZH
Bark Chinese Speaker 1
ZH
Bark Chinese Speaker 2
ZH
Bark Chinese Speaker 3
ZH
Bark Chinese Speaker 4
ZH
Bark Chinese Speaker 5
ZH
Bark Chinese Speaker 6
ZH
Bark Chinese Speaker 7
ZH
Bark Chinese Speaker 8
ZH
Bark Chinese Speaker 9
ZH
Bark English Speaker 0
EN
Bark English Speaker 1
EN

چطور استفاده شود پوسته

  1. 1

    ثبت نام مجانی

    برای درخواست اعتبارهای آغازین خود یک حساب TextToSpeechAI رایگان ایجاد کنید. اعتبارهای رایگان قبل از ارتقا کافی است تا کلیپ‌های Bark چند تایی را تولید کند.

  2. 2

    انتخاب صدای برگ

    کتابخانه صدا را باز کنید و یک تنظیم پیش‌فرض بلندگوهای Bark را که با صدای مورد نظر شما مطابقت دارد ، انتخاب کنید. صداهای Bark به عنوان سطح بالا برچسب‌گذاری می‌شوند (۲۵ امتیاز در ۱۰۰۰ کاراکتر) و برای راوی‌گویی احساسی و سبک شخصیت تنظیم می‌شوند.

  3. 3

    وارد کردن متن با نشانگرهای احساسی

    دست‌نوشتۀ خود را تایپ کنید و نشانگرهای احساس Bark را در خط جاسازی کنید: [خنده] برای خنده ، [خنده] برای ناله ، [خنده] برای نفس کشیدن ،... برای توقف ، و CAPS برای تأکید. برای مثال: « اوه وای! [خنده] این شگفت‌انگیز است... باورم نمی‌شود!»

  4. 4

    تولید صدا

    کلیک بر روی تولید و Bark متن شما را به گفتار بیانی تبدیل می‌کند ، هر نشانگر را به صدای تطابق تبدیل می‌کند. تولید به دلیل مدل مبدل Bark آهسته‌تر از موتورهای سبک است ، بنابراین برای هر جمله چند ثانیه اضافه اجازه دهید.

  5. 5

    دانلود یا استفاده از API

    پیش‌نمایش نتیجه، سپس آن را به صورت MP3، WAV یا OGG بارگیری کنید. برای خودکارسازی Bark در برنامه خود، API TextToSpeechAI را با صدای Bark و همان متن غنی از نشانگر برای بازگرداندن صدای بیانی فراخوانی کنید.

پوسته API

این برنامه با استفاده از TextToSpeechAI REST API تولید می‌شود.

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "اوه واو! اين خارق العاده است... من عاشق اينم که چقدر اين به نظر تعبيري مياد!",
    "voice": "bark-zh_0"
  }'

پرسشهای متداول

Bark یک مدل متن به صدا بر پایه ترانسفر است که توسط Suno ایجاد شده‌است. برخلاف سیستم‌های TTS سنتی، Bark سخنرانی بسیار بیانگر را با احساسات طبیعی، خنده، نفس کشیدن و دیگر صداهای غیرکلامی تولید می‌کند. حتی می‌تواند موسیقی و جلوه‌های صوتی را تولید کند.

بله، Bark منبع بازي تحت مجوز MIT است که اجازه استفاده آزاد تجاری را مي دهد. در TextToSpeechAI، ما 25 کرید را برای هر 1000 کاراکتر به خاطر منابع قابل توجه GPU مورد نیاز برای تولید محاسبه مي کنيم.

Bark از ۱۳ زبان پشتیبانی می‌کند که شامل انگلیسی، آلمانی، اسپانیایی، فرانسوی، هندی، ایتالیایی، ژاپنی، کره‌ای، لهستانی، پرتغالی، روسی، ترکی و چینی است.

Bark به دلیل معماری تبدیل خودبازگشتی خود از اکثر موتورهای TTS کندتر است. تولید یک جمله معمولی ۵ تا ۱۵ ثانیه در GPU طول می‌کشد. معامله به طور قابل توجهی بیانگر و طبیعی تر است.

Bark فقط شبیه‌سازی محدود صدا را از طریق «پیش‌فرض‌های معنایی» و پیش‌فرض‌های بلندگو ارائه می‌دهد، بنابراین نمی‌تواند صدای دلخواه را از یک نمونه به صورت قابل اعتماد شبیه‌سازی کند. برای شبیه‌سازی صدا، از ابزار صدای کلون استفاده کنید که Chatterbox را اجرا می‌کند.

Bark نشانگرهای خطی را که مستقیماً در متن شما قرار داده شده است ، می‌خواند و آنها را به صداهای تطابقی تبدیل می‌کند. از [laugh] برای خنده ، [sighs] برای ناله ، [gasps] برای نفس کشیدن ،... برای تردید یا یک توقف ، و CAPS برای تأکید استفاده کنید. مثال: « اوه وای! [laugh] این شگفت‌انگیز است... باورم نمی‌شود!»

در کنار گفتار ساده، Bark می‌تواند صداهای غیرکلامی مانند خنده، نفس کشیدن، نفس کشیدن، گلوی صاف و لکنت را تولید کند، علاوه بر موسیقی ساده و اثرات محیطی.اینها با نشانگرهایی مانند [خنده]، [نفس کشیدن] و [لغزش] در متن ایجاد می‌شوند، که باعث می‌شود Bark احساس بیشتری نسبت به TTS استاندارد داشته باشد.

Bark صدای با کیفیت بسیار خوبی با بیان طبیعی تولید می‌کند که برای محتوای احساسی با سخن انسان رقابت می‌کند. خروجی ۲۴ کیلوهرتز حرفه‌ای به نظر می‌رسد، اگرچه کیفیت سخن خالص کمی پایین‌تر از StyleTTS2 است.

Bark نیازمند ۸-۱۲ گیگابایت VRAM است که بسته به اندازه مدل متفاوت است. مدل کامل نیازمند ~۱۲ گیگابایت است، در حالی که انواع کوچکتر با ۸ گیگابایت کار می‌کنند.

بله ، Bark دارای مجوز MIT است ، که اجازه استفاده تجاری بدون محدودیت بدون هزینه مجوز را می‌دهد. شما می‌توانید آزادانه از Bark در محصولات ، خدمات و برنامه‌ها استفاده کنید. در TextToSpeechAI می‌توانید قبل از پرداخت برای بیشتر ، Bark را با استفاده از اعتبار ثبت نام خود امتحان کنید.

Bark در بیان بیانی با نشانگرهای احساسی مانند [خنده] و [خندی] در ۱۳ زبان برتری دارد، در حالی که StyleTTS2 پاک‌ترین و طبیعی‌ترین راوی انگلیسی را ارائه می‌دهد. Bark را برای صداهای احساسی و شخصیت‌ها انتخاب کنید، و StyleTTS2 را برای صداگذاری انگلیسی تمیز انتخاب کنید.

Bark در توانایی تولید گفتار واقعی بیانگر با احساسات و صداهای غیرکلامی منحصر به فرد است. از موتورهای دیگر کندتر است ، اما نتایج انسانی بیشتری برای محتوای خلاق تولید می‌کند. برای ترکیب سریعتر ، از Piper استفاده کنید. برای شبیه‌سازی صدا ، از ابزار صدای شبیه‌سازی استفاده کنید ، که Chatterbox را اجرا می‌کند.

Technical Specs

  • Generation Speed Slow
  • Output Quality Very Good
  • Voice Cloning Not Supported
  • Languages 13
  • GPU VRAM 8-12GB
  • Credits/1000 chars 25

Try پوسته Now

Generate your first audio free. No credit card required.

Start Free