ভিটিএস

Standard

প্রাকৃতিক কথার সাথে দ্রুত শেষ-থেকে-শেষ TTS

Very Fast গতি
Good গুণমান
না ক্লোনিং
1 ভাষা

পরিচিতি ভিটিএস

-to-end neural TTS model that generates natural-sounding speech. It combines variational autoencoders with adversarial learning for

প্রধান বৈশিষ্ট্য

দ্রুত সংশ্লেষণ

দ্রুত বাক্যের উৎপাদনের জন্য শেষ-থেকে-শেষ স্থাপত্য।

ব্যাচ প্রসেসিং

একাধিক টেক্সট একসাথে কার্যকরভাবে প্রসেস করুন।

প্রাকৃতিক বক্তৃতা

VAE+GAN প্রশিক্ষণ প্রাকৃতিক প্রসদ এবং রীতি তৈরি করে।

বহু- স্পিকার

একক মডেল একাধিক স্পিকারের কন্ঠ সমর্থন করে।

দক্ষ

ভাল পারফরম্যান্সের সাথে কম মেমরি ব্যবহার করে ।

ওপেন সোর্স

MIT লাইসেন্স, যে কোন কাজে ব্যবহারের জন্য।

ব্যবহারের ক্ষেত্রে

ব্যাচ অডিও উৎপাদন ই-লর্নিং প্ল্যাটফর্ম নিউজ রিডারName স্বয়ংক্রিয় ঘোষনা আইভিআর সিস্টেম উচ্চ- ভলিউম বিষয়বস্তু

ভিটিএস Voices

View All 109
LJSpeech (English Female)
EN
VCTK Speaker 225 (English Female)
EN
VCTK Speaker 226 (English Male)
EN
VCTK Speaker 227 (English Male)
EN
VCTK Speaker 228 (English Female)
EN
VCTK Speaker 229
EN
VCTK Speaker 230
EN
VCTK Speaker 231
EN
VCTK Speaker 232
EN
VCTK Speaker 233
EN
VCTK Speaker 234
EN
VCTK Speaker 236
EN

ব্যবহারের নিয়ম ভিটিএস

  1. 1

    বিনামূল্যে নিবন্ধন করুন

    স্টার্টার ক্রেডিট পেতে একটি বিনামূল্যে TextToSpeechAI অ্যাকাউন্ট তৈরি করুন।

  2. 2

    VITS শব্দ বা স্পিকার নির্বাচন করুন

    শব্দ লাইব্রেরী ব্রাউজ করুন এবং VITS ব্যাজ দ্বারা চিহ্নিত একটি শব্দ নির্বাচন করুন। VCTK স্পিকার সেট সহ বহু- স্পিকার VITS লাইব্রেরী আপনাকে অনেক ভিন্ন শব্দ নির্বাচন করতে দেয়।

  3. 3

    আপনার লেখা লিখুন

    আপনি যে লেখাটি লিখতে চান তা টাইপ করুন অথবা এডিটর- এ সাঁটান। VITS দীর্ঘ লেখার ক্ষেত্রে ভালভাবে কাজ করে এবং ব্যাচ এবং উচ্চ পরিমাণের বিষয়বস্তুর ক্ষেত্রে এটি খুবই উপযোগী।

  4. 4

    অডিও তৈরি করুন

    VITS ব্যবহার করে শব্দ সংশ্লেষণ করতে ক্লিক করুন। VITS খুব দ্রুত এবং স্ট্যান্ডার্ড- স্তর (প্রতি ১০০০ অক্ষর ১০ ক্রেডিট) হওয়ায় ফলাফল দ্রুত এবং কম খরচে পাওয়া যায়।

  5. 5

    API ডাউনলোড অথবা ব্যবহার করুন

    MP3, WAV, অথবা OGG হিসাবে শেষ অডিও ডাউনলোড করুন, অথবা TextToSpeechAI REST API-র মাধ্যমে VITS শব্দটি ডাকুন আপনার নিজের অ্যাপ্লিকেশনে স্বয়ংক্রিয়ভাবে উত্পাদন করার জন্য।

ভিটিএস অ্যাপলিকেশন প্রযুক্তিগত তথ্যের সংগ্রহস্থল (API)

TextToSpeechAI REST API ব্যবহার করে প্রোগ্রামিং দ্বারা বাক্যের উৎপাদন করুন।

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "VITS দ্রুত, উচ্চ পরিমাণ অ্যাপ্লিকেশনের জন্য প্রাকৃতিক কথা প্রদান করে।",
    "voice": "vits-ljspeech"
  }'

প্রায়শ জিজ্ঞাসিত প্রশ্ন

VITS (Variation Inference with adversarial learning for end-to-end Text-to-Speech) একটি নিউরাল TTS মডেল যা একটি variation autoencoder এবং adversarial GAN প্রশিক্ষণকে একত্রিত করে। এটি একটি একক পাস-এ প্রাকৃতিক-স্বরযুক্ত কথা তৈরি করে, যা এটি দ্রুত এবং কার্যকর করে তোলে। আপনি VITS বিনামূল্যে TextToSpeechAI-এ পরীক্ষা করতে পারেন।

হ্যাঁ, VITS MIT লাইসেন্সের অধীনে উন্মুক্ত উৎস, তাই এটি সম্পূর্ণ বাণিজ্যিক ব্যবহারকে কোন বাধা ছাড়া সমর্থন করে। এটি ব্যাপকভাবে বাণিজ্যিক পণ্য এবং পরিষেবাতে ব্যবহৃত হয়। TextToSpeechAI-এ, VITS-এর মূল্য হল প্রতি ১০০০ অক্ষরের জন্য ১০ ক্রেডিট।

TextToSpeechAI একটি বড় মাল্টি- স্পিকার VITS লাইব্রেরী প্রদান করে, VCTK শব্দ সেট সহ ডজনের মত আলাদা ইংরেজি স্পিকার সহ । একটি VITS মডেল অনেক স্পিকার হোস্ট করতে পারে, তাই আপনি ইঞ্জিন পরিবর্তন না করে অনেক ভিন্ন শব্দ থেকে বেছে নিতে পারেন ।

TextToSpeechAI-এর VITS শব্দগুলো ইংরেজি, LJSpeech এবং VCTK স্পিকার সেট থেকে নেওয়া। অন্যান্য ভাষার জন্য, Piper অথবা Bark শব্দ ব্যবহার করুন।

VITS খুব দ্রুত, বাস্তব সময়ে বা GPU-এর উপর দ্রুততরভাবে কথা তৈরি করে। এর শেষ-থেকে-শেষ স্থাপত্য অন্যান্য মডেলের একাধিক প্রক্রিয়াকরণ পর্যায় এড়িয়ে যায়, যে কারণে VITS ব্যাচ এবং উচ্চ পরিমাণ সংশ্লেষণের জন্য ভালভাবে উপযুক্ত।

না, VITS শব্দ ক্লোন সমর্থন করে না। এটি একটি নমুনা থেকে লক্ষ্য শব্দ অনুলিপি করার পরিবর্তে পূর্বে প্রশিক্ষিত বহু-স্পিকার মডেল ব্যবহার করে। শব্দ ক্লোন করার জন্য, ক্লোন শব্দ টুল ব্যবহার করুন, যা Chatterbox চালায়।

VITS প্রাকৃতিক প্রসোডি এবং রীতির সাথে ভাল মানের অডিও উৎপাদন করে । যদিও এটি StyleTTS2অথবা Tortoise এর মানের মত নয়, এটি তার গতি, বিশেষ করে ব্যাচ প্রসেসিং এর জন্য অসাধারণ মানের অফার করে ।

VITS মেমরি-সমৃদ্ধ, সাধারণত মাত্র কয়েক GB VRAM (প্রায় ৪GB) প্রয়োজন হয়। এটি গ্রাহক GPUs-এ আরামদায়কভাবে চলতে পারে, এবং TextToSpeechAI-এ সব রেন্ডারিং আমাদের সার্ভারে ঘটে তাই আপনার নিজের কোন হার্ডওয়্যারের প্রয়োজন হয় না।

VITS এবং Piper উভয়ই দ্রুত, MIT- লাইসেন্সকৃত ইঞ্জিন TextToSpeechAI-এ। Piper সবচেয়ে হালকা অপশন এবং প্রতি ১,০০০ অক্ষরের জন্য ১ ক্রেডিট খরচ হয়, যখন VITS (প্রতি ১০,০০০ অক্ষরের জন্য ১০ ক্রেডিট) একটি বড় মাল্টি-স্পিকার লাইব্রেরী (VCTK সহ) প্রদান করে যা কিছুটা বেশি প্রাকৃতিক প্রসন্নতা সহকারে। কোনটিই শব্দের ক্লোনিং সমর্থন করে না।

VITS একটি স্ট্যান্ডার্ড- টাইর ইঞ্জিন, যার মূল্য ১০ ক্রেডিট প্রতি ১০০০ অক্ষর। শুধু পাইপার, ১ ক্রেডিট প্রতি ১০০০ অক্ষর, কম খরচ হয়।

VITS ২২০৫০Hz-এ অডিও উৎপাদন করে। TextToSpeechAI-এর মাধ্যমে আপনি MP3, WAV, অথবা OGG ফরম্যাট অনুরোধ করতে পারেন, স্বয়ংক্রিয় রূপান্তর আপনার জন্য পরিচালিত হয়।

TextToSpeechAI-এ নিবন্ধন করুন বিনামূল্যে শুরুর জন্য ক্রেডিট পেতে, তারপর VITS শব্দ নির্বাচন করুন, আপনার লেখা লিখুন এবং অডিও তৈরি করুন। আপনি আমাদের REST API-র মাধ্যমে VITS ব্যবহার করতে পারেন যখন আপনি নিবন্ধন করবেন।

Technical Specs

  • Generation Speed Very Fast
  • Output Quality Good
  • Voice Cloning Not Supported
  • Languages 1
  • GPU VRAM 1-2GB
  • Credits/1000 chars 10

Try ভিটিএস Now

Generate your first audio free. No credit card required.

Start Free