ስለ ቪቲስ
-to-end neural TTS model that generates natural-sounding speech. It combines variational autoencoders with adversarial learning for efficient synthesis. VITS is excellent for batch processing and applications requiring high-to-end neural TTS model that generates natural-sounding speech. It combines variational autoencoders with adversarial learning for efficient synthesis. VITS is excellent for batch processing and applications requiring
የዋና ባህሪያት
የፍጥነት ማጣመር
የፍጥነት ንግግር ማምጣት
የባች ሂደት
በአንድ ጊዜ ብዙ ጽሑፎችን በፍጥነት ይፍጠሩ
የቋንቋ አማራጭ
VAE+GAN ስልጠና ተፈጥሯዊ የፕሮሶዲ እና የሪትሚን ትርጓሜን ያመጣል፡፡
ብዙ-ተናጋሪ
አንድ ሞዴል ብዙ ተናጋሪ ድምጾችን ይደግፋል
ፋይል
ጥሩ ውጤት ያለው ዝቅተኛ የማስታወሻ ፋይል
የይዘት ማውጫ
MIT ለሁሉም ጥቅም ወቅት ፈቃድ
ጥቅም
ቪቲስ Voices
View All 109LJSpeech (English Female)
ENVCTK Speaker 225 (English Female)
ENVCTK Speaker 226 (English Male)
ENVCTK Speaker 227 (English Male)
ENVCTK Speaker 228 (English Female)
ENVCTK Speaker 229
ENVCTK Speaker 230
ENVCTK Speaker 231
ENVCTK Speaker 232
ENVCTK Speaker 233
ENVCTK Speaker 234
ENVCTK Speaker 236
ENእንዴት እንደሚጠቀሙ ቪቲስ
-
1
ነጻ ምዝገባ ወይም ዲሞን ይሞክሩ
ነጻ TextToSpeechAI መለያ ለመፍጠር መጀመርያ ክሬዲቶች ለማግኘት, ወይም VITS ከመመዝገብዎ በፊት ለመስማት በገጽ ላይ ዲሞን ይጠቀሙ.
-
2
VITS ድምፅ ወይም ተናጋሪ ይምረጡ
የድምፅ መጽሐፍት ማተሚያውን አሳይ እና በቪቲኤስ ባንዲራ የተቀመጠውን ድምፅ ይምረጡ። የቪቲኤስ መጻሕፍት ማተሚያው በቪሲቲኬ ተናጋሪ ሰሌዳ ውስጥ ከብዙ የተለዩ ድምጾች ውስጥ ይምረጡ።
-
3
ጽሑፉን አስገባ
ጽሑፉን በኢሚዲየር ውስጥ ለመናገር ፈልጉት? ጻፉ ወይም አስቀምጡት. VITS ረጅም ክፍሎችን በደንብ ይይዛል እና ለባች እና ከፍተኛ መጠን ያለው ይዘት ተስማሚ ነው.
-
4
የድምፅ ፋይል
በቪቲኤስ (VITS) ቋንቋን ለማቀናጀት ይጫኑ። ቪቲኤስ በጣም ፈጣንና ስታንዳርድ-ደረጃ (10 ክሬዲቶች በ1000 አርእስቶች ላይ) ስለሆነ፣ ውጤቶች በጥቂት ወጪ በፍጥነት ይመለሳሉ።
-
5
መተግበሪያውን ይጫኑ
የተጠናቀቀውን ድምፅ እንደ MP3, WAV ወይም OGG ያውርዱ፣ ወይም በራስዎ ፕሮግራም ውስጥ ማመቻቸትን ለማመቻቸት በ TextToSpeechAI REST API ውስጥ ተመሳሳይ VITS ድምፅን ጠራ
ቪቲስ መተላለፊያ
የTextToSpeechAI REST APIን በመጠቀም ፕሮግራም በመፍጠር ንግግርን ይፈጥሩ
curl -X POST "https://api.texttospeechai.com/v1/generate/" \
-H "Authorization: Bearer YOUR_API_TOKEN" \
-H "Content-Type: application/json" \
-d '{
"text": "VITS ለከፍተኛ መጠን ፕሮግራሞች ፈጣን, ተፈጥሯዊ ንግግር ይሰጣል.",
"voice": "vits-ljspeech"
}'
ብዙ ጊዜ የሚጠየቁ ጥያቄዎች
Technical Specs
- Generation Speed Very Fast
- Output Quality Good
- Voice Cloning Not Supported
- Languages 10
- GPU VRAM 1-2GB
- Credits/1000 chars 10