CosyVoice2

Premium

Nollalaukauksinen monikielinen äänikloonaus suoratoistotuella

Fast Nopeus
Very Good Laatu
Kyllä Kloonaus
5 Kielet

Tietoja CosyVoice2

CosyVoice2 on FunAudioLLM:n (Albaba) seuraavan sukupolven puhesynteesimalli. Se tarjoaa luonnolta kuulostavaa nollalaukauksen äänikloonausta useilla kielillä ja mahdollistaa streamauksen matalan latenssin sovelluksiin. Se perustuu rajalliseen scalar-määrittelyyn, ja sillä saavutetaan erinomainen äänen samankaltaisuus vain muutaman sekunnin referenssiäänellä.

Tärkeimmät ominaisuudet

Nollakuuman äänen kloonaus

Kloonaaa 3-10 sekunnin referenssiäänen korkealla uskollisuudella.

Monikielinen

Tukee kiinaa, englantia, japania, koreaa ja kantonilaista ylikielisellä synteesillä.

Tuki virtaa

Matalan viiveen suoratoistotila reaaliaikaisiin sovelluksiin ja vuorovaikutteisiin järjestelmiin.

Luonnollinen mainos

Advanced prosody -mallisto tuottaa luonnolta kuulostavaa puhetta sopivalla intonaatiolla.

Käytä tapauksia

Monikielinen sisällön luominen Reaaliaikaiset ääniavustajat Ristiinkielinen dubbaus Henkilökohtaiset äänisovellukset

Miten lääkettä käytetään CosyVoice2

  1. 1

    Rekisteröidy ja vaadi ilmaisia opintopisteitä

    Luo ilmainen TextToSpeechAI-tili, jolla voit hakea aloituskomennuksesi tai kokeilla demoa ensin. Ei GPU:ta tai paikallista CosyVoice2-asennusta tarvita - kaikki toimii infrastruktuurissamme.

  2. 2

    Valitse CosyVoice2 ja lisää viitelippis

    Valitse moottoriksesi CosyVoice2 ja lataa sen jälkeen puhdas 3-10 sekunnin referenssitallennus äänestä, jonka haluat kloonata. CosyVoice2 poimii kaiuttimen ominaisuudet nollalaukauksen monikielinen kloonaus.

  3. 3

    Syötä teksti millä tahansa tuetulla kielellä

    Kirjoita tai liitä käsikirjoitus kiinaksi, englanniksi, japaniksi, koreaksi tai kantoniksi. CosyVoice2 tukee ylikielteistä synteesiä, joten kloonattu ääni voi puhua eri kieltä kuin viiteliitteen.

  4. 4

    Luo puhe

    Klikkaa luo ja CosyVoice2 syntetisoi luonnollisen, monikielinen puhe kloonatulla äänellä, yleensä sekunneissa lyhyen tekstin takia. Huipputason käyttö maksaa 25 op tuhannesta merkistä.

  5. 5

    Lataa tai käytä API-rajapintaa

    Lataa valmis ääni MP3- tai WAV-levynä historiastasi tai automatisoi CosyVoice2-äänen kloonaus mittakaavassa TextToSpeechAI REST API:n kautta.

CosyVoice2 API

Luo puheohjelmallisesti TextToSpeechAI REST API:n avulla.

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "CosyVoice2 tarjoaa luonnollista monikielinen puhe, jossa on nollalaukausta äänen kloonauskykynä.",
    "voice": "en_US-lessac-medium"
  }'

Usein kysyttyjä

CosyVoice2 on FunAudioLLM:n (Albaba) seuraavan sukupolven teksti-äänten kloonausmalli. Se tukee nollakuormitusta vain muutamasta sekunnin mittaisesta referenssiäänestä ja voi syntetisoida luonnollista puhetta kiinaksi, englanniksi, japaniksi, korealaiseksi ja kantoniseksi. TextToSpeechAI:lla voit ajaa CosyVoice2:ta selaimessa ilman paikallista ohjelmaa.

CosyVoice2 on täysin Apache 2.0 -lisenssin saanut – sekä koodi että mallipainot. Näin on turvallista käyttää kaupallisissa tuotteissa, maksullisessa sisällössä ja asiakastyössä ilman lisenssimaksuja tai ei-kaupallisia rajoituksia.

CosyVoice2 tukee viittä kieltä: kiinaa (mandariinia), englantia, japania, koreaa ja kantonia. Se käsittelee myös ylikielten synteesiä, joten ääni voidaan kloonata yhdellä kielellä ja saada aikaan puhe toisessa.

CosyVoice2 poistaa kaiuttimen ominaisuudet rajallisella scalar-kvantisointimenetelmällä ja synnyttää sitten uuden puheen kloonatulla äänellä kaikilla sen tukemilla kielillä. Mallikoulutusta tai hienosäätöä ei tarvita.

CosyVoice2 on yksi vahvempia monikielisiä kloonausmalleja, ja se säilyttää puhujan identiteetin myös silloin, kun se tuottaa puhetta eri kielellä kuin viitelippis. Se tuottaa luonnollista prosodiaa ja intonaatiota, mikä tekee siitä sopivan ylikielisille dubbaus- ja lokalisoituun sisältöön.

Kyllä. CosyVoice2 on nopea malli, ja siihen kuuluu suoratoistotila, joka tuottaa ääntä matalalla viiveellä, mikä tekee siitä sopivan ääniavustajille ja vuorovaikutteisille sovelluksille. TextToSpeechAI sukupolvea on yleensä valmis sekunneissa lyhyeen tekstiin.

CosyVoice2 vaatii 0,5B-parametrimalliin noin 4-6GB VRAM-muistia, joten 6GB:n tai sitä enemmän omaa mittaria suositellaan. TextToSpeechAI:n kohdalla malli toimii GPU-infrastruktuurissamme, joten omaa laitteistoa ei tarvita.

CosyVoice2 on huippuluokan malli, joka maksaa 25 krediitiä tuhatta kirjainta kohti. Jokainen uusi tili saa ilmaiset aloituskomennukset, joten voit kokeilla CosyVoice2 -äänen kloonausta ennen kuin päätät maksullisesta suunnitelmasta.

Molemmat ovat korkealuokkaisia äänen kloonausmoottoreita. GPT-SoVITS saavuttaa usein suurimman raa'an samankaltaisuuden yhden kohdeäänen kohdalla, kun taas CosyVoice2 on vahvempi monikielisessä ja ylikielisessä kloonauksessa ja tuo matalan viiveen suoratoistotilan. Valitse CosyVoice2, kun tarvitset yhden kloonatun äänen puhuaksesi useita kieliä.

Molemmissa on laadukas nollaäänikloonaus. CosyVoice2 tukee enemmän kieliä (5 vastaan 2) ja lisää suoratoistoa reaaliaikaiseen käyttöön, kun taas F5-TTS voi olla hieman nopeampi vain englanninkielisten työmäärien osalta. Monikielisissä projekteissa CosyVoice2 on yleensä parempi vaihtoehto.

TextToSpeechAI mahdollistaa CosyVoice2-sukupolvien viennin yhteisissä formaattien, kuten MP3:n ja WAV:n, kautta. Voit ladata tiedoston suoraan historiasivultasi tai hakea sen ohjelmallisesti TextToSpeechAI API:n kautta.

Kyllä. Voit testata CosyVoice2:ta ilmaisella demolla ja ilmaisella starttikorteilla TextToSpeechAI:lla asentamatta mitään. Voit vain kirjautua, ladata lyhyen viiteliitteen, kirjoittaa tekstisi millä tahansa tuetulla kielellä ja luoda.

Technical Specs

  • Generation Speed Fast
  • Output Quality Very Good
  • Voice Cloning Supported
  • Languages 5
  • GPU VRAM 4-6GB
  • Credits/1000 chars 25

Try CosyVoice2 Now

Generate your first audio free. No credit card required.

Start Free