Ultra

带有情感和风格控制的语音克隆

Medium 速度
Excellent 质量
是 是 克隆
5 语文

关于 子

Zyphra的Zonos是1.6B参数文本到语音模型,具有先进的情感和风格控制。它支持从5-30秒的音频参考后进行语音克隆,并可以调节生成的语音的情绪。从幸福、悲伤、愤怒、恐惧、惊喜和厌恶等情感中选择产生高度表达和情感微调的音频。

关键特征

情感控制

控制言论情绪:快乐、悲伤、愤怒、恐惧、惊异、厌恶和中立。

语音克隆

以高度忠诚 以5 -30秒的音频 来打开任何声音

语音

1.6B参数产生高度表达性的讲话,有微调的情感传递。

多种语文

支持英语、日语、中文、法语和德语。

使用案例

情感表达内容的创造 游戏字符带有情感的声音 充满心情的音频书解说 互动语音体验

如何使用 子

  1. 1

    签名或打开演示

    创建免费的TextToSpeechAI账户以获得初始信用,或使用无签名演示来尝试Zonos立即。

  2. 2

    选择左农引擎

    从声音和模型采集器中选择 Zonos。 要克隆声音, 上传5- 30 秒的清洁参考音频, 使Zonos 能够匹配发言者 。

  3. 3

    输入文本

    左诺斯的作品遍及英文、日文、中文、法文和德文。

  4. 4

    挑挑情感 产生

    选择七种Zonos情绪中的一种, 中立、幸福、悲伤、愤怒、恐惧、惊恐、惊讶或厌恶, 然后点击产生来表达这种情绪的表情。

  5. 5

    下载或使用 API

    播放并下载已完成的音频,或者通过自动工作流程TextToSpeechAI REST API 程序调用同一Zonos引擎。

子 API AIP AIPI AIP

以TextToSpeechAIREST API 生成有计划的语言。

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "佐诺斯产生出令人难以置信的 表达性演讲 精细的感官控制。",
    "voice": "en_US-lessac-medium"
  }'

常问问题

Zonos 是来自Zyphra的1.6B参数文本到语音模型, 专门用于表达性语音生成, 精细的情感控制以及高贞洁的语音克隆。 在TextToSpeechAI 上, 它作为最细微、 情感丰富的音频的超层引擎运行 。

是的。 以阿帕奇2.0号许可证发放的Zonos的代码和模型重量,因此可以自由用于商业产品,而没有任何归属或非商业限制。 这使得它能够安全使用付费应用程序、客户工作和货币化内容。

佐诺斯暴露了七个你选择的情感状态 — — 中立、幸福、悲伤、愤怒、恐惧、惊喜和厌恶 — — 产生前选择的。 模型将它以所选择的情感、调子、节奏和调子为条件,这样同一句句子就能听起来快乐或愤怒。 这使得佐诺斯理想地表达需要特定情绪的性格和对话声音。

佐诺斯支持七个情感选择:中立、幸福、悲伤、愤怒、恐惧、惊喜和厌恶。 每代人中选一个来决定整个片段的情绪音调。

是的。 佐诺斯从仅仅5-30秒的参考音频中克隆出声音,提取出音量特征,并以新的演讲方式复制它们。 你可以将克隆与七个情感中的任何一个结合在一起,使克隆声音听起来快乐、愤怒或恐惧。

泽诺斯人处理五种语言:英语、日语、中文、法语和德语,情感控制和声音克隆在所有这些语言中都起作用。

佐诺斯以中速运行,因为其1.6B参数大小,以原始产出交换优质、高超的表达性输出。 质量是情感和克隆语言的最佳语言之一,因此它适合最终生产音频而不是大规模实时生成。

Zonos 需要 8GB 或更多 VRAM 的1.6B 参数模型。 在将语音克隆与情感控制相结合时, 推荐至少 10GB 的 GPU 操作舒适。 在 TextToSpeechAI 上, 所有这些运行都在 GPU 后端上, 所以不需要自己的硬件 。

左诺斯是一个超级引擎,每千个字符的计费为50分。 超级反映的是其巨大的模型和先进的情感和克隆能力,与SteleftTTS2、Tortoise和OpenVoice的级别相同。

以语音克隆提供风格和情感控制。 左诺斯提供了七个离散的情绪状态和一个现代1.6B结构,而 OpenVoice则提供了友好、欢乐和快速快速克隆低语的音调风格。 选择左诺斯时需要明确的情感选择和最大表达力;选择 OpenVoice 以更轻、更快的音调变化。

左诺斯在“无语言声音”中强调明确的情感选择,并强化单声克隆,让您能够准确控制每个片段的情绪。选择符合您需要情感标签、对话旋转或可选情感的引擎。

是的。 新的TextToSpeechAI个账户获得免费启动信用, 演示可以让您在不注册的情况下生成样本音频。 这足以测试Zonos情绪控制及语音克隆, 然后再购买额外信用。

Technical Specs

  • Generation Speed Medium
  • Output Quality Excellent
  • Voice Cloning Supported
  • Languages 5
  • GPU VRAM 8GB+
  • Credits/1000 chars 50

Try 子 Now

Generate your first audio free. No credit card required.

Start Free