乌龟 TTTS

Ultra

具有与自然无比性格的超高质量演讲

Very Slow 速度
Exceptional 质量
无 无 克隆
1 语文

关于 乌龟 TTTS

TTS是一种自动递减的文字到语音模型,它把音质放在所有其它方面之上。 托托伊斯结合了自动递减变压器和传播模型,产生了非常自然的言语,捕捉了人类声音的微妙细微差别。 托伊斯虽然比其他模型慢,却产生了最自然的 TTS 输出。

关键特征

超高质量

现有最自然的 TTS 输出。

字符声音

选择在语音库中 选择简易的乌龟声音

自然状态

捕捉微妙的言语模式和微表达方式

速推荐

以快速为导向的设置 剪辑在合理的时间内完成

情感深度

以真正的情感共鸣 产生演讲

开放源码

Apache 2. 0 持有商业使用权许可证。

使用案例

音传 电影制制制 纪录片叙述 专业语音电话 档案项目 高端内容

乌龟 TTTS Voices

View All 18
Tortoise Angie
EN
Tortoise Deniro
EN
Tortoise Freeman
EN
Tortoise Geralt
EN
Tortoise Halle
EN
Tortoise Jlaw
EN
Tortoise Lj
EN
Tortoise Mol
EN
Tortoise Myself
EN
Tortoise Pat
EN
Tortoise Pat2
EN
Tortoise Snakes
EN

如何使用 乌龟 TTTS

  1. 1

    注册免费

    创建一个免费 TextToSpeechAI 账户以获取初始积分。 乌龟是一个超层引擎( 每1000个字符50个积分), 因此免费积分在第一个短时间测试时是完美的 。

  2. 2

    选择乌龟声音

    选择声音浏览器中的一种内置的乌龟声音 。

  3. 3

    输入文本

    输入或粘贴您想要说明的文本。 因为乌龟速度缓慢, 开始用短短的一段来确认声音和语气, 然后发送完整的音频书章或长脚本 。

  4. 4

    生成

    单击生成并有耐心。 乌龟可以将每个剪辑从30秒到几分钟。

  5. 5

    下载或使用 API

    当生成完成时, 下载您的音频为 MP3 、 WAV 或 OGG, 或者从历史中获取它。 要自动配置 Tomtoise 任务, 请调用 TextToSpeechAI API 并允许更长的超时, 因为 Tortoise 缓慢地转换 。

乌龟 TTTS API AIP AIPI AIP

以TextToSpeechAIREST API 生成有计划的语言。

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "乌龟需要时间,但结果值得等待。",
    "voice": "tortoise-angie"
  }'

常问问题

托托伊斯 TTS 是詹姆斯·贝克(James Betker)创建的自动递减文本到语音模式, 其优先关注音质, 并且将基于变压器的语言模型与扩散解码结合起来, 产生不匹配的自然性、 情感深度和人性化的语音。 它被广泛视为最现实的开放源 TTS 引擎之一。

是的,乌龟 TTS是开放源码,根据允许的阿帕奇2.0许可证,允许商业使用、修改和再分配。 在TextToSpeechAI时,乌龟由于计算要求高和产出质量异常,以每1000个字符50个信用额的高度在超端层中占有席位。

乌龟的设计速度缓慢:它自动生成几个候选剪辑,然后用扩散模型和CLVP的重新排行来改进最佳剪辑。 质量第一管道意味着一个单剪辑可以从30秒到几分钟, 取决于文字长度和质量预设。 权衡的取舍是乌龟制作了任何 TTS 引擎最自然的演讲。

Not on TextToSpeechAI today. The open-source model has presets that trade speed for quality; we render with a speed-oriented setting so a clip finishes in reasonable time.

而不是在 TextToSpeechAI。 这里的乌龟声音是来自图书馆的现成声音。 对于语音克隆, 使用“ 克隆” 工具, 即运行聊天盒的工具 。

乌龟主要接受英语语言数据集的培训,因此英语的质量最强。 对于其他语言,请使用 Piper 或 Bark 声音,或者克隆声音。

乌龟产生了不同寻常的、常常无法区分的与人类的音频。 它捕捉了呼吸、犹豫、民族以及轻量级模型错过的真正情感共鸣。 这就是为什么它仍然是高级音频书籍、电影叙事和高端语音作品中最受欢迎的原因,而现实主义是其中最重要的。

乌龟通常需要12-24GB VRAM, 取决于设置和批量大小, 因此推荐本地使用高端的 RTX 3090、 4090 或 A100 等 GPU 。 CPU 推论在技术上是可能的, 但非常慢 。 在 TextToSpeechAI 上, 模型运行在我们的 GPU 基础设施上, 所以不需要任何硬件 。

土生土长的乌龟将24kHz WAV 制成高质量的音频。 通过 TextToSpeechAI, 您可以请求 MP3, WAV, 或 OGG, 我们用质量保护编码进行转换, 这样您就可以保持模型的精细细节, 以您项目所需的任何格式 。

乌龟在超大定价层次上每1000个字符50个信用额度,反映了GPU的质量第一管道消耗的时间。新账户获得免费的启动信用额度,这样您就可以在承诺前测试乌龟。 超大层也包括StuleTTS2。

两者都是超层引擎,但贸易却不同。 乌龟 TTS 达到了自然和情感深度的绝对峰值,但速度最慢。 StyleTTS2 提供近乌龟质量,其生成速度要快得多,在需要许多剪辑或更快的转弯时,它更能成为更好的选择。 当质量不可谈判,时间不是限制时,选择乌龟。

是的。 注册 TextToSpeechAI 以获得免费启动分, 然后选择一个乌龟声音来生成一个不安装任何设备的剪辑。 因为乌龟动作慢, 开始在更长的工作之前用短句开始 。

Technical Specs

  • Generation Speed Very Slow
  • Output Quality Exceptional
  • Voice Cloning Not Supported
  • Languages 1
  • GPU VRAM 12-24GB
  • Credits/1000 chars 50

Try 乌龟 TTTS Now

Generate your first audio free. No credit card required.

Start Free