Moderate
速度
Excellent
质量
无 无
克隆
1
语文
关于 样式表2 2
StyldTTS 2 是通过风格传播和对抗性训练实现人文文本合成和语音合成的。 它产生与真实的人类录音相匹配的非常自然的演讲。 StyldTS 2 代表了TTS质量和自然性的最新技术。
关键特征
人 品 质量
制作与人文记录无法区分的言语 进行盲目测试
表达式风格
模型的风格,因此传送自然随文字而变化。
自然状态
完美的节奏 压力 和与传播模型的共鸣
演播室声音
选择在语音库中 选择现成的 StyldTTS 2 声音 。
快速推断
保持质量的同时, 速度比自动递减模型快 。
开放源码
麻省理工学院获得许可证,享有全部商业使用权。
使用案例
音传
专业语音电话
电影和电视制作
高端广告
播客制作
语音代声
样式表2 2 Voices
View All 6StyleTTS2 Default
ENStyleTTS2 Expressive
ENStyleTTS2 Fast
ENStyleTTS2 Natural
ENStyleTTS2 Neutral
ENStyleTTS2 Quality
EN如何使用 样式表2 2
-
1
注册免费
创建一个免费 TextToSpeechAI 账户以获取启动积分。
-
2
选择 StystetTS2 引擎
从语音库中选择 StyltTS2 声音。
-
3
输入文本
粘贴或键入您想要描述的脚本。 StyldTS2 精通英语, 并会通过长通道传递自然的行走、 压力和内向 。
-
4
生成音频
点击生成, TextToSpeechAI 使您的 StyldTS2 在 GPU 上具有音频。 Utra- tier StreetTS2 花费每1000 个字符50 个分数 。
-
5
下载或使用 API
完成的 StylTTS2 音频下载为 MP3 、 WAV 或 OGG, 或者用 StylTTS2 声音调用 TextToSpeechAI API 来自动生成 。
样式表2 2 API AIP AIPI AIP
以TextToSpeechAIREST API 生成有计划的语言。
curl -X POST "https://api.texttospeechai.com/v1/generate/" \
-H "Authorization: Bearer YOUR_API_TOKEN" \
-H "Content-Type: application/json" \
-d '{
"text": "StyldTS 2 的演讲很自然 与人类的唱片相匹配",
"voice": "styletts2-default"
}'
常问问题
StyleTTS2 是一个最先进的文本到语音模型, 能够实现人文语言合成。 它使用风格传播和对抗性培训来制作几乎无法区分的演讲, 与盲人听觉测试中真实的人类录音几乎无法区分。 您可以在 TextToSpeechAI 时尝试 StyleTTS2 免费 。
StyleTTS2 制作了TextToSpeechAI份上最高质量的 TTS 音频。 在正式评价中,它达到了MOS( MEE voice评分) 测试的人类评级,听众往往无法将其与真正的人说话者区分开来。 之所以它与乌龟一起坐在我们的超端层。
Not on TextToSpeechAI. StyleTTS2 voices here are ready-made voices from the library. For voice cloning, use the Clone Voice tool, which runs Chatterbox.
是的,StleftS2是根据许可的MIT许可证发放的,允许完全商业使用,而没有使用费,因此,对于涉及权利的音频书籍、广告、电影和其他专业StyleTTS2项目来说,它很安全。
StyleTTS2 主要支持英语,因为模型是接受英语数据集培训的。 对于其他语言,使用 Piper 或 Bark 声音,或克隆声音。
StylftS2 具有中度的生成速度。 它比像乌龟这样的自动递减模型快得多,但比像管道这样的轻量引擎慢得多。 由于StyleTTS2的溢价质量和计算成本,它以我们的超端等级而不是实时模型来定价。
StyleTTS2 需要 VRAM 的 4-6GB 来进行推论。 它比 bark 或 Tortoise 或 Tortoise 更具有内存效率, 并且生产质量更高的输出。 在 TextToSpeechAI 上, StyleTTS2 的所有处理都运行在我们的 GPU 上, 所以您不需要自己的硬件 。
StyldTS2是一种超级模型,在TextToSpeechAI上每1000个字符要花费50个信用额度。这种溢价价格反映了其人的水平质量和所需的GPU资源。相比之下,VITS等标准模型每1000个字符要花费10个信用额度,Piper每1,000个字符要花费1个信用额度。
两者都是超级(每1000字符50个分数)和英语。 StylTTS2 速度要快得多,而乌龟在长通道上听起来自然一些。在需要许多剪辑时选择StyleTS2, 在时间不是限制时选择乌龟。
StyleTTS2 生成24kHz的高质量音频。 通过 TextToSpeechAI, 您可以下载 MP3 、 WAV 或 OGG 的结果, 我们使用高质量的编码, 从而在最终文件中保存特殊 StyltTS2 的质量 。
是的。 StyldTTS2 支持语音调整,图书馆的每个声音都有自己的表达方式,所以选择不同的声音可以改变行走。
从我们的库中选择 StyleTTS2 语音, 然后引用您 API 请求中的该语音 。 TextToSpeechAI 处理所有 GPU 处理, 并用您的高级 StylTS2 音频返回下载的 URL 。
Technical Specs
- Generation Speed Moderate
- Output Quality Excellent
- Voice Cloning Not Supported
- Languages 1
- GPU VRAM 4-6GB
- Credits/1000 chars 50