Very Slow
スピード
Exceptional
品質
いや
クローン
1
言語
情報 トートイズTTS
s available. Tortoise TTS is a
主要な特徴
超高品質
現存する最も自然な音のTTS出力。
キャラクターの声
音声ライブラリの既存の Tortoise 音声から選択します。
自然韻律
微妙な音声パターンと微細な表情を捕捉する。
スピード調整レンダリング
クリップが合理的な時間で終了するように速度指向の設定でレンダリングしました。
エモーショナル・ディープス
真の感情共鳴をもつ話を生成する。
オープンソース
商用利用権を持つApache 2.0ライセンス。
ユースケース
プレミアムオーディオブック
映画製作
ドキュメンタリー・ナラティブ
プロフェッショナル・ボーカル
アーカイブプロジェクト
ハイエンドコンテンツ
トートイズTTS Voices
View All 18Tortoise Angie
ENTortoise Deniro
ENTortoise Freeman
ENTortoise Geralt
ENTortoise Halle
ENTortoise Jlaw
ENTortoise Lj
ENTortoise Mol
ENTortoise Myself
ENTortoise Pat
ENTortoise Pat2
ENTortoise Snakes
EN使い方 トートイズTTS
-
1
無料で登録
無料の TextToSpeechAI アカウントを作成して、スタートアップクレジットを入手してください。 Tortoise は Ultra-tier エンジン (1000 文字当たり 50 クレジット) です。無料のクレジットは、初めての短いテストに最適です。
-
2
Tortoise の音声を選択
音声ブラウザから Tortoise の内蔵音声を選択します。
-
3
テキストを入力
語りたいテキストを入力または貼り付けてください。 Tortoise は遅いので、オーディオブックの全章または長いスクリプトを送信する前に、声と音色を確認するために短いパートから始めてください。
-
4
生成
生成をクリックして待ってください。Tortoise はクリップごとに 30 秒から数分かかります。
-
5
API をダウンロードまたは使用
生成が終わったら、MP3、WAV、OGG として音声をダウンロードするか、履歴から取得します。Tortoise ジョブを自動化するには、TextToSpeechAI API を呼び出し、Tortoise のレンダリングが遅いので、長いタイムアウトを許可してください。
トートイズTTS API
Generate speech programmatically using the TextToSpeechAI REST API.
curl -X POST "https://api.texttospeechai.com/v1/generate/" \
-H "Authorization: Bearer YOUR_API_TOKEN" \
-H "Content-Type: application/json" \
-d '{
"text": "タータスは時間がかかるが 結果は待つ価値がある",
"voice": "tortoise-angie"
}'
よくある質問
Tortoise TTSは音声品質を優先する自動回帰テキストから音声へのモデルです。トランスフォーマーベースの言語モデルと拡散復号を組み合わせて、自然で感情的な音声を生成します。これは最もリアルなオープンソースのTTSエンジンの一つとして広く認められています。
Tortoise TTS は商用利用、修正、再配布を許可する Apache 2.0 ライセンスの下でオープンソースです。TextToSpeechAI では、高い計算要求と優れた出力品質のため、 Tortoise は Ultra 階層に 1000 文字当たり 50 クレジットで位置しています。
Tortoise は設計上遅いものです: 複数の候補クリップを自動回帰的に生成し、拡散モデルと CLVP 再ランクステップを使って最良のクリップを精密化します。この品質優先パイプラインは、テキストの長さと品質の設定に依存して、1 つのクリップが 30 秒から数分かかることを意味します。トレードオフは、 Tortoise は TTS エンジンで最も自然な音声を生成します。
今日は TextToSpeechAI ではありません。 オープンソースモデルは、スピードと品質を交換するプレセットを持っています。クリップが適切な時間で終了するように、速度指向の設定でレンダリングします。
TextToSpeechAI ではありません。ここに表示されている Tortoise の音声はライブラリから作成された音声です。音声クローンは Chatterbox を実行する Clone Voice ツールを使用してください。
Tortoise は主に英語の音声データセットを使って訓練されました。英語が最も高い品質を持っています。他の言語は Piper または Bark 音声またはクローン音声を使用してください。
Tortoise は人間と区別できない音を生み出します。呼吸、躊躇、音調、軽いモデルでは見逃される真の感情的共鳴を捕捉します。これは、プレミアムオーディオブック、映画ナレーション、リアリズムが最も重要なハイエンドの声優作業において好まれる理由です。
Tortoise は通常、設定とバッチサイズに依存して 12-24GB の VRAM を必要とします。 ローカル使用には RTX 3090、4090、A100 のようなハイエンド GPU を推奨します。 CPU 推論は技術的には可能ですが、非常に遅い。 TextToSpeechAI では、モデルは GPU インフラストラクチャ上で実行されます。 それゆえ、自分でハードウェアを必要としません。
Tortoiseは高品質の24kHz WAVオーディオをネイティブでレンダリングします。TextToSpeechAIを通してMP3、WAV、OGGを要求できます。モデルの細かい詳細をプロジェクトが必要とするフォーマットに保つために、品質保持エンコーディングでトランスコードします。
Tortoise は Ultra 価格帯で 1000 文字当たり 50 クレジットであり、それは GPU 時間を消費するパイプラインの品質を優先するためです。新規アカウントは無料のスタートクレジットを受け取ります。コミットする前に Tortoise をテストできます。Ultra 価格帯は StyleTTS2 も含みます。
両方とも Ultra-tier エンジンですが、操作方法は異なります。 Tortoise TTS は自然さと感情的な深さの絶対的なピークに達しますが、最も遅いエンジンです。 StyleTTS2 は、より速い生成速度で Tortoise に近い品質を提供します。多くのクリップを必要とする場合や、より速いターンオーバーを必要とする場合に、より良い選択です。 品質が交渉できず、時間制約がない場合は Tortoise を選択してください。
はい。TextToSpeechAI に登録して無料のスタートクレジットを受け取って、Tortoise の音声を選択して何もインストールせずにクリップを生成します。Tortoise は遅いので、長いジョブを実行する前に短い文で始めてください。
Technical Specs
- Generation Speed Very Slow
- Output Quality Exceptional
- Voice Cloning Not Supported
- Languages 1
- GPU VRAM 12-24GB
- Credits/1000 chars 50