スタイルTTS 2

Ultra

スタイル転送を備えた人間レベルのテキストから音声への変換

Moderate スピード
Excellent 品質
いや クローン
1 言語

情報 スタイルTTS 2

StyleTTS 2 achieves human-level text-to-speech synthesis through style diffusion and adversarial training. It generates highly natural speech that rivals real human recordings. StyleTTS 2 represents the state-of-the-art in TTS quality and naturalness.

主要な特徴

人間レベルの品質

人間の音声とは区別できない音声を生成する。

表現的スタイル

モデルの話し方はテキストと自然に変化する。

自然韻律

拡散モデルを用いた完全リズム,ストレス,音調のモデル化を行った。

スタジオ・ヴォイス

音声ライブラリの既製 StyleTTS 2 音声から選択します。

ファストインフェクション

また,自動回帰モデルよりも高速であり,品質を維持できる。

オープンソース

MITライセンスで商用利用権を持つ。

ユースケース

プレミアムオーディオブック プロフェッショナル・ボーカル 映画・テレビプロダクション ハイエンド広告 ポッドキャスト制作 声優

スタイルTTS 2 Voices

View All 6
StyleTTS2 Default
EN
StyleTTS2 Expressive
EN
StyleTTS2 Fast
EN
StyleTTS2 Natural
EN
StyleTTS2 Neutral
EN
StyleTTS2 Quality
EN

使い方 スタイルTTS 2

  1. 1

    無料で登録

    無料でTextToSpeechAIアカウントを作成して クレジットを得る

  2. 2

    StyleTTS2 エンジンを選択

    音声ライブラリから StyleTTS2 音声を選択します。

  3. 3

    テキストを入力

    ナレーションを行うスクリプトを貼り付けまたはタイプします。 StyleTTS2 は英語に優れ、長いパートにおいて自然な韻律、強調、音調を提供します。

  4. 4

    音声を生成

    生成をクリックすると、TextToSpeechAI が StyleTTS2 オーディオを GPU 上でレンダリングします。

  5. 5

    API をダウンロードまたは使用

    完成した StyleTTS2 オーディオを MP3、WAV、OGG としてダウンロードするか、自動生成のために StyleTTS2 音声で TextToSpeechAI API を呼び出す。

スタイルTTS 2 API

Generate speech programmatically using the TextToSpeechAI REST API.

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "スタイルTTS2は,プロの人間の録音と競うほど自然な音声を生成する。",
    "voice": "styletts2-default"
  }'

よくある質問

StyleTTS2は人間レベルの音声合成を達成する最新のテキストから音声へのモデルです。スタイル拡散と対抗訓練を用いて、盲目聴取テストで実際の人間の録音とほとんど区別がつかない音声を生成します。TextToSpeechAI 上で StyleTTS2 を無料で試すことができます。

StyleTTS2 は TextToSpeechAI で利用可能な最高品質の TTS オーディオを生成します。正式な評価では、MOS (平均意見得点) テストで人間レベルの評価を得ました。聴衆はしばしば実際の人間の話者と区別できません。そのため、Tortoise と共に Ultra 層に位置しています。

TextToSpeechAI ではありません。ここに表示されている StyleTTS2 音声はライブラリから作成された音声です。音声クローンには、Chatterbox を実行する Clone Voice ツールを使用してください。

はい。StyleTTS2は、ロイヤリティなしで完全な商用利用を許可する MIT ライセンスの下でリリースされています。これはオーディオブック、広告、映画、その他の権利が重要なプロフェッショナル StyleTTS2 プロジェクトに安全に使用できます。

StyleTTS2 は英語を主にサポートします。モデルは英語データセットで訓練されました。他の言語では Piper または Bark 音声またはクローン音声を使用してください。

StyleTTS2は中程度の生成速度を持っています。Tortoiseのような自己回帰モデルよりはるかに速いが、Piperのような軽量エンジンよりは遅い。その優れた品質と計算コストのため、StyleTTS2はリアルタイムモデルではなくUltra チームで価格設定されています。

StyleTTS2 は推論において 4-6GB の VRAM を必要とします。 Bark や Tortoise よりメモリ効率が良く、出力の品質も高いです。TextToSpeechAI では StyleTTS2 の処理は全て GPU 上で行われ、自分でハードウェアを必要としません。

StyleTTS2は Ultra-tier モデルで、TextToSpeechAI 上で 1000 文字あたり 50 クレジットを費やします。そのプレミアム価格は、その人間レベルの品質と必要な GPU リソースを反映しています。VITS のような標準モデルは 1000 文字あたり 10 クレジット、Piper は 1000 文字あたり 1 クレジットを費やします。

両方とも Ultra Tier (1000 文字当たり 50 クレジット) で英語です。 StyleTTS2 は速く、Tortoise は長いパートで少し自然に聞こえます。多くのクリップが必要な場合は StyleTTS2 を、時間制限がない場合は Tortoise を選択してください。

StyleTTS2は24kHzで高品質の音声を生成します。TextToSpeechAIを通してMP3、WAV、OGGとしてダウンロードできます。 StyleTTS2の優れた品質を最終ファイルに保持するために高品質のエンコーディングを使用します。

StyleTTS2 は話し速度調整をサポートし、ライブラリの各声は独自の伝達を持っています。それで、異なる声を選択すると、韻律が変わります。

ライブラリから StyleTTS2 音声を選択し、API リクエストでその音声を参照します。TextToSpeechAI は全ての GPU 処理を処理し、プレミアム StyleTTS2 オーディオのダウンロード URL を返します。

Technical Specs

  • Generation Speed Moderate
  • Output Quality Excellent
  • Voice Cloning Not Supported
  • Languages 1
  • GPU VRAM 4-6GB
  • Credits/1000 chars 50

Try スタイルTTS 2 Now

Generate your first audio free. No credit card required.

Start Free