Kiểu dáng TTS 2

Ultra

Text- to- Speech với chuyển đổi phong cách

Moderate Tốc độ
Excellent Chất lượng
Không Bản sao
1 Ngôn ngữ

Về Kiểu dáng TTS 2

StyleTTS 2 achieves human-level text-to-speech synthesis through style diffusion and adversarial training. It generates highly natural speech that rivals real human recordings. StyleTTS 2 represents the state-of-the-art in TTS quality and naturalness.

Tính năng chính

Chất lượng mức người

Sản xuất giọng nói không thể phân biệt được với ghi âm của con người trong các thử nghiệm mù.

Kiểu biểu cảm

Các mẫu nói về phong cách để giao tiếp thay đổi tự nhiên với văn bản.

Tự nhiên

Nhịp điệu hoàn hảo, áp lực, và giọng điệu với mô hình dựa trên sự lan truyền.

Âm thanh phòng thu

Chọn từ các giọng nói StyleTTS 2 sẵn có trong thư viện giọng nói.

Suy luận nhanh

Nhanh hơn các mô hình tự hồi phục trong khi duy trì chất lượng.

Mã nguồn mở

MIT licensed with full commercial use rights.

Tình huống sử dụng

Sách âm thanh Premium Lồng tiếng chuyên nghiệp Sản xuất phim và truyền hìnhName Quảng cáo cao cấp Sản xuất Podcast Giọng hát

Kiểu dáng TTS 2 Voices

View All 6
StyleTTS2 Default
EN
StyleTTS2 Expressive
EN
StyleTTS2 Fast
EN
StyleTTS2 Natural
EN
StyleTTS2 Neutral
EN
StyleTTS2 Quality
EN

Cách sử dụng Kiểu dáng TTS 2

  1. 1

    Đăng ký miễn phí

    Tạo một tài khoản miễn phí TextToSpeechAI để nhận tiền thưởng.

  2. 2

    Chọn bộ vi xử lý StyleTTS2

    Chọn giọng StyleTTS2 từ thư viện giọng nói.

  3. 3

    Nhập văn bản

    Đặt tên cho tập tin

  4. 4

    Tạo âm thanh

    Click generate và TextToSpeechAI sẽ tạo âm thanh StyleTTS2 trên GPU. StyleTTS2 cấp cao có giá 50 credit cho mỗi 1000 ký tự.

  5. 5

    Tải xuống hoặc sử dụng API

    Tải về âm thanh StyleTTS2 hoàn thành như MP3, WAV, hoặc OGG, hoặc gọi API TextToSpeechAI với giọng nói StyleTTS2 của bạn để tự động tạo ra.

Kiểu dáng TTS 2 API

Tạo lời nói bằng cách lập trình sử dụng TextToSpeechAI REST API.

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "StyleTTS 2 tạo ra giọng nói tự nhiên, nó cạnh tranh với các bản ghi chuyên nghiệp của con người.",
    "voice": "styletts2-default"
  }'

Câu hỏi thường gặp

StyleTTS2 là mô hình văn bản- nói hiện đại nhất, đạt được tổng hợp giọng nói ở mức độ con người. Nó dùng sự lan truyền phong cách và huấn luyện đối thủ để tạo ra giọng nói gần như không thể phân biệt được với giọng nói thật của người trong thử nghiệm nghe mù. Bạn có thể thử StyleTTS2 miễn phí trên TextToSpeechAI.

StyleTTS2 tạo ra âm thanh TTS chất lượng cao nhất có sẵn trên TextToSpeechAI. Trong các đánh giá chính thức, nó đạt được điểm đánh giá ở mức người trên thử nghiệm MOS (Mean Opinion Score), với người nghe thường không thể phân biệt nó với một người nói thật. Nó nằm trong tầng Ultra của chúng tôi cùng với Tortoise vì lý do đó.

Không phải trên TextToSpeechAI. Những giọng nói StyleTTS2 ở đây là những giọng nói đã được tạo từ thư viện. Để sao chép giọng nói, hãy dùng công cụ Clone Voice, chạy Chatterbox.

StyleTTS2 được phát hành theo giấy phép MIT, cho phép sử dụng thương mại đầy đủ mà không cần trả phí bản quyền. Điều này làm cho nó an toàn cho sách âm thanh, quảng cáo, phim và các dự án StyleTTS2 chuyên nghiệp khác mà quyền sở hữu là quan trọng.

StyleTTS2 hỗ trợ chủ yếu tiếng Anh, vì mô hình được huấn luyện trên tập dữ liệu tiếng Anh. Đối với các ngôn ngữ khác, dùng giọng nói Piper hay Bark, hoặc giọng nói nhân bản.

StyleTTS2 có tốc độ tạo trung bình. Nó nhanh hơn nhiều so với các mô hình tự hồi quy như Tortoise nhưng chậm hơn các động cơ nhẹ như Piper. Do chất lượng cao và chi phí tính toán, StyleTTS2 được định giá ở cấp Ultra của chúng tôi thay vì là một mô hình thời gian thực.

StyleTTS2 cần khoảng 4- 6GB VRAM để suy luận. Nó tiết kiệm bộ nhớ hơn Bark hay Tortoise trong khi tạo ra kết quả chất lượng cao hơn. Trên TextToSpeechAI, tất cả các quy trình StyleTTS2 chạy trên GPU của chúng tôi, vì vậy bạn không cần bất kỳ phần cứng nào của riêng mình.

StyleTTS2 là một mô hình Ultra-tier và có giá 50 credits cho mỗi 1000 ký tự trên TextToSpeechAI. Giá cao cấp phản ánh chất lượng ở mức người và các nguồn GPU cần thiết. Để so sánh, các mô hình tiêu chuẩn như VITS có giá 10 credits cho mỗi 1000 ký tự và Piper có giá 1 credit cho mỗi 1000 ký tự.

Cả hai đều là cấp Ultra (50 tín hiệu trên 1000 ký tự) và tiếng Anh. StyleTTS2 nhanh hơn nhiều, trong khi Tortoise có thể nghe tự nhiên hơn một chút trong các đoạn dài. Chọn StyleTTS2 khi bạn cần nhiều đoạn phim và Tortoise khi không có giới hạn thời gian.

StyleTTS2 tạo ra âm thanh chất lượng cao ở 24kHz. Thông qua TextToSpeechAI bạn có thể tải về kết quả như MP3, WAV, hoặc OGG, và chúng tôi sử dụng mã hóa chất lượng cao để chất lượng StyleTTS2 đặc biệt được bảo tồn trong tập tin cuối cùng.

StyleTTS2 hỗ trợ điều chỉnh tốc độ nói, và mỗi giọng nói trong thư viện có cách phát âm riêng, vì vậy chọn một giọng nói khác thay đổi cách nói.

Chọn một giọng nói StyleTTS2 từ thư viện của chúng tôi, sau đó tham khảo giọng nói đó trong yêu cầu API của bạn. TextToSpeechAI xử lý tất cả các quy trình GPU và trả lại một URL tải về với âm thanh StyleTTS2 cao cấp của bạn.

Technical Specs

  • Generation Speed Moderate
  • Output Quality Excellent
  • Voice Cloning Not Supported
  • Languages 1
  • GPU VRAM 4-6GB
  • Credits/1000 chars 50

Try Kiểu dáng TTS 2 Now

Generate your first audio free. No credit card required.

Start Free