Tortuga TTS

Ultra

Discurso de alta calidad con una naturalidad inigualable

Very Slow Velocidad
Exceptional Calidad
No Clonación
1 Idiomas

Acerca de Tortuga TTS

Tortoise TTS es un modelo de texto a voz autorregresivo que prioriza la calidad de audio sobre todo. Utilizando una combinación de transformadores y modelos de difusión autorregresivos, Tortoise genera un habla extremadamente natural que capta matices sutiles de voz humana. Mientras que más lento que otros modelos, Tortoise produce la salida TTS más natural disponible.

Características principales

Alta calidad

La salida TTS más natural disponible.

Voces de caracteres

Elija entre voces Tortuga ya hechas en la biblioteca de voz.

Prosodia natural

Captura patrones de habla sutiles y micro-expresiones.

Renderización de velocidad

Se muestra con un ajuste orientado a la velocidad para que los clips terminen en un tiempo razonable.

Profundidad emocional

Genera habla con una resonancia emocional genuina.

Código abierto

Apache 2.0 con licencia de derechos de uso comercial.

Casos de uso

Audiolibros premium Producción de películas Narración documental Voz profesional Proyectos de archivo Contenido de gama alta

Tortuga TTS Voices

View All 18
Tortoise Angie
EN
Tortoise Deniro
EN
Tortoise Freeman
EN
Tortoise Geralt
EN
Tortoise Halle
EN
Tortoise Jlaw
EN
Tortoise Lj
EN
Tortoise Mol
EN
Tortoise Myself
EN
Tortoise Pat
EN
Tortoise Pat2
EN
Tortoise Snakes
EN

Cómo usar Tortuga TTS

  1. 1

    Inscríbete gratis

    Crear una cuenta gratuita de TextToSpeechAI para obtener créditos de arranque. Tortoise es un motor de Ultra-tier (50 créditos por 1000 caracteres), por lo que los créditos gratuitos son perfectos para una primera prueba corta.

  2. 2

    Elija una voz de tortuga

    Seleccione una de las voces de Tortuga integradas desde el navegador de voz.

  3. 3

    Introduzca su texto

    Escriba o pegue el texto que desee narrar. Debido a que Tortuga es lenta, comience con un pasaje corto para confirmar la voz y el tono antes de enviar un capítulo completo de audiolibro o un guión largo.

  4. 4

    Generar

    Haga clic en generar y ser paciente. Tortuga puede tomar de 30 segundos a varios minutos por clip.

  5. 5

    Descargue o utilice la API

    Cuando la generación termine, descargue su audio como MP3, WAV, u OGG, o retírela de su historial. Para automatizar trabajos de Tortoise, llame a la API TextToSpeechAI y permita tiempos de espera más largos, ya que Tortoise se renderiza lentamente.

Tortuga TTS API

Generar voz programáticamente usando la API TextToSpeechAI REST.

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "Tortuga toma su tiempo, pero los resultados son dignos de esperar.",
    "voice": "tortoise-angie"
  }'

Preguntas frecuentes

Tortoise TTS es un modelo de texto a voz autorregresivo creado por James Betker que prioriza la calidad de audio sobre todo. Combina el modelado de lenguaje basado en transformadores con la decodificación de difusión para generar un lenguaje con una naturalidad inigualable, profundidad emocional y prosodia humana. Es ampliamente considerado como uno de los motores TTS de código abierto más realistas disponibles.

Sí. Tortoise TTS es de código abierto bajo la licencia de Apache 2.0, que permite el uso comercial, modificación y redistribución. En TextToSpeechAI, Tortoise se sienta en el nivel Ultra a 50 créditos por 1000 caracteres debido a sus requisitos de cálculo pesados y calidad de salida excepcional.

Tortoise es lenta por diseño: genera varios clips candidatos automáticamente y luego refina el mejor con un modelo de difusión y un paso de re-calificación CLVP. Este primer conducto de calidad significa que un solo clip puede tomar de 30 segundos a varios minutos dependiendo de la longitud del texto y la calidad preestablecida. La compensación es que Tortoise produce algo de la expresión más natural de cualquier motor TTS.

No en TextToSpeechAI hoy. El modelo de código abierto tiene presets que cambian la velocidad de calidad; renderizamos con un ajuste orientado a la velocidad para que un clip termine en un tiempo razonable.

No en TextToSpeechAI. Las voces de tortuga aquí son voces ya hechas de la biblioteca. Para la clonación de voz, utilice la herramienta Clone Voice, que ejecuta Chatterbox.

Tortoise fue entrenado principalmente en conjuntos de datos de habla inglesa, por lo que el inglés es donde su calidad es más fuerte. Para otros idiomas, use voces Piper o Bark, o una voz clonada.

La tortuga produce un audio excepcional, a menudo indistinguible de los humanos. Captura la respiración, la vacilación, la entonación y la resonancia emocional genuina que los modelos más ligeros pierden. Por eso sigue siendo un favorito para audiolibros premium, narración de películas y trabajo de voz en off de alta gama donde el realismo es primordial.

Tortuga normalmente requiere 12-24 GB de VRAM dependiendo de la configuración y el tamaño de los lotes, por lo que GPU de alta gama como el RTX 3090, 4090 o A100 se recomiendan para uso local. inferencia de CPU es técnicamente posible pero extremadamente lento. En TextToSpeechAI el modelo se ejecuta en nuestra infraestructura GPU, por lo que no necesita ningún hardware propio.

Tortoise representa de forma nativa audio WAV de alta calidad 24 kHz. A través de TextToSpeechAI puede solicitar MP3, WAV u OGG, y transcodificamos con codificación de calidad para que mantenga el detalle fino del modelo en cualquier formato que necesite su proyecto.

Tortoise is in the Ultra pricing tier at 50 credits per 1000 characters, reflecting the GPU time its quality-first pipeline consumes. New accounts get free starter credits, so you can test Tortoise before committing. The Ultra tier also covers StyleTTS2.

Ambos son motores ultra-tier, pero que comercian de manera diferente. Tortuga TTS alcanza el pico absoluto de naturalidad y profundidad emocional, pero es por lejos el motor más lento. StyleTTS2 ofrece calidad casi-Tortuga con generación mucho más rápida, por lo que es la mejor opción cuando necesita muchos clips o giros más rápidos. Pick Tortuga cuando la calidad es no negociable y el tiempo no es una restricción.

Sí. Inscríbete en TextToSpeechAI para recibir créditos de inicio gratuitos, luego selecciona una voz Tortuga para generar un clip sin instalar nada. Debido a que Tortuga es lenta, comienza con una frase corta antes de ejecutar trabajos más largos.

Technical Specs

  • Generation Speed Very Slow
  • Output Quality Exceptional
  • Voice Cloning Not Supported
  • Languages 1
  • GPU VRAM 12-24GB
  • Credits/1000 chars 50

Try Tortuga TTS Now

Generate your first audio free. No credit card required.

Start Free