Dia

Ultra

TTS προσανατολισμένη στο διάλογο με κλωνοποίηση φωνής και μη λεκτική ήχους

Medium Ταχύτητα
Excellent Ποιότητα
Ναι. Κλώνος
1 Γλώσσες

Σχετικά Dia

Dia από Nari Labs είναι ένα 1.6B παράμετρος διαλόγου-εστιασμένο κείμενο σε-ομιλία μοντέλο. Υπερέχει στη δημιουργία φυσικών συνομιλίας ομιλία με υποστήριξη για μη λεκτική ήχους όπως γέλιο, αναστεναγμοί, και βήχας. Dia υποστηρίζει πολύ-ηχεία γενιά διαλόγου και φωνή κλωνοποίησης από 5-10 δευτερόλεπτα του ήχου αναφοράς, καθιστώντας το ιδανικό για τη δημιουργία ρεαλιστικών συνομιλιών και φωνές χαρακτήρα.

Βασικά χαρακτηριστικά

Γενιά διαλόγου

Δημιουργήστε φυσικές πολυ-συνομιλίες με διακριτές φωνές και γυρίσματα-κόλλημα.

Μη Διαβόλους Ήχοι

Προσθέστε [γέλια], [αναστενάζει], [βήχας], (λαχανιάζει) για φυσική παράγλωσση έκφραση.

Κλωνοποίηση φωνής

Κλώνε οποιαδήποτε φωνή από 5-10 δευτερόλεπτα ήχου αναφοράς για εξατομικευμένη ομιλία.

Φυσική Συνομιλία

1.6B παράμετροι παράγουν εξαιρετικά φυσική συνομιλία προσθετικότητα και τονισμό.

Περιπτώσεις χρήσης

Γενιά διαλόγου και συζητήσεων Παραγωγή ακουστικών βιβλίων με πολλούς χαρακτήρες Φωνές χαρακτήρων παιχνιδιού Podcast και δημιουργία περιεχομένου

Πώς να χρησιμοποιήσετε το φάρμακο Dia

  1. 1

    Εγγραφείτε δωρεάν ή ανοίξτε το demo

    Δημιουργήστε ένα δωρεάν λογαριασμό TextToSpeechAI για να διεκδικήσετε τις πιστώσεις εκκίνησης σας, ή ανοίξτε το demo χωρίς υπογραφή για να δοκιμάσετε το Dia διάλογο αμέσως.

  2. 2

    Επιλέξτε τον κινητήρα Dia

    Στο ταμπλό TTS επιλέξτε Dia από τη λίστα μηχανών. Dia είναι το προσανατολισμένο στο διάλογο, εξαιρετικά-tier μοντέλο με πολυ-επεξεργαστή και φωνητική υποστήριξη.

  3. 3

    Γράψτε ένα σενάριο διαλόγου με ετικέτες

    Συγκρίνετε τη συζήτησή σας χρησιμοποιώντας [S1] και [S2] για να σημειώσετε κάθε ομιλητής γυρίστε, και ρίξτε σε μη λεκτική ετικέτες όπως [γέλια], [αναστενάζει], [βήχας], ή (λαχανιάζει) όπου θέλετε φυσικές αντιδράσεις.

  4. 4

    Δημιουργία ήχου

    Κάντε κλικ για να στείλετε το σενάριο Dia σας σε μας φιλοξενεί GPUs. Dia καθιστά το διάλογο δύο ηχείων με τη λήψη στροφής και μη λεκτική ετικέτες σας σε ένα ενιαίο αρχείο ήχου.

  5. 5

    Κατεβάστε ή καλέστε το API

    Κατεβάστε το τελικό διάλογο στην επιλεγμένη μορφή σας, ή αυτοματοποιήστε το με την ανάρτηση του ίδιου [S1]/[S2] σεναρίου στο TextToSpeechAI API με το σήμα λογαριασμού σας.

Dia API

Δημιουργήστε ομιλία προγραμματικά χρησιμοποιώντας το TextToSpeechAI REST API.

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "Γεια σας, πώς είστε σήμερα\u003B",
    "voice": "en_US-lessac-medium"
  }'

Συχνές Ερωτήσεις

Dia είναι ένα 1.6B μοντέλο διαλόγου με βάση το κείμενο-σε-φωνή μοντέλο από τα εργαστήρια Nari. Ειδικεύεται στην παραγωγή φυσικών συνομιλίας ομιλία με υποστήριξη για πολλούς ομιλητές, μη λεκτική ήχους, και κλωνοποίησης φωνής.

Ναι, Dia είναι πλήρως Apache 2.0 άδεια - τόσο κώδικα και πρότυπα βάρη.

Επί του παρόντος Dia υποστηρίζει μόνο αγγλικά. Το μοντέλο είναι βελτιστοποιημένο για φυσικό αγγλικό λόγο συζήτησης.

Η Dia απαιτεί περίπου 10GB VRAM για το μοντέλο παραμέτρου 1.6B. Συνιστάται GPU με τουλάχιστον 12GB για άνετη λειτουργία. Στις TextToSpeechAI όλα αυτά τρέχει σε φιλοξενούμενους GPUs μας, έτσι δεν χρειάζεστε κανένα υλικό της δικής σας.

Ναι - ο διάλογος είναι ακριβώς αυτό για το οποίο είναι χτισμένο η Dia. Με εναλλασσόμενη [S1] και [S2] γυρίζει στο σενάριο σας, η Dia TTS παράγει μια ρέουσα συζήτηση δύο ηχείων με διαφορετικές φωνές και ρεαλιστικό turn-taking, το οποίο είναι δυσκολότερο να επιτευχθεί με μονή-ηχεία TTS μοντέλα.

Πρόθεμα κάθε γραμμή του σεναρίου σας με [S1] ή [S2] για να επισημάνει ποιος μιλάει. Dia εκχωρεί μια συνεπή φωνή σε κάθε ετικέτα και διακόπτει μεταξύ τους καθώς η συζήτηση κινείται, έτσι [S1] και [S2] ενεργεί ως οι δύο χαρακτήρες στο διάλογό σας.

Ναι. Dia υποστηρίζει την κλωνοποίηση φωνής από περίπου 5-10 δευτερόλεπτα καθαρού ήχου αναφοράς, επιτρέποντάς σας να επαναλάβετε μια συγκεκριμένη φωνή για ένα ομιλητή. Μπορείτε να συνδυάσετε την κλωνοποίηση με τις ετικέτες [S1]/[S2] έτσι ώστε κάθε χαρακτήρας σε ένα διάλογο ακούγεται σαν τη φωνή που κλωνοποιήσατε.

Η Dia αποδίδει [γέλια], [αναστενάζει], [βήχα], και (λαχανιάζει) ως φυσικούς παράγλωσσους ήχους που είναι υφασμένους στην ομιλία αντί να μιλάνε λέξεις. Τοποθετήστε μια ετικέτα όπου θέλετε την αντίδραση - για παράδειγμα "[S1] Αυτό είναι ξεκαρδιστικό [γέλια]" - για να κάνει τον διάλογο να αισθάνεται πιο ανθρώπινος.

Τόσο η Dia όσο και η Bark υποστηρίζουν εκφραστικά μη λεκτική ήχους, αλλά η Dia είναι χτισμένη για διάλογο πολλαπλών ηχείων με [S1]/[S2] turn-taking και κλωνοποίηση φωνής. Επιλέξτε Dia για ρεαλιστικές συζητήσεις δύο ατόμων και εργασία χαρακτήρα?Ο Bark είναι μια καλύτερη εφαρμογή όταν χρειάζεστε ευρύτερη γλωσσική κάλυψη σε μονόφωνη αφήγηση.

Η Dia είναι ένας υπερ-βαθμός κινητήρας, έτσι κοστίζει 50 μονάδες ανά 1.000 χαρακτήρες της δημιουργημένης ομιλίας. Η υπερβαθμίδα αντανακλά το μεγαλύτερο μοντέλο 1.6B και το ~10GB της μνήμης GPU που χρησιμοποιεί για διάλογο υψηλής ποιότητας.

Ναι. Οι νέοι TextToSpeechAI λογαριασμοί περιλαμβάνουν δωρεάν μονάδες εκκίνησης, και υπάρχει ένα demo που μπορείτε να τρέξετε χωρίς να εγγραφείτε. Αυτό είναι αρκετό για να δημιουργήσει ένα σύντομο διάλογο Dia με [S1]/[S2] ετικέτες πριν αποφασίσει για ένα πληρωμένο σχέδιο.

Ναι. Μόλις έχετε ένα API σύμβολο από τη σελίδα του λογαριασμού σας μπορείτε να υποβάλετε Dia scripts διαλόγου - συμπεριλαμβανομένων [S1] / [S2] στροφές και ετικέτες όπως [γέλια] - στο TextToSpeechAI REST API και να κατεβάσετε το προκύπτοντα ακουστικό πρόγραμμα.

Technical Specs

  • Generation Speed Medium
  • Output Quality Excellent
  • Voice Cloning Supported
  • Languages 1
  • GPU VRAM 10GB
  • Credits/1000 chars 50

Try Dia Now

Generate your first audio free. No credit card required.

Start Free