Come Shaip ha realizzato un programma scalabile di valutazione della qualità della clonazione vocale per un client di riconoscimento vocale basato sull'intelligenza artificiale.

Dalla qualità di prova alla prontezza per la distribuzione: come una valutazione umana strutturata ha aiutato un client di riconoscimento vocale basato sull'IA a colmare il divario tra i parametri di laboratorio e le prestazioni nel mondo reale.

Clonazione vocale

Panoramica del progetto

I modelli di clonazione vocale possono sembrare impressionanti nelle demo, ma faticano a dimostrarsi efficaci nell'utilizzo reale. Il cliente aveva bisogno di un metodo affidabile per misurare se il suo modello stesse effettivamente migliorando, soprattutto per l'inglese indiano, un mercato prioritario per l'implementazione.

Shaip è stato incaricato di progettare e gestire un programma di valutazione delle risorse umane in grado di rispondere a tre domande aziendali chiave:

  • Il discorso suona naturale?
  • Il suono è ancora identico a quello dell'altoparlante originale?
  • È sufficientemente sicuro e affidabile per l'uso in produzione?

Anziché affidarsi esclusivamente a metriche automatizzate, il progetto si è avvalso di revisori umani qualificati per valutare output audio reali e individuare i punti deboli del modello.

Qualità della clonazione vocale

Metriche chiave del set di dati

Usa caso

Valutazione della qualità della clonazione vocale

Durata del progetto

settimane 12

Esempi esaminati

12,400 clip audio sintetizzate

Annotatori impiegati

48 valutatori di inglese qualificati

Sfide nella valutazione della qualità della sintesi vocale e della clonazione vocale

  • Il modello doveva funzionare bene in tutti i casi molteplici accenti inglesi, in particolare l'inglese indiano.
  • La qualità audio doveva migliorare in modi che fossero importanti per gli utenti finali, non solo in base ai parametri di laboratorio.
  • Il team aveva bisogno di un modo chiaro per identificare Cosa non funzionava nell'output vocale?.
  • Col tempo, i file audio di lunga durata a volte perdevano l'identità di chi parlava originariamente.
  • Il cliente aveva anche bisogno di controlli per sicurezza, rischio di impersonificazione e presenza della filigrana.

Soluzione: Framework di valutazione umana per la qualità della voce AI

Strategia di valutazione

Shaip ha creato un quadro di riferimento strutturato per valutare la naturalezza, la chiarezza, la somiglianza della voce, la coerenza e la sicurezza.

Revisione umana su larga scala

48 valutatori esperti hanno esaminato 12,400 campioni audio in inglese indiano, inglese americano neutro e una traccia audio in Hinglish.

Valutazione in tre parti

  • I recensori hanno valutato quanto naturale e comprensibile risultasse ogni clip audio.
  • Hanno confrontato coppie di clip per identificare quale versione fosse migliore.
  • Hanno segnalato problemi di qualità ricorrenti come ritmo innaturale, problemi di intonazione e deriva degli altoparlanti.

Controllo di qualità

Shaip ha utilizzato attività di calibrazione, verifiche di riferimento, revisioni ripetute e monitoraggio della qualità per garantire la coerenza e l'affidabilità dei punteggi.

Ciclo di feedback attuabile

I risultati di ogni sprint sono stati reintrodotti nel processo di ottimizzazione del cliente, contribuendo al miglioramento del modello nel corso di più cicli.

Ambito del progetto: Lingue, accenti e copertura delle revisioni

Zona Obbiettivo
Lingue disponibili Inglese
Accenti prioritari Inglese indiano, inglese americano neutro
Copertura secondaria Inglese britannico, sottotraccia Hinglish
Tipi di campioni Brevi clip di riferimento, campioni con poche inquadrature, discorso di lunga durata
Rivedere l'output Valutazioni di qualità, etichette di preferenza, etichettatura dei problemi
Durata del fidanzamento 12 settimane

Risultati: Miglioramenti misurabili nella clonazione vocale

  • Netto miglioramento della qualità della voce: Il punteggio di qualità complessivo del modello è migliorato da 3.41 a 4.12, a dimostrazione che il parlato è diventato più naturale e pronto per la produzione.
  • Migliore abbinamento degli altoparlanti: Il sistema è diventato molto più efficace nel preservare la voce originale dell'oratore, migliorando la somiglianza da 0.71 a 0.87.
  • Meno errori evidenti: I problemi di linguaggio sono diminuiti dal 31% dei campioni all'inizio dello studio all'11% nella fase finale.
  • Elevata intelligibilità: Il tasso di errore finale per l'inglese indiano ha raggiunto il 4.8%, superando la soglia prefissata.
  • Maggiore sicurezza nella preparazione al dispiegamento: La valutazione ha inoltre confermato ottime prestazioni nei controlli di sicurezza chiave, tra cui la verifica del rischio di usurpazione d'identità e la verifica della filigrana.
Ancora più importante, il cliente ha ottenuto un sistema di valutazione ripetibile da utilizzare non solo per giudicare la qualità del modello, ma anche per migliorarla continuamente. Quello che era iniziato come un programma di revisione tecnica si è trasformato in un pratico strumento decisionale per i team di prodotto, i team di modellazione e le parti interessate all'implementazione.
Icona di citazione

Shaip ci ha aiutato a trasformare la qualità audio soggettiva in un programma di miglioramento misurabile. Il loro sistema di valutazione ci ha fornito indicazioni chiare su cosa correggere, dove migliorare e come avvicinarci alla produzione con sicurezza.

— Responsabile di prodotto per il riconoscimento vocale basato sull'intelligenza artificiale

★ ★ ★ ★ ★
Icona di citazione