Trei lucrări, un protocol de evaluare
Toate trei folosesc exclusiv metrici obiective, reproductibile — alegere deliberată pentru o limbă cu resurse reduse, unde testele subiective la scară nu sunt fezabile. A treia lucrare este un manuscris în lucru, nepublicat încă; este marcată ca atare.
Tabelul principal din benchmark-ul MARA
Cinci enunțuri reprezentative × patru arhitecturi. Valoarea cea mai bună de pe fiecare enunț este marcată.
Raportare la sistemele de referință anterioare
Tabel reprodus din articol ca atare: aceleași modele, evaluate cu sistemele de referință din literatură în loc de înregistrarea naturală, pentru continuitate cu rezultatele mai vechi ale grupului.
Manuscris în lucru — F5-TTS față de VITS, cu ASR în protocol
Cel mai riguros protocol de până acum: 330 de perechi sinteză–referință, text identic pentru ambele arhitecturi, același frontend de preprocesare, aceleași referințe naturale și un decodor ASR înghețat care adaugă WER și CER celor cinci metrici de semnal. Rezultatele de mai jos sunt preliminare — lucrarea nu este încă publicată.
Aceeași frază, prin patru sisteme
Fiecare bloc de mai jos pornește de la înregistrarea naturală a aceleiași propoziții din „Mara” lui Slavici, urmată de sinteza fiecărui sistem. Metricile din dreapta sunt calculate față de acea înregistrare, cu aliniere DTW. Pe ultimele două propoziții apare și F5-TTS, singurele din setul lui care coincid cu acest corpus de test.


VITS față de F5-TTS pe aceeași frază
F5-TTS nu este antrenat pe MARA: clonează vocea dintr-un singur prompt de referință de câteva secunde. Comparația arată ce se câștigă și ce se pierde față de un model antrenat dedicat.



Rezultate obiective pe toate arhitecturile
Experimentul pe entități numite evaluează fiecare sistem pe aceleași 62 de propoziții din MARA, grupate după tipul de entitate pe care îl conțin: persoane, locuri, organizații și diverse. Este cel mai mare set de perechi comparabile din proiect.


F5-TTS pe vocea emoțională, 1.384 de perechi
Cel mai mare set de evaluare al proiectului: fiecare clip din corpusul Catalina resintetizat și comparat cu originalul.


Identități vocale multiple
Un singur model VITS antrenat pe corpusul multi-locutor SWARA, plus clonarea zero-shot cu F5-TTS. Fiecare pereche de mai jos conține înregistrarea originală a vorbitorului și reconstrucția modelului pentru exact același text.
VITS multi-locutor — reconstrucție pereche
Cele cinci perechi cu cea mai bună reconstrucție din setul de evaluare.
F5-TTS — zece voci, o singură frază, fără antrenare

Corpusul emoțional și ce se poate sintetiza din el
Două corpusuri monolocutor înregistrate și curățate în cadrul proiectului, cu aceeași schemă de etichetare: neutru, fericit, furios, calm. Pe ele au fost construite două fine-tune-uri VITS și experimentul de transfer de emoție cu F5-TTS.

Exemple din corpus, pe emoții — voce feminină
Stânga: înregistrarea originală. Dreapta: reconstrucția modelului VITS fine-tune-at pe aceeași voce.
Exemple din corpus, pe emoții — voce masculină
Același protocol. Chipul durată compară secundele efectiv rostite: sinteza nu reproduce durata originalului, ci o rescrie — de la 0,6× pe enunțul furios până la 3,1× pe cel neutru. MCD și F₀ rămân valabile pentru că sunt aliniate prin DTW.

Sinteză liberă pe text nou, pe fiecare emoție
Text care nu apare în corpus, sintetizat cu modelele fine-tune-ate. Nu există referință naturală — aici se aude ce a învățat efectiv modelul despre fiecare stil.


Transfer de emoție cu F5-TTS, fără fine-tune
Aici emoția nu vine dintr-o etichetă, ci dintr-un singur clip de referință de câteva secunde. Ascultați întâi referința, apoi sinteza pe text complet diferit.


Preprocesarea textului românesc
Un pipeline separat de modelul acustic, care transformă text brut în reprezentarea de care are nevoie un sistem TTS: text normalizat, analiză lingvistică, fonetizare IPA cu accent lexical, emoție, focus și valori de control prozodic. Tot ce urmează este ieșire reală a pipeline-ului, nu ilustrație.
1 · Normalizare — fiecare modificare este trasată
Numere, date, ore, procente, monede, unități și abrevieri sunt expandate în forma rostită, determinist, fără pierderea diacriticelor.
2 · Fonetizare, silabificare și accent lexical
Cascadă: dicționar de excepții al proiectului → eSpeak IPA → regulă grafemică marcată ca fallback. Fiecare simbol este validat față de inventarul fonetic canonic al limbii.
3 · Emoție, intensitate, valență și activare
Clasificator XLM-RoBERTa multilingv rulat local. Șase etichete plus unspecified pentru cazurile ambigue sau cu încredere scăzută. Toate valorile de mai jos sunt predicții reale pe propozițiile afișate.
4 · Focus — care cuvânt poartă accentul frazei
Scor continuu per token, separat de accentul lexical: accentul lexical spune ce silabă dintr-un cuvânt, focusul spune ce cuvânt din propoziție.
5 · Prozodie și tokeni de control
Punctuația, sintaxa, emoția și focusul devin valori de control independente de model, limitate la intervale sigure, apoi tokeni discreți pe care un model TTS îi poate consuma direct.
6 · Netezire contextuală între propoziții
Emoția fiecărei propoziții este echilibrată cu cea precedentă, fără a suprascrie vreodată predicția locală — ambele rămân în rezultat.
Cum sună antrenarea, pas cu pas
Aceeași propoziție sintetizată cu checkpoint-uri succesive ale modelului VITS pe MARA. De la zgomot structurat la voce inteligibilă, apoi la prozodie — se aude unde se face fiecare salt.

Curbele fine-tune-ului emoțional

Ce nu funcționează
Cazurile problematice sunt la fel de informative ca rezultatele bune și sunt reproductibile din aceleași fișiere. Fiecare exemplu de mai jos poate fi ascultat.