METRICĂ · REFERINȚĂ · AUDIO PUBLIC
Un sunet,
cinci forme acceptate
Un benchmark poate păstra mai multe transcrieri corecte pentru același sunet. Într-un clip hindi de 0,9 secunde, aceeași ieșire primește 33,3% WER cu primul reper scris și 0,0% WER cu întregul set acceptat.
DE CE MERITĂ CITIT Dacă folosești WER ca să spui ce a auzit un sistem, alegerea reperului face parte din răspuns.
PROBĂ VIZIBILĂ · VoiceArena / Monsoon hi-IN · 753 de clipuri în splitul public
Rândul sursă conține voce publică. Nu o redăm aici fără o verificare separată a drepturilor și a riscului de reidentificare.
vezi datasetul sursăAceeași ieșire, două judecăți
OUTPUT improve होता है
Reperul ales: prima formă din listă. Scorul include o substituție.
RĂSPUNSUL SCURT reperul nu este decor; este parte din măsurătoare.
Ce măsoară scorul?
Nu doar diferența dintre voce și text. WER măsoară și distanța dintre ieșire și textul ales drept reper.
Schimbi numai starea de referință: de la primul șir la formele acceptate ale sursei.
În exemplul nostru, `improve` este o formă acceptată pentru primul cuvânt. Dacă reperul unic este `इम्प्रूव होता है`, cuvântul diferit devine o substituție. Dacă evaluatorul poate alege traseul `improve / होता / है` din lattice, ieșirea se potrivește fără eroare.
Lattice-ul păstrează opțiunile
Fiecare poziție are o mică listă de forme acceptate. Linia nu spune care formă este „mai bună”; spune ce a permis benchmarkul să fie comparat ca aceeași vorbire.
- 01poziția 1इम्प्रूवइंप्रूवimproveimprovimproov5 forme acceptate
- 02poziția 2होताhota2 forme acceptate
- 03poziția 3हैhai2 forme acceptate
Două judecăți, aceeași ieșire
Interacțiunea schimbă numai accesul la referințe. Operația rămâne edit-distance la nivel de cuvânt, transparentă și repetabilă.
(I + D + S) / cuvinte reper × 100
I = inserții · D = ștergeri · S = substituții
| Stare | Reper | Erori | Rezultat |
|---|---|---|---|
| Un reper | इम्प्रूव होता है | 1 S / 3 | 33,3% |
| Lattice | improve · होता · है | 0 / 3 | 0,0% |
Demonstrația folosește tokenuri exacte, ca să poată fi verificată cu ochiul. Scorerul OIWER citat adaugă normalizare indică și aliniere dinamică între variante; această pagină nu îl reproduce ca implementare completă.
Cât de dens e obiectul?
Setul public hi-IN are 753 de clipuri. Pentru a păstra obiectul verificabil, arătăm forma unui eșantion de 12 rânduri, nu o statistică nouă despre toți vorbitorii.
- 009Rândul 0: 9 variante în 3 poziții, 0,9 sec
- 0118Rândul 1: 18 variante în 5 poziții, 2,0 sec
- 0242Rândul 2: 42 variante în 21 poziții, 9,6 sec
- 034Rândul 3: 4 variante în 1 poziții, 0,5 sec
- 0426Rândul 4: 26 variante în 10 poziții, 2,8 sec
- 0540Rândul 5: 40 variante în 16 poziții, 9,0 sec
- 06104Rândul 6: 104 variante în 36 poziții, 12,8 sec
- 0781Rândul 7: 81 variante în 30 poziții, 14,8 sec
- 0837Rândul 8: 37 variante în 23 poziții, 11,6 sec
- 0955Rândul 9: 55 variante în 24 poziții, 7,0 sec
- 102Rândul 10: 2 variante în 1 poziții, 0,9 sec
- 1113Rândul 11: 13 variante în 7 poziții, 1,9 sec
LIMITĂ DE POPULAȚIE Niciun câmp despre persoană, localizare sau dispozitiv nu este folosit aici. Sunetul este inclus doar sub licența declarată a datasetului.
Clasamentul poate moșteni reperul
Articolul de lansare descrie o comparație în care aceleași ipoteze sunt evaluate cu referințe aplatizate sau cu lattice. Sursează faptul că ratele se schimbă neuniform și că unele perechi de modele își pot inversa ordinea.
O eroare nu este o sentință
Un scor mai mic în această demonstrație nu dovedește că un model „înțelege” mai bine vorbitorul.
- 01
Formele acceptate sunt rezultatul procesului de revizuire al benchmarkului; pagina nu certifică independent ortografia hindi.
- 02
Exemplul arată un rând și forma a 12 rânduri. Nu este o reanaliză completă a celor 753 de clipuri.
- 03
Nu publicăm metadate despre contributori și nu facem comparații pe oraș, regiune, venit, dispozitiv sau gen.
- 04
Nu evaluăm inteligență, echitate, înțelegere sau calitate generală. Măsurăm efectul alegerii reperului asupra unui scor.
De unde vine demonstrația
Rândul, metoda și limitele pot fi urmărite în materialele originale. Sursele au fost arhivate local și verificate înainte de publicare.
30 AUG
2026
Credit: VoiceArena, MonsoonASR-Open-ASR-leaderboard-hi-IN — CC BY 4.0. Schimbare făcută: reproducem lattice text redacționat și scorul demo; nu redistribuim audio-ul sursă sau câmpurile despre contributor.