METRICĂ · REFERINȚĂ · AUDIO PUBLIC

Un sunet,
cinci forme acceptate

Un benchmark poate păstra mai multe transcrieri corecte pentru același sunet. Într-un clip hindi de 0,9 secunde, aceeași ieșire primește 33,3% WER cu primul reper scris și 0,0% WER cu întregul set acceptat.

DE CE MERITĂ CITIT Dacă folosești WER ca să spui ce a auzit un sistem, alegerea reperului face parte din răspuns.

PROBĂ VIZIBILĂ · VoiceArena / Monsoon hi-IN · 753 de clipuri în splitul public

CLIP PUBLIC · MONSOON hi-IN0,9 sec
CLIPUL NU ESTE REHOSTAT

Rândul sursă conține voce publică. Nu o redăm aici fără o verificare separată a drepturilor și a riscului de reidentificare.

vezi datasetul sursă

Aceeași ieșire, două judecăți

OUTPUT improve होता है

un singur reper 33,3% 1 substituție / 3 cuvinte
lattice acceptat 0,0% 0 erori / 3 cuvinte
Schimbă judecătorul

Reperul ales: prima formă din listă. Scorul include o substituție.

RĂSPUNSUL SCURT reperul nu este decor; este parte din măsurătoare.

01 / ÎNTREBAREA

Ce măsoară scorul?

Nu doar diferența dintre voce și text. WER măsoară și distanța dintre ieșire și textul ales drept reper.

aceeași ieșire
33,3%0,0%

Schimbi numai starea de referință: de la primul șir la formele acceptate ale sursei.

În exemplul nostru, `improve` este o formă acceptată pentru primul cuvânt. Dacă reperul unic este `इम्प्रूव होता है`, cuvântul diferit devine o substituție. Dacă evaluatorul poate alege traseul `improve / होता / है` din lattice, ieșirea se potrivește fără eroare.

02 / OBIECTUL

Lattice-ul păstrează opțiunile

Fiecare poziție are o mică listă de forme acceptate. Linia nu spune care formă este „mai bună”; spune ce a permis benchmarkul să fie comparat ca aceeași vorbire.

calea ieșirii alternativă acceptată
03 / CALCULUL

Două judecăți, aceeași ieșire

Interacțiunea schimbă numai accesul la referințe. Operația rămâne edit-distance la nivel de cuvânt, transparentă și repetabilă.

FORMULA (I + D + S) / cuvinte reper × 100

I = inserții · D = ștergeri · S = substituții

Scorul exact al demonstrației
StareReperEroriRezultat
Un reperइम्प्रूव होता है1 S / 333,3%
Latticeimprove · होता · है0 / 30,0%

Demonstrația folosește tokenuri exacte, ca să poată fi verificată cu ochiul. Scorerul OIWER citat adaugă normalizare indică și aliniere dinamică între variante; această pagină nu îl reproduce ca implementare completă.

04 / CONTEXT

Cât de dens e obiectul?

Setul public hi-IN are 753 de clipuri. Pentru a păstra obiectul verificabil, arătăm forma unui eșantion de 12 rânduri, nu o statistică nouă despre toți vorbitorii.

753clipuri publice
1,33ore declarate
468vorbitori declarați
  1. 00
    9Rândul 0: 9 variante în 3 poziții, 0,9 sec
  2. 01
    18Rândul 1: 18 variante în 5 poziții, 2,0 sec
  3. 02
    42Rândul 2: 42 variante în 21 poziții, 9,6 sec
  4. 03
    4Rândul 3: 4 variante în 1 poziții, 0,5 sec
  5. 04
    26Rândul 4: 26 variante în 10 poziții, 2,8 sec
  6. 05
    40Rândul 5: 40 variante în 16 poziții, 9,0 sec
  7. 06
    104Rândul 6: 104 variante în 36 poziții, 12,8 sec
  8. 07
    81Rândul 7: 81 variante în 30 poziții, 14,8 sec
  9. 08
    37Rândul 8: 37 variante în 23 poziții, 11,6 sec
  10. 09
    55Rândul 9: 55 variante în 24 poziții, 7,0 sec
  11. 10
    2Rândul 10: 2 variante în 1 poziții, 0,9 sec
  12. 11
    13Rândul 11: 13 variante în 7 poziții, 1,9 sec
Fiecare bară este un rând din eșantionul local; numărul de la dreapta este totalul variantelor acceptate din acel rând.

LIMITĂ DE POPULAȚIE Niciun câmp despre persoană, localizare sau dispozitiv nu este folosit aici. Sunetul este inclus doar sub licența declarată a datasetului.

05 / CE SPUNE SURSA

Clasamentul poate moșteni reperul

Articolul de lansare descrie o comparație în care aceleași ipoteze sunt evaluate cu referințe aplatizate sau cu lattice. Sursează faptul că ratele se schimbă neuniform și că unele perechi de modele își pot inversa ordinea.

06 / CE NU SPUNE

O eroare nu este o sentință

Un scor mai mic în această demonstrație nu dovedește că un model „înțelege” mai bine vorbitorul.

  • 01

    Formele acceptate sunt rezultatul procesului de revizuire al benchmarkului; pagina nu certifică independent ortografia hindi.

  • 02

    Exemplul arată un rând și forma a 12 rânduri. Nu este o reanaliză completă a celor 753 de clipuri.

  • 03

    Nu publicăm metadate despre contributori și nu facem comparații pe oraș, regiune, venit, dispozitiv sau gen.

  • 04

    Nu evaluăm inteligență, echitate, înțelegere sau calitate generală. Măsurăm efectul alegerii reperului asupra unui scor.

07 / URMĂREȘTE PROBA

De unde vine demonstrația

Rândul, metoda și limitele pot fi urmărite în materialele originale. Sursele au fost arhivate local și verificate înainte de publicare.

VERIFICAT
30 AUG
2026

Credit: VoiceArena, MonsoonASR-Open-ASR-leaderboard-hi-IN — CC BY 4.0. Schimbare făcută: reproducem lattice text redacționat și scorul demo; nu redistribuim audio-ul sursă sau câmpurile despre contributor.