# Un sunet, cinci forme acceptate

Într-un clip hindi public de 0,9 secunde, aceeași ieșire — `improve होता है` — primește 33,3% WER dacă primul șir scris, `इम्प्रूव होता है`, este singurul reper. Cu formele acceptate în lattice, aceeași ieșire primește 0,0% WER.

## Ce se schimbă

WER măsoară distanța dintre output și reper. În cazul simplu: o substituție din trei cuvinte = 33,3%. În cazul lattice: forma `improve` este acceptată pentru primul cuvânt, iar celelalte două se potrivesc = 0,0%.

## Ce conține sursa

Setul public Monsoon hi-IN are 753 de clipuri, 1,33 ore declarate și 468 de vorbitori declarați. Acest proiect arată un singur rând și forma unui eșantion local de 12 rânduri; nu reanalizează întregul clasament și nu afișează metadate despre contributori.

## Limite

Articolul de lansare raportează că aplatizarea variantelor poate schimba neuniform ratele de eroare și poate inversa perechi de modele. Nu recalculăm acel clasament: release-ul public nu conține ipotezele tuturor modelelor. Demonstrația nu măsoară inteligență, echitate, înțelegere, performanță regională sau calitatea generală a unui model.

## Surse

- [Dataset card Monsoon hi-IN](https://huggingface.co/datasets/VoiceArena/MonsoonASR-Open-ASR-leaderboard-hi-IN) — lattice, split public și licență CC BY 4.0.
- [Articolul de lansare](https://huggingface.co/blog/open-asr-leaderboard-global-south) — implicația pentru scoruri și clasamente, prezentată aici ca rezultat raportat de sursă.
- [OIWER](https://arxiv.org/abs/2603.00941) — metoda de aliniere cu variante de referință.
- [`voi-oiwer` pe PyPI](https://pypi.org/project/voi-oiwer/) — scorerul public documentat.

Verificat la 30 august 2026. Audio demo folosit sub licența CC BY 4.0 declarată de dataset.
