# Care limbă e cea mai apropiată de română? Trei măsurători, trei răspunsuri

Româna a fost comparată cu limbile lumii în trei feluri, pe date deschise. Răspunsurile nu coincid, iar orice limbă poate fi pusă lângă română, după fiecare măsură în parte.

Marius Comper · 4 octombrie 2026 · date: ASJP, WALS, Grambank, PHOIBLE

## Hărțile apropierii

Pe hărți, un punct e o limbă, așezată acolo unde se vorbește. Cu cât punctul e mai mare și mai intens, cu atât limba e mai aproape de română după măsura respectivă. Cercul gol marchează româna. Sunetele au două hărți, câte una pentru fiecare descriere a românei.

### Cuvinte

1. meglenoromână: 0,44
2. italiană: 0,60
3. sardă logudoreză: 0,61
4. aromână: 0,61
5. napolitană și graiuri din sudul Italiei: 0,62
6. emiliană: 0,66
7. sardă campidaneză: 0,66
8. catalană: 0,67
9. piemonteză: 0,67
10. friulană: 0,67

### Gramatică

1. italiană: 41 din 51
2. albaneză: 45 din 56
3. portugheză: 40 din 50
4. greacă: 48 din 65
5. spaniolă: 47 din 64
6. ucraineană: 29 din 40
7. bulgară: 41 din 57
8. rusă: 46 din 65
9. arabă din Golf: 33 din 47
10. catalană: 28 din 40

### Sunete: cu 7 vocale și 20 de consoane

1. damana (malayo): 1–11
2. bangolan: 1–22
3. nupe: 3–11
4. creolă franceză karipúna: 2–17
5. mazanderani: 1–56
6. popoluca de Sayula: 8–32
7. ndamba: 4–37
8. pidgin nigerian: 3–54
9. ishkashimi: 8–46
10. kirundi: 8–52

### Sunete: cu consoanele muiate din «lupi» și «pomi» numărate separat

1. rusă: 1–5
2. sorabă de sus: 3–7
3. vepsă: 1–7
4. sami skolt: 1–10
5. lituaniană: 1–12
6. votică: 6–10
7. erzeană: 4–11
8. sorabă de jos: 6–9
9. bulgară: 1–62
10. sami de Ter: 10–21

Trei baze de date deschise descriu limbile lumii din trei unghiuri: cuvintele de bază, gramatica și sunetele. Fiecare a fost folosită la fel: româna, comparată pe rând cu toate limbile din bază.

Rudele, vecinii și limbile care doar au aceleași sunete sunt trei lucruri diferite. Cuvintele de bază se moștenesc din limba-mamă și se schimbă greu. Gramatica se moștenește și ea, dar se apropie, în secole de conviețuire, de a vecinilor. Sunetele unei limbi sunt puține, câteva zeci, iar două limbi pot ajunge să aibă aproape aceleași sunete fără să se fi întâlnit vreodată.

## O limbă lângă română

Scrie numele unei limbi. Cele patru rigle pornesc din stânga, de la română: cu cât semnul limbii e mai la stânga, cu atât limba e mai aproape după măsura respectivă. Sub rigle sunt dovezile: cele 40 de cuvinte puse alături, trăsăturile de gramatică la care limbile coincid sau diferă, sunetele comune și cele care apar numai într-una dintre cele două limbi.

Fiecare loc e însoțit de un interval. Calculul se poate face în mai multe feluri la fel de îndreptățite (care listă de cuvinte pentru română, care descriere a sunetelor, câte trăsături comune se cer); intervalul arată cel mai bun și cel mai slab loc pe care limba îl ocupă în toate aceste variante. La sunete se dă și locul median, cel din mijloc când variantele sunt puse în ordine. Sunt 5.734 de limbi în total, dar numai 201 intră în clasament la toate cele trei măsuri.

## Cuvintele: rudele ies primele

Programul ASJP (Automated Similarity Judgment Program) a strâns 11.540 de liste din toată lumea, fiecare cu aceleași 40 de înțelesuri, cele mai stabile dintr-o listă clasică de 100 (lista lui Swadesh): eu, tu, noi, unu, doi, apă, foc, soare, nume. Fiecare cuvânt e transcris cu un set mic de simboluri fonetice. Distanța dintre două limbi se calculează cuvânt cu cuvânt: câte sunete trebuie schimbate, adăugate sau scoase ca să ajungi de la o formă la cealaltă, raportat la lungime. Rezultatul se împarte apoi la distanța medie dintre cuvintele cu înțelesuri diferite din aceleași două liste. Zero înseamnă forme identice la toate înțelesurile comparate. În jur de 1 (scorul poate trece puțin peste), cuvintele cu același înțeles nu seamănă mai mult decât cele luate la întâmplare.

Cea mai apropiată listă e cea meglenoromână (0,44), în toate cele 72 de variante de calcul. Urmează italiana (0,60), sarda logudoreză (0,61), aromâna (0,61, dar cu numai 32 de cuvinte comune din 40) și napolitana (0,62). În calculul de bază, pe primele 17 locuri sunt limbi romanice (pe ultimul dintre ele, o creolă portugheză din India). Spaniola e pe locul 29 (0,73), franceza pe 33 (0,78).

Meglenoromâna și aromâna sunt socotite, în tradiția lingvisticii românești, dialecte istorice ale românei, alături de dacoromână și de istroromână. Cataloagele internaționale Glottolog și ISO 639-3 le trec drept limbi separate. Oricum le-ai numi, sunt rudele cele mai apropiate ale românei, iar prima limbă din afara acestui grup e italiana. ASJP nu are listă separată nici pentru istroromână, nici pentru graiul din Republica Moldova, pe care Glottolog îl trece ca dialect al românei.

În calculul de bază, latina vine abia pe locul 18 (0,69); după variantă, e între locurile 10 și 25, dar mereu după italiană și sarda logudoreză. Măsura compară formele de azi sunet cu sunet și nu spune nimic despre descendență. «Foc» și italienescul «fuoco» continuă latinescul «focus», care însemna vatră; pentru foc, lista latină din ASJP are «ignis».

Dincolo de limbile romanice, scorurile se apropie repede de 1. Bulgara e pe locul 53 (0,87), albaneza pe 245 (0,93), chineza mandarină pe 2.843 (0,99), maghiara pe 3.846 (1,00). Mai mult de jumătate dintre cele 5.457 de limbi au peste 0,99, iar numai 127 coboară sub 0,90. Aici, unde aproape toate limbile se înghesuie lângă 1, locul unei limbi spune foarte puțin. Clasamentul nu măsoară nici vocabularul împrumutat: bulgara și maghiara, din care româna a luat multe cuvinte, sunt comparate doar pe 40 de înțelesuri stabile, fără cuvintele marcate ca împrumuturi.

ASJP are liste și pentru limbi artificiale, lăsate aici în afara clasamentului. Interlingua, alcătuită din vocabularul comun al marilor limbi europene, în cea mai mare parte romanic, ar fi a doua (0,59); esperanto ar fi pe locul 29 (0,72).

## Gramatica: o rudă și o vecină, cu același scor

WALS, atlasul mondial al structurilor lingvistice, descrie gramatica fiecărei limbi prin trăsături cu câteva valori posibile: unde stă articolul hotărât, câte cazuri are substantivul, în ce ordine vin subiectul, verbul și complementul. Româna are 82 de trăsături descrise; 65 țin de gramatică, restul de sunete și de vocabular. Măsura folosită aici e simplă: dintre trăsăturile descrise la ambele limbi, câte au aceeași valoare.

Italiana are aceeași valoare ca româna la 41 din 51 de trăsături, albaneza la 45 din 56, portugheza la 40 din 50: patru din cinci, la toate trei. Urmează greaca (48 din 65), spaniola (47 din 64), ucraineana (29 din 40) și bulgara (41 din 57). Franceza, limbă romanică, are 38 din 64, mai puțin decât rusa (46 din 65) sau engleza (45 din 65). La celălalt capăt, turca: 21 din 58.

Cu 50–60 de trăsături, diferențele mici nu pot despărți limbile: marjele de eroare ale primelor zece se suprapun. Ce rămâne valabil în cele nouă variante de calcul: albaneza e în primele trei în toate, italiana e în primele cinci în opt dintre ele (în a noua nu are destule trăsături comune ca să intre în clasament), iar franceza nu urcă niciodată peste locul 14.

Comparația e mai curată pe aceleași trăsături pentru toate limbile. Sunt 36 descrise la toate cele opt limbi din tabelul de mai jos. Pe ele, albaneza coincide cu româna la 32, italiana la 30, portugheza la 29, spaniola la 28, bulgara la 24, greaca la 23, iar franceza la 21.

Unde româna se desparte de italiană, albaneza e de partea românei. La opt trăsături româna și italiana au valori diferite, iar albaneza e descrisă și ea; la cinci dintre ele, albaneza are valoarea românei și la una singură pe a italianei. Cele cinci: articolul hotărât lipit la sfârșitul cuvântului («lupul», în albaneză «ujku»), cazurile marcate prin terminații, numeralele ordinale formate de la cele cardinale cu excepția lui «primul», felul în care se formează poruncile și îndemnurile și ordinea subiect–verb. La bulgară și la greacă nu se vede același lucru: în aceeași comparație, bulgara e de trei ori de partea românei și de șase ori de a italianei, greaca de patru și de cinci ori. Una dintre cele șase e chiar articolul hotărât: WALS îl socotește pe cel bulgăresc cuvânt aparte, deși stă tot după substantiv («вълкът», lupul).

Rezultatul nu e o probă a uniunii lingvistice balcanice, numele dat de lingviști asemănărilor de gramatică dintre română, albaneză, bulgară, macedoneană și greacă. Dintre trăsăturile ei clasice, WALS are articolul pus după substantiv; infinitivul înlocuit de conjunctiv («vreau să plec» față de «vreau a pleca»), viitorul format cu «a vrea» și complementul reluat prin pronume nu au rubrici proprii. Articolul, infinitivul și viitorul sunt arătate, cu exemple, pe pagina despre uniunea lingvistică balcanică. Nici italiana nu e departe de albaneză: cele două au aceeași valoare la 42 din 58 de trăsături descrise la amândouă.

### Ce spune Grambank, care nu are româna

Cea mai mare bază de date comparativă de gramatică, după autorii ei, Grambank (2.467 de limbi și dialecte, 195 de trăsături), nu are fișă pentru română în versiunea 1.0.3. Nu are nici pentru bulgară, nici pentru spaniolă. O are pe a aromânei, cu 165 de trăsături completate, așa că testul poate fi repetat pentru ruda cea mai apropiată a românei care are date.

Așa cum sunt codate în Grambank, aromâna coincide cel mai des cu italiana și cu portugheza (151 din 164 de trăsături la fiecare), apoi cu occitana, galiciana, lombarda și corsicana. Albaneza toscă, baza albanezei literare, vine imediat după ele (142 din 160), înaintea sardei, a catalanei (142 din 164) și a francezei (136 din 165).

Și aici, unde aromâna se desparte de italiană, albaneza e de partea aromânei: de nouă ori, față de patru. Macedoneana dă 9 la 3, greaca 7 la 6. Printre trăsături: articolul pus după substantiv, cazurile, apoi modul și timpul marcate prin particule invariabile. Două dintre aceste codări au fost contestate la verificare: italiana apare în Grambank fără verb auxiliar pentru timp, deși «ho visto» are unul, iar a doua privește pronumele lipit după verb în aromână. Fără ele, scorurile sunt 7 la 4 pentru albaneză, 7 la 3 pentru macedoneană și 5 la 6 pentru greacă.

## Sunetele: două descrieri ale românei, două liste

PHOIBLE adună inventare de sunete. Un inventar e lista sunetelor unei limbi care pot deosebi două cuvinte (fonemele, uneori și variante ale lor), așa cum a stabilit-o un lingvist. Sunt 3.020 de inventare pentru 2.186 de limbi. Ce se măsoară aici e câte sunete au două inventare în comun, din câte au împreună; una dintre variantele de calcul măsoară în schimb cât de apropiate sunt sunetele unui inventar de ale celuilalt. Nu se măsoară cât de des apare fiecare sunet în vorbire, nici melodia frazei, nici cum sună limba pentru cineva care nu o știe.

Pentru română, PHOIBLE are trei inventare, iar ele nu coincid. Două urmează descrierea obișnuită: șapte vocale, 20 de consoane și semivocalele din «iarnă», «ziuă», «seară» și «soare». Al treilea, întocmit după cartea Ioanei Chitoran despre fonologia românei (2002), numără separat consoanele muiate (palatalizate) de la sfârșitul unor cuvinte ca «lupi», «pomi», «rupi»: p-ul din «lupi» e trecut ca alt sunet decât p-ul din «lup». Inventarul ajunge astfel la 51 de unități, față de 31 și 32.

Cu descrierea obișnuită, cele mai apropiate inventare sunt ale unor limbi îndepărtate: damana din Columbia, bangolan din Camerun, nupe din Nigeria, o creolă franceză din Brazilia (karipúna) și mazanderani din Iran. Primele trei nu au nicio legătură cu româna; mazanderani e o limbă iraniană, deci o rudă foarte îndepărtată. Au, ca româna, un inventar de mărime mijlocie, făcut mai ales din sunete răspândite în toată lumea. Bangolan are toate cele 29 de sunete prezente în cele trei descrieri ale românei: șapte vocale, 20 de consoane și semivocalele din «iarnă» și «ziuă».

Când consoanele muiate sunt numărate separat, lista se mută în nordul și estul Europei: rusă, sorabă, vepsă, sami skolt, lituaniană, erzeană, bulgară. Toate au serii întregi de consoane muiate, ca rusa în «брать» (brat', a lua) față de «брат» (brat, frate).

În niciuna dintre cele 72 de variante de calcul italiana nu urcă peste locul 19, iar chineza mandarină nu urcă peste locul 986, din 2.085. Albaneza are 28 dintre cele 29 de sunete comune descrierilor românei, italiana 25 (îi lipsesc «ă», «î», «h» și «j»), bulgara 24, chineza mandarină 17.

Dintre aceste 29 de sunete, cele mai rare în inventarele din PHOIBLE sunt «j» din «joc» (ʒ, prezent în 15,9% din inventare), «î» (ɨ, 16,5%) și «ă» (ə, 22,4%). Urmează «ț» (26,8%) și «v» (27,0%). Cel mai răspândit sunet care lipsește din toate cele trei descrieri ale românei e «ng» din englezescul «sing» (ŋ, în 62,8% din inventare). Printre următoarele se numără «ñ» din spaniolă (ɲ, 42,7%) și ocluziva glotală, pauza scurtă din mijlocul interjecției englezești «uh-oh» (ʔ, 37,5%).

Cum sună româna pentru urechea unui străin e altă întrebare. Într-un joc online în care oamenii ghiceau limba dintr-o înregistrare de 20 de secunde, cu 15 milioane de răspunsuri analizate în 2017 de Hedvig Skirgård, Seán Roberts și Lars Yencken, pe harta confuziilor făcute de jucători româna stă lângă greacă, albaneză și limbile slave.

## De ce nu se potrivesc cele trei răspunsuri

Fiecare măsură urmărește altceva. Lista de 40 de cuvinte e alcătuită din înțelesurile cele mai stabile, iar pe primele 17 locuri din calculul de bază sunt numai limbi romanice, rudele românei.

Gramatica se moștenește, dar se și apropie de a limbilor din jur. Româna se vorbește departe de celelalte limbi romanice: între ea și italiană stau limbi slave și maghiara, iar bulgara, albaneza și greaca îi sunt mai aproape pe hartă. Pe grafic, limbile romanice sunt aproape la ambele măsuri; albaneza, greaca și bulgara sunt aproape la gramatică și departe la cuvinte.

Sunetele sunt puține. O limbă are câteva zeci de foneme, iar cele mai răspândite (p, t, k, m, n, a, i, u) apar aproape peste tot. Două inventare de mărime mijlocie se pot suprapune în proporție de peste trei sferturi fără ca limbile să aibă vreo legătură, cum se întâmplă cu româna și damana.

De aceea întrebarea din titlu nu are un singur răspuns. «Cea mai apropiată» are sens numai împreună cu măsura: la cuvinte, la gramatică sau la sunete.

## Cum s-a măsurat și ce alegeri s-au făcut

### Identitatea limbilor

O limbă înseamnă aici o intrare de nivel «limbă» din catalogul Glottolog 5.3. Listele și inventarele culese pentru dialecte sunt trecute la limba lor. Albaneza literară se sprijină pe dialectul tosc. Lista ASJP pentru albaneza standard, atașată grupului «Albanian», și fișa WALS «Albanian» (care are codul ISO sqi, nu are cod Glottolog și pomenește atât dialectul gheg, cât și pe cel tosc) au fost puse la albaneza toscă, fiindcă PHOIBLE și Grambank au datele albanezei sub acest cod.

### Cuvinte

ASJP versiunea 21: 11.540 de liste. Calculul de bază urmează regulile programului: lista de 40 de cuvinte, cel mult două sinonime pentru un înțeles, cuvintele marcate ca împrumuturi lăsate deoparte, distanța Levenshtein raportată la lungimea cuvântului și împărțită la distanța medie dintre cuvintele cu înțelesuri diferite (în engleză LDND). Pentru română sunt trei liste, care diferă între ele cu 0,12 până la 0,22; cea de bază e ROMANIAN_3. O limbă intră în clasament dacă are cel puțin 28 de cuvinte comune cu lista românească: 5.457 de limbi. Au rămas pe dinafară 405 liste fără cod Glottolog, 22 de liste ale unor limbi artificiale, patru liste atașate unor grupuri de limbi și 620 de limbi cu prea puține cuvinte.

Variantele: lista românească (3), simbolurile compuse luate ca o unitate sau desfăcute (2), împrumuturile scoase sau păstrate (2), sinonimele (primele două, toate, sau perechea cea mai apropiată: 3), lista mediană sau cea mai apropiată când o limbă are mai multe (2). În total 72. Tabelul de cuvinte arată lista mediană; când aceasta e a unui grai local, iar ASJP are și o listă cu numele simplu al limbii, e arătată aceea, cu distanța ei. Pentru chineza mandarină, care are 184 de liste, tabelul arată lista din Beijing.

### Gramatică

WALS, ediția 2020.4: 65 de trăsături ale românei, după scoaterea celor 15 de fonologie și a celor două de vocabular; 28 dintre ele descriu ordinea cuvintelor. Clasamentul de bază cere cel puțin 40 de trăsături comune: 243 de limbi, din 1.900 de limbi care au măcar una. Variantele: toate trăsăturile, fără cele de ordine a cuvintelor (37), sau pe blocuri, în care trăsăturile care decurg una din alta contează o singură dată (51 de blocuri); cu pragul la 30, 40 sau 50 de trăsături comune.

În Grambank 1.0.3 s-au căutat codul Glottolog al românei și toată ramura romanică orientală: singura fișă e a aromânei. Aromâna a fost comparată cu limbile care au cel puțin 120 de trăsături comune cu ea.

### Sunete

PHOIBLE 2.0.1. Înainte de comparație, notațiile au fost aduse la aceeași formă: semnele pentru dental, apical, laminal, coborât, ridicat, centralizat, avansat și retras au fost scoase; r bătut și r vibrant au fost numărați ca un singur r; semivocalele notate i̯ și u̯ au fost citite ca j și w. Tonurile, diftongii și semivocalele din «seară» și «soare» nu intră în calcul. Lungimea, nazalizarea, palatalizarea, aspirația și sonoritatea rămân diferențe. Este o simplificare făcută cu bună știință: fără ea, același t românesc ar fi trei sunete diferite în cele trei descrieri.

Variantele: măsura (suprapunerea pe notația simplificată, pe notația din PHOIBLE, sau o distanță pe cele 37 de trăsături fonetice din PHOIBLE: 3), diftongii scoși sau păstrați (2), fonemele marginale păstrate sau scoase (2), descrierea românei (3), inventarul median sau cel mai apropiat când o limbă are mai multe (2). În total 72. La comparația sunet cu sunet, un sunet românesc e socotit comun dacă îl are, ca fonem obișnuit, cel puțin un inventar al limbii alese.

### Ce lipsește

Nicio măsură de aici nu spune cât de ușor se înțeleg doi vorbitori și niciuna nu ține seama de vocabularul întreg, de scriere sau de pronunția reală. Bazele de date sunt inegale: WALS are puține trăsături pentru multe limbi, iar PHOIBLE amestecă descrieri făcute după convenții diferite. De aceea fiecare rezultat e dat împreună cu numărul de cuvinte sau de trăsături pe care se sprijină.

## Surse

- [Wichmann, Holman, Brown, Dryer & Ran (eds.), The ASJP Database, version 21 (2025)](https://doi.org/10.5281/zenodo.16736409) Listele de cuvinte; versiunea CLDF 21.1, licență CC BY 4.0.
- [Dryer & Haspelmath (eds.), The World Atlas of Language Structures Online (2013), v2020.4](https://doi.org/10.5281/zenodo.13950591) Trăsăturile de gramatică; CC BY 4.0. Fișa românei: wals.info/languoid/lect/wals_code_rom.
- [Grambank v1.0.3 (2023)](https://doi.org/10.5281/zenodo.7844558) Trăsăturile de gramatică ale aromânei și ale limbilor de comparație; CC BY 4.0.
- [Skirgård, Haynie, Blasi, Hammarström, Collins et al., “Grambank reveals the importance of genealogical constraints on linguistic diversity…”, Science Advances 9(16), 2023](https://doi.org/10.1126/sciadv.adg6175) Articolul care descrie Grambank.
- [Moran & McCloy (eds.), PHOIBLE 2.0 (2019), Max Planck Institute for the Science of Human History](https://phoible.org/) Inventarele de sunete; versiunea CLDF 2.0.1, licență CC BY-SA 3.0. Inventarele românei: phoible.org/languages/roma1327.
- [Hammarström, Forkel, Haspelmath & Bank, Glottolog 5.3 (2026)](https://doi.org/10.5281/zenodo.18840935) Identitatea, clasificarea și coordonatele limbilor; CC BY 4.0.
- [Natural Earth, 1:110m land](https://www.naturalearthdata.com/) Conturul continentelor de pe hărți; domeniu public.
- [Wichmann, Holman, Bakker & Brown, “Evaluating linguistic distance measures”, Physica A 389(17), 2010, 3632–3639](https://doi.org/10.1016/j.physa.2010.05.011) Distanța LDND folosită la cuvinte.
- [ASJP, software and instructions](https://asjp.clld.org/help) Regulile de calcul urmate: cel mult două sinonime, împrumuturile excluse.
- [Chitoran, The Phonology of Romanian: A Constraint-Based Approach, Mouton de Gruyter, 2002](https://doi.org/10.1515/9783110889185) Sursa inventarului cu consoane palatalizate (EA 2443 în PHOIBLE).
- [Agard, “Structural Sketch of Rumanian”, Language 34(3, part 2), 1958, 7–127](https://doi.org/10.2307/522282) Una dintre sursele celorlalte două inventare ale românei (SPA 165, UPSID 527).
- [Lee & Zee, “Standard Chinese (Beijing)”, Journal of the International Phonetic Association 33(1), 2003, 109–112](https://doi.org/10.1017/S0025100303001208) Sursa a două dintre cele patru inventare ale chinezei standard din PHOIBLE.
- [Skirgård, Roberts & Yencken, “Why are some languages confused for others? Investigating data from the Great Language Game”, PLOS ONE 12(4), 2017](https://doi.org/10.1371/journal.pone.0165934) Cu ce limbi e confundată româna la auz.
- [Anderson, Tresoldi, Greenhill, Forkel, Gray & List, “Variation in phoneme inventories: quantifying the problem and improving comparability”, Journal of Language Evolution 8(2), 2023, 149–168](https://doi.org/10.1093/jole/lzad011) De ce inventarele aceleiași limbi diferă de la o bază de date la alta.
- [Littell, Mortensen, Lin, Kairis, Turner & Levin, “URIEL and lang2vec”, EACL 2017](https://doi.org/10.18653/v1/E17-2002) O bibliotecă de distanțe între limbi, construită din aceleași surse.
