Marius Comper · Recensământ

RecensământLimba română · dexonline · 3 septembrie 2026

Câte cuvinte are limba română?

Gândește-te la un număr. Acum uită-l: dicționarul numără patru lucruri deodată254.055 de articole, 320.645 de forme de bază, 1.242.747 de definiții și 2.274.323 de forme flexionate. Toate sunt adevărate. Niciunul singur nu e răspunsul.

Socoteală reproductibilă din dump-ul public dexonline din 3 septembrie 2026 (licență GPL) · scriptul de numărare e versionat · limitele stau lângă afirmații, nu la subsol.

Scrie numărul — apoi vezi unde pică el între cele patru numere reale.

1 · Cele patru numere

Întrebarea pare să ceară un număr. Baza de date răspunde cu o piramidă: cu cât cobori de la sensuri spre forme, cu atât numerele cresc.

254.055

Articole de dicționar

Intrări — câte cuvinte-titlu are dexonline. Aici intră și locuțiuni, proverbe, ba chiar și câte un citat franțuzesc rătăcit.

320.645

Forme de bază

Lexeme — infinitivul verbelor, nominativul substantivelor. Mai multe decât articolele, fiindcă variantele (fierăstrău, ferăstrău, herăstrău) stau fiecare pe picioarele ei.

1.242.747

Definiții

Explicații culese din 113 dicționare. Aproape cinci definiții de articol, în medie — fiindcă fiecare dicționar își spune părerea pe cont propriu.

2.274.323

Forme flexionate

Toate hainele gramaticale: conjugări, declinări, articulări. Fiecare formă de bază îmbracă în medie 7,1 haine.

≈ 1,26 forme de bază de articol · ≈ 4,9 definiții de articol · ≈ 7,1 forme flexionate de formă de bază

Uite de ce nu se pupă niciodată două numere auzite la televizor: unul numără articolele, altul formele de bază, altul definițiile. Iar paradoxul preferat al lexicografilor stă într-un cuvânt ca broască — două articole (amfibianul și încuietoarea), dar un singur lexem, fiindcă se declină la fel. Două sensuri, o singură haină gramaticală.

De reținut: când cineva îți servește „numărul de cuvinte al limbii române”, întreabă-l ce-a numărat. Dacă nu știe, tocmai ai aflat cât valorează numărul lui.

2 · Alfabetul strâmb

Dicționarul nu începe cu A și nu se termină cu Z în mod egal. Trei litere — C, P și S — adună singure 28,7% din toate articolele (72.987 din 254.055). Coada alfabetului e aproape goală.

C-ul domină cu 28.488 de articole (11,21%), iar litera  nu deschide niciun cuvânt românesc: singurul ei articol e litera însăși, â. Q-ul, intrat pe filiera neologismelor, strânge 251 de articole — iar cele zece intrări care nu încep cu nicio literă sunt cifre, resturi și mici accidente de catalogare, ținute la vedere ca atare.

Cifrele brute, ca să le verifici fără JavaScript: data.csv · data.json.

De reținut: Î-ul adună 5.211 articole (2,05%) aproape integral din verbe cu „în-”. Alfabetul dicționarului e harta prefixelor limbii, nu a sunetelor ei.

3 · Dicționarul e o antologie

dexonline nu e un dicționar, ci o sută treisprezece — puse unul peste altul. Cel mai mare contribuabil nu e DEX-ul, ci Micul dicționar academic (MDA2), cu 189.870 de definiții: 15,3% din total, de unul singur.

Primele 10 dicționare din componență, după numărul de definiții din dump-ul public (3 septembrie 2026).
#DicționarEdițieDefiniții
1Micul dicționar academic (MDA2)2010189.870
2Marele dicționar ortografic (DOR)200881.152
3Dicționar ortografic200274.906
4DEX '09200972.421
5DEX '98199866.185
6DOOM 3202165.329
7DOOM 2200562.488
8Marele dicționar de neologisme200054.374
9Dicționarul limbii române literare contemporane1955–195751.295
10Dicționar de sinonime (Seche)200249.269

Două lucruri merită privite de aproape. Întâi: DEX '09 are cu 6.236 de definiții mai multe decât DEX '98 (+9,4%) — un deceniu de limbă, măsurat în intrări. Apoi: înăuntru stau laolaltă dicționare de aproape un secol — Scriban (1939) cu 42.763 de definiții, Șăineanu (1929) cu 33.413, Candrea (1926–1931) cu 28.675. Când cauți un cuvânt pe dexonline, întrebi de fapt o sută de ani de lexicografi.

De reținut: numerele din tabel sunt definiții din dump-ul public, nu tirajele tipărite — dicționarele cu copyright nu apar aici deloc (vezi Limite).

4 · Ce nu-ți vine să crezi

Orice recensământ adevărat iese cu povești pe margine. Patru, culese chiar din baza de date:

Singuraticul Â

â

Un singur articol începe cu  — litera însăși. Niciun cuvânt românesc nu începe cu â; dicționarul o recunoaște tacit, păstrând litera drept exponat.

Cel mai lung cuvânt-titlu

50 de caractere

Jumătate-de-Om-Călare-pe-Jumătate-de-Iepure-Șchiop — personaj din basm, intrat articol în toată regula. Dicționarul ia în serios și fantastica.

Demonstrativele lui Ă

16 articole

ăla, ăsta, ăstălalt, ălalalt, ăl — toată familia arătătoarelor stă înghesuită sub cea mai rară vocală. Plus ăuire, fiindcă limba știe și să urle.

Proverbe franțuzești

„Il faut…”

Printre cele mai lungi articole stau citate întregi — On revient toujours à ses premières amours — moștenite din culegerile de proverbe. Dicționarul e și bibliotecă de înțelepciune împrumutată.

5 · Ce nu spun cifrele

Un recensământ cinstit își arată și golurile. Patru, pe scurt:

1. Dump-ul public nu e tot dexonline-ul. Dicționarele împovărate de copyright lipsesc din arhiva gratuită — deci și din socoteala noastră. Numerele descriu arhiva din 3 septembrie 2026, nu „limba română” ca atare.

2. Tot ce e scris pare mai mare decât e. Variantele regionale, diminutivele și citatele umflă cozile numărătorii. Româna vorbită de zi cu zi — și neologismele care n-au apucat tiparul — nu apar deloc.

3. Formele flexionate se repetă. Din cele 2.274.323 de rânduri, o parte sunt dublete de accent sau de variantă; șirurile distincte sunt mai puține. Cifra măsoară munca morfologică, nu vocabularul.

4. Mediile mint frumos. „4,9 definiții de articol” amestecă cuvinte cu cincizeci de sensuri și cuvinte cu unul singur. Media e busolă, nu portret.

6 · Cum s-a numărat

Arhiva dex-database-2026-09-03.sql.gz (378,6 MB comprimați, ~1,6 GB deschiși) s-a descărcat de la dexonline.ro/static/download și s-a citit ca flux, fără import în bază de date: scriptul scripts/parse_dex.py desparte tuplurile INSERT ținând cont de ghilimele și numără rândurile tabelelor Entry, Lexeme, Definition, InflectedForm și Source. Histograma pe litere iese din inițialele descrierilor de articole și se adună exact la total (254.055 = 254.055); scriptul refuză arhivele nedatate, ca fiecare cifră să știe din ce zi vine.

Fișierele cu cifrele brute: data.json · data.csv. Arhiva brută nu se publică odată cu pagina (e mare și e a dexonline), dar oricine o descarcă și rulează scriptul obține aceleași numere, byte cu byte.

Baza de definiții dexonline e liberă sub licența publică generală GNU; cifrele de mai sus sunt fapte calculate din ea, publicate aici sub CC BY 4.0, cu mulțumiri voluntarilor care țin limba pe internet de două decenii.