# 哪种语言离罗马尼亚语最近？三种量法，三个答案

罗马尼亚语属于罗曼语族，通行于罗马尼亚和摩尔多瓦。本页用公开数据，从三个方面把它和世界各种语言逐一比较。三个答案并不一致；任何一种语言，包括汉语，都可以放到罗马尼亚语旁边一项一项地比。

Marius Comper · 2026年10月4日 · 数据：ASJP、WALS、Grambank、PHOIBLE

## 三张地图：谁近谁远

地图上一个点代表一种语言，画在它通行的地方。点越大、颜色越深，说明这种语言在该项指标上离罗马尼亚语越近。空心圆圈是罗马尼亚语。语音有两张地图，分别对应罗马尼亚语的两种描写。

### 词汇

1. 梅格莱诺-罗马尼亚语：0.44
2. 意大利语：0.60
3. 撒丁语（洛古多罗方言）：0.61
4. 阿罗马尼亚语：0.61
5. 那不勒斯语及意大利南部方言：0.62
6. 艾米利亚语：0.66
7. 撒丁语（坎皮达诺方言）：0.66
8. 加泰罗尼亚语：0.67
9. 皮埃蒙特语：0.67
10. 弗留利语：0.67

### 语法

1. 意大利语：51项中的41项
2. 阿尔巴尼亚语：56项中的45项
3. 葡萄牙语：50项中的40项
4. 希腊语：65项中的48项
5. 西班牙语：64项中的47项
6. 乌克兰语：40项中的29项
7. 保加利亚语：57项中的41项
8. 俄语：65项中的46项
9. 海湾阿拉伯语：47项中的33项
10. 加泰罗尼亚语：40项中的28项

### 语音：按7个元音、20个辅音算

1. 达马纳语（Damana）：1–11
2. Bangolan：1–22
3. 努佩语：3–11
4. 卡里普纳法语克里奥尔语：2–17
5. 马赞德兰语：1–56
6. 萨尤拉波波卢卡语（Sayula Popoluca）：8–32
7. Ndamba：4–37
8. 尼日利亚皮钦语：3–54
9. 伊什卡希姆语（Ishkashimi）：8–46
10. 基隆迪语：8–52

### 语音：把 lupi、pomi 词尾的腭化辅音单独算

1. 俄语：1–5
2. 上索布语：3–7
3. 维普斯语：1–7
4. 斯科尔特萨米语：1–10
5. 立陶宛语：1–12
6. 沃特语：6–10
7. 埃尔齐亚语：4–11
8. 下索布语：6–9
9. 保加利亚语：1–62
10. 特尔萨米语：10–21

三个公开数据库从三个角度描写世界上的语言：基本词汇、语法和语音。本页对三者的用法相同：把罗马尼亚语和库里的每一种语言逐一比较。

亲属、邻居和碰巧有同样语音的语言，是三回事。基本词汇从祖语继承下来，变得很慢。语法也是继承的，但几百年相邻而居，会向邻居靠拢。一种语言的音很少，只有几十个，两种从未接触过的语言也可能得到几乎相同的一套。

## 把一种语言放到罗马尼亚语旁边

输入一种语言的名称。四把尺子都从左端的罗马尼亚语量起：标记越靠左，这种语言在该项指标上越近。尺子下面是证据：并排列出的40个词，两种语言取值相同和不同的语法特征，共有的音，以及只在其中一种语言里出现的音。

每个名次都附有一个范围。计算可以有几种同样站得住的做法（用罗马尼亚语的哪一份词表、哪一种语音描写、要求多少项共同特征）；范围给出的是这种语言在所有做法中的最好和最差名次。语音还给出中位名次，即把各种算法的名次排好后居中的那个。总共有5,734种语言，但三项指标都列入排名的只有201种。

## 词汇：排在前面的是亲属

ASJP项目（Automated Similarity Judgment Program，自动相似度判断项目）收集了世界各地的11,540份词表，每份都围绕同样的40个词义，它们是一份经典的100词表（斯瓦迪士词表）里最稳定的：我、你、我们、一、二、水、火、太阳、名字。每个词用一小套音标符号转写。两种语言的距离逐词计算：从一个词形变成另一个，要替换、增加或删去几个音，再除以词长；得到的结果再除以这两份词表里意义不同的词之间的平均距离。0表示每个可比词义对应的词形都完全相同；接近1（得分可以略高于1），表示同义的词并不比随便配对的词更像。

最近的是梅格莱诺-罗马尼亚语的词表（0.44），在全部72种算法下都是如此。其次是意大利语（0.60）、撒丁语洛古多罗方言（0.61）、阿罗马尼亚语（0.61，但40个词里只有32个词可比）和那不勒斯语（0.62）。在基准算法下，前17名都是罗曼语族的语言（其中最后一名是印度的一种葡萄牙语克里奥尔语）。西班牙语排第29（0.73），法语排第33（0.78）。

梅格莱诺-罗马尼亚语通行于希腊和北马其顿，阿罗马尼亚语通行于这两国、阿尔巴尼亚及其邻国。罗马尼亚语言学传统上把它们同罗马尼亚本土的罗马尼亚语以及克罗地亚的伊斯特拉-罗马尼亚语一起，看作罗马尼亚语的历史方言；国际目录Glottolog和ISO 639-3则把它们列为独立的语言。不论怎么称呼，它们都是罗马尼亚语最近的亲属，这一组之外的第一种语言是意大利语。ASJP没有单独的伊斯特拉-罗马尼亚语词表，也没有摩尔多瓦共和国境内语言的单独词表，Glottolog把后者列为罗马尼亚语的方言。

在基准算法下，拉丁语只排在第18（0.69）；换一种算法，它在第10到第25之间，但始终排在意大利语和撒丁语洛古多罗方言之后。这项指标逐音比较今天的词形，并不说明谁是谁的后代。罗马尼亚语的 foc 和意大利语的 fuoco（火）都来自拉丁语 focus，本义是炉灶；表示“火”，ASJP的拉丁语词表记的是 ignis。

出了罗曼语族，得分很快逼近1。保加利亚语排第53（0.87），阿尔巴尼亚语第245（0.93），汉语官话第2,843（0.99），匈牙利语第3,846（1.00）。5,457种语言里有一半以上高于0.99，低于0.90的只有127种。在这里，几乎所有语言都挤在1附近，名次说明不了什么。这个排名也不衡量借词：罗马尼亚语从保加利亚语和匈牙利语借过许多词，但这里只比40个稳定的词义，而且不计标为借词的词。

ASJP还收有人造语言的词表，这里没有列入排名。因特语（Interlingua）取材于欧洲主要语言的共同词汇，其中大部分来自罗曼语，若列入排名，它会排在第二（0.59）；世界语会排在第29（0.72）。

## 语法：一个亲属和一个邻居得分相同

WALS（《世界语言结构地图集》）用一项项特征来描写每种语言的语法，每项特征有几个可能的取值：定冠词放在哪里，名词有几个格，主语、动词和宾语按什么顺序排列。罗马尼亚语有82项特征得到描写，其中65项属于语法，其余属于语音和词汇。这里用的指标很简单：两种语言都有描写的特征里，有多少项取值相同。

意大利语与罗马尼亚语取值相同的有51项特征中的41项，阿尔巴尼亚语56项中的45项，葡萄牙语50项中的40项：三者都是五分之四。随后是希腊语（65项中的48项）、西班牙语（64项中的47项）、乌克兰语（40项中的29项）和保加利亚语（57项中的41项）。法语虽然是罗曼语，只有64项中的38项，还不如俄语（65项中的46项）和英语（65项中的45项）。另一头是土耳其语：58项中的21项。

只有五六十项特征，细小的差别不足以区分语言：前十种语言的误差范围互相重叠。在9种算法下都成立的是：阿尔巴尼亚语在每一种算法下都在前3名；意大利语在其中8种算法下都在前5名（第九种算法下它的共同特征不够，没有列入排名）；法语从未进入前13名。

让每种语言都比同样的特征，比较会更干净。下表的八种语言全都有描写的特征共36项。在这些特征上，阿尔巴尼亚语与罗马尼亚语相同的有32项，意大利语30项，葡萄牙语29项，西班牙语28项，保加利亚语24项，希腊语23项，法语21项。

在罗马尼亚语与意大利语分道扬镳的地方，阿尔巴尼亚语站在罗马尼亚语一边。罗马尼亚语和意大利语取值不同、阿尔巴尼亚语又有描写的特征有8项；其中5项阿尔巴尼亚语与罗马尼亚语相同，1项与意大利语相同。这5项是：定冠词附在词尾（罗马尼亚语 lupul，阿尔巴尼亚语 ujku，意思都是“那只狼”），用词尾标记格，序数词除“第一”外都由基数词构成，命令和劝勉的构成方式，以及主语在动词之前的语序。保加利亚语和希腊语看不到同样的情形：同样的比较中，保加利亚语3次与罗马尼亚语相同、6次与意大利语相同，希腊语分别是4次和5次。保加利亚语的这6次里就有定冠词本身：WALS把保加利亚语的定冠词算作独立的词，尽管它同样放在名词后面（вълкът，“那只狼”）。

这个结果并不是对“巴尔干语言联盟”的检验。语言学家用这个名称指罗马尼亚语、阿尔巴尼亚语、保加利亚语、马其顿语和希腊语在语法上的相似。它的几项经典特征里，WALS有“冠词放在名词之后”这一项；用虚拟式从句代替不定式（如罗马尼亚语 vreau să plec，字面是“我想我走”）、用“想要”构成将来时、用代词复指宾语，则没有专门的条目。冠词、不定式和将来时这三项，在介绍巴尔干语言联盟的页面（英文）上有例句说明。意大利语离阿尔巴尼亚语也不远：两者都有描写的58项特征中的42项取值相同。

### 没有罗马尼亚语的Grambank怎么说

Grambank（2,467种语言和方言，195项特征）据其作者称是现有最大的比较语法数据库，它在1.0.3版里没有罗马尼亚语的条目，也没有保加利亚语和西班牙语的条目。它有阿罗马尼亚语，填了165项，所以可以用罗马尼亚语最近的、有数据的亲属把这个比较重做一遍。

按Grambank的编码，阿罗马尼亚语与意大利语、葡萄牙语相同的最多（各为164项特征中的151项），其次是奥克语、加利西亚语、伦巴第语和科西嘉语。阿尔巴尼亚语托斯克方言是标准阿尔巴尼亚语的基础，它紧随其后（160项中的142项），排在撒丁语、加泰罗尼亚语（164项中的142项）和法语（165项中的136项）之前。

这里也一样：在阿罗马尼亚语与意大利语不同的地方，阿尔巴尼亚语站在阿罗马尼亚语一边，9次对4次。马其顿语是9对3，希腊语是7对6。这些特征包括：冠词放在名词之后，格，以及用不变化的小品词标记语气和时态。其中两项编码在审核时受到质疑：Grambank记意大利语没有表示时态的助动词，可是 ho visto（“我看见了”）里就有一个；另一项涉及阿罗马尼亚语中附在动词后面的代词。去掉这两项，阿尔巴尼亚语是7对4，马其顿语是7对3，希腊语是5对6。

## 语音：罗马尼亚语的两种描写，两份名单

PHOIBLE收集的是音位清单。一份清单就是语言学家为一种语言列出的、能够区别词义的音（音位，有时也包括它们的变体）。共有2,186种语言的3,020份音位清单。这里量的是两份清单共有多少个音，占两者合起来的多少；其中一种算法量的则是一份清单里的音与另一份里的音有多接近。它不衡量每个音在说话时出现得多频繁，不衡量语调，也不衡量不懂这种语言的人听起来觉得像什么。

PHOIBLE里罗马尼亚语有三份清单，彼此并不一致。两份沿用通行的描写：7个元音、20个辅音，加上 iarnă（冬天）、ziuă（白天）、seară（傍晚）、soare（太阳）里的半元音。第三份依据约阿娜·基托兰（Ioana Chitoran）2002年论罗马尼亚语音系的专著，把 lupi（狼，复数）、pomi（树，复数）、rupi（你折断）这类词词尾的腭化辅音（俗称“软辅音”）单独计数，词尾的 -i 不单独发成元音，只使前面的辅音腭化：lupi 里的 p 和 lup（狼，单数）里的 p 被记成两个不同的音。这样清单就有51个音位，另两份是31个和32个。

按通行的描写，清单最接近的是一些相距遥远的语言：哥伦比亚的达马纳语、喀麦隆的 Bangolan 语、尼日利亚的努佩语、巴西的一种法语克里奥尔语（卡里普纳语）和伊朗的马赞德兰语。前三种与罗马尼亚语毫无关系；马赞德兰语属于伊朗语支，算是很远的亲属。它们和罗马尼亚语一样，清单大小中等，用的多是全世界常见的音。罗马尼亚语三种描写共有的29个音（7个元音、20个辅音，加上 iarnă 和 ziuă 里的半元音），Bangolan 语全都有。

把腭化辅音单独计数之后，名单移到了欧洲北部和东部：俄语、索布语、维普斯语、斯科尔特萨米语、立陶宛语、埃尔齐亚语、保加利亚语。它们都有成套的腭化辅音，如俄语 брать（拿）与 брат（兄弟）的区别。

在全部72种算法下，意大利语最好也只排到第19名；在2,085种语言中，汉语普通话最好也只排到第986名。罗马尼亚语各种描写共有的29个音，阿尔巴尼亚语有28个，意大利语25个（缺 ă、î、h 和 joc 里的 j），保加利亚语24个，普通话17个。

这29个音里，在PHOIBLE的清单中最少见的是 joc 里的 j（ʒ，近似英语 measure 中的 s，不是拼音的 j；15.9%的清单里有）、î（ɨ，16.5%）和 ă（ə，22.4%）。其次是 ț（ts，26.8%）和 v（27.0%）。罗马尼亚语三种描写都没有的音里，最常见的是 ŋ（汉语拼音的 ng，62.8%的清单里有）。排在后面的还有西班牙语的 ñ（ɲ，42.7%）和喉塞音（ʔ，37.5%）。

罗马尼亚语在外人耳朵里听起来像什么，是另一个问题。有一个网络游戏让人听20秒录音猜是哪种语言；Hedvig Skirgård、Seán Roberts 和 Lars Yencken 在2017年分析了其中1500万次作答，在玩家的混淆关系图上，罗马尼亚语紧挨着希腊语、阿尔巴尼亚语和斯拉夫语言。

## 三个答案为什么对不上

三项指标追踪的东西不同。40词的词表由最稳定的词义组成，在基准算法下，前17名全是罗曼语族的语言，也就是罗马尼亚语的亲属。

语法是继承的，但也会向周围的语言靠拢。罗马尼亚语通行的地方远离其他罗曼语：它和意大利语之间隔着斯拉夫语言和匈牙利语，而保加利亚语、阿尔巴尼亚语和希腊语在地图上离它更近。图上罗曼语在两项指标上都近；阿尔巴尼亚语、希腊语和保加利亚语语法近、词汇远。

音的数目很少。一种语言只有几十个音位，其中最常见的（p、t、k、m、n、a、i、u）几乎到处都有。两份中等大小的清单可以有四分之三以上相同，而两种语言毫无关系，罗马尼亚语和达马纳语就是这样。

所以标题里的问题没有唯一的答案。“最近”只有和量法连在一起才有意义：按词汇，按语法，还是按语音。

## 怎样量的，做了哪些取舍

### 语言的认定

这里的一种语言，指Glottolog 5.3目录中“语言”一级的一个条目。为方言收集的词表和清单归入所属的语言。标准阿尔巴尼亚语以托斯克方言为基础。ASJP的标准阿尔巴尼亚语词表挂在“Albanian”这个语组下，WALS的“Albanian”条目有ISO代码sqi，没有Glottolog代码，并且同时提到盖格和托斯克两种方言；这里把两者都归入托斯克方言，因为PHOIBLE和Grambank的阿尔巴尼亚语数据也在这个代码下。

### 词汇

ASJP第21版：11,540份词表。基准算法遵循该项目的规则：40词词表，一个词义最多取两个同义词，标为借词的词不计，归一化莱文斯坦距离，再除以两份词表中不同义词对的平均距离（LDND）。罗马尼亚语有三份词表，彼此相差0.12到0.22；基准用的是ROMANIAN_3。一种语言至少要有28个词与罗马尼亚语词表可比才列入排名：共5,457种语言。未列入的有：405份词表没有Glottolog代码，22份属于人造语言，4份词表挂在语组而不是具体语言下，620种语言可比的词太少。

各种算法：罗马尼亚语的词表（3种），复合符号算一个单位还是拆开（2种），去掉还是保留借词（2种），同义词（取前两个、取全部、取最近的一对：3种），一种语言有多份词表时取中位的还是最近的（2种）。共72种。对照表显示的是中位的那份词表；如果它属于某个地方方言，而ASJP另有一份直接以该语言命名的词表，就显示后者及其距离。汉语官话有184份词表，对照表里显示的是北京话的那一份。

### 语法

WALS 2020.4版：罗马尼亚语的65项特征，已去掉15项音系特征和2项词汇特征；其中28项描写语序。基准排名要求至少40项共同特征：共243种语言，而至少有一项可比的有1,900种。各种算法：全部特征，去掉语序特征（剩37项），或者分组计算，让可以互相推出的特征只算一次（51组）；门槛分别设为30、40或50项共同特征。

在Grambank 1.0.3中按罗马尼亚语的Glottolog代码和整个东罗曼语支检索：唯一的条目是阿罗马尼亚语。与阿罗马尼亚语比较的是同它至少有120项共同特征的语言。

### 语音

PHOIBLE 2.0.1。比较之前先把记法统一：去掉表示齿音、舌尖、舌叶、偏低、偏高、央化、偏前、偏后的附加符号；闪音r和颤音r算作同一个r；记作 i̯ 和 u̯ 的半元音读作 j 和 w。声调、双元音以及 seară、soare 中的半元音不参与计算。长短、鼻化、腭化、送气和清浊仍算作区别。这是有意做的简化：不这样做，同一个罗马尼亚语的t在三种描写里会成为三个不同的音。

各种算法：指标（简化记法上的重合度、PHOIBLE原记法上的重合度，或按PHOIBLE的37项语音特征计算的距离：3种），去掉还是保留双元音（2种），保留还是去掉边缘音位（2种），罗马尼亚语的描写（3种），一种语言有多份清单时取中位的还是最近的（2种）。共72种。逐音比较时，只要所选语言有一份清单把某个罗马尼亚语的音列为普通音位，就算共有。

### 没有量的东西

这里没有哪项指标能说明两种语言的人互相听懂有多容易，也没有哪项顾及全部词汇、文字或实际发音。几个数据库并不均衡：WALS对许多语言只有很少的特征，PHOIBLE把按不同惯例做的描写放在一起。所以每个结果都注明了它所依据的词数或特征数。

## 资料来源

- [Wichmann, Holman, Brown, Dryer & Ran (eds.), The ASJP Database, version 21 (2025)](https://doi.org/10.5281/zenodo.16736409) 词表；CLDF 21.1版，CC BY 4.0许可。
- [Dryer & Haspelmath (eds.), The World Atlas of Language Structures Online (2013), v2020.4](https://doi.org/10.5281/zenodo.13950591) 语法特征；CC BY 4.0。罗马尼亚语条目：wals.info/languoid/lect/wals_code_rom。
- [Grambank v1.0.3 (2023)](https://doi.org/10.5281/zenodo.7844558) 阿罗马尼亚语及对比语言的语法特征；CC BY 4.0。
- [Skirgård, Haynie, Blasi, Hammarström, Collins et al., “Grambank reveals the importance of genealogical constraints on linguistic diversity…”, Science Advances 9(16), 2023](https://doi.org/10.1126/sciadv.adg6175) 介绍Grambank的论文。
- [Moran & McCloy (eds.), PHOIBLE 2.0 (2019), Max Planck Institute for the Science of Human History](https://phoible.org/) 音位清单；CLDF 2.0.1版，CC BY-SA 3.0许可。罗马尼亚语的清单：phoible.org/languages/roma1327。
- [Hammarström, Forkel, Haspelmath & Bank, Glottolog 5.3 (2026)](https://doi.org/10.5281/zenodo.18840935) 语言的身份、分类和坐标；CC BY 4.0。
- [Natural Earth, 1:110m land](https://www.naturalearthdata.com/) 地图上的陆地轮廓；公有领域。
- [Wichmann, Holman, Bakker & Brown, “Evaluating linguistic distance measures”, Physica A 389(17), 2010, 3632–3639](https://doi.org/10.1016/j.physa.2010.05.011) 词汇部分使用的LDND距离。
- [ASJP, software and instructions](https://asjp.clld.org/help) 本页遵循的计算规则：至多两个同义词，排除借词。
- [Chitoran, The Phonology of Romanian: A Constraint-Based Approach, Mouton de Gruyter, 2002](https://doi.org/10.1515/9783110889185) 含腭化辅音的那份清单（PHOIBLE中的EA 2443）的来源。
- [Agard, “Structural Sketch of Rumanian”, Language 34(3, part 2), 1958, 7–127](https://doi.org/10.2307/522282) 罗马尼亚语另外两份清单（SPA 165、UPSID 527）的来源之一。
- [Lee & Zee, “Standard Chinese (Beijing)”, Journal of the International Phonetic Association 33(1), 2003, 109–112](https://doi.org/10.1017/S0025100303001208) PHOIBLE四份普通话音位清单中两份的来源。
- [Skirgård, Roberts & Yencken, “Why are some languages confused for others? Investigating data from the Great Language Game”, PLOS ONE 12(4), 2017](https://doi.org/10.1371/journal.pone.0165934) 听辨时罗马尼亚语与哪些语言相混。
- [Anderson, Tresoldi, Greenhill, Forkel, Gray & List, “Variation in phoneme inventories: quantifying the problem and improving comparability”, Journal of Language Evolution 8(2), 2023, 149–168](https://doi.org/10.1093/jole/lzad011) 同一种语言的音位清单为何因数据库而异。
- [Littell, Mortensen, Lin, Kairis, Turner & Levin, “URIEL and lang2vec”, EACL 2017](https://doi.org/10.18653/v1/E17-2002) 利用同类数据构建的语言间距离库。
