# Privește cu atenție: de ce eșuează modelele de inteligență artificială la teste vizuale simple

*Marius Comper · 14 septembrie 2026*
*Sursă: Video-MME-Logical (EMNLP 2026 Findings, Hohin Kwan et al.)*
*Versiune interactivă completă cu cele 10 secvențe video: https://mariuscomper.uk/watch-carefully/*

Un copil de șase ani poate urmări o bilă ascunsă sub un pahar care este mutat de trei ori pe o masă. Pentru cele mai avansate modele multimodale din lume, aceeași sarcină reprezintă un obstacol aproape de netrecut.

La 12 septembrie 2026, echipa condusă de Hohin Kwan a lansat public setul extins de antrenare pentru benchmarkul Video-MME-Logical (acceptat la Findings of EMNLP 2026). Rezultatele experimentale arată o diferență mare: oamenii rezolvă aceste teste cu o acuratețe medie de 95,9%, în timp ce GPT-5.4 atinge 22,7%, iar Gemini-3.1 Pro 28,6% pe întregul set de date.

## Rezultatele oficiale ale benchmarkului Video-MME-Logical

Autorii au evaluat cele mai puternice modele proprietare și cu sursă deschisă pe 25 de categorii de sarcini vizuale generate algoritmic. Nivelurile de dificultate sunt controlate matematic prin durata orizontului temporal și numărul de stări intermediare:

| Model / Evaluator | General (%) | Ușor (%) | Mediu (%) | Dificil (%) |
|---|---:|---:|---:|---:|
| **Nivel uman (evaluatori independenți)** | **95,9** | **98,4** | **95,9** | **93,4** |
| Gemini-3.1 Pro (Google DeepMind) | 28,6 | 33,1 | 24,1 | 20,6 |
| GPT-5.4 (OpenAI) | 22,7 | 31,7 | 20,3 | 16,1 |
| Qwen2.5-VL-72B-Instruct | 12,5 | 15,2 | 13,1 | 9,1 |
| InternVL3.5-8B-Instruct | 12,1 | 13,8 | 13,5 | 8,9 |
| Qwen3-VL-8B-Instruct | 11,9 | 13,4 | 12,8 | 9,6 |
| KimiVL-16B-A3B-Think | 7,6 | 10,2 | 6,8 | 5,8 |
| LLaVA-Video-72B-Qwen2 | 2,4 | 4,7 | 1,9 | 0,7 |

## Cele zece teste din experimentul interactiv

1. **Paharul buclucaș (Urmărirea stării)**: Urmărirea unei bile albastre ascunse sub 4 pahare permutate succesiv. Bila începe la Paharul 1 și ajunge la Paharul 2. Oamenii obțin 96%, în timp ce GPT-5.4 pierde identitatea paharelor la trecerile încrucișate.
2. **Cuburile 3D în rotație (Compoziție structurală)**: Numărarea cuburilor unitate dintr-un bloc 3D solid în rotație. Blocul conține 3 × 2 × 1 = 6 cuburi. AI-ul halucinează cuburi noi sau cavități la schimbarea unghiului de perspectivă.
3. **Recipientul invizibil (Spațialitate dinamică)**: Deducerea formei unei incinte transparente din ricoșeul particulelor. Forma reală este o capsulă alungită (stadium). Modelele vizuale nu pot calcula ecuațiile de coliziune fără contururi desenate explicit.
4. **Labirintul 2D (Spațialitate dinamică)**: Urmărirea unui punct mobil portocaliu către ieșirea albastră. Punctul parcurge toate cele 8 cotituri fără să se blocheze. Modelele AI pierd urmărirea din cauza eșantionării cadrelor la intervale mari.
5. **Discul mobil și semnele ascunse (Compoziție structurală)**: Numărarea cruciulițelor aurii acoperite parțial de un disc roșu mobil. În total sunt 9 cruciulițe fixe. Modelele suferă de pierderea permanenței obiectului și numără doar ce este vizibil simultan.
6. **Puncte pe traiectorie (Spațialitate dinamică)**: Verificarea numărului de intersecții dintre un punct albastru și unul verde. Deși se mișcă simultan, punctele rămân în benzi orizontale paralele, iar traiectoriile lor nu se intersectează niciodată (0 ori).
7. **Tastatura secvențială (Ordonare temporală)**: Identificarea primei taste aprinse pe o tastatură virtuală (tasta M, urmată de I, W, R). Modelele procesează adesea cadrele video fără păstrarea ordinii temporale și pierd cronologia evenimentelor.
8. **Ploaia de forme (Compoziție structurală)**: Identificarea formei absente dintr-o cădere de figuri geometrice. Scena conține triunghiuri, pătrate, dreptunghiuri și romburi, dar niciun cerc. Modelele răspund pe baza stereotipurilor lingvistice fără să verifice imaginea.
9. **Centrul de rotație (Spațialitate dinamică)**: Identificarea pivotului unei piese de mobilier care orbitează în jurul centrului ecranului. Modelele confundă rotația proprie cu orbita în jurul unui punct extern.
10. **Tunelul 3D (Spațialitate dinamică)**: Identificarea culorii camerei finale dintr-un zbor prin coridoare geometrice (albastru deschis). Oamenii o disting imediat, dar AI-ul o ratează dacă starea finală ocupă doar câteva cadre.

## De ce eșuează vederea artificială

1. **Decimarea cadrelor**: Modelele nu analizează 30 sau 60 de cadre pe secundă, ci eșantionează doar 8-32 de cadre statice pe videoclip. Orice acțiune intermediară este complet pierdută.
2. **Prăbușirea permanenței obiectului**: Rețelele vizuale sunt lipsite de memorie spațială persistentă; când un obiect iese din raza vizuală, acesta încetează să mai existe pentru model.
3. **Absența reprezentării 3D**: Modelele tratează spațiul ca pe o matrice plată 2D și nu mențin o reprezentare volumetrică mentală a corpurilor solide.
4. **Orbirea la deducție fizică**: Modelele detectează texturi și contururi desenate, dar nu pot deduce granițe invizibile din legi de reflexie fizică.
5. **Amestecarea ordinii temporale**: Atenția din Transformer tratează cadrele ca pe o colecție concurentă, pierzând relațiile stricte de precedență cauzală.

## Protocolul de testare umană

Cercetătorii au eșantionat 3.750 de exemple din setul Video-MME-Logical și le-au evaluat cu trei evaluatori umani independenți remunerați cu 50 USD pe oră, în exact aceleași condiții vizuale ca și modelele. Acuratețea umană a fost de 95,9% pe întreg setul (98,4% la nivelul ușor, 95,9% la mediu și 93,4% la dificil).

## Citare

Hohin Kwan, Hongyu Li, Ray Zhang, Manyuan Zhang, Xianghao Kong, Anyi Rao, Jiahao Xie, Si Liu. „Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning”, Findings of EMNLP 2026 / arXiv:2606.27828.
