EN
Diagnostic vizual · EMNLP 2026 Findings

Privește cu atenție: de ce eșuează modelele de inteligență artificială la teste vizuale simple

Un copil de șase ani poate urmări o bilă ascunsă sub un pahar care este mutat de trei ori pe o masă. Pentru cele mai avansate modele multimodale din lume, aceeași sarcină reprezintă un obstacol aproape de netrecut.

La 12 septembrie 2026, echipa condusă de Hohin Kwan a lansat public setul extins de antrenare pentru benchmarkul Video-MME-Logical (acceptat la Findings of EMNLP 2026). Rezultatele experimentale arată o diferență mare: oamenii rezolvă aceste teste cu o acuratețe medie de 95,9%, în timp ce GPT-5.4 atinge 22,7%, iar Gemini-3.1 Pro 28,6% pe întregul set de date.

Oameni
95,9%
Media generală
Gemini-3.1 Pro
28,6%
Cel mai performant model
GPT-5.4
22,7%
Evaluat pe întreg setul
Scorul tău
0/10
Progres în timp real
Testul 1 din 10 Urmărirea stării

Se încarcă întrebarea...

🎯

Ai finalizat testul de logică vizuală

Analiza performanței tale comparative.

0 / 10
Media umană
95,9%
Gemini-3.1 Pro
28,6%
GPT-5.4
22,7%
Qwen2.5-VL-72B
12,5%

De ce se prăbușesc modelele de inteligență artificială la raționamente vizuale elementare

Există un contrast izbitor între ceea ce cred utilizatorii despre modelele multimodale și capacitatea lor reală de a procesa secvențe temporale. Un model precum GPT-5.4 sau Gemini-3.1 Pro poate sintetiza un tratat de biochimie, poate genera cod în Rust și poate rezolva probleme de matematică de nivel universitar.

Arată-i o animație de cinci secunde în care un disc roșu acoperă câteva cruciulițe sau un pahar își schimbă locul cu altul, iar performanța scade până aproape de nivelul ghicirii la întâmplare. Pe întregul set de date Video-MME-Logical, GPT-5.4 a atins o acuratețe de 22,7%, iar Gemini-3.1 Pro 28,6%.

„Agregarea mai multor cadre video nu este echivalentă cu executarea unui raționament logic de-a lungul timpului. În timp ce un copil mic poate deduce fără efort poziția unei bile ascunse urmărind mișcarea prin ocluziune, modelele actuale se împiedică tocmai de această logică primară.”
— Kwan et al., Video-MME-Logical (EMNLP 2026)

Rezultatele oficiale ale benchmarkului Video-MME-Logical

Autorii au evaluat cele mai puternice modele proprietare și cu sursă deschisă pe 25 de categorii de sarcini vizuale generate algoritmic. Nivelurile de dificultate sunt controlate matematic prin durata orizontului temporal și numărul de stări intermediare.

Model / Evaluator General (%) Ușor (%) Mediu (%) Dificil (%)
Nivel uman (evaluatori independenți) 95,9 98,4 95,9 93,4
Gemini-3.1 Pro (Google DeepMind) 28,6 33,1 24,1 20,6
GPT-5.4 (OpenAI) 22,7 31,7 20,3 16,1
Qwen2.5-VL-72B-Instruct 12,5 15,2 13,1 9,1
InternVL3.5-8B-Instruct 12,1 13,8 13,5 8,9
Qwen3-VL-8B-Instruct 11,9 13,4 12,8 9,6
KimiVL-16B-A3B-Think 7,6 10,2 6,8 5,8
LLaVA-Video-72B-Qwen2 2,4 4,7 1,9 0,7

Cele cinci mecanisme de eșec ale vederii artificiale

De ce eșuează rețelele neuronale la sarcini atât de simple? Studiul identifică cinci cauze structurale fundamentale ale arhitecturilor actuale:

1. Decimarea cadrelor și eșantionarea temporală discontinuă

Modelele video nu vizionează secvențele așa cum o fac oamenii, la 30 sau 60 de cadre pe secundă. Pentru a reduce costul computațional, secvența este decupată în doar 8, 16 sau 32 de cadre statice izolate. Dacă o permutare sau o cotitură are loc între două cadre eșantionate, modelul pur și simplu nu are acces la dovadă.

2. Prăbușirea permanenței obiectului

În psihologia cognitivă, conceptul de permanență a obiectului (studiat clasic de Jean Piaget) descrie capacitatea de a înțelege că un lucru continuă să existe chiar dacă nu mai este direct vizibil. Rețelele vizuale actuale sunt predictori fără memorie spațială persistentă: odată ce un disc acoperă cruciulițele aurii, pentru model acele obiecte au încetat să existe.

3. Absența reprezentării spațiale 3D

Creierul uman construiește spontan un model tridimensional al obiectelor observate. La testul cuburilor în rotație, un om deduce imediat structura de 3 × 2 × 1 cuburi rotind mental forma în spațiu. În schimb, modelele lingvistice multimodale tratează rotația ca pe o serie de imagini plate bidimensionale, confundând fețele noi cu adăugiri fizice de material.

4. Orbirea la granițe implicite și deducție fizică

La testul recipientului invizibil, omul reface mental pereții recipientului urmărind punctele de impact și unghiurile de reflexie. Pentru AI, particulele par să se miște dezordonat, deoarece modelul nu calculează vectori de coliziune fără prezența unei linii fizice desenate pe ecran.

5. Atenția temporală difuză și amestecarea ordinii cronologice

Mecanismul de atenție din Transformer tratează de multe ori cadrele ca pe o colecție de jetoane concurente, fără o constrângere strictă de cauzalitate unidirecțională. La testul tastaturii virtuale, modelul detectează faptul că tastele M, I și W au fost aprinse, însă nu poate stabili cu certitudine care a precedat-o pe care.

Protocolul de testare umană

Pentru a stabili o linie de referință riguroasă, autorii au eșantionat 3.750 de exemple din setul Video-MME-Logical și le-au supus evaluării de către evaluatori umani independenți. Aceștia au primit exact aceleași videoclipuri și întrebări ca și modelele, fără acces la metadate sau răspunsuri prestabilite.

Rezultatul uman obținut a fost de 95,9% pe întregul benchmark (98,4% la nivelul ușor, 95,9% la mediu și 93,4% la dificil). Acest scor confirmă că sarcinile sunt perfect rezolvabile de către un observator uman atent și că eșecul modelelor reflectă o deficiență reală de raționament temporal.

Metodologie și citare

Setul de date Video-MME-Logical este disponibil public sub licență liberă (CC BY 4.0). Pentru detalii suplimentare despre metodologia de generare procedurală și evaluare automată, consultați lucrarea de cercetare:

Hohin Kwan, Hongyu Li, Ray Zhang, Manyuan Zhang, Xianghao Kong, Anyi Rao, Jiahao Xie, Si Liu. „Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning”, Findings of EMNLP 2026 / arXiv:2606.27828.