USENIX Security ’26 · Cercetare evaluată colegial

Tor ascunde destinația.
Ce mai poate trăda ritmul pachetelor?

Criptarea pe mai multe straturi protejează conținutul și maschează serverul final. Însă un observator pasiv aflat pe conexiunea locală poate înregistra lungimea exploziilor de date și pauzele dintre ele. Un nou cadru de analiză coboară drastic costul menținerii unei liste de ținte: adăugarea unui site nou cere doar 5 până la 20 de vizite înregistrate, chiar și când utilizatorul navighează cu cinci taburi deschise simultan.

5–20
mostre suficiente pentru un site nou adăugat pe listă
față de sute sau mii în abordările clasice
73,6%
precizie la 5 taburi simultane cu doar 5 mostre
în testul controlat pe site-uri nou introduse
47,0%
precizie după 2 luni de derivă a rețelei la 5 taburi
sub pragul unei aruncări de monedă

Ce vede și ce nu poate vedea atacatorul

Pentru a înțelege amprentarea traficului web, este esențială clarificarea poziției în rețea. În modelul de securitate al Tor, utilizatorul trimite pachete criptate printr-un lanț de trei noduri succesive. Atacatorul considerat în studiu este un observator pasiv: se află pe legătura locală, la nivelul routerului, al furnizorului de internet (ISP) sau în fața primului nod de intrare (guard relay).

Acest observator nu sparge cheile criptografice, nu modifică pachetele, nu injectează date și nu întârzie fluxul. Toate pachetele Tor au o dimensiune standardizată (celule fixe de 512 octeți). Cu toate acestea, când un browser încarcă o pagină, el cere fișiere HTML, imagini, fonturi și scripturi într-o ordine specifică, generând o secvență unică de rafale de descărcare și încărcare.

Conținutul paginii
Complet criptat pe mai multe straturi; indescifrabil pentru observator.
Adresa IP de destinație
Ascunsă de circuitele Tor; observatorul vede doar primul nod de intrare.
Identitatea utilizatorului
Nu este furnizată automat de trafic; cere corelare cu alte baze de date.
👁 VIZIBIL
Direcția fiecărui pachet
Trimitere (+1) sau primire (-1) de date la fiecare milisecundă.
👁 VIZIBIL
Mărimea exploziilor de celule
Câte celule de 512 octeți circulă compact înainte de următoarea pauză.
👁 VIZIBIL
Cadența temporală
Intervalele precise de milisecunde dintre cererile clientului și răspunsuri.

Problema menținerii listei de urmărire

Amprentarea clasică a traficului a rămas multă vreme o curiozitate de laborator dintr-un motiv practic: costul uriaș de întreținere. Site-urile web își actualizează frecvent layout-ul, reclamele și resursele externe, iar oamenii navighează rareori deschizând o singură pagină izolată. În lumea reală, utilizatorii au trei, patru sau cinci taburi deschise concomitent.

Sistemele anterioare încercau să clasifice un amestec de trafic ca pe o combinație uriașă. Dacă un serviciu de monitorizare dorea să adauge o nouă publicație de investigație sau un portal pentru avertizori de integritate, trebuia să adune sute sau mii de înregistrări proaspete și să reantreneze rețeaua neuronală de la zero.

Modelul MMF schimbă fundamental logica: în loc să ghicească întreaga combinație, analizează fluxul amestecat și caută independent dacă semnalul specific al unei ținte este prezent. Prin învățare metrică din puține exemple, sistemul poate adăuga o țintă nouă pe lista de urmărire din numai 5 până la 20 de mostre recente.

CLASIC

Abordarea clasică combinatorică

  • Presupune că 1 flux = 1 singur site sau o combinație rigidă.
  • Cere sute sau mii de vizite înregistrate pentru fiecare site nou.
  • Necesită reantrenarea completă a modelului la fiecare actualizare a listei.
  • Devine inutilizabilă când numărul de taburi deschise este necunoscut.
NOUL MMF

Modelul MMF (USENIX Security ’26)

  • Tratează traficul cu mai multe taburi ca pe un amestec compozit de semnale.
  • Integrează o țintă nouă din doar 5 până la 20 de exemple recente.
  • Nu necesită reantrenare greoaie: compară reprezentările vectoriale.
  • Funcționează chiar și când numărul de taburi deschise se schimbă în timp real.

Osciloscopul de pachete: simulează amestecul și detecția

Experimentează direct modul în care navigarea cu mai multe taburi interclasează pachetele criptate și cum numărul de mostre (shots) influențează capacitatea modelului de a detecta o țintă supravegheată.

● OSCILOSCOP DE IMPULSURI ACTIV TOR CELL STREAM · 512B CELLS
Pachete provenite de la site-ul țintă
Pachete de la alte taburi deschise (zgomot)
Pachet trimis (încărcare)
Pachet primit (descărcare)
Scor de încredere pentru prezența țintei: 62.4%
Pachete totale analizate în fereastra de timp: --
Verdictul clasificatorului:
● Țintă detectată

Performanța comparată pe scenarii reale

Cercetătorii au evaluat modelul atât în condiții controlate, cât și într-un scenariu de tip „lume deschisă” (open-world), unde traficul de fond conține mii de site-uri neînregistrate pe lista de urmărire.

Precizia la primii k (P@k) într-un amestec de 4 taburi cu zgomot de fond

MMF (Noul model) 62,36%
De 3,51× mai precis decât cel mai apropiat competitor
BAPM (Baseline 2024) 17,75%
Scade masiv în prezența mai multor taburi
TMWF (Baseline) 15,20%
Sensibil la suprapunerea pachetelor
ARES (Baseline) 13,43%
Dificultăți majore la clasificarea compozită
FMWF (Baseline) 6,20%
Aproape complet degradat în regim deschis

De ce 47% împiedică mitul unei arme absolute

Cea mai utilă parte a studiului nu este precizia din laborator, ci măsurarea degradării în timp. Pentru a simula condițiile operaționale, autorii au colectat trafic eșalonat pe o durată de aproximativ două luni, lăsând paginile web, condițiile de rutare și latențele de rețea să evolueze natural.

Chiar și cu 20 de mostre recente furnizate pentru fiecare site nou, precizia MMF pe datele cu derivă reală scade la 59,1% pentru 3 taburi, 54,5% pentru 4 taburi și 47,0% pentru 5 taburi. Când utilizatorul are 5 taburi deschise, probabilitatea ca observatorul pasiv să detecteze corect site-ul monitorizat coboară sub nivelul unei aruncări de monedă.

Acest rezultat arată clar limitele tehnologiei: atacul nu oferă o certitudine absolută și necesită reîmprospătarea continuă a mostrelor. Ceea ce s-a schimbat este doar economia procesului: costul de a ține sistemul la zi a scăzut de la mii de înregistrări la câteva zeci.

3 taburi paralele
59,15%
Precizie moderată; zgomotul de interclasare este parțial gestionabil.
4 taburi paralele
54,50%
Eroziune semnificativă; aproape jumătate dintre inferențe devin incerte.
5 taburi paralele
47,02%
Sub 50%; amestecul haotic de celule maschează eficient semnătura țintei.

Instituții, atribuire și semnal de capabilitate

Lucrarea este semnată de cercetători de la Universitatea Națională de Tehnologie a Apărării din China (NUDT) și Universitatea Tsinghua. NUDT este o instituție militară aflată în subordinea directă a Comisiei Militare Centrale a Chinei.

Această afiliere reprezintă un semnal important de direcție a cercetării și de capabilitate tehnică în sfera analizei avansate de trafic (SIGINT). Totuși, ea nu constituie o dovadă că tehnica este utilizată operațional de forțele armate chineze sau de vreun serviciu de informații.

Autorii au publicat codul și seturile de date în regim deschis pe Zenodo încă din mai 2026, iar lucrarea se prezintă explicit ca o cercetare de apărare a confidențialității, discutând deschis riscurile de abuz în supravegherea cetățenilor și avertizorilor.

🛡 Distincția crucială: Detecție vs Identificare

Sistemul descris nu asociază direct un nume cu o sesiune de navigare. El indică doar că un flux criptat observat pe o anumită conexiune conține tipare statistice compatibile cu un site din lista de urmărire. Pentru a ajunge la identitatea reală a unei persoane, atacatorul trebuie să coroboreze această constatare cu alte surse de informații: contracte de internet, adrese IP locale, identificatori de dispozitiv sau supraveghere fizică.