# Forma traficului. Ce dezvăluie pachetele criptate când destinația este ascunsă

*Rețeaua Tor ascunde destinația și conținutul paginilor, dar pachetele criptate păstrează un profil temporal. Un studiu prezentat la USENIX Security ’26 arată cum menținerea unei liste de supraveghere devine mult mai ieftină prin învățare din câteva mostre.*

**Data**: 20 august 2026 | **Referință**: USENIX Security ’26 proceedings, 12–14 August 2026. Liu, Lin et al. (NUDT & Tsinghua University).

---

## Tor ascunde destinația. Ce mai poate trăda ritmul pachetelor?

Criptarea pe mai multe straturi protejează conținutul și maschează serverul final. Însă un observator pasiv aflat pe conexiunea locală poate înregistra lungimea exploziilor de date și pauzele dintre ele. Un nou cadru de analiză coboară drastic costul menținerii unei liste de ținte: adăugarea unui site nou cere doar 5 până la 20 de vizite înregistrate, chiar și când utilizatorul navighează cu cinci taburi deschise simultan.

### Cifre cheie
- **5–20**: mostre suficiente pentru un site nou adăugat pe listă (față de sute sau mii în abordările clasice)
- **73,6%**: precizie la 5 taburi simultane cu doar 5 mostre (în testul controlat pe site-uri nou introduse)
- **47,0%**: precizie după 2 luni de derivă a rețelei la 5 taburi (sub pragul unei aruncări de monedă)

---

## 1. Ce vede și ce nu poate vedea atacatorul

Pentru a înțelege amprentarea traficului web, este esențială clarificarea poziției în rețea. În modelul de securitate al Tor, utilizatorul trimite pachete criptate printr-un lanț de trei noduri succesive. Atacatorul considerat în studiu este un observator pasiv: se află pe legătura locală, la nivelul routerului, al furnizorului de internet (ISP) sau în fața primului nod de intrare (guard relay).

Acest observator nu sparge cheile criptografice, nu modifică pachetele, nu injectează date și nu întârzie fluxul. Toate pachetele Tor au o dimensiune standardizată (celule fixe de 512 octeți). Cu toate acestea, când un browser încarcă o pagină, el cere fișiere HTML, imagini, fonturi și scripturi într-o ordine specifică, generând o secvență unică de rafale de descărcare și încărcare.

### Bilanțul vizibilității în tranzit
- **Conținutul paginii** (HIDDEN): Complet criptat pe mai multe straturi; indescifrabil pentru observator.
- **Adresa IP de destinație** (HIDDEN): Ascunsă de circuitele Tor; observatorul vede doar primul nod de intrare.
- **Identitatea utilizatorului** (HIDDEN): Nu este furnizată automat de trafic; cere corelare cu alte baze de date.
- **Direcția fiecărui pachet** (VISIBLE): Trimitere (+1) sau primire (-1) de date la fiecare milisecundă.
- **Mărimea exploziilor de celule** (VISIBLE): Câte celule de 512 octeți circulă compact înainte de următoarea pauză.
- **Cadența temporală** (VISIBLE): Intervalele precise de milisecunde dintre cererile clientului și răspunsuri.

---

## 2. Problema menținerii listei de urmărire

Amprentarea clasică a traficului a rămas multă vreme o curiozitate de laborator dintr-un motiv practic: costul uriaș de întreținere. Site-urile web își actualizează frecvent layout-ul, reclamele și resursele externe, iar oamenii navighează rareori deschizând o singură pagină izolată. În lumea reală, utilizatorii au trei, patru sau cinci taburi deschise concomitent.

Sistemele anterioare încercau să clasifice un amestec de trafic ca pe o combinație uriașă. Dacă un serviciu de monitorizare dorea să adauge o nouă publicație de investigație sau un portal pentru avertizori de integritate, trebuia să adune sute sau mii de înregistrări proaspete și să reantreneze rețeaua neuronală de la zero.

Modelul MMF schimbă fundamental logica: în loc să ghicească întreaga combinație, analizează fluxul amestecat și caută independent dacă semnalul specific al unei ținte este prezent. Prin învățare metrică din puține exemple, sistemul poate adăuga o țintă nouă pe lista de urmărire din numai 5 până la 20 de mostre recente.

### Abordarea clasică combinatorică
- Presupune că 1 flux = 1 singur site sau o combinație rigidă.
- Cere sute sau mii de vizite înregistrate pentru fiecare site nou.
- Necesită reantrenarea completă a modelului la fiecare actualizare a listei.
- Devine inutilizabilă când numărul de taburi deschise este necunoscut.

### Modelul MMF (USENIX Security ’26)
- Tratează traficul cu mai multe taburi ca pe un amestec compozit de semnale.
- Integrează o țintă nouă din doar 5 până la 20 de exemple recente.
- Nu necesită reantrenare greoaie: compară reprezentările vectoriale.
- Funcționează chiar și când numărul de taburi deschise se schimbă în timp real.

---

## 3. Performanța comparată pe scenarii reale

Cercetătorii au evaluat modelul atât în condiții controlate, cât și într-un scenariu de tip „lume deschisă” (open-world), unde traficul de fond conține mii de site-uri neînregistrate pe lista de urmărire.

### Precizia la primii k (P@k) într-un amestec de 4 taburi cu zgomot de fond
- **MMF (Noul model)**: 62,36% — De 3,51× mai precis decât cel mai apropiat competitor
- **BAPM (Baseline 2024)**: 17,75% — Scade masiv în prezența mai multor taburi
- **TMWF (Baseline)**: 15,20% — Sensibil la suprapunerea pachetelor
- **ARES (Baseline)**: 13,43% — Dificultăți majore la clasificarea compozită
- **FMWF (Baseline)**: 6,20% — Aproape complet degradat în regim deschis

---

## 4. De ce 47% împiedică mitul unei arme absolute

Cea mai utilă parte a studiului nu este precizia din laborator, ci măsurarea degradării în timp. Pentru a simula condițiile operaționale, autorii au colectat trafic eșalonat pe o durată de aproximativ două luni, lăsând paginile web, condițiile de rutare și latențele de rețea să evolueze natural.

Chiar și cu 20 de mostre recente furnizate pentru fiecare site nou, precizia MMF pe datele cu derivă reală scade la 59,1% pentru 3 taburi, 54,5% pentru 4 taburi și 47,0% pentru 5 taburi. Când utilizatorul are 5 taburi deschise, probabilitatea ca observatorul pasiv să detecteze corect site-ul monitorizat coboară sub nivelul unei aruncări de monedă.

Acest rezultat arată clar limitele tehnologiei: atacul nu oferă o certitudine absolută și necesită reîmprospătarea continuă a mostrelor. Ceea ce s-a schimbat este doar economia procesului: costul de a ține sistemul la zi a scăzut de la mii de înregistrări la câteva zeci.

### Matricea degradării în timp (după 2 luni)
- **3 taburi paralele**: 59,15% — Precizie moderată; zgomotul de interclasare este parțial gestionabil.
- **4 taburi paralele**: 54,50% — Eroziune semnificativă; aproape jumătate dintre inferențe devin incerte.
- **5 taburi paralele**: 47,02% — Sub 50%; amestecul haotic de celule maschează eficient semnătura țintei.

---

## 5. Instituții, atribuire și semnal de capabilitate

Lucrarea este semnată de cercetători de la Universitatea Națională de Tehnologie a Apărării din China (NUDT) și Universitatea Tsinghua. NUDT este o instituție militară aflată în subordinea directă a Comisiei Militare Centrale a Chinei.

Această afiliere reprezintă un semnal important de direcție a cercetării și de capabilitate tehnică în sfera analizei avansate de trafic (SIGINT). Totuși, ea nu constituie o dovadă că tehnica este utilizată operațional de forțele armate chineze sau de vreun serviciu de informații.

Autorii au publicat codul și seturile de date în regim deschis pe Zenodo încă din mai 2026, iar lucrarea se prezintă explicit ca o cercetare de apărare a confidențialității, discutând deschis riscurile de abuz în supravegherea cetățenilor și avertizorilor.

> **Distincția crucială: Detecție vs Identificare**
> Sistemul descris nu asociază direct un nume cu o sesiune de navigare. El indică doar că un flux criptat observat pe o anumită conexiune conține tipare statistice compatibile cu un site din lista de urmărire. Pentru a ajunge la identitatea reală a unei persoane, atacatorul trebuie să coroboreze această constatare cu alte surse de informații: contracte de internet, adrese IP locale, identificatori de dispozitiv sau supraveghere fizică.

---

*Sursă: USENIX Security ’26 proceedings, 12–14 august 2026. Cod și date de reproducere arhivate pe Zenodo (28 mai 2026).*
*Un proiect de cercetare și vizualizare de Marius Comper.*
