Sari la conținut
Toate articolele
Date, confidențialitate și GDPR

Poate un model AI să fie anonim? EDPB a răspuns, iar răspunsul nu este „da”

Opinia 28/2024 arată că modelele AI antrenate cu date personale „cannot, in all cases, be considered anonymous” și stabilește un test în două părți care trebuie îndeplinit înainte ca cineva să susțină contrariul.

De Bastion, Cluj-NapocaPublicat 7 min de citit

„Modelul este anonim” este o propoziție atractivă pentru un furnizor și periculoasă pentru un cumpărător. Comitetul European pentru Protecția Datelor a tratat-o direct în Opinia 28/2024, publicată la 18 decembrie 2024, iar răspunsul este mai îngust decât marketingul.

Constatarea

Opinia arată că afirmațiile privind anonimitatea unui model AI „should be assessed by competent SAs on a case-by-case basis, since the EDPB considers that AI models trained with personal data cannot, in all cases, be considered anonymous”.

Concluzia este reluată în corpul documentului: „the EDPB considers that AI models trained on personal data cannot, in all cases, be considered anonymous. Instead, the determination of whether an AI model is anonymous should be assessed, based on specific criteria, on a case-by-case basis.”

Este important ce spune și ce nu spune. Nu este o decizie că modelele nu sunt niciodată anonime. Este un refuz de a accepta anonimitatea ca proprietate a categoriei, în locul unei constatări despre un model anume.

Testul în două părți

for an AI model to be considered anonymous, using reasonable means, both (i) the likelihood of direct (including probabilistic) extraction of personal data regarding individuals whose personal data were used to train the model; as well as (ii) the likelihood of obtaining, intentionally or not, such personal data from queries, should be insignificant for any data subject

EDPB, Opinia 28/2024

Ambele condiții, nu una dintre ele. Extragerea din model și dezvăluirea accidentală prin interogări obișnuite. Iar standardul este „insignificant for any data subject”, nu în medie.

Evaluarea trebuie să ia în considerare „all the means reasonably likely to be used” de către operator sau de către altă persoană, iar opinia adaugă că autoritățile de supraveghere trebuie să analizeze riscul de identificare de către „different types of 'other persons', including unintended third parties accessing the AI model”.

De ce testul intuitiv eșuează

Argumentul obișnuit este că modelul nu conține nume, deci nu conține date personale. Anonimizarea nu a funcționat niciodată așa. O descriere poate identifica o persoană fără niciun nume în ea: directorul general al singurei companii software dintr-un oraș de opt mii de locuitori, angajat în martie 2018.

Opinia notează și că cercetarea din domeniu este activă: „research on training data extraction is particularly dynamic. It shows that it is possible, in some cases, to use means reasonably likely to extract personal data from some AI models, or simply to accidentally obtain personal data through interactions with an AI model”.

Anonimitatea este o concluzie susținută de documentație despre un model anume. Nu este un adjectiv pe care un furnizor îl poate aplica unei linii de produse.

Ce ar trebui să facă o companie înainte să apară întrebarea

  • Identifică ce date personale există efectiv în prompturi, documente și în orice set de fine-tuning
  • Decide dacă sunt necesare pentru sarcină și elimină ce nu este
  • Consemnează temeiul legal al prelucrării
  • Consemnează cine le prelucrează, unde și cât timp sunt păstrate
  • Păstrează în scris controalele tehnice și raționamentul din spatele lor

Opinia așteaptă exact acest tip de evidență. Spune că autoritățile de supraveghere „should review the documentation provided by the controller to demonstrate the anonymity of the model”. Sarcina revine celui care face afirmația.

Unde ajută prelucrarea locală și unde nu

Rularea modelului în interiorul organizației dă mai mult control asupra celor care îl pot interoga și îl pot accesa, ceea ce este direct relevant pentru partea testului privind „alte persoane”. Mai puține părți cu acces înseamnă o suprafață de identificare mai mică.

Nu transformă datele personale în date anonime. Un model care ar putea reproduce un exemplu din antrenare într-un centru de date poate face același lucru în camera ta de servere. Munca de confidențialitate începe cu înțelegerea datelor, iar nicio alegere de implementare nu o înlocuiește.

Cu Bastion

Ce schimbă Bastion

Bastion este un sistem AI privat, livrat ca un singur echipament sigilat care funcționează în clădirea ta. Un singur abonament lunar acoperă echipamentul, modelul, sistemul de operare securizat și suportul, iar nimic din ce scrie echipa ta nu părăsește clădirea.

Bastion livrează un model open-weight pe care clientul nu îl antrenează implicit pe datele proprii și îl rulează acolo unde clientul controlează cine îl poate interoga.

Niciunul dintre aceste fapte nu face un model anonim în sensul folosit de Opinia 28/2024 și nu vom susține altceva. Ce fac ele este să restrângă cercul celor care ar putea încerca vreodată o extragere.

Sursele

  1. 1