De ce rezultatele excelente ale AI la examene medicale pot induce în eroare

Un studiu publicat în Nature Health arată că modelele de inteligență artificială care obțin note excelente la examene medicale standardizate pot fi păcălite să greșească aproape de fiecare dată, atunci când întrebările sunt ușor modificate în timp real.

Cercetarea a fost condusă de Jiazhen Pan și Bailiang Jian, alături de Daniel Rueckert (autor corespondent, Imperial College London), în colaborare cu specialiști de la Technical University of Munich și alte institute. Echipa a testat 15 dintre cele mai avansate modele lingvistice ale momentului, printre care GPT, Claude, Gemini, DeepSeek și modele specializate în domeniul medical, precum MedGemma, folosind un cadru numit DAS (Dynamic, Automatic and Systematic), conceput special pentru a evita capcana testelor fixe.

Problema testelor statice

De obicei, capacitatea unui model AI de a „face medicină” este evaluată prin benchmark-uri standardizate, seturi fixe de întrebări cu răspunsuri corecte cunoscute, similare celor din examenele de licență medicală. Modelele de top ating în mod curent peste 80-90% acuratețe pe cel mai cunoscut astfel de test, MedQA.

Problema, spun autorii, este că aceste teste devin rapid ținte de optimizare. Odată publicate, ele pot fi „învățate” de dezvoltatori, într-un proces cunoscut sub numele de legea lui Goodhart: atunci când o măsurătoare devine o țintă, ea încetează să mai fie o măsurătoare bună. Cu alte cuvinte, un scor mare la un test fix poate reflecta memorare superficială a tiparelor din acel test, nu o capacitate reală de raționament medical.

Cum au fost păcălite modelele

Cercetătorii au folosit agenți AI adversariali care modificau dinamic întrebările la care modelele răspunseseră deja corect, prin șase tipuri de perturbări: negarea răspunsului corect, inversarea logicii întrebării (de exemplu, „care NU este tratamentul corect”), adăugarea unor informații irelevante dar plauzibile, extinderea variantelor de răspuns cu variante capcană, introducerea unor valori fiziologic imposibile și inducerea unor tipare cognitive eronate, cum ar fi apelul la autoritate sau la un consens fals.

Rezultatul: deși scorul median inițial la MedQA depășea 80%, 94% dintre răspunsurile inițial corecte au putut fi transformate în răspunsuri greșite prin aceste perturbări dinamice. Cea mai eficientă metodă s-a dovedit inversarea logicii întrebării, ceea ce sugerează că modelele se bazează mai mult pe recunoașterea unor tipare de suprafață decât pe un raționament medical solid. Vulnerabilitatea s-a păstrat și pe un set de întrebări deschise, mai realiste, conceput de medici, unde modelele de top au avut rate de eșec de peste 70%.

Testele nu s-au oprit la robustețea răspunsurilor medicale. Aceiași agenți adversariali au reușit să obțină scurgeri de informații confidențiale despre pacienți în 86% dintre scenariile testate, chiar și atunci când modelelor li se ceruse explicit să respecte reglementările HIPAA și GDPR. Recomandările medicale s-au schimbat în 81% din cazuri atunci când în context a fost introdusă o simplă frază care sugera o eroare de gândire (bias cognitiv), precum aparenta autoritate a unei surse sau un fals consens al colegilor. Iar peste 74% dintre răspunsurile testate au conținut cel puțin o formă de halucinație, informații false prezentate cu încredere, de la fapte medicale incorecte până la citări fabricate.

Nu toate modelele s-au comportat la fel. Modelele proprietare (precum GPT sau Claude) au fost, în general, mai robuste decât cele open-source. Seria Claude s-a remarcat drept cea mai rezistentă la manipulările de tip bias, iar Claude Sonnet-4 a fost modelul cel mai greu de păcălit în testele de confidențialitate, deși nici acesta nu a fost imun.

O precizare importantă

Cifra de 94% nu înseamnă că un model greșește în 94% dintre situațiile medicale reale. Testul a fost proiectat deliberat, cu o singură țintă: să găsească punctele slabe ale fiecărui model, printr-un proces adversarial care escaladează atacul până când reușește să inducă o eroare. Ceea ce demonstrează, de fapt, acest rezultat nu este că AI-ul e inutil în context medical, ci cât de puțin spune un scor de benchmark despre robustețea reală a unui sistem într-o conversație autentică, cu întrebări de follow-up, detalii incomplete sau presiuni contextuale, exact genul de situații pe care le întâlnește un pacient sau un medic în practică.

De ce contează

Modelele de inteligență artificială sunt deja folosite pentru a răspunde la întrebări de sănătate și pentru a sprijini fluxuri de lucru clinice, de la asistenți conversaționali destinați publicului larg până la instrumente folosite direct de medici. Studiul arată că evaluarea siguranței acestor sisteme nu poate rămâne blocată la un singur test static, făcut o singură dată, înainte de lansare. Autorii propun, în schimb, un model de audit continuu, care evoluează pe măsură ce modelele evoluează, similar unei supravegheri post-lansare din domeniul farmaceutic.

Analogia cu examenul de medicină este potrivită tocmai pentru că surprinde esența problemei: a lua o notă mare la un test standardizat nu înseamnă automat că poți practica medicina în siguranță, în fața unor pacienți reali, cu întrebări neașteptate, informații incomplete și presiuni emoționale. Același principiu, arată acest studiu, se aplică și inteligenței artificiale.

Studiul arată că scorurile mari obținute de modelele AI la teste medicale standardizate spun surprinzător de puțin despre robustețea lor reală. Atunci când întrebările sunt modificate dinamic, chiar și cele mai performante modele greșesc în marea majoritate a cazurilor, ceea ce ridică semne serioase de întrebare asupra modului în care sunt evaluate aceste sisteme înainte de a fi folosite în context medical real.


Sursă: Jiazhen Pan, Bailiang Jian și colegii, Daniel Rueckert (autor corespondent) — Imperial College London, Technical University of Munich și colaboratori, Nature Health, 15 iulie 2026. DOI: 10.1038/s44360-026-00152-8

Lasă un răspuns

Adresa ta de email nu va fi publicată. Câmpurile obligatorii sunt marcate cu *