← terug naar overzicht

Leak It: een probabilistische benadering voor het extraheren van trainingsdata uit black-box taalmodellen

onderzoek 📅 2026-08-04
Membership inference op taalmodellen wordt doorgaans samengevat met een geaggregeerde ROC-AUC, maar zulke evaluaties zijn vertekend: modelvrije blinde baselines onderscheiden leden van niet-leden louter op basis van de oppervlaktetekst. Wij bestuderen zwarte-doos, steekproefgebaseerde datalekkage door een probabilistische bril, waarbij we N samples uit p(.|x) behandelen als een schatting van de uitvoerverdeling en leksignalen opvatten als functionalen daarvan. We breiden de blinde-baselineanalyse uit.

🔗 lees originele bron