Leak It: een probabilistische benadering voor het extraheren van trainingsdata uit black-box taalmodellen
Membership inference op taalmodellen wordt doorgaans samengevat met een geaggregeerde ROC-AUC, maar zulke evaluaties zijn vertekend: modelvrije blinde baselines onderscheiden leden van niet-leden louter op basis van de oppervlaktetekst. Wij bestuderen zwarte-doos, steekproefgebaseerde datalekkage door een probabilistische bril, waarbij we N samples uit p(.|x) behandelen als een schatting van de uitvoerverdeling en leksignalen opvatten als functionalen daarvan. We breiden de blinde-baselineanalyse uit.
🔗 lees originele bron