POSPAN: positie-beperkte span-masking voor het voortrainen van taalmodellen
Span-niveau gemaskeerd taalmodelleren (MLM) heeft bewezen voordelig te zijn voor voorgetrainde taalmodellen ten opzichte van het oorspronkelijke single-token MLM, aangezien entiteiten/zinnen en hun afhankelijkheden cruciaal zijn voor taalbegrip. Eerder werk beschouwt alleen de span-lengte met enkele discrete verdelingen, terwijl de afhankelijkheden tussen spans worden genegeerd, dat wil zeggen door aan te nemen dat de posities van gemaskeerde spans uniform verdeeld zijn. In dit artikel presenteren we POSPA
🔗 lees originele bron