Blokparallellisme voor efficiënte gedistribueerde training van lange-context-diffusie-taalmodel
Block diffusion-taalmodellen (BDLM's) combineren autoregressieve afhankelijkheden tussen blokken met parallelle denoising binnen blokken, maar het trainen met lange context wordt beperkt door gedistribueerde aandachtscommunicatie en activeringsgeheugen. Conventioneel context-parallellisme (CP) versnippert de gecombineerde schone-plus-gecorrumpeerde reeks op positie, waarbij gedeelde schone K/V samen met blokspecifieke gecorrumpeerde K/V en hun gradiënten worden gecommuniceerd. We constateren dat de BDLM…
🔗 lees originele bron