← terug naar overzicht

Artsen gebruiken AI-scribes, maar wat gebeurt er met je medische gegevens?

onderzoek 📅 2026-08-03
Gedesaggregeerde LLM-inferentie creëert een datacenternetwerkprobleem dat geen enkel bestaand systeem correct oplost. Wanneer prefill en decode op aparte GPU-pools draaien, moet de KV-cache tussen beide worden overgedragen. Voor een 70B-model is dit 2,6 GB per verzoek, wat op productieschaal uitkomt op meer dan 100 GB/s aan geaggregeerd verkeer. Toch gebruiken DistServe, Splitwise en Mooncake allemaal uniforme RDMA, waarbij ze negeren dat de bandbreedte tussen twee GPU's tot 72× kan verschillen afhankelijk van hun fysieke relatie.

🔗 lees originele bron