MawForge: Geheugenbeperkte Expertmaterialisatie voor Lokale Mixture-of-Experts Inferentie
Gepubliceerd 14 July 2026
MawForge onderzoekt de haalbaarheid van lokale Mixture-of-Experts (MoE) inferentie op machines met beperkte geheugenbronnen. Het systeem slaat het volledige model op de schijf op en houdt veelgebruikte tensors in het geheugen, terwijl het expert tensors dynamisch in een beperkte uitvoeringscache materialiseert. De resultaten tonen aan dat MawForge effectief is als uitvoeringsmechanisme, maar niet als beleid voor cache-maximalisatie. De prestaties zijn afhankelijk van de balans tussen expert hergebruik, resident footprint, KV-cachegrootte, kwantisatie, route-localiteit en geheugendruk op macOS.
Oorspronkelijke bronnen (1)
Deze pagina toont geen volledige brontekst - lees het origineel voor de volledige context.
-
Primaire bron MawForge: Memory-Bounded Expert Materialization for Local Mixture-of-Experts InferenceLees origineelarXiv - cs.LG (Machine Learning) · 14-07-2026 · ResearchPublication