Accès ouvert
2026
preprint
OpenAlex
Zijie Yan, Hongxiao Bai, Xin Yao, Dennis Liu et autres
Scaling Mixture-of-Experts (MoE) training introduces systems challenges absent in dense models. Because each token activates only a subset of experts, this sparsity allows total parameters to grow much faster than per-token computation, creating coupled constraints across memory, communication, and computation. Optimizing one …
Accès ouvert
2026
preprint
OpenAlex
Zijie Yan, Hongxiao Bai, Xin Yao, Dennis Liu et autres
Scaling Mixture-of-Experts (MoE) training introduces systems challenges absent in dense models. Because each token activates only a subset of experts, this sparsity allows total parameters to grow much faster than per-token computation, creating coupled constraints across memory, communication, and computation. Optimizing one …
2025
article
OpenAlex
Tailai Ma, Zhihong Gou, Ningyi Xu, Shuli Sun
cn
(code pays fourni par la source)
Accès ouvert
2024
preprint
OpenAlex
Tailai Ma, Zhihong Gou, Ningyi Xu, Shuli Sun
cn
(code pays fourni par la source)