Articles

2026.8.24Harsh ChandraResearch技術解説解説

MoEはなぜ『巨大なのに安い』のか — DeepSeekの革新を読み解く

Product

無料で始める(準備中) エンタープライズのご相談

Career

特化型AIエージェントのサービス開発を一緒に取り組む人を積極的に募集しています!

『巨大なのに、動かすのは安い』——DeepSeekやKimiに代表されるMoE(Mixture of Experts)モデルは、数千億〜数兆の総パラメータを持ちながら、各トークンはごく一部のエキスパートだけを通るため、実際に動くパラメータは総容量のほんの一部に抑えられます。本スライドでは、この仕組みの基本から、ルーターの負荷分散が抱える課題、DeepSeekが導入した補助損失なしのロードバランシングとその発展形までを、図解で解説します。

この記事をシェア