Tag Archive

标签:MoE

这里整理所有带有「MoE」标签的文章,方便按主题快速回看。

MoE

共 2 篇
主题归档 · 2026-06-17

Mixture-of-Transformers(MoT)架构详解:把多模态大模型从“一个脑子硬扛所有模态”改成“按模态分工的 Transformer 混合体”

详细解释 Meta 提出的 Mixture-of-Transformers(MoT)架构:它为什么不是普通 MoE,怎样按模态解耦 Transformer 参数、保留全局自注意力,以及为什么能显著降低多模态预训练 FLOPs 和 wall-clock time。
Multimodal Foundation ModelMixture-of-TransformersMoESparse TransformerArchitecturePretraining
论文精读 · 2026-06-01

MiniMax-M2.7 技术报告详解:10B 激活参数如何撑起 Agentic Intelligence

详解 MiniMax-M2.7 技术报告:从 229.9B 总参数/9.8B 激活参数的 MoE 架构,到 192K 长上下文、MTP 推测解码、agentic 数据管线、Forge 强化学习系统、交错思考与自演化能力,理解“mini activations, max real-world intelligence”背后的系统路线。
MiniMax-M2.7MoEAgent RLForgeself-evolutioninterleaved thinkinglong context