Tag Archive
标签:Pretraining
这里整理所有带有「Pretraining」标签的文章,方便按主题快速回看。
首页
每日调研
论文精读
主题归档
实验分析
复现指南
Pretraining
共 2 篇
主题归档 · 2026-06-17
Mixture-of-Transformers(MoT)架构详解:把多模态大模型从“一个脑子硬扛所有模态”改成“按模态分工的 Transformer 混合体”
详细解释 Meta 提出的 Mixture-of-Transformers(MoT)架构:它为什么不是普通 MoE,怎样按模态解耦 Transformer 参数、保留全局自注意力,以及为什么能显著降低多模态预训练 FLOPs 和 wall-clock time。
Multimodal Foundation Model
Mixture-of-Transformers
MoE
Sparse Transformer
Architecture
Pretraining
论文精读 · 2026-05-09
daVinci-LLM:把预训练从“炼丹”推进到“科学实验”
详细解读 daVinci-LLM 的核心贡献:全开放预训练过程、Data Darwinism 数据处理框架、两阶段自适应课程、200+ 消融实验,以及它对基础模型训练研究的启发。
LLM
Pretraining
Open Models
Data
Reasoning