KEY TAKEAWAYS · 要点
  • 艾伦所与伯克利联合开发EMO模型,利用文档边界约束实现领域专家模块化。
  • EMO保留12.5%专家模块时性能下降不足1%,大幅节省存储并支持定向控制。
  • 该研究于2026年5月发布,解决传统混合专家模型无法按需加载子集难题。

中文翻译

摘要: 艾伦人工智能研究所与加州大学伯克利分校联合开发了模块化语言模型 EMO。该模型创新性地利用“文档边界”作为训练约束,促使专家模块专注于医学、政治等特定领域,而非仅学习通用语法。研究显示,EMO 在仅保留 12.5% 的专家模块时,性能下降不足 1%,却能大幅节省存储并实现定向内容控制。这一突破解决了传统混合专家模型难以按需加载子集的问题,为高效、灵活的 AI 部署提供了新路径。

正文

将链接复制到剪贴板

研究人员训练出一种 AI 模型,仅使用其专家模块的 12.5% 即可实现接近全性能的表现

乔纳森·肯珀(Jonathan Kemper)

查看乔纳森·肯珀的领英资料

2026 年 5 月 16 日

由 THE DECODER 提示生成的 Nano Banana Pro

艾伦人工智能研究所(Allen Institute for AI)与加州大学伯克利分校联合开发了 EMO——一种模块化语言模型。该模型的内部模块专注于医学、政治等特定领域,而非仅仅学习语法结构,同时仍保持强大的整体性能。

该系统在训练过程中采用固定的文档边界作为约束,促使各个模块发展出针对特定内容领域的专长,而非仅学习纯粹的语言结构模式。

当 EMO 被精简至仅剩四分之一模块时,其性能仅下降约一个百分点,显著节省了存储空间,并实现了对模型所覆盖内容领域的定向控制。

关于本文提问……

艾伦人工智能研究所与加州大学伯克利分校的研究人员构建了 EMO,这是一种在预训练阶段即形成模块化结构的混合专家(Mixture-of-Experts, MoE)模型。该模型可被大幅精简至仅保留少量专家模块,而性能几乎不受影响。

混合专家架构如今已成为 DeepSeek-V4 或 Qwen3.5 等大语言模型的标准配置。这类架构在每个 token 处理时仅激活少数几个专家模块,从而能够在不显著增加计算成本的前提下扩展至数千亿参数规模。然而,由于同一任务中不同 token 会调用不同的专家模块,完整模型仍需全部驻留内存。因此,若仅需执行数学或代码生成任务,无法仅加载模型的一部分便完成工作。

根据论文所述,标准 MoE 模型中的专家往往倾向于捕捉浅层语言模式,例如介词、标点符号或冠词,而非数学、编程等高层语义领域。这使得从中提取有用子集变得不可行。

以文档边界作为训练信号

EMO 通过一个巧妙策略解决了这一问题:它不再像 BTX 项目或艾伦研究所自身的 FlexOlmo 那样,预先将训练数据划分为数学、生物学等固定领域,而是利用文档边界作为信号。通常情况下,同一文档内的 token 属于同一领域。

DEC_D_Incontent-1

EMO 强制要求同一文档中的所有 token 从共享的专家池中选择其激活的专家模块。模型通过计算文档内所有 token 的路由器偏好平均值,并保留被选中频率最高的专家,来确定该池的成员构成。

EMO 将“模块化”作为首要训练目标。用户可为特定领域任意选取专家子集,而不会损害完整模型的性能。| 图片来源:艾伦人工智能研究所

为确保训练稳定性,研究者进行了两项调整。首先,他们停止了在每个训练批次内局部计算负载均衡(load balancing)的操作——该机制原本旨在将计算任务均匀分配给各专家模块。取而代之的是……


来源: Brave/the-decoder.com

采集时间: 2026-05-16 20:20:16

常见问题

EMO 模型是由哪两个机构联合开发的?
由艾伦人工智能研究所与加州大学伯克利分校联合开发。
EMO 仅保留多少比例的专家模块时性能下降不足 1%?
当仅保留 12.5% 的专家模块时,其性能下降不足 1%。