外观
Kimi K2.5 模型介绍
月之暗面发布了 Kimi K2.5,这是一款面向通用智能体能力的开放多模态模型。它基于 Kimi K2:一个使用 15 万亿词元预训练的万亿参数混合专家(MoE)Transformer。
K2.5 联合优化文本与视觉,使两种模态相互促进。模型还引入 Agent Swarm(智能体集群),自主拆解复杂任务并并行执行不同子问题。原文报告,相较单智能体基线,最高可获得约 4.5 倍的执行加速。
后训练后的模型检查点已在 Hugging Face 公开,支持后续研究与实际应用。
主要贡献
两项核心贡献是文本与视觉的联合优化,以及面向并行编排的 Agent Swarm。它们共同支持推理、编程、多模态理解、智能体任务和计算机操作。
文本与视觉的联合优化
很多视觉适配模型是在文本骨干上追加多模态能力,训练后期才以较高比例引入视觉词元,例如超过 50%。K2.5 团队发现,在固定图文词元总预算下,较低视觉比例的早期融合反而更有效。
因此,K2.5 在整个训练过程以稳定、适中的比例混合文本与视觉,而不是最后集中进行高比例视觉训练,让模型通过较长时间的联合优化形成平衡的多模态表征。
架构上,模型采用 MoonViT-3D 三维原生分辨率视觉编码器,无需复杂的子图切分即可处理原始分辨率图像。视频中最多四个连续帧组成时空体,二维图块展平并打包成一维序列。图像与视频共享编码方式,配合四倍时间压缩,使同一上下文窗口可处理约四倍长度的视频。
无视觉数据的监督微调
一个值得关注的发现是“零视觉 SFT”。团队没有要求后训练使用人工标注的视觉思维链,而是发现,仅文本监督微调就足以激活视觉智能体能力。
图像操作通过 IPython 中的程序实现,将传统视觉工具使用推广到通用编程操作。这使模型能够执行像素级处理、物体定位、计数和 OCR 等行为,而这些能力由纯文本监督激活。
视觉强化学习改善文本表现
结果导向的视觉强化学习还改善了纯文本基准:MMLU-Pro 从 84.7% 提升到 86.4%,GPQA-Diamond 从 84.3% 到 86.4%,LongBench v2 从 56.7% 到 58.9%。
这表明,视觉强化学习可能改善需要结构化信息提取的校准能力,通过跨模态泛化促进文本推理,而不损害语言能力。
智能体集群
多数智能体模型依次执行推理和工具调用。即便能完成数百个步骤,推理时间也会随步骤数线性增长,复杂任务的延迟可能难以接受。Agent Swarm 使用动态并行编排,区别于顺序链和预先规定的并行规则。
工作原理
K2.5 动态拆解任务、实例化子智能体,并调度并行执行。一个可训练的编排器创建专门的冻结子智能体,给它们分配任务,并决定何时并行、并行什么。这些决策通过环境反馈和强化学习探索得到,而不是写死在代码中。
架构将可训练编排器与来自固定中间策略检查点的冻结子智能体解耦。训练期间,子智能体的执行轨迹被视为环境观察,而不是需要求导的决策点;只有编排器通过强化学习更新。
这样可以缓解两个问题:一是贡献归因不清,最终回答正确并不意味着每个子智能体都做得好;二是多智能体场景中奖励噪声大、稀疏,导致训练不稳定。
PARL:并行智能体强化学习
有效训练并行编排并不简单。PARL 奖励包含三部分:
- 并行奖励:鼓励真正创建同时执行的子智能体,避免退化为顺序执行的“串行坍缩”。
- 完成奖励:确保子智能体完成分配的任务,避免创建大量却没有实际工作的“虚假并行”。
- 表现奖励:评估最终解决方案的整体质量。
训练将“关键步骤”而不是总步骤数作为成本指标,类似计算图的关键路径分析。这鼓励均衡拆解任务、缩短最长并行分支,从而降低端到端延迟,而非单纯增加并发数量。
集群实验结果
原文报告,BrowseComp 得分从单智能体基线的 60.6% 提升到 78.4%,增加 17.8 个百分点,并超过对比中的 GPT-5.2 Pro(77.9%)。WideSearch 的 Item-F1 从 72.7% 提升到 79.0%,增加 6.3 个百分点,超过 Claude Opus 4.5(76.2%)。在 WideSearch 中,准确率提高的同时,执行速度相较单智能体提升约 3 至 4.5 倍。
集群也提供了主动上下文管理:长周期任务被拆成语义隔离的并行子任务,每个子智能体只维护有限的本地上下文和独立工作记忆,只有与任务相关的输出返回编排器,从而减少上下文溢出,并保留结构信息与推理完整性。
Toggle:提高词元效率的强化学习
Toggle 是一种交替进行推理时扩展与预算约束优化的训练方法。预算受限阶段要求模型在与任务相关的词元预算内解决问题,形成更简洁的推理;标准扩展阶段则允许难题使用最高输出上限。
原文报告,Toggle 平均减少 25% 至 30% 的输出词元,对表现影响很小。即便只在数学和编程任务训练,也显示出较好的跨领域泛化。
评估要点
以下均为来源报告中的结果,比较对象和评估条件以对应报告为准。
**推理与知识:**AIME 2025 得分 96.1%,接近 GPT-5.2 的满分,超过 Claude Opus 4.5 的 92.8% 和 Gemini 3 Pro 的 95.0%。MMLU-Pro 为 87.1%,GPQA-Diamond 为 87.6%。开启工具的 HLE-Full 达到 50.2%,高于 Gemini 3 Pro 的 45.8% 和 GPT-5.2 的 45.5%。
**编程与软件工程:**SWE-Bench Verified 为 76.8%,SWE-Bench Multilingual 为 73.0%。LiveCodeBench v6 为 85.0%,高于 DeepSeek-V3.2 的 83.3% 和 Claude Opus 4.5 的 82.2%。
**智能体能力:**BrowseComp 在不管理上下文时为 60.6%,采用 Discard-all 上下文管理时为 74.9%,高于对比中的 GPT-5.2(65.8%)、Claude Opus 4.5(37.0%)和 Gemini 3 Pro(37.8%)。DeepSearchQA 为 77.1%,在报告中的对比模型里领先。
**视觉理解:**MMMU-Pro 为 78.5%,MathVision 为 84.2%,OCRBench 为 92.3%,VideoMMU 为 86.6%。长视频测试 LVBench 为 75.9%,LongVideoBench 为 79.8%,报告称达到当时领先水平。
**计算机操作:**OSWorld-Verified 的 GUI 操作成功率为 63.3%,接近 Claude Opus 4.5(66.3%),高于 Qwen3-VL-235B-A22B(38.1%)。WebArena 为 58.9%,超过报告中的 OpenAI Operator(58.1%)。
架构概览
Kimi K2.5 基于 Kimi K2:总参数约 1.04 万亿,包含 384 个专家,每个词元激活 8 个专家,约 320 亿激活参数。
多模态架构由 MoonViT-3D 视觉编码器、MLP 投影器和 Kimi K2 MoE 语言模型组成。预训练流程包含独立 ViT 训练(约 1 万亿词元)、4K 序列长度的联合预训练(约 15 万亿词元),以及使用高质量数据的中期训练,将长上下文扩展到约 262K 序列长度。