跳转到正文

Grok-1 模型介绍

Grok-1 是一个拥有 3,140 亿参数的混合专家(MoE)大语言模型,公开了基础模型权重和网络架构。

它由 xAI 训练,推理时每个词元激活约 25% 的权重,预训练截止于 2023 年 10 月。

根据官方公告,公开版本是预训练阶段的原始基础检查点,尚未针对对话智能体等具体用途微调。

模型以 Apache 2.0 许可发布

结果与能力

最初的公告称,Grok-1 在推理和编程任务中表现较强。原文所引用的公开结果显示,HumanEval 得分为 63.2%,MMLU 为 73%;整体超过 ChatGPT-3.5 和 Inflection-1,但仍落后于 GPT-4 等更强模型。

Grok-1 推理与编程基准结果

在匈牙利全国高中数学毕业考试中,Grok-1 获得 C 等级、59% 的成绩,GPT-4 则为 B 等级、68%。

Grok-1 数学考试结果

查看模型仓库。由于模型有 3,140 亿参数,xAI 建议使用多 GPU 机器测试。

参考资料

ChatGPT 中文使用指南 · MIT 许可 · 隐私政策