跳转到正文

Claude 3 模型系列

Anthropic 发布了 Claude 3 系列,包括 Claude 3 Haiku、Claude 3 Sonnet 和 Claude 3 Opus。

根据发布时公布的结果,最强的 Claude 3 Opus 在 MMLU、HumanEval 等常见基准中超过 GPT-4 及当时参与比较的其他模型。

结果与能力

Claude 3 的能力包括进阶推理、基础数学、分析、数据提取、预测、内容创作、代码生成,以及西班牙语、日语、法语等非英语语言交流。下表比较了多个基准,Claude 3 Opus 在图示模型中领先。

Claude 3 发布时的基准比较

Haiku 是该系列中速度最快、成本最低的模型。Sonnet 比先前 Claude 版本快两倍;Opus 在能力提升的同时,保持与 Claude 2.1 相近的速度。

Claude 3 支持 20 万词元上下文,并可为特定客户扩展到 100 万词元。Opus 在“大海捞针”(NIAH)评估中取得接近完美的召回表现。这项测试衡量模型从大量内容中回忆信息、处理长上下文的能力。

模型还具备视觉能力,可处理照片、图表等内容。

Claude 3 的视觉处理能力

Anthropic 表示,这些模型对请求的理解更加细致,减少了不必要的拒绝。Opus 在开放式事实问答中也有所改善,减少错误与幻觉。与 Claude 2 相比,Claude 3 更擅长输出 JSON 等结构化内容。

参考资料

ChatGPT 中文使用指南 · MIT 许可 · 隐私政策