外观
OpenAI 深度研究使用指南
什么是深度研究?
深度研究(Deep Research)是 OpenAI 推出的研究智能体,能够在互联网开展多步骤研究,完成报告撰写、竞争分析等复杂任务。它是一种智能体推理系统,可以使用 Python 和网页浏览工具,在多个领域开展深入研究。
这一系统旨在把人类可能需要数小时的复杂研究缩短到数分钟,尤其适合需要大量、复杂网页搜索的工作。原文介绍的深度研究由针对浏览和数据分析优化的 o3 模型驱动,通过推理搜索、解释和分析大量信息。OpenAI 后来还推出了由 o4-mini 驱动的轻量版本。
该模型通过强化学习训练,学习有效浏览、理解复杂信息,以及规划和执行多步骤任务以找到所需数据。它能够回退、调整计划,并响应新获得的信息。
深度研究支持用户上传文件,可以用 Python 生成图表,设计上也支持将生成图表、网页图片和引用纳入结果。原作者指出,写作时部分嵌入功能尚未完全可用。
如何使用 OpenAI 深度研究?
原文记录了当时 Pro、Plus、Team 和 Enterprise 等订阅的开放情况,以及 4 月 24 日更新后的额度:Plus、Team、Enterprise 和 Edu 从每月 10 次增加到 25 次;Pro 从 120 次增加到 250 次;免费用户可使用轻量版本 5 次。原文说明,原版额度耗尽后会自动转向轻量版本。
这些额度属于原文发布时期的产品信息,当前是否可用及具体限额,请以账户界面和官方说明为准。
深度研究解决什么问题?
深度研究能够制定较复杂的研究计划和搜索查询,处理需要大量网页检索的多步骤工作,将原本耗时较长的流程缩短。
其核心过程是搜索、分析、综合,最终形成报告、洞察和行动计划,可以整合数百个在线来源。
应用场景
**专业工作:**金融市场与竞争分析、科学研究与数据分析、政策及监管研究、工程文档与分析。
**购物与消费者研究:**汽车、家电、家具等产品的详细研究,高度个性化推荐,以及深入产品比较。
**学术与分析:**文献综述、全面摘要、研究概览和新洞察;发现研究空白并提出新问题;跟踪趋势并推荐阅读材料;分析量化结果、验证来源、寻找新证据。原作者也提出探索其用于假设检验的可能性。
**知识工作与工程:**回答需要多步处理的复杂问题;分析上传文档并补充研究;撰写综合报告和技术文档;开展可行性研究;整合不同来源的信息。
原作者的示例
- 分析 GitHub 仓库:2025 年 5 月 8 日新增功能的介绍。
- 常见 AI 智能体框架:研究报告。
- 跨学科的 AI 驱动科学发现:文献综述。
- OpenAI 与 Google Gemini 模型比较:竞争分析。
- AI 教育趋势:趋势研究。
- YC 创业点子研究:企业研究。
- DeepSeek-R1 指南:使用指南。
- CrewAI 一个月学习计划:学习规划。
- 大语言模型价格趋势:趋势分析。
- 近期 o1 与 DeepSeek-R1 论文:摘要与分析。
更多示例见OpenAI 深度研究介绍。
深度研究尤其适合通常需要人类数小时完成的工作,包括整合多个信息来源、分析复杂数据、撰写有充分出处的报告,以及同时涉及规划、查找、浏览、推理、分析和综合的多步骤研究。
何时应该使用深度研究?
如果任务包含多个维度的领域专用问题,需要广泛查询实时信息,并认真理解与推理这些信息,就适合尝试深度研究。上面的场景可作为参考。
对于其他任务,原文建议使用不带深度研究流程的 o1-mini 或 GPT-4o:需要自主拆解复杂任务的场景可以使用前者;简单的一次性任务可以使用后者。这是原文时期的模型选择建议。
使用技巧
以下建议来自原作者的实验及对他人结果的观察。
提示词建议
- 清楚、具体地说明要求:尽量提供计划与细节。研究需要时间,第一次就写好提示词能减少返工。
- 认真回答澄清问题:模型会就不确定之处提问。完整回答通常有助于改善结果;此类请求成本高于普通查询,值得花时间澄清。
- 提供关键词:模型依靠关键词搜索网页。准确的品牌、技术术语和产品名可减少检索时间。
- 使用明确动词:例如“比较”“建议”“推荐”“报告”,帮助模型理解任务和输出目标。
- 规定输出格式:说明报告类型、章节、表格需求,甚至列数与表头。默认报告形式未必适合每个人。
- 上传背景资料:PDF 等文件可以提供必要上下文,尤其适用于技术主题或模型不熟悉的信息。原文提到可结合 ChatGPT-4o 使用。
**务必自行核查来源。**模型仍可能出错,也可能无法分清权威信息与推测。
接下来可以尝试什么?
**研究:**全面调查 AI 工具市场及竞争对手;查询新产品评论与价格;要求补充、扩展或批评已有文档;结合趋势、采用率和用户行为提出产品功能建议;开展用户研究、法律案例与判例检索、事实核查或背景调查。
**商业:**寻找特定行业的 AI 或智能体应用场景,跟踪行业或主题趋势。
**学习:**制定学习计划和路径;整理 AI 模型使用与编程实践;查询开发工具的新功能,并推荐练习与学习材料。
**科学:**研究睡眠、症状、心理健康等领域的最新成果,撰写包含新发现的技术报告。
**内容创作:**围绕多个主题撰写文章,依据行业网络趋势推荐选题。
**个人事务:**整理自己或公众人物的详细介绍;根据公开信息和项目更新简历;为演示文稿提出页面内容。
与其他方案有什么区别?
Google Gemini Deep Research 等产品也提供专门的研究智能体。开发者还可以使用 Flowise AI、LlamaIndex、crewAI、n8n 或 LangGraph 构建类似工作流。自建系统可能更经济,并可结合原文时期的 o1、o3-mini 等模型。
原文指出,OpenAI 深度研究使用其专有的 o3 变体,专门用于复杂推理和多步骤研究。当时尚不清楚这一具体模型是否会通过 API 或 ChatGPT 单独开放。可以查看 OpenAI 提供的深度研究与 o3-mini-high 在 Humanity’s Last Exam 等基准上的比较结果。
模型浏览和思考所投入的时间越多,表现往往越好,因此给它足够时间很重要。推理模型是改善复杂任务表现的关键,推理能力的进步也有望改善深度研究。
局限
原作者认为,深度研究在综合技术与专业领域信息方面仍有困难,因此有相关文档时应主动提供。它仍会产生幻觉和事实错误,也可能分不清权威来源与传闻。不同领域的效果可能差异明显,整合不同类型信息也有挑战。
原文记录的具体问题包括:
- 不清楚如何强制检索更多来源,例如 50 篇不同文章,或准确限定特定来源;还观察到对某些域名的偏好。
- 引用与格式仍可能出错。
- 导出到 Excel、笔记本、Notion、文档编辑器等格式不够方便。
- 对时间、日期查询处理不佳,因此应尽量明确。
- 当时尚不支持付费墙或订阅后方的来源,未来可能通过集成改善。
- 原作者测试时,生成并嵌入图表尚未正常工作,虽然可以加入图片。
另一项重要局限是,原文时期的深度研究主要进行阅读,并不执行实际行动。OpenAI 表示它能够打开网页并查看其中的内容;作者希望未来它还能进行站内搜索、使用 arXiv 高级搜索等操作,并与 Operator 一类行动工具融合。
作者也期待更多工具、自动访问知识库,以及更个性化的输出。自定义指令和增强记忆可能有帮助,但原文尚未确认它们对研究结果的具体影响。
原文课程信息
查看深度研究智能体构建课程。原文优惠码 PROMPTING20 可额外优惠 20%,有效性以课程方说明为准。