跳转到正文

使用 Gemini 1.5 Flash 进行上下文缓存

Google 推出了上下文缓存功能,可通过 Gemini API 在 Gemini 1.5 Pro 与 Gemini 1.5 Flash 上使用。本指南用一个基础示例,介绍如何在 Gemini 1.5 Flash 中使用上下文缓存。

观看原文视频演示

视频短链接:https://youtu.be/987Pd89EDPs?si=j43isgNb0uwH5AeI

应用场景:分析一整年的机器学习论文

本指南展示如何利用上下文缓存,分析原作者过去一年整理的机器学习论文摘要。将摘要存入文本文件后,就能提供给 Gemini 1.5 Flash,并高效地进行查询。

操作流程:上传、缓存与查询

  1. 准备数据:把包含摘要的 README 转换为纯文本文件。
  2. 使用 Gemini API:通过 Google 的 generativeai 库上传文本文件。
  3. 创建上下文缓存:使用 caching.CachedContent.create(),指定 Gemini 1.5 Flash 模型、缓存名称、模型指令(如“你是一名专业的 AI 研究员”),并设置缓存存活时间 TTL,例如 15 分钟。
  4. 创建模型:基于缓存内容创建生成式模型实例。
  5. 查询:使用自然语言提问,例如:“请告诉我本周最新的 AI 论文。”“列出提到 Mamba 的论文,并给出标题和摘要。”“长上下文大语言模型有哪些创新?请列出论文标题和摘要。”

原文实验得到了较好的结果:模型准确检索并总结了文件中的信息。上下文缓存避免了每次查询都重新发送整个文本文件,提高了效率。

这一流程有望帮助研究人员快速分析并查询大量研究资料,无需手动翻阅文档就能找到特定发现,并在交互式研究中减少提示词词元的重复消耗。

原作者希望继续探索上下文缓存在智能体工作流等更复杂场景中的应用。

可在下方查看示例笔记本:

  • 使用 Gemini API 进行上下文缓存

原文课程信息

查看原作者关于缓存方法的 AI 课程。原文优惠码 PROMPTING20 可额外优惠 20%,有效性以课程方信息为准。

ChatGPT 中文使用指南 · MIT 许可 · 隐私政策