minssam.
Published on

1M Token重返的Opus、改写编程基准的Gemini,以及进入工作聊天的AI:2026年8月AI三选

AI工具的进化有两种:悄然前进,以及重新定义基准线。

2026年7至8月,后者连续发生了三次。Anthropic推出了Opus系列的全新一代。Google一举将编程智能体市场的性能标准提升到新高度。而今天——2026年8月26日——Google Chat与AI的关系发生了改变。无需离开聊天界面,就能撰写邮件、管理日程、搜索文档的时代已经到来。


目录

  1. Claude Opus 5:1M Token、编程基准三冠、与Opus 4.8相同定价
  2. Opus 5的"努力等级"调节功能为何重要
  3. Gemini 3.7 Flash:将智能体自动化基准近乎翻倍
  4. Ask Gemini in Google Chat:工作聊天应用成为AI命令中心
  5. 三项更新指向的方向

1. Claude Opus 5:1M Token、编程基准三冠、与Opus 4.8相同定价

Anthropic于2026年7月24日正式发布了Claude Opus 5。这是迄今最强大的Claude模型,也是本代最重要的单项发布。

核心数据一览:

  • 上下文窗口:1,000,000 Token(1M)
  • 最大输出Token:128,000
  • 价格:输入5/1M,输出5/1M,输出25/1M——与Opus 4.8相同
  • 扩展思考:默认启用
  • 平台:Claude.ai、Claude Code、Anthropic API、Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry

编程性能:三项基准测试均排名第一

在Meta 8月Muse Code发布会上公布的三项编程基准测试中,Opus 5全部位居第一。

基准测试Opus 5第二名
Terminal-Bench 2.186.7%82.9%
DeepSWE v1.165.0%59.3%
Meta内部编程基准79.4%70.6%

这不是简单的回答质量,而是真实工程工作——修复Bug、重构代码、探索陌生代码库——的实际性能。

1M Token实际意味着什么

100万Token是个抽象数字,换算成实际场景:

  • 一次性分析750页的PDF
  • 在单次请求中处理50万行规模的整个代码库
  • 在单一上下文中汇总6小时会议记录

对于教育工作者,这意味着可以一次性上传整学期的课程资料,并提问:"3月课程与6月课程之间存在哪些概念联系?"

"使用Opus 5之后,我第一次停止了'必须分割上下文'的担忧。我把整个项目放进去,然后开始思考了。"


2. Opus 5的"努力等级"调节功能为何重要

Opus 5有一个新的调节旋钮:努力等级(Effort Level)——low · medium · high · xhigh · max。

这个功能重要的原因在于,用户可以直接调节成本与性能之间的权衡关系。同一模型,但根据使用方式不同,会成为完全不同性格的工具。

等级适合的任务
low简单摘要、格式转换、结构化数据提取
medium一般写作、分析报告初稿
high复杂代码审查、需要逻辑推理的文档
xhigh高难度Bug排查、长篇结构化分析
max核心能力任务、要求最高质量时

个人教育创业者与内容创作者的使用技巧

  • 日常社交媒体初稿:low或medium就足够。节省成本,提升速度。
  • 课程体系设计:建议high以上。逻辑流程和先修知识映射更加精准。
  • 教育科技产品规划书:这是使用max的典型场景。同时处理复杂用户场景和竞争分析时,质量差距会非常明显。

3. Gemini 3.7 Flash:将智能体自动化基准近乎翻倍

Google于2026年8月13日发布了Gemini 3.7 Flash,距Gemini 3.6 Flash发布(7月21日)仅3周。

Google给这款模型的官方定位是"最具智能的工作主力模型(most capable workhorse model)",本次版本特别针对编程和智能体工作流进行了优化。

各基准测试性能提升

基准测试Gemini 3.6 FlashGemini 3.7 Flash提升幅度
DeepSWE v1.149.0%65.3%+16.3pp
AutomationBench17.0%30.4%+13.4pp
WebDev Arena Elo1,5381,588+50

DeepSWE是衡量AI能够自主解决真实GitHub Issue的软件工程基准测试。65.3%意味着AI能够独立解决约6.5个真实软件工程问题(满分10个)。

定价:年底前输入仅$0.75/1M Token

2026年12月31日前适用的发布优惠价格:

  • 输入:**0.75/1MToken20271月起调整为0.75/1M Token**(2027年1月起调整为1.50)
  • 输出:**3.75/1MToken20271月起调整为3.75/1M Token**(2027年1月起调整为7.50)

相比Gemini 3.6 Flash便宜约50%,同时提供更高性能。正在运营自动化流水线的开发者,现在是评估迁移的好时机。


4. Ask Gemini in Google Chat:工作聊天应用成为AI命令中心

从今天——2026年8月26日——起,Google Chat引入了Ask Gemini。Google的说明很简单:"面向工作的统一命令行(unified command line for your work)。"

此前,使用AI助手需要关闭Chat并打开Gemini应用,或访问Google.com。现在无需离开Chat界面即可与AI对话。

可以做的6件事

  1. 搜索Workspace数据:用自然语言搜索Gmail、Drive、Calendar。"找一下上个月张总发来的合同"可以直接执行。
  2. 生成图片:直接在Chat界面处理图片生成请求。
  3. 起草重要更新:在对话流程中撰写团队公告、客户邮件。
  4. 快速了解讨论动态:汇总长篇未读讨论串,只获取核心要点。
  5. 管理会议和任务:用自然语言添加日历事件、创建任务。
  6. 整理会话:按主题分组保存会话,随时继续工作。

访问方式

  • Google Chat界面左侧Shortcuts下方的Ask Gemini入口
  • 键盘快捷键:ChromeOS/Windows为Ctrl + G,macOS为Command + G

推广期

2026年10月1日前,Workspace用户免费获得更高使用配额。此后将适用使用限制。现在是充分体验该功能的最佳时机。

"AI命令在Chat内执行,不仅仅是方便。这意味着工作流不会中断。切换标签页的0.5秒,原来打断了比预想中多得多的思维流。"


5. 三项更新指向的方向

将三条消息并排放置,可以看到共同的移动方向。

第一,AI模型的"上限"在持续提升。 Claude Opus 5和Gemini 3.7 Flash在3周内先后刷新了编程智能体的性能基准。6个月前的"最高性能模型"如今已变成中等水平,这就是当前的速度。

第二,成本与性能的关系正在逆转。 Opus 5以与Opus 4.8相同的价格提供了显著更高的性能。Gemini 3.7 Flash比上一代更便宜,性能却更高。AI成本下降的同时,使用范围在扩大。

第三,AI正在进入你已经在使用的工具中。 Ask Gemini in Chat不是需要安装的新应用,而是你每天打开的Google Chat变成了AI命令中心。不是用户去寻找工具,而是工具进入用户的工作流。

站在这三个方向交汇点的人——以合理成本使用强大模型,同时在已有环境中自然地利用AI——将成为2026年下半年AI生产力的真正受益者。


结语

Claude Opus 5重新划定了"可以交给AI的任务复杂度上限"。Gemini 3.7 Flash提高了"智能体能够自主解决的工程问题比例"。Ask Gemini in Chat将接触AI助手的成本降到了近乎为零。

工具变得更强大、更实惠,也更自然地融入了你的工作环境。剩下要做的,只是决定你想创造什么。


Sources

1M Token重返的Opus、改写编程基准的Gemini,以及进入工作聊天的AI:2026年8月AI三选 | MINSSAM.COM