- Published on
1M Token重返的Opus、改写编程基准的Gemini,以及进入工作聊天的AI:2026年8月AI三选
AI工具的进化有两种:悄然前进,以及重新定义基准线。
2026年7至8月,后者连续发生了三次。Anthropic推出了Opus系列的全新一代。Google一举将编程智能体市场的性能标准提升到新高度。而今天——2026年8月26日——Google Chat与AI的关系发生了改变。无需离开聊天界面,就能撰写邮件、管理日程、搜索文档的时代已经到来。
目录
- Claude Opus 5:1M Token、编程基准三冠、与Opus 4.8相同定价
- Opus 5的"努力等级"调节功能为何重要
- Gemini 3.7 Flash:将智能体自动化基准近乎翻倍
- Ask Gemini in Google Chat:工作聊天应用成为AI命令中心
- 三项更新指向的方向
1. Claude Opus 5:1M Token、编程基准三冠、与Opus 4.8相同定价
Anthropic于2026年7月24日正式发布了Claude Opus 5。这是迄今最强大的Claude模型,也是本代最重要的单项发布。
核心数据一览:
- 上下文窗口:1,000,000 Token(1M)
- 最大输出Token:128,000
- 价格:输入25/1M——与Opus 4.8相同
- 扩展思考:默认启用
- 平台:Claude.ai、Claude Code、Anthropic API、Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry
编程性能:三项基准测试均排名第一
在Meta 8月Muse Code发布会上公布的三项编程基准测试中,Opus 5全部位居第一。
| 基准测试 | Opus 5 | 第二名 |
|---|---|---|
| Terminal-Bench 2.1 | 86.7% | 82.9% |
| DeepSWE v1.1 | 65.0% | 59.3% |
| Meta内部编程基准 | 79.4% | 70.6% |
这不是简单的回答质量,而是真实工程工作——修复Bug、重构代码、探索陌生代码库——的实际性能。
1M Token实际意味着什么
100万Token是个抽象数字,换算成实际场景:
- 一次性分析750页的PDF
- 在单次请求中处理50万行规模的整个代码库
- 在单一上下文中汇总6小时会议记录
对于教育工作者,这意味着可以一次性上传整学期的课程资料,并提问:"3月课程与6月课程之间存在哪些概念联系?"
"使用Opus 5之后,我第一次停止了'必须分割上下文'的担忧。我把整个项目放进去,然后开始思考了。"
2. Opus 5的"努力等级"调节功能为何重要
Opus 5有一个新的调节旋钮:努力等级(Effort Level)——low · medium · high · xhigh · max。
这个功能重要的原因在于,用户可以直接调节成本与性能之间的权衡关系。同一模型,但根据使用方式不同,会成为完全不同性格的工具。
| 等级 | 适合的任务 |
|---|---|
| low | 简单摘要、格式转换、结构化数据提取 |
| medium | 一般写作、分析报告初稿 |
| high | 复杂代码审查、需要逻辑推理的文档 |
| xhigh | 高难度Bug排查、长篇结构化分析 |
| max | 核心能力任务、要求最高质量时 |
个人教育创业者与内容创作者的使用技巧
- 日常社交媒体初稿:low或medium就足够。节省成本,提升速度。
- 课程体系设计:建议high以上。逻辑流程和先修知识映射更加精准。
- 教育科技产品规划书:这是使用max的典型场景。同时处理复杂用户场景和竞争分析时,质量差距会非常明显。
3. Gemini 3.7 Flash:将智能体自动化基准近乎翻倍
Google于2026年8月13日发布了Gemini 3.7 Flash,距Gemini 3.6 Flash发布(7月21日)仅3周。
Google给这款模型的官方定位是"最具智能的工作主力模型(most capable workhorse model)",本次版本特别针对编程和智能体工作流进行了优化。
各基准测试性能提升
| 基准测试 | Gemini 3.6 Flash | Gemini 3.7 Flash | 提升幅度 |
|---|---|---|---|
| DeepSWE v1.1 | 49.0% | 65.3% | +16.3pp |
| AutomationBench | 17.0% | 30.4% | +13.4pp |
| WebDev Arena Elo | 1,538 | 1,588 | +50 |
DeepSWE是衡量AI能够自主解决真实GitHub Issue的软件工程基准测试。65.3%意味着AI能够独立解决约6.5个真实软件工程问题(满分10个)。
定价:年底前输入仅$0.75/1M Token
2026年12月31日前适用的发布优惠价格:
- 输入:**1.50)
- 输出:**7.50)
相比Gemini 3.6 Flash便宜约50%,同时提供更高性能。正在运营自动化流水线的开发者,现在是评估迁移的好时机。
4. Ask Gemini in Google Chat:工作聊天应用成为AI命令中心
从今天——2026年8月26日——起,Google Chat引入了Ask Gemini。Google的说明很简单:"面向工作的统一命令行(unified command line for your work)。"
此前,使用AI助手需要关闭Chat并打开Gemini应用,或访问Google.com。现在无需离开Chat界面即可与AI对话。
可以做的6件事
- 搜索Workspace数据:用自然语言搜索Gmail、Drive、Calendar。"找一下上个月张总发来的合同"可以直接执行。
- 生成图片:直接在Chat界面处理图片生成请求。
- 起草重要更新:在对话流程中撰写团队公告、客户邮件。
- 快速了解讨论动态:汇总长篇未读讨论串,只获取核心要点。
- 管理会议和任务:用自然语言添加日历事件、创建任务。
- 整理会话:按主题分组保存会话,随时继续工作。
访问方式
- Google Chat界面左侧Shortcuts下方的Ask Gemini入口
- 键盘快捷键:ChromeOS/Windows为Ctrl + G,macOS为Command + G
推广期
2026年10月1日前,Workspace用户免费获得更高使用配额。此后将适用使用限制。现在是充分体验该功能的最佳时机。
"AI命令在Chat内执行,不仅仅是方便。这意味着工作流不会中断。切换标签页的0.5秒,原来打断了比预想中多得多的思维流。"
5. 三项更新指向的方向
将三条消息并排放置,可以看到共同的移动方向。
第一,AI模型的"上限"在持续提升。 Claude Opus 5和Gemini 3.7 Flash在3周内先后刷新了编程智能体的性能基准。6个月前的"最高性能模型"如今已变成中等水平,这就是当前的速度。
第二,成本与性能的关系正在逆转。 Opus 5以与Opus 4.8相同的价格提供了显著更高的性能。Gemini 3.7 Flash比上一代更便宜,性能却更高。AI成本下降的同时,使用范围在扩大。
第三,AI正在进入你已经在使用的工具中。 Ask Gemini in Chat不是需要安装的新应用,而是你每天打开的Google Chat变成了AI命令中心。不是用户去寻找工具,而是工具进入用户的工作流。
站在这三个方向交汇点的人——以合理成本使用强大模型,同时在已有环境中自然地利用AI——将成为2026年下半年AI生产力的真正受益者。
结语
Claude Opus 5重新划定了"可以交给AI的任务复杂度上限"。Gemini 3.7 Flash提高了"智能体能够自主解决的工程问题比例"。Ask Gemini in Chat将接触AI助手的成本降到了近乎为零。
工具变得更强大、更实惠,也更自然地融入了你的工作环境。剩下要做的,只是决定你想创造什么。
Sources
- Claude Opus 5: Benchmarks, Pricing & How It Compares — Codersera
- Claude Opus 5 Release Date — Emergent.sh
- Introducing Gemini 3.7 Flash — blog.google
- Gemini 3.7 Flash launches — 9to5Google
- Introducing Ask Gemini in Chat — Google Workspace Updates
- Google Chat Just Got a Lot Smarter — Phandroid
- Claude Updates August 2026 — Releasebot