- Published on
先说后想、97种语言实时口译、正面突破版权争议:2026年9月AI三选
2026年9月,三个AI更新各自以不同方式重新定义了"速度"的含义。
Anthropic以"更快、更便宜、更直接"的方向发布了Claude Opus 5.5。Google将Gemini 3.8 Live的实时语音翻译语言支持扩展到97种。Suno走出法庭,与唱片公司签订许可协议并发布v6。快速响应、快速口译、快速音乐编辑——三个更新的共同关键词是减少摩擦的速度。
目录
- Claude Opus 5.5:先说后想
- Responsive模式与文字水印带来的变化
- Gemini 3.8 Live:97种语言实时语音转换
- Extended Thinking变体与后台任务处理
- Suno v6:解决版权争议,从授权音乐出发
- 段落编辑、混搭与多模态提示
- 深入了解Opus 5.5:始终开启的思考、Preserved Thinking与Fast Mode
- Gemini 3.8 Flash与3.8 Flash Cyber:几乎每月更新的Flash
- 深入了解Suno v6:训练数据与收益分成
- 一览Notion 3.7:团队技能库与模型控制
- 三个更新指向的方向
1. Claude Opus 5.5:先说后想
Anthropic于2026年9月发布Claude Opus 5.5。输入Token定价为每百万个4美元,输出为每百万个20美元,比Opus 5便宜40%。输出速度提升30%以上。
比价格和速度更引人注目的是新的运行方式。以往Claude会在使用工具或完成推理之后才给出响应。Opus 5.5的Responsive模式颠倒了这个顺序——在任何推理或工具调用之前,先输出一句话。不是"先思考再说话的AI",而是"先说话再思考的AI"。
Opus 5.5数据对比
| 项目 | Opus 5 | Opus 5.5 |
|---|---|---|
| 输入价格(每百万Token) | $7 | $4 |
| 输出价格(每百万Token) | $35 | $20 |
| 输出速度 | 基准 | +30% |
| 上下文窗口 | 200K Token | 1M Token |
| Responsive模式 | — | 已搭载 |
| 文字水印 | — | 默认开启 |
Opus 5.5在大多数任务上达到Fable 5.1级别的性能,同时比Opus 5降低40%的成本。它已成为Claude Code中默认的Opus模型,可在Amazon Web Services、Google Cloud和Microsoft Azure上使用。
多步骤错误恢复
初期测试中,Opus 5.5在多步骤任务出错时,恢复所需的步骤数少于Opus 5。复杂智能体工作中的"无效尝试次数"减少了。这也正是它以智能体编码和知识工作为主要目标进行设计的原因。
"第一次使用Opus 5.5时,你会发现第一个响应比预期来得更快。感觉就像在和一个还没想完就开始说话的人交谈——不显唐突,反而很自然。"
2. Responsive模式与文字水印带来的变化
Responsive模式带来的实质变化是响应的体感速度。 推理前先输出一句话,消除了"等待空白"。尤其在需要较长推理的复杂问题上,差异更为明显。
文字水印是Anthropic于2026年7月签署欧盟AI生成内容透明度行为准则后首次引入的技术。Claude生成文本时,会在正文中嵌入不影响含义、可读性和Token数量的模式。读者无法察觉,但拥有密钥的系统可以确认该文本是Claude生成的。
教育者视角的含义
- 作业提交验证:文字水印可成为无需外部工具即可识别文档中AI生成内容的基础
- AI素养课堂素材:"这段文字中有一个看不见的签名"这一事实为数字媒体教育提供了丰富的讨论素材
- 个人创业者内容管理:可以事后确认哪些新闻通讯或报告是由Claude生成的间接工具
3. Gemini 3.8 Live:97种语言实时语音转换
Google于2026年9月15日发布Gemini 3.8 Live。这是一个专为语音到语音转换设计的实时AI模型,支持97种语言。同时发布的Gemini 3.8 Live Extended Thinking是针对复杂多步骤任务优化的上位变体。
Gemini 3.8 Live的特点是后台任务与对话流程并行处理。用户说话时,模型可以调用函数或查询外部数据并在下一句话中反映结果。语音口译不再是单向转换器,而是成为实时更新上下文的智能体。
技术规格
- 输入格式:音频、图像、视频、文本同时接受
- 输出格式:音频
- 连接方式:基于WebSocket的Gemini Live API
- 部署渠道:Gemini API、Vertex AI、Google Workspace
Gemini 3.8 Live针对低延迟对话优化,Extended Thinking针对复杂多步骤推理优化。Extended Thinking在Artificial Analysis基准测试中获得82.6分,τ-Voice任务完成率为68.6%。
与Gemini 3.5 Transcribe的组合
同日达到正式可用(GA)的Gemini 3.5 Transcribe是支持85种以上语言的高精度低延迟语音转文本模型,支持说话人分离(diarization)、词级时间戳和自定义词汇偏置。将3.8 Live与3.5 Transcribe结合使用,可在同一流水线中处理语音口译(实时话语转换)和会议纪要(文本归档)。
"支持97种语言不仅仅是一个数字。这是一个信号,表明以往无法找到口译员的语言组合开始由软件处理了。"
4. Extended Thinking变体与后台任务处理
Gemini 3.8 Live Extended Thinking是扩展了3.8 Live推理能力的上位模型。 专为需要深度处理而非即时回答的场景设计——复杂数学问题、多阶段规划、代码错误分析。
| 项目 | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking |
|---|---|---|
| 主要优势 | 低延迟·可扩展性·成本效率 | 复杂多步骤推理 |
| 后台函数调用 | 默认异步 | 默认异步 |
| τ-Voice完成率 | — | 68.6% |
| Artificial Analysis | — | 82.6 |
两个模型都支持默认异步函数调用。用户说话时,模型调用API并在下一轮对话中反映结果,无需等待。实时天气查询、日程确认、数据库搜索都可以在语音对话流程中处理。
教育与商业场景应用
- 多语言混合课堂:用中文讲解的同时为越南语或蒙古语学生提供同声传译
- 国际会议即席口译:无需设备,仅用智能手机和耳机即可运营多语言会议
- 客户服务自动化:实时翻译语音问询并转接给本地语言工作人员
5. Suno v6:解决版权争议,从授权音乐出发
Suno于2026年9月9日发布v6。这是由v6、v6-wild和v6-mini三个模型组成的家族,取代所有之前的版本。最大的变化是训练数据——v6是在与Warner Music Group、BMG和Believe的版权许可协议基础上从头构建的模型。
Suno等AI音乐生成服务在2024至2025年间因未经授权使用训练数据被唱片公司集体起诉。Warner Music Group于2025年11月撤销诉讼,同意与Suno合作开发授权模型。v6是该协议的首个成果。
三个模型等级
| 模型 | 访问权限 | 主要功能 |
|---|---|---|
| v6-mini | 含免费用户 | 段落编辑·混搭·多模态提示 |
| v6 | Pro及以上 | v6-mini全部功能 + 高质量生成 |
| v6-wild | Pro及以上 | 不可预测的实验性输出 |
通过与Believe和TuneCore的发行合作,使用Suno"行业合作伙伴模型"制作的曲目可申请在Spotify、Apple Music、Amazon Music和YouTube上发行。AI生成音乐进入官方渠道发行的路径由此开启。
6. 段落编辑、混搭与多模态提示
v6功能变化中最值得关注的是编辑单位从"整首歌"缩小到了"单个段落"。
段落编辑(Section Editing)
以前在Suno中,如果某个段落不满意,就必须重新生成整首歌。v6的段落编辑功能可以用自然语言只修改特定部分。
- "把副歌改成福音合唱风格"
- "把第二段歌词里的'孤独'替换成'心动'"
- "去掉前奏的鼓,只用钢琴开始"
这些指令只重新生成对应段落,不影响歌曲的其余部分。
混搭与采样
v6正式支持在一个请求中组合多首歌曲元素的多源混搭。可以用文字指令将一首歌的人声与另一首歌的节奏结合。分离乐器或段落用作新节拍素材的采样功能也已支持。
多模态提示
v6不仅接受文字,还可以将音频、图像、视频用作提示。上传视频片段后,它会分析该场景的氛围和节拍来生成BGM。
"段落编辑是作曲家的最后阵地。如果非专业人士现在可以选择歌曲的某个特定部分进行修改,那么音乐制作的入门门槛可能会比编程还低。"
教育者与内容创作者活用提示
- 定制课堂BGM:一句"把前奏改得平静一些"就能把已生成的曲目调整成符合讲课氛围的背景音乐
- 视频编辑效率化:直接上传YouTube视频片段,自动为每个场景生成BGM
- 音乐欣赏教学:通过段落编辑实时生成同一首歌的不同流派版本进行对比聆听
7. 深入了解Opus 5.5:始终开启的思考、Preserved Thinking与Fast Mode
Opus 5.5于9月22日正式发布,并在同一天登陆GitHub Copilot(Pro+、Max、Business和Enterprise方案)。除了价格和Responsive模式,还有三项变化值得了解。
- 思考模式始终开启:在Opus 5.5中,Thinking是无法关闭的默认设置。面对复杂问题能给出更可靠的回答,但思考token同样计费,因此对于非常简单的查询,成本效率反而可能下降。
- Preserved Thinking:沿用了在Fable 5.1中首次引入的"反蒸馏"机制,阻止API用户通过篡改先前上下文来提取推理过程,并自动适用于2026年8月31日之后创建的API账号。模型还内置了EU AI Act要求的水印措施,并可搭配Zero Data Retention选项使用。
- Claude Code Fast Mode:在Claude Code中可使用Fast Mode,以最高2.5倍的速度运行Opus 5.5(此时价格为输入$8 / 输出$40,是标准价格的两倍)。结合Dynamic Workflows,用并行子智能体处理大型代码库的成本比以前更低。
Claude Code的同步变化
9月更新中,Claude Code改进了面向100万token模型的auto-compact:会话接近100万token上限时会自动压缩,大型代码库的工作不会中断。同时,可缓存的最短提示长度从1,024 token缩短至512 token,较短的重复请求也能享受缓存折扣。关于开启百万上下文时代的Opus 5本身,请参阅Claude Opus 5·Gemini Notebook·Notion Workers汇总文章。
8. Gemini 3.8 Flash与3.8 Flash Cyber:几乎每月更新的Flash
如果说3.8 Live负责语音,那么在文本与编程方面,Gemini 3.8 Flash于9月初登场。 继7月的3.6 Flash、8月的3.7 Flash之后,Google几乎每个月都在更新Flash系列。
- token效率:输出token比3.5 Flash减少17%
- 计算机操作:OSWorld-Verified达83%(此前为78.4%)
- 知识截止日期:从2025年1月大幅更新至2026年3月
- 价格:标准价为每百万token输入$1.50 / 输出$7.50,2026年底前输入推广价为$0.75
- 3.8 Flash Cyber:同时发布针对网络安全用途优化的版本
在大批量文档处理和自动化流水线中,它可以作为高价模型的高性价比替代;也可以与3.5 Transcribe、3.8 Live组合,把语音、文本和推理全部交给Google模型。
9. 深入了解Suno v6:训练数据与收益分成
v6不仅使用授权音源,还使用Suno用户数据从零开始重新训练。 核心在于收益分成模式:音乐被用作训练数据时,唱片公司也能获益,这把"AI偷走音乐"的叙事改写成了"AI与音乐产业一起赚钱"。
从教育科技的角度看,可及性更为重要。由于v6-mini免费提供,即使是从未接触过音乐制作工具的学生,也可以布置免费的作曲作业。追求实验性效果的创作者,则可以用v6-wild尝试突破类型边界。
10. 一览Notion 3.7:团队技能库与模型控制
同月9月15日发布的Notion 3.7,把AI从"一个人用的工具"提升为"团队的共同语言"。
- 技能库:像"按我们组长的反馈方式审阅文档"这样的重复指令只需创建一次,整个团队都能调用最新版本。
- AI Search提速50%:工作区搜索和智能体的上下文检索只需一半时间。
- 模型控制:由工作区所有者决定使用Claude Opus 5、GPT-5.6 Sol、Kimi K3等哪些最新模型。
- Effort设置:Personal Agent和Custom Agent都可以调节推理深度。
- 其他:开发者侧边栏(Worker连接状态与运行日志)、收件箱AI优先级排序,以及9月22日独立Notion Mail服务的终止。
关于Agent SDK和技能导出(SKILL.md)等更多内容,请参阅Claude Code·Notion 3.7·Suno v6汇总文章。
11. 三个更新指向的方向
将三条消息并排来看,可以看到一个共同的趋势。
第一,等待时间在缩短。 Claude Opus 5.5的Responsive模式在推理前输出第一句话,消除对话的空白停顿。Gemini 3.8 Live在用户说话时并行处理后台函数调用,信息检索与对话同步进行。Suno v6的段落编辑无需整体重新生成,立即修改对应段落。三个工具都朝着减少"等待结果的时间"的方向进化。
第二,专业人士的最后领地在持续缩小。 实时口译员、作曲·编曲家、大规模运行高性能AI模型的开发者——这三个领域的门槛同时降低了。
第三,AI生成内容的信任基础设施正在建立。 Claude的文字水印和Suno的版权许可协议,都是以"这是AI制作的"为前提进入制度框架的趋势。透明标注并应用AI生成内容成为竞争力的时代正在临近。
结语
Claude先说后想。Gemini将97种语言实时转换成声音。Suno走出法庭,与唱片公司握手言和。
三个更新都先问"要创造什么",而不是"怎么制作"。工具的摩擦减少了多少,设定方向和标准的能力就变得更加重要。
相关文章
这次的更新中,您最想先应用到工作或课堂中的是哪一个?欢迎在评论区告诉我们。
Sources
- Introducing Claude Opus 5.5 — Anthropic
- What's new in Claude Opus 5.5 — Claude Platform Docs
- How Claude's text watermarking works — Anthropic
- Claude Opus 5.5 is now available in GitHub Copilot — GitHub Changelog
- Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking — Google Blog
- Build real-time voice applications with Gemini 3.8 Live and 3.5 Transcribe — Google Blog
- Gemini 3.8 Live: Features, Benchmarks, Pricing, Access — DataCamp
- Suno | Introducing v6 — Suno Release Notes
- Suno Launches v6 AI Music Models with Industry Partnerships and New Editing Features — Soundstock
- Suno replaces its AI models with a new one trained on licensed music — TechCrunch
- Claude Opus 5.5 matches Fable 5.1 performance at lower cost — The Decoder
- Claude Code Updates by Anthropic - September 2026 — Releasebot
- Gemini 3.8 Flash and 3.8 Flash Cyber — Google Blog
- Suno v6 Launch — Axios
- AI Music Startup Suno Launches New Models That Pay Labels — Bloomberg
- September 15, 2026 – Notion 3.7: Agent skills for your whole team — Notion
- September 9, 2026 – Control which AI models your agents can use — Notion