minssam.
Published on

为文字打上指纹、用对话编辑音乐、转录85种语言:2026年9月AI摘要

AI工具的更新节奏开始与季节同步。

进入2026年9月,三家公司几乎同时发布了重要版本。Anthropic将Claude Fable 5.1指定为Claude Code的正式默认模型。Suno以v6之名一次性发布三款模型,公开了用对话方式修改已完成歌曲的功能。Google在8月相继推出了面向编程智能体的Gemini 3.7 Flash和专用语音识别模型Gemini 3.5 Transcribe。

三次更新的共同主题:降低成本与专业工具的大众化


目录

  1. Claude Fable 5.1:更便宜、更安全,还为文字加上指纹
  2. Fable 5.1值得关注的三个原因
  3. Suno v6:用对话编辑音乐的新时代
  4. v6带来的三大变化
  5. Gemini 3.7 Flash + 3.5 Transcribe:编程与语音的成本创新
  6. 深入了解Fable 5.1:双胞胎模型Mythos 5.1与更新后的规格
  7. Claude Code的8~9月:/design技能与Auto模式默认化
  8. Gemini Notebook(原NotebookLM):代码执行、笔记本复制与搜索整合
  9. 深入了解Suno v6:收益分成、仍在进行的诉讼与新的输入方式
  10. 深入了解Gemini:3.7 Flash的上线范围、3.5 Transcribe的智能转写与Gemini Live智能体
  11. 三次更新所指向的方向

1. Claude Fable 5.1:更便宜、更安全,还为文字加上指纹

Anthropic于2026年9月1日发布Claude Fable 5.1,并从Claude Code 2.1.257版本起将其设为默认模型。

Pro、Max、Team和Enterprise方案的Claude Code用户无需任何配置,即可自动切换到Fable 5.1。这款比Fable 5更强大、成本更低的模型在三个方面值得重点关注。

基准测试:超越上一代

Fable 5.1在多项编程评估指标上超越Fable 5、Opus 5和OpenAI GPT-5.6 Sol。官方公布数据:

  • Terminal-Bench-Science 0.1:52.6%
  • Terminal-Bench 4.0:55.8%
  • CursorBench 3.2(最大努力设置):73.4%

比数字更重要的是,Fable 5.1在智能体编程和计算机操作评估上超越了Opus 5。


2. Fable 5.1值得关注的三个原因

原因一:缓存读取费用降低75%

Fable 5.1最直观的变化是缓存读取价格从每百万token 1美元降至0.25美元

在持续引用对话上下文的Claude Code等工具中,缓存读取占总成本的很大比例。Anthropic表示,典型工作负载可节省约25%,智能体工作比例越高最多可节省45%。越频繁使用智能体,折扣越大。

原因二:安全误报率降低60%

Fable 5.1将网络安全领域的误报警告相比上一个模型降低了约60%。

在代码审查和漏洞检测中,模型将安全代码错误标记为危险的情况大幅减少。对开发团队而言,这意味着追查无效警告的时间显著减少。

Anthropic明确表示,Fable 5.1可用于发现软件漏洞,但不能用于开发漏洞利用程序。

原因三:AI生成文本水印

从Fable 5.1开始,Claude生成的文本中会嵌入肉眼不可见的水印。

水印不影响文本内容或可读性。Anthropic已开始向特定合作伙伴提供私有预览版的水印检测API。这一功能在需要验证内容是否由AI生成的媒体、教育和法律领域尤为值得关注。

使用技巧

  • Claude Code用户请立即运行claude --version,确认版本为2.1.257或更高——Fable 5.1已经在运行了。
  • 处理大型代码库的团队智能体工作负载越多,成本节省越明显。重构、自动测试生成等多步骤任务中缓存优势最大化。
  • 教育工作者应关注水印API正式公开的时机——系统验证学生作业中AI参与程度的工具即将到来。

3. Suno v6:用对话编辑音乐的新时代

Suno于2026年9月9日发布v6模型家族,这是其首次在单次发布中同时推出三款模型:v6、v6-wild和v6-mini。

v6取代了此前的所有模型,将整个平台转移至新世代。Warner Music、BMG和Believe作为音乐行业合作伙伴加入。Universal Music和Sony Music仍处于诉讼阶段。

三款模型的定位

模型可用方案特点
v6Pro及以上平衡的音质与可控性
v6-wildPro及以上不可预测的实验性音效
v6-mini包含免费方案的所有方案快速生成,适合创意验证

免费方案用户也能通过v6-mini体验新一代模型,这一点值得关注。


4. v6带来的三大变化

变化一:用日常语言编辑已完成的歌曲

v6最大的变化是可以用自然语言提示修改已完成的音乐。

此前在Suno修改歌曲,需要用新提示从头重新生成,或通过Stem Separation分离音轨后进行编辑。现在可以直接输入"降低第二段副歌的钢琴音量"或"把桥段改得更抒情一些"这样的指令。音乐创作从提示词工程转向了对话式编辑

变化二:多源混音与多模态提示

v6支持多源混音——同时参考多个来源生成新音乐。

以前只能选择一个参考音轨或文本提示。现在可以同时输入两首歌的节奏型和第三首歌的人声音色来生成新音乐。提示输入方式也从文本扩展到了音频、图像和视频。

变化三:与音乐行业的正式合作

与Warner Music、BMG和Believe的许可协议是AI音乐生成工具在法律框架内与音乐行业共存的首个大规模案例。

艺术家和词曲作者可以选择性地(opt-in)允许将自己的音乐目录用于Suno的训练。版税补偿模式的具体运作方式尚未公开,但从对抗关系转向合作关系的象征意义重大。

使用技巧

  • 教育工作者:将v6的自然语言编辑作为听觉词汇扩展工具——让学生用语言描述他们想要的音乐变化。
  • 内容创作者:在后期制作阶段尝试同步调整BGM——"把这段场景的背景音乐调整得更有张力"是可行的新工作流。
  • v6-mini:免费验证创意的好工具。确定方向后升级到Pro,用v6提升质量。

5. Gemini 3.7 Flash + 3.5 Transcribe:编程与语音的成本创新

Google在8月相继推出两款专用模型——一款面向编程和智能体工作流,一款面向语音识别。

Gemini 3.7 Flash:专为编程智能体,价格减半

Gemini 3.7 Flash以Gemini 3.6 Flash一半的价格提供,专注于编程、软件工程和Web开发。

以前的Flash模型是通用低成本选项,而3.7 Flash从一开始就为编程智能体工作流设计。构建与Claude Code或Cursor竞争的AI编程平台的开发者,将直接关注其性价比。

Gemini 3.5 Transcribe:以词为单位转录85种以上语言

Gemini 3.5 Transcribe是专注语音识别的专用模型。 主要规格:

功能详情
支持语言85种以上
语言自动检测基于发话单元(utterance-based)检测
说话人识别支持
时间戳词级提供
自定义词汇最多可注册1,000个术语

基于发话单元的语言检测意味着,当一个会议中多名参与者使用不同语言发言时,每段发言都会被自动识别并分别处理。结合说话人识别功能,可以清晰分离并转录"说话人A用韩语说的内容、说话人B用英语说的内容"。

使用技巧

  • 多语言讲座录音:讲师在英语和中文之间切换讲课时,基于发话单元的语言检测会自动识别切换点。
  • 全球团队会议记录:说话人识别+时间戳=自动生成"谁在何时说了什么"的结构化文本。
  • 自定义词汇注册:为医疗、法律、技术领域注册最多1,000个专业术语以提高识别准确率。

6. 深入了解Fable 5.1:双胞胎模型Mythos 5.1与更新后的规格

9月1日,Anthropic在发布Fable 5.1的同时推出了Claude Mythos 5.1。两者是同一个基础模型,区别只在于"谁可以使用、在何种安全措施下使用"。

Fable 5.1是适用标准安全政策的公开版本。Mythos 5.1放宽了部分安全措施,仅通过**可信访问计划(trusted access)**提供给经过验证的网络安全组织、生命科学机构等参与者。它面向漏洞研究、临床数据处理等通用模型会拒绝的合法专业工作,同时还推出了面向生命科学研究者的Life Sciences Verification Program。

用数字看其他变化

项目Fable 5Fable 5.1
最大输出64K token128K token
100万token上下文计费长区间加价全区间标准价格
自适应思考可选始终开启(low·medium·high·xhigh·max)
Terminal-Bench-Science 0.124.7%52.6%(Opus 5为29.0%)
知识截止日期2025年12月2026年6月

Effort默认值在Claude Code中为high,在Claude.ai和Cowork中为medium。无需开启新会话即可在对话中途调整工作强度,模型也经过调校以避免降低质量的捷径。批处理价格的输入和输出均减半,面向Enterprise客户的零数据保留选项也已恢复。

缓存降价实际能省多少

对于每天引用10万token系统提示1,000次的智能体,缓存读取成本将从每天$100降至$25,一年约从$36,500降至$9,125。初创公司和独立开发者尝试智能体的门槛也随之降低。

Microsoft 365连接器新增写入工具

同一时期,Claude的Microsoft 365连接器从只读扩展为可读写。Claude现在可以直接起草并发送邮件、创建和修改日历日程,以及在OneDrive和SharePoint中创建和更新文档。"帮我安排下周的团队会议"这类请求,最终会变成真正的日历日程,而不是一段文字草稿。


7. Claude Code的8~9月:/design技能与Auto模式默认化

如果说Fable 5.1更换了模型,那么Claude Code本身也在同一时期大幅调整了工作流程。

  • /design技能:根据一段想法描述或一张截图,将多画板视觉设计以Artifact形式发布。这是一个可编辑的画布,可以点击元素调整属性,并直接在线编辑文字。
  • Auto模式默认化(8月14日起):自动应用于Pro、Max和Team方案的新会话,可用自然语言编写允许/拒绝规则,例如"npm命令始终允许""git push始终确认"。
  • Concise输出风格:先给结果,必要时才解释。
  • 其他变化:超出用量上限后会话自动继续、插件评估工具与/output-style命令、基于文件的子智能体提示。

关键在于:过去在Figma中做方案再交给开发者的流程,如今可以在终端内完成"设计→实现→部署"的闭环。


8. Gemini Notebook(原NotebookLM):代码执行、笔记本复制与搜索整合

Google的研究笔记本在7月至9月间也接连经历了低调却重要的变化。

  • 代码执行(7月16日起):NotebookLM更名为Gemini Notebook的同时,每个笔记本都内置了安全的云端计算机。该功能此前仅限AI Ultra和Workspace商业客户,现已扩展到AI Pro订阅用户。上传20篇论文PDF、用Python分析引用频率,都可以在笔记本内完成。
  • 笔记本复制(8月17日):不仅复制来源,音频与视频概览、学习指南、抽认卡、测验和幻灯片等Studio成果也会一并复制。适合复制上学期的课程笔记本改为新学期版本,或为团队成员提供相同的起点。
  • 整合进搜索AI模式(8月19日起):在Google搜索的AI模式中可直接引用自己的笔记本,公开网络信息与自己整理的资料合并成一个回答。目前以英语在180多个国家和地区逐步推出,EEA除外。
  • 整合Gemini 3.5(9月):会展示推理路径——依据哪个来源的哪一部分做出判断,并可自行设置Audio Overview的长度、重点和复杂度。还新增了可在收听途中说"我有问题"来插话的互动模式,以及10种信息图风格。

9. 深入了解Suno v6:收益分成、仍在进行的诉讼与新的输入方式

v6的授权合作只是第一个谈判案例,并不意味着所有纠纷都已结束。

从v6开始,Suno会将部分生成收益支付给Warner Music Group、BMG和Believe,再由唱片公司分配给艺人和词曲作者。同时推出的艺人自愿加入计划允许将参与艺人的风格用于混搭,并将部分收益返还给他们。v6发布的同时,v5、v4等所有旧模型均已停止服务;所有生成内容都带有与Audible Magic、Musixmatch共同打造的水印和指纹,即使经过剪辑或压缩也能保留。

尚未达成和解的仍有不少:

  • Universal Music Group与Sony Music:波士顿法院的诉讼仍在进行
  • GEMA(德国):2026年7月31日在慕尼黑法院胜诉
  • SOCAN(加拿大):2026年9月2日提起诉讼
  • Round Hill Music:索赔最高10亿美元
  • 音乐人Jason Isbell:2026年9月1日提起个人诉讼

输入方式也更加丰富。除了照片和视频,只用日记式的文字或"80年代夏日海边兜风"这样的**氛围(vibe)**描述就能生成歌曲,还可以只选中歌词中的某个词来重新生成该部分。


10. 深入了解Gemini:3.7 Flash的上线范围、3.5 Transcribe的智能转写与Gemini Live智能体

Gemini 3.7 Flash:基准测试与上线范围

基准测试Gemini 3.5 FlashGemini 3.7 Flash
FrontierCode 1.1 Main34.4%43.6%
DeepSWE v1.149.0%65.3%

可在160多个国家和地区通过AI Studio、Gemini API、Android Studio、Gemini Enterprise智能体平台、智能体优先的编程IDE Google Antigravity、Gemini CLI,以及面向AI Pro和Ultra订阅用户的Gemini Spark同时使用。价格在2026年12月31日前为每百万token输入$0.75 / 输出$3.75,2027年起为$1.50 / $7.50。

Gemini 3.5 Transcribe:从听写到"理解式转写"

8月26日发布的3.5 Transcribe支持智能转写,可自动去除"呃""嗯"等填充词并整理句子。开发者现在即可通过Gemini API和Google Cloud使用;面向普通用户,它率先搭载于Gboard的Rambler功能,之后也将逐步引入Chrome。

Gemini Live:用声音清理收件箱

Gemini Live已从语音对话扩展为智能体,四大核心是Spark任务自动化、Daily Brief语音简报、免手动Gmail管理以及Personal Intelligence(记住已连接Google应用记录的个性化回答)。开车时说一句"回复上周经理的邮件",它就会先起草回复,再请你确认。


11. 三次更新所指向的方向

第一,专业工具的准入成本持续降低。 Fable 5.1缓存价格75%降幅、Gemini 3.7 Flash半价、Suno v6-mini免费提供,三者同时发生。更高性能、更低价格的趋势在这一轮周期中再次重复。

第二,AI生成物的责任追溯基础设施开始建立。 Fable 5.1的文本水印和Suno的音乐行业合作伙伴关系,都是试图让AI生成的成果可追溯的尝试。这一趋势对媒体、教育和法律领域预示着重大变化。

第三,多模态输入输出正在成为标准。 Suno v6接受图像、音频和视频作为音乐生成提示。Gemini 3.5 Transcribe处理多语言混杂的语音。工具正在从单一格式的输入输出,向更接近人类实际沟通方式的方向演进。


结语

Claude Fable 5.1重塑了编程智能体的成本结构,并为生成的文本嵌入了可追溯的指纹。Suno v6将音乐创作的范式从从头创作转向了与已有音乐的对话。Gemini 3.7 Flash和Gemini 3.5 Transcribe在降低编程和语音领域准入成本的同时提升了精度。

共同点只有一个:工具变得更便宜、更自然、更负责任。


Sources

为文字打上指纹、用对话编辑音乐、转录85种语言:2026年9月AI摘要 | MINSSAM.COM