X / 推特
Anthropic Claude Code 团队 Boris Cherny
Fable 5.1 的写作质量和语气均得到改善,团队正在根据反馈减少容易被辨认的“Claude 腔”。新版还降低了安全机制对正常请求的误拦截,其中生物领域的防护措施对无害请求的干预次数比 Fable 5 减少 85%。Claude Code 用户在每次会话中遇到的网络安全干预预计减少约 60%,后续还会继续优化。Enterprise、API 和 SDK 客户的使用价格也同步下调。Fable 5.1 的缓存读取价格从每百万 token 1 美元降至 0.25 美元。对典型 Claude Code 会话而言,综合成本最高可以降低 38%,说明本次升级同时围绕输出体验、安全边界和推理成本展开。
https://x.com/bcherny/status/2094864064648536068
https://x.com/bcherny/status/2094864063478276288
https://x.com/bcherny/status/2094864062186426373
AI 教程与访谈创作者 Peter Yang
Peter Yang 不赞成安装大量来源随机的 AI skills,目前只保留约十几个,而且大部分由自己编写。他会定期删除不再使用的 skill,并尽量缩短每份指令,减少不必要的上下文负担。他也指出了一种常见维护陷阱:skill 首次执行不够准确,人工与 AI 迭代修正后,再让 AI 根据当前对话反向更新 skill。这样的修改很容易过度拟合单次案例,长期累积后会让 skill 偏离原始目标。针对 Fable 5.1,他推荐运行 `/claude-api prompt-audit` 检查现有 skills,找出适用于新模型的冗余规则和可删除内容。他正在对自己的全部 skills 执行这项审计,整体思路是让能力集合保持少而精,并把单次纠错与通用规则更新区分开。
https://x.com/petergyang/status/2094999358525821099
https://x.com/petergyang/status/2094995775952740795
https://x.com/petergyang/status/2094987791566622971
OpenAI 产品团队候任成员 Nan Yu
Nan Yu 注意到,Fable 5.1 把“不那么令人厌烦的写作方式”列为主要升级之一。由此延伸出的产品判断是,降低 agent 的冒犯感、啰嗦感和交流摩擦,本身就可能带来尚未被充分利用的产品优势。用户必须持续留在交互流程中,才有机会真正获得模型提供的价值。如果对话体验不断让人产生挫败感,用户可能在任务完成前就直接退出。他认为 UX 设计师可以进一步转向“对话与修辞设计”,专门塑造 agent 如何表达、解释和推进任务。
https://x.com/thenanyu/status/2094928209095872530
https://x.com/thenanyu/status/2094928205753040999
Meta AI 高级总监 Madhu Guru
Madhu Guru 认为,企业建立自己的 post-training 系统、评测体系和数据飞轮,仍然存在巨大机会。他以接触过的 Shopify ML 团队为例,认为更多企业应当发展类似的内部能力,而不是只消费通用模型。“自我改进的产品”需要先明确 primary、secondary 和 guardrail 等不同层级的指标,避免 agent 只优化单一目标。企业还需要把战略、路线图以及最希望推动的指标清楚表达出来,让系统知道优化方向。过去的产品决策和原则应沉淀为知识库,使 agent 理解组织实际如何作出判断。agent 还要连接内部仪表盘、API、MCP 和其他工具,才能观察产品状态并采取行动。最后需要一套覆盖端到端产品开发流程的 harness,而复杂度较低的产品可以先从简化版本起步,并复用现有的软件工程 agent。
https://x.com/realmadhuguru/status/2094973690576576675
https://x.com/realmadhuguru/status/2094817857821704659
Anthropic Claude Code 与 Cowork 团队 Cat Wu
Cat Wu 表示,Fable 5.1 让团队开始承担过去可能需要数月才能完成的更大型项目。她将新版能力与“更大的押注”联系起来,重点不只是缩短已有任务,而是扩大团队愿意尝试的项目范围。用户可以在 Claude Code、Claude Cowork 和 Claude Tag 中直接交给 Fable 5.1 一项任务。这三个入口覆盖不同的工作方式,但素材没有进一步说明各自的功能差异。团队正在邀请用户提交实际使用反馈,以观察新版在更具野心的项目中能够承担什么工作。
https://x.com/_catwu/status/2094933602228416603
Anthropic Claude Code 团队 Thariq
Thariq 在深入测试后对 Fable 5.1 给出了积极评价,并表示还会发布更长的分析。他建议,对于不需要大量验证、边缘情况较少的任务,可以优先尝试较低 effort 设置。这意味着并非所有任务都需要以最高推理投入运行,任务风险和验证需求应当决定 effort 等级。新版在切换 effort 时也不会再破坏 prompt cache。这个变化让用户更容易在同一工作流中动态调整推理强度,同时继续利用已有缓存。
https://x.com/trq212/status/2094945951865520458
Vercel CEO Guillermo Rauch
Vercel 将与 Tanner Linsley 团队合作,并继续支持 React、开源生态和 Web。对客户而言,无论选择 Next.js 还是 TanStack,Vercel 都承诺提供高质量服务与支持。Fable 5.1 也已经接入 Vercel AI Gateway,开发者可以通过统一入口调用该模型。Guillermo Rauch 还介绍了 Fluid 对 Vercel 基础设施的作用,包括提升 Build 性能、Sandbox 可靠性与大规模并发,并支持 30 分钟的 Function 执行时间。Fluid 通过共享 Dockerfile、安全边界、网络和文件系统,把不同计算产品统一起来。当前 Builds 与 Functions 已经可以加入同一个 Secure Compute 边界并共享配置。其长期方向是让 Sandbox 的出口防火墙等防止 agent 越界的能力,同样覆盖 Builds、Functions 和 Servers,形成一个全球统一的计算平台。
https://x.com/rauchg/status/2094901483414372716
https://x.com/rauchg/status/2094867652573528074
https://x.com/rauchg/status/2094831747037085978
Anthropic 研究员 Alex Albert
Alex Albert 特别关注随 Fable 5.1 发布的 Enterprise Frontier Safeguards,也就是 EFS。随着企业向 agent 开放越来越多内部系统,仅有传统 zero data retention 无法识别跨会话积累的高风险行为模式。EFS 在保持企业数据留在自有云中的同时,增加自动监控层,由系统识别风险模式并向企业团队发出提示。他将其定义为面向 agent 的可观测性与风险缓解层,并判断这可能成为企业运行更强 AI 系统时的标准要求。在模型能力方面,他尤其喜欢使用 Fable 5.1 通过代码生成视频。他提供一张地产地块图片后,模型完成了房屋设计、渲染,并制作出电影感的游览视频。
https://x.com/alexalbert__/status/2094889286990446769
https://x.com/alexalbert__/status/2094860187743986169
Box CEO Aaron Levie
Aaron Levie 判断,AI 在网络安全领域即将进入垂直深化阶段,因为模型发现和利用漏洞的能力正在快速增强。前沿模型仍然领先,但 open weights 已经相距不远,而企业本就难以处理现有的大量安全发现。随着发现数量继续增长,使用更多 AI 完成分诊和修复自动化,并保留人工监督,几乎是唯一可行的方向。他还披露,Box 使用复杂企业工作评测测试 Fable 5.1,新版在非结构化数据任务上的总体成绩比 Fable 5 高出 7 个百分点。金融服务任务提升 17%,新版能够先应用资本减免再计算税务负担,避免错误一路传导至留存收益。技术类任务提升 37%,模型面对归一化定义模糊时会计算两种形式并给出正确结果,而不是过早选择错误解释。公共部门任务提升 16%,新版能够完成完整的加权平均计算并生成正确排名,Fable 5 则因一次错误分类引发后续连锁错误,Fable 5.1 也将很快进入 Box AI Studio,用于构建基于企业内容的定制 agent。
https://x.com/levie/status/2095024699441119612
https://x.com/levie/status/2094851976769257770
FPV Ventures 合伙人 Nikunj Kothari
Nikunj Kothari 认为 WebMCP 的价值仍被低估,它允许网站原生向 agent 提供 tool calls。agent 不仅能够操作网站,还能利用完整 UI、交互元素构建自己的视图。他提交的 WebMCP challenge 演示使用 El Niño 状况追踪器,展示 agent 如何生成视图并保留人类所做的编辑。生成结果还可以创建分享链接,供其他 agent 或人类继续使用。演示中的视频和代码由 Codex、ChatGPT 与 Railway 完成,并已提供在线版本供体验。
https://x.com/nikunj/status/2094922789128196314
OpenAI Sam Altman
Sam Altman 表示,OpenAI 在夏季集中推进安全优先事项,目标是让模型能力与防护机制同步演进。下一款模型 Astra 即将发布,它已经完成训练一段时间,在能力和 alignment 上都有显著提升。与此同时,团队认为当前阶段需要保持谨慎,并为 Astra 之后的模型按需要放慢进度,以完成足够的安全与 alignment 工作。他坦言,AI 正变得极其强大,但没有人完全理解这种变化的后果。OpenAI 当前面对的核心张力,是既期待开发者使用新能力进行创造,又对能力进展可能带来的风险感到焦虑。他认为,让社会理解 AI 的前进方向以及模型在现实环境中的表现,是管理转型的必要条件。其主张不是让技术与社会割裂发展,而是建立社会和技术共同演进的迭代循环,以提高安全度过强大 AI 转型期的可能性。
https://x.com/sama/status/2094934592062959832
Anthropic AI 助手 Claude
Claude Fable 5.1 已于当天在所有渠道开放。面向网络防御人员和生命科学家的 Claude Mythos 5.1,则通过受信任访问计划提供。Anthropic 同时推出 Enterprise Frontier Safeguards,为企业客户提供与 zero data retention 相同的完整隐私保障。EFS 也用于防止对模型的对抗性滥用,将隐私要求与风险识别放进同一套企业方案。该能力计划从今年秋季开始分阶段推出。
https://x.com/claudeai/status/2094848592812917122
https://x.com/claudeai/status/2094848590245965931
播客
Training Data — Making Cities Awesome: Peregrine’s Nick Noone & Ben Rudolph
核心要点:城市 AI 的关键并不是收集更多数据,而是在严格权限和治理之下,让公共机构更准确地使用自己已经拥有的信息。
Peregrine 的 Nick Noone 曾负责 Palantir 的 SOCOM 业务,并参与中东地区的高风险情报部署。Ben Rudolph 则放弃当时加入 Airbnb 的机会,进入 UN Refugee Agency,在苏丹和哥伦比亚边境参与难民工作,之后又在 Demagi 为印度农村地区开发结核病用药依从性应用。两条经历最终汇聚到同一判断:安全是城市运转的基础,但改善安全不能以建立监控国家为代价。
第一项关键方法是 forward deployed engineering。工程人员需要进入客户环境,在心理上共同承担问题,并一路负责到实际结果,而不是交付软件后离开。Nick 对速度的要求非常具体:“真正的答案,是不惜一切代价抵达结果,理想情况下比任何其他个人或团队快 3 到 5 倍。”但速度不能来自傲慢。面对 LAPD 这类拥有 30 年制度背景的复杂组织,工程师必须暂时放下自己的聪明和既有判断,理解决策方式、团队协作和人的处境,以耐心和同理心建立信任。
第二项判断是,公共安全技术不应依赖持续扩张的数据收集。Peregrine 不把新的外部数据卖给机构,而是连接其原有系统,让客户更安全、更精确地使用已有信息。每个机构拥有自己的数据,Peregrine 提供细粒度权限、数据治理和选择性共享能力。相比把资料装进汽车后备箱运过城市,这种受控数字化流程反而能够减少过度分享和信息误用。
第三项洞察是,AI 的价值远超“更好用的搜索”。Florida 一个县在单月发生超过 100 次水上救援,agent 综合事故记录、911 电话、天气与地形数据后发现,类似天气虽然以前出现过,却从未连续发生三天,而这种持续模式会形成沙质水道并制造离岸流。另一个案例中,侦探调查针对犹太教堂的威胁时,传统关键词很难覆盖表达差异,语义分析却识别出了多个相关威胁模式。
真正决定答案质量的工作大多发生在提问之前。Ben 估计,95% 的工作用于数据准备、系统连接、权限控制和引用准确性,而不是生成回答。部署团队由此还能快速制作高度本地化的工具,例如 hurricane simulator,或综合 911 响应时间与预算数据,估算在城市某处新建消防站能影响多少人。对 AI builders 的启示很直接:高风险领域的壁垒不是一个更漂亮的聊天框,而是可信数据、制度理解、现场交付和可审计治理共同构成的基础设施。
https://www.youtube.com/playlist?list=PLOhHNjZItNnMm5tdW61JpnyxeYH5NDDx8