← 收录原文
BUILDERS · 精选整理

Builders 精选|2026-09-02

2026-09-02 · 历史整理稿

X / 推特

Anthropic Claude Code 团队 Boris Cherny

Fable 5.1 的写作质量和语气均得到改善,团队正在根据反馈减少容易被辨认的“Claude 腔”。新版还降低了安全机制对正常请求的误拦截,其中生物领域的防护措施对无害请求的干预次数比 Fable 5 减少 85%。Claude Code 用户在每次会话中遇到的网络安全干预预计减少约 60%,后续还会继续优化。Enterprise、API 和 SDK 客户的使用价格也同步下调。Fable 5.1 的缓存读取价格从每百万 token 1 美元降至 0.25 美元。对典型 Claude Code 会话而言,综合成本最高可以降低 38%,说明本次升级同时围绕输出体验、安全边界和推理成本展开。

AI 教程与访谈创作者 Peter Yang

Peter Yang 不赞成安装大量来源随机的 AI skills,目前只保留约十几个,而且大部分由自己编写。他会定期删除不再使用的 skill,并尽量缩短每份指令,减少不必要的上下文负担。他也指出了一种常见维护陷阱:skill 首次执行不够准确,人工与 AI 迭代修正后,再让 AI 根据当前对话反向更新 skill。这样的修改很容易过度拟合单次案例,长期累积后会让 skill 偏离原始目标。针对 Fable 5.1,他推荐运行 `/claude-api prompt-audit` 检查现有 skills,找出适用于新模型的冗余规则和可删除内容。他正在对自己的全部 skills 执行这项审计,整体思路是让能力集合保持少而精,并把单次纠错与通用规则更新区分开。

OpenAI 产品团队候任成员 Nan Yu

Nan Yu 注意到,Fable 5.1 把“不那么令人厌烦的写作方式”列为主要升级之一。由此延伸出的产品判断是,降低 agent 的冒犯感、啰嗦感和交流摩擦,本身就可能带来尚未被充分利用的产品优势。用户必须持续留在交互流程中,才有机会真正获得模型提供的价值。如果对话体验不断让人产生挫败感,用户可能在任务完成前就直接退出。他认为 UX 设计师可以进一步转向“对话与修辞设计”,专门塑造 agent 如何表达、解释和推进任务。

Meta AI 高级总监 Madhu Guru

Madhu Guru 认为,企业建立自己的 post-training 系统、评测体系和数据飞轮,仍然存在巨大机会。他以接触过的 Shopify ML 团队为例,认为更多企业应当发展类似的内部能力,而不是只消费通用模型。“自我改进的产品”需要先明确 primary、secondary 和 guardrail 等不同层级的指标,避免 agent 只优化单一目标。企业还需要把战略、路线图以及最希望推动的指标清楚表达出来,让系统知道优化方向。过去的产品决策和原则应沉淀为知识库,使 agent 理解组织实际如何作出判断。agent 还要连接内部仪表盘、API、MCP 和其他工具,才能观察产品状态并采取行动。最后需要一套覆盖端到端产品开发流程的 harness,而复杂度较低的产品可以先从简化版本起步,并复用现有的软件工程 agent。

Anthropic Claude Code 与 Cowork 团队 Cat Wu

Cat Wu 表示,Fable 5.1 让团队开始承担过去可能需要数月才能完成的更大型项目。她将新版能力与“更大的押注”联系起来,重点不只是缩短已有任务,而是扩大团队愿意尝试的项目范围。用户可以在 Claude Code、Claude Cowork 和 Claude Tag 中直接交给 Fable 5.1 一项任务。这三个入口覆盖不同的工作方式,但素材没有进一步说明各自的功能差异。团队正在邀请用户提交实际使用反馈,以观察新版在更具野心的项目中能够承担什么工作。

Anthropic Claude Code 团队 Thariq

Thariq 在深入测试后对 Fable 5.1 给出了积极评价,并表示还会发布更长的分析。他建议,对于不需要大量验证、边缘情况较少的任务,可以优先尝试较低 effort 设置。这意味着并非所有任务都需要以最高推理投入运行,任务风险和验证需求应当决定 effort 等级。新版在切换 effort 时也不会再破坏 prompt cache。这个变化让用户更容易在同一工作流中动态调整推理强度,同时继续利用已有缓存。

Vercel CEO Guillermo Rauch

Vercel 将与 Tanner Linsley 团队合作,并继续支持 React、开源生态和 Web。对客户而言,无论选择 Next.js 还是 TanStack,Vercel 都承诺提供高质量服务与支持。Fable 5.1 也已经接入 Vercel AI Gateway,开发者可以通过统一入口调用该模型。Guillermo Rauch 还介绍了 Fluid 对 Vercel 基础设施的作用,包括提升 Build 性能、Sandbox 可靠性与大规模并发,并支持 30 分钟的 Function 执行时间。Fluid 通过共享 Dockerfile、安全边界、网络和文件系统,把不同计算产品统一起来。当前 Builds 与 Functions 已经可以加入同一个 Secure Compute 边界并共享配置。其长期方向是让 Sandbox 的出口防火墙等防止 agent 越界的能力,同样覆盖 Builds、Functions 和 Servers,形成一个全球统一的计算平台。

Anthropic 研究员 Alex Albert

Alex Albert 特别关注随 Fable 5.1 发布的 Enterprise Frontier Safeguards,也就是 EFS。随着企业向 agent 开放越来越多内部系统,仅有传统 zero data retention 无法识别跨会话积累的高风险行为模式。EFS 在保持企业数据留在自有云中的同时,增加自动监控层,由系统识别风险模式并向企业团队发出提示。他将其定义为面向 agent 的可观测性与风险缓解层,并判断这可能成为企业运行更强 AI 系统时的标准要求。在模型能力方面,他尤其喜欢使用 Fable 5.1 通过代码生成视频。他提供一张地产地块图片后,模型完成了房屋设计、渲染,并制作出电影感的游览视频。

Box CEO Aaron Levie

Aaron Levie 判断,AI 在网络安全领域即将进入垂直深化阶段,因为模型发现和利用漏洞的能力正在快速增强。前沿模型仍然领先,但 open weights 已经相距不远,而企业本就难以处理现有的大量安全发现。随着发现数量继续增长,使用更多 AI 完成分诊和修复自动化,并保留人工监督,几乎是唯一可行的方向。他还披露,Box 使用复杂企业工作评测测试 Fable 5.1,新版在非结构化数据任务上的总体成绩比 Fable 5 高出 7 个百分点。金融服务任务提升 17%,新版能够先应用资本减免再计算税务负担,避免错误一路传导至留存收益。技术类任务提升 37%,模型面对归一化定义模糊时会计算两种形式并给出正确结果,而不是过早选择错误解释。公共部门任务提升 16%,新版能够完成完整的加权平均计算并生成正确排名,Fable 5 则因一次错误分类引发后续连锁错误,Fable 5.1 也将很快进入 Box AI Studio,用于构建基于企业内容的定制 agent。

FPV Ventures 合伙人 Nikunj Kothari

Nikunj Kothari 认为 WebMCP 的价值仍被低估,它允许网站原生向 agent 提供 tool calls。agent 不仅能够操作网站,还能利用完整 UI、交互元素构建自己的视图。他提交的 WebMCP challenge 演示使用 El Niño 状况追踪器,展示 agent 如何生成视图并保留人类所做的编辑。生成结果还可以创建分享链接,供其他 agent 或人类继续使用。演示中的视频和代码由 Codex、ChatGPT 与 Railway 完成,并已提供在线版本供体验。

OpenAI Sam Altman

Sam Altman 表示,OpenAI 在夏季集中推进安全优先事项,目标是让模型能力与防护机制同步演进。下一款模型 Astra 即将发布,它已经完成训练一段时间,在能力和 alignment 上都有显著提升。与此同时,团队认为当前阶段需要保持谨慎,并为 Astra 之后的模型按需要放慢进度,以完成足够的安全与 alignment 工作。他坦言,AI 正变得极其强大,但没有人完全理解这种变化的后果。OpenAI 当前面对的核心张力,是既期待开发者使用新能力进行创造,又对能力进展可能带来的风险感到焦虑。他认为,让社会理解 AI 的前进方向以及模型在现实环境中的表现,是管理转型的必要条件。其主张不是让技术与社会割裂发展,而是建立社会和技术共同演进的迭代循环,以提高安全度过强大 AI 转型期的可能性。

Anthropic AI 助手 Claude

Claude Fable 5.1 已于当天在所有渠道开放。面向网络防御人员和生命科学家的 Claude Mythos 5.1,则通过受信任访问计划提供。Anthropic 同时推出 Enterprise Frontier Safeguards,为企业客户提供与 zero data retention 相同的完整隐私保障。EFS 也用于防止对模型的对抗性滥用,将隐私要求与风险识别放进同一套企业方案。该能力计划从今年秋季开始分阶段推出。

播客

Training Data — Making Cities Awesome: Peregrine’s Nick Noone & Ben Rudolph

核心要点:城市 AI 的关键并不是收集更多数据,而是在严格权限和治理之下,让公共机构更准确地使用自己已经拥有的信息。

Peregrine 的 Nick Noone 曾负责 Palantir 的 SOCOM 业务,并参与中东地区的高风险情报部署。Ben Rudolph 则放弃当时加入 Airbnb 的机会,进入 UN Refugee Agency,在苏丹和哥伦比亚边境参与难民工作,之后又在 Demagi 为印度农村地区开发结核病用药依从性应用。两条经历最终汇聚到同一判断:安全是城市运转的基础,但改善安全不能以建立监控国家为代价。

第一项关键方法是 forward deployed engineering。工程人员需要进入客户环境,在心理上共同承担问题,并一路负责到实际结果,而不是交付软件后离开。Nick 对速度的要求非常具体:“真正的答案,是不惜一切代价抵达结果,理想情况下比任何其他个人或团队快 3 到 5 倍。”但速度不能来自傲慢。面对 LAPD 这类拥有 30 年制度背景的复杂组织,工程师必须暂时放下自己的聪明和既有判断,理解决策方式、团队协作和人的处境,以耐心和同理心建立信任。

第二项判断是,公共安全技术不应依赖持续扩张的数据收集。Peregrine 不把新的外部数据卖给机构,而是连接其原有系统,让客户更安全、更精确地使用已有信息。每个机构拥有自己的数据,Peregrine 提供细粒度权限、数据治理和选择性共享能力。相比把资料装进汽车后备箱运过城市,这种受控数字化流程反而能够减少过度分享和信息误用。

第三项洞察是,AI 的价值远超“更好用的搜索”。Florida 一个县在单月发生超过 100 次水上救援,agent 综合事故记录、911 电话、天气与地形数据后发现,类似天气虽然以前出现过,却从未连续发生三天,而这种持续模式会形成沙质水道并制造离岸流。另一个案例中,侦探调查针对犹太教堂的威胁时,传统关键词很难覆盖表达差异,语义分析却识别出了多个相关威胁模式。

真正决定答案质量的工作大多发生在提问之前。Ben 估计,95% 的工作用于数据准备、系统连接、权限控制和引用准确性,而不是生成回答。部署团队由此还能快速制作高度本地化的工具,例如 hurricane simulator,或综合 911 响应时间与预算数据,估算在城市某处新建消防站能影响多少人。对 AI builders 的启示很直接:高风险领域的壁垒不是一个更漂亮的聊天框,而是可信数据、制度理解、现场交付和可审计治理共同构成的基础设施。