← 收录原文
BUILDERS · 精选整理

Builders 精选|2026-09-24

2026-09-24 · 历史整理稿

X / 推特

Swyx

Swyx 表示,他将 5.5 Opus 与 6 Sol 并行用于 Latent Space 的 AINews,观察到明显的输出差异。他更认可 5.5 Opus 的报道风格,认为内容更简洁,编辑取舍也更有品味。与 5 Opus 相比,他认为新模型进一步减少了空泛、模板化的 AI 腔。这次比较围绕 AINews 的实际工作流展开,评价重点是报道质量与表达方式。他已决定将 5.5 Opus 设为 AINews 后续使用的默认模型。

Anthropic Claude Code 团队成员 Boris Cherny

Boris Cherny 详细解释了 Claude 如何借助类似形式化方法的流程寻找代码缺陷。第一步是针对程序中复杂的状态机或容易出现竞态的部分建立模型,随后在模型中寻找反例,将其视为潜在 bug。Claude 接着尝试复现这些问题,再修复实际代码。他强调,这不代表整个代码库已经完成形式化验证,而是对最棘手的局部进行建模、检查和修复。另一条推文则介绍了最近几周网页端与 Desktop 应用提速背后的工程工作。他推荐工程师阅读相关博客中的具体技术与经验,用于改进自己的应用性能。

OpenAI Codex 与 ChatGPT 团队成员 Thibault Sottiaux

Thibault Sottiaux 预告,下周二的 DevDay 将展示一些有趣的新内容,以及他认为能改变工作方式的功能。他将近期开发称为团队最有雄心的一轮冲刺,并表示 Astra 让团队能在很短时间内实现新的能力。另一条推文介绍了他使用 ChatGPT 语音的日常工作方式。他已经习惯直接与 ChatGPT 通话,讨论工作、检查邮件、处理部分编程任务和管理日历。据他描述,这种语音交互能够调用整个插件生态,也包括第三方开发的插件。两条内容共同指向的是 ChatGPT 在实际工作中的交互方式与工具覆盖范围。

AI 教程与访谈作者 Peter Yang

Peter Yang 认为,模型能力足够强之后,Claude Code 的运行框架也需要配套更好的交互与执行能力。他具体提出了高质量的实时语音,以及浏览器和计算机操作能力。对于后两项,他补充说目前已经在改善。他用“一家实验室拥有最好的模型,另一家拥有最好的运行框架”概括自己的判断,但没有在文字中明确列出两家实验室的名称。这条观点把模型质量与产品框架分开评价,也明确指出了他希望 Claude Code 继续补齐的功能。

Meta AI 高级总监 Madhu Guru

Madhu Guru 不认同把消费者对“做事情”的态度视为单一偏好的判断,并以自己在 Google 和 Meta 构建消费及中小企业产品的经历作为背景。他指出,对一些人而言,浏览衣服本身就是娱乐,但寻找屋顶维修工对大多数人而言是令人头疼的事务。即使同样是购物,用户有时愿意逛一个小时,有时只想让合适的商品尽快送到。他列举了雇用屋顶维修工的繁琐流程,包括搜索、阅读 10 条评价、反复电话沟通、协调保险、安排检查、获取报价和排查隐藏费用。对于这类任务,更好的体验可能意味着几乎不需要用户投入精力;对于另一些任务,则意味着比较更多选项、享受过程并做出知情决定。他以早年消费者质疑网上买衣服和购买 $500 电视的态度作类比,强调技术会不断改变人们完成任务的方式。他的结论是,能够替消费者消除这些阻力的 agent 存在巨大的潜在需求。

Anthropic Claude Code 团队成员 Thariq

Thariq 调侃了“Claude 一次就做出来了”这类展示帖背后容易被忽略的准备工作。他举出的情形是,实际输入包含 10k 字符的提示词,以及精心组织的思路、skills、示例和 API keys。这条评论提醒读者,一次生成的结果与事先投入了多少上下文密切相关。他同时介绍了一种正在尝试的新文章形式,深入分享团队如何使用具体提示词和技巧完成工作。这类内容的目标是让读者能够复现方法,而不只是看到最终成果。他也邀请读者反馈这些细节是否有用,以便继续调整分享方式。

Vercel CEO Guillermo Rauch

Guillermo Rauch 分享了对 Shell 启动速度的优化实践,称 Opus 5.5 找到了其他模型遗漏的改进,并建议用户让 agent 检查 `.zshrc` 等配置。他随后将成功的 agent 拆成三个部分:负责推理与调度的模型和运行框架,负责操作的工具、浏览器与计算机,以及承载记忆、skills 和代码仓库的文件。在一台持续运行的 Mac Mini 中放入全部组件很直接,但要在云端控制成本,就需要将这些部分解耦。他列举了 Fluid compute 承载运行框架、Workflow 持久化事件日志,以及 Browserbase、Kernel、Sandbox 和 just-bash 承担不同执行任务的组合。此次介绍的 Drives 则补上独立存储能力,可以作为按需挂载到 Sandbox 的“外接磁盘”。例如,夜间进行记忆整理时,可以直接读写文件,无须启动 agent 的整台计算机。他表示 Drives 仍处于早期阶段,并认为组件拆分不仅能降低成本,也能显著改善安全性与可审计性。

Box CEO Aaron Levie

Aaron Levie 赞同一种关于 AI 与影视创作的判断:当门槛和成本下降,电影数量会增加,制片厂也能承担更多创作风险。他转引的观点还认为,更多人将获得参与机会,并催生新的叙事形式。相关论述以动画从曾经的细分领域发展为广受欢迎的叙事形式,以及 Steven Spielberg、James Cameron 和 Peter Jackson 使用新视觉工具为例。Levie 据此强调,技术长期以来反复重塑创意产业,并带来更多机会或新的创作方法。在他看来,即使技术和媒介发生变化,创作能力与审美仍然不可替代。新工具的作用,是让更多人能够有效运用这些能力,并探索新的讲故事方式。

曾参与 Cursor、Notion 与 Stripe 设计的 Ryo Lu

Ryo Lu 质疑 AI 行业对效率、生产力与速度的持续崇拜,认为更快交付、更多合并和管理更多 agent,并不能回答产出本身是否值得存在。他担心人们不断压缩工作循环,却失去深入思考、辨认真实意图和寻找目的的时间。在他看来,AI 原本可以成为创作工具、世界、诗歌、游戏、界面和电影的新画布,但大量应用正在走向低质内容、营销漏斗和看似忙碌的无效工作。他用合并 2000 个 PR、管理 500 个 agent,却每天只睡 5 小时的对比,追问这种生产方式究竟服务于谁。他提出的反直觉警告是,AI 的危险可能不是让人懒惰,而是在意图与审美尚未形成之前,就让人获得无限执行能力并永远忙碌。他因此把辨别力视为更值得追求的方向,包括知道什么不该做,以及什么时候应该停下来。其核心主张是,工具应当为人腾出更多生活、想象与自由,而非把生活变成生产系统的一部分。

Y Combinator 总裁兼 CEO Garry Tan

Garry Tan 将创业公司获取客户的变化概括为两个同时发生的趋势。第一个是,做出 agent 想要使用的软件。在这一表述中,agent 本身成为产品需要考虑的使用对象。第二个是,利用 agent 让人们想要使用软件,关注点仍然是人的需求与选择。他将两者并列,分别指出了面向 agent 构建产品,以及借助 agent 获取人类客户这两个方向。

Every CEO Dan Shipper

Dan Shipper 宣布,Every 将通过一场线下聚会检验 AI agent 能否做好活动策划。他表示,Every 的 agent 已经规划了 9 月聚会,覆盖食品、饮品菜单和宾客名单。活动地点是 Every 位于 Brooklyn 的褐石住宅,推文给出的时间为“明天下午 6 点”。他邀请参与者到场,为 agent 的策划效果打分。这个实验把 agent 的规划能力放进真实活动中检验,素材尚未提供活动结果或参与者评价。

SPC 普通合伙人、Bevel Health 联合创始人 Aditya Agarwal

Aditya Agarwal 认为,评估团队时,成员共同工作的时间比单纯的人数更值得关注。他指出,已经合作 3 年以上的团队,相比刚组建的团队,往往拥有明显更高的产出能力和更强的韧性。他将员工流动较低视为值得观察的信号,也认为个人职业经历中的频繁变动能够提供信息。他批评投资人和求职者常常只问团队规模,却忽略团队已经共同工作了多久。他用“团队的 AUC 才是正确指标”概括这一观点,强调团队规模之外还应考虑时间积累。

Anthropic AI 助手 Claude

Claude 官方账号介绍了 Claude Marketplace,用户可以在其中发现工具、agent 和专业服务伙伴。市场中的一类内容是 Slack、Notion 等连接器与插件,用于扩展 Claude 可连接的工作工具。另一类是来自 Cursor、CrowdStrike 等公司的 agent 和产品,用户可以通过市场购买。企业还可以寻找 Accenture、Deloitte 等服务伙伴,支持更大范围的应用。官方同时邀请为 Claude 构建产品的开发者提交自己的工具、agent 或服务,将 Marketplace 同时作为发现与上架入口。

官方博客

Anthropic:如何限制 Claude 在不同产品中的访问与影响范围

Anthropic 将 agent 部署风险分为两个维度:发生故障的概率,以及一次故障可能造成的损害范围。随着模型能力与访问权限扩大,即使错误概率下降,潜在损害仍可能增加,因此工程上的关键问题是为 agent 的影响范围设置硬边界。

文章解释了为什么逐次人工审批不足以承担这一任务:遥测数据显示,用户批准了约 93% 的权限请求,频繁审批会削弱注意力。Claude Code auto mode 通过自动处理更安全的审批来缓解疲劳,但概率性防御仍然存在漏判。文章给出的数据是,auto mode 能在执行前拦截约 83% 的过度主动行为;在 Gray Swan 的 Agent Red Teaming 基准中,Claude Opus 4.7 面对单次提示注入尝试时,攻击成功率约为 0.1%,面对 100 次自适应尝试时则约为 5–6%。

Anthropic 因此强调环境隔离,包括进程沙箱、虚拟机、文件系统边界和出站网络控制。文章区分了用户滥用、模型自行采取有害行动、外部攻击者三个风险来源,并分别从执行环境、模型防御和外部内容三个层面设置保护。一个具体原则是,让凭证从一开始就不进入沙箱,避免安全性依赖模型是否会遵守要求。文章还提醒,连接器通过审计不代表其读取的数据可信,例如 GitHub 连接器仍可能将带有攻击内容的 README 放入模型上下文。

Anthropic:复盘 Claude Code 质量下降报告背后的三项变更

这篇围绕 4 月问题的复盘将用户感知到的质量下降追溯到三项独立变更,涉及 Claude Code、Claude Agent SDK 和 Claude Cowork,API 未受影响。文章称,三个问题均已在 4 月 20 日的 v2.1.116 中解决,不能将这些历史修复误读为 9 月新发生的事件。

第一项变更发生在 3 月 4 日,Claude Code 将默认推理强度从 high 调为 medium,以降低部分用户遇到的长延迟。用户反馈更希望默认获得较高智能水平,再自行对简单任务降低强度,因此团队在 4 月 7 日撤销了这一调整。第二项变更发生在 3 月 26 日,原计划仅在会话闲置超过一小时后清理一次旧推理记录,却因 bug 在此后每轮持续清理,造成遗忘、重复和异常工具选择;该问题于 4 月 10 日修复。

第三项变更发生在 4 月 16 日,一条减少冗长输出的系统提示与其他提示改动叠加,损害了编码质量,并于 4 月 20 日撤销。三项变更影响的流量与时间不同,使整体表现看起来像广泛且不稳定的退化,内部使用与评测最初也未能复现问题。复盘说明,用户体验不仅取决于模型本身,默认推理参数、历史上下文处理和系统提示同样会直接影响编码结果。

Anthropic:通过拆分推理、执行与会话记录扩展 Managed Agents

Anthropic 介绍了 Claude Managed Agents 的架构设计:将 session 定义为只追加的事件日志,将 harness 定义为调用 Claude 并分发工具请求的运行循环,将 sandbox 定义为执行代码和编辑文件的环境。三者通过独立接口连接,使底层实现能够替换,而不必同步改动整个系统。

最初,团队把这些组件都放在同一个容器中,虽然文件操作直接、系统边界简单,却让容器变成难以丢失或替换的单点。容器故障可能导致会话丢失,运行框架错误、事件流丢包和容器离线也容易呈现相似症状。容器内同时持有用户数据,又让直接进入环境排查问题变得困难;客户希望连接自己的私有网络时,这种耦合还带来了额外部署限制。

拆分之后,运行框架通过工具接口调用执行容器,容器故障可以作为工具错误交给 Claude 处理,并按标准配置重新创建。运行框架本身也可以在崩溃后重启,从外部持久化的会话日志恢复工作。安全上的关键变化是,让 Claude 生成的非可信代码无法接触运行所需的敏感凭证,例如把自定义工具的 OAuth token 保存在沙箱外的安全保管库中。

文章还强调,运行框架中用于弥补旧模型弱点的逻辑需要持续复查。例如,团队曾用上下文重置应对 Sonnet 4.5 接近上下文上限时过早结束任务的行为,但相同问题在 Opus 4.5 上已消失,原有补丁也随之失去作用。Managed Agents 的设计目标,就是保持接口稳定,同时允许模型、运行框架与执行基础设施各自演进。