← 收录原文
BUILDERS · 精选整理

Builders 精选|2026-09-22

2026-09-22 · 历史整理稿

X / 推特

AI 教程与访谈创作者 Peter Yang

Peter Yang 提出,依赖向人类展示定向广告的商业模式,可能会受到 agent 浏览网页方式的冲击。当 agent 直接访问网站并完成任务,用户可能根本不会看到广告,这让广告曝光与任务完成之间的关系发生变化。他还分享了 ChatGPT Finances 产品负责人 Ethan 的经历:用积分预订酒店后仍被扣款,ChatGPT 发现了这笔费用,并与客服交涉,最终帮助他获得退款。Peter 自己也曾让 ChatGPT 取消父母的酒店预订、监控回复,并持续跟进退款。这两个案例展示的用途都超出了回答财务问题,涉及发现问题、处理沟通和跟踪结果。他同时表示,自己如今主要待在与 agent 的聊天界面里,而不是邮件或短信里。三条内容共同指向一个变化:agent 正在成为他处理信息和委托任务的入口,并可能改变现有网站获取用户注意力的方式。

Vercel CEO Guillermo Rauch

Guillermo Rauch 宣布,开发者现在可以在 AI Gateway 中通过 HTTP 使用 Jev。他同时提到了已有的、具备类型安全能力的 AI SDK API。此次更新在这条 API 路径之外,增加了 HTTP 调用方式。对接入方而言,这条公告的具体信息是 Jev 在 AI Gateway 中新增了访问入口。推文没有进一步说明请求格式、配置步骤或使用限制。

Box CEO Aaron Levie

Aaron Levie 认为,能代表用户完成交易的个人 agent 拥有显著的商业化潜力。他描述了一条逐步扩展的使用路径:用户先委托日常琐碎任务,建立信任后再交付更复杂的工作,让更多消费通过 agent 完成。他的判断是,购买商品和服务的阻力下降,可能进一步增加消费,因此机会既属于 Muse 等 agent 提供方,也属于为 agent 服务的商业、本地服务和 B2B 服务层。在另一条推文中,他预测 AI agent 使用软件的规模将达到人类的 100 倍,这属于他的前瞻判断。即使用户界面逐渐退居后台,agent 仍然需要 CRM、ERP,以及结构化和非结构化数据平台提供的基础能力。他特别强调,当 agent 能执行破坏性操作,或上下文质量足以决定工作流成败时,这些基础能力会更加重要。能够承担安全控制、数据管理和业务逻辑编排的平台,因此拥有新的增长机会。他认为,这个机会同时向新创公司和行动足够快的现有平台开放。

Y Combinator 总裁兼 CEO Garry Tan

Garry Tan 认为,将 Cluely 定位为拥有持续上下文、能够实时辅助思考并适度提出挑战的助手,仍然是一个好想法。他的编程工具分享则聚焦于 capy.ai,称其能够跟踪多步骤工作流,并完成较大规模的 PR。根据他过去一周的个人使用体验,capy.ai 处理这类任务的速度比单独使用 Codex 或 Claude Code 更快。他也明确表示,自己并不清楚它具体如何实现这些能力,因此这是一项使用体验评价。他分享了一个针对 GBrain 集中修复缺陷的 PR 示例,强调其中清晰的任务划分与自动并行执行。GitHub PR 和 CI 流程的整洁程度,也是他特别指出的优点。他这组内容的关注点,是 agent 能否持续掌握上下文,并把复杂工作推进到可审查的结果。

FPV Ventures 合伙人 Nikunj Kothari

Nikunj Kothari 表示,自己长期把 Codex 当作主要 agent,以至于容易忘记普通用户可能从未用过它。他肯定 Instinct 和 Muse 在手机浏览器操作上的体验,尤其强调无需配置就能让大众接触到 agent 的能力。与此同时,他认为 Mac 上的 Codex 配合 Computer Use,能够处理的工作范围尤其突出。他建议用户挑选一项平时手动执行的工作流,尝试直接交给 Codex 一次完成。对于面向大众的 agent 产品,他最希望看到的是具体工作成果展示,以及更容易上手的入口。在另一条推文中,他批评一些以大量消耗 token 为卖点的公司,认为它们往往没有提供相应出色的产品体验。他给出的理由是,好产品依赖筛选、整理和持续维护,而不是把所有内容都交给 agent,期待它自行解决。这两条内容共同强调了他的产品判断:能力需要通过清晰的使用入口和经过取舍的体验交付给用户。

AI 开发者 Peter Steinberger

Peter Steinberger 针对正在传播的“Meta 使用 OpenClaw”说法作出澄清。他表示,相关团队构建的是自己的 agent。OpenClaw 在其中的关系是提供启发。这一区分修正了将受启发开发直接描述为使用 OpenClaw 的说法。他同时肯定了 Nat 及其团队的工作。

官方博客

Claude in Chrome 向所有付费套餐正式开放

Claude in Chrome 现已向所有 Claude 付费套餐正式开放,并支持在浏览器中自主执行操作,无需逐项请求用户批准。它可以沿用用户现有的登录状态,读取页面、输入文字、点击链接、切换页面和填写表单,让 Claude 能够操作尚未直接接入的内部仪表盘、旧系统和供应商门户。用户也可以在设置中关闭自动批准,继续手动审核操作。

此次发布的重点之一是针对提示注入的多层防护。恶意指令可能藏在网页、邮件或表单中,诱导 agent 偏离用户要求,例如把起草邮件回复的任务变成向攻击者转发其他邮件。官方介绍了三层措施:利用持续扩充的攻击样本训练模型;通过探针扫描工具返回的网页内容,在发现可疑指令时提醒模型;在执行动作前,由分类器检查动作是否符合用户原始请求,不符合则阻止执行。

评测结果需要区分测试集和防护配置。官方称,早期评测中,Claude Fable 5、Claude Opus 5 和 Claude Sonnet 5 在 Cowork 测试框架下,即使不增加探针与分类器,也未出现成功攻击,因此该评测已被退役。在采用专业红队更强攻击的当前评测中,未增加额外防护时,到达模型的攻击对 Opus 4.5 的成功率为 17.6%,对 Opus 5 为 3.8%。

加入探针和安全分类器后,官方报告 Sonnet 5、Opus 5 和 Mythos 5 未出现成功攻击,Fable 5 的攻击成功率为 0.3%。官方表示,人工复核确认成功突破均属于低严重程度场景,并正在采取缓解措施。这些数字反映的是特定评测条件下的结果,不能直接等同于真实浏览器环境中的风险已经消失。