← 收录原文
BUILDERS · 精选整理

Builders 精选|2026-09-05

2026-09-05 · 历史整理稿

X / 推特

AI Builder Swyx

Swyx 正在制作一份关于 Astra、Fable 前沿模型和 AEO 的大型报告。研究过程中,他发现 Claude 在被问及最佳 AI newsletter 或 podcast 时,非常偏爱推荐 Latent Space。他对这个结果颇为意外,因为模型给出的推荐可能受到训练数据、检索来源或上下文的影响。Ric Mac 的反馈促使他重新检查是否存在 memory leak。这个案例也说明,评估模型如何呈现品牌和内容来源时,需要先排除测试流程自身造成的偏差。

OpenAI Codex 与 ChatGPT 团队 Thibault Sottiaux

Thibault Sottiaux 表示,Astra 在尚未全面开放时,可能是团队最大的竞争优势。它带来的生产力提升幅度很大,以至于团队调整了部分产品计划。原本预计明年年中交付的内容,现在计划提前约 6 个月,在 DevDay 发布。Astra 已提前完成面向用户的推出。团队同时决定为 Plus、Pro 和 Business 用户执行完整的 banked reset,并计划在当天结束前完成。当天太平洋时间晚上 8 点前新建账户或升级的用户也能获得这次 reset。两条更新共同传递出一个明确信号,Astra 不只是模型能力升级,也已经直接改变 OpenAI 内部的开发速度和发布节奏。

AI 教程创作者 Peter Yang

Peter Yang 建议 OpenAI 为 Apple Watch 推出一款应用。核心交互是直接通过语音向 Codex thread 输入任务,再由 Codex 用语音返回结果。这样的入口可以让用户在不携带手机的情况下继续处理已有任务线程。他认为它还能减少用户对手机屏幕的依赖,把 Codex 从桌面和手机界面延伸到更轻量的随身设备。Peter 也提出,这类体验可能正是传闻中的 OpenAI device 所要解决的问题。这个设想关注的不是把完整 ChatGPT 界面缩小到手表上,而是为持续运行的 agent 工作流提供低摩擦的语音入口。

Meta AI 高级总监 Madhu Guru

Madhu Guru 建议,想提升 AI 产品能力的人可以选择一个自己非常熟悉的生活或工作流程,并尝试用 AI 将它完整自动化。工具可以从自己已经熟悉的 AI 产品开始,但过程中通常需要试验多个方案。这个练习会迫使 builder 明确定义优秀的端到端体验,而不是只优化其中一个模型调用。它也会暴露 MCP 和其他工具应该在什么环节介入,以及哪些决策仍需保留 human in the loop。自动化完成后,还要建立评价方法,判断结果是否真正可靠和有用。随着实践推进,可以逐步扩大流程的目标和复杂度。Madhu 的判断是,完整做过一次这样的项目,比花一个月阅读 AI 产品方法论学得更多,因为真正的学习来自亲手构建。

Vercel CEO Guillermo Rauch

Guillermo Rauch 对 WebMCP 非常乐观,因为 agent 必须在现有 WWW 基础设施上工作,而不是等待整个互联网为 agent 重建。他用 Tesla FSD 适应真实道路、红绿灯和坑洼作类比,强调 WebMCP 的价值在于更高效地利用已有网页环境。一个具体场景是,Next.js 开发页面可以直接向正在测试该标签页的 agent 暴露调试工具。agent 因而能够获得页面级上下文,不必先从大量服务器日志中筛选问题。开发者也不需要另外寻找和配置 MCP server,因为网页本身就能提供自己的 agent tools。他认为在这种架构下,fx 与 agent-browser 可以形成完整的 Web 开发栈,同时保留调试深度。Guillermo 还判断,AI software factories 最终会产出无缺陷且能够持续自我改进的软件。两条观点的共同方向是,让 agent 更贴近真实软件运行环境,并把观察、调试和迭代能力直接嵌入系统。

Y Combinator CEO Garry Tan

Garry Tan 用 AsideAI 配置 OpenClaw 与 Slack 的完整集成,体验与此前流程形成了鲜明对比。原有设置过程需要约 2 小时,而 AsideAI 的 harness 在不到 3 分钟内完成。它同时提供完整 integrations、browser integration 和较为完善的默认访问控制。Garry 已将 AsideAI browser 设为 GStack 首选的 remote session browser。对于需要像用户本人一样访问网页和 credentials 的 AI agent,他认为 AsideAI 是自己试过的工具中表现最好的方案。除浏览器和凭据管理外,他还特别肯定其 integrations、harness 与 memory system。这个案例表明,agent 工具的实际效率不仅取决于模型能力,还取决于身份验证、权限边界、浏览器控制和长期记忆能否被整合成一个连贯流程。

Builder Zara Zhang

Zara Zhang 提出,大多数人对 AI 写作能力的评价高于它的真实水平。这个判断提醒 builder,不应把语言流畅度直接等同于写作质量。AI 生成的文本可能在表面表达上足够自然,但仍需要针对观点、结构和事实进行独立判断。对于把 AI 用于内容生产的人,关键问题不是模型能否生成完整文字,而是成品是否达到了实际发布标准。她的观点将注意力从生成速度重新拉回到编辑判断和质量评估。

SPC General Partner Aditya Agarwal

Aditya Agarwal 表示,自己能够理解 RL、inference time scaling 和现代 data-verification loop 的工作方式。即使掌握这些技术机制,他仍觉得当代模型展现出的能力近乎“魔法”。这种感受揭示了理解单项原理与解释完整系统行为之间的距离。模型能力来自多个训练、推理和验证环节的共同作用,知道每个组成部分并不意味着其组合效果会变得直观。他的反思提醒 AI builder,在分析技术机制的同时,也要对复杂系统中出现的能力跃迁保持敬畏。

OpenAI Sam Altman

Sam Altman 宣布 GPT-6 Astra 已可供所有 Pro、Enterprise 和 Business Premium 用户在 Work 与 Codex 中使用。Astra 同时已经进入 API。发布时,OpenAI 表示接下来会向 Plus 和 Business 用户逐步开放。随后更新确认,Astra 已覆盖所有 Plus 和 Business 用户。两条消息呈现了这次发布从高阶方案、企业方案和 API 向更广泛付费用户扩展的顺序。Sam 对用户的直接提示是,现在可以开始使用 Astra 进行构建。

官方博客

Claude in Chrome is generally available

Claude in Chrome 现已向所有 Claude 付费方案全面开放,并能够在浏览器中自主执行部分操作,不再要求用户逐项批准。它可以利用用户已有的登录状态读取页面、输入文字、点击链接、切换页面和填写表单,因此也能覆盖没有 connector 的内部 dashboard、legacy system 与 vendor portal。用户仍可在设置中关闭自动批准,恢复手动确认模式。

浏览器 agent 的核心风险是 prompt injection,即攻击者把恶意指令藏在网页、邮件或表单字段中,诱导模型执行用户没有要求的行为。Claude 会通过持续扩充的攻击样本训练、扫描 tool result 的 probes,以及执行前核对任务意图的 safety classifier 建立多层防线。当前更强的评估中,未叠加额外防护时,攻击到达模型后的成功率在 Opus 4.5 上为 17.6%,在 Opus 5 上为 3.8%。启用 probes 和 safety classifier 后,针对 Sonnet 5、Opus 5 与 Mythos 5 的攻击没有成功,Fable 5 的成功率为 0.3%,且人工复核认定成功案例均为低严重度场景。官方同时强调,这些结果来自持续演进的测试与防御体系,并不意味着浏览器环境的 prompt injection 风险已经消失。

Claude gets its own browser in Cowork

Claude Cowork 桌面应用新增内置浏览器。当任务涉及网站时,浏览器会在侧边栏打开,Claude 可以导航网页、读取内容、点击和输入,让用户把填写表单、读取 dashboard 数据或处理无 connector 的 portal 等工作直接交给它。该能力不需要浏览器扩展,也不会默认共享用户个人浏览器中的标签页、书签或密码。

内置浏览器与 Claude in Chrome 面向不同场景。前者是独立于个人浏览器的工作环境,适合研究资料、收集发票等可整体委托的 Web 任务;后者适合操作用户已经打开并登录的页面,例如更新 CRM、处理收件箱或编辑当前文档。用户可以逐站点从 Chrome、Edge 或 Firefox 导入登录信息,银行、邮箱和 SSO 站点默认不会被纳入,除非用户主动选择。

内置浏览器采用与 Claude in Chrome 相同的 prompt injection 防护和行动核验机制,但官方仍建议从可信网站开始使用。它将在一周内逐步覆盖 macOS、Windows 和 Linux 上的 Claude 桌面应用,面向 Pro、Max 和 Team 方案提供 beta,Enterprise 管理员已可在组织设置中启用。只要桌面应用保持开启并在线,用户也可以从 Web 或手机端驱动该浏览器。