← 收录原文
BUILDERS · 精选整理

Builders 精选|2026-08-26

2026-08-26 · 历史整理稿

X / 推特

AI Builder Swyx

Swyx 提醒用户暂时不要使用 Codex 的“locked use”能力。该功能当前依赖不稳定的 macOS 特性,本周已经两次导致他无法访问自己的 macOS Keychain。他引用 Apple Developer Forums 的信息称,这是一个已知问题。虽然把相关操作全部放到云端可能避开本机风险,但他认为目前云端能力尚未成熟。对依赖 Codex 操作系统权限或凭证的用户而言,现阶段更稳妥的选择是避开该功能,等待底层问题修复。

OpenAI Codex 与 ChatGPT 产品成员 Thibault Sottiaux

Thibault Sottiaux 介绍了一项面向团队和小型公司的产品方案,其使用方式接近 Pro $100 计划。方案覆盖 ChatGPT、ChatGPT Work 和 Codex 的全部功能,并可连接 Google Workspace、Slack、GitHub、Microsoft 365 等服务。企业管理能力包括安全工作区、SAML、SSO、MFA、集中账单与统一管理。团队还可以查看使用分析,并通过支出控制管理成本。该方案没有 5 小时使用限制,重点是在个人高额度方案与企业协作需求之间建立连接。他同时表示,好产品需要时间,并以“至少 34 天”概括其开发周期。

实用 AI 教程创作者 Peter Yang

Peter Yang 开源了免费 AI skill `/fuck-cancer`,帮助癌症患者及照护者整理诊断、治疗和沟通信息。它会生成一份持续更新的实用 brief,集中保存患者与医疗团队资料,并把下一步行动限制为三个明确事项。文档会分别记录已确认事实与仍不明确的问题,同时用通俗语言解释医疗术语。第五个部分是包含近期进展与决策的照护日志,方便家属维护单一信息来源。该 skill 可以读取用户提供的文档和背景信息,在需要研究时使用 National Cancer Institute、ClinicalTrials.gov API 等来源。Peter 使用 ChatGPT、Codex 和 Claude Code 来准备沟通及研究,结果既可保存为本地 Markdown,也可同步到供家人协作的 Google Doc。他强调,这项工具的目标是帮助患者提出问题、推动检查,并应对医生、文档和保险材料迅速累积带来的压力。

Meta AI 高级总监 Madhu Guru

Madhu Guru 发布了 eval 系列第九篇,讨论“The Eval Roadmap Problem”。他的核心判断是,大量 eval 失败并非测试本身完全错误,而是团队把它当作静态产物,忽略了用户预期和使用行为正在升级。以金融研究 agent 为例,需求可能从总结一份 5 页财报,发展到比较最近 5 份财报,再扩展到结合 15 份文件建立投资论点,最终变成持续监控投资组合并主动预警。对应的 eval 也必须从短上下文迁移到长上下文单轮问答、多轮引用、文档与行级引用,并从简单 QA 走向复杂综合和主动 agent。团队应识别轮次、文档规模、工具使用、自主程度和用户旅程覆盖等演化维度,再确定下一阶段的 P0 eval。Madhu 建议持续访谈用户、分析生产 traces、寻找行为变化,并根据失败模式反复改进。若 eval 仍停留在第一周,而用户已经进入第三周的复杂用法,差距最终会体现在产品质量和流失指标中。

Anthropic Claude Code 与 Cowork 产品成员 Cat Wu

Cat Wu 宣布 Claude 已经统一 Chat 与 Cowork 之间的 memory。用户只需告诉 Claude 一次需要记住的内容,相同背景就能跨两个使用界面生效。这样,从聊天讨论形成的项目背景可以直接进入 Cowork 的任务流程,无需重复说明。此次更新来自用户反馈,重点是降低跨产品切换时的上下文损耗。Cat 也邀请用户继续提出希望加入 memory 的后续能力。

Google AI 实验平台 Google Labs

Google Labs 推出了协作式 vibe coding 实验 Play with Putty。它允许多人实时共同构建工具和网站,把个人式 AI 编程扩展为多人协作流程。产品强调共同创作,参与者可以围绕同一个想法同步推进实现。当前用户需要先加入 waitlist,并向团队提交使用反馈。该实验目前仅面向美国地区的 18 岁以上用户。

Vercel CEO Guillermo Rauch

Guillermo Rauch 发布 Run SDK,用于在动态 Code Mode 中安全执行 agent 生成的代码。它采用轻量级 QuickJS 安全上下文,适用于不需要完整 sandbox 的任务,目标是降低执行延迟和成本。开发者可以通过 `npm i run` 安装。Guillermo 同时宣布 Vercel Connect 已进入 GA,聚焦 agent 连接服务和数据时的安全问题。开发者可以运行 `vercel connect create notion` 创建连接,并获得一个代表已认证用户执行查询的 MCP client。这两项能力分别处理 agent 的代码执行与外部服务访问,构成两类关键基础设施。其共同方向是让 agent 在更小的运行开销下,安全调用代码、身份和业务数据。

Box CEO Aaron Levie

Aaron Levie 认为,基础 AI 模型与企业实际工作流之间仍存在很大距离,这为 applied AI 公司留下了重要机会。企业真正需要的不是原始模型或孤立 agent,而是问题得到解决、结果能够交付。要跨越这段距离,产品必须理解行业上下文,并推动组织内部的 change management。技术层面还需要能路由不同模型的 harness、关键业务系统连接,以及把用户和 agent 放入正确工作流的 UX。团队还必须掌握所在领域的 eval,才能判断 agent 是否真的完成了业务目标。Aaron 的判断是,超越模型智能本身的整套落地能力具有大量价值,目前正是建立各企业关键领域代表性公司的窗口期。

FPV Ventures 合伙人 Nikunj Kothari

Nikunj Kothari 推出了 El Niño situation monitor,集中呈现 El Niño 的实时动态。网站汇总政府来源的信息与新闻,并按地区说明影响和成本。它还收录历史记录,帮助用户理解当前读数的重要性。针对不同指标和术语,网站提供 glossary 与 FAQ,降低非专业用户的理解门槛。该项目最初受到 Odd Lots 一期内容启发,使用 ChatGPT Codex 和 Railway 构建。界面细节借助 Emil Kowalski 的 skills 与 Kasturi 的 generative loaders 完成,Nikunj 也公开邀请用户提供反馈。

SPC General Partner Aditya Agarwal

Aditya Agarwal 认为,公众反感数据中心扩建并不令人意外。当前 AI 的主要受益者仍是知识工作者以及收入最高的人群,因此大规模基础设施建设与普通人的直接利益之间存在距离。他判断,当 AI 能够帮助找到困扰所有人的疾病疗法时,公众态度可能发生重大变化。他认为相关方向已经开始出现希望,也能解释为什么一些最聪明的人开始把注意力转向医疗问题。Aditya 同时批评 AI 行业长期强调风险和恐惧,却没有充分描绘一个积极、可感知的未来。要获得更广泛的社会支持,AI 需要用普遍可见的真实成果证明基础设施投入的价值。

Anthropic AI 助手 Claude

Claude 现在会在 Chat 与 Claude Cowork 之间使用同一套 memory。Cowork 接到任务时,可以直接利用用户此前在聊天中讨论的项目背景、管理者偏好或客户信息。所有已保存内容会以主题列表形式出现在 Settings 中,用户可以逐项阅读、编辑或删除。memory 会随着聊天自动更新,持续保存新出现的相关细节。用户也可以明确说出“remember this”,要求 Claude 记录某一项信息。此次设计在跨界面连续性之外,也把记忆内容的查看与控制权交给用户。

播客

Training Data — Parallel’s Parag Agrawal: Building a New Web for AI Agents

核心要点:Parallel 判断,面向 agent 的搜索不能继续依赖人类点击数据,而要围绕 agent 的任务反馈,重新设计索引、排序、接口和互联网商业模式。

Parag Agrawal 曾任 Twitter CEO,如今创办 Parallel Web Systems,目标是让 agent 能够搜索和使用整个 Web。他的出发点是,agent 未来使用网络的频率可能达到人类的 1000 倍,因此传统搜索引擎为人类浏览、点击和关键词输入建立的技术栈并不够用。

第一个关键变化是反馈机制。Parag 的原话是:“在 Parallel 看来,人类点击数据是一个 bug,使用搜索完成工作的 agent 应该依赖 agent 反馈,而不是人类反馈。”传统搜索依靠大量点击和人工评分判断结果好坏,年轻公司很难复制这种规模优势。现在,大模型可以压缩信息并更低成本地产生评价数据,使团队有机会把模型研究应用于索引与排序。

第二个变化是从慢速 agent 切入,而不是第一天就复制完整搜索引擎。Parallel 最初推出的是 search agent,它可以在查询到达后再抓取网页。深度研究任务允许等待一分钟,有些产品甚至会研究十分钟,这给实时抓取和页面筛选留下空间。Parag 把索引视为一种延迟优化,团队先与人工资料搜集竞争,再通过客户任务逐步建设更大、更复杂的索引,早期场景包括保险承保、理赔和销售流程。

第三个变化是质量、成本与延迟的联合优化。Parallel 的目标不是训练另一个超大基础模型,而是把能力压缩到小型排序模型中,从数以万亿计的网页里选出最有价值的约 1000 个 token。Parag 表示,使用 Parallel Search 通常能让 agent 消耗不到一半的 token,同时提高准确性和速度。更少的噪声意味着模型可以在相同上下文限制下处理更多问题,或者以更低成本完成同一任务。

第四个变化发生在互联网经济层。广告之所以高效,是因为有限的人类注意力能够转化为点击、购买和订阅,并通过差异化定价补贴大量免费内容。当访问者变成无法识别的 agent,内容方无法判断一次抓取是否会带来订阅,也无法用现有广告模式变现,因此可能选择阻止 agent。固定费用的数据授权同样难以跟上 AI inference 以倍数增长的使用量,内容方在续约时可能发现自身收入占比持续下降。

Parag 把未来分为三个层次:agent 把 Web 当搜索工具,更复杂的多 agent 系统相互唤醒和编排,以及 Web 从 pull 转向 push。最终,agent 不再反复询问“现在帮我找什么”,而是持续监测网页、卫星图像或客户评论的变化,并在事件满足条件时主动触发工作。届时,为 agent 编写可读取的 API 文档、内容和数据接口,将与面向人类设计网页同样重要。