← 收录原文
BUILDERS · 精选整理

Builders 精选|2026-09-01

2026-09-01 · 历史整理稿

X / 推特

OpenAI Codex 与 ChatGPT 团队成员 Thibault Sottiaux

Thibault Sottiaux 正在收集潜在用户没有尝试 Codex 的核心原因。他把问题限定为“唯一一个阻碍因素”,意在识别采用过程里最关键的摩擦点。提问面向过去考虑过 Codex、但尚未真正使用的人群。关注范围并非新功能,而是用户为何迟迟没有迈出第一步。这也为 Codex 后续改善产品理解、信任或上手体验提供了直接反馈入口。

AI 教程与访谈创作者 Peter Yang

Peter Yang 判断,信任将成为个人 agent 普及的最大障碍,同时也会是最重要的驱动力。这意味着 agent 能否执行任务并不是唯一问题,用户是否愿意授予它数据、权限与行动空间同样关键。信任不足时,即使能力成熟,个人用户也可能拒绝采用。反过来,一旦产品建立起可靠预期,信任就能推动用户把更多事务交给 agent。他的观点把个人 agent 的竞争重点从单纯模型能力,转向长期使用中可验证的可靠性。

即将加入 OpenAI 产品团队的 Nan Yu

Nan Yu 宣布将加入 OpenAI,参与 Codex 和 ChatGPT 的产品工作。他此前担任 Linear 产品负责人,并在该团队工作了 4 年。他表示自己为与 Linear 团队共同打造的成果感到自豪,也感谢这段经历。新的阶段将延续他对软件产品工艺的积累,把相关经验带入 OpenAI。此次变动让一位长期打磨开发者软件体验的产品负责人,直接进入 Codex 与 ChatGPT 的产品建设。

Meta AI 高级总监 Madhu Guru

Madhu Guru 认为,产品经理深入理解自身场景对应的模型前沿,蕴含着巨大的超额价值。PM 应当清楚不同尺寸模型目前分别擅长什么,而不能只依据通用榜单选型。他们还需要准确掌握各类模型在具体用例中的失败方式,以及可以采用哪些变通方案。更高的要求是,PM 对自己的业务场景应比多数前沿实验室研究员和其他 PM 理解得更深。产品路线图也必须纳入模型能力在未来 2 至 3 个月可能发生的变化,避免仅按今天的能力规划。Madhu 将这种技术判断视为当代 PM 的核心职责,而不是可选的额外知识。

Vercel CEO Guillermo Rauch

Guillermo Rauch 提出,下一代设计系统可能就是 Markdown。Vercel 正通过 DESIGN.md 处理 AI 生成内容缺乏品位与一致性的难题,并尝试让大型组织规模化传递设计判断。这个思路把设计规范变成模型和开发流程都容易读取的文本约束,使设计意图能够更直接地进入生成环节。他同时把 coding tokens 视为基础设施,认为企业不能像发放一个无限制 AWS key 那样任由团队使用。一个 key 的资源范围可能从每月 3.80 美元的 t3.nano 延伸到每月 4 万美元的 p5.48xlarge,因此缺少治理、优化和可观测性会迅速造成成本失控。AI Gateway 为 token 使用提供按 key 以及按用户设置预算的能力,目标是把 AI 消耗纳入成熟的基础设施治理体系。这两项主张共同指向一个变化,即 AI 开发正在从个人工具使用进入需要组织级规范、成本控制和质量约束的阶段。

Box CEO Aaron Levie

Aaron Levie 判断,随着基础开放权重模型持续进步,后训练基础设施日益成熟并商业化,拥有大量数据的公司将获得训练自有模型的新机会。过去,大型数据语料的主要变现路径是授权给外部机构训练模型。现在企业可以在不承担前沿实验室级研究成本与复杂度的情况下,为自身领域训练模型。通用前沿模型仍会凭借广泛任务覆盖保持优势,但各垂直行业和专业领域可能出现远多于今天的模型。他还指出,随着 AI 安全事件增加,企业需要更先进的 AI agent 来发现和阻止安全问题。目前前沿模型在网络安全能力上依然领先,但开放模型正在快速追赶。数据资产、领域后训练和安全 agent 因此可能同时成为企业 AI 战略的重要组成部分。

Y Combinator CEO Garry Tan

Garry Tan 为 GBrain 增加了一组新的评测,用于验证其面向 AI agent 的开源检索层。他表示,这些评测证明 GBrain 在无需让 LLM 参与读取过程的情况下,能够以 SOTA 水平取回记忆。这个设计把记忆检索与模型推理拆开,重点衡量基础检索层本身的效果。他还补充了从 agent transcript 保存记忆的评测。其目标是从 agent 的交互记录中提炼信息,持续丰富用户的“brain”。Garry 同时公开了相关结果依据,方便外界检查这些能力主张。

Every CEO Dan Shipper

Dan Shipper 认为,拟人化 AI 并非天然有害,关键在于它服务于什么目的。当拟人化帮助人们理解、预测并更有效地使用 AI 时,它具有实际价值。当它被用来制造恐慌、夸大恐惧,或把 AI 与人类进行缺乏依据的比较时,问题才真正出现。他理解反对者为何警惕这套语言,尤其是有人借意识主张改变 agent 的道德地位时。不过,他强调可以在不宣称 AI 具有意识的前提下,务实地使用拟人化表达。他由此把争论焦点从“能否拟人化”转向“这种表达是否改善了理解和使用”。另一条简短判断进一步概括了他的立场,即务实主义者将在 AI 时代持续占据优势。

播客

Training Data — Rich Sutton and Khurram Javed: Why AI Models Stop Learning, and How to Start It Again

核心要点:真正的智能不能只在训练阶段学习,它必须在持续行动中形成自己的抽象,并在不破坏旧知识的前提下不断更新。

Rich Sutton 是强化学习的重要奠基者、相关经典教材作者,也是 The Bitter Lesson 的作者。Khurram Javed 是他在 University of Alberta 的前学生,如今两人共同创办 Oak Lab,试图构建能够真正持续学习的系统。Sutton 对问题的定位十分直接:“我不奇怪,是这个领域很奇怪。它非要把这叫作持续学习,但这其实就只是学习。”在他看来,智能体始终处于行动、感知和学习的循环中,把学习压缩成一次离线训练才是反常状态。

第一项关键判断是,合成数据无法替代真实经验。Javed 提出的 big world hypothesis 认为,世界包含无限多值得学习的事物,其复杂度远超任何单一智能体。合成世界来自一个规模有限的程序,只能覆盖真实环境中极小的一部分。比如让无人机依靠回声定位飞行,数据如何生成、哪些物理细节重要,仍需要人类领域专家先做判断。电机磨损、摩擦以及他人的心理状态等现实因素,也无法被一个简化模拟完整复制。因此,只靠人类设计合成数据,会把系统的进步速度锁在人类专业知识上。

第二项缺口是学习抽象的能力。智能体不仅要预测下一步会发生什么,还必须自己发现模型应该基于哪些状态、特征和概念进行预测。Javed 以精英运动员为例,他们常会形成描述细微动作的专用概念,有些概念甚至没有名称。这些抽象来自长期经验,而不是开发者预先列出的标签。Oak Lab 的研究目标之一,就是让系统根据所在世界自行形成适合规划和推理的抽象。

第三项难题是 catastrophic forgetting。用单个新样本直接更新整个模型,会损害模型先前掌握的知识。Cursor 一类拥有大量用户数据的场景可以依靠大批量样本缓解问题,但多数个人化 agent 面对的只是单一数据流。Sutton 提出的方向是为网络中的每个权重分别学习 step size,让大部分权重只发生极小变化,新经验则更新真正相关的位置。

第四项方法是 continual backprop。传统 backprop 只在初始化时获得一次随机性,随后这种多样性会逐渐耗尽。Continual backprop 会持续植入随机初始化的新单元,再由 backprop 检验哪些新特征有用。Sutton 认为,把逐权重 step size 优化与这种 generate and test 机制结合,可能带来明显更强的持续深度学习系统。

Sutton 同时肯定 LLM 是神经网络语言能力上的重大突破,但反对把流畅使用语言等同于全部智能。他估计语言能力只占智能的约 20% 或四分之一。Oak Lab 最终追求的不是一个学会所有事情的单一心智,而是一种通用设计,让多个系统根据各自经历成长为不同的心智。