← 收录原文
BUILDERS · 精选整理

Builders 精选|2026-08-25

2026-08-25 · 历史整理稿

X / 推特

OpenAI Codex 与 ChatGPT Thibault Sottiaux

Thibault Sottiaux 宣布,Plus 账户将在次日恢复 ChatGPT Work 与 Codex 的 5 小时限制,此前该调整曾被推迟。限制的首要目的,是平滑算力负载,从而在周使用量上继续保持相对宽松。另一个原因是,Plus 用户中有较多轻度用户和新用户,他们可能无意间快速耗尽整周额度,之后又对额度消耗感到困惑。他表示,未来几个月内,Pro $100 和 Pro $200 订阅暂不启用这一限制。除此之外,他预告 OpenAI DevDay 2026 将成为公司历史上最好的一届 DevDay,并强调领先幅度会非常明显。这两项信息分别指向近期的算力分配策略,以及 OpenAI 对下一届开发者活动的高度预期。

AI 实用教程创作者 Peter Yang

Peter Yang 对需要登录新网站或 App 的产品表现出明显抵触,甚至连被困在网页或 App 内部的 agent 也会降低他的使用意愿。除娱乐和游戏外,这类额外入口摩擦通常会让他直接放弃产品。这反映出 AI 工具的价值不仅取决于模型能力,也取决于它能否脱离封闭界面、顺畅进入用户已有的工作环境。他还希望尝试让 AI 通过语音拨打客服电话,自动穿过体验糟糕的电话菜单。目标不仅是识别自动语音选项,还包括接通真人客服,完成预约或取消订阅。他目前仍在寻找最容易上手的实现方式,并没有声称已经搭建或验证了具体方案。

产品爱好者 Nan Yu

Nan Yu 用 Codex 配置新电脑时,直接要求它下载并安装 Handy、Slack、Chrome、CleanShot 和 Rectangle。他认为这种通过自然语言批量处理软件安装的体验相当不错,也因此感叹 Siri 如果足够好,本应承担类似任务。这个案例展示了 coding agent 正在从写代码扩展到通用电脑配置和操作。与此同时,他批评 Gmail 的 emoji reactions 在其他邮件客户端中的兼容表现。对使用其他邮件 App 的收件人而言,这些反应可能显示成难看的单字符邮件,并附带额外 metadata。他特别指出 iPhone Mail 是广泛使用的邮件客户端,意味着这一兼容问题会影响大量非 Gmail 用户。

Meta AI 高级总监 Madhu Guru

Madhu Guru 在 eval 系列第八部分讨论了评测的区分能力。他给出的例子是五个 AI 系统分别获得 94、93、95、94 和 92 分,但已知 A、C 明显优于 D、E,评测结果却没有体现这种差异。这样的 eval 即使能产生分数,也缺乏有效的 discriminatory power。他把它类比为让一群博士参加五年级数学考试,所有人都能拿高分,因此无法判断谁的能力更强。但把评测任意提高到所有系统都失败,同样无法衡量系统原本要解决的问题。理想的 hill-climbing eval 应同时具备真实性、难度,并对能力差异保持敏感。随着 harness 和底层模型持续进步,原本有效的 eval 最终会趋于饱和,因此评测体系本身也需要继续演进。

Replit CEO Amjad Masad

Amjad Masad 表示,Replit Agent 已经在他的日常工作中完全取代 Claude CoWork。他认为 Replit Agent 更有持续性,处理任务时也更加细致。这种优势并非只来自响应速度,而是体现在面对完整任务时能够持续推进。他还强调,Replit Agent 更善于利用代码和软件来完成实际工作。评价标准因此从单次回答质量,转向 agent 是否能可靠地操作工具并把任务执行到底。这是他基于个人日常使用给出的明确产品选择,而不是对所有使用场景的普遍比较。

Vercel CEO Guillermo Rauch

Guillermo Rauch 注意到,终端输出乱码或进入异常状态后常用的 `reset` 命令执行得出奇地慢。他追溯到 1979 年 3BSD 的 `tset`,发现其中包含 `sleep(1)`,原本是为了等待机械打印与墨水终端稳定下来。这个历史遗留行为让现代终端重置仍可能耗时约 1 秒。他随后让 `fx` 用 Zig 编写了一个更快的替代方案,将耗时缩短到 1ms。探索过程中,他进一步研究了 `ncurses`、`tset`、`terminfo`,以及终端进入各种异常状态的机制。这个案例说明现代技术栈仍保留着数十年前硬件环境留下的设计痕迹。Guillermo 的感受是,优秀的系统设计可以长期延续,但其中也会残留少量不再适应当前环境的“蜘蛛网”。

Box CEO Aaron Levie

Aaron Levie 认为,在 AI agent 能够完成远超人类工作量的环境里,system of record 变得比以往更重要。Agent 会持续查询系统数据、处理任务、执行工作流,并与人类及其他 agent 协作,因此治理、可靠性、安全、访问控制和业务逻辑仍是核心基础。他把 OpenAI Hugging Face incident 视为未来 agent 自主执行目标时可能出现问题的一个早期缩影。不过,传统系统只有提供合适的产品体验、API 和商业模式,才能支持平台内外的 agent 真正执行任务,这也给整个软件行业带来机会与冲击。Aaron 还强调,ZDR 对 AI 增长具有尚未被充分认识的重要作用,因为它显著简化了企业处理数据 subprocessors 时的合规流程。许多 applied AI 工具只向客户提供带 ZDR 的模型,使客户无需逐一审查每个启用的模型,而例外审批通常耗时更长。企业内部也常要求只能使用 ZDR 模型,因为它们难以在整个组织的 context window 中明确隔离 PII、敏感信息和机密数据。在少数模型仍不支持 ZDR 的情况下,企业政策可能需要多年才能改变,因此他的判断是,没有 ZDR,AI 的扩散速度会骤然放缓。

Y Combinator CEO Garry Tan

Garry Tan 表示,Conductor Cloud 显著提高了他的生产力,并让他不必继续让 MacBook Pro 保持打开状态。他同时给出了一套面对现实、迭代判断的简洁方法。第一步是形成自己的观点,再把观点转化为可检查的 artifact 或实验。随后要让它接触真实世界,并在不自我欺骗的前提下读取结果。最后根据结果修正判断并再次运行,这套循环把抽象意见转化为可以持续验证的行动。

FPV Ventures 合伙人 Nikunj Kothari

Nikunj Kothari 指出,一笔最终正式打款的非传统风险投资交易,在完成前往往已经“死”过 100 次。交易能够继续推进,通常依赖一位愿意为创始人承担风险的内部 champion。这个人不仅公开支持项目,还会在基金内部低调协调,推动交易越过最终完成线。对创始人而言,识别谁是真正的 champion,是融资过程中的关键任务。找到对方后,应主动提供其说服内部决策者所需的信息和材料。他特别提到,associate 和没有投票权的 partner 往往非常有用,因为他们有动力帮助创始人推动项目。这一过程也能提前检验投资人在进入 cap table 后会如何与创始人合作。

OpenClaw 与 OpenAI Peter Steinberger

Peter Steinberger 主张,软件应该能够通过 prompt 被用户改变。他认为,那些无法用自然语言调整的软件需要被重新审视。这一判断把 prompt 从输入内容的手段提升为修改软件行为的界面。其关注点不是让用户围绕固定功能学习复杂操作,而是让软件本身具备更直接的可塑性。按照这一观点,可提示修改能力将成为软件是否适应 AI 时代的一项重要产品特征。