← 收录原文
BUILDERS · 精选整理

Builders 精选|2026-09-23

2026-09-23 · 历史整理稿

X / 推特

Anthropic Claude Code 成员 Boris Cherny

Boris 用 Opus 5.5 配合 Lean,对 Claude Agent SDK 做了形式化验证,几个简短提示就带来了 16 个修复不同 bug 和竞态条件的 PR。他表示,TLA+ 也很适合这类工作,自己有时会结合 Lean 与 TLA+,排查数据流、并发和状态管理问题。虽然他对这两种语言都不熟悉,但 Claude 的表现让他能够通过形式化建模,寻找人工检查可能遗漏的缺陷。他由此提出一个问题:形式化验证是否会成为编程,至少是查找 bug 的未来方向?在另一项测试中,团队分别让 Opus 5.5 和 Fable 5.1 将 HAProxy 从 C 移植到 Rust,两者都通过了几乎全部 HAProxy 测试。Opus 5.5 用时 9.5 小时,Fable 5.1 用时 12 小时,前者成本还低了 51%。Boris 表示,过去几周 Opus 5.5 已经是他的日常主力模型。

OpenAI Codex 与 ChatGPT 成员 Thibault Sottiaux

Thibault 宣布 GPT-6 Sol 和 Luna 已发布,并称两个模型的整体能力都有显著提升。他特别提到写作能力,以及需要实际使用才能感受到的综合体验改善。与此同时,两者的 API 价格将永久降低 50%,让更多使用场景在成本上变得可行。他表示,效率提升也会让订阅用户的额度更经用。OpenAI 还将为 Plus、Pro 和 Business 用户的所有账户提供一次可留待使用的额度重置。他将团队的方向概括为同时提升效率与智能,并强调,顶端模型的能力可以进一步用于改善其他层级的产品。

Anthropic Claude Code 与 Cowork 成员 Cat Wu

Cat 宣布,面向 Pro、Max 和 Team 套餐,Opus 5.5 已成为 Claude Code 和 Claude 应用的默认模型,其中也包括 Cowork。她已将其作为日常主力模型,尤其认可它清晰的表达能力,以及按照自己风格写作的能力。各产品默认采用 medium 推理强度,她表示,这一设置下的智能水平与 Fable 5.1 相当,但速度更快。与 Opus 5 相比,使用 Opus 5.5 时,同样的使用限额可以多支撑 25% 的用量。这次调整同时涉及默认模型、推理强度和额度效率,直接影响订阅用户的日常使用体验。Cat 鼓励用户交给 Opus 5.5 更有挑战性的任务,再反馈实际表现。

Anthropic Claude Code 成员 Thariq

Thariq 认为,模型能力提升后的正确用法,不是向生产环境交付 10 倍数量的功能。他主张把更多时间用于理解用户、开展实验和制作原型,也用于学习自己尚未理解的领域。这些投入的目标,是让最终交付的东西真正有效,而不是只增加功能数量。在具体使用上,工作流已经成为他使用 Claude 的重要组成部分。他看重的新变化,是接近 Fable 水平的智能如今在成本上更适合用于工作流。两条观点共同指向一个关注点:模型进步的价值,需要通过更充分的探索和可负担的实际使用来兑现。

Vercel CEO Guillermo Rauch

Guillermo 提出,软件可以通过用户自行生成和部署的方式延续生命,并以 Google Reader 为例说明:喜欢某个产品,就可以构建属于自己的版本。他还公布了一轮新的 Next.js 评测,Opus 5.5、GPT 6 Sol 和 Fable 5.1 的成绩均为 97%,Grok 4.7 为 94%。除了得分,他特别指出 Grok 的成本便宜 2 至 7 倍,让价格成为这组结果中值得同时考虑的因素。在设计层面,他赞赏 Anthropic 发布产品时体现出的审美。他解释,自己当初对网页的 headless 架构感兴趣,就是因为页面可以拥有各种独特、富有想象力的形态。在他看来,AI 进一步降低了实现这些设计的门槛,开发者应当继续探索网页设计的边界。

Anthropic 研究成员 Alex Albert

Alex 分享了使用 Opus 5.5 和 Blender 重建历史街景的尝试,目标是还原 1906 年地震前的 San Francisco Market Street。他给 Claude Tag 的提示将时间精确到 1906 年 4 月 17 日下午,范围从 Ferry Building 沿 Market Street 延伸到 Fifth Street,并指定 Palace Hotel、Call Building 等地标。在开始建模前,模型需要先依据 1899 至 1905 年的 Sanborn 火灾保险地图、Miles Brothers 的街景影片、历史照片和 USGS 地形资料建立来源文件。每栋建筑都要记录占地轮廓、高度、立面材料、使用者,以及各项事实的来源和置信度。建模必须全部使用 Blender Python,不得下载现成网格、纹理或 HDRI。提示还要求编写可复用的建筑立面、屋顶、窗户、路灯及交通工具生成器,再依据来源文件组装街道,确保建筑能够追溯到数据。最终交付要求包括一段沿街行进的 10 秒视频,Alex 则将这一尝试归功于 Opus 5.5 更好的三维建模与视觉能力。

Box CEO Aaron Levie

Aaron 将 Opus 5.5 降价和 GPT-6 Sol、Luna 的 token 价格下降 50% 联系起来,认为单位任务成本下降会显著扩大 agent 的可用场景,这是杰文斯悖论在 agent 上的体现。他列举的方向包括处理企业数据、扫描代码安全问题、分析日志,以及在工作流中使用多个 agent。Box 使用 Box Agent 测试复杂的非结构化数据任务后报告,相比 Opus 5,Opus 5.5 的 token 用量减少 63%、冗长程度降低 42%、速度提升 30%。在金融尽调测试中,任务准确率提升 39%,模型每次都找出了收购目标定价工具中的全部计算错误,总 token 用量减少 82%。在云成本分析中,任务准确率提升 65%,模型正确选择了留存计算依据并保持单位一致,用时减半,token 用量减少 70%。在客户账户分析中,任务准确率提升 17%,模型从 18 人名单推导合同未注明的资历构成,并按每位客户的回答计算平均满意度,而非被单项满分误导。在疟疾快速检测数据分析中,任务准确率提升 15%,模型发现两组标准差相差超过 100 倍,重新分析后判断旱季差异并不成立。Aaron 表示,客户很快就能在 Box AI Studio 中使用 Opus 5.5 构建 AI Agents。

Y Combinator CEO Garry Tan

Garry 分享了使用 Capy 的体验,称它让自己提交 PR 的速度显著快于单独使用 Codex 或 Claude Code。他给出的是个人使用感受,没有提供具体提速比例或评测数据。在另一条推文中,他主张教会更多人编写提示,并充分使用 AI。他希望人们看到 AI 如何帮助自己推进不同领域的追求。与工具使用相配套的,是更主动地寻找和解决问题,既解决自己的问题,也帮助他人。

FPV Ventures 合伙人 Nikunj Kothari

Nikunj 提醒读者,对大额融资新闻的标题保持审慎,因为即使是顶尖投资者,也在组织数量惊人的 SPV,即特殊目的投资载体。他认为,一些看起来由大型基金支持的融资,实际上有相当一部分资金来自 SPV,而标题未必呈现这种结构。再加上分批设置的估值,以及营收口径并不一致,公开报道很难完整反映公司的真实情况。他的核心判断是,真正能够验证表现的证据,并不都能从公开信息中获得。他还发布了与 Todd Saunders 的《A Walk In The Park》第三部分,议题包括从 Google 转向地板行业软件、标为“1000 万美元转型”的经历,以及退出后的生活。讨论目录还涵盖垂直软件与通用软件、联合创始人,以及为什么再次募集风险投资,视频在 New Jersey 的 Westfield 使用 iPhone 拍摄、Descript 剪辑。

OpenClaw 与 OpenAI 成员 Peter Steinberger

Peter 分享了一次从应用崩溃追查底层缺陷的经历。他升级到 macOS 27 后,遇到了 ChatGPT 偶尔崩溃的问题。随后,Astra 找到了 libuv 中一个存在约 14 年的 bug。这条更新给出了具体的系统版本、排查工具和缺陷所在组件。不过,素材没有说明 bug 的技术成因,也没有交代修复是否已经合并或发布。

SPC 普通合伙人、Bevel Health 联合创始人 Aditya Agarwal

Aditya 将当下围绕模型安全与对齐的讨论,放回自动驾驶的发展背景中,指出 AI 与机器学习早期的重要安全争论就发生在这一领域。他回忆,第一次乘坐 Waymo 时,最震撼的是技术竟然能够应对真实道路上的各种复杂情况。在 SPC 与 Dmitri Dolgov 的交流中,他最关注的是 Waymo 为建立发布信心而搭建的大规模评测和测试基础设施。这套基础设施服务于一个非常具体的任务:让重达 2 吨的机器人以每小时 30 英里的速度穿行城市环境。他已主持超过 50 场 Minus One 炉边谈话,而与 Waymo 的这场交流,是他 9 岁孩子第一次主动要求参加的活动,让他感受到面向物理世界创造产品的吸引力。对于 AI 产品本身,他还提醒开发者,不要在追求生产力的过程中忘记愉悦感和趣味性,并以自己使用 Sentience 时的体验为例。