← 收录原文
BUILDERS · 精选整理

Builders 精选|2026-07-26

2026-07-26 · 历史整理稿

X / 推特

Google Labs VP Josh Woodward

Josh Woodward 展示了 Gemini Spark 的一个实用场景:用户可以把学校日历 PDF 丢进 Gemini,让它把所有 “No School” 日期添加到 Google Calendar。这个例子强调 Gemini 不只是聊天界面,而是在替用户完成跨应用的具体任务。Gemini Spark 目前已面向美国所有 Google AI Pro 订阅用户上线,接下来会扩展到全球。对 builders 来说,这类 PDF 到日历的工作流很典型,因为它把非结构化文件、自然语言指令和个人工具链连接起来。它也说明 AI 产品竞争正在从“回答得好不好”转向“能否可靠操作用户已有的软件环境”。

Claude Code Boris Cherny

Boris Cherny 认为 Opus 5 不只是 coding、data analysis、design、biology 和 knowledge work 上的强模型,更让他兴奋的是它在 prompt injection 上的进步。他提到系统卡里埋着一个重要细节:在 PI evals 和 red teaming 中,Opus 5 很难被成功 prompt inject。更关键的是,强模型 alignment、prompt injection probes 和 Claude Code 的 Auto Mode 叠加后,prompt injection attack 的成功率会降到约 0。这个方向值得 builders 关注,因为 agent 越能操作真实工具,prompt injection 就越接近产品级安全问题,而不只是模型评测问题。Boris 的表述也暗示 Anthropic 会继续公开更多关于多层防御的细节。

Codex & ChatGPT Thibault Sottiaux

Thibault Sottiaux 宣布 ChatGPT Work 已经面向全球所有付费计划开放,覆盖 mobile、web 和 desktop。他形容它像是给 ChatGPT 装上 jetpack,重点是把 ChatGPT 从单次问答推进到更强的工作执行状态。虽然推文没有展开功能细节,但“all paid plans”和“already on your phone”说明这不是小范围实验,而是面向既有付费用户的广泛分发。对 builders 来说,值得注意的是 AI 工作流能力正在从桌面 IDE 或专门 agent 工具进入通用 ChatGPT 入口。移动端可用也会改变使用场景,用户可以在手机上接入更持续的工作线程。

AI 教程作者 Peter Yang

Peter Yang 分享了一个具体工作流:躺在床上用 ChatGPT Voice 跟 Codex 协作完成工作。他指出,要把这种方式用好,需要记住自己所有 long running threads 的名字。这个观察很小,但很实用:当语音成为控制 agent 的入口,线程命名、上下文管理和任务可恢复性会变成关键体验。传统 GUI 里靠视觉列表定位任务,语音模式里则更依赖用户能准确说出上下文对象。对 builders 来说,这提示了一个产品细节:长期任务的命名、检索和口语化调用,可能会决定 voice agent 是否真的可用。

Meta AI Sr Director Madhu Guru

Madhu Guru 认为未来几年会有一个巨大机会:把混乱的真实工作流接到 foundation models 上,并让模型在特定领域表现出色。这个能力不只是会调 prompt,而是要理解工作如何发生、设计 evals、通过 post-training 改进模型,并建立持续反馈回路。他把这定义为从通用模型到领域专家模型的关键路径。今天这种能力仍主要集中在少数实验室里,因此外部 builders 如果能掌握这套方法,会有很大的空间。他还补了一句更尖锐的判断:有些人应该被要求用 AI 写作。两条推文合起来看,他关注的是 AI 能否真正嵌入生产流程,而不是停留在单点内容生成。

Claude Code Cat Wu

Cat Wu 强调 Claude Opus 5 很适合 long-running autonomous work,并邀请用户试用反馈。她的角度与 Claude Code 场景直接相关:模型是否能长时间维持目标、上下文和执行质量,是 coding agent 能否从助手变成实际执行者的关键。这里没有展开具体 benchmark,但“long-running autonomous work”本身说明 Opus 5 的卖点不只是单轮解题能力。对 builders 来说,长任务能力意味着产品设计要关注 checkpoint、恢复、权限和失败处理,而不是只看一次回答。她的表述也呼应了 Anthropic 近期对 Claude Code 和 agentic work 的整体叙事。

Claude Code Thariq

Thariq 说 Anthropic 为最新模型移除了约 80% 的 Claude Code system prompt,并总结了他们对 system prompts、skills 和 Claude.MDs 的经验。这个数字很关键,因为它说明更强模型可能不需要旧模型时代那种冗长、细碎的行为约束,反而可能从更简洁的指令中获益。他还建议把 Opus 5 和 Fable 搭配,用于 planning、brainstorming 或修最难的 bugs。对 builders 来说,这意味着模型升级不一定是无缝替换,prompt、skills 和项目说明文件都可能需要重新设计。Thariq 还补充相关内容也发布在 Claude Blog,说明这不是单纯个人感受,而是 Anthropic 正在系统化沉淀的工程经验。

Replit CEO Amjad Masad

Amjad Masad 把焦点放在 open weight models 的政策立场上,公开追问 Anthropic 是否会签署相关倡议,并建议 Anthropic 员工向领导层确认是否支持禁止 open weight models。这个问题不是模型技术细节,而是 AI 生态的产业结构问题:开放权重是否应被限制,直接影响创业公司、开发者和下游产品的选择空间。他同时提醒,如果很久没用 Replit,现在会有很大惊喜。两条推文放在一起看,一边是对开放模型政策的公开施压,一边是对 Replit 产品进展的暗示。对 builders 来说,Amjad 关注的是应用层工具能否在开放生态中继续快速迭代。

Anthropic Research Alex Albert

Alex Albert 分享了 Opus 5 发布中他最喜欢的一些图表,并强调团队在跨领域 token efficiency 上投入了大量工作。他的重点不是单纯提高 intelligence bar,而是在保持或提升能力的同时,让模型用更少 token 完成任务。他表示 Opus 5 使用起来很 smooth,并且在许多 coding tasks 上比 Fable 5 更偏好它。对 builders 来说,token efficiency 是很实际的产品指标,因为它会影响延迟、成本和长上下文任务的稳定性。Alex 的观察也说明模型体验不只由最高分数决定,还由执行流畅度和跨任务成本结构决定。

Box CEO Aaron Levie

Aaron Levie 连续讨论了 open weights AI 和 Claude Opus 5 在企业文档任务上的表现。他认为 open weights 能加速 AI 在经济中的扩散,为不同客户需求提供更多选择,降低某些 workload 成本,并让高度垂直的 post-training 更容易发生。Box 已签署支持 open weights 的信件,他强调 open vs. closed 不是零和战争,强 open weights models 会推动整个行业前进。在 Box 内部测试中,Claude Opus 5 相比 Opus 4.8 在 Box AI Agent 的 Complex Work Eval 上有明显提升,尤其是复杂企业文档端到端任务。具体例子包括 due diligence 提升 17%、life sciences 提升 30%、legal 提升 12%、technology 提升 19%、healthcare 提升 13%。他的结论是,Opus 5 的 reasoning、analytical 和 data processing 能力对 enterprise agentic use-cases 会很有力,并且很快可以在 Box AI Studio 中构建相关 agents。

Y Combinator CEO Garry Tan

Garry Tan 在 YC Startup School 2026 前一天分享了 Chase Center 的 rehearsal,并欢迎未来创始人来到 San Francisco。更值得关注的是他对 AI 生产力扩散速度的判断:要获得宏观生产力提升,managers 和 CEOs 必须批准 radically different staffing 和 workflow plans。他认为到目前为止企业管理层还没有真正做到这一点,因此这种变化可能需要 10 年,而不是 2 年。这个判断对 builders 很重要,因为它把 AI adoption 的瓶颈从模型能力转移到组织授权和工作流重构。换句话说,即使工具已经可用,宏观生产力也不会自动出现,除非管理层愿意改变人员配置和流程设计。

FirstMark VC Matt Turck

Matt Turck 提到一个被低估的讽刺点:世界顶级 AI 研究员正在构建 recursive auto-research,从而研究出可能替代自己工作的系统。他还指出这是 model routing 的大周,提到 Stripe 传闻以 10B 美元收购 OpenRouter,Cursor Router 在周三发布,Runway Router 在昨天发布。除此之外,Databricks、Vercel、Cloudflare、Dataiku、AWS 和 Google 也都有 routers,虽然同一个词背后的实现差异很大。对 builders 来说,model routing 正在从基础设施细节变成产品层能力,因为不同模型的成本、速度、能力和可用性需要动态调度。Matt 的观察提醒大家,不要把 router 当成单一品类,它可能覆盖支付、开发工具、视频生成、云平台和企业数据栈里的不同问题。

Builder Zara Zhang

Zara Zhang 说她现在最想从任何模型里得到的第一件事是 speed,因为 intelligence 已经足够好。她认为每个任务等待 1 到 5 分钟是最糟的窗口:太短,无法进入 deep work;太长,又只能盯着屏幕,于是用户会去刷 X。她还提出,如果把 agent 带进 chat groups 和 meetings,聊天记录和会议 transcript 就会变成 PRDs。这个判断很有启发:过去工作文化更偏向擅长写作的人,现在 verbal communicators 也会获得同等机会,因为 agents 不在乎信息是口头还是书面产生的。她还补充,SF 的主要好处是当你尝试做疯狂的事时,人们会觉得 admirable,而不是 crazy。整体看,她关注的是 agent 改变工作节奏、组织记忆和创业文化的方式。

Every CEO Dan Shipper

Dan Shipper 对 Claude Opus 5 给出了偏谨慎的 Day 0 评价:它很难让人喜欢。他和 Every 团队测试了 coding、writing、knowledge work 和内部 agent,发现 Opus 5 会和指令争辩、在工作完成前停止,并且与他们现有的 skills 和 plugins 配合不好。随后他们删除旧有 skills、从头开始,Opus 5 的表现明显改善,甚至出现 flashes of brilliance。他的核心提醒是,Opus 5 可能会破坏 backward compatibility,使用既有 workflows 的团队要小心。他还提到 medium 或 low effort 反而更好,因为给它更多 thinking time 可能会增加烦人的行为。Dan 的结论是,Opus 5 有类似 Fable 的性格,但没有 Fable 的最高上限,因此在他的日常工作流里处于尴尬中间地带。

Sam Altman

Sam Altman 表态希望美国在 AI 的 open source 和 proprietary models 两条线上都获胜,并称乐见相关进展。虽然这条推文本身很短,但它呼应了当天围绕 open weights models 的广泛讨论。它的重点是双轨竞争,而不是在开放和封闭之间做单选。对 builders 来说,这种立场意味着应用层可能同时受益于开放模型的可定制和闭源 frontier models 的最高能力。它也与 Aaron Levie、Amjad Masad 等人关于 open weights 的讨论形成同一条产业线索。

Claude

Claude 官方宣布 Opus 5 已面向所有 paid plans 和 Claude API 提供,价格与 Opus 4.8 相同。它是 Claude Max 的默认模型,也是 Claude Pro 上最强的模型,同时还提供 Fast mode,速度约为默认模式的 2.5 倍。Claude 还强调 Opus 5 在 cybersecurity tasks 上强于 Opus 4.8,但在 exploit development 上仍显著落后于 Mythos 5。安全策略的目标是允许开发者识别和修复软件漏洞,同时阻止高风险用途。根据 automated behavioral audit,Opus 5 是 Claude 迄今最 aligned 的模型,相比其他模型 reckless 或 deceptive behavior 比率最低,对 Claude Constitution 的遵循最强。对 builders 来说,这组信息同时覆盖了价格、产品可用性、速度模式、安全边界和行为对齐。

官方博客

Anthropic Engineering

Anthropic 的工程博客《How we contain Claude across products》讨论了一个核心变化:一年前他们会直接拒绝让 Claude 拥有足以影响内部服务的访问权限,但今天这种访问已经成为常规,并显著提升了开发者生产力。文章把风险拆成两部分:失败发生的可能性,以及失败可能造成的损害;随着模型和 safeguards 进步,前者在下降,但 agent 能访问的系统越多,理论 blast radius 就越大。Anthropic 认为 agent 安全不能只靠 human-in-the-loop,因为 Claude Code telemetry 显示用户会批准约 93% 的 permission prompts,审批越多,监督越疲劳。因此他们推动 Claude Code auto mode,用自动化的安全批准减少 approval fatigue,但也承认概率防御永远不可能 100% 有效。文章重点转向 containment,也就是不只监督 agent 做了什么,而是限制 agent 能接触什么,包括 process sandboxes、VMs、filesystem boundaries 和 egress controls。Anthropic 将 agent 风险分为 user misuse、model misbehavior 和 external attackers,并指出外部内容如 MCP servers、third-party plugins、web search tools 都可能把不受控内容带入上下文。一个关键例子是,audited connector 不等于 audited data,GitHub connector 通过安全检查也可能把被污染的 README 加载给模型。对 builders 来说,这篇文章的实际启发是:agent 产品要把权限、环境隔离、外部内容边界和模型层防御一起设计,不能只依赖用户点确认或模型“应该不会乱做”。

播客

No Priors — Building an Autonomous Delivery Experience with DoorDash Co-Founders Andy Fang and Stanley Tang

核心要点:DoorDash 正在把 food delivery 从“人点餐、人配送”的应用,重构成 agentic commerce、robotics 和 multimodal fleet 共同驱动的本地履约网络。

Andy Fang 和 Stanley Tang 是 DoorDash cofounders。素材里提到 DoorDash 已经围绕 robotics 投入了八年左右,并且网络规模涉及 9,000,000 Dashers 和每年 3,000,000,000 deliveries。值得关注的是,他们讨论的不是把 AI 塞进搜索框做一个更聪明的推荐,而是让 AI 直接改变消费者发现餐厅、购买杂货、补货和组织多人订单的方式。

第一个高密度信号来自 Ask DoorDash。DoorDash 早期曾看好 voice 作为入口,但真正落地的是自然对话式体验:用户可以把脑子里的模糊需求直接表达出来,而不是做关键词优化。结果在餐厅场景里,使用 Ask DoorDash 的路径中有 50% 会导向用户从未下单过的餐厅;在 grocery 场景里,basket size 高出约 40%。这说明 AI 不是只提升转化率的小组件,它可能打开原本被搜索和筛选摩擦压住的 latent demand。

第二个信号是 agent 需要接入更多真实上下文。用户可以拍冰箱照片,让 DoorDash 帮忙补货;也可以做 meal planning,加入 dietary constraints,或者让它为周末家庭 pasta dinner 准备食材。Andy 给出的更具体例子是办公室 pantry shelf:摄像头看到货架快空了,就能触发 DoorDash 补货请求。这里的关键不是“聊天点单”,而是 agent 逐步参与现实世界的库存、偏好和例行任务。

第三个信号是 DoorDash 对 robotics 的时间尺度。Stanley 说他们从 2018 年就开始研究 autonomy 和 robotics,当时这还不是显然会爆发的方向。他回顾 DoorDash 的创业原点也是实验:Stanford 宿舍里的 politoidelivery.com,八个 PDF menus 和一个 Google Voice phone number。robotics 也不是一开始就要自建硬件,而是他加上半个工程师时间的 skunkworks project,先探索、合作、学习,再判断哪些基础设施和运营环节必须自己补上。

第四个信号是,自动化不一定意味着人类配送员减少。Stanley 的判断很反直觉:“十年后,我们可能会有更多 Dashers 在配送,而不是更少。”他的理由是 DoorDash 业务还在增长,素材里提到同比增长 25%,未来还想做到 5x 或 10x;仅靠人力供给不现实,但需求变大后也不会只靠机器人覆盖。更可能出现的是 human Dashers、DOT、robotics、drones、Waymos 和 sidewalk robots 共同组成的 multimodal fleet。

对 builders 的启发很直接:agentic commerce 不是把现有 app 改成聊天 UI,而是重新设计需求表达、上下文接入、自动触发、履约能力和成本结构。DoorDash 的案例尤其说明,AI 产品一旦进入现实世界交易和物流,真正的壁垒会从模型能力扩展到网络数据、运营系统、供应侧能力和长期实验耐心。