X / 推特
Google Labs VP Josh Woodward
Josh Woodward 展示了 Gemini Spark 的一个实用场景:用户可以把学校日历 PDF 丢进 Gemini,让它把所有 “No School” 日期添加到 Google Calendar。这个例子强调 Gemini 不只是聊天界面,而是在替用户完成跨应用的具体任务。Gemini Spark 目前已面向美国所有 Google AI Pro 订阅用户上线,接下来会扩展到全球。对 builders 来说,这类 PDF 到日历的工作流很典型,因为它把非结构化文件、自然语言指令和个人工具链连接起来。它也说明 AI 产品竞争正在从“回答得好不好”转向“能否可靠操作用户已有的软件环境”。
https://x.com/joshwoodward/status/2080771183944073347
Claude Code Boris Cherny
Boris Cherny 认为 Opus 5 不只是 coding、data analysis、design、biology 和 knowledge work 上的强模型,更让他兴奋的是它在 prompt injection 上的进步。他提到系统卡里埋着一个重要细节:在 PI evals 和 red teaming 中,Opus 5 很难被成功 prompt inject。更关键的是,强模型 alignment、prompt injection probes 和 Claude Code 的 Auto Mode 叠加后,prompt injection attack 的成功率会降到约 0。这个方向值得 builders 关注,因为 agent 越能操作真实工具,prompt injection 就越接近产品级安全问题,而不只是模型评测问题。Boris 的表述也暗示 Anthropic 会继续公开更多关于多层防御的细节。
https://x.com/bcherny/status/2080713091688583312
Codex & ChatGPT Thibault Sottiaux
Thibault Sottiaux 宣布 ChatGPT Work 已经面向全球所有付费计划开放,覆盖 mobile、web 和 desktop。他形容它像是给 ChatGPT 装上 jetpack,重点是把 ChatGPT 从单次问答推进到更强的工作执行状态。虽然推文没有展开功能细节,但“all paid plans”和“already on your phone”说明这不是小范围实验,而是面向既有付费用户的广泛分发。对 builders 来说,值得注意的是 AI 工作流能力正在从桌面 IDE 或专门 agent 工具进入通用 ChatGPT 入口。移动端可用也会改变使用场景,用户可以在手机上接入更持续的工作线程。
https://x.com/thsottiaux/status/2080876712439747052
AI 教程作者 Peter Yang
Peter Yang 分享了一个具体工作流:躺在床上用 ChatGPT Voice 跟 Codex 协作完成工作。他指出,要把这种方式用好,需要记住自己所有 long running threads 的名字。这个观察很小,但很实用:当语音成为控制 agent 的入口,线程命名、上下文管理和任务可恢复性会变成关键体验。传统 GUI 里靠视觉列表定位任务,语音模式里则更依赖用户能准确说出上下文对象。对 builders 来说,这提示了一个产品细节:长期任务的命名、检索和口语化调用,可能会决定 voice agent 是否真的可用。
https://x.com/petergyang/status/2080793867960643823
Meta AI Sr Director Madhu Guru
Madhu Guru 认为未来几年会有一个巨大机会:把混乱的真实工作流接到 foundation models 上,并让模型在特定领域表现出色。这个能力不只是会调 prompt,而是要理解工作如何发生、设计 evals、通过 post-training 改进模型,并建立持续反馈回路。他把这定义为从通用模型到领域专家模型的关键路径。今天这种能力仍主要集中在少数实验室里,因此外部 builders 如果能掌握这套方法,会有很大的空间。他还补了一句更尖锐的判断:有些人应该被要求用 AI 写作。两条推文合起来看,他关注的是 AI 能否真正嵌入生产流程,而不是停留在单点内容生成。
https://x.com/realmadhuguru/status/2080707454422413487
Claude Code Cat Wu
Cat Wu 强调 Claude Opus 5 很适合 long-running autonomous work,并邀请用户试用反馈。她的角度与 Claude Code 场景直接相关:模型是否能长时间维持目标、上下文和执行质量,是 coding agent 能否从助手变成实际执行者的关键。这里没有展开具体 benchmark,但“long-running autonomous work”本身说明 Opus 5 的卖点不只是单轮解题能力。对 builders 来说,长任务能力意味着产品设计要关注 checkpoint、恢复、权限和失败处理,而不是只看一次回答。她的表述也呼应了 Anthropic 近期对 Claude Code 和 agentic work 的整体叙事。
https://x.com/_catwu/status/2080707593115516985
Claude Code Thariq
Thariq 说 Anthropic 为最新模型移除了约 80% 的 Claude Code system prompt,并总结了他们对 system prompts、skills 和 Claude.MDs 的经验。这个数字很关键,因为它说明更强模型可能不需要旧模型时代那种冗长、细碎的行为约束,反而可能从更简洁的指令中获益。他还建议把 Opus 5 和 Fable 搭配,用于 planning、brainstorming 或修最难的 bugs。对 builders 来说,这意味着模型升级不一定是无缝替换,prompt、skills 和项目说明文件都可能需要重新设计。Thariq 还补充相关内容也发布在 Claude Blog,说明这不是单纯个人感受,而是 Anthropic 正在系统化沉淀的工程经验。
https://x.com/trq212/status/2080710971228918066
Replit CEO Amjad Masad
Amjad Masad 把焦点放在 open weight models 的政策立场上,公开追问 Anthropic 是否会签署相关倡议,并建议 Anthropic 员工向领导层确认是否支持禁止 open weight models。这个问题不是模型技术细节,而是 AI 生态的产业结构问题:开放权重是否应被限制,直接影响创业公司、开发者和下游产品的选择空间。他同时提醒,如果很久没用 Replit,现在会有很大惊喜。两条推文放在一起看,一边是对开放模型政策的公开施压,一边是对 Replit 产品进展的暗示。对 builders 来说,Amjad 关注的是应用层工具能否在开放生态中继续快速迭代。
https://x.com/amasad/status/2080850075358826871
Anthropic Research Alex Albert
Alex Albert 分享了 Opus 5 发布中他最喜欢的一些图表,并强调团队在跨领域 token efficiency 上投入了大量工作。他的重点不是单纯提高 intelligence bar,而是在保持或提升能力的同时,让模型用更少 token 完成任务。他表示 Opus 5 使用起来很 smooth,并且在许多 coding tasks 上比 Fable 5 更偏好它。对 builders 来说,token efficiency 是很实际的产品指标,因为它会影响延迟、成本和长上下文任务的稳定性。Alex 的观察也说明模型体验不只由最高分数决定,还由执行流畅度和跨任务成本结构决定。
https://x.com/alexalbert__/status/2080703118086693121
Box CEO Aaron Levie
Aaron Levie 连续讨论了 open weights AI 和 Claude Opus 5 在企业文档任务上的表现。他认为 open weights 能加速 AI 在经济中的扩散,为不同客户需求提供更多选择,降低某些 workload 成本,并让高度垂直的 post-training 更容易发生。Box 已签署支持 open weights 的信件,他强调 open vs. closed 不是零和战争,强 open weights models 会推动整个行业前进。在 Box 内部测试中,Claude Opus 5 相比 Opus 4.8 在 Box AI Agent 的 Complex Work Eval 上有明显提升,尤其是复杂企业文档端到端任务。具体例子包括 due diligence 提升 17%、life sciences 提升 30%、legal 提升 12%、technology 提升 19%、healthcare 提升 13%。他的结论是,Opus 5 的 reasoning、analytical 和 data processing 能力对 enterprise agentic use-cases 会很有力,并且很快可以在 Box AI Studio 中构建相关 agents。
https://x.com/levie/status/2080704871934931221
Y Combinator CEO Garry Tan
Garry Tan 在 YC Startup School 2026 前一天分享了 Chase Center 的 rehearsal,并欢迎未来创始人来到 San Francisco。更值得关注的是他对 AI 生产力扩散速度的判断:要获得宏观生产力提升,managers 和 CEOs 必须批准 radically different staffing 和 workflow plans。他认为到目前为止企业管理层还没有真正做到这一点,因此这种变化可能需要 10 年,而不是 2 年。这个判断对 builders 很重要,因为它把 AI adoption 的瓶颈从模型能力转移到组织授权和工作流重构。换句话说,即使工具已经可用,宏观生产力也不会自动出现,除非管理层愿意改变人员配置和流程设计。
https://x.com/garrytan/status/2080699367883980924
FirstMark VC Matt Turck
Matt Turck 提到一个被低估的讽刺点:世界顶级 AI 研究员正在构建 recursive auto-research,从而研究出可能替代自己工作的系统。他还指出这是 model routing 的大周,提到 Stripe 传闻以 10B 美元收购 OpenRouter,Cursor Router 在周三发布,Runway Router 在昨天发布。除此之外,Databricks、Vercel、Cloudflare、Dataiku、AWS 和 Google 也都有 routers,虽然同一个词背后的实现差异很大。对 builders 来说,model routing 正在从基础设施细节变成产品层能力,因为不同模型的成本、速度、能力和可用性需要动态调度。Matt 的观察提醒大家,不要把 router 当成单一品类,它可能覆盖支付、开发工具、视频生成、云平台和企业数据栈里的不同问题。
https://x.com/mattturck/status/2080645582209663049
Builder Zara Zhang
Zara Zhang 说她现在最想从任何模型里得到的第一件事是 speed,因为 intelligence 已经足够好。她认为每个任务等待 1 到 5 分钟是最糟的窗口:太短,无法进入 deep work;太长,又只能盯着屏幕,于是用户会去刷 X。她还提出,如果把 agent 带进 chat groups 和 meetings,聊天记录和会议 transcript 就会变成 PRDs。这个判断很有启发:过去工作文化更偏向擅长写作的人,现在 verbal communicators 也会获得同等机会,因为 agents 不在乎信息是口头还是书面产生的。她还补充,SF 的主要好处是当你尝试做疯狂的事时,人们会觉得 admirable,而不是 crazy。整体看,她关注的是 agent 改变工作节奏、组织记忆和创业文化的方式。
https://x.com/zarazhangrui/status/2080829737044439444
Every CEO Dan Shipper
Dan Shipper 对 Claude Opus 5 给出了偏谨慎的 Day 0 评价:它很难让人喜欢。他和 Every 团队测试了 coding、writing、knowledge work 和内部 agent,发现 Opus 5 会和指令争辩、在工作完成前停止,并且与他们现有的 skills 和 plugins 配合不好。随后他们删除旧有 skills、从头开始,Opus 5 的表现明显改善,甚至出现 flashes of brilliance。他的核心提醒是,Opus 5 可能会破坏 backward compatibility,使用既有 workflows 的团队要小心。他还提到 medium 或 low effort 反而更好,因为给它更多 thinking time 可能会增加烦人的行为。Dan 的结论是,Opus 5 有类似 Fable 的性格,但没有 Fable 的最高上限,因此在他的日常工作流里处于尴尬中间地带。
https://x.com/danshipper/status/2080700057892815114
Sam Altman
Sam Altman 表态希望美国在 AI 的 open source 和 proprietary models 两条线上都获胜,并称乐见相关进展。虽然这条推文本身很短,但它呼应了当天围绕 open weights models 的广泛讨论。它的重点是双轨竞争,而不是在开放和封闭之间做单选。对 builders 来说,这种立场意味着应用层可能同时受益于开放模型的可定制和闭源 frontier models 的最高能力。它也与 Aaron Levie、Amjad Masad 等人关于 open weights 的讨论形成同一条产业线索。
https://x.com/sama/status/2080683363174945065
Claude
Claude 官方宣布 Opus 5 已面向所有 paid plans 和 Claude API 提供,价格与 Opus 4.8 相同。它是 Claude Max 的默认模型,也是 Claude Pro 上最强的模型,同时还提供 Fast mode,速度约为默认模式的 2.5 倍。Claude 还强调 Opus 5 在 cybersecurity tasks 上强于 Opus 4.8,但在 exploit development 上仍显著落后于 Mythos 5。安全策略的目标是允许开发者识别和修复软件漏洞,同时阻止高风险用途。根据 automated behavioral audit,Opus 5 是 Claude 迄今最 aligned 的模型,相比其他模型 reckless 或 deceptive behavior 比率最低,对 Claude Constitution 的遵循最强。对 builders 来说,这组信息同时覆盖了价格、产品可用性、速度模式、安全边界和行为对齐。
https://x.com/claudeai/status/2080699515271528827
官方博客
Anthropic Engineering
Anthropic 的工程博客《How we contain Claude across products》讨论了一个核心变化:一年前他们会直接拒绝让 Claude 拥有足以影响内部服务的访问权限,但今天这种访问已经成为常规,并显著提升了开发者生产力。文章把风险拆成两部分:失败发生的可能性,以及失败可能造成的损害;随着模型和 safeguards 进步,前者在下降,但 agent 能访问的系统越多,理论 blast radius 就越大。Anthropic 认为 agent 安全不能只靠 human-in-the-loop,因为 Claude Code telemetry 显示用户会批准约 93% 的 permission prompts,审批越多,监督越疲劳。因此他们推动 Claude Code auto mode,用自动化的安全批准减少 approval fatigue,但也承认概率防御永远不可能 100% 有效。文章重点转向 containment,也就是不只监督 agent 做了什么,而是限制 agent 能接触什么,包括 process sandboxes、VMs、filesystem boundaries 和 egress controls。Anthropic 将 agent 风险分为 user misuse、model misbehavior 和 external attackers,并指出外部内容如 MCP servers、third-party plugins、web search tools 都可能把不受控内容带入上下文。一个关键例子是,audited connector 不等于 audited data,GitHub connector 通过安全检查也可能把被污染的 README 加载给模型。对 builders 来说,这篇文章的实际启发是:agent 产品要把权限、环境隔离、外部内容边界和模型层防御一起设计,不能只依赖用户点确认或模型“应该不会乱做”。
https://www.anthropic.com/engineering/how-we-contain-claude
播客
No Priors — Building an Autonomous Delivery Experience with DoorDash Co-Founders Andy Fang and Stanley Tang
核心要点:DoorDash 正在把 food delivery 从“人点餐、人配送”的应用,重构成 agentic commerce、robotics 和 multimodal fleet 共同驱动的本地履约网络。
Andy Fang 和 Stanley Tang 是 DoorDash cofounders。素材里提到 DoorDash 已经围绕 robotics 投入了八年左右,并且网络规模涉及 9,000,000 Dashers 和每年 3,000,000,000 deliveries。值得关注的是,他们讨论的不是把 AI 塞进搜索框做一个更聪明的推荐,而是让 AI 直接改变消费者发现餐厅、购买杂货、补货和组织多人订单的方式。
第一个高密度信号来自 Ask DoorDash。DoorDash 早期曾看好 voice 作为入口,但真正落地的是自然对话式体验:用户可以把脑子里的模糊需求直接表达出来,而不是做关键词优化。结果在餐厅场景里,使用 Ask DoorDash 的路径中有 50% 会导向用户从未下单过的餐厅;在 grocery 场景里,basket size 高出约 40%。这说明 AI 不是只提升转化率的小组件,它可能打开原本被搜索和筛选摩擦压住的 latent demand。
第二个信号是 agent 需要接入更多真实上下文。用户可以拍冰箱照片,让 DoorDash 帮忙补货;也可以做 meal planning,加入 dietary constraints,或者让它为周末家庭 pasta dinner 准备食材。Andy 给出的更具体例子是办公室 pantry shelf:摄像头看到货架快空了,就能触发 DoorDash 补货请求。这里的关键不是“聊天点单”,而是 agent 逐步参与现实世界的库存、偏好和例行任务。
第三个信号是 DoorDash 对 robotics 的时间尺度。Stanley 说他们从 2018 年就开始研究 autonomy 和 robotics,当时这还不是显然会爆发的方向。他回顾 DoorDash 的创业原点也是实验:Stanford 宿舍里的 politoidelivery.com,八个 PDF menus 和一个 Google Voice phone number。robotics 也不是一开始就要自建硬件,而是他加上半个工程师时间的 skunkworks project,先探索、合作、学习,再判断哪些基础设施和运营环节必须自己补上。
第四个信号是,自动化不一定意味着人类配送员减少。Stanley 的判断很反直觉:“十年后,我们可能会有更多 Dashers 在配送,而不是更少。”他的理由是 DoorDash 业务还在增长,素材里提到同比增长 25%,未来还想做到 5x 或 10x;仅靠人力供给不现实,但需求变大后也不会只靠机器人覆盖。更可能出现的是 human Dashers、DOT、robotics、drones、Waymos 和 sidewalk robots 共同组成的 multimodal fleet。
对 builders 的启发很直接:agentic commerce 不是把现有 app 改成聊天 UI,而是重新设计需求表达、上下文接入、自动触发、履约能力和成本结构。DoorDash 的案例尤其说明,AI 产品一旦进入现实世界交易和物流,真正的壁垒会从模型能力扩展到网络数据、运营系统、供应侧能力和长期实验耐心。