X / 推特
Latent Space 播客与 AI Engineer 大会的 Swyx
Swyx 提出了一个叫 Loopcraft 的概念:他认为下个世纪整场游戏的核心,就是看谁能最有效地把循环(loop)一层层叠起来。在每个阶段的早期,知道出问题时何时往下钻一层循环(为了可靠性)很值钱,但随着模型变强,知道如何往上跳一层循环(为了杠杆)可能更值钱。他撂下一句狠话:搞不明白这件事的人,输给搞明白的人时别抱怨。另一条推里他解释了自己动手做 vibecoding 平台的最大动机:他很喜欢 Vercel、Cloudflare、Netlify,但没有一家真正帮你闭环,没人在出错时把你拉回正轨、在系统挂掉时主动 ping 你,而系统总是会挂。每个项目都要重复一遍 webmaster 式的基础设施配置,这边 npx posthog wizard、那边 npx arize skills,他只想把这些一次性吞进 One Thing 里解决。他还祝贺了 Ona 团队加入 OpenAI,并附上对方的演讲链接,暗示里面有 Codex 下一步方向的 alpha。整体看他这几天的关注点很统一:agent 时代的杠杆在于谁把反馈循环和基础设施闭环做掉。
https://x.com/swyx/status/2065307558198567206
https://x.com/swyx/status/2065264832056889711
https://x.com/swyx/status/2065176231453282777
OpenAI Codex 与 ChatGPT 团队的 Thibault Sottiaux
Thibault 发推确认了 Codex 与 Ona 的结合,配文就是简短的 "Codex 🤟 Ona"。他说自己对接下来与 Johannes 及其团队一起构建未来感到无比兴奋。结合 Swyx 同日对 Ona 加入 OpenAI 的祝贺,这是 OpenAI 在 agentic coding 方向又一次明确的团队补强。对关注 Codex 路线图的人来说,这是值得记下的信号:Ona 团队的能力会直接进入 Codex 的演进路径。
https://x.com/thsottiaux/status/2065193272952422852
Replit CEO Amjad Masad
Amjad 这几天密集分享 Fable 模型落地 Replit 后的体感。他说这是他第一次在 vibecoding 时零挫败、完全进入心流,以至于把积压的想法都做完了,开始没东西可做。他由此给出一个判断:vibecoding 不再需要更高的 IQ,只需要更便宜更快的模型,然后这件事就算完成了。成本方面他夸了 Replit Agent 团队,说他们把 Fable 的成本做到了可以接受的程度,而且因为模型犯错少,净算下来反而更省钱。他还展示了在 Replit 上创业的样子:一块画布上同时放着你的 web 应用、移动应用、营销物料和 App Store 素材,点进任何一块就能继续构建、修改、生成新东西。串起来看,他在传递的信息是 Replit 想把"开公司"这件事整体装进一个 agent 原生的工作台里。
https://x.com/amasad/status/2065236013627351551
https://x.com/amasad/status/2065259509082411233
https://x.com/amasad/status/2065241626436583860
Vercel CEO Guillermo Rauch
Guillermo 转发了一个 Vercel + Shopify 的实战案例:开发者 foda 用 v0 加 Cursor 搭了一个完全定制的 Next.js headless storefront,2 分钟内处理了 500 多个订单。他对此的总结是长期看好 web:任何人现在都可以走完 dream、build、ship、sell 的完整链路。他还简短预告了 Vercel + Grok 的组合,没有展开细节。两条推合起来,他在强调 Vercel 正在同时接入电商(Shopify)和模型(Grok)两端,把自己放在 AI 建站到卖货链路的中间位置。
https://x.com/rauchg/status/2065116986678624419
https://x.com/rauchg/status/2065118448947216681
Box CEO Aaron Levie
Aaron 公布了 Box 刚做的一项调研:他们访问了美国、日本、欧洲共 1,640 位 IT 负责人,了解 agentic AI 的采用情况。最突出的发现是,AI 采用程度最高的公司,反而计划扩招最多的人。他承认这个数据有多种解读方式、变量也混杂,但认为逻辑其实很直观:生产力提升最大的公司,有意愿也有能力把收益再投回业务里,让增长继续。他直接反驳了"AI 消灭工作岗位"的叙事:那个叙事假设公司对要做的事情总量是固定的,而实际发生的是,公司因为 AI 想启动更多工程项目、卖给更多客户、自动化更多流程,这些都带来更多需要人做的工作。对在企业侧做 AI 的人,这份 1,640 人样本的调研是个可引用的论据。
https://x.com/levie/status/2065287110744297809
Y Combinator CEO Garry Tan
Garry 花了两条推驳斥一篇否定"天才儿童"概念的文章。作者 Katie Arnold-Ratliff 引用了一项 35 年追踪研究,677 个天才儿童中只有 12.3% 达到了"卓越"(正教授、财富 500 强高管、联邦法官),并以此证明这个分类是谎言。Garry 指出这恰恰是自我打脸:普通人群达到这种稀有成就的基率远低于此,接近于零而不是两位数百分比,12.3% 恰恰说明选拔机制运转得极好。他还点名社区注释已经指出是作者自己对"天才"的理解有问题,并呼吁别再让作者靠撒谎来圈内表态显得很酷。另一条推他分享了加州州长 Gavin Newsom 来 YC 参加 garryslist 活动,双方聊了 little tech、YIMBY、如何阻止资产没收税,以及如何在让加州人都过得好的同时延续加州的创新浪潮。他这几天一边在公共话语场上对线,一边在政商层面为创新政策铺路。
https://x.com/garrytan/status/2065314389196959813
https://x.com/garrytan/status/2065313198237180238
https://x.com/garrytan/status/2065298785463579053
OpenClaw 创建者 Peter Steinberger
Peter 分享了 OpenClaw 安全加固工作的一个具体进展:此前做媒体格式转换需要 shell out 到 ffmpeg,这会扩大攻击面。下个版本里这件事可以通过 wasm 完成,在他们的使用场景下性能相近。这是"减少 surface risk"思路的一个干净案例:把外部进程调用换成沙箱内的 wasm 执行,攻击面显著收窄。他还顺手展示了拉 Chris 用 Codex 提 PR 的协作日常,以及感叹写 Mac 应用至今仍然很难。对做 agent 基础设施的人,ffmpeg 转 wasm 这条值得参考。
https://x.com/steipete/status/2064999763397980286
https://x.com/steipete/status/2065176989359808636
https://x.com/steipete/status/2065132980398444945
Every CEO Dan Shipper
Dan 分享了一次不太顺利的 Fable 使用体验。他给 Fable 设置了一个大项目,放着让它自己跑,一小时后回来发现它在 10 分钟时就触发了安全护栏(safeguards),降级回退到了 4.8。他的反应是直接回去用 Codex。这是一线重度用户对新模型的真实反馈:长时间自主运行的稳定性,比峰值能力更决定他们留在哪个工具上。
https://x.com/danshipper/status/2065269582961737957
官方博客
Anthropic Engineering: How we contain Claude across products
Anthropic 工程团队系统性复盘了三款 agent 产品(claude.ai、Claude Code、Claude Cowork)的隔离架构和踩过的坑。核心立场是:先在环境层做硬隔离(沙箱、VM、出口流量控制),再在模型层做概率性防御。几个关键数据:Claude Code 用户曾经批准了大约 93% 的权限弹窗,审批疲劳让人工监督形同虚设;上线 OS 级沙箱后权限弹窗减少了 84%;Claude Opus 4.7 在 Gray Swan 的 Agent Red Teaming 基准上单次攻击成功率约 0.1%,100 次自适应尝试后约 5% 到 6%。文章坦诚披露了多起真实事故:内部红队钓鱼让员工粘贴恶意 prompt,25 次重试中 Claude 24 次完成了 AWS 凭证外泄;攻击者用自己的 Anthropic API key 通过白名单内的 api.anthropic.com 把用户文件传到自己账户。后者带来一个重要的概念转变:"域名白名单不是目的地过滤器,而是能力授予(capability grant)"。另一条反复出现的教训是"自己造的轮子最脆弱":gVisor、seccomp、hypervisor 这些久经考验的原语都没出事,出事的全是他们自研的 proxy 和配置加载逻辑。对所有在做 agent 产品的团队,这是近期信息密度最高的一篇安全工程实录。
https://www.anthropic.com/engineering/how-we-contain-claude
播客
Training Data — Google DeepMind's Logan Kilpatrick: Why the Model Eats the Harness
核心要点:今天大家抢着自研的 agent harness,12 个月内会被模型本身"吃掉",alpha 会转移到别处。
Logan Kilpatrick 负责 Google AI Studio 和 Gemini API,是 Google 面向开发者生态的核心人物。这期对话正值 Google IO 之后,他罕见地把 Google 内部的 agent 战略、coding 竞赛的真实处境和世界模型路线一次性讲透了。
第一个重点是 Antigravity 的真实定位。它不只是一个 IDE,而是一套生态:核心 IDE、web 端 agent 体验、CLI、SDK 都有,更关键的是同一个 agent harness 正在成为 Google 全部产品的新"through line",搜索、Gemini app、Cloud、AI Studio 里的 agent 功能都由它驱动。历史上是 Gemini 模型串起 50 多个 Google 产品,现在这根线变成了 harness 本身。基础 harness 大约 80% 通用,再针对 vibe coding 或 7x24 消费级 agent 等场景做特化。
第二是他对 coding 竞赛的坦率复盘。主持人直说开发者朋友现在 Claude 和 Codex 大约五五开,很少有人用 Gemini,他没有回避。他给的解释有三层:去年 12 月 Gemini 3 发布时叙事还是"Google 赢了",结果假期之后 agentic coding 的浪潮立刻把叙事翻了页,说明变化有多快;做不出长程 SWE 级 coding 模型的根本原因是你必须自己拥有一个这样的产品来转飞轮,这正是 Windsurf 交易和 Antigravity 诞生的原因;外界还忽略了预训练窗口期,3.5 Flash 仅靠 post-training 就超过了之前所有 pro 模型的编码能力,大规模预训练的成果还在路上。
第三是标题里的判断。两年前"模型"就是一组权重,现在所谓模型已经是围绕权重的一整套系统:工具调用、托管搜索、代码执行、容器运行时。脚手架总是领先模型几步,然后被模型消化吸收。他由此预言:现在人人都说"alpha 在 harness 里",这句话 12 个月后大概率不成立,并提议业界应该搞一个 harness bench,测各家模型适配不同 harness 的能力。
数据方面有几个值得记的点:AI Studio 上周以来已经造出了 350,000 个 Android 应用,其中大量是以前根本不会被造出来的个人应用;应用类别里金融(很多和 crypto 相关)约占 20%,游戏曾经占 20%;他预测今年之内,路人就能 vibe code 出真正好玩的游戏,瓶颈不在模型质量,而在懂游戏的人还没把脚手架搭对。
谈到 GDM 文化时他引了一句他最爱的硅谷台词:"我们不能让别人比我们更能让世界变得更好。"他说现在整个行业就是这个状态,大家在争谁能把世界变得更好,这么一框定就显得很滑稽,所以这件事本质上不是零和的。
对工具层创业者,这期最实际的启示是:别把壁垒押在 harness 工程上,押在垂直领域的专注和对客户的理解上,因为"专注是创业公司的超能力",而 harness 的红利窗口正在关闭。