X / 推特
意图、强度与 AI 工程社区 Builder Swyx
Swyx 继续把注意力放在 AEO,也就是 AI Engine Optimization 上。他认为,如果还没有让 Codex、Claude、Gemini 或 Devin 每周自动研究如何改进 SEO / AEO,就是错过了一个仍然“免费”、本该商品化但还没有被充分利用的机会。这里的重点不是传统搜索排名,而是产品、内容和公司如何被 AI 系统发现、引用和推荐。他进一步提出一个更细的问题:如果用 Claude 来优化 AEO,它是否会更偏向提升 Claude 内部的可见性,而不是提升跨模型的通用 AEO。这个问题把 AEO 从“怎么被 AI 看见”推进到“被哪类模型看见,以及优化是否会过拟合某个模型生态”。对 builder 来说,这提示了一个新的自动化工作流:让 agent 定期研究、测试、更新面向 AI 搜索和回答系统的可见性策略。
https://x.com/swyx/status/2078244735794413786
OpenAI Codex & ChatGPT Thibault Sottiaux
Thibault Sottiaux 宣布 Codex 和 ChatGPT Work 的付费用户使用限制被重置。他把这次调整归因于团队在高速迭代,同时仍在支撑快速扩张的基础设施需求。对重度使用 Codex 的开发者来说,这类额度重置直接影响周末能否继续跑长任务、调试 agent 工作流和做代码实验。他还转发式提到 GPT-5.6 Sol 被确认是一个“extremely good model”,但没有给出更多评测细节或适用场景。两条信息放在一起,核心信号是 OpenAI 正在同时推进模型体验和使用额度层面的运营调整。可操作的点是,付费用户可以重新检查 Codex 与 ChatGPT Work 的可用额度,并把原本因限制暂停的任务重新排入执行。
https://x.com/thsottiaux/status/2078320950488297917
AI 教程与访谈创作者 Peter Yang
Peter Yang 提到 Codex browser use “终于被击败”,但素材里没有展开具体机制,因此不能推断是安全绕过、能力失效还是某个测试案例被解决。更有信息密度的是他对 agent 交互方式的判断:整天盯着屏幕管理 agents 会让人疲惫,他更希望像打电话一样在户外通过语音给 agents 分配工作,并让它们用语音汇报状态。这个观点把 agent 产品的瓶颈从“能不能完成任务”转向“人类如何低成本管理多个任务流”。他还预告周末会发布一期与 Thariq 的内容,重点是 AI video workflows 和更多实践演示。对 AI builder 来说,这说明语音、状态汇报、异步代理管理可能会成为下一波工作流产品的重要交互层。
https://x.com/petergyang/status/2078276992470794531
Meta AI 高级总监 Madhu Guru
Madhu Guru 反驳了“Kimi 会伤害 Google”的简单叙事。他认为很多企业不会直接消费 Kimi,而会通过 Google Cloud 等平台获得模型能力,因为企业仍然需要 security、data residency、compliance,尤其是 chips 这类保障。换句话说,模型竞争不一定只是在模型公司之间分走收入,也可能让云平台把需求从一个口袋转到另一个口袋。他还指出,企业很难超越基础聊天机器人,核心原因是缺少构建 harnesses 和 evals 的人才。Evals 要能表达真实用例、覆盖 offline 和 online 场景,并帮助企业在 quality-cost-latency 曲线上选模型。Harness 则要独立于具体模型,负责 routing、multiagency orchestration、context management、tool calling 和 memory。最后他把 talent 定义为最稀缺的一环,因为前沿系统的真正难点不是接入模型,而是把评测、编排和运行时能力搭起来。
https://x.com/realmadhuguru/status/2078131628262752550
Anthropic Claude Code Thariq
Thariq 给出的实践建议很直接:在消耗大量 token 之前,先构建 mockups、schemas、data models、proof of concepts 等原型。他的判断是,原型能更早暴露方向是否值得继续,而不是等模型输出一大堆内容后才发现自己并不想要这个结果。对于 Claude Code 或类似编程 agent 工作流,这其实是在强调“先压缩不确定性,再扩大生成规模”。一个低保真 schema 或 mockup,往往比一段长 prompt 更能约束模型的输出空间。它也能让人类更早判断产品形态、数据结构和交互逻辑是否成立。对团队来说,这条建议可以转化为 agent 使用规范:复杂任务先让模型产出可检查的小样,再进入大规模实现。
https://x.com/trq212/status/2078189833445654714
Replit CEO Amjad Masad
Amjad Masad 转发并称赞了一个关于 chess history 的探索项目,认为 Replit 社区正在“ChessMaxxing”。素材没有提供该项目的具体功能、实现方式或内容细节,因此不能展开为完整产品评测。可保留的信息是,Replit 社区正在用平台构建偏知识探索或互动叙事类项目,而不仅是传统工具型应用。对 builder 来说,这类案例说明低门槛开发平台正在把历史、游戏和可视化探索结合起来。Amjad 的关注点也延续了 Replit 一贯的社区创作导向:让用户把兴趣主题快速变成可运行项目。
https://x.com/amasad/status/2078273728618877326
Vercel CEO Guillermo Rauch
Guillermo Rauch 宣布 Sandbox data for downloads,并用这条更新鼓励大家继续发布更多 agents。素材没有给出 Sandbox data 的完整产品说明,但可以确定它与 downloads 数据有关,并面向 agent 构建场景。对使用 Vercel Sandbox 的开发者来说,这意味着围绕下载数据的可观测性或可用性有所增强。它也呼应了当前 agent 产品的一条主线:当 agent 执行越来越多真实任务时,沙箱运行环境、数据产物和下载能力都需要变得更稳定。Guillermo 的表达重点不是单个 demo,而是把 Sandbox 作为 agent shipping 的基础设施。
https://x.com/rauchg/status/2078305023784620342
Box CEO Aaron Levie
Aaron Levie 讨论了 AI 成本下降对整个生态的影响。他认为 AI 越便宜,生态各层和终端客户越有机会受益,因为当前真正的瓶颈是能否把 AI 成功且低成本地部署到真实工作负载里。成本下降通常会带来总使用量上升,价值会流向 stack 的各个层次,而不只是某一个模型供应商。他补充了一个关键修正:即使更便宜、更调优的模型承担大量 token,frontier closed models 的需求也可能继续上升。原因是复杂任务的 orchestration 往往仍需要最强模型,而批量执行部分可以交给更便宜或更专门的模型。这种效率提升反而可能扩大 frontier spend,因为更多任务变得值得用 AI 去做。真正承压的可能是 margins,他判断 intelligence 最终可能会向基础设施栈的利润率靠拢。
https://x.com/levie/status/2078139206946459853
Builder Zara Zhang
Zara Zhang 给 building in public 的建议是,不要把内容创作当成额外工作,而是展示产品内部已经发生的工作。比如一个很短的 screen recording、第一版原型,或某个用户行为如何改变了设计。她强调 reasoning 比 production value 更重要,这对早期 builder 特别实用,因为内容不必被包装成高制作成本的发布稿。另一条观察是,几年前很多人还不适应会议录音,现在商业会议被录制已经近乎默认,而且录音对象不只是人类,也是 agents。她把这种变化视为技术改变文化的例子。两条合起来看,她关注的是产品工作如何自然外显,以及 AI agent 如何把组织沟通的默认行为改掉。
https://x.com/zarazhangrui/status/2078086930756202924
OpenClaw + OpenAI Peter Steinberger
Peter Steinberger 分享了 Codex 通过 browser 和 computer use 打开 Chrome、进入 GitHub PR、点击评论,并处理 macOS picker 以上传图片的过程。他的感受是既惊人又痛苦,因为整个链路只是为了上传一张图片,但“GitHub 没有 API”并不会阻止 agent 尝试完成任务。这个案例很有代表性:当 API 缺失时,agent 会退回到真实 GUI 操作,而 GUI 自动化的可靠性和成本都更难控制。他还提到自己让 Codex 跑在 VMs 里,这样不会抢走本机 app focus。另一条更新是,由于 codexbar icon customization 问题很多,他让 Codex 帮他做了一个 editor。对工具开发者来说,这两条都说明 agent 已经能承担周边开发和 GUI 操作,但隔离环境、焦点管理、系统 picker 这类“非代码细节”会成为真实可用性的关键。
https://x.com/steipete/status/2078318731785359634
Anthropic AI assistant Claude
Claude 官方说明了 Claude Fable 5 的订阅访问安排。自 July 20 起,Claude Fable 5 会包含在所有 Max 和 Team Premium plans 中,但使用量按 50% limits 计入。Pro 和 Team Standard 用户仍可通过 usage credits 使用 Fable,并会收到一次性 $100 credit。官方承认 Fable 的需求难以预测,所以此前采用分阶段方式加入订阅计划,并在获得更多 capacity 后多次延长访问。另一条说明是,对使用 Fable 最密集的计划,会在 50% usage 处标准化 access,以便用户更明确知道自己 plan 包含什么。对开发者和团队用户来说,重点是尽快确认自身 plan、额度和 credits 安排,因为这会影响是否把 Fable 放入日常工作流。
https://x.com/claudeai/status/2078302415804379218
官方博客
An update on recent Claude Code quality reports
Anthropic 复盘了过去一个月部分用户反馈 Claude 质量下降的问题,并确认影响来自三个独立变更,分别波及 Claude Code、Claude Agent SDK 和 Claude Cowork,API 未受影响。第一个问题是 March 4 将 Claude Code 默认 reasoning effort 从 high 改为 medium,初衷是降低长延迟和 token 消耗,但用户感知为 Claude Code 变笨;Anthropic 已在 April 7 回滚,并让 Opus 4.7 默认 xhigh,其他模型默认 high。第二个问题是 March 26 的缓存优化,本应在空闲超过一小时后只清理一次旧 thinking,却因为 bug 在之后每一轮持续清理,导致 Claude 丢失先前推理脉络,表现为健忘、重复和奇怪的工具选择;该问题已在 April 10 修复。第三个问题是 April 16 的系统提示词变更,意图减少冗长,但与其他 prompt 变化叠加后伤害了编码质量,并在 April 20 回滚。Anthropic 表示这些问题在不同时间影响不同流量切片,因此外观看起来像广泛且不稳定的退化,并宣布截至 April 23 为所有订阅用户重置使用限制。
https://www.anthropic.com/engineering/april-23-postmortem
Scaling Managed Agents: Decoupling the brain from the hands
Anthropic 的工程文章解释了 Managed Agents 的架构选择:把 agent 的 brain、hands 和 session 解耦。早期设计把 session、agent harness 和 sandbox 放在同一个 container 里,好处是文件编辑直接、边界少,但问题是 container 变成了不可丢失的“pet”:一旦失败,session 也可能丢失;一旦卡住,工程师又很难在不接触用户数据的情况下 debug。新设计把 session 变成 append-only log,把 harness 变成可重启的 orchestration loop,把 sandbox 变成可替换的执行环境。这样 container 死掉时,harness 可以把失败作为 tool-call error 交给 Claude,必要时用标准 recipe 重新 provision 一个 sandbox;harness 自己失败时,也可以通过 session log 恢复。安全边界也更清晰:Claude 生成的不可信代码不再和 credentials 跑在同一容器里,Git token 可以在 sandbox 初始化时被绑定到 remote,custom tools 的 OAuth token 则放在 vault 里。文章的核心判断是,agent harness 里的假设会随着模型能力提升而过时,所以接口要稳定,具体实现要能替换。
https://www.anthropic.com/engineering/managed-agents
New in Claude Managed Agents: self-hosted sandboxes and MCP tunnels
Claude Managed Agents 新增 self-hosted sandboxes 和 MCP tunnels,让企业可以把 agent 的工具执行环境放在自己控制的基础设施内。self-hosted sandbox 允许代码执行、敏感文件、packages、services 和数据留在企业边界内,同时 Anthropic 侧继续负责 agent loop、orchestration、context management 和 error recovery。企业也可以选择 Cloudflare、Daytona、Modal 或 Vercel 这样的 managed provider 来处理 compute 和 isolation。Cloudflare 提供 microVMs、轻量 isolates、zero-trust secrets injection 和可控 egress;Daytona 强调 long-running、stateful sandbox,可通过 SSH 或 authenticated preview URL 访问,也可暂停和恢复;Modal 面向 AI workloads,支持 custom container runtime、CPU 和 GPU on demand;Vercel 则结合 VM security、VPC peering、bring your own cloud 和 millisecond startup time。MCP tunnels 允许 Managed Agents 连接企业私有网络里的 MCP servers,不需要开放公网入口,只由企业部署的 lightweight gateway 建立 outbound connection,并支持 Managed Agents 和 Messages API。对企业 agent 落地来说,这次更新的关键是把执行、网络、审计和数据边界还给客户,同时保留托管 agent 的编排层。
https://claude.com/blog/claude-managed-agents-updates
播客
The MAD Podcast with Matt Turck — OpenAI’s Compute Chief: We Can’t Build Fast Enough | Sachin Katti
核心要点:AI 的下一阶段瓶颈不是单纯模型能力,而是 compute、power、cooling、networking、supply chain 和 skilled labor 组成的物理基础设施。
Sachin Katti 现在是 OpenAI head of industrial compute,此前是 Stanford professor、多次创业者,并曾任 Intel CTO。他负责的不是模型界面层,而是支撑 OpenAI 训练和运行 intelligence 的底层 compute buildout。这个话题值得关注,是因为 OpenAI 正在把 compute 当成 intelligence 的供应链来经营:模型越强、用例越复杂,所需的数据中心、芯片、网络和电力越接近工业级基础设施问题。
Katti 对规模的描述非常直接。OpenAI 今年 compute spending 的方向性数字被提到约 $50,000,000,000,整个行业 compute spend 被提到约 $700,000,000,000。他说需求远超供给,任何上线的 compute 都会被立即消耗掉,最大的担忧是物理世界移动得没有软件那么快。这里最有代表性的一句话是:“只要你以为 compute 已经够了、可以慢下来,结果总会负面地提醒你,不该慢下来。”这不是普通云扩容,而是把数据中心当成“把 electrons 变成 tokens 的巨大工厂”。
AI 数据中心和传统云数据中心的差异首先在密度和热。Katti 说 AI 本质上是在建大型 supercomputers,芯片温度非常高,不能只靠空气冷却。冷却不只发生在 data hall,也发生在 chip、连接芯片的组件、cables 和 transformers 上,因为所有处理能量的部件都会产生热。液冷不是全新技术,但从未以今天这种规模部署,所以创新集中在可靠性、成本、可扩展性,以及更高效的 liquids 和 materials。冷却效率越高,芯片就能跑得越热,也意味着更多 memory bandwidth、更多 flops,最终产出更多 intelligence。
电力是另一条硬约束。早期大家主要连接电网,现在 OpenAI 也开始投资 grid 的 generation infrastructure 和 transmission infrastructure。Katti 给出的原则是,建数据中心时不能从电网拿走既有电力,而是要投资新增发电能力,让数据中心可以消费新增 power。这把 AI 公司推向了更像工业参与者的位置:不仅购买云资源,还要关心能源、输电和建设周期。
OpenAI 也在更主动地建设自己的 compute 能力,而不只是从 Microsoft、Google、Amazon、Oracle 等 partner 处获得 capacity。Katti 表示,OpenAI 通常是 tenant 或 off-take 方,承诺消费 partner 建好的 compute,但在所需规模下,公司必须更主动参与获取和构建 compute。他把这称为 OpenAI 正在训练的一块“new muscle”。这对 AI builder 的启示是,基础模型公司正在从纯软件组织变成软硬件、能源和资本密集型组织。
Jalapeno 自研芯片的速度尤其值得注意。Katti 说从 design 到 tape-out 用了九个月,这是他职业生涯里见过最快的节奏之一。原因包括团队曾在 Google 设计 TPU,Broadcom 具备交付 XPUs ASICs 的经验,以及 OpenAI 自己知道未来模型 workload 可能长什么样,所以可以缩短很多芯片设计决策。更关键的是,AI 正在辅助芯片设计和优化,减少人类做实验和处理数据的时间。他判断,AI 设计用于训练和运行下一代 AI 的系统并不遥远,甚至包括 chips。
大规模训练还需要新的网络可靠性。Katti 介绍了 MRC,这是一种用于扩展大型 cluster fabrics 的 networking protocol / routing technology。想象 100,000 GPUs 在训练时持续通信,links、switches、NIC cards 的数量巨大,失败会频繁发生,甚至无法枚举所有失败方式。MRC 的思路是 multipath spraying,在任意两个 chips 之间存在多条路径时,把 packets 分散到多条路径上,哪条成功就用哪条,从而避免单个 link failure 阻断训练。核心目标不是炫技,而是让 training workload 不需要关心底层网络失败。
最后一个反直觉瓶颈是人。Katti 明确提到 electricians、plumbers 等 skilled trades 存在短缺,而且这些是 hyperscalers 和 labs 都会积极招聘的高薪岗位。当 knowledge work 被 AI 重塑时,物理世界的建设能力反而更值钱。OpenAI 的 guaranteed capacity 也体现了同样 framing:它本质上是 guaranteed tokens,也就是为企业锁定一定美元价值的 intelligence supply。Katti 的判断是,intelligence 正在变成每个 digital enterprise 的关键供应品,企业需要像管理其他关键供应链一样管理它。