← 收录原文
BUILDERS · 精选整理

Builders 精选|2026-07-19

2026-07-19 · 历史整理稿

X / 推特

意图、强度与 AI 工程社区 Builder Swyx

Swyx 继续把注意力放在 AEO,也就是 AI Engine Optimization 上。他认为,如果还没有让 Codex、Claude、Gemini 或 Devin 每周自动研究如何改进 SEO / AEO,就是错过了一个仍然“免费”、本该商品化但还没有被充分利用的机会。这里的重点不是传统搜索排名,而是产品、内容和公司如何被 AI 系统发现、引用和推荐。他进一步提出一个更细的问题:如果用 Claude 来优化 AEO,它是否会更偏向提升 Claude 内部的可见性,而不是提升跨模型的通用 AEO。这个问题把 AEO 从“怎么被 AI 看见”推进到“被哪类模型看见,以及优化是否会过拟合某个模型生态”。对 builder 来说,这提示了一个新的自动化工作流:让 agent 定期研究、测试、更新面向 AI 搜索和回答系统的可见性策略。

OpenAI Codex & ChatGPT Thibault Sottiaux

Thibault Sottiaux 宣布 Codex 和 ChatGPT Work 的付费用户使用限制被重置。他把这次调整归因于团队在高速迭代,同时仍在支撑快速扩张的基础设施需求。对重度使用 Codex 的开发者来说,这类额度重置直接影响周末能否继续跑长任务、调试 agent 工作流和做代码实验。他还转发式提到 GPT-5.6 Sol 被确认是一个“extremely good model”,但没有给出更多评测细节或适用场景。两条信息放在一起,核心信号是 OpenAI 正在同时推进模型体验和使用额度层面的运营调整。可操作的点是,付费用户可以重新检查 Codex 与 ChatGPT Work 的可用额度,并把原本因限制暂停的任务重新排入执行。

AI 教程与访谈创作者 Peter Yang

Peter Yang 提到 Codex browser use “终于被击败”,但素材里没有展开具体机制,因此不能推断是安全绕过、能力失效还是某个测试案例被解决。更有信息密度的是他对 agent 交互方式的判断:整天盯着屏幕管理 agents 会让人疲惫,他更希望像打电话一样在户外通过语音给 agents 分配工作,并让它们用语音汇报状态。这个观点把 agent 产品的瓶颈从“能不能完成任务”转向“人类如何低成本管理多个任务流”。他还预告周末会发布一期与 Thariq 的内容,重点是 AI video workflows 和更多实践演示。对 AI builder 来说,这说明语音、状态汇报、异步代理管理可能会成为下一波工作流产品的重要交互层。

Meta AI 高级总监 Madhu Guru

Madhu Guru 反驳了“Kimi 会伤害 Google”的简单叙事。他认为很多企业不会直接消费 Kimi,而会通过 Google Cloud 等平台获得模型能力,因为企业仍然需要 security、data residency、compliance,尤其是 chips 这类保障。换句话说,模型竞争不一定只是在模型公司之间分走收入,也可能让云平台把需求从一个口袋转到另一个口袋。他还指出,企业很难超越基础聊天机器人,核心原因是缺少构建 harnesses 和 evals 的人才。Evals 要能表达真实用例、覆盖 offline 和 online 场景,并帮助企业在 quality-cost-latency 曲线上选模型。Harness 则要独立于具体模型,负责 routing、multiagency orchestration、context management、tool calling 和 memory。最后他把 talent 定义为最稀缺的一环,因为前沿系统的真正难点不是接入模型,而是把评测、编排和运行时能力搭起来。

Anthropic Claude Code Thariq

Thariq 给出的实践建议很直接:在消耗大量 token 之前,先构建 mockups、schemas、data models、proof of concepts 等原型。他的判断是,原型能更早暴露方向是否值得继续,而不是等模型输出一大堆内容后才发现自己并不想要这个结果。对于 Claude Code 或类似编程 agent 工作流,这其实是在强调“先压缩不确定性,再扩大生成规模”。一个低保真 schema 或 mockup,往往比一段长 prompt 更能约束模型的输出空间。它也能让人类更早判断产品形态、数据结构和交互逻辑是否成立。对团队来说,这条建议可以转化为 agent 使用规范:复杂任务先让模型产出可检查的小样,再进入大规模实现。

Replit CEO Amjad Masad

Amjad Masad 转发并称赞了一个关于 chess history 的探索项目,认为 Replit 社区正在“ChessMaxxing”。素材没有提供该项目的具体功能、实现方式或内容细节,因此不能展开为完整产品评测。可保留的信息是,Replit 社区正在用平台构建偏知识探索或互动叙事类项目,而不仅是传统工具型应用。对 builder 来说,这类案例说明低门槛开发平台正在把历史、游戏和可视化探索结合起来。Amjad 的关注点也延续了 Replit 一贯的社区创作导向:让用户把兴趣主题快速变成可运行项目。

Vercel CEO Guillermo Rauch

Guillermo Rauch 宣布 Sandbox data for downloads,并用这条更新鼓励大家继续发布更多 agents。素材没有给出 Sandbox data 的完整产品说明,但可以确定它与 downloads 数据有关,并面向 agent 构建场景。对使用 Vercel Sandbox 的开发者来说,这意味着围绕下载数据的可观测性或可用性有所增强。它也呼应了当前 agent 产品的一条主线:当 agent 执行越来越多真实任务时,沙箱运行环境、数据产物和下载能力都需要变得更稳定。Guillermo 的表达重点不是单个 demo,而是把 Sandbox 作为 agent shipping 的基础设施。

Box CEO Aaron Levie

Aaron Levie 讨论了 AI 成本下降对整个生态的影响。他认为 AI 越便宜,生态各层和终端客户越有机会受益,因为当前真正的瓶颈是能否把 AI 成功且低成本地部署到真实工作负载里。成本下降通常会带来总使用量上升,价值会流向 stack 的各个层次,而不只是某一个模型供应商。他补充了一个关键修正:即使更便宜、更调优的模型承担大量 token,frontier closed models 的需求也可能继续上升。原因是复杂任务的 orchestration 往往仍需要最强模型,而批量执行部分可以交给更便宜或更专门的模型。这种效率提升反而可能扩大 frontier spend,因为更多任务变得值得用 AI 去做。真正承压的可能是 margins,他判断 intelligence 最终可能会向基础设施栈的利润率靠拢。

Builder Zara Zhang

Zara Zhang 给 building in public 的建议是,不要把内容创作当成额外工作,而是展示产品内部已经发生的工作。比如一个很短的 screen recording、第一版原型,或某个用户行为如何改变了设计。她强调 reasoning 比 production value 更重要,这对早期 builder 特别实用,因为内容不必被包装成高制作成本的发布稿。另一条观察是,几年前很多人还不适应会议录音,现在商业会议被录制已经近乎默认,而且录音对象不只是人类,也是 agents。她把这种变化视为技术改变文化的例子。两条合起来看,她关注的是产品工作如何自然外显,以及 AI agent 如何把组织沟通的默认行为改掉。

OpenClaw + OpenAI Peter Steinberger

Peter Steinberger 分享了 Codex 通过 browser 和 computer use 打开 Chrome、进入 GitHub PR、点击评论,并处理 macOS picker 以上传图片的过程。他的感受是既惊人又痛苦,因为整个链路只是为了上传一张图片,但“GitHub 没有 API”并不会阻止 agent 尝试完成任务。这个案例很有代表性:当 API 缺失时,agent 会退回到真实 GUI 操作,而 GUI 自动化的可靠性和成本都更难控制。他还提到自己让 Codex 跑在 VMs 里,这样不会抢走本机 app focus。另一条更新是,由于 codexbar icon customization 问题很多,他让 Codex 帮他做了一个 editor。对工具开发者来说,这两条都说明 agent 已经能承担周边开发和 GUI 操作,但隔离环境、焦点管理、系统 picker 这类“非代码细节”会成为真实可用性的关键。

Anthropic AI assistant Claude

Claude 官方说明了 Claude Fable 5 的订阅访问安排。自 July 20 起,Claude Fable 5 会包含在所有 Max 和 Team Premium plans 中,但使用量按 50% limits 计入。Pro 和 Team Standard 用户仍可通过 usage credits 使用 Fable,并会收到一次性 $100 credit。官方承认 Fable 的需求难以预测,所以此前采用分阶段方式加入订阅计划,并在获得更多 capacity 后多次延长访问。另一条说明是,对使用 Fable 最密集的计划,会在 50% usage 处标准化 access,以便用户更明确知道自己 plan 包含什么。对开发者和团队用户来说,重点是尽快确认自身 plan、额度和 credits 安排,因为这会影响是否把 Fable 放入日常工作流。

官方博客

An update on recent Claude Code quality reports

Anthropic 复盘了过去一个月部分用户反馈 Claude 质量下降的问题,并确认影响来自三个独立变更,分别波及 Claude Code、Claude Agent SDK 和 Claude Cowork,API 未受影响。第一个问题是 March 4 将 Claude Code 默认 reasoning effort 从 high 改为 medium,初衷是降低长延迟和 token 消耗,但用户感知为 Claude Code 变笨;Anthropic 已在 April 7 回滚,并让 Opus 4.7 默认 xhigh,其他模型默认 high。第二个问题是 March 26 的缓存优化,本应在空闲超过一小时后只清理一次旧 thinking,却因为 bug 在之后每一轮持续清理,导致 Claude 丢失先前推理脉络,表现为健忘、重复和奇怪的工具选择;该问题已在 April 10 修复。第三个问题是 April 16 的系统提示词变更,意图减少冗长,但与其他 prompt 变化叠加后伤害了编码质量,并在 April 20 回滚。Anthropic 表示这些问题在不同时间影响不同流量切片,因此外观看起来像广泛且不稳定的退化,并宣布截至 April 23 为所有订阅用户重置使用限制。

Scaling Managed Agents: Decoupling the brain from the hands

Anthropic 的工程文章解释了 Managed Agents 的架构选择:把 agent 的 brain、hands 和 session 解耦。早期设计把 session、agent harness 和 sandbox 放在同一个 container 里,好处是文件编辑直接、边界少,但问题是 container 变成了不可丢失的“pet”:一旦失败,session 也可能丢失;一旦卡住,工程师又很难在不接触用户数据的情况下 debug。新设计把 session 变成 append-only log,把 harness 变成可重启的 orchestration loop,把 sandbox 变成可替换的执行环境。这样 container 死掉时,harness 可以把失败作为 tool-call error 交给 Claude,必要时用标准 recipe 重新 provision 一个 sandbox;harness 自己失败时,也可以通过 session log 恢复。安全边界也更清晰:Claude 生成的不可信代码不再和 credentials 跑在同一容器里,Git token 可以在 sandbox 初始化时被绑定到 remote,custom tools 的 OAuth token 则放在 vault 里。文章的核心判断是,agent harness 里的假设会随着模型能力提升而过时,所以接口要稳定,具体实现要能替换。

New in Claude Managed Agents: self-hosted sandboxes and MCP tunnels

Claude Managed Agents 新增 self-hosted sandboxes 和 MCP tunnels,让企业可以把 agent 的工具执行环境放在自己控制的基础设施内。self-hosted sandbox 允许代码执行、敏感文件、packages、services 和数据留在企业边界内,同时 Anthropic 侧继续负责 agent loop、orchestration、context management 和 error recovery。企业也可以选择 Cloudflare、Daytona、Modal 或 Vercel 这样的 managed provider 来处理 compute 和 isolation。Cloudflare 提供 microVMs、轻量 isolates、zero-trust secrets injection 和可控 egress;Daytona 强调 long-running、stateful sandbox,可通过 SSH 或 authenticated preview URL 访问,也可暂停和恢复;Modal 面向 AI workloads,支持 custom container runtime、CPU 和 GPU on demand;Vercel 则结合 VM security、VPC peering、bring your own cloud 和 millisecond startup time。MCP tunnels 允许 Managed Agents 连接企业私有网络里的 MCP servers,不需要开放公网入口,只由企业部署的 lightweight gateway 建立 outbound connection,并支持 Managed Agents 和 Messages API。对企业 agent 落地来说,这次更新的关键是把执行、网络、审计和数据边界还给客户,同时保留托管 agent 的编排层。

播客

The MAD Podcast with Matt Turck — OpenAI’s Compute Chief: We Can’t Build Fast Enough | Sachin Katti

核心要点:AI 的下一阶段瓶颈不是单纯模型能力,而是 compute、power、cooling、networking、supply chain 和 skilled labor 组成的物理基础设施。

Sachin Katti 现在是 OpenAI head of industrial compute,此前是 Stanford professor、多次创业者,并曾任 Intel CTO。他负责的不是模型界面层,而是支撑 OpenAI 训练和运行 intelligence 的底层 compute buildout。这个话题值得关注,是因为 OpenAI 正在把 compute 当成 intelligence 的供应链来经营:模型越强、用例越复杂,所需的数据中心、芯片、网络和电力越接近工业级基础设施问题。

Katti 对规模的描述非常直接。OpenAI 今年 compute spending 的方向性数字被提到约 $50,000,000,000,整个行业 compute spend 被提到约 $700,000,000,000。他说需求远超供给,任何上线的 compute 都会被立即消耗掉,最大的担忧是物理世界移动得没有软件那么快。这里最有代表性的一句话是:“只要你以为 compute 已经够了、可以慢下来,结果总会负面地提醒你,不该慢下来。”这不是普通云扩容,而是把数据中心当成“把 electrons 变成 tokens 的巨大工厂”。

AI 数据中心和传统云数据中心的差异首先在密度和热。Katti 说 AI 本质上是在建大型 supercomputers,芯片温度非常高,不能只靠空气冷却。冷却不只发生在 data hall,也发生在 chip、连接芯片的组件、cables 和 transformers 上,因为所有处理能量的部件都会产生热。液冷不是全新技术,但从未以今天这种规模部署,所以创新集中在可靠性、成本、可扩展性,以及更高效的 liquids 和 materials。冷却效率越高,芯片就能跑得越热,也意味着更多 memory bandwidth、更多 flops,最终产出更多 intelligence。

电力是另一条硬约束。早期大家主要连接电网,现在 OpenAI 也开始投资 grid 的 generation infrastructure 和 transmission infrastructure。Katti 给出的原则是,建数据中心时不能从电网拿走既有电力,而是要投资新增发电能力,让数据中心可以消费新增 power。这把 AI 公司推向了更像工业参与者的位置:不仅购买云资源,还要关心能源、输电和建设周期。

OpenAI 也在更主动地建设自己的 compute 能力,而不只是从 Microsoft、Google、Amazon、Oracle 等 partner 处获得 capacity。Katti 表示,OpenAI 通常是 tenant 或 off-take 方,承诺消费 partner 建好的 compute,但在所需规模下,公司必须更主动参与获取和构建 compute。他把这称为 OpenAI 正在训练的一块“new muscle”。这对 AI builder 的启示是,基础模型公司正在从纯软件组织变成软硬件、能源和资本密集型组织。

Jalapeno 自研芯片的速度尤其值得注意。Katti 说从 design 到 tape-out 用了九个月,这是他职业生涯里见过最快的节奏之一。原因包括团队曾在 Google 设计 TPU,Broadcom 具备交付 XPUs ASICs 的经验,以及 OpenAI 自己知道未来模型 workload 可能长什么样,所以可以缩短很多芯片设计决策。更关键的是,AI 正在辅助芯片设计和优化,减少人类做实验和处理数据的时间。他判断,AI 设计用于训练和运行下一代 AI 的系统并不遥远,甚至包括 chips。

大规模训练还需要新的网络可靠性。Katti 介绍了 MRC,这是一种用于扩展大型 cluster fabrics 的 networking protocol / routing technology。想象 100,000 GPUs 在训练时持续通信,links、switches、NIC cards 的数量巨大,失败会频繁发生,甚至无法枚举所有失败方式。MRC 的思路是 multipath spraying,在任意两个 chips 之间存在多条路径时,把 packets 分散到多条路径上,哪条成功就用哪条,从而避免单个 link failure 阻断训练。核心目标不是炫技,而是让 training workload 不需要关心底层网络失败。

最后一个反直觉瓶颈是人。Katti 明确提到 electricians、plumbers 等 skilled trades 存在短缺,而且这些是 hyperscalers 和 labs 都会积极招聘的高薪岗位。当 knowledge work 被 AI 重塑时,物理世界的建设能力反而更值钱。OpenAI 的 guaranteed capacity 也体现了同样 framing:它本质上是 guaranteed tokens,也就是为企业锁定一定美元价值的 intelligence supply。Katti 的判断是,intelligence 正在变成每个 digital enterprise 的关键供应品,企业需要像管理其他关键供应链一样管理它。