← 收录原文
BUILDERS · 精选整理

Builders 精选|2026-07-27

2026-07-27 · 历史整理稿

X / 推特

OpenAI Codex 与 ChatGPT Thibault Sottiaux

Thibault Sottiaux 重点提到 ChatGPT Work 在移动端使用时的体验变化,称它已经在 ChatGPT app 中可用,并认为移动端场景会成为一个 game changer。这个判断的核心在于,工作流类 AI 产品不再只绑定桌面环境,而是可以进入更碎片化、更随手的使用场景。他还补充说,ChatGPT Work 的活跃用户数已经正式超过 Codex,这说明 OpenAI 内部面向“工作场景”的产品线正在获得更广泛采用。对 builder 来说,这个信号值得关注,因为 Codex 代表偏开发者的 agentic coding 工作流,而 ChatGPT Work 更偏通用知识工作和企业协作。如果后者增长更快,说明 AI 工作流的普及可能先从非代码场景扩散。这里没有披露具体用户数,但“active users overtaken Codex”本身已经是一个产品采用趋势信号。

AI 教程创作者 Peter Yang

Peter Yang 预告了与 OpenAI DevEx engineer Jason 的一期 Codex 访谈,Jason 是官方 Codex 工作指南的作者。预告里最有价值的信息是 Jason 展示了完整的 Codex work system,而不是单点技巧。这个系统包括用 Codex 在 Slack 和 email 之间承担 chief of staff 式的协调工作,把过去的 sessions 转化成新的 skills 和 workflows,以及构建用于学习任何主题的网站,例如学鼓。Peter 的角度仍然是“给忙人看的实用 AI 技能”,所以他把 Codex 放在真实工作流中,而不是只讨论代码生成。他还推荐 Kun 对模型的分析,称其是他见过最好的模型分析之一,但没有展开具体观点。整体来看,Peter 今天关注的是 Codex 如何从开发工具扩展为个人工作系统。

Meta AI 高级总监 Madhu Guru

Madhu Guru 讨论了美国 AI 社区为什么会快速转向支持 open-weight models。他认为在“未知地带”里,复杂问题的答案只能来自和现实的反复接触,而不是一次性抽象推理。不到一个月前,open weights 的行业共识并没有今天这么明显,但一系列公开事件让各方能够共同观察不同方向的后果。他列举了 DeepSeek、Microsoft-OpenAI breakup、GLM、Kimi、Fable、OpenAI-Hugging Face episode 等案例,认为这些事件分别揭示了激励机制、创新路径、地缘政治和不同玩家手中筹码的变化。他的重点不是为某个阵营站队,而是强调 AI 社会性问题需要通过公开实验、观察一阶和二阶效应、再更新信念来推进。这也意味着未来十年很多 AI 治理和产业问题,可能不会靠先验原则一次解决,而是靠连续现实反馈形成动态共识。

Replit CEO Amjad Masad

Amjad Masad 发布了 Replit 新部署的 chess engine,并称目前估算接近 1200 Elo。他设定的目标是达到 2000+ Elo,但保留两个关键约束:只使用一个 small finetuned LLM,不做 custom pretraining 或 custom architecture,并且模型必须在没有 chess engine assistance 的情况下直接生成走法。这个实验的价值不在于做出最强棋力,因为一旦放松这些约束,问题会容易很多。它更像是在测试小模型在规则明确、长程规划、错误代价很高的环境中能走多远。Amjad 明确强调“如果放松约束会容易得多”,这说明他关注的是模型能力本身,而不是外部搜索或传统引擎辅助后的系统能力。他另一条关于信息负担对 ADHD brain 特别不友好的评论信息不足,这里跳过。

Vercel CEO Guillermo Rauch

Guillermo Rauch 今天把 agent workflow 上升到“software factory”的层面。他认为 https://v0.dev 比 Vercel 过去构建的任何 framework 都更基础,因为它代表一个公司想法的起点。对于新 idea,他建议不要把思路停留在“找一个 agent 随手 prompt 一下”,而是问自己如何构建一个能启动、维护、增长这个想法的 factory。他进一步说,软件世界里“factory is the product”,产品质量取决于你设置了怎样的 agents 来自动维护它。他还分享了自己的研究工作流:用 agent CLIs 和 filesystem 做全部 research,维护一个 research/ 文件夹,再用 AGENTS.md 写清楚自己想要的格式和最佳实践。这个系统不依赖 fancy apps、knowledge graphs 或 UIs,而是让 agent 在过去 sessions 中查找和关联知识,需要分享时再生成 HTML report 并部署到 Vercel。他的结论很明确:驱动这套“软件”的核心,是 AGENTS.md 里的英文指令和文件系统组织方式。

Box CEO Aaron Levie

Aaron Levie 把 Google 的参与解读为对 open weights AI 的完整背书。他认为这是行业里的一个重要时刻,因为 open weights 不再只是个别开源社区或模型公司的选择,而是获得了更大平台玩家的认可。虽然他没有展开 Google 具体加入了什么事项,但措辞里的“complete endorsement”说明他把它视为方向性信号。结合今天其他 builder 对 open-weight models 的讨论,这条推文反映出开放权重正在从争议路线变成主流产业选项。对企业软件公司来说,open weights 的意义不仅是模型可下载,还包括部署控制、成本结构、安全边界和生态议价能力。Aaron 的关注点仍然落在企业 AI 的长期基础设施选择上。

FirstMark Capital VC Matt Turck

Matt Turck 分享了与 Andrew Feldman 讨论 chip landscape 101 的内容,覆盖 CPU、GPU、NVIDIA、AMD、TPU、Trainium、Cerebras 等主题。这个方向适合需要补齐 AI compute 基础知识的 builder,因为模型、agent 和应用层的竞争最终都受到芯片供给、成本和架构选择影响。Matt 没有在推文里展开具体论点,但列出的关键词显示内容重点是把 AI 芯片生态从基础概念讲清楚。CPU、GPU、TPU、Trainium 和 Cerebras 分别代表通用计算、主流加速、云厂商自研加速和 wafer-scale 等不同路线。对于关注 AI infra 的读者,这类“landscape 101”有助于理解为什么不同模型公司、云厂商和硬件创业公司会采用不同 capex 与性能权衡。今天这条更像是给后续深入判断打底的入口。

Builder Zara Zhang

Zara Zhang 提出一个简短但有信息密度的判断:AI-native companies 的文化更像 open-source community。这个说法指向一种组织形态变化,即公司内部的协作方式可能更开放、更迭代、更依赖共享上下文和自发贡献,而不是传统自上而下的流程分工。她没有展开例子,但“AI-native”与“open-source community”的类比本身值得注意,因为 AI 工具降低了个体从想法到原型再到发布的门槛。这样的公司可能更重视透明工作流、可复用 artifacts、prompt 或 agent 配置的共享,以及跨职能成员直接动手构建。她另一条关于等待 AI output 时做什么,更偏互动问题,信息密度较低。整体来看,Zara 今天关注的是 AI 对公司文化和工作节奏的影响,而不是单个工具更新。

FPV Ventures Partner Nikunj Kothari

Nikunj Kothari 评论了一类非常规收购,认为这种事情通常只有在两个条件同时成立时才可能发生。第一,CEO 对公司拥有完整控制权,例如盈利、没有 board 和他所知道的 VC 约束。第二,创始人必须像 David Holz 一样既有野心又足够疯狂。否则,很难向团队解释为什么一家 generative media company 要收购 astrology app。他还提到“scanners”这个方向,说明他认为相关公司已经在做一些边界很宽、常规公司治理下不容易通过的实验。Nikunj 的重点不是评价收购对错,而是指出组织控制权和创始人性格会决定公司能否采取非共识行动。对 builder 来说,这条的启发是:某些看似离谱的战略动作,背后不是普通产品逻辑,而是公司治理结构给了创始人足够行动空间。

OpenAI 与 OpenClaw Peter Steinberger

Peter Steinberger 分享了用 Codex 做大规模并行 QA 的工作流,重点是为 OpenClaw 下一次发布做准备。他给 agent 的任务非常具体:用 live API keys 做 full end-to-end QA test,调用 12 个 subagents 拆分功能,启动不同端口的 dev gateways,并让其中一些做 stress test。任务还要求 agent 使用 worktrees、自动创建 PRs,把目标设为发现 200 个 bugs,并且每次修 root cause,避免 band-aids。边界也写得很清楚:允许 refactors,但不要触碰 plugin SDK boundary;测试报告要持续更新为桌面上的 markdown 文件。他补充说,Codex 一整天都在跑 massive parallel QA,而且 Sol 在理解 intent 和发现复杂行为问题上已经明显变强。过去这类 workflow 容易在 compaction boundaries 处崩掉,或者模型开始 cheating;这次的进展说明长程 agent QA 的可靠性正在改善。

官方博客

Anthropic Engineering An update on recent Claude Code quality reports

Anthropic 解释了过去一个月部分用户反馈 Claude 变差的原因,并明确说 API 和 inference layer 没有受影响。问题来自三个独立改动,分别影响 Claude Code、Claude Agent SDK 和 Claude Cowork,且已经在 April 20 的 v2.1.116 修复。第一个问题是 March 4 把 Claude Code 默认 reasoning effort 从 high 改成 medium,以降低高 effort 下过长延迟和 token 使用,但用户反馈宁愿默认更高智能、简单任务再主动降低 effort,于是 April 7 回滚。第二个问题是 March 26 的缓存优化,本意是在 session idle 超过一小时后清理旧 thinking 以降低恢复成本,但 bug 导致之后每一轮都继续丢弃旧 reasoning,让 Claude 显得健忘、重复、工具选择异常。第三个问题是 April 16 增加了减少 verbosity 的 system prompt 指令,和其他 prompt 改动叠加后损害 coding quality,并在 April 20 回滚。由于三个问题影响不同流量切片和时间段,外观看起来像广泛且不稳定的整体退化。Anthropic 还表示会为所有 subscribers 重置 usage limits。

Anthropic Engineering Scaling Managed Agents: Decoupling the brain from the hands

Anthropic 用 Managed Agents 说明长程 agent harness 的设计思路:把 brain、hands 和 session 拆开。早期设计把 session、agent harness 和 sandbox 放在同一个 container 里,优点是文件编辑就是直接 syscall,也没有服务边界,但问题是 container 变成了不能丢的“pet”。一旦 container 失败,session 会丢;一旦卡住,工程师只能靠 WebSocket event stream 猜测问题来源,而这无法区分 harness bug、event stream 丢包或 container 下线。新的设计把 harness 从 container 中移出,把 sandbox 当成普通 tool 来调用,即 execute(name, input) → string;container 失败时只是工具调用错误,可以重新 provision。session log 也独立于 harness,harness 崩溃后可以 wake(sessionId),用 getSession(id) 读取 event log,从最后事件继续。安全边界同样因此更清晰:Claude 生成的不可信代码不再和 credentials 跑在同一个 sandbox 里,Git token 可以在 sandbox 初始化时接到 remote 上,MCP OAuth token 则保存在 sandbox 外的 secure vault。核心判断是,agent harness 中那些关于模型短板的假设会过期,所以接口应该稳定,具体实现应该可替换。

Claude Blog New in Claude Managed Agents: self-hosted sandboxes and MCP tunnels

Claude Managed Agents 新增 self-hosted sandboxes 和 MCP tunnels,让 agent 的工具执行和私有服务访问可以留在企业自己的边界内。self-hosted sandbox 允许 Claude Managed Agent 在用户控制的基础设施上执行工具,或使用 Cloudflare、Daytona、Modal、Vercel 等 managed providers。Anthropic 仍负责 agent loop、orchestration、context management 和 error recovery,但代码执行、敏感文件、packages、services 和 data 留在企业 perimeter 内。Cloudflare 方案强调 microVM、轻量 isolates、zero-trust secrets injection、可审计和可改写的 egress;Daytona 强调 long-running、stateful、可 SSH 或 authenticated preview URL 访问,并可暂停恢复状态;Modal 强调 AI workload、sub-second startup、CPU/GPU on demand 和大规模并发;Vercel 强调 VM security、VPC peering、bring your own cloud 和 millisecond startup。MCP tunnels 则让 Managed Agents 连接企业内网的 MCP servers,不需要把 internal databases、private APIs、knowledge bases、ticketing systems 暴露到公网。它通过用户部署的 lightweight gateway 发起单个 outbound connection,不需要 inbound firewall rules 或 public endpoints,并提供端到端加密。self-hosted sandboxes 已在 Claude Platform public beta,MCP tunnels 是 research preview,需要 request access。

播客

Unsupervised Learning — Ep 91: Top AI Analyst Unpacks Today's AI Hype Cycle

核心要点:Benedict Evans 反对把 AI 讨论成“前所未有所以无法比较”的神话,他更关心历史技术平台的产业结构怎样迁移到 AI。

Benedict Evans 是长期研究科技平台变迁的分析师,以 newsletter 和 presentation 影响创业者、投资人和产品团队。Jacob Efron 把问题放在 AI hype cycle、foundation model 估值、consumer AI 应用、enterprise adoption 和就业冲击上,但 Benedict 的方法很稳定:不要争 AI 到底比互联网、移动或工业革命“大多少”,而是回看过去几次世界级技术变迁中,价值如何在 stack 上分配,哪些层有 pricing power,哪些层只是承担 capex。

他最反直觉的提醒是,类比不是为了预测,而是为了提出更好的问题。比如 semiconductors 有 cutting-edge fab 成本每四年翻倍的结构,foundation models 在某些方面有相似的 escalating cost structure;mobile networks 也有 marginal cost,流量增长就要加 base stations 和设备。过去十五年 mobile data traffic 增长了一千到两千倍,移动运营商是 trillion dollar industry,每年花 $200,000,000,000 CapEx,但 Uber、banking、YouTube 这些价值都跑到了上层。AI 的问题也类似:模型层投入巨大,但最终利润会不会更多流向应用、工作流、行业系统或新平台,还没有定论。

他对“LLM 会像 Windows 一样”也保持怀疑。Sam Altman 说过 OpenAI 要像 Windows,但 Benedict 指出 LLMs 没有明显 network effects,所以竞争动态不一定像操作系统。更值得追问的是,不同 stack 层能不能向上竞争,能不能向下整合,以及 token pricing、算力供给和产品入口会怎样改变行业分工。

Consumer AI 的难点在于,很多产品还没有变成具体、持续、能解决问题的行为。他用 Midjourney 类比 Drone,指出它可以很令人兴奋,但如果没有翻译成用户反复要做的 tangible specific thing,就仍然不是强产品。他举了 virtual try-ons 的例子:如果产品能读取用户 Instagram 和品牌 look book,生成十个不同穿搭视频,那才可能是一个具体用例,而不是单纯“生成图片”。

他也反对把 AI 仅仅看成 text 和 pictures。他说:“这不是 chat rooms,而是 network;这里也一样,不是 text 和 pictures,而是 enabling technology。”他的意思是,AI 会进入 fraud detection、企业 back office process、日常服务体验等大量用户看不见的地方,这些改进不会以“这是 ChatGPT”的形式出现。很多人拿一次问答不准来判断 AI,就像 1995 年看互联网慢、聊天室杂乱,于是误判了网络本身。

对 AI lab 和年轻 builder 的建议则更冷静:默认现在很多缩写、协议、公司和 playbook 都会失败。1995 和 2010 的很多概念后来消失了,但尝试它们仍然有价值。他甚至提到 OpenAI 放弃 web browser、MCP 也可能被替换,说明当前是 radical uncertainty,不该过早把任何接口或产品形态神圣化。

企业采用也不会像社交媒体讨论那样线性爆发。Benedict 引用 Goldman CIO survey 的例子说,二十年后企业 workflow 上云比例仍只有约 30%,因为大公司有权限、合规、集成、优先级和组织现实。AI 不是每个行业的唯一变量;对 newspaper 可能是结构性冲击,对 Caterpillar 或 aggregates company,影响就可能更有限或更间接。给 builder 的启示是:不要只问模型会多强,而要问具体行业的工作、成本、风险、分销和组织结构到底会不会因此重排。