← 收录原文
BUILDERS · 精选整理

Builders 精选|2026-06-12

2026-06-12 · 历史整理稿

X / 推特

Box CEO Aaron Levie

Levie 发布了 Box AI Complex Work Eval 的详细测试结果,称 Fable 在编码和复杂知识工作任务上都有巨大跃升。测试方法是让使用 Fable 的 Box AI Agent 处理一组真实世界的企业文档难题,然后和 Opus 4.8 对比打分。Fable 的三个核心差异点:不在复杂推理上走捷径、多步计算算得对、多次运行的一致性显著更高。分行业看,提升最大的是 Media & Entertainment(78% vs 61%)、Technology(81% vs 73%)、Financial Services(89% vs 83%)和 Healthcare(66% vs 60%)。具体案例很有说服力:法律 M&A 尽调任务中 Fable 拿了 100% 而 Opus 78%;媒体行业的利润预测任务里,Fable 正确识别出 20% 的阿根廷税收抵扣已经包含在源表格数字里没有重复计算,Opus 则又叠加了一次,连环错误直接把分数打成负数。5 年期债务融资预测任务中,Opus 把利息算在了总授信额度上、税基也选错,Fable 83% vs Opus 62%。Levie 总结这是复杂分析、分析性推理和深度领域理解上的一次 step change,Fable 很快会上线 Box AI Studio 供客户构建 agent。

OpenAI Codex 与 ChatGPT 负责人 Thibault Sottiaux

Sottiaux 确认过去 48 小时 Codex 的 token 消耗出现强劲增长尖峰,并特别指出这很不寻常,因为 OpenAI 这期间没有发布任何新东西。他还发了一条只有一句话的产品哲学:"简化,直到没有东西可以再简化。"另外他官宣欢迎 Clint 和 Michael 两位新成员加入,表示非常期待一起为网络安全领域做贡献,加速全球防御者的能力,口号是"It's time to build"。可以看出 Codex 团队当前两条线:一边享受用量自然增长,一边在向 cybersecurity 方向扩张人才。

Builder Zara Zhang

Zara 连发三条高密度观察。第一条:agency(代理公司)的交付物正在从一次性资产变成"一个给 agent 用的文件夹",她引用的金句是"靠你的脑子赚钱,而不是靠你的手"。第二条展开了一个组织设计观点:每个团队都应该给跨职能协作方构建 agent/skill,比如设计团队基于品牌规范和设计模式给市场团队做一个设计 agent,市场团队就能自助产出符合品牌的素材,不用每次都去打扰设计师;关键在于这个 agent 只有设计师能做出来,因为需要他们的专业知识和上下文。她认为这会推动组织从按"职能"划分走向按"loop"划分。第三条是对 San Francisco 创业生态的吐槽:她问创始人目标用户是谁,90% 的回答都是"工程和产品团队、AI-native 创业公司",感觉同一小撮人被一百万个产品轰炸,而很少有人为世界上另外 99% 的人构建产品。三条连起来是一套完整的"agent 时代的组织与市场"思考。

Y Combinator CEO Garry Tan

Garry Tan 推荐了 Nessie,称它已经成为把你在 ChatGPT、Perplexity 和 Gemini 里积累的上下文、记忆和历史迁移到其它有记忆能力的地方的最佳方式,还能导入 OpenClaw/Hermes Agent,并夸它的 OpenClaw 和 MCP server 做得很出色。这反映了一个新兴品类:跨 AI 产品的个人记忆可移植性正在成为真实需求。另外两条是他一贯的 San Francisco 本地政治输出:庆祝 Aaron Peskin 成为普通市民,喊话"愿常识统治 San Francisco 一百年",并继续炮轰"表演型非营利产业复合体"应该被连根拔起和撤资。

前 Google Gemini、Veo、Nano Banana 产品负责人 Madhu Guru

Madhu 分享了 Gemini 早期服务企业客户时反复看到的一个错误:企业总是把质量和成本的权衡做反,一上来就选最小最便宜的模型。他给客户的经验法则分两种情况:如果是用 LLM 替换一个传统 ML 模型,可以从小模型开始,因为你已经知道"好"长什么样;但如果是构建全新的东西,一定要从最强的模型开始,先"魔法式地思考",搞清楚到底什么是可能的。等有了高质量的可用应用之后,再帮客户在保持质量的前提下迁移到更小的模型。这条对所有在做 AI 应用选型的团队都是直接可用的决策框架。

Anthropic Claude Code 团队成员 Thariq

Thariq 解密了他怎么用 Fable 给 Fable 自己的发布视频做剪辑,因为太多人问所以专门录了一期讲解视频。核心做法是让模型写大量代码和工具调用:调用转录服务、用 ffmpeg 处理、做调色、调 Figma MCP、写 Remotion UI 然后渲染输出,全程他没有碰过任何视频剪辑器。他同时公开了视频里用的 deck,欢迎大家自己研究并提问,还附上了参考视频(他提到没来得及用上更新后的设计稿)。这是"agent 做创意工作流"的一个完整实例:视频剪辑这种传统上重交互的工作,被完全拆解成了代码和工具调用。

Claude 官方账号

两条值得注意。一是 The Problem Solvers 系列发布了 Cursor 联合创始人 Michael Truell 的故事:他 12 岁爱上编程,共同创办的公司两年内从 15 人扩张到 700 人,如今超过 60% 的 Fortune 500 在用其 AI coding 平台构建产品。二是 Claude Platform 产品更新:scheduled deployments(定时部署)和 vault 中的环境变量管理今天起可用,面向在平台上跑生产级 agent 的开发者。

AI 教程作者、150K+ 订阅 newsletter 主理人 Peter Yang

Peter 这次的主题是"给自己许可去做 builder"。他批评传统职业阶梯把所有人都推向管理岗:越往上爬,越要远离实际构建,时间被产品评审、跨部门对齐、向上管理和绩效校准填满,他认识很多 builder 把最好的年华花在了爬错的梯子上。好消息是风向在变,公司比以往任何时候都更奖励 builder 和 IC,连管理者也越来越被要求做一线工作。他的建议是:成为好 builder 需要大量练习,如果你骨子里是 builder,就拥抱它,不必为了当"领导"放弃你擅长的事。另外一条是他的实践状态:用 Codex 越多,提的需求越有野心,甚至开始怀疑自己是不是还不够有野心。

Vercel CEO Guillermo Rauch

Rauch 预告下周在 London 举办 Vercel Ship 大会,暗示会有一些特别的发布。另一条是他对 Silicon Valley 的辩护:他做天使投资时收到各种各样的人的引荐,无论是"两个小伙子和一条狗"还是五次获奖的连续创业者,他都同等认真对待,因为这里的未来对所有人开放,没有比这更任人唯贤的地方。对关注 Vercel 生态的人,下周的 Ship London 值得盯一下。

Every CEO Dan Shipper

Dan 翻出了自己去年在 Lenny 播客上的预测:AI 让每个员工的生产力大幅提升后,把某些岗位回流(reshore)到美国以贴近客户会变得有吸引力,现在有新闻印证了这个判断。这是一个值得记住的二阶效应:AI 不只是替代劳动力,还会改变劳动力的地理分布逻辑,当单人产出足够高时,人力成本差距的重要性下降,贴近客户的价值上升。

FirstMark Capital 合伙人 Matt Turck

Turck 用一条长推自嘲了 2026 年 VC 的"残酷"日程:从 Davos 开年,Aspen 挨冻,赶 Upfront,熬过 Milken,直奔 Paris 看法网,回 NYC 看 Knicks,然后是 Berlin 的 SuperReturn、London 的 Founders Forum、世界杯、Paris 的 Raise AI、Idaho 的 Sun Valley、Mykonos 小憩、Goldman 科技会议马拉松、Finland 的 Slush,最后是远在 Sydney 的 NeurIPS。一年"高产的思想领导力和价值创造"结束,人也垮了。玩笑背后是对 VC 行业会议社交文化的精准讽刺:行程表的密度和实际价值创造之间未必有关系。

Google Labs 官方账号

Project Genie 的开放范围进一步扩大:从今天起,Google AI Ultra 5X 订阅档位(Google 最新推出的订阅层级)的全球用户都可以访问 Project Genie。Google 正在用最高订阅档位作为前沿实验产品的分发渠道,值得关注这条产品线的商业化路径。

Google Labs 与 Gemini App 副总裁 Josh Woodward

Josh 处理了一次 Gemini 服务中断:他先发公告确认 Gemini 正在经历 outage,团队正在抢修,部分修复已上线;随后确认全部恢复并再次道歉。从公告到恢复的沟通节奏很标准,值得做 to C AI 产品的团队参考:第一时间承认问题、给出进度、收尾致歉。

Anthropic Claude Code 团队 Boris Cherny

Boris 在 Tokyo 现场发来 Code with Claude Tokyo 活动的问候,Anthropic 的开发者活动系列正在向亚洲扩展,日本站正在进行中。

播客

AI & I by Every — How Anthropic Uses Claude Fable 5 With Mike Krieger

核心要点:Fable 5 把 AI 从"结对编程的同事"变成了"可以整夜托付复杂任务的队友",真正的瓶颈从模型能力转移到了人类的验证方式和工作组织方式。

Mike Krieger 是 Anthropic Labs 负责人、Instagram 联合创始人,刚从 CPO 转回一线 builder 角色。在 Fable 5 发布前夜,他分享了内部使用这个模型几个月的真实体感,对所有在重度使用 coding agent 的人都有直接参考价值。

他的第一个感受是自己的技能过时了。"我感觉自己完全像个新手,因为我 prompt 和拆解任务的方式对这个模型来说已经过时了。"现在他的日常是睡前给 Claude 布置一个复杂任务,通常凌晨两点左右就做完了。模型卡住时的表现尤其让他印象深刻:某个远程服务挂了,它会自己搭一个脚手架后端继续推进,把这个事实记录下来,等服务恢复再修复。他甚至在飞机上也不担心 Wi-Fi 断线,设置好上下文指令就敢托付。

工作流上的变化:更多前置的架构规划对话,经常让模型直接产出一个 HTML 页面或带图表的文档用来对齐团队;并发 session 数量大增,要么一个长 session 配后台 sub-agent,要么直接开五六个 tab 跑长任务。他第一次真正用起了 effort level 调节,小的 UI 调整降到 medium,因为 Fable 的能力范围比 Opus 宽得多。快问快答类问题他会切到 Sonnet,自嘲"这不是一个配得上 Fable 的问题"。

成本问题他给的框架是:衡量成本已经变成多维度的事,除了单轮成本,更要看"完成到你满意为止"的总成本。Fable 贵,但它第一次就做对,省掉了后面九、十轮"不对,我不是这个意思"的来回。他周末搭的个人媒体追踪应用(支持 agent 修改软件本身)只用掉了一点额外用量。对比 Instagram v1:当年他这个熟练工程师连续五天通宵加 Kevin Systrom 做滤镜才上线,现在一个周末带娃间隙就能完成同等量级的东西。

他认为软件工程没有死,但被重新定义了:写代码的部分基本解决,留下的是意图表达、架构判断、验证和对结果负责。验证是他反复强调的下一个前沿:给每个 PR 附上完整的截图集甚至视频,他在原型阶段把 ffmpeg 给 Claude,让它逐帧检查自己做的动画有没有卡顿。最打动他的用户故事来自内部一位招聘同事:"这是我人生中第一次,感觉我脑子里的东西和真实存在于世界上的东西就挨在一起,我可以直接把它做出来。"

对读者的启示是:模型的天花板和地板同时被抬高了,非技术人员能构建的复杂度上限在快速上升,真正稀缺的能力变成了清晰表达意图、设计验证闭环、以及对交付物负责的判断力。