← 收录原文
BUILDERS · 精选整理

Builders 精选|2026-06-04

2026-06-04 · 历史整理稿

X / 推特

Google Gemini 团队 VP Josh Woodward

长期被用户吐槽的 Thinking Levels 体验终于在 Gemini 全平台铺开。Josh 宣布 Web、iOS、Android 三端的 Gemini App 现在都能让用户自己选择推理强度档位。这把过去藏在内部参数里的 reasoning trade off 直接交到用户手上,意味着轻量提问和深度分析可以按需切换,不再被默认档位牵着走。配合 Google AI Studio 的开放,这一波是 Gemini 在产品体验上拉近与 OpenAI 推理模型差距的关键一步。对重度用户来说,最直接的好处是可以在生产环境里精细控制延迟与质量的取舍。

OpenAI Codex 与 ChatGPT 负责人 Thibault Sottiaux

Thibault 这两天连发多条信号围绕 Codex 的企业化升级。他特别强调 ChatGPT 这个名字"无论你理解不理解,它都将和 AI、和 agent 成为同义词",等于直接喊话品牌叙事会与产品形态绑死。更实际的一波更新是 Codex 商业版用户现在可以直接 host 并分享自己生成的网站,plugins 和 skills 体系也针对更多职能角色做了大幅升级。另一个少被注意的点是反馈机制,用户现在可以在 docs、slides、sheets 上直接做可视化标注给 agent 反馈,比纯文字提示精准很多。这套组合拳的目标显然是把 Codex 从开发者工具往更广泛的知识工作者场景渗透。

Roblox 产品经理 Peter Yang

Peter 这两天关于 AI 时代 SaaS 是不是要死掉的论述值得创业者细读。他不认同 "SaaS 已死" 的口号但提出了 3 条具体筛选标准:单一 narrow 用例的 SaaS 越来越难卖,因为 AI skill 已经可以更灵活地解决同样问题;Codex 和 Claude Code 这类自带用户长期上下文和 memory 的 agent 在知识层面碾压独立 SaaS 网站和 chatbot;定价上人们愿意为有人服务付几百到几千美元,但 20 美元的 SaaS 会被直接对比 Claude 和 ChatGPT 订阅。他也给 Devin 和 Windsurf 团队 "献花",称在起伏中保持纪律继续推进的团队正在被一批 AI native builder 重新认可。另一条转引 Matt 的金句很有意思:"他们因为能 build 任何东西而过度兴奋,结果发布时一个用户都没有"。

Anthropic Claude Code 团队 Thariq

Thariq 把 Claude Code 新上线的 Workflows 称为继 skills 和 subagents 之后最大的能力升级。他和 sidbid 深度试用后整理了一份 best practices 和案例集合。特别让他兴奋的是 Workflows 对非技术任务的解锁能力,意味着 Claude Code 的目标用户不再只是写代码的人。这条 thread 同步发到了 Claude 官方博客。Workflows 的出现把 Claude Code 从 "一个会写代码的 agent" 推向 "一个可编排的工作流引擎" 的定位。

Replit CEO Amjad Masad

Amjad 宣布与 Microsoft 联合发布的新通道:通过 Microsoft 全新的 Rayfin SDK,企业内部任何人都可以在 Replit 上构建并部署安全合规的 Fabric 数据应用。这是 Replit 从消费级 vibe coding 工具向企业级数据平台延伸的关键一步。同时他也转推了 ViBench 这个新 benchmark,强调 "传统 SWE benchmark 抓不住 app building 能力",需要专门的应用构建评测体系来量化模型在真实开发场景中的表现。他还分享了一张把整个业务结构铺到 canvas 上的截图,暗示 Replit 正在把整个商业逻辑做成可被 AI 操作的画布。

Vercel CEO Guillermo Rauch

Guillermo 提出 "YES-CODE" 框架直接对抗 no code 时代逻辑:no code 建立在 "代码昂贵稀缺" 的假设上,而 coding agent 已经把这条假设推翻,代码现在便宜、容易、丰沛。他引用同事 cramforce 多年前对分析师的回应 "Vercel 不是 no code 平台,是 yes code 平台" 作为公司一直坚持的定位。他的核心论点是 Vercel 的使命是 "为 agent 打造你永远不需要毕业的最简单云",不在性能与复杂度上妥协。在教育议题上他认为 AI 时代学习的入口就是语言本身,英语过去无法直接产出实物,需要翻译成机器指令,而现在可以 go direct。他还宣布 Vercel Sandbox 给 Conductor 提供算力,并把 Conductor 称作 "为 coding agent 而生的 ADE",预言 agent 将让远程开发成为主流。

Box CEO Aaron Levie

Aaron 给企业 AI 应用层挑出了一个未来 12 到 24 个月的明确机会:token 预算会变成企业 opex 大头,model routing 因此必然胜出。理由是不同领域有不同的工作模式,只有掌握领域 eval 的玩家才能精细做 cost performance 优化。他判断短期内大部分用例还需要 frontier 模型的能力,但随着评估足够成熟,企业会逐步把可处理的工作流挪到更便宜的小模型上。关键在于企业自己内部很难 scale 这套路由系统,所以能智能路由工作流到合适模型层级的产品将聚合更多需求。这是 Box 把内容层 AI 包装成路由层 AI 平台叙事的一次预热。

Builder Zara Zhang

Zara 引用 OpenAI 最新 Codex 报告中的关键数据:知识工作者已经占 Codex 用户的 20% 左右,并且采用速度是开发者的 3 倍以上。增长最快的任务类型分别是数据分析(周环比 110% 增长)、研究(37%)、知识产物(36%)。她自己的开源项目 Frontend Slides 在 GitHub 上达到了 20k stars,最近新增了精美模板、网页发布、PDF 导出、内联编辑等功能。她直言惊讶于多少人已经把 PPT 彻底换成 HTML deck 而不再回头。这条 signal 印证了她长期押的判断:开发者工具一旦做到足够低门槛,就会被知识工作者抢着用。

FPV Ventures 合伙人 Nikunj Kothari

Nikunj 给当下的种子轮和 A 轮创始人写了一封带刺的长文:他看到太多 pitch 把 AI、timing、融资、distribution、市场、产品、收入中的某一项当成投资的核心理由,但优秀的创始人都把这些当作必要条件而不是全部业务。他指出 seed 到 A 的差距正在拉大,原因是 bar 真的在升高,创始人必须解释自己如何在多个维度上构建别人难复制的优势,尤其在过度拥挤的赛道。他认可 "业务很强但融资为什么这么难" 的挫败感,但提醒创始人 VC 的机会成本也在飙升,narrative 和 ambition 决定了你和下一轮之间的微妙差别。如果你已经盈利不需要钱,那确实没必要伺候 VC,但如果要谈,请多花十分钟把长期野心讲清楚。

OpenClaw 与 OpenAI 创始人 Peter Steinberger

Peter 这两天连发企业化进展。他和 Omar 把 observability 和 verifiable workspaces 接入了 OpenClaw,让企业用户能审计 agent 的行为路径。更大的新闻是和 Microsoft 的合作落地,OpenClaw 正式被引入微软企业客户群。这两步把 Peter 自己定位的 "ClawFather" 角色从早期玩家推到了 enterprise AI agent 基础设施的中心位置。配合 OpenAI 自身的企业版迭代,Claw 系生态正在快速补足 "可信任、可审计、可部署" 的企业三件套。

Every CEO Dan Shipper

Dan 这两天有 3 条值得关注。他公开告别了 Every 设计负责人 Lucas,回顾对方四年前以销售广告身份加入,最终带出一支在 AI 行业树立设计标杆的团队,Every 视觉风格的形成有他的关键贡献。他点出 "团队内部正在为某件事 freak out,值得关注" 但语焉不详,留下钩子。关于 Opus 4.8 他做了一次坦诚 ask:Every 内部测试时极度看好,但外部反响偏温和,他猜测原因是 Opus 4.8 倾向于挑战用户的 framing,所以体验呈高方差,有时给出惊艳结果,有时又以明显错误的方式反驳用户。他想听社区如何看,以便调整内部 evaluation 体系。这条问询本身就揭示了 "模型评测应当贴近用户实际感受而不是 benchmark" 的判断。

OpenAI CEO Sam Altman

Sam 罕见地把行业立场写得很直接:美国应该通过持续打造最好的模型、确保模型安全、把 cyber 工具交到可信防御者手里来在 AI 上领跑。他说新的 Executive Order "把平衡拿对了",等于公开为白宫这一轮 AI 政策背书。在 AI 治理叙事日趋两极的当下,OpenAI 主动站台官方政策,意味着政企关系将继续是头部模型公司的核心战场。

Anthropic 官方账号 Claude

Claude 推出系列 The Problem Solvers,聚焦那些用 Claude 攻克复杂问题的创始人。第一集主角是 Legora 联合创始人兼 CEO Max Junestrand,他正在用 Claude 把 "解读法律" 这个最古老的职业之一带入新时代。他的赌注是每次新模型发布都抬高整个行业的水位,Legora 在为其他所有人造船。这是 Anthropic 把 Claude 从模型 API 升级为 "客户成功故事" 叙事的关键编辑动作。

播客

Training Data — Knowing What Your Customers Want, All the Time: Listen Labs' Alfred Wahlforss

核心要点:当 AGI 把 "造东西" 变便宜后,真正稀缺的将是 "知道造什么",Listen Labs 押注用 AI 大规模做用户访谈加上行为模拟来给企业供给这个稀缺能力。

嘉宾 Alfred Wahlforss 是 Listen Labs 创始人兼 CEO,公司一年前上线,目前已经服务 Fortune 500 中 20% 的客户,名单包括 Microsoft、Anthropic、Sweetgreen、NBC 等。Listen 是一个 AI 优先的用户研究平台,同时可以跑数千场语音访谈。在 AGI 即将把执行端无限拉低成本的当下,他给这家公司的定位非常直白:"离 AGI 越近,造东西越容易,难的是知道造什么"。

Listen 的核心机制是给每个研究项目配一个 AI agent,先生成 interview guide,再到平台 3000 万人的 audience 里召人做视频访谈,最后做数据分析和建议。访谈以视频形式进行,AI 还会捕捉受访者的表情和说话方式,把 "说什么" 和 "实际感受" 之间的 gap 补齐。Alfred 提到一个反直觉数据:同样一个多选问卷给同一个人重复几次,回答会高度不一致,但用 Listen 让他口头作答并真正思考时,一致性显著提高。他特别强调他们 80% 的工程资源都花在 audience 上,因为 "每家公司都被一条 power law 驱动"。例如 Sweetgreen 看似面向所有人,但真正贡献 80% 收入的客群是 "城市、高家庭收入、女性为主,并且知道什么是 seed oil 的那 1% 人群"。

最 contrarian 的观察是关于 AI 比人类访谈员更受欢迎:"因为 AI 不评判、永远感兴趣,受访者会非常坦诚地敞开心扉,连让小孩参与都变得可能"。他还透露 Procter & Gamble 当年 Tide Pods 的成功正是源自客户访谈发现 "用洗衣液真的很不方便",Mars 在 1950 年代做的早期市场研究让 M&M 从军用零食转型为给小孩的甜品,凡此种种都是 Listen 想用 AI 加速重做的工作。

商业模式上他直言定价反而在涨:"我们做过项目,能向客户收几十万美元跨 8 个国家访谈 20 位医生"。但他承认单次访谈的边际成本会下降,整体研究量会涨两个数量级,公司更大的押注在 simulation:访谈一个人一小时后可以以 95% 准确率预测他对某些问题的回答,把一个人的 "高保真模型" scale 成上千人代表样本。Listen 已经在用真实数据 vs ChatGPT 做了 head to head 对比,他亲身案例是给一场演讲选标题,从 100 个候选里 simulation 选中的标题转化率是次选的两倍,而 ChatGPT 在同一组测试里选错了。他给 vertical AI 公司提出一个清晰的 moat 公式:"拥有自己的 proprietary eval,不断爬这个 eval 就是你的护城河"。Listen 当年 GPT-4 时代的 eval 是 20% 准确率,现在已经爬到 85%,但他们立刻设计了下一代更难的 eval 又回到 20% 起步。

最后他抛了一个未来设想:"我们做到 one person billion dollar company 的时候,Listen 会和 coding agent 一起留在那个 loop 里,构成 autonomous organization"。换句话说在他的视角里,AI 给所有人解锁了执行能力,但最稀缺的环节永远是 "该解决谁的什么问题",而 Listen 正在把这一环外包给 AI 自己。