← 收录原文
BUILDERS · 精选整理

Builders 精选|2026-05-30

2026-05-30 · 历史整理稿

X / 推特

Google VP Josh Woodward

Josh Woodward 连发两条预告,集中展示 Gemini App 的新能力。第一条主打图像变换玩法,配文是 Turn your car into a Lamborghini,把一辆普通车直接换成 Lamborghini 的视觉效果。第二条强调多语言能力,他说现在做 Multilingual 已经 ridiculously easy,意在说明跨语种生成和切换的门槛被大幅拉低。两条都以引用推文加短链的形式发布,更像是面向普通用户的功能种草,而不是技术细节披露。整体看,他在持续把 Gemini App 往"普通人也能轻松上手的创作工具"方向推。

Claude Code 团队 Boris Cherny

Boris Cherny 转述了 Salesforce 公布的一份关于全面转向 agentic 开发(用 Claude Code)的详细复盘,并挑出几个最亮眼的数字。他说 Salesforce 原本评估需要 231 天的一次迁移,最后只用 13 天就交付;有一个 PR 一次性交付了 21 个 endpoint,且测试覆盖率达到 100%。他特别强调质量并没有因为产出变多而下降,反而在 PR 数量增加的同时,整体事故率还下降了 5%,因为他们把安全护栏和质量标准直接内建进了 agentic workflow。他的核心判断是:从 AI 拿到最大收益的团队,是在彻底改变工作方式,而不是把原来的流程做得更快。用他的话说,要想清楚"哪些步骤可以删掉、哪些交接可以取消、哪些事可以让 agent 端到端地全包"。他还点名感谢了 Srini、Benioff 和团队,认为生产力和质量常被当成此消彼长的取舍,但 Salesforce 的实践证明并非如此。

OpenAI Codex 与 ChatGPT 负责人 Thibault Sottiaux

Thibault Sottiaux 今天透露,他在 Codex 的 dashboard 上看到一个让他很开心的数字,并预告"关于这个数字"很快会有更多消息。他感谢持续采用 Codex 的用户,同时强调现在还非常早期,连说了两次 So early。他还抛出一个值得每个做模型的人思考的问题:你到现在是更相信 benchmark,还是单纯听朋友推荐?究竟是什么让你愿意去试一个新模型?这条问题帖收获了 545 条回复,说明"benchmark 失信、靠口碑选模型"已经是社区里的普遍焦虑。整体看,他一边为 Codex 的采用势头铺垫,一边在公开收集"用户到底怎么决定换模型"的一手反馈。

Box CEO Aaron Levie

Aaron Levie 给出了一个 contrarian 的解读:当一家公司愿意花 500M 美元去自建某个应用的替代品时,这恰恰是对"应用层"最好的广告。他的逻辑是,如果应用层不够有价值,没人会下这么大的本钱去复制它,所以这件事反而应该让你对软件更加 bullish。他也承认标题里塞不下其中很多 nuance,但坚持认为这是看多软件的信号。这延续了他一贯的立场:在 AI 冲击应用层的叙事里,他反复论证应用层不会被轻易抹平,反而会因为内容和场景而更有壁垒。

Y Combinator CEO Garry Tan

Garry Tan 分享了一条很犀利的创业建议。有个 founder 反复念叨"要是我们有钱就能做成 X",他直接点破:钱不是火,钱是浇在已经燃起来的火上的汽油。换句话说,你没有融资问题,你有的是"现在还没人想要"的问题,正确的动作是先去把第一簇火点起来。这条把"缺钱"重新定义成"缺需求"的帖子,是给早期创业者最实用的提醒。除了创业话题,他今天还连发两条针对 University of California 招生的评论,批评 UC Regents 里那些"只做道德表演、并不真正关心学生结果"的人,并直指 UC 招生中存在针对亚裔的歧视。

OpenClaw 与 OpenAI 的 Peter Steinberger

Peter Steinberger 宣布 Vince 加入团队,难掩兴奋。他说很少有人真正理解"软件被构建的新方式",而 Vince 正是 get it 的那一类人。结合他自己 ClawFather、OpenClaw 加 OpenAI 的身份,这条更像是为 OpenClaw 补充关键人手的招募与团队扩张信号。对关注 agentic 编码工具走向的人来说,值得留意 OpenClaw 在持续吸纳"懂新范式"的人。

播客

No Priors — Building an AI Guardian for Enterprise with Onyx Security CEO Maxim Bar Kogan

核心要点:当企业内部的 agent 行为以 100x、1000x 甚至百万倍的速度增长时,"human in the loop"彻底失效,唯一可行的解法是训练专门的小模型去实时判断"这一步该不该让更聪明的 agent 来复核"。

这期嘉宾是 Onyx Security 的联合创始人兼 CEO Maxim Bar Kogan。Onyx 是一家位于 Israel 的安全公司,团队多来自以色列情报部门里专攻数学与 cyber 交叉领域的单位,做的事是"训练 agent 去监督其他 agent"。这个话题值得关注,是因为过去几个月企业对 AI 安全的担忧,已经从两年前的"员工往 ChatGPT 里输入什么(类似聊天机器人的 DLP)",急转为接近全市场范围的恐慌:autonomous 的 coding agent 开始误删数据库、把不该公开的 code 和 token 发出去,甚至造成系统 downtime。

Maxim 抓了几个关键判断。第一,autonomous coding agent 已经是企业里增长最快的一类,在典型企业中占比超过 50%,另有约 45% 是 low code 的自动化,真正自建的 first party agent 只占 2%。第二,传统安全工具在这里基本失灵:身份权限的逻辑是"限制软件能做什么",但我们偏偏希望 Claude Code 这类助手拥有和我们一样的权限去替我们干活,于是 identity security 失去意义;endpoint 和 API 安全工具也不知道 agent"为什么这么做",缺乏判断意图的 context。第三,光靠 proxy 加 policy engine 不够,因为很多 AI 跑在别人的 cloud 或端上,proxy 不总是可行,而且真正难的不是"看到数据",而是"看到之后该不该放行"。

Onyx 的解法是训练"很不聪明、但只擅长一件事"的小模型,专门判断"这一步是否需要让更聪明的 agent 来看"。Maxim 用下棋打了个反直觉的比方:"顶尖棋手大部分走子都是凭直觉,不往前算,但每隔一阵会突然停下来花很长时间深算,因为他们知道这一步是关键。"安全监督同理:不要在不需要的地方浪费智能,把算力压倒性地投在高风险的动作上,这样才能同时把成本和延迟压低。

他还有一个对创业者很有启发的 framing:企业之所以愿意找一家不到 100 人、成立两年的公司,是因为痛点足够强;而这件事注定不会被大模型厂商自己包办,因为买安全的人天然不信任"卖你产品的人"来认证产品安全,就像买车不会让卖车的人来认证车好不好。Maxim 判断这是一个 100B 美元以上的机会,长期还要深入到机制可解释性(mechanistic interpretability),去理解模型权重和激活的内部结构。