X / 推特
AI builder Swyx
Swyx 关注的是 RLM 论文里一段关于轨迹相似性的分析,重点不是单个 benchmark 分数,而是模型训练和评测之间可能存在的“看起来没作弊、实际很接近测试分布”的灰区。他指出,前沿模型即便没有直接训练测试集,也可以通过训练“test lookalikes”来逼近目标 benchmark,从而把分数做得很好看。问题在于,开源权重发布时,通常不会同时发布完整 datasets 或 rlenvs,因此外部很难判断模型是否训练过类似 Temu Tbench 的数据。他提到 Alex 和 Omar 尝试把标准 NLP 距离指标应用到隐藏轨迹上,用来观察训练任务和测试任务之间的潜在相似性。Swyx 没有把这称为最终解决方案,而是强调这只是初步探索。这个观察同时支持另一个更积极的结论:RLMs 可能确实能泛化到未见过、但共享 latent structure 的任务。对 builder 来说,这条推文提醒大家不要只看榜单分数,还要追问数据、环境、轨迹和泛化边界。
https://x.com/swyx/status/2079411861150429402
AI 教程作者 Peter Yang
Peter Yang 的第一条观点很直接:禁止 Chinese models 可能会重演禁止 Chinese EVs 的“self own”。他的意思不是讨论单个模型质量,而是提醒美国市场如果把竞争者挡在外面,可能会错过成本、速度和产品压力带来的整体进步。第二条更偏实操,讲的是用一个 agent 做任务,再用另一个 agent 按 rubric 复审。例子来自视频 shorts 场景,因为“这是不是一个好短视频”没有确定性答案,不能像单元测试一样直接判定。Peter 引用的做法是让单独的 verification agent 阅读 rubric、审查短视频并给反馈,从而减少模型验证自己输出时的 self-preferential bias。这里的关键不是“多用一个模型”,而是把生成者和评审者拆开,避免同一个 agent 对自己的产出过于宽松。对做 AI 工作流的人来说,这是一种可迁移的评估模式,尤其适合创意、内容、设计这类没有唯一正确答案的任务。
https://x.com/petergyang/status/2079273815004303477
https://x.com/petergyang/status/2079257646939742542
Meta AI 高级总监 Madhu Guru
Madhu Guru 把当前 AI 产品机会概括为“最适合拥有 product sense 的时代”。他的判断是,通往 AGI 的路不是抽象地堆能力,而是由一批 economically valuable tasks 铺出来的。也因此,enterprise AI 是最重要的前沿之一,因为企业内部存在大量真实、有预算、能衡量价值的任务。他还把四年前 web3 和 crypto tokenomics 的争论,转移到今天 AI 的新 tokenomics 上:open vs closed weight、inference costs、model routing。这个类比很有意思,因为“tokenomics”在这里不再是发币机制,而是模型部署和任务分配的经济学。对 AI builder 来说,核心问题变成了什么时候用闭源前沿模型、什么时候用开源权重、什么时候为了成本切换模型。Madhu 的整体关注点是产品判断和经济价值之间的结合:AI 能不能落地,取决于任务是否有价值、成本是否可控、路由是否聪明。
https://x.com/realmadhuguru/status/2079387984852668780
https://x.com/realmadhuguru/status/2079369965569003691
https://x.com/realmadhuguru/status/2079227605031829700
Vercel CEO Guillermo Rauch
Guillermo Rauch 从 AI 得出的“大 lesson”是 everything is code。这里的 code 不是狭义的软件源码,而是一种可被描述、生成、组合和自动化的结构。按照他的说法,slide deck 是 code,design 是 code,promo video 是 code,Excel automation 也是 code。这个判断反映了 AI 工具正在把更多创意和业务产物转成可执行、可迭代的表达。对 builder 来说,重要变化是“会不会写程序”不再只对应传统工程,而是影响演示、设计、视频、表格、运营自动化等越来越多的工作流。它也解释了为什么 coding agent 的边界会不断向外扩张,因为 agent 处理的是结构化意图,而不只是 repository 里的文件。Guillermo 的结论偏极端,但方向清楚:AI 时代的产品和组织,会越来越多地把非代码资产当成代码来管理。
https://x.com/rauchg/status/2079274102129304026
Box CEO Aaron Levie
Aaron Levie 重点解读了 Cursor 关于 multi-model agentic systems 的研究。他认为,多模型 agent 系统显然是未来,因为不是每一步都需要 frontier model 的最高智能。Cursor 的研究显示,用 frontier model 做 planner 和 orchestrator,再把大量执行工作交给更便宜的 workhorse model,可以把项目总 token 成本显著降下来,达到 15X cost improvement。他引用的核心逻辑是,大任务中真正需要 frontier intelligence 的时刻并不多,主要是原始拆解、设计决策和关键 trade-off。一旦 frontier planner 把模糊问题压缩成详细明确的指令,低成本模型只需要跟随执行。Aaron 认为这会成为复杂 agent 的核心设计模式,因为大量 token 消耗发生在不需要同等智能阈值的工作阶段。真正的应用层差异化,会来自谁更懂具体 domain,并且能在多个模型层级之间做有效路由。Coding、finance、legal、healthcare、life sciences 等高价值领域尤其适合这种模式,因为成本下降会让原本太贵的大工作负载变得可部署。
https://x.com/levie/status/2079402164988895293
Builder Zara Zhang
Zara Zhang 提出了一套面向 AI 时代的招聘流程。第一轮是线下面试,并且不允许使用 AI,用来测试候选人的领域知识和现场判断。第二轮则反过来,要求候选人必须使用 AI 完成一个如果不用 AI 就无法完成的项目。她强调评估不只看最终结果,还要看候选人与 agents 的 chat transcript,因为过程能暴露候选人如何拆问题、纠错、调度工具和判断输出。另一条推文则把公司分成两类:coding agents 出现之前成立、现在努力 retrofit 的公司,以及 coding agents 出现之后成立的公司。她认为后者从第一天就不同,团队通常少于十人,因为实际不需要更多人;工作按 projects 组织,而不是按 departments 组织;每个人都能 close their own loop;内部会议也几乎没有。Zara 的核心观点是,AI 原生公司不只是用了新工具,而是在招聘、组织结构和协作方式上从根部重写。
https://x.com/zarazhangrui/status/2079409165424799889
https://x.com/zarazhangrui/status/2079225776545968166
FPV Ventures 合伙人 Nikunj Kothari
Nikunj Kothari 提醒过去 18 个月的很多 founder:即便 AI 里已经没有传统意义上的“moats”,也不代表 scale and capital 会自动成为主要护城河。他用 Webvan、Groupon、MySpace、Yahoo、AltaVista、Blockbuster、Nokia 和 2021 年的 zombiecorns 举例,说明结构位置和资本优势并不能保证长期胜利。这些公司曾经在资源、规模或市场位置上看起来很强,但最终输给了拥有更好 unique insight 的对手,或者被自己的规模拖垮。他给 founder 的建议是找到一个值得走 10 年以上的独特洞察,同时保持足够审慎,不要让资本和规模替代真实洞察。另一条观察是,VC 转去 fast growing startup 的趋势正在加速,他过去一周又看到三个人加入这条路径。他把这类流动类比为 2012 年左右 IB 或 consultant 转 BizOps 的潮流,并指出这一批人常见 title 是 Special projects。两条推文连在一起看,Nikunj 关注的是 AI 泡沫期的人才、资本和公司建设纪律:热潮可以带来资源,但不能替代长期判断。
https://x.com/nikunj/status/2079328912912355470
https://x.com/nikunj/status/2079211477127291350
播客
No Priors — Travel Through the Lens of AI with with Booking.com CEO Glenn Fogel
核心要点:AI 不会自动抹平 travel 行业的复杂度,真正的机会在于把客户需求、供应侧合作、token economics 和人工服务边界一起优化。
Glenn Fogel 是 Booking Holdings CEO,也是在公司还是 Priceline、估值只有几亿美元时加入的二十多年老兵。他见过互联网泡沫从狂热到崩盘,也见证公司从接近退市、股价做 reverse split 后约 $6,一路成长为曾经接近 $180,000,000,000 market cap 的 travel 巨头。这个背景让他看 AI 的方式很克制:不是否认技术冲击,而是反复强调“没有 moat”这种永久保护,只有持续创造新服务和更好满足客户。
他最反直觉的判断是,外部看 travel 很容易,以为 AI agent 一进来就能替代 Booking 这类平台,但真正做起来复杂得多。Travel 不是简单商品搜索,它涉及旅客、酒店和其他 partners,平台处在 marketplace 中间,要同时解决信息、供给、支付、履约、客服和信任问题。Fogel 对那些想直接“knock away these very big players”的创业者给了明确提醒:先真正理解业务,再决定是否投入资本。
Booking 对 AI 的态度不是防御,而是把它当成完成使命的工具。他说 AI 可以让旅客更容易获得信息,也可以让 partners 获得更多需求,最终目标是“cheaper and better for our customers”。Priceline 的 agentic tool Penny 最近几个月 adoption 每月翻倍,但 Fogel 特别指出,它现在在绝对量上还很小,所以不能只看增长率就夸大财务影响。Booking 去年做了 $186,000,000,000 的 travel,超过 1,000,000,000 room nights,这种规模下任何新工具都必须证明真实 ROI。
成本是他最关心的 AI 问题之一。Penny 或客服 AI 的价值不能只看“更酷”,还要算为了拿到一次 trip 消耗了多少 tokens、用了哪些 models、用户来回交互多少次,以及长期 lifetime value 是否提升。他明确提出今天新的 token economics 问题:哪个模型应该用于哪个目的、什么时候用、便宜 token 能不能承担一部分工作。这和今天很多 agent 架构讨论一致,frontier model 不一定要覆盖所有步骤。
客服是已经看到效果的场景。Booking 的 customer service per contact 成本已经下降,customer satisfaction 上升,AI 可以避免用户在高峰期排队等人工,也能更快解决一部分标准问题。但 Fogel 同时警告,不能为了自动化而自动化,因为有些客户就是想和真人说话。他的原则很简单:最终永远是 customer wants 什么,而不是公司单方面想把什么都交给 AI。
关于 AI 对就业的冲击,他把重点放在 upskill。Booking 内部每天都在讨论如何让员工 AI literate,即便某些岗位未来无法完全保留,员工也应该因为掌握新工具而有更好的职业选择。他担心的是,如果企业和社会不诚实讨论转型,恐惧会导致人们拒绝本来对社会有益的技术。他甚至直说,其他地区不会因为这种恐惧停下来,并特别提到 China 不会用“AI is bad”作为行动前提。
Fogel 最值得记住的一句话是:“There is no such thing as a moat.” 换成中文就是,不存在一个地方能让你永远免受创新冲击。对 AI builder 的启示不是“传统巨头安全”或“agent startup 必胜”,而是任何一方都必须在真实业务复杂度里证明自己:更低成本、更好体验、更高转化、更少取消、更高客户成功,并且知道什么时候该让人类回到流程里。