← 收录原文
BUILDERS · 精选整理

Builders 精选|2026-07-20

2026-07-20 · 历史整理稿

X / 推特

OpenAI Codex & ChatGPT Thibault Sottiaux

Thibault Sottiaux 给出了一段他直接口述给 ChatGPT Work 的真实任务,核心是让系统遍历 Twitter DM,把所有提到 ChatGPT Work 早期访问 beta 的消息整理成 spreadsheet。他要求表格包含姓名、DM 链接、用户发来的内容,并把换行去掉放进单个单元格。更重要的是,他还让 ChatGPT Work 自行根据用户工作内容设计一个大约 8 到 12 个标签的 taxonomy,比如 sales、marketing、design。另一个字段是根据用户描述判断其当前 ChatGPT Work 使用流程的成熟度,用来挑选不同 sophistication 层级的 beta cohort。这个例子展示的不是简单信息抽取,而是把 inbox triage、分类体系设计、候选人筛选和表格生产合成一个可委派 workflow。他随后总结说,自己的工作基本已经变成“delegating to ChatGPT Work”,尤其离不开 dictation。最后他明确列出 ChatGPT Work 的使用场景,包括创建和托管 sites、管理 email、总结大量文档,以及生成 docs、sheets 和 slides,并说明它已经在 mobile app 和网页端可用,包含在 Plus、Pro、Business 和 Enterprise plans 中。

AI tutorials builder Peter Yang

Peter Yang 分享了一个很具体的亲子 AI building 案例:他和 8 岁的孩子一起做了一个 @ChatGPTapp Site,用来帮助她学习 multiplication tables。这个项目从孩子的兴趣出发,因为她喜欢动物,所以用 ChatGPT Images 生成了 UI 和角色。除了练习乘法表,页面还加入了音乐,让学习体验更像一个小游戏。他们还做了 timed boss level,把原本枯燥的记忆训练变成带节奏和挑战的互动流程。这个例子有价值的地方在于,它不是展示 AI 做一个 demo,而是展示普通家庭如何把个性化学习需求转成一个可玩的微型产品。对 builder 来说,这说明 ChatGPT Sites 的一个重要用法可能是低门槛生成小型、定制化、围绕真实使用者兴趣设计的工具。

Vercel CEO Guillermo Rauch

Guillermo Rauch 根据内部 evals 讨论了几个模型在 cybersecurity 上的表现。他说 Kimi K3 在 cybersecurity 上属于 top-tier,并回应 X 上关于 Moonshot benchmark-overfit 的讨论,强调这些是 stealth evals,结论是模型有 raw IQ。他还提到 Sol 在 cyber capability 上有明显跃升,成本显著更高,但能力仍然很突出。相比之下,Fable 的问题是拒答太多,团队无法让它完成整套 run。Guillermo 特别指出,Sol 更愿意帮助 defensive cyber hardening,因此他的结论是 frontier、open-weight cybersecurity capability 已经到来,但应该用于 defensive purposes。另一条长文里,他批评“AGI”这个词已经老化,因为 AI 和人类智能的差异极大,在多数 economically-relevant tasks 上已经远强于人类,但这不等于 AI 比 humanity 更好。他强调,人类真正不可替代的部分是关心他人、保持身份、表达独特想法,以及创造性地使用机器,而不是把写作和判断完全外包。他最后把 AI social replies 和模板化 landing page 文案当作反例,认为 quality 和 humanity 会胜出。

Box CEO Aaron Levie

Aaron Levie 认为,过去几个月已经扭转了一个常见判断:AI 生态的价值不会只流向少数 frontier AI labs。他承认 frontier labs 仍然会继续推动模型进步,因为它们拥有 compute scale、大收入流、客户基础、顶级研究员和数据管线。但与此同时,围绕 frontier models 的扩散层正在快速形成,并且存在多种可行路径。第一类是帮助企业和 applied AI 公司开发针对具体 use case 的自有模型,并为它们运行 inference,从而在不同 domain 中获得性能和成本优势。第二类是 applied AI 公司,它们负责 end-user experience 和 business process tools,覆盖 legal、IT、security、HR、customer support、coding 等场景,能够作为模型 routing layer,并深入理解企业 workflow、change management 和数据接入。第三类是深入 life sciences、financial services、healthcare 等垂直领域的新 labs,这些领域不是 frontier labs 的主战场,且需要很深的 domain expertise。第四类是 agent 和 model 运行、治理、数据存储、安全、orchestration 等基础设施,以及未来会出现的大量 services firms,帮助企业真正完成 AI adoption。他的判断是,现在太早定义 winning architectures,未来更可能是 heterogeneous environment;同时他也认为,靠 gatekeeping models 在规模上行不通,美国应在安全前提下保持高速度进步、推动 diffusion、建设 infrastructure,并支持 US OSS。

Y Combinator CEO Garry Tan

Garry Tan 的两条推文都围绕 San Francisco 的公共治理和问责。他主张真正投入 recovery 和 treatment,并对那些他认为主动鼓励、协助或导致 overdose deaths、以及支持 drug dealers 的 harm reduction organizations 进行严格审计和 defund。这里的核心观点是,他把城市药物危机的解决路径放在“治疗和恢复”而非无条件 harm reduction 上。他还批评 The Standard 应该更多坚持 journalism,减少 partisanship。他认为,要求城市 accountability 并不是不合理,攻击 accountability 反而是在反向使用新闻影响力。对关注创业生态的人来说,这类内容反映了 Garry Tan 近期持续把 SF 治理、公共安全和城市复兴当作 founder ecosystem 的基础议题。

FirstMark VC Matt Turck

Matt Turck 的一条高信息密度推文是对“model layer is commoditizing”这个叙事的反讽。他列出 2024、2025、2026 三个年份都有人重复同一句话:模型层正在商品化。然后他的结论很直接:model layer 仍然没有 commoditized。这个观点针对的是 AI stack 里一个反复出现的判断,即随着开源模型追赶和 API 价格下降,基础模型会变成低差异化基础设施。Matt 的反驳不是展开技术细节,而是用时间跨度提醒读者,模型层的差异、领先窗口和商业价值仍然持续存在。他另一条关于 Didier Deschamps 的内容主要是体育纪念,虽然包含比赛和冠军数字,但与 AI builders 主题关系较弱。

Builder Zara Zhang

Zara Zhang 建议每个人都应该为 AI models 建立自己的 personal eval set,也就是一组和自己日常工作或生活真正相关的任务。她认为行业 benchmark 有参考价值,但不一定能反映一个模型对你本人是否真的有用。找到模型能力边界的方式,是反复拿具体任务去“poke at it”,在有趣的试验中撞到边界。这个建议对 builder 很实用,因为很多模型选择并不是看综合榜单,而是看它能否完成你的真实 workflow。她还指出企业 AI adoption 最大的障碍,是懂 AI 的人不懂业务,懂业务的人不懂 AI。两条放在一起看,她关注的是把模型能力从抽象评测拉回具体使用场景,同时补齐业务语境和 AI 能力之间的断层。

播客

Unsupervised Learning — Ep 90: AI Pioneer Jürgen Schmidhuber on the State of AI Today

核心要点:Jürgen Schmidhuber 对 AI 技术本身很乐观,但对当前大模型公司的资本开支和商业模式非常悲观,因为真正的 AGI 不能只停留在屏幕背后,而模型领先优势也很难形成长期护城河。

Jürgen Schmidhuber 被 New York Times、Forbes 等称为 AI pioneer,长期参与神经网络、meta learning、artificial curiosity、formal theory of fun and creativity 等方向的研究。他的视角和当下许多 AI 公司叙事不同:他不否认 LLM 已经能通过 Turing test,也不否认屏幕内 AI 已经很强,但他认为“true AI”必须进入物理世界。也就是说,真正关键的问题不只是更强的聊天机器人,而是机器人、真实机器、能够在物理环境中行动和学习的系统。

他最反直觉的判断是,当前数据中心和 GPU 的投资可能会反噬大公司。他提到 compute per dollar 长期大约每五年提升 10 倍,因此今天投入巨大资本买入的 GPU,在五年后可能损失大部分经济价值。他把当前大公司从轻资产软件公司转向像 utilities 一样经营 clouds、data centers、power plants 和 gas turbines,看作自由现金流恶化的重要原因。面对“未来会有无限 compute demand”的反驳,他的回答很朴素:需求也需要有人付钱,如果服务提供方持续亏钱,商业模式就站不住。

在 open source 与 closed source 的竞争上,他认为闭源模型公司很难靠领先 3 到 6 个月赚取长期利润。原因是 open source models 紧跟其后,给定价带来巨大压力。即使某个商业大模型今天刷新 benchmark,几个月后开源模型也可能追上,这让昂贵训练和数据中心债务变得更难回收。更进一步,recursive self improvement 也未必会成为大公司独占护城河,因为很多关键想法来自小实验室、academic labs 和 PhD students,而不是只存在于少数大公司的私有体系中。他的一句判断很锋利:“每个人都是用同样的水做饭。”

Schmidhuber 对 RSI 的解释也更偏研究源流。他回顾了 1987 年的 meta evolution、1994 年的 self-referential machines,以及 2003 年的 Godel machine:机器在修改自身代码前,需要证明这个修改会比不修改带来更高 expected reward。他承认这种数学上更一般的路径在实践中很难,今天更流行的是神经网络通过权重变化实现较弱版本的 self modification。当前方法依赖 gradient descent,效果实用,但仍受 gradient descent 的限制。

他对未来 AI 的核心 framing 是 artificial scientist。今天的 LLM 被 World Wide Web 训练,而 Web 上的数据本来就是人类觉得有趣才被留下的,所以模型天然高度 human-biased。真正更接近婴儿学习方式的系统,应该通过自己的行动产生训练数据,预测行动后果,建立 world model,再用这个模型计划下一步。Schmidhuber 把这称为 artificial curiosity:当基本需求满足后,系统会主动提出问题、设计实验、收集数据,而不只是回答人类给的问题。

机器人硬件是他认为最被低估的瓶颈。他明确说,当前 robot hardware 和人类身体相比非常落后,尤其没有人造技术能接近人手兼具强抓握和精细操作的能力。他的原话是:“你不能只靠屏幕背后的东西拥有 AGI。”棋类超人系统和能通过 Turing test 的文本系统可以存在于屏幕里,但如果不能掌握真实世界,就还不是 physical AGI。对 builder 的启示是,AI 的下一阶段不只是模型榜单,还包括硬件、world model、自主实验和真实环境中的闭环学习。