X / 推特
OpenAI Codex & ChatGPT Thibault Sottiaux
Thibault Sottiaux 给出了一段他直接口述给 ChatGPT Work 的真实任务,核心是让系统遍历 Twitter DM,把所有提到 ChatGPT Work 早期访问 beta 的消息整理成 spreadsheet。他要求表格包含姓名、DM 链接、用户发来的内容,并把换行去掉放进单个单元格。更重要的是,他还让 ChatGPT Work 自行根据用户工作内容设计一个大约 8 到 12 个标签的 taxonomy,比如 sales、marketing、design。另一个字段是根据用户描述判断其当前 ChatGPT Work 使用流程的成熟度,用来挑选不同 sophistication 层级的 beta cohort。这个例子展示的不是简单信息抽取,而是把 inbox triage、分类体系设计、候选人筛选和表格生产合成一个可委派 workflow。他随后总结说,自己的工作基本已经变成“delegating to ChatGPT Work”,尤其离不开 dictation。最后他明确列出 ChatGPT Work 的使用场景,包括创建和托管 sites、管理 email、总结大量文档,以及生成 docs、sheets 和 slides,并说明它已经在 mobile app 和网页端可用,包含在 Plus、Pro、Business 和 Enterprise plans 中。
https://x.com/thsottiaux/status/2078702412085498087
AI tutorials builder Peter Yang
Peter Yang 分享了一个很具体的亲子 AI building 案例:他和 8 岁的孩子一起做了一个 @ChatGPTapp Site,用来帮助她学习 multiplication tables。这个项目从孩子的兴趣出发,因为她喜欢动物,所以用 ChatGPT Images 生成了 UI 和角色。除了练习乘法表,页面还加入了音乐,让学习体验更像一个小游戏。他们还做了 timed boss level,把原本枯燥的记忆训练变成带节奏和挑战的互动流程。这个例子有价值的地方在于,它不是展示 AI 做一个 demo,而是展示普通家庭如何把个性化学习需求转成一个可玩的微型产品。对 builder 来说,这说明 ChatGPT Sites 的一个重要用法可能是低门槛生成小型、定制化、围绕真实使用者兴趣设计的工具。
https://x.com/petergyang/status/2078638568784994686
Vercel CEO Guillermo Rauch
Guillermo Rauch 根据内部 evals 讨论了几个模型在 cybersecurity 上的表现。他说 Kimi K3 在 cybersecurity 上属于 top-tier,并回应 X 上关于 Moonshot benchmark-overfit 的讨论,强调这些是 stealth evals,结论是模型有 raw IQ。他还提到 Sol 在 cyber capability 上有明显跃升,成本显著更高,但能力仍然很突出。相比之下,Fable 的问题是拒答太多,团队无法让它完成整套 run。Guillermo 特别指出,Sol 更愿意帮助 defensive cyber hardening,因此他的结论是 frontier、open-weight cybersecurity capability 已经到来,但应该用于 defensive purposes。另一条长文里,他批评“AGI”这个词已经老化,因为 AI 和人类智能的差异极大,在多数 economically-relevant tasks 上已经远强于人类,但这不等于 AI 比 humanity 更好。他强调,人类真正不可替代的部分是关心他人、保持身份、表达独特想法,以及创造性地使用机器,而不是把写作和判断完全外包。他最后把 AI social replies 和模板化 landing page 文案当作反例,认为 quality 和 humanity 会胜出。
https://x.com/rauchg/status/2078647648307880209
Box CEO Aaron Levie
Aaron Levie 认为,过去几个月已经扭转了一个常见判断:AI 生态的价值不会只流向少数 frontier AI labs。他承认 frontier labs 仍然会继续推动模型进步,因为它们拥有 compute scale、大收入流、客户基础、顶级研究员和数据管线。但与此同时,围绕 frontier models 的扩散层正在快速形成,并且存在多种可行路径。第一类是帮助企业和 applied AI 公司开发针对具体 use case 的自有模型,并为它们运行 inference,从而在不同 domain 中获得性能和成本优势。第二类是 applied AI 公司,它们负责 end-user experience 和 business process tools,覆盖 legal、IT、security、HR、customer support、coding 等场景,能够作为模型 routing layer,并深入理解企业 workflow、change management 和数据接入。第三类是深入 life sciences、financial services、healthcare 等垂直领域的新 labs,这些领域不是 frontier labs 的主战场,且需要很深的 domain expertise。第四类是 agent 和 model 运行、治理、数据存储、安全、orchestration 等基础设施,以及未来会出现的大量 services firms,帮助企业真正完成 AI adoption。他的判断是,现在太早定义 winning architectures,未来更可能是 heterogeneous environment;同时他也认为,靠 gatekeeping models 在规模上行不通,美国应在安全前提下保持高速度进步、推动 diffusion、建设 infrastructure,并支持 US OSS。
https://x.com/levie/status/2078567715544121815
Y Combinator CEO Garry Tan
Garry Tan 的两条推文都围绕 San Francisco 的公共治理和问责。他主张真正投入 recovery 和 treatment,并对那些他认为主动鼓励、协助或导致 overdose deaths、以及支持 drug dealers 的 harm reduction organizations 进行严格审计和 defund。这里的核心观点是,他把城市药物危机的解决路径放在“治疗和恢复”而非无条件 harm reduction 上。他还批评 The Standard 应该更多坚持 journalism,减少 partisanship。他认为,要求城市 accountability 并不是不合理,攻击 accountability 反而是在反向使用新闻影响力。对关注创业生态的人来说,这类内容反映了 Garry Tan 近期持续把 SF 治理、公共安全和城市复兴当作 founder ecosystem 的基础议题。
https://x.com/garrytan/status/2078699319209984033
FirstMark VC Matt Turck
Matt Turck 的一条高信息密度推文是对“model layer is commoditizing”这个叙事的反讽。他列出 2024、2025、2026 三个年份都有人重复同一句话:模型层正在商品化。然后他的结论很直接:model layer 仍然没有 commoditized。这个观点针对的是 AI stack 里一个反复出现的判断,即随着开源模型追赶和 API 价格下降,基础模型会变成低差异化基础设施。Matt 的反驳不是展开技术细节,而是用时间跨度提醒读者,模型层的差异、领先窗口和商业价值仍然持续存在。他另一条关于 Didier Deschamps 的内容主要是体育纪念,虽然包含比赛和冠军数字,但与 AI builders 主题关系较弱。
https://x.com/mattturck/status/2078520552680046920
Builder Zara Zhang
Zara Zhang 建议每个人都应该为 AI models 建立自己的 personal eval set,也就是一组和自己日常工作或生活真正相关的任务。她认为行业 benchmark 有参考价值,但不一定能反映一个模型对你本人是否真的有用。找到模型能力边界的方式,是反复拿具体任务去“poke at it”,在有趣的试验中撞到边界。这个建议对 builder 很实用,因为很多模型选择并不是看综合榜单,而是看它能否完成你的真实 workflow。她还指出企业 AI adoption 最大的障碍,是懂 AI 的人不懂业务,懂业务的人不懂 AI。两条放在一起看,她关注的是把模型能力从抽象评测拉回具体使用场景,同时补齐业务语境和 AI 能力之间的断层。
https://x.com/zarazhangrui/status/2078666187026911488
播客
Unsupervised Learning — Ep 90: AI Pioneer Jürgen Schmidhuber on the State of AI Today
核心要点:Jürgen Schmidhuber 对 AI 技术本身很乐观,但对当前大模型公司的资本开支和商业模式非常悲观,因为真正的 AGI 不能只停留在屏幕背后,而模型领先优势也很难形成长期护城河。
Jürgen Schmidhuber 被 New York Times、Forbes 等称为 AI pioneer,长期参与神经网络、meta learning、artificial curiosity、formal theory of fun and creativity 等方向的研究。他的视角和当下许多 AI 公司叙事不同:他不否认 LLM 已经能通过 Turing test,也不否认屏幕内 AI 已经很强,但他认为“true AI”必须进入物理世界。也就是说,真正关键的问题不只是更强的聊天机器人,而是机器人、真实机器、能够在物理环境中行动和学习的系统。
他最反直觉的判断是,当前数据中心和 GPU 的投资可能会反噬大公司。他提到 compute per dollar 长期大约每五年提升 10 倍,因此今天投入巨大资本买入的 GPU,在五年后可能损失大部分经济价值。他把当前大公司从轻资产软件公司转向像 utilities 一样经营 clouds、data centers、power plants 和 gas turbines,看作自由现金流恶化的重要原因。面对“未来会有无限 compute demand”的反驳,他的回答很朴素:需求也需要有人付钱,如果服务提供方持续亏钱,商业模式就站不住。
在 open source 与 closed source 的竞争上,他认为闭源模型公司很难靠领先 3 到 6 个月赚取长期利润。原因是 open source models 紧跟其后,给定价带来巨大压力。即使某个商业大模型今天刷新 benchmark,几个月后开源模型也可能追上,这让昂贵训练和数据中心债务变得更难回收。更进一步,recursive self improvement 也未必会成为大公司独占护城河,因为很多关键想法来自小实验室、academic labs 和 PhD students,而不是只存在于少数大公司的私有体系中。他的一句判断很锋利:“每个人都是用同样的水做饭。”
Schmidhuber 对 RSI 的解释也更偏研究源流。他回顾了 1987 年的 meta evolution、1994 年的 self-referential machines,以及 2003 年的 Godel machine:机器在修改自身代码前,需要证明这个修改会比不修改带来更高 expected reward。他承认这种数学上更一般的路径在实践中很难,今天更流行的是神经网络通过权重变化实现较弱版本的 self modification。当前方法依赖 gradient descent,效果实用,但仍受 gradient descent 的限制。
他对未来 AI 的核心 framing 是 artificial scientist。今天的 LLM 被 World Wide Web 训练,而 Web 上的数据本来就是人类觉得有趣才被留下的,所以模型天然高度 human-biased。真正更接近婴儿学习方式的系统,应该通过自己的行动产生训练数据,预测行动后果,建立 world model,再用这个模型计划下一步。Schmidhuber 把这称为 artificial curiosity:当基本需求满足后,系统会主动提出问题、设计实验、收集数据,而不只是回答人类给的问题。
机器人硬件是他认为最被低估的瓶颈。他明确说,当前 robot hardware 和人类身体相比非常落后,尤其没有人造技术能接近人手兼具强抓握和精细操作的能力。他的原话是:“你不能只靠屏幕背后的东西拥有 AGI。”棋类超人系统和能通过 Turing test 的文本系统可以存在于屏幕里,但如果不能掌握真实世界,就还不是 physical AGI。对 builder 的启示是,AI 的下一阶段不只是模型榜单,还包括硬件、world model、自主实验和真实环境中的闭环学习。