← 收录原文
BUILDERS · 精选整理

Builders 精选|2026-06-11

2026-06-11 · 历史整理稿

X / 推特

深度学习研究者 Andrej Karpathy

Karpathy 对 Claude Fable 5 的发布给出了罕见的高评价。他指出 Fable 5 和 Mythos 是同一个底层模型,只是加了安全护栏,benchmark 全面 SOTA 且领先幅度明显。但他强调更重要的是定性体感:这是一次配得上大版本号的跃迁,量级和去年 11 月的 Claude 4.5 相当,尤其在超难问题的长时间求解上表现突出。他说你可以交给它远比以往更有野心的任务,模型能真正理解意图然后自己往前推进,他甚至第一次产生了完全不看代码的冲动,但提醒不要在生产环境这么干。他也指出模型仍有怪癖,发布初期的安全护栏触发得偏敏感,希望后续能调优。他感受到 Jevons 悖论正在发生:软件像自来水一样产出后,他自己对软件的需求反而大幅增长,解释器、可视化工具、仪表盘、一次性定制应用(比如只为你的项目定制的完整 wandb)、10 倍扩充测试套件、自动优化代码、带定制 HTML 结果页的大型研究项目,什么都可以要。

AI Engineer 大会与 Latent Space 主理人 Swyx

Swyx 给出一个实用技巧:趁 Fable 还没按用量计费,赶紧让 Claude Code 对你的代码跑一遍 "review my code for issues",他说结果会让你惊恐于自己过去居然敢不做 Fable Check 就把东西推上生产环境。他还梳理了一条时间线:从签约到 Mythos 级模型向全世界 GA 只用了 34 天,他的评价是基于 NVIDIA 技术栈意味着"你就是能把事干成"。他另外整理了多个订阅档位的对比图表,包括他所说的 vibe shift 图,不同档位之间的差距没有旗舰档那么悬殊。整体看他的关注点是把这次发布放进产业节奏里读:模型迭代速度、算力合作和定价窗口期。

Anthropic Claude Code 团队 Boris Cherny

Boris Cherny 说 Fable 5 是自去年 11 月 Opus 4.5 以来他体感最大的一次模型跃升。他回忆 Opus 4.5 发布后,他意识到自己已经连续几周 100% 在终端里写代码,于是卸载了 IDE。而到了 Fable,他的感受是 Claude 从一个 coding agent 升级成了产品构建中的思考和设计伙伴,模型有了判断力、品味和多维度思考,让他敢把最复杂的工作交给它。他举了一个让他产生这种认知的瞬间:让 Fable 去 debug 一个问题,这是他用过的第一个如此有条理且精确的模型,会先做测量、加日志,然后验证问题真的修好了才宣布完成。而 Claude Code 的提示词里并没有任何指令要求模型这么做,这就是它的性格,他称之为前所未有的 "big model smell"。他还强调了自我验证循环的重要性:在模型能长时间运行的时代,自我验证是让模型跑得更久、产出更贴近你意图的关键要素,让你不用一直盯着 Claude 干活,并推荐了 delba_oliveira 对这套方法的拆解。

OpenAI Codex 与 ChatGPT 团队 Thibault Sottiaux

Thibault Sottiaux 这两天的主题是 Codex 的 /goal 功能。他发起了一个调研,问大家是偶尔用 codex /goal,还是把它当成完成工作的主要方式。他自己的用法是"像指挥交响乐一样玩 Codex",一次跑一个 /goal,让多个目标有序推进。这和 Anthropic 这边推的 /loop 与 /goal 思路形成了有趣的呼应:两家头部实验室都在把交互范式从"给任务"推向"给目标"。

AI 教程与访谈创作者 Peter Yang

Peter Yang 分享了他用来测试 Fable 的完整 prompt:让模型构建一个 F-Zero 风格的反重力赛车游戏,要求伪 3D 赛道(raycasting 或 mode-7 式缩放)、3 个 AI 对手、消耗血量的加速槽、400-800 km/h 的速度感(通过赛道扭曲和地面纹理滚动呈现)、方向键转向、shift 加速、3 圈带检查点的环形赛道。风格要求霓虹赛博朋克:暗色天空、发光赛道边缘、加速时的色差效果,外加显示排名/圈数/速度/血量的 HUD,并让飞船入弯时侧倾。他特别强调"手感优先于真实感,速度感就是这个游戏的全部",这条 prompt 本身就是一份很好的游戏类 vibe coding 模板。他也给出了负面反馈:浏览器调用让 Fable 在他这边明显变慢。他还吐槽了一句"big model smell 到底是什么意思",调侃了 Anthropic 团队这两天的高频词。

Anthropic Claude Code 团队 Thariq

Thariq 说 Fable 是模型的一次 step-change,他希望这会改变你和 Claude 协作的方式。他预告接下来会发一系列文章,讲 Fable 如何重塑了他们团队的工作方式,TLDR 只有一句话:是时候更有野心了。这和 Boris Cherny、Alex Albert 的表态一致,Anthropic 内部对这次发布的定调显然是"改变用法"而不只是"提升性能"。他本人目前在 Code w/ Claude Tokyo 活动现场,邀请在场的人去打招呼。

Vercel CEO Guillermo Rauch

Guillermo Rauch 发布了 Vercel CLI 的新能力:可以直接创建 AI Gateway API key,用 --budget 参数给每个 key 设消费上限,再用 --refresh-period 设定额度刷新周期。他的类比是"给 AI token 用的虚拟信用卡",这对需要把模型调用额度分发给团队成员或子项目的工程组织来说是个很实际的治理工具。他还分享了一个跨模型协作的案例:让 Opus 写了一个 VM,然后用 Mythos 来验证它,展示了"一个模型生成、另一个模型校验"的工作流。两条信息合起来看,Vercel 正在把自己往 AI 基础设施的计费和编排层定位。

Anthropic 研究员 Alex Albert

Alex Albert 宣布 Anthropic 已重置了全产品线的用量限制,并给刚开始测试 Fable 的用户总结了四条使用技巧。第一,给它比以往模型能处理的更大、更有野心的任务。第二,默认用 xhigh 或 high effort 档位以获得最佳性能,交互式会话求快可以用 med。第三,重写你的 skills 和 CLAUDE.md,为旧模型写的指令会把 Fable 锚定在过时的模式上,应该先让它用自己的判断力。第四,从"给任务"转向"给目标":描述完成态长什么样、如何验证,然后让 Fable 自己找路径,/loop 和 /goal 就是为此设计的。他还从亲历者角度给这次发布定位:他经历了 Anthropic 的每一次模型发布,真正称得上 step-change 的只有 Claude Opus 3、Sonnet 3.5、Opus 4.5,现在加上 Fable 5。他的核心感受是,模型从一个"被我指挥的工具"变成了"与我协作的对象"。

Box CEO Aaron Levie

Aaron Levie 力荐一篇关于应用层 AI 公司的文章,他认为正在做 applied AI 的创业者必读。他引用的核心段落是:应用要在"模型训练不到的角落"里赢得位置,靠的是不光鲜的苦活,把企业的私有现实整理成模型可以行动的形态、给模型递上行动工具、陪客户改变其组织现实,这种"翻译工作"永远做不完,做翻译的公司很难被复制。他自己的判断是:模型能力和企业具体工作流之间仍然存在巨大鸿沟,一部分是待建的技术,一大部分是拿到并格式化正确的数据,还有更大一块是变更管理和具体实施(比如 FDE 模式)。他认为两件事可以同时为真:前沿模型和实验室会继续高速增长,同时会涌现一个庞大的软件和服务生态把模型能力带进真实企业,给新基础设施商、各垂直领域的 applied AI 公司、新形态系统集成商都留出空间。他对 Fable 5 的发布也很直接:如果你以为 AI 进展在放缓,这就是立刻打脸的回答,能力全面大跳,会给几乎所有知识工作品类的 agent 带来重大提升。他还讨论了一个评测方法论问题:模型表现很大程度上是推理时算力的函数,因此按算力归一化的 benchmark 是唯一合理的方向,但难点在于该用多少算力是主观的,模型在不同算力阈值下排名会互换,阈值又有近乎无限种取法。

Y Combinator CEO Garry Tan

Garry Tan 对 Fable 5 的评价是"我见过的最大的模型能量"。不过他的实际体验并非一帆风顺:他在用 Fable 5 修 GStack 的问题时碰了壁,发推配了一声长叹。一边是兴奋的整体判断,一边是真实工作流里的摩擦,这两条放在一起反而是这次发布期更真实的用户写照。

独立开发者 Zara Zhang

Zara Zhang 提出了一个关于 coding agent 普及的反直觉观点:非技术人群用不起来 coding agent,瓶颈从来不是界面,因为聊天本身就是人类发明过的最简单的 UI。真正的障碍是他们不知道该提什么需求,空白的聊天框默认你已经知道什么是可能的,而大多数人不知道。她以 Town 的 onboarding 为例:agent 会主动建议工作流、提出它能帮你分担的事情,而不是干等你下指令,这让她印象深刻。她还预告本周五会做一场线上分享,讲她的 vibe coding 全过程:作为一个在 GitHub 上拿到 30k star 的非技术背景开发者,她会分享产品想法从哪来、怎么和 coding agent 协作、如何设计出不是 AI slop 的东西,以及为什么她认为代码是讲故事的媒介。报名时用优惠码 PREMIUMPASS 可以免费参加。

FPV Ventures 合伙人 Nikunj Kothari

Nikunj Kothari 演示了一个从播客到成品网站的一条龙工作流。他听了最新一期 Invest Like the Best,里面大量讨论 S-curve,于是让 Fable 一次性生成了一个网站,梳理过去 200 年里所有的 S 曲线、各自的拐点,以及每一条当年被当成泡沫的争议,现已上线 escurves dot com。他公开了具体做法:在 Claude app 里开 research 模式,把整期播客的 transcript 倒进去,让它研究历史上所有 S-curve、划分章节,最后产出一条可以让 Claude Code 一次跑通的 prompt。这个"播客 transcript 到 research 到 one-shot prompt 到上线网站"的链路,是普通人复制门槛很低的内容生产范式。

Every CEO Dan Shipper

Dan Shipper 宣布 Fable(Mythos)正式发布,并透露 Every 团队已经提前测试了一周。他们第一时间放出了惯例的 Vibe Check 节目,给出团队对新模型的整体评测,视频已在 YouTube 上线。Every 一直是新模型发布日最快产出深度使用报告的媒体之一,这期 Vibe Check 值得想了解 Fable 真实表现的人优先观看。

Anthropic 官方账号 Claude

Anthropic 官方公布了这次发布的双模型结构:Claude Fable 5 即日起全渠道可用,Claude Mythos 5 则仅限 Glasswing 合作伙伴使用。Mythos 5 和 Fable 5 共享同一个底层模型,区别在于 Mythos 在某些领域解除了安全护栏。首批拿到 Mythos 5 的是一小批网络防御者和关键基础设施提供商。官方表示后续打算通过更广泛的 trusted access program 扩大 Mythos 5 的开放范围,方向是防御性网络安全工作和生物医学研究。这套"同一模型、分级护栏、可信准入"的发布结构,是前沿实验室在能力与安全之间做权衡的一个新模板。

播客

AI & I by Every — We Automated Everything With AI and Tripled Our Headcount

核心要点:自动化越多,人类的工作反而越多,只要你"骑在模型上"持续跟进新模型,你就不会失业。

Every CEO Dan Shipper 这次被自家 COO Brandon 反向采访,聊他刚发表的 8000 字长文 After Automation。Every 是观察这个问题的最佳样本:这家公司 AI 原生到"在 Slack 里随手一挥,打到人和打到 agent 的概率差不多",所有人每天用 Claude Code 和 Codex 干活,但从 GPT-3 时代至今团队从 4 人涨到 30 人,现在还在继续招人。一边是 Dario 说一半入门级白领岗位可能消失、Citadel 的 Ken Griffin 看到 AI 做出 PhD 级金融分析后大受震撼,一边是最自动化的公司在持续扩张,这个悖论值得拆开看。

Dan 的核心论证分三步。第一,AI 把"昨天的专家能力"变得廉价:模型在人类全部产出上训练,任何人一条 prompt 就能写代码、做应用、出报告。第二,廉价能力被大规模采用后,会涌出海量"接近正确但不完全对"的产出,Every 内部连运营人员都在发 PR,但资深工程师 Willie 经常"觉得想法不错,然后整个重写"。第三,这反而推高了对专家的需求:要么搭系统(repo 规则、review 流程、编辑规范)把及格产出护送成真正有用的东西,要么用这些工具做以前不可能的事,比如同事 Kieran 一两个月独立做出完整的 inbox 产品。

他给出的最关键一句话是:"agent 离人越远,它就越不值钱。"在他看来 agent 这个词本身有误导性,它的本义是"代表他人行事",这些工具在执行任务上会越来越自主,但这和"有自己想做的事"的 agency 完全是两回事,整个行业的经济激励都在把模型推向更顺从而不是更有自主意志。他对 AGI 的定义也很实用主义:一个你永远不会关掉、让它持续生成 token 干活在经济上划算的 agent。即便到了那一天,它依然会回头问你"接下来做什么才重要",而"什么重要"恰恰因为 AI 在高速改变世界,更需要人来持续判断。

对于 ClickUp CEO 高调宣布裁员两成的新闻,Dan 的态度是怀疑:业绩不好的公司本来就会裁员,把锅甩给 AI 只是更省事的叙事。他还观察到不少公司用 AI 替换客服后两个月就回头求人回来,因为打电话的用户在拼命确认"你是不是机器人"并坚决要找真人。他的结尾建议很明确:"如果你骑在模型上,你会没事的。你会有工作,你会做出很棒的作品,你不需要担心。"另外他还分享了写这篇长文的工作流:每天早晨对着 proof 文档口述全文论证,让 Claude 帮他厘清"我到底想说什么",再让 Codex 把最新草稿转成播客,通勤路上边听边找问题。