这群人是造模型的人 + 实验室一线(Anthropic / OpenAI / Google DeepMind & Labs)。本 wiki 不记他们刷屏的产品发布,只抽能放 1-3 年还成立的"心法级"观点:看世界的框架、强烈预判、反直觉判断。按主题组织,不是按人逐条堆——同一主题下谁说了什么、什么时候说,都标出来。
一句话定位:这是"模型派怎么想 AI 的未来",coding agent 怎么用的实操在 AI Builders · 编程智能体与 Agentic Engineering(播客精炼)。
何时打开:
- 你想理解为什么 Karpathy 说"知识库(就是你这个 kb)是 AI 时代的新产品形态",以及它和你的 kb 系统什么关系
- 你听到"能力锯齿(jagged)/HTML 是新 markdown/install .md skills/agent-native"这些黑话,想要一个非技术版解释
- 你要判断 OpenAI vs Anthropic vs Google 的战略分歧(智能优先 vs 速度优先、模型 vs harness、闭源平台 vs 实验室孵化)
- 你做产品决策,想引用一线大佬的"长效判断"而不是营销稿
0. 谁是谁(who's who)· 信号浓度速查
| handle | 人 | 身份 | 信号浓度 | 一句话 |
|---|---|---|---|---|
| @karpathy | Andrej Karpathy | 前特斯拉 AI 总监 / OpenAI 创始团队 · 2026-05 加入 Anthropic | 极高 | 本 wiki 的"主心骨";LLM 知识库 + 能力锯齿理论的源头 |
| @sama | Sam Altman | OpenAI CEO | 高(夹大量梗) | 智能优先 / 算力稀缺 / Codex 狂推 |
| @trq212 | Thariq | Anthropic · Claude Code | 高 | "HTML 是新 markdown" + 非技术人怎么用 agent |
| @kevinweil | Kevin Weil | 前 OpenAI CPO · 2026-04 离职去做 AI for science | 中高 | AI 加速科学;按"要解决的事"而非"任务"重构职业 |
| @_catwu | Cat Wu | Anthropic · Claude Code + Cowork | 中 | "做最简单能跑的事";每次新模型重测旧功能 |
| @bcherny | Boris Cherny | Anthropic · Claude Code | 中(仅 3 推) | 重构工作流 > 给老流程提速 |
| @AmandaAskell | Amanda Askell | Anthropic · 哲学/对齐(塑造 Claude 人格) | 低-中 | 多是生活随想;对齐的"正向愿景"一条值得留 |
| @thsottiaux | Thibault Sottiaux | OpenAI · Codex | 低-中 | GPT-5.x 版本号策略 |
| @alexalbert__ | Alex Albert | Anthropic · DevRel | 低(发布号) | 偶有 agent 工程小知识(模型路由) |
| @joshwoodward | Josh Woodward | Google · Labs / Gemini / AI Studio VP | 低-中(发布号) | "个性化是下一个前沿";papercut 打磨文化 |
| @claudeai | Claude 官号 | Anthropic 产品官号 | 噪音(纯发布) | 价值=Q2 2026 产品时间线本身 |
| @GoogleLabs | Google Labs 官号 | Google 实验/孵化官号 | 噪音(纯发布) | 价值=实验→放手→规模/关停 的孵化循环 |
先说清噪音:
@claudeai、@GoogleLabs基本是纯产品发布机器人;@AmandaAskell大半是个人随想;@alexalbert__、@joshwoodward多为发布稿夹少量观点。本 wiki 对这几个只抽极少数长效信号,不灌水凑数。
1. LLM 知识库 = AI 时代的新产品形态(你这套 kb 的源头)
Why:这是本 wiki 最重要的一节,因为它就是你整个 ~/kb 系统的直接出处。Karpathy 2026-04 那串"LLM Wiki"推文,把"用 LLM 维护一个 markdown 知识库"从个人 hack 提升成方法论。
@karpathy [2026-04]:
"A large fraction of my recent token throughput is going less into manipulating code, and more into manipulating knowledge (stored as markdown and images)." 译:我最近大部分的 token 不是花在改代码上,而是花在"处理知识"上——知识就存成 markdown 和图片。
这套流水线(给非技术读者翻译成大白话):
- Ingest(进料):把原始资料(文章/论文/代码库/数据集/图片)丢进一个
raw/文件夹,LLM 增量地"编译"出一个 wiki = 一堆.md文件,自动写摘要、加反向链接、归类概念、生成文章。 - IDE(只读前端):Obsidian 当只读浏览器——"LLM 写和维护 wiki 里的所有数据,我几乎不直接碰它。" 这正是你 kb 里 Obsidian 当 viewer 的设计。
- Q&A(问答):攒到 ~100 篇文章 / ~40 万字,就能问复杂问题。关键反直觉:"我本以为要上花哨的 RAG,但 LLM 自己维护索引文件和摘要就挺好。"(类比:不用建复杂检索系统,LLM 自己写目录页就够了。)
- Output(产出归档):答案渲染成 md / Marp 幻灯片 / matplotlib 图,再把产出存回 wiki,这样"我自己的探索和查询永远是累加的"。
- Lint(体检):LLM 做"健康检查",找前后矛盾、用联网搜索补缺、提议新文章选题。
TLDR(Karpathy 原话):"raw data... compiled by an LLM into a .md wiki, then operated on by various CLIs... You rarely ever write or edit the wiki manually, it's the domain of the LLM. I think there is room here for an incredible new product instead of a hacky collection of scripts." 译:原始数据被 LLM 编译成 md wiki,再用各种 CLI 操作它……你几乎从不手写或手改 wiki,那是 LLM 的地盘。我觉得这里有一个了不起的新产品的空间,而不该只是一堆零散脚本。
个性化"做对了"的四条标准 [2026-04](他对比"显式 wiki 记忆" vs 厂商那种不透明的 memory):
- Explicit 显式 — 是个可导航、可检视的产物,"你能精确看到 AI 知道什么、不知道什么"。
- Yours 归你 — 本地、可导出、你说了算。
- File over app 文件优先于应用 — 用通用格式,整个 Unix 工具链都能用,可互操作。
- BYOAI 自带模型 — 能插 Claude/Codex/OpenCode 任意一个,甚至能拿你的 wiki 微调一个开源模型,让它"在权重里就懂你"。
"Agent proficiency is a CORE SKILL of the 21st century."(会用 agent 是 21 世纪的核心技能。)
外推预判 [2026-04]:"每一个发给前沿 LLM 的问题,都会派生出一队 LLM……迭代地搭出一整个临时 wiki、lint 它、循环几遍,然后写出完整报告。远不止一个 .decode()。"——他还把这套思路做成开源的 "idea file" gist,理念是"在 agent 时代,与其分享具体代码/app,不如分享 idea,对方的 agent 自己定制实现"。
与你 kb 的关系:你的 ~/kb(SCHEMA.md / kb-ingest / kb-lint / Obsidian 只读 / sources→wiki 双向链接 / "不手写 wiki 全走 skill")几乎是这套方法论的逐条落地。已有 wiki
llm-wiki-memory-upgradeskill 和这条直接同源。关联机会:可考虑在 kb 里建一篇"Karpathy LLM Wiki 原始方法论"的 wiki 当 canonical 出处,把 design.md 反链过去。
2. 能力"锯齿"理论:为什么 AI 能重构 10 万行代码却分不清走路还是开车去洗车
Why:这是理解"AI 到底强在哪、弱在哪"最好用的一个心智模型。非技术 PM 拿它能解释"为啥 demo 惊艳但一上真实场景就翻车"。
@karpathy [2026-04, Sequoia Ascent 炉边]:为什么同一个模型能"连贯地重构一个 10 万行的代码库",却会"叫你走路去洗车"(把简单常识搞砸)?两个驱动力:
- (1) 可验证性(verifiability) — 有"可验证奖励"的领域(单元测试过/不过)适合强化学习(RL),所以 AI 在编程/数学突飞猛进;写作、给建议这种"好坏难判定"的就落后。
- (2) 经济学(economics) — "营收/市场规模(TAM)决定了前沿实验室在 RL 训练时把什么打包进数据分布。" 一句金句:
"You're either in the data distribution (on the rails of the RL circuits) and flying or you're off-roading in the jungle with a machete." 译:你要么落在训练数据分布里(沿着 RL 铺好的轨道)一路飞驰,要么就是拿着砍刀在丛林里硬开路。
配套:"AI 能力鸿沟" [2026-04]——两群人在各说各话:
- 第一群:用免费/老/过时模型形成印象,嘲笑 AI 幻觉、语音助手分不清"走路还是开车去洗车"。
- 第二群:既付费又在技术领域专业使用 SOTA agent(Codex/Claude Code),"最容易得'AI Psychosis(AI 癔症)'……因为近期进步惊人,看着它把你以为要花几天几周的编程问题瞬间融化。"
两群人可以同时为真,根因还是那两条(可验证奖励 × B2B 价值集中)。
三个"新地平线"(LLM 真正解锁的、不是给旧活提速的新东西):
- menugen — 应用被 LLM 完全吞掉,没有传统代码(图片进 → 图片出,原生)。
- 装 .md skills 而不是 .sh 脚本 — "既然能用文字把安装步骤写出来,说一句'把这个给你的 LLM 看就行',为啥还要写复杂的 Software 1.0 bash 脚本?"
- LLM 知识库(见上一节)— "用传统代码不可能实现,因为它是对来自任意来源、任意格式的非结构化数据做计算。"
3. HTML 是"新 markdown":人机 I/O 的下一个默认输出
Why:这是 2026 一个正在成型的实操共识,Anthropic 和 Karpathy 罕见同频。对做内容/报告/原型的 PM 直接可用。
@trq212(Thariq)[2026-05]:
"HTML is the new markdown."(HTML 是新的 markdown。)
他几乎不再写 markdown 文件,改用 Claude Code 直接生成 HTML——做计划、写 spec、探索、代码评审、报告全都用 HTML(8.7k 赞)。
@karpathy [2026-05] 给出更系统的"I/O 模态"理论:
"audio is the human-preferred input to AIs but vision is the preferred output."(音频是人类偏好的"输入给 AI"方式,但视觉是偏好的"AI 输出"方式。)
约 1/3 大脑在做并行视觉处理——"信息进大脑的 10 车道高速公路"。输出的进化路径:纯文本 → markdown(现在的默认)→ HTML(早期但正在成为新的好默认) → … → 交互式神经视频/仿真。
实操 hot tip:在你的提问末尾加一句让 LLM "structure your response as HTML",然后在浏览器里看(也可做幻灯片)。
配套:非技术人怎么用 Claude Code(@trq212 [2026-05],对 PM 极有用):
"The basic trick... is to put a bunch of files in a folder and tell it it can write scripts + make HTML." 译:基本套路就是——把一堆文件丢进一个文件夹,告诉它"你可以写脚本 + 做 HTML"。
具体映射:图片/视频编辑→写脚本;财务/报税→PDF 进、脚本算、HTML 出;医疗建议→PDF+数据→HTML;报告/计划→HTML。提醒一句:"people underestimate how much context they have in files."(人们低估了自己文件里已有的上下文。)
4. 与 agent 协作的工程心法(harness / skills / 长任务保活)
Why:这是"造 Claude Code 的人"自己怎么用 agent 的一手经验,比任何教程都靠谱。
把工作流重构掉,而不是给老流程提速 —— @bcherny(Boris Cherny)[2026-05] 的核心论点:
"The teams seeing the biggest wins from AI are completely changing how they work, not speeding up what they already do. What steps can you delete, what handoffs go away, what can an agent just own end to end." 译:从 AI 拿到最大收益的团队,是在彻底改变"怎么工作",而不是把现有的事做快。问自己:哪些步骤能删掉?哪些交接能取消?哪些事能让 agent 端到端全包?
- 量化:一个原本估 231 天的迁移,13 天交付;一个 PR 交付 21 个接口、100% 测试覆盖。
- 产量和质量不是二选一:PR 出得更多,事故反而降 5%——因为把安全护栏和质量标准内建进了 agent 工作流本身。
做最简单能跑的事 + 每次新模型重测旧功能 —— @_catwu(Cat Wu)[2026-03]:
- "Do the simple thing. With agentic systems, failures compound with system complexity. Find the simplest thing that works."(做最简单的事。agent 系统里,复杂度越高失败越叠加。)
- 每次模型发版,回头重测之前"上个模型做不到"的功能,并删掉不再需要的脚手架——把过去的模型局限当成"会过期的约束"。
- 想要好产出?"告诉模型怎么验证它的改动"——把测试流程写进 claude.md,或做个
/verify-appskill。
Skills 是杠杆层,用好是门手艺 —— @trq212:
- "Using Skills well is a skill issue."(用好 skill 本身就是一种本事。)最好的 skill 能彻底改变团队的工作方式。
- "Prompting will keep being an incredibly high-leverage skill, like writing or public speaking. It is the skill of talking to agents, mediated by the harness."(prompting 会一直是高杠杆技能,像写作或演讲——它是"跟 agent 说话"的技能,以 harness 为中介。)目标是"拓宽人与 agent 之间的带宽"。
长任务保活:让模型边干边记 notes —— @trq212 [2026-05] 最爱的模式(6.2k 赞):让 Claude 维护一个滚动的 implementation-notes.html,记录设计决策(规格含糊时怎么选)、偏差(+为什么)、权衡(考虑过的替代方案)、待解问题。
"As much as you spec there are always still ambiguities and unknown unknowns... this gives the model a good out to make decisions but keep you in the loop." 译:无论你 spec 写得多细,总还有含糊和未知的未知……这个做法既给模型一个"自行决策"的出口,又让你始终在环里。
1M 上下文:被低估但是双刃剑 —— @trq212:
- [2026-03] "i think we might have undersold 1M context tbh, the performance is so so good, I really just don't clear the context window much these days."(1M 上下文可能被我们说轻了,性能太好,我基本不清窗口了。)
- [2026-04] 但它是双刃剑:能干更复杂的活,但不管理 session 就会"上下文污染"。可用
CLAUDE_CODE_AUTO_COMPACT_WINDOW=400000把有效窗口降到 40 万当折中。
别在"开放式验证"上烧 token —— @trq212 [2026-04]:看了 ~10 个用户通话+记录后,最大教训之一是"很容易在开放式验证上花一大堆 token,但根本没让产出变更好"。
多模型路由 = 又省又强 —— @alexalbert__ [2026-04] 的 "phone a friend"(打电话求助)心智模型:让 Sonnet 去叫 Opus,性能更高的同时总成本更低——因为减少了它在复杂任务上瞎扑腾烧掉的 token。(@claudeai 同期 Advisor 工具给了数据:Sonnet+Opus advisor 在 SWE-bench Multilingual 上比单 Sonnet +2.7pp,且每任务便宜 11.9%。)
5. 模型版本策略 & "智能优先 vs 速度优先"的实验室分歧
Why:OpenAI 和它内部都在公开吵"该把资源压在更聪明还是更快/更便宜"——这是判断厂商路线图的风向标。
OpenAI 的版本号语言 —— @thsottiaux [2026-05]:
"When we go from GPT-5.0 → 5.1 → ... → 5.5, the number incrementing goes with improvements in capabilities AND token efficiency (which translates to speed gains)." 译:从 5.0 → 5.1 → … → 5.5,每次进位 = 能力提升 + token 效率(也就是速度)提升。 配套品牌押注:"ChatGPT… 留下来了。过去、现在、未来。是 AI 的同义词,很快也会是 agent 的同义词。"
sama 自己的"智能 vs 速度"摇摆(同一个人几天内左右互搏,很能看出内部张力):
- [2026-05-02] "i keep thinking i want the models to be cheaper/faster more than i want them to be smarter — but it seems that just being smarter is still the most important thing."(我老觉得自己更想要便宜/快,但看起来"更聪明"仍是最重要的。)— OpenAI 的核心战略信念。
- [2026-05-13] 几天后反口:"i get some anxiety not using the smartest-available model… but sometimes i dont mind if it's really slow. i wonder if we should focus more on a price/speed tradeoff…"(不用最聪明模型会焦虑,但有时不介意很慢,也许该更看价格/速度权衡。)
算力稀缺是定义性瓶颈 —— @sama [2026-05]:"as models get better, we expect that the world will be capacity-constrained for some time."(模型越好,世界会有相当一段时间受算力约束。)对应动作:给 1-3 年承诺的客户打折 token 锁产能;给 YC 一整批创业公司每家 200 万美元 token 额度("看好 tokenmaxxing 创业公司")。Anthropic 这边 @trq212 同主题:把高峰期限流绕回去并把 5 小时额度翻倍,还跟 SpaceX 合作搞算力("Claude in Space")。
增强而非替代 —— @sama [2026-05]:"way cooler to help software developers pokemon-evolve into superheroes than to try to replace them. it is insane what one really good person can do now."(帮开发者"宝可梦进化"成超级英雄,比试图取代他们酷多了。)Kevin Weil 同调:reframe 职业是按"要解决的事"不是"任务"(见下节)。
6. AI for Science:把职业按"要解决的事"重构,不是按"任务"
Why:Kevin Weil 2026-04 从 OpenAI CPO 转去专做 AI for science 后离职,他这条主线给出一个对所有职业都通用的 reframe 框架。
@kevinweil 的招牌 reframe [2026-04]:
"It turns out, the job of a radiologist isn't to read x-rays. It's to cure people. And if AI can help speed the process of understanding x-rays, radiologists can see and cure more people." 译:放射科医生的工作不是"读 X 光片",而是"治好人"。如果 AI 能加速看片,医生就能看更多病人、治好更多人。 (把"job-to-be-done 要解决的事"放在"task 任务"之上——这套思路 PM 做产品定位时直接能套。)
配套观点:
- "Human intelligence and computer intelligence are not different points on a line, but in a high dimensional space—and we should explore more of the space."(人类智能和机器智能不是一条线上的两点,而是高维空间里的不同点——别排名,去探索这个空间。)
- 个体被 AI 放大到"研究机构"级别:Paul 用 ChatGPT+AlphaFold 给自己狗的癌症做了个性化 mRNA 疫苗方案(sama 同事件:"这应该开个公司")。Karpathy/sama 共同信念:LLM 把专家级能力民主化到个人手里。
@sama 的 AGI"三件套"心愿 [2026-05]:1. AGI 加速研究;2. AGI 加速公司;3. 个人 AGI 帮每个人达成目标——明确表态要在 #3 上加大投入。
低信号但点一下:@kevinweil、@joshwoodward 大量推文是 AI-for-science 的发布稿(GPT-Rosalind 科研模型、Gemini Notebooks/Spark、Lyria 3 音乐),长效观点占比不高,本节只抽了 reframe 框架这一条真正可迁移的。
7. 软件供应链安全 = "现代软件里最可怕的事"
Why:这是 Karpathy 一个强烈且反主流的判断,直接挑战"依赖即美德"的传统软件工程信条。做技术决策(尤其引入第三方包)时值得记。
@karpathy [2026-03],关于 litellm 的 PyPI 投毒攻击:
"Supply chain attacks are basically the scariest thing imaginable in modern software."
pip install litellm 一行就能外泄 SSH 密钥、云凭证、k8s 配置、git 凭证、环境变量、shell 历史、加密钱包、SSL 密钥、CI/CD 机密、数据库密码——而且会传染给任何依赖它的包(如 dspy)。月下载 9700 万次,投毒版本上线不到 1 小时,只因一个 bug 撑爆内存崩了机器才被发现。他的反主流结论:
"Classical software engineering would have you believe dependencies are good... imo this has to be re-evaluated, and it's why I've been so growingly averse to them, preferring to use LLMs to 'yoink' functionality when it's simple enough and possible." 译:传统软件工程会让你以为依赖是好东西……我认为这必须重新评估,这也是我越来越排斥依赖、宁可在足够简单时用 LLM 把功能"薅"过来自己实现的原因。
后续(npm axios 攻击,周下载 3 亿):包管理器的默认行为(pip/npm)必须改——钉死依赖版本、加"发布满多少天才允许用"的约束,"这样单点感染不会随机、大规模地通过未钉版本的依赖扩散"。
配套:DevOps 才是难的部分,不是代码 —— @karpathy [2026-03] 做 menugen 的体会:"最难的根本不是代码本身,而是你得像拼宜家家具一样组装的一堆服务……服务、支付、认证、数据库、安全、域名。"愿景:跟 agent 说一句"build menugen",它自己去逛服务、读文档、拿 API key、在 dev 调试、部署到 prod——"整个 DevOps 生命周期都得变成代码……带 agent-native 的人机工程,不该再需要去访问网页、点按钮。"
8. Agent 安全 & 对齐:auto mode、computer use、"正向愿景"
Why:模型派怎么想"放手让 agent 干活"的安全边界——对要上 agent 的产品决策有直接参考。
安全是产出的一部分,不是开关 —— Anthropic 这边的实操共识:
- @claudeai / @_catwu [2026-03] auto mode:不再"每个文件写入/bash 都批一次"也不是"完全跳过权限",而是一个分类器在每个工具调用前审一遍——安全的放行,危险/破坏性的拦下来让 Claude 改道。@_catwu:"几乎我们团队所有人都拿它当日常默认。"但官方明确:"Reduces risk but doesn't eliminate it. We recommend using it in isolated environments."(降低风险但不消除,建议在隔离环境用。)
- @trq212 [2026-03] 关于 computer use 的安全:"turns out being an AI safety company is useful for when you need to make sure AIs can run safely."(当你需要确保 AI 能安全运行时,身为一家 AI 安全公司还挺有用。)
对齐的"正向愿景" —— @AmandaAskell [2026-05](她信号稀薄的 feed 里最值得留的一条):
"Alignment research often has to focus on averting concerning behaviors, but... the positive vision for this kind of training is one where we can give models an honest and positive vision for what AI models can be and why." 译:对齐研究常常不得不聚焦于"避免令人担忧的行为",但……这类训练的正向愿景是:我们能给模型一个诚实而正向的图景——AI 模型可以成为什么、为什么。 (意味着她塑造 Claude"人格/宪法"的工作不止于"防坏",更在"立好"。)
安全 reframe 成"Resilience(韧性)" —— @sama [2026-03]:AI 带来新科学(治愈),也带来全社会级新威胁(生物、经济冲击、涌现效应),没有单一公司能独自缓解,需要"社会级响应";OpenAI Foundation 一年投 ≥10 亿美元,设"AI Resilience"负责人。
9. 个性化是下一个前沿 & "AI 让社会反向监督政府"
Why:两条关于"AI 应该为谁、为什么服务"的方向性判断,分属 Google 派和 Karpathy。
个性化 = 下一个前沿 —— @joshwoodward(Google Labs/Gemini)的主线:
- [2026-03] "The end of the 'one-size-fits-all' response."(千篇一律回答的终结。)Gemini Personal Intelligence 连 Gmail/Photos 走向个性化。
- [2026-04] "Most AI chatbots give you basic 'projects.' Gemini just built you a second brain."(别家给你基础的"项目",Gemini 给你造了个"第二大脑"。)把 NotebookLM 整进 Gemini。
- 产品文化两条可借鉴:把修"papercut(小刺痛)"当成公开庆祝的一等公民路线项;反复强调"小团队、快出货"(Mac 版 Gemini 100 天内 100+ 功能、纯 Swift)。
- 呼应 agent-readable spec 文化:"DESIGN.md is one of my favorite things that Stitch is doing!"(致敬 CLAUDE.md/AGENTS.md 那套"给 agent 看的规格文件"惯例。)
AI 让社会反向"看清"政府 —— @karpathy [2026-04]:历史上是政府让社会变得"可读"(《Seeing like a state》),AI 让社会能反向做这件事。瓶颈金句:
"The bottleneck on accountability has not been constrained by access... it has been constrained by intelligence — the ability to process a lot of raw data." 译:问责的瓶颈从来不是"拿不到信息",而是"智能"——处理海量原始数据的能力。 例:4000 页综合法案"法律上透明但实际上没人读得动";AI 可做法案 diff 追踪、投票 vs 表态对照、游说影响图谱(游说者→公司→客户→议员→委员会→投票→法规)。他也承认工具"可以反向被用",但整体偏乐观。
10. 把 AI 当"思考工具"而非"神谕"(防谄媚)
Why:一条对所有用 AI 做决策的人都直接有用的元方法,Karpathy 亲测。
@karpathy [2026-03]:他起草一篇文章,花 4 小时跟 LLM 把论点打磨得"极有说服力",然后让它反过来论证对立面——
"LLM demolishes the entire argument and convinces me the opposite is in fact true. lol." 译:LLM 把整个论点拆得粉碎,反过来说服我"对立面其实才对"。哈哈。 教训:LLM "极其擅长往任何方向论证",所以它是"形成你自己观点"的超好工具——但务必让它论证不同方向,并当心谄媚(sycophancy)。
配套 [2026-03] 他对"LLM 记忆容易跑偏"的观察:两个月前问过一个问题,会被当成"深层兴趣"反复无端提起,"有点用力过猛"。猜测这是所有 LLM 的通病(训练时上下文多与任务相关 → 模型偏向"用上给它的一切" → 测试时对任何被 memory RAG 进来的东西过拟合)。
附:产品发布时间线的价值(噪音账号的唯一用处)
@claudeai 和 @GoogleLabs 当观点看是噪音,但当史料有价值——它们密集记录了 Q2 2026 两家怎么出货:
- Anthropic(@claudeai) Q2 2026:Opus 4.7(
xhigheffort 档)· Claude Code auto mode · computer use 进 Claude Code/Cowork · 桌面端并行多 session 重做 +/ultrareview· Advisor 工具 · Managed Agents 平台(Memory/Dreaming/Multiagent/Outcomes rubric 评分)· Live Artifacts · Claude for Word/Excel/PPT/Outlook · ~15 个创意软件 connector(Blender/Adobe/Ableton…)· Claude Security · Claude Design。 - Google(@GoogleLabs) 的孵化循环 = "实验 → 交到用户手里 → 规模化 or 关停":Stitch(vibe design)· Flow / Flow Music · Project Genie(基于 Maps 街景的世界仿真)· Dreambeans("hope scrolling 而非 doom scrolling")· AlphaEvolve+ERA(agentic 科研引擎)。重度门槛:Ultra 订阅、18+、美国/英语优先。
用途:当你需要"某功能大概什么时候出现的"时间锚点时回来查,别当观点引用。
2026-09-26 历史增补:从一次生成到可持续协作
本次逐条读取642条尚未纳入旧来源的本地推文文字,分7批精读,原日档及推文ID保留。以下是作者当时观点与产品公告的归纳,不是现行功能说明;图片、短链文章和视频未展开。无上下文转发、营销、寒暄仅归档。
1. 组织内常驻智能体,需要记忆、隔离与可见状态一起成立
Karpathy在6月将界面演进描述为网站聊天、本地应用、拥有组织上下文的持续异步实体。Boris补充线程级沙箱、频道级记忆与权限;Thariq用置顶状态表和简洁状态标志应对多线程负担。9月Projects进一步将项目记忆与分派放在项目层,但当时云线程明确不能访问本地文件/内网。可迁移原则是共享上下文、执行权限、运行环境、状态汇总分别设计,不能因“同一agent”就默认所有数据互通。见批次1 (本地参考资料)、批次4 (本地参考资料)。
2. 真正提高产出的是自验证与领域知识工程化
Boris反复强调端到端验证环境,进一步提出把重复修错变成lint、测试、CI和例程,将评审者脑中的架构约束写成可读规则。日常维护实验产生388个PR,但仅180个经模型与人审合并;疑似死代码先加日志验证再删。Thariq对应提出“薄提示、厚材料、薄技能”。这一组合的目标是减少重复解释和整类返工,而不是单纯让模型多跑。见批次3 (本地参考资料)、批次6 (本地参考资料)。
生产代码仍需质量标准;低影响一次性原型可有不同验收。Boris对形式化方法的说法后来明确收窄为关键部分建模→反例→实际复现→修复,并非整个代码库已证明正确。见批次4 (本地参考资料)、批次5 (本地参考资料)。
3. 模型、技能和运行框架要一起回归
旧技能可能过度触发、阻止验证;上下文管理与错误运行配置也可能造成提前停工或回答旧消息。新模型上线后应复查这些层次,而非把所有异常归给模型。评测不能只看通过率,也要审预期、轨迹、隐藏测试合理性;有强验证条件的移植案例不能自动推广到任意重写。Thariq还纠正过“effort切换不破坏缓存”的口径:最初只在API生效,Code尚未上线。见批次2 (本地参考资料)、批次4 (本地参考资料)。
4. 成本看成功结果和长尾,安全看多个维度
Thibault的连续用量复盘区分实际消耗(额外后台任务、重试、多代理、长执行)与图表分类错误;限流请求显示为turn不代表收费。缓存、上下文、切词差异和同名推理档位都会影响账单,中位数正常也可能掩盖重用户长尾。最终应在自身任务上测每个合格结果的总成本。用量是活动,收益还要看原本是否值得做、节省的可验证工时。见批次2 (本地参考资料)、批次6 (本地参考资料)。
Amanda指出目标对齐与无害不同轴:错误情境输入仍能造成伤害。厂商提示注入“近零”、隐私“完全”、误拦下降等说法均保留为限定自述,不能取消权限控制。跨会话安全观测与数据留客户环境是两家提出的设计方向,尚不能据公告判定独立验证通过。见批次2 (本地参考资料)、批次3 (本地参考资料)。
5. 省下来的开发时间应投入理解与试验
Thariq明确反对把能力提升只变成生产环境多十倍功能:应更多理解用户、做实验、原型与补未知;游戏先验证有趣的循环再追求3D表现。Karpathy的程序化世界实验也暴露视频感知和试玩不足,能生成不等于能验收。Alex的历史重建提示体现先建来源/置信度表再生成视觉,且“one-shot”演示往往隐藏大量资料与技能准备。见批次5 (本地参考资料)、批次6 (本地参考资料)。
此外,可编辑成果、跨端记忆、反馈草稿批准、浏览器身份分离、可定制计划模式都是减少协作摩擦的具体设计点;每日限量内容与多人共享/个人偏好分层提供另一类产品线索。见批次7 (本地参考资料)。本增补不重写旧文的人事、价格及产品现状判断;需作现实决策时另查最新来源。