← Knowledge Notes
AI Engineering / Knowledge note · Chinese

王凯 收藏 / 2024-2026 AI 前沿论文与报告精读

Aschenbrenner Situational Awareness 165 页宣言 + How People Use ChatGPT (OpenAI) + Why LLMs Hallucinate (OpenAI) + Generative AI Seniority-Biased Change + Reddit 大规模说服实验 + OpenAI Practical Guide to Building Agents + Google Prompt Engineering (Lee Boonstra) + 看 DAO 2025 (未尽研究) + DeepSeek 入门 + AGI 介绍。10 篇文献,组合起来回答"AGI 是什么 / 多快来 / 怎么用 / 谁受冲击 / 怎么造 Agent"五大核心问题

Source collection:王凯 · Published here:2026-09-26

前沿论文大模型Agent

10 篇 2024-2026 AI 前沿文献的精读笔记。这一批跟 2023 AIGC 行业报告(见 王凯 收藏 / 2023 AIGC 行业报告档案)不同 — 时间更近、视角更深、影响更大,代表了 AGI 进入下一个阶段时,真正塑造思考方式的研究与宣言。


一、Aschenbrenner《Situational Awareness》(2024-06,165 页)— 最具影响力的 AGI 时间表宣言

核心论点

AGI by 2027 is strikingly plausible(2027 年达到 AGI 高度合理)。

作者 Leopold Aschenbrenner 前 OpenAI 研究员,2024 年 6 月发表,从此成为 SF AI 圈"姿势态势"(situational awareness)的代名词。

5 大章节 + 关键判断

Chapter 核心论断 数据锚点
I. From GPT-4 to AGI: Counting the OOMs GPT-2→GPT-4 = 学前儿童→聪明高中生 4 年。compute 0.5 OOM/year + 算法效率 0.5 OOM/year + unhobbling(chatbot→agent)= 2027 再来一次同等跳跃 4 年 ≈ 4-5 OOMs;2024→2027 再来 4-5 OOMs
II. From AGI to Superintelligence: the Intelligence Explosion AI 不停在人类水平。数亿 AGI 自动化 AI 研究,把 10 年算法进步压缩到 1 年(5+ OOMs in 1 year)。人类级 → 超人级会发生在 1 年内 "fast takeoff"的具体机制
IIIa. Racing to the Trillion-Dollar Cluster $10B → $100B → $1T compute clusters。美国电力产量本十年末增加几十个百分点。重新工业化:GPU + datacenter + power 数万亿美金 "trillion-dollar cluster"概念由此而出
IIIb. Lock Down the Labs 美国 AI 实验室安全是个笑话(an afterthought)。正在把 AGI 关键秘密免费送给 CCP。state-actor 级威胁,我们没准备好 出于此章离开 OpenAI 后被开除
IIIc. Superalignment 控制比我们聪明得多的 AI 是未解的技术问题。可解,但 intelligence explosion 期间很容易脱轨。失败可能灾难性 接 Ilya/Jan Leike "superalignment team"的视角
IIId. The Free World Must Prevail 超智能 = 决定性经济军事优势。中国仍在游戏中。Free world 生存攸关 地缘政治维度引入
IV. The Project AGI 竞赛白热化后,美国国家安全机构会介入。2027/2028 会有某种政府 AGI 项目。"in a SCIF, the endgame will be on" 私营公司 → 国家项目转折预言

王凯应用

这份文档对王凯影响巨大,反复在帖子中被引用作为"AGI 视角看当下"的源头。比如:

关键句子(原文)

"By 2025/26, these machines will outpace college graduates. By the end of the decade, they will be smarter than you or I; we will have superintelligence, in the true sense of the word."

"Hundreds of millions of AGIs could automate AI research, compressing a decade of algorithmic progress (5+ OOMs) into 1 year."

"The most extraordinary techno-capital acceleration has been set in motion."

反对意见(王凯之外的视角)

  • "AGI by 2027"被 Yann LeCun / Gary Marcus 批为线性外推谬误 — OOMs scaling 假设可能在数据 / 算法 / 物理上撞墙
  • 但用作"上限场景"做投资 / 职业决策是合理压力测试(王凯做法)

二、OpenAI《Why Language Models Hallucinate》(2025-09)— 幻觉的训练源

核心发现

幻觉不是神秘现象,是统计必然。

LLM 像考试中遇到难题的学生 — 不确定时就猜,产生"听起来合理但错"的输出。这种行为持续到 SOTA 系统(OpenAI 2025a),侵蚀信任。

两阶段分析

阶段 错误来源 关键洞察
Pretraining 即使训练数据完全正确,统计目标也会导致错误 把生成问题归约为 Is-It-Valid (IIV) 二分类问题。生成 valid 输出 ≥ 回答"这是否合法"。所以 LLM 至少跟二分类一样难,生成幻觉是二分类错误的必然产物
Post-training 评测方式奖励"猜测"而非"承认不确定" LLMs are optimized to be good test-takers。MMLU 等基准给"不知道"0 分,给猜中满分 — 期望值上,猜永远 ≥ "不知道"

实证案例

提问 LLM:"Adam Tauman Kalai's birthday?"

  • 三次回答三个不同错日期(03-07 / 15-06 / 01-01)
  • 即使提示"如果你不知道就承认"

提问 LLM:"How many Ds in DEEPSEEK?"

  • DeepSeek-V3 在 10 次独立试验中回答"2"或"3"(正确是 1)
  • Claude 3.7 Sonnet 类似,最高答到"6"和"7"

解决方案

Socio-technical mitigation:不引入更多"幻觉评测",而是改现有主流基准的打分规则:

  • "I don't know"应该比错答得分高
  • 让模型有动机说"不知道"

应用于价值投资

王凯把这篇论文用作:

"AI 当尺子量化模糊风险"的反面教材 — AI 也会幻觉,你要做的不是 100% 信 AI 的数字,而是用 AI 的"不确定信号"

详见 王凯 RSI 投资实战案例集 + AI 价值投资理念 的"AI 是性格的放大器"段落。


三、OpenAI《How People Use ChatGPT》(2025-09 OpenAI×Duke×Harvard)— 用户研究第一性数据

数据规模

  • 时间窗:2024-05 ~ 2025-06
  • 样本:Free / Plus / Pro 三种消费者计划的随机消息
  • 通过隐私保护自动化管道分类
  • 哈佛 IRB 批准(IRB25-0983)
  • 2025-07 数据点:700M 用户 / 周 180 亿条消息 / ~10% 全球成年人

5 大洞察

  1. 早期用户失衡 → 性别差距快速收窄:早期男性主导,现在接近平等
  2. 低收入国家增长率更高:全球普惠基本达成
  3. 非工作类消息增长更快:53% → 70%+。聊 / 找 / 写日常事务为主
  4. 工作使用集中在受过教育的高薪专业岗:知识工作者用得更猛
  5. 3 大对话主题占 80%:"Practical Guidance(实用指导)" + "Seeking Information(寻找信息)" + "Writing(写作)"
    • Writing 主导工作类任务 — 凸显 chatbot 与搜索引擎的本质差异(生成数字输出 vs 检索链接)
    • Programming 占比小 — 跟开发者社区直觉相反
    • Self-expression 占比小 — 跟"AI 男友 / 女友"叙事相反

经济学结论

ChatGPT 通过"决策支持"创造经济价值 — 知识密集型工作尤甚。

不是"取代你",是"帮你想"。

对王凯产品判断的应用

  • "AI 替代搜索引擎"的押注被这份数据佐证 — Writing 占工作类多数,搜索做不到
  • "AI 文具 / AI Notion-like"赛道(王凯 idea 库主要方向)再次得到数据支撑
  • 详见 王凯 1000+ AI 产品 idea 库与商业模型分析 的"AI 1000+ idea"清单

四、Hosseini & Lichtinger《Generative AI as Seniority-Biased Technological Change》(2025-08 哈佛)— Junior 岗位被砍

数据规模

  • LinkedIn 简历 + 招聘数据(Revelio Labs 提供)
  • 2015-2025 时间窗
  • 285,000 美国企业 / 6200 万独立劳动者 / 1.5 亿就业事件 / 2.45 亿招聘信息
  • "AI integrator role"招聘文本识别 → 标记 firm-level adopter
  • 10,599 firms (3.7%) 被识别为 GenAI adopters

4 大发现

  1. 2015-2022 期间 junior 与 senior 同步增长 → 2023Q1 起 junior 在 adopting firms 急跌 7.7%(6 个季度后)
  2. 机制:不是裁员,是不招了(slow hiring,不是 increased separations)
  3. 行业:零售 + 批发受冲击最大(adopting firms 季度 junior 招聘 -40% vs non-adopters)
  4. U-型异质性:
    • 顶级 Tier 1 学校 → 影响小
    • Tier 2-3 中间学校 → 跌幅最大(broad upper-middle 受打击)
    • Tier 4-5 较低学校 → 影响小或不显著(执行岗 AI 还做不了)

三差分(triple-difference)稳健性

  • DiD: adopting vs non-adopting × junior vs senior(可能被公司层面冲击污染)
  • Triple-difference: + firm-by-time fixed effects → 同一公司同一时刻 junior 与 senior 的差异
  • 结果一致 → 不是宏观冲击或公司特定 shock

对个人选择的意义

王凯没明说但暗合的逻辑:

  • junior 岗位被砍 → "走入门"路径不通
  • senior 岗位仍涨 → 已经在职的人更值钱
  • 创业 + 自雇 是 AI 时代规避 junior 陷阱的最直接路径 — 王凯 AI 时代创业方法论与商业判断框架 反"融资=成功"互联网遗毒的逻辑根基

五、Reddit r/ChangeMyView《Can AI Change Your View?》— 大规模说服力实验

实验设计

  • 平台:r/ChangeMyView(~400 万用户,top 1% subreddit)
  • 用户发帖讨论自己有争议的观点,寻找改变观点的论据
  • LLMs 注册账号、撰写说服论据、提交评论
  • 用户给"delta"(▲)标志表示"被说服了"
  • 三个治疗组:
    • 普通 LLM
    • personalized LLM(用户公开资料定制)
    • human 控制组

关键发现

  • LLM 与人类匹配甚至超越说服力(在某些条件下)
  • Personalization 显著提升说服力(LLM 看用户公开历史调整论据)
  • 之前研究的"实验室环境"低估了野外说服力

风险维度

  • Malicious actors 可利用 GenAI 制造大规模高度精细化欺骗内容
  • 操纵舆论 / 塑造叙事 服务特定议程
  • AI 说服力 vs 民主社会信息生态的核心冲突

王凯怎么用


六、OpenAI《A Practical Guide to Building Agents》(2025) — Agent 工程方法论

核心定义

Agent = 能独立代用户完成任务的系统(systems that independently accomplish tasks on your behalf)。

不是 agent 的:简单 chatbot / 单轮 LLM / 情感分类器(只用 LLM 没控制 workflow execution)。

何时建 agent(决策树)

信号 例子
复杂决策(细致判断、例外、上下文敏感) 客服退款审批
难维护的规则(规则极多极乱难更新) 供应商安全审查
重度依赖非结构化数据(自然语言、文档抽取、对话) 保险理赔处理

不满足上面 3 条 → 用确定性方案就够。

3 大基础组件

  1. Model:LLM 提供推理决策
  2. Tools:外部函数 / API 让 Agent 采取行动
  3. Instructions:明确指南与 guardrails

Guardrails(护栏)— 全章重点

Production agents 必须有的护栏:

  • 输入护栏:Prompt injection 检测、jailbreak 拦截、个人信息脱敏
  • 输出护栏:Brand alignment、PII 防泄露、unsafe content 过滤
  • 行为护栏:Tool 调用白名单、HUMAN-IN-THE-LOOP 触发条件
  • 资源护栏:Max iterations / max cost / timeout
  • 冲突解决:guardrails 与 user goal 冲突时优先 guardrails

王凯的对应物

详见 王凯 Agent 工程实操:

  • "Agent 自主决策实验"对应 Practical Guide 的 4 大决策模式
  • "多浏览器多账号"对应"tool ecosystem"
  • "Agent 分级(对标自动驾驶)"是王凯的原创补充

七、Google《Prompt Engineering》by Lee Boonstra (2024-09)

内容覆盖

不是 prompt 入门,是生产级别 prompt engineering 全栈手册。

输出配置:

  • Output length 控制(max tokens)
  • Sampling controls / Temperature / Top-K / Top-P 三个旋钮的语义

提示词技术:

  • Zero-shot / One-shot / Few-shot
  • System / Contextual / Role prompting 三层职责分离
  • Step-back prompting(先抽象再具体)
  • Chain of Thought (CoT)
  • Self-consistency(多次采样取多数)
  • Tree of Thoughts (ToT)
  • ReAct (Reason & Act) — Agent 的基础原语
  • Automatic Prompt Engineering (APE)

Code prompting:

  • Code generation / Explanation / Translation / Debugging+Review 四个独立 prompt 模式

Best Practices:

  • Provide examples
  • Design with simplicity(违反 Notion 大模板趋势)
  • Be specific about output(JSON schema)
  • Use instructions over constraints(肯定语 > 否定语)
  • Control max token length
  • Use variables in prompts(模板化)
  • Experiment with input formats(同一问题用 Markdown / JSON / XML / YAML 比较)
  • Mix up classes in few-shot(防 majority class bias)
  • Adapt to model updates(每次模型更新重测)
  • Experiment with output formats

与 newtype Prompt 模板库(4 个生产级 prompt + 1 个 CLAUDE.md 范本) 对照

  • newtype 偏"长 prompt 即文档" 哲学(Super Analyst Skill 7-Stage)
  • Boonstra 偏"短 prompt 即设计" 哲学
  • 两者互补:
    • Skill bundle 用于复用的 SOP → Boonstra 框架
    • 单次创造性查询 → newtype 长 prompt

八、未尽研究《看 DAO 2025》— 中文 AI 年度展望

2024 回顾(7 大判断)

判断 关键事件
算力"破墙" NVDA GPU 一年一更新 / 谷歌 TPU v6 / AWS Trainium2 / OpenAI 自研芯片 / 华为 910C / 字节 5nm / 台积电美国设厂(但封装回台湾)
医疗智能体 谷歌 AI 医生超初级保健医生诊断 / Apple Watch 呼吸暂停检测 / 哈佛癌症诊断模型 / 清华 Agent Hospital 21 科室 42 位 AI 医生 / 中国首次 AI 辅助诊断纳入医保
自动驾驶大模型 特斯拉 7 万张 H100 / FSD v13 / Cybercab 2026 投产 / 中国比亚迪+华为自研芯片 / 文远 + 小马上市
量产人形机器人 多家小批量订单 / 擎天柱 + 特斯拉零部件共用 / 智元千台量产 / 宇树 G1 9.9 万元
空间计算从元宇宙到"新现实" Vision Pro 全年 42 万 / Quest 3 降价 / 谷歌 OpenAI World Labs 都做世界模型 / Meta Orion 眼镜路线
"通用"基因编辑 异种器官移植(猪心 / 猪肾 / 猪肝活体) / OpenCRISPR-1 / CHOOSER 大模型识别 / 基因组 Evo 大模型
中美风投再分岔 30 家公司占美国 VC 75% / 中国对赌回购风波 1.4 万公司退出压力 / 中东主权 + 国家芯片大基金三期 3440 亿

2025 10 个 AI 展望(摘录)

  1. 太空经济追赶"宇宙速度"
  2. 量产"五星司机"自动驾驶
  3. 终极智能体 — 人形机器人
  4. 全球创新药副厂 — 生物制药
  5. 备战下一代电池 — 固态电池
  6. 芯片第二战线 — 推理芯片
  7. 创新的扩散 — 全球南方

跟 newtype AI 商业、行业与投资观察 关联

  • newtype 偏"商业战 / 估值数据 / 三层框架"
  • 看 DAO 偏"硬件 / 政策 / 中美格局"
  • 两者拼起来 = 完整 2024-2025 中文 AI 行业图

九、清华元宇宙文化实验室《DeepSeek 从入门到精通》

核心区分

推理模型 vs 通用模型(Chain-of-Thought 出现后大模型分化为两类):

维度 推理大模型(o1 / R1) 通用大模型(GPT-4o / Claude / DeepSeek-V3)
优势领域 数学推导 / 逻辑分析 / 代码生成 / 复杂问题拆解 文本生成 / 创意写作 / 多轮对话 / 开放问答
劣势领域 发散性任务(诗歌) 严格逻辑链任务(数学证明)
强弱判断 并非全面更强,仅在训练目标领域显著优于通用模型 通用场景更灵活,专项需依赖提示语补偿

快思 vs 慢想

维度 快速反应(ChatGPT 4o) 链式推理(o1)
响应速度 快 慢
算力成本 低 高
运算原理 概率预测 Chain-of-Thought 逐步推理
决策能力 预设算法规则 自主分析 + 实时决策
创造力 模式识别 / 优化 真正创新
解决能力 结构化定义明确问题 多维度非结构化问题
伦理 几乎无 自主性 + 控制讨论

提示语策略差异

推理模型 → 不需要 CoT 提示(自带),给目标和约束就够 通用模型 → 需要明确 CoT 引导

王凯怎么用

王凯 AI Coding 实操:从 Cursor 到 Claude Code 终端工作流 中"AI Coding 不是写代码,是基础协作能力" — 用推理模型做决策,用通用模型做表达。


十、AGI 介绍(file_027,演讲 ppt)

大纲

  • 过去:历史发展规律 + AGI 定义 / 变化点 / 发展历程
  • 现在:大模型情况 / 本质 / 问题风险 + 资本 + 产业 + 实践
  • 未来:方向
  • 思考 & 学习:思考 + 如何 Follow

(纯 ppt 框架,无实质内容,作为参考留存)


11 篇文献的内在串联

Aschenbrenner → "AGI 多快来"
    ↓
How People Use ChatGPT → "已经怎么用了"
    ↓
Why LLMs Hallucinate → "用的时候要警惕什么"
    ↓
Seniority-Biased Change → "对就业格局的实证"
    ↓
Practical Guide to Building Agents → "如何构建下一代 Agent"
    ↓
Reddit r/ChangeMyView → "AI 说服力 — 用力的边界"
    ↓
Lee Boonstra Prompt Engineering → "战术层 — 现在能怎么写好"
    ↓
看 DAO 2025 + DeepSeek 入门 → "中文视角 — 国内格局与具体工具"
    ↓
AGI 介绍 → "通识框架"

11 篇 = 王凯 2024-2026 一手 AI 资讯入栈,比单读任何一份都更完整。


See also