何时打开:你想跟人解释"为什么 AI 编程不只是写代码,而是软件范式变了"——但又不想引用一堆碎片化的 Twitter 截图。这份是 Karpathy 在 YC AI Startup School(2025 年 6 月)的完整演讲,经 newtype 整理成中文。
演讲核心:软件第二次大变化(70 年来),且是 5 年内连发两次 —— 先从 1.0 → 2.0(神经网络权重),再从 2.0 → 3.0(自然语言提示词)。
一、三种软件 (Software 1.0/2.0/3.0)
核心观点:写程序的"语言"换了两次,从 C/Python → 数据 + 权重 → 自然语言。
| 范式 | 写程序的方式 | 编写者 | GitHub 类比 | 现状 |
|---|---|---|---|---|
| Software 1.0 | 写代码(C / Python / ...) | 程序员 | github.com | 70 年传统范式 |
| Software 2.0 | 调神经网络权重(写数据集 → 优化器跑出权重) | ML 工程师 | Hugging Face(权重的 GitHub) | 2017-2022 主导 |
| Software 3.0 | 写自然语言提示词,LLM 直接执行 | 任何人 | (尚无统一仓库,Prompts as code) | 2023- 主导,5 年内全栈渗透 |
3 个并存:今天的软件工程师必须熟练在三者之间切换,知道每个范式各自的优点和缺点,以及 何时使用哪种 来编写哪些功能。
Karpathy 自己的经历:
- 在特斯拉做自动驾驶时,逐步把 1.0 代码(车道线检测、信号灯识别、各种 if-else)替换成 2.0 神经网络。最终结果:有一段巨大的 2.0 神经网络在做图像分析,1.0 代码只剩 stitching(把 2.0 输出粘起来)。
- 现在 3.0 时代,连那个 stitching 都开始被自然语言提示词替代了。
引言:"当看到 Sun Microsystems 服务器被推进特斯拉一栋楼时,我第一次意识到 2.0 栈正在替代 1.0 栈。"
对 newtype 读者的含义:
- 你不需要"会写代码"才能创业。学会用自然语言精确表达需求 + 调优提示词,就能让 LLM 写代码、给你交付软件。
- 但 1.0 没有死。关键判断:何处用哪个。性能瓶颈、确定性、安全性高的部分还要 1.0;模糊需求、自然语言交互的部分用 3.0;有大量训练数据但无法显式建模的部分用 2.0。
二、LLM 的三个本质类比
Karpathy 给出 3 个互补的类比,帮人理解 LLM 这个新物种。
2.1 LLM = 新型操作系统(OS)
核心:LLM 不是工具,是 OS。我们正处于 1960s 主机时代,LLM 是远程调用的"分时操作系统"。
类比对照:
| 1960s 主机时代 | 今天的 LLM 时代 |
|---|---|
| Unix / Multics 等 OS | GPT-5 / Claude 4.5 / Gemini / Grok |
| 集中式大型机 | 远程 API / 数据中心推理 |
| 通过电报机分时访问 | 通过 ChatGPT 网页 / API 访问 |
| 个人电脑(70 年代末)还没来 | "个人 LLM 革命"几年内会来 |
| 闭源 IBM / 开源 Linux | 闭源 OpenAI / 开源 Llama, Mistral |
含义:
- "我们现在用 ChatGPT 不是终端工具,是用主机 OS" —— 这话当玩笑听,但抓到了本质
- LLM 是一个时代级别的基础设施,不只是 PHP 或者 React 那种"语言 / 框架"级别
- 类似 60 年代主机时代,家用电脑还要 10 年才会来(本地 LLM 真正可用至少要等 GPU 平民化)。但创业可以从"远程主机时代"开始,不必等家用电脑
- 现在不是"打孔卡时代"——已经过了那个阶段。但也不是"个人电脑时代"——还没到那个阶段。今天是"小型机 / 终端 / 远程"的"中间过渡阶段"
2.2 LLM = 公用事业(Utility)
核心:OpenAI / Anthropic / Google / xAI 像四家电厂,模型是电流;停电 = "智力中断"(intelligence brownout)。
- 各家公司的资本支出像建电网 / 发电厂
- API 是电网调度,按 Token 收费
- 用户低延迟、高稳定、统一接口的需求和"用电"几乎一致
- DeepSeek、Meta Llama 等开源 = "自发电"(类比家庭光伏 / 柴油机)
- 当某家"停电"(API 故障),整个城市 GDP 会下降 —— 智力变成水电那样的公用事业
2.3 LLM = 半成型晶圆厂(Fab)
类比:芯片厂(TSMC / Intel)资本密集 + 技术堆栈;前沿 LLM 也是。但 LLM 的"硬件"是软件(权重),所以更易复制。
- TSMC vs 老牌 Intel — 把"工艺 know-how"看成"模型训练 know-how + 数据 know-how"
- AMD 想用 TSMC 代工,类比 Anthropic 在 AWS Trainium 训练
- 边际成本几乎为 0(单次推理的电费 / Token 几分钱),但前期资本 + 智力门槛巨高
- 推理(运行)= 出货,训练 = 建厂
三类比合起来:LLM 既是 OS、又是 Utility、又是 Fab。哪个角度都不完全,但 OS 类比最贴。
三、LLM 心理学:类人,但有"认知缺陷"
Karpathy 在 OpenAI 训过 GPT,他对 LLM 的判断不是"它能干什么",而是"它像什么样的人"。
3.1 LLM 的"心智模型"
LLM 是一个 emerge-like-human 但又有奇怪缺陷的智能体。
| 类人特征 | 缺陷 |
|---|---|
| 有百科知识,海量 token 训过的"博学者" | 幻觉(Hallucination):无 ground truth 时编故事还自信 |
| 有上下文理解、推理、写代码 | 无长期记忆:刚说过的事,跨 session 全忘 |
| 能多模态对话、扮演角色 | 算术 / 计数 / 几何空间感知:经常错 |
| 能整理 / 总结 / 翻译 | 顺从性偏见(sycophancy):用户说啥它都附和 |
| 能执行 step-by-step 推理 | 知识截止后的世界完全不知道:训练数据外的事实零知识 |
3.2 给开发者的实用建议
- 不要把 LLM 当成"绝对可靠的程序":它是"博学但精神有点不稳定的实习生"。
- 把 ground truth、计数、几何、严格逻辑这些 1.0 代码能搞定的事,还是用 1.0 搞。LLM 是 fuzzy reasoning,精确计算让传统代码做。
- 提示词不是命令,是"对实习生交代任务"——上下文越足、要求越具体,完成度越高。
- 不要相信单次输出。用 evals + 自动复核机制(两次跑、不同模型交叉验证)。
四、机会:为半自主产品而设计
Karpathy 反复警告:不要做"AI Demo",要做"半自主产品"(partial autonomy products)。
4.1 什么叫"半自主产品"
核心:自主性 = 用户拉的滑动条(autonomy slider),而不是开发者选定的二元状态(全人工 / 全 Agent)。
| 维度 | 全人工 | 半自主(Iron Man Suit) | 全 Agent |
|---|---|---|---|
| 决策权 | 100% 用户 | 用户大方向 + LLM 细节执行 | 100% LLM |
| 信任要求 | 0 | 中等 | 极高(需要 Eval + 监督) |
| 当前可行 | 是 | 是 | 否(大多场景失败) |
| Karpathy 推荐 | ❌ 浪费 LLM | ✅ 黄金区域 | ❌ 跑得动 Demo,但产品化死 |
4.2 Iron Man Suit 类比
钢铁侠的西装(suit)有两种模式:
- suit 模式:Tony 穿在身上,西装放大他的能力(类比 Cursor / Claude Code,人在驾驶)
- robot 模式:Tony 不在,西装自己飞(类比 Devin / Manus,全自动)
今天:做 suit 比做 robot 更有商业价值。原因:
- robot 在 Demo 里跑得动,但在真实业务里反复 fail,边际可靠性指数下降
- suit 立刻有用户价值,因为每一步用户都可以纠正
- robot 一旦 fail 一次就丢失信任,suit fail 用户也能拉回来
4.3 LLM App 的 4 条设计原则(Karpathy 总结)
- 上下文管理(Context Management):不要把所有信息塞进 prompt;让用户决定要塞什么、什么时候塞、塞到什么深度
- 多 LLM 编排(Orchestration):用便宜模型做 first pass,贵模型做 verify;用工具型模型做检索,用推理型模型做规划
- GUI ≠ chat box:不要让用户用聊天框做所有事;做出 GUI,把"自主性"做成可视化滑动条(像 Photoshop 的图层透明度)
- 快速验证循环(Fast verification loop):UI 必须让用户能在 5 秒内判断 LLM 的输出对不对;时间越长,产品越死
反例:做一个"全自动写邮件 Bot"——用户根本不敢发,因为不知道写得对不对。 正例:做一个"邮件草稿生成器,左侧大纲是用户写的,右侧是 LLM 扩写"——用户随时改、随时看效果。
4.4 Demo 跟产品的鸿沟
不要被 Demo 迷惑。Demo 是"在精心挑选的输入上工作良好";产品是"对所有现实输入都不能炸"。
从 Demo 到产品,在 LLM 时代,不是 10x 难度,是 1000x 难度。
这是为什么 Devin / AutoGPT / GPT Researcher 这些 Demo 火爆但实际产品没人付费——因为它们承诺了"全自动",但全自动的鲁棒性极差。
五、Agentic Decade(2025-2035)
Karpathy 的判断:不要被"Agent 元年"忽悠,Agent 不是 2025 元年,是 未来 10 年缓慢演进。
5.1 时间预判
- 现在(2025)是 Agent 的"打孔卡时代"——你能做 Demo,但跑不动复杂任务
- 2026-2028 是"小型机时代"——专业 Agent 在窄场景跑得动(代码、客服、合规)
- 2028-2032 是"PC 时代"——多 Agent 编排成熟,大量企业 deploy
- 2032-2035 是"成熟期"——Agent 跟当年的 SaaS 一样普及
含义:不要把全部时间和钱压在"2025 一定要做出 AGI Agent",会撞墙。 对应:做半自主产品(suit),让你的产品在每个阶段都受益,而不是赌"完全自主的那一天"。
5.2 不要做"Agent Demo 上瘾者"
Karpathy 在 OpenAI 内部反复看到:
- 团队做出一个 Agent Demo
- 在 Twitter / 内部演示 hyped 起来
- 资源涌入扩大 Demo,但 Demo 外的世界跑不动
- 6 个月后悄悄取消项目,大家假装没发生
对独立开发者的建议:
- 不要追求"Demo 看起来像 AGI",追求"用户每天会用 5 次"
- 找到一个 窄场景 + 高频使用 + 你能让 LLM 不出大错 的位置切入
- 让 LLM 做"放大器"而不是"自主体"
六、Vibe Coding:软件已从代码切换到自然语言
Karpathy 2025 年 2 月在 Twitter 创造了"Vibe Coding"这个词,演讲中给出的最完整定义:
6.1 Vibe Coding 是什么
"屈服于氛围,拥抱指数级增长,忘掉代码本身存在。在 Vibe Coding 中,你不再读代码,你只看效果;不再 debug stack trace,你只换提示词重跑。"
4 个特征:
- 你不读 / 不改 LLM 写出来的代码,只看输出
- 你只用自然语言描述要什么、错了什么
- 你接受"不完美但够用"的代码
- 你认为代码是消耗品,坏了就重写
6.2 Karpathy 的 Vibe Coding 实操
- 他在 X 上发过几个 Vibe Coded 的小程序:一个网页计时器、一个 todo list、一个 OG image 生成器
- 全程 0 行手写代码,纯靠"嘿 Claude,我要 X,做出来了再迭代"
- 他强调:这不是教程,是范式。Vibe Coding 让 95% 的"小工具"软件失去存在意义——每个人都可以自己造
6.3 含义
- 每个人都可以做软件——会用 LLM = 会编程
- 软件的边际成本接近零——做 100 个软件跟做 1 个的成本差距极小
- "Killer App"的护城河变成理解用户场景的能力,而不是"会写代码"
- 这开启了"每个人都做几百个工具给自己用"的时代
七、为 Agent 重写基础设施
Karpathy 提出:互联网 30 年前是为"人 + 浏览器"设计的;未来要为"Agent + LLM"重写一遍。
7.1 三个具体例子
| 现状(为人设计) | 未来(为 Agent 设计) |
|---|---|
| robots.txt(告诉爬虫哪些不能爬) | llms.txt(告诉 LLM 这个网站怎么用、有什么 API、怎么省你的 token) |
| OpenAPI 文档给程序员看 | AI-Native API(直接喂给 LLM 调用,带 few-shot 例子) |
| 网页 HTML / CSS 给浏览器渲染 | AGENTS.md(网页给 Agent 的指南:这页是什么、有哪些 action、副作用是什么) |
7.2 含义(对独立开发者)
- 早期布局"AI-friendly"接口的产品会被更多 Agent 调用
- 如果你做产品,可以同时发布:
- 人用的网页 + 文档
- Agent 用的 llms.txt + AGENTS.md + Tool API
- 如果你做 Agent,可以优先选已经为 Agent 提供 llms.txt 的工具——可靠性会高很多
八、关键判断与对独立开发者的指南
8.1 Karpathy 给独立开发者的"软件 3.0 时代指南"
- 学三层范式:不要只学 LLM,也学传统代码 + 神经网络。何处用哪个的判断会值最多钱
- 做 suit 不做 robot:半自主产品比全自动 Agent 商业价值大 10 倍
- Vibe Coding 是新基础技能:不会用 LLM 写代码 = 不会用 Excel
- 建立 evals 文化:对每个 LLM 调用都有自动评估
- 设计可视化滑动条:让用户控制自主性,GUI 比聊天框值钱
- 拥抱 10 年时间:Agent 不是 2025 一年的事,是 10 年的事;盯一个窄场景做到 10x 好
8.2 newtype 的二次推论(整理者补充)
- 对小厂 / 独立开发者:LLM Native 产品的最大优势是"用户基数小,场景窄,迭代快"——可以做 suit 而不必做 robot
- 对大厂 / SaaS:Vibe Coding 削弱传统 SaaS 的"功能护城河",但增强"上下文 / 数据 / 集成"的护城河
- 对 AI 应用层创业者:不要追"做 AGI",做"用户每天用 5 次的窄场景 suit"
九、与 newtype 既有思考的对照
Karpathy 的判断跟 newtype 心法 · 超级个体方法论 几乎完全 align:
- "做小而美的工具,不做大而全的平台" → suit 不是 robot
- "AGI 视角看当下" → 1960s 主机视角
- "Pro User 一个人多工具" → 学三层范式
跟 newtype · Agent 架构与多 Agent 编排 互补:
- newtype 关心"Multi-Agent 编排的实操难点"
- Karpathy 关心"半自主产品的设计哲学"
跟 newtype · AI Coding 实战与工具栈演化 一致:
- Cursor / Claude Code 都是 suit
- v0 / Cline / OpenCode 也都是 suit
- 验证 Karpathy 的"今天黄金区域是 suit"
跟 AI Agent 技术架构演进 2025(深度研究报告)(研究报告) 互补:
- 演讲是"范式 / 心法",研究报告是"技术栈 / 数据"
- 一起读才完整
十、引用清单(供进一步研究)
- Andrej Karpathy 原推:"Software is changing again"(2025-06)
- YC AI Startup School 演讲视频(2025-06)
- newtype 整理版:本 wiki source 文件
- 相关:Karpathy 的 nanoGPT、Vibe Coding 系列 tweet、micrograd
History
- 2026-05-16:Phase 3 ingest 从
09_Karpathy_Software_Changing_CN.md创建。完整覆盖三段论 + 三类比 + 心理学 + 半自主产品 + Agentic Decade + Vibe Coding + 重写基础设施 + 给独立开发者的指南。