← Knowledge Notes
AI Engineering / Knowledge note · Chinese

Karpathy · Software in the era of AI(Software 3.0)

Andrej Karpathy 2025-06 在 Y Combinator AI Startup School 演讲完整中文整理。Software 1.0(传统代码)→ 2.0(神经网络权重)→ 3.0(自然语言提示词)三段论;LLM = 新型操作系统/工具/公用事业三类比;LLM 心理学(类人不可靠);1960s 大型机视角看当下 AI(终端→个人电脑还要几年);Vibe Coding 即"软件已转向自然语言编程";Agentic Decade(2025-2035 十年演进,不要做 Agent Demo 上瘾);构建半自主产品的 4 条原则;为 Agent 重写软件基础设施(robots.txt → llms.txt)。

Source collection:Newtype · Published here:2026-09-26 · Note updated:2026-05-16

Software 3.0大语言模型自然语言编程

何时打开:你想跟人解释"为什么 AI 编程不只是写代码,而是软件范式变了"——但又不想引用一堆碎片化的 Twitter 截图。这份是 Karpathy 在 YC AI Startup School(2025 年 6 月)的完整演讲,经 newtype 整理成中文。

演讲核心:软件第二次大变化(70 年来),且是 5 年内连发两次 —— 先从 1.0 → 2.0(神经网络权重),再从 2.0 → 3.0(自然语言提示词)。


一、三种软件 (Software 1.0/2.0/3.0)

核心观点:写程序的"语言"换了两次,从 C/Python → 数据 + 权重 → 自然语言。

范式 写程序的方式 编写者 GitHub 类比 现状
Software 1.0 写代码(C / Python / ...) 程序员 github.com 70 年传统范式
Software 2.0 调神经网络权重(写数据集 → 优化器跑出权重) ML 工程师 Hugging Face(权重的 GitHub) 2017-2022 主导
Software 3.0 写自然语言提示词,LLM 直接执行 任何人 (尚无统一仓库,Prompts as code) 2023- 主导,5 年内全栈渗透

3 个并存:今天的软件工程师必须熟练在三者之间切换,知道每个范式各自的优点和缺点,以及 何时使用哪种 来编写哪些功能。

Karpathy 自己的经历:

  • 在特斯拉做自动驾驶时,逐步把 1.0 代码(车道线检测、信号灯识别、各种 if-else)替换成 2.0 神经网络。最终结果:有一段巨大的 2.0 神经网络在做图像分析,1.0 代码只剩 stitching(把 2.0 输出粘起来)。
  • 现在 3.0 时代,连那个 stitching 都开始被自然语言提示词替代了。

引言:"当看到 Sun Microsystems 服务器被推进特斯拉一栋楼时,我第一次意识到 2.0 栈正在替代 1.0 栈。"

对 newtype 读者的含义:

  • 你不需要"会写代码"才能创业。学会用自然语言精确表达需求 + 调优提示词,就能让 LLM 写代码、给你交付软件。
  • 但 1.0 没有死。关键判断:何处用哪个。性能瓶颈、确定性、安全性高的部分还要 1.0;模糊需求、自然语言交互的部分用 3.0;有大量训练数据但无法显式建模的部分用 2.0。

二、LLM 的三个本质类比

Karpathy 给出 3 个互补的类比,帮人理解 LLM 这个新物种。

2.1 LLM = 新型操作系统(OS)

核心:LLM 不是工具,是 OS。我们正处于 1960s 主机时代,LLM 是远程调用的"分时操作系统"。

类比对照:

1960s 主机时代 今天的 LLM 时代
Unix / Multics 等 OS GPT-5 / Claude 4.5 / Gemini / Grok
集中式大型机 远程 API / 数据中心推理
通过电报机分时访问 通过 ChatGPT 网页 / API 访问
个人电脑(70 年代末)还没来 "个人 LLM 革命"几年内会来
闭源 IBM / 开源 Linux 闭源 OpenAI / 开源 Llama, Mistral

含义:

  • "我们现在用 ChatGPT 不是终端工具,是用主机 OS" —— 这话当玩笑听,但抓到了本质
  • LLM 是一个时代级别的基础设施,不只是 PHP 或者 React 那种"语言 / 框架"级别
  • 类似 60 年代主机时代,家用电脑还要 10 年才会来(本地 LLM 真正可用至少要等 GPU 平民化)。但创业可以从"远程主机时代"开始,不必等家用电脑
  • 现在不是"打孔卡时代"——已经过了那个阶段。但也不是"个人电脑时代"——还没到那个阶段。今天是"小型机 / 终端 / 远程"的"中间过渡阶段"

2.2 LLM = 公用事业(Utility)

核心:OpenAI / Anthropic / Google / xAI 像四家电厂,模型是电流;停电 = "智力中断"(intelligence brownout)。

  • 各家公司的资本支出像建电网 / 发电厂
  • API 是电网调度,按 Token 收费
  • 用户低延迟、高稳定、统一接口的需求和"用电"几乎一致
  • DeepSeek、Meta Llama 等开源 = "自发电"(类比家庭光伏 / 柴油机)
  • 当某家"停电"(API 故障),整个城市 GDP 会下降 —— 智力变成水电那样的公用事业

2.3 LLM = 半成型晶圆厂(Fab)

类比:芯片厂(TSMC / Intel)资本密集 + 技术堆栈;前沿 LLM 也是。但 LLM 的"硬件"是软件(权重),所以更易复制。

  • TSMC vs 老牌 Intel — 把"工艺 know-how"看成"模型训练 know-how + 数据 know-how"
  • AMD 想用 TSMC 代工,类比 Anthropic 在 AWS Trainium 训练
  • 边际成本几乎为 0(单次推理的电费 / Token 几分钱),但前期资本 + 智力门槛巨高
  • 推理(运行)= 出货,训练 = 建厂

三类比合起来:LLM 既是 OS、又是 Utility、又是 Fab。哪个角度都不完全,但 OS 类比最贴。


三、LLM 心理学:类人,但有"认知缺陷"

Karpathy 在 OpenAI 训过 GPT,他对 LLM 的判断不是"它能干什么",而是"它像什么样的人"。

3.1 LLM 的"心智模型"

LLM 是一个 emerge-like-human 但又有奇怪缺陷的智能体。

类人特征 缺陷
有百科知识,海量 token 训过的"博学者" 幻觉(Hallucination):无 ground truth 时编故事还自信
有上下文理解、推理、写代码 无长期记忆:刚说过的事,跨 session 全忘
能多模态对话、扮演角色 算术 / 计数 / 几何空间感知:经常错
能整理 / 总结 / 翻译 顺从性偏见(sycophancy):用户说啥它都附和
能执行 step-by-step 推理 知识截止后的世界完全不知道:训练数据外的事实零知识

3.2 给开发者的实用建议

  • 不要把 LLM 当成"绝对可靠的程序":它是"博学但精神有点不稳定的实习生"。
  • 把 ground truth、计数、几何、严格逻辑这些 1.0 代码能搞定的事,还是用 1.0 搞。LLM 是 fuzzy reasoning,精确计算让传统代码做。
  • 提示词不是命令,是"对实习生交代任务"——上下文越足、要求越具体,完成度越高。
  • 不要相信单次输出。用 evals + 自动复核机制(两次跑、不同模型交叉验证)。

四、机会:为半自主产品而设计

Karpathy 反复警告:不要做"AI Demo",要做"半自主产品"(partial autonomy products)。

4.1 什么叫"半自主产品"

核心:自主性 = 用户拉的滑动条(autonomy slider),而不是开发者选定的二元状态(全人工 / 全 Agent)。

维度 全人工 半自主(Iron Man Suit) 全 Agent
决策权 100% 用户 用户大方向 + LLM 细节执行 100% LLM
信任要求 0 中等 极高(需要 Eval + 监督)
当前可行 是 是 否(大多场景失败)
Karpathy 推荐 ❌ 浪费 LLM ✅ 黄金区域 ❌ 跑得动 Demo,但产品化死

4.2 Iron Man Suit 类比

钢铁侠的西装(suit)有两种模式:

  • suit 模式:Tony 穿在身上,西装放大他的能力(类比 Cursor / Claude Code,人在驾驶)
  • robot 模式:Tony 不在,西装自己飞(类比 Devin / Manus,全自动)

今天:做 suit 比做 robot 更有商业价值。原因:

  • robot 在 Demo 里跑得动,但在真实业务里反复 fail,边际可靠性指数下降
  • suit 立刻有用户价值,因为每一步用户都可以纠正
  • robot 一旦 fail 一次就丢失信任,suit fail 用户也能拉回来

4.3 LLM App 的 4 条设计原则(Karpathy 总结)

  1. 上下文管理(Context Management):不要把所有信息塞进 prompt;让用户决定要塞什么、什么时候塞、塞到什么深度
  2. 多 LLM 编排(Orchestration):用便宜模型做 first pass,贵模型做 verify;用工具型模型做检索,用推理型模型做规划
  3. GUI ≠ chat box:不要让用户用聊天框做所有事;做出 GUI,把"自主性"做成可视化滑动条(像 Photoshop 的图层透明度)
  4. 快速验证循环(Fast verification loop):UI 必须让用户能在 5 秒内判断 LLM 的输出对不对;时间越长,产品越死

反例:做一个"全自动写邮件 Bot"——用户根本不敢发,因为不知道写得对不对。 正例:做一个"邮件草稿生成器,左侧大纲是用户写的,右侧是 LLM 扩写"——用户随时改、随时看效果。

4.4 Demo 跟产品的鸿沟

不要被 Demo 迷惑。Demo 是"在精心挑选的输入上工作良好";产品是"对所有现实输入都不能炸"。

从 Demo 到产品,在 LLM 时代,不是 10x 难度,是 1000x 难度。

这是为什么 Devin / AutoGPT / GPT Researcher 这些 Demo 火爆但实际产品没人付费——因为它们承诺了"全自动",但全自动的鲁棒性极差。


五、Agentic Decade(2025-2035)

Karpathy 的判断:不要被"Agent 元年"忽悠,Agent 不是 2025 元年,是 未来 10 年缓慢演进。

5.1 时间预判

  • 现在(2025)是 Agent 的"打孔卡时代"——你能做 Demo,但跑不动复杂任务
  • 2026-2028 是"小型机时代"——专业 Agent 在窄场景跑得动(代码、客服、合规)
  • 2028-2032 是"PC 时代"——多 Agent 编排成熟,大量企业 deploy
  • 2032-2035 是"成熟期"——Agent 跟当年的 SaaS 一样普及

含义:不要把全部时间和钱压在"2025 一定要做出 AGI Agent",会撞墙。 对应:做半自主产品(suit),让你的产品在每个阶段都受益,而不是赌"完全自主的那一天"。

5.2 不要做"Agent Demo 上瘾者"

Karpathy 在 OpenAI 内部反复看到:

  • 团队做出一个 Agent Demo
  • 在 Twitter / 内部演示 hyped 起来
  • 资源涌入扩大 Demo,但 Demo 外的世界跑不动
  • 6 个月后悄悄取消项目,大家假装没发生

对独立开发者的建议:

  • 不要追求"Demo 看起来像 AGI",追求"用户每天会用 5 次"
  • 找到一个 窄场景 + 高频使用 + 你能让 LLM 不出大错 的位置切入
  • 让 LLM 做"放大器"而不是"自主体"

六、Vibe Coding:软件已从代码切换到自然语言

Karpathy 2025 年 2 月在 Twitter 创造了"Vibe Coding"这个词,演讲中给出的最完整定义:

6.1 Vibe Coding 是什么

"屈服于氛围,拥抱指数级增长,忘掉代码本身存在。在 Vibe Coding 中,你不再读代码,你只看效果;不再 debug stack trace,你只换提示词重跑。"

4 个特征:

  1. 你不读 / 不改 LLM 写出来的代码,只看输出
  2. 你只用自然语言描述要什么、错了什么
  3. 你接受"不完美但够用"的代码
  4. 你认为代码是消耗品,坏了就重写

6.2 Karpathy 的 Vibe Coding 实操

  • 他在 X 上发过几个 Vibe Coded 的小程序:一个网页计时器、一个 todo list、一个 OG image 生成器
  • 全程 0 行手写代码,纯靠"嘿 Claude,我要 X,做出来了再迭代"
  • 他强调:这不是教程,是范式。Vibe Coding 让 95% 的"小工具"软件失去存在意义——每个人都可以自己造

6.3 含义

  • 每个人都可以做软件——会用 LLM = 会编程
  • 软件的边际成本接近零——做 100 个软件跟做 1 个的成本差距极小
  • "Killer App"的护城河变成理解用户场景的能力,而不是"会写代码"
  • 这开启了"每个人都做几百个工具给自己用"的时代

七、为 Agent 重写基础设施

Karpathy 提出:互联网 30 年前是为"人 + 浏览器"设计的;未来要为"Agent + LLM"重写一遍。

7.1 三个具体例子

现状(为人设计) 未来(为 Agent 设计)
robots.txt(告诉爬虫哪些不能爬) llms.txt(告诉 LLM 这个网站怎么用、有什么 API、怎么省你的 token)
OpenAPI 文档给程序员看 AI-Native API(直接喂给 LLM 调用,带 few-shot 例子)
网页 HTML / CSS 给浏览器渲染 AGENTS.md(网页给 Agent 的指南:这页是什么、有哪些 action、副作用是什么)

7.2 含义(对独立开发者)

  • 早期布局"AI-friendly"接口的产品会被更多 Agent 调用
  • 如果你做产品,可以同时发布:
    • 人用的网页 + 文档
    • Agent 用的 llms.txt + AGENTS.md + Tool API
  • 如果你做 Agent,可以优先选已经为 Agent 提供 llms.txt 的工具——可靠性会高很多

八、关键判断与对独立开发者的指南

8.1 Karpathy 给独立开发者的"软件 3.0 时代指南"

  1. 学三层范式:不要只学 LLM,也学传统代码 + 神经网络。何处用哪个的判断会值最多钱
  2. 做 suit 不做 robot:半自主产品比全自动 Agent 商业价值大 10 倍
  3. Vibe Coding 是新基础技能:不会用 LLM 写代码 = 不会用 Excel
  4. 建立 evals 文化:对每个 LLM 调用都有自动评估
  5. 设计可视化滑动条:让用户控制自主性,GUI 比聊天框值钱
  6. 拥抱 10 年时间:Agent 不是 2025 一年的事,是 10 年的事;盯一个窄场景做到 10x 好

8.2 newtype 的二次推论(整理者补充)

  • 对小厂 / 独立开发者:LLM Native 产品的最大优势是"用户基数小,场景窄,迭代快"——可以做 suit 而不必做 robot
  • 对大厂 / SaaS:Vibe Coding 削弱传统 SaaS 的"功能护城河",但增强"上下文 / 数据 / 集成"的护城河
  • 对 AI 应用层创业者:不要追"做 AGI",做"用户每天用 5 次的窄场景 suit"

九、与 newtype 既有思考的对照

Karpathy 的判断跟 newtype 心法 · 超级个体方法论 几乎完全 align:

  • "做小而美的工具,不做大而全的平台" → suit 不是 robot
  • "AGI 视角看当下" → 1960s 主机视角
  • "Pro User 一个人多工具" → 学三层范式

跟 newtype · Agent 架构与多 Agent 编排 互补:

  • newtype 关心"Multi-Agent 编排的实操难点"
  • Karpathy 关心"半自主产品的设计哲学"

跟 newtype · AI Coding 实战与工具栈演化 一致:

  • Cursor / Claude Code 都是 suit
  • v0 / Cline / OpenCode 也都是 suit
  • 验证 Karpathy 的"今天黄金区域是 suit"

跟 AI Agent 技术架构演进 2025(深度研究报告)(研究报告) 互补:

  • 演讲是"范式 / 心法",研究报告是"技术栈 / 数据"
  • 一起读才完整

十、引用清单(供进一步研究)

  • Andrej Karpathy 原推:"Software is changing again"(2025-06)
  • YC AI Startup School 演讲视频(2025-06)
  • newtype 整理版:本 wiki source 文件
  • 相关:Karpathy 的 nanoGPT、Vibe Coding 系列 tweet、micrograd

History

  • 2026-05-16:Phase 3 ingest 从 09_Karpathy_Software_Changing_CN.md 创建。完整覆盖三段论 + 三类比 + 心理学 + 半自主产品 + Agentic Decade + Vibe Coding + 重写基础设施 + 给独立开发者的指南。

来源与关联资料