王凯从 2024-08 开始观察 Agent 浪潮(Manus 早期),但长期警告"Agent 元年说太早"(token 太贵、商业模型未跑通)。2026-Q1 开始亲自构建 Agent 系统(Chrome MCP / Loop / 多 Agent),认知达到"Agent 是新协作流程"层级。
1. Agent 演化时间线
graph LR
A[2023-04 SEC FastFacts<br/>Workflow 雏形] --> B[2024-Q3 Devin 演示震撼<br/>Agent 分级概念]
B --> C[2025-01 Coding 领域出独角兽<br/>Cursor / v0 / Manus]
C --> D[2025-03 Manus 国内爆火<br/>但本质是 token 消耗变多]
D --> E[2025-07 ChatGPT Agent<br/>OpenAI 专门优化模型]
E --> F[2025-Q4 MCP 生态成熟<br/>Claude 接百+服务]
F --> G[2026-Q1 Chrome MCP 普及<br/>多 Agent 自动化体系]
G --> H[2026-04 王凯亲建 Agent 集群<br/>多浏览器多账号多 Agent]
2. Agent 分级(参考自动驾驶)
| 等级 | 描述 | 当前位置 |
|---|---|---|
| L1: 单点辅助 | 人提任务,AI 写,人执行 | 普及 |
| L2: 多步辅助 | AI 帮人拆解任务、引导 | Cursor / v0 / 深度研究 |
| L3: 半自主 | 人监督下 AI 完成多步任务 | Devin / Claude Code Agent |
| L4: 完全自主 | 无需人介入,Agent 完成复杂任务 | 待 token 价再降 90% |
| L5: Agent 组织 | 多 Agent 协作完成组织级任务 | OpenAI L5 设想 |
王凯当前定位:L3 半自主(Claude Code 跑投资策略、自动推广等)。
3. MCP 实战清单
graph TD
A[Claude Code] --> B[金融 MCP - FMP API<br/>解决数据准确性]
A --> C[Chrome MCP - 控制真实浏览器]
A --> D[飞书 CLI - 文档 + bot]
A --> E[滴答清单 MCP - 任务管理]
A --> F[Notion / Gmail 等]
A --> G[AgentMail - Agent 邮箱]
A --> H[自建 MCP - tokrepo skills]
3.1 FMP MCP(金融数据准确性)
- 问题:Claude/GPT 联网搜索拿数字 100% 不可信(编造数据)
- 解决:买 FMP API → 自建 MCP → Claude 通过 MCP 拿准确数据
- 效果:投资决策质量从"猜"变成"严谨可信"
- 关键纪律:所有涉及数据的 AI 输出都要绕开联网搜索
3.2 Chrome MCP(重大升级,2026-04)
- 官方版:使用无头浏览器(没有用户数据)
- 王凯改造:"session 复用 + 用户数据浏览器"
- 解决:每次链接重复授权 + 抢焦点问题
- 效果:多个 Agent 并行控制不同浏览器,互不干扰
- 王凯把此 Skill 上传 tokrepo:"Chrome MCP Background Proxy"
3.3 自建 MCP 的关键
- 任何需要"准确数据"的场景都应该走 MCP,不走 AI 联网搜索
- API 月费看似贵,但精准度带来的 token ROI 极高
- 把工作流中所有"数据源"接进来,让 Claude 成为"中枢"
4. 自动化任务体系(2026-Q1 重大转折)
graph TB
A[设定自动化任务] --> B[Agent 启动]
B --> C[10 min 心跳检查<br/>是否停止]
C -- 停止 --> D[Claude Code 重新启动]
C -- 运行 --> B
B --> E[每日报告 → 飞书 bot]
B --> F[异常处理 → 通知]
王凯顿悟(2026-04-12):
- 之前苦于让 Claude Code 持续执行任务,它总自作聪明停止
- 想用 /loop 配置复杂定时任务
- 顿悟:设定 10min 检查定时,如果停就让其继续即可,不需要复杂循环
自动化任务示例:
- 监控 700 只股票 + 飞书 bot 发买卖信号
- 每日跑投资标的的内在价值
- YouTube/Reddit 评论自动化推广
- 多账号多浏览器并发分发内容
5. 多 Agent / 多浏览器 / 多账号体系(2026-04)
graph TB
A[1 台电脑] --> B[5+ 浏览器]
B --> B1[浏览器 1 - Google 账号 A]
B --> B2[浏览器 2 - Google 账号 B]
B --> B3[浏览器 3 - Google 账号 C]
B --> B4[浏览器 4 - Google 账号 D]
B --> B5[浏览器 5 - Google 账号 E]
B1 --> C1[Claude Code 窗口 1<br/>YouTube 推广]
B2 --> C2[Claude Code 窗口 2<br/>Reddit 推广]
B3 --> C3[Claude Code 窗口 3<br/>Dev.to 推广]
核心思路:
- 不在一个 Agent 内做多账号切换
- 一个浏览器一个账号体系(Google 账号互不混淆)
- 每个 Claude Code 窗口绑定一个浏览器
- 同时铺几十个平台
前置要求:
- 海外手机号(淘宝买美国/英国卡,激活国外账号体系)
- 多套 Google / Apple / Claude 账号
- 海外银行卡 / Stripe / Wise / Lemon Squeezy 等支付
6. Agent 自主决策实验(200 美金给 Polymarket)
2026-03-12 王凯实验:
- 让 Claude Code 自主决策访问类 Polymarket 加密项目
- 给 200 美金本金,完全自主跑
- 设定:让 Claude Code 看完所有 RSI AI 交易飞书文档,凝练 Skill 进行 prediction market 决策
结论(截止 2026-05):Agent 自主决策在投资场景还不到 L4
- 提示词框定后能稳定运行
- 但策略迭代仍需要人来突破
- "我看到什么高度,Agent 才能达到什么高度"
7. Agent 在投资中的角色(最值钱场景)
graph LR
A[市场信息] --> B[Agent 1: 拉数据<br/>FMP MCP]
B --> C[Agent 2: 量化风险<br/>5 个变量打分]
C --> D[Agent 3: 计算内在价值<br/>6000 字提示词]
D --> E[人类决策<br/>当前 L2]
E --> F[Agent 4: 执行交易<br/>挂单 / 监控]
当前定位:决策仍然人来,但 Agent 把"信息采集 + 风险量化 + 价值计算 + 执行"全包了。
8. Devin / Manus / Cursor 对比
| Agent | 类型 | 王凯评价 |
|---|---|---|
| Devin | 编程 Agent | 演示震撼,实战还在 L3 |
| Manus | 通用 Agent | 国内首款相对复杂,但门槛不高 |
| Cursor | 辅助编程 | 主力,数据分析利器 |
| Claude Code | 命令行 Agent | 2026 王凯主力,改变协作流程 |
| v0 | 产品设计 Agent | "万字提示词敢 PUA" |
| Stitch | UI 设计 Agent | "切换 Gemini 后突飞猛进" |
9. Agent 工程的"自主性 vs 可控性"陷阱
王凯踩坑("六大模型跑币圈"分析):
- 6 个大模型给币圈 1 万美金自主决策
- 第一次问询有倾向性 → 后续输入信息变化 → 决策永远基于当前持仓
- "AI 陷入到优化细节,跳不出来说'清仓保现金'"
- 结论:纯自主决策必须有"清仓"权限,否则永远陷在细节优化中
10. AI Agent 在不同场景的适用度
| 场景 | 适用度 | 原因 |
|---|---|---|
| 编程 | ⭐⭐⭐⭐⭐ | 结果可验证(跑通就对) |
| 投资决策 | ⭐⭐⭐⭐ | 结果可验证(赚钱就对) |
| 数学题 | ⭐⭐⭐⭐⭐ | 有标准答案 |
| 内容生成 | ⭐⭐⭐ | 主观评判,易飘 |
| 市场调研 | ⭐⭐⭐ | 信息源严重影响质量 |
| 法律 / 医疗 | ⭐⭐ | 准入 + 风险高 |
王凯引用 Jason Wei 论文:"可验证性 = AI 优势区,不可验证 = AI 弱区"
11. Agent 商业模式判断
王凯立场(2025-03-29):
- Agent 不是创业方向(小微 team)
- 因为:
- token 单次成本太高(10 美金/任务)
- 大模型公司自己做(OpenAI ChatGPT Agent 用专门优化模型)
- 生态完善前竞争是赔钱战
- 但Agent 周边机会很多:
- 使用模板库
- Agent 导航
- 精选案例
- 垂直 Agent(包一层串起来满足细分场景)
12. Loop 自动化 vs 互联网定时任务
- 之前互联网时代有 cron / 定时任务
- 但都是预写规则
- AI Agent Loop 是有判断能力的循环
- "如果某个状态出现就这么做,否则那么做"
- 王凯把人脑能想到的所有"重复 + 判断"任务都丢给 Loop
13. 王凯说
"Agent 在 token 价格再降 90% 之前不会真正爆发。"
"Agent 改变的不是流程效率,是协作模式。"
"构建稳定运行的体系,而不是直接干。"
"1 个人能 cover 100 件事,如果你会构建 Agent 体系。"
"把自动化任务都丢给 AI,我去做更高维度的事。"
引用
- 王凯 AI Coding 实操:从 Cursor 到 Claude Code 终端工作流 - AI Coding 基础(用 Claude Code 构建 Agent)
- 王凯 RSI AI 投资策略与"好资产 好价格 好波动"框架 - 投资策略(Agent 最值钱场景)
- 王凯 AI 时代创业方法论与商业判断框架 - 创业方法论(Agent 不是创业方向)
- 王凯 出海推广 SOP 与海外多账号矩阵实战 - 海外推广(多 Agent 多浏览器铺平台)
- newtype-ai-agent-architecture - Agent 架构演进对比
2026-06 增补:产品经理理解长任务 Agent 的最小边界
本节来自王凯 6 月 9 日与 16 日两则文字帖,均已全文阅读。帖子推荐的外链文章没有随本批提供全文,因此本节不冒充对外链实现的拆解。
读工程机制,是为了知道什么时候不能依赖它
Harness(让模型持续工作的外围执行系统)、记忆和上下文工程(决定每一步给模型看什么信息),对产品经理的价值首先是识别能力边界:它大概能做什么、会丢什么信息、为什么会卡住。作者强调,AI 越深入投资等生产力场景、系统越像黑盒,越需要形成这种半专业判断;不必为了使用工具而掌握所有底层代码。
从执行一段任务,变成围绕目标反复行动
6 月 16 日把 Claude Code 的 Loop 与 Codex 的 Goal、自动化放在同一个需求下:让 Agent 多轮推进一个目标,直到达成。相对于本页已有的定时任务经验,新增观察是协作时间跨度和任务复杂度都在变长。评估时应看跨轮是否真的保持目标和进度,而不是只比较一次对话的回答质量。
这两帖只支持上述产品层认识,没有提供停止判定、预算上限或失败恢复的具体实现;配置操作应查对应项目资料,不能根据推荐链接标题推导出一套已验证方案。