← 知识整理
AI 技术与工程 / 知识整理 · 中文

王凯 Agent 工程实操

272 帖记录的 Agent 工程实践:从 Devin / Manus 观察到自建 Agent 系统、MCP 接 FMP/飞书/Chrome、Loop 任务、多 Agent 多浏览器多账号体系、自动化推广 SOP

资料来源:王凯 · 本站发布:2026-09-26

Agent工程MCP自动化

王凯从 2024-08 开始观察 Agent 浪潮(Manus 早期),但长期警告"Agent 元年说太早"(token 太贵、商业模型未跑通)。2026-Q1 开始亲自构建 Agent 系统(Chrome MCP / Loop / 多 Agent),认知达到"Agent 是新协作流程"层级。

1. Agent 演化时间线

graph LR
    A[2023-04 SEC FastFacts<br/>Workflow 雏形] --> B[2024-Q3 Devin 演示震撼<br/>Agent 分级概念]
    B --> C[2025-01 Coding 领域出独角兽<br/>Cursor / v0 / Manus]
    C --> D[2025-03 Manus 国内爆火<br/>但本质是 token 消耗变多]
    D --> E[2025-07 ChatGPT Agent<br/>OpenAI 专门优化模型]
    E --> F[2025-Q4 MCP 生态成熟<br/>Claude 接百+服务]
    F --> G[2026-Q1 Chrome MCP 普及<br/>多 Agent 自动化体系]
    G --> H[2026-04 王凯亲建 Agent 集群<br/>多浏览器多账号多 Agent]

2. Agent 分级(参考自动驾驶)

等级 描述 当前位置
L1: 单点辅助 人提任务,AI 写,人执行 普及
L2: 多步辅助 AI 帮人拆解任务、引导 Cursor / v0 / 深度研究
L3: 半自主 人监督下 AI 完成多步任务 Devin / Claude Code Agent
L4: 完全自主 无需人介入,Agent 完成复杂任务 待 token 价再降 90%
L5: Agent 组织 多 Agent 协作完成组织级任务 OpenAI L5 设想

王凯当前定位:L3 半自主(Claude Code 跑投资策略、自动推广等)。

3. MCP 实战清单

graph TD
    A[Claude Code] --> B[金融 MCP - FMP API<br/>解决数据准确性]
    A --> C[Chrome MCP - 控制真实浏览器]
    A --> D[飞书 CLI - 文档 + bot]
    A --> E[滴答清单 MCP - 任务管理]
    A --> F[Notion / Gmail 等]
    A --> G[AgentMail - Agent 邮箱]
    A --> H[自建 MCP - tokrepo skills]

3.1 FMP MCP(金融数据准确性)

  • 问题:Claude/GPT 联网搜索拿数字 100% 不可信(编造数据)
  • 解决:买 FMP API → 自建 MCP → Claude 通过 MCP 拿准确数据
  • 效果:投资决策质量从"猜"变成"严谨可信"
  • 关键纪律:所有涉及数据的 AI 输出都要绕开联网搜索

3.2 Chrome MCP(重大升级,2026-04)

  • 官方版:使用无头浏览器(没有用户数据)
  • 王凯改造:"session 复用 + 用户数据浏览器"
  • 解决:每次链接重复授权 + 抢焦点问题
  • 效果:多个 Agent 并行控制不同浏览器,互不干扰
  • 王凯把此 Skill 上传 tokrepo:"Chrome MCP Background Proxy"

3.3 自建 MCP 的关键

  • 任何需要"准确数据"的场景都应该走 MCP,不走 AI 联网搜索
  • API 月费看似贵,但精准度带来的 token ROI 极高
  • 把工作流中所有"数据源"接进来,让 Claude 成为"中枢"

4. 自动化任务体系(2026-Q1 重大转折)

graph TB
    A[设定自动化任务] --> B[Agent 启动]
    B --> C[10 min 心跳检查<br/>是否停止]
    C -- 停止 --> D[Claude Code 重新启动]
    C -- 运行 --> B
    B --> E[每日报告 → 飞书 bot]
    B --> F[异常处理 → 通知]

王凯顿悟(2026-04-12):

  • 之前苦于让 Claude Code 持续执行任务,它总自作聪明停止
  • 想用 /loop 配置复杂定时任务
  • 顿悟:设定 10min 检查定时,如果停就让其继续即可,不需要复杂循环

自动化任务示例:

  • 监控 700 只股票 + 飞书 bot 发买卖信号
  • 每日跑投资标的的内在价值
  • YouTube/Reddit 评论自动化推广
  • 多账号多浏览器并发分发内容

5. 多 Agent / 多浏览器 / 多账号体系(2026-04)

graph TB
    A[1 台电脑] --> B[5+ 浏览器]
    B --> B1[浏览器 1 - Google 账号 A]
    B --> B2[浏览器 2 - Google 账号 B]
    B --> B3[浏览器 3 - Google 账号 C]
    B --> B4[浏览器 4 - Google 账号 D]
    B --> B5[浏览器 5 - Google 账号 E]
    B1 --> C1[Claude Code 窗口 1<br/>YouTube 推广]
    B2 --> C2[Claude Code 窗口 2<br/>Reddit 推广]
    B3 --> C3[Claude Code 窗口 3<br/>Dev.to 推广]

核心思路:

  • 不在一个 Agent 内做多账号切换
  • 一个浏览器一个账号体系(Google 账号互不混淆)
  • 每个 Claude Code 窗口绑定一个浏览器
  • 同时铺几十个平台

前置要求:

  • 海外手机号(淘宝买美国/英国卡,激活国外账号体系)
  • 多套 Google / Apple / Claude 账号
  • 海外银行卡 / Stripe / Wise / Lemon Squeezy 等支付

6. Agent 自主决策实验(200 美金给 Polymarket)

2026-03-12 王凯实验:

  • 让 Claude Code 自主决策访问类 Polymarket 加密项目
  • 给 200 美金本金,完全自主跑
  • 设定:让 Claude Code 看完所有 RSI AI 交易飞书文档,凝练 Skill 进行 prediction market 决策

结论(截止 2026-05):Agent 自主决策在投资场景还不到 L4

  • 提示词框定后能稳定运行
  • 但策略迭代仍需要人来突破
  • "我看到什么高度,Agent 才能达到什么高度"

7. Agent 在投资中的角色(最值钱场景)

graph LR
    A[市场信息] --> B[Agent 1: 拉数据<br/>FMP MCP]
    B --> C[Agent 2: 量化风险<br/>5 个变量打分]
    C --> D[Agent 3: 计算内在价值<br/>6000 字提示词]
    D --> E[人类决策<br/>当前 L2]
    E --> F[Agent 4: 执行交易<br/>挂单 / 监控]

当前定位:决策仍然人来,但 Agent 把"信息采集 + 风险量化 + 价值计算 + 执行"全包了。

8. Devin / Manus / Cursor 对比

Agent 类型 王凯评价
Devin 编程 Agent 演示震撼,实战还在 L3
Manus 通用 Agent 国内首款相对复杂,但门槛不高
Cursor 辅助编程 主力,数据分析利器
Claude Code 命令行 Agent 2026 王凯主力,改变协作流程
v0 产品设计 Agent "万字提示词敢 PUA"
Stitch UI 设计 Agent "切换 Gemini 后突飞猛进"

9. Agent 工程的"自主性 vs 可控性"陷阱

王凯踩坑("六大模型跑币圈"分析):

  • 6 个大模型给币圈 1 万美金自主决策
  • 第一次问询有倾向性 → 后续输入信息变化 → 决策永远基于当前持仓
  • "AI 陷入到优化细节,跳不出来说'清仓保现金'"
  • 结论:纯自主决策必须有"清仓"权限,否则永远陷在细节优化中

10. AI Agent 在不同场景的适用度

场景 适用度 原因
编程 ⭐⭐⭐⭐⭐ 结果可验证(跑通就对)
投资决策 ⭐⭐⭐⭐ 结果可验证(赚钱就对)
数学题 ⭐⭐⭐⭐⭐ 有标准答案
内容生成 ⭐⭐⭐ 主观评判,易飘
市场调研 ⭐⭐⭐ 信息源严重影响质量
法律 / 医疗 ⭐⭐ 准入 + 风险高

王凯引用 Jason Wei 论文:"可验证性 = AI 优势区,不可验证 = AI 弱区"

11. Agent 商业模式判断

王凯立场(2025-03-29):

  • Agent 不是创业方向(小微 team)
  • 因为:
    • token 单次成本太高(10 美金/任务)
    • 大模型公司自己做(OpenAI ChatGPT Agent 用专门优化模型)
    • 生态完善前竞争是赔钱战
  • 但Agent 周边机会很多:
    • 使用模板库
    • Agent 导航
    • 精选案例
    • 垂直 Agent(包一层串起来满足细分场景)

12. Loop 自动化 vs 互联网定时任务

  • 之前互联网时代有 cron / 定时任务
  • 但都是预写规则
  • AI Agent Loop 是有判断能力的循环
  • "如果某个状态出现就这么做,否则那么做"
  • 王凯把人脑能想到的所有"重复 + 判断"任务都丢给 Loop

13. 王凯说

"Agent 在 token 价格再降 90% 之前不会真正爆发。"

"Agent 改变的不是流程效率,是协作模式。"

"构建稳定运行的体系,而不是直接干。"

"1 个人能 cover 100 件事,如果你会构建 Agent 体系。"

"把自动化任务都丢给 AI,我去做更高维度的事。"


引用

2026-06 增补:产品经理理解长任务 Agent 的最小边界

本节来自王凯 6 月 9 日与 16 日两则文字帖,均已全文阅读。帖子推荐的外链文章没有随本批提供全文,因此本节不冒充对外链实现的拆解。

读工程机制,是为了知道什么时候不能依赖它

Harness(让模型持续工作的外围执行系统)、记忆和上下文工程(决定每一步给模型看什么信息),对产品经理的价值首先是识别能力边界:它大概能做什么、会丢什么信息、为什么会卡住。作者强调,AI 越深入投资等生产力场景、系统越像黑盒,越需要形成这种半专业判断;不必为了使用工具而掌握所有底层代码。

从执行一段任务,变成围绕目标反复行动

6 月 16 日把 Claude Code 的 Loop 与 Codex 的 Goal、自动化放在同一个需求下:让 Agent 多轮推进一个目标,直到达成。相对于本页已有的定时任务经验,新增观察是协作时间跨度和任务复杂度都在变长。评估时应看跨轮是否真的保持目标和进度,而不是只比较一次对话的回答质量。

这两帖只支持上述产品层认识,没有提供停止判定、预算上限或失败恢复的具体实现;配置操作应查对应项目资料,不能根据推荐链接标题推导出一套已验证方案。

来源与关联资料