newtype 星球收录的 3 篇 Agent 研究 / 演讲精读。05 CAMEL-AI Wendong Fan《Finding the Scaling Laws of Agents》(2025 演讲:# Parameters → # Agents 类比 / CAMEL + OWL + CRAB + OASIS 框架 / Agentic Data Generation 反哺训练)/ 07《More Agents Is All You Need》(Tencent ICML 2024:sampling-and-voting 暴力堆 Agent 数量,Llama2-13B + 15 个 agents 匹敌 Llama2-70B,3 个维度决定 gain 大小)/ 08《ChatQA》(NVIDIA 2024:two-stage instruction tuning,70B 在 10 个 conv QA 数据集上 54.14 vs GPT-4 53.90,fine-tune retriever 替代 query rewriting 省 API 钱,"unanswerable" sample 训练消除幻觉)
2026-01 newtype 整理的 AI Agent 技术架构演进研究报告。基于 2024-10 至 2026-01 的论文 + Anthropic/OpenAI/Google/Microsoft 官方博客 + 开源项目 + 真实部署案例。涵盖 6 大演进 / 4 种多 Agent 编排模式 / Google 8 大基础模式 / 记忆管理(MemoryOS 3 层 + 向量库选型)/ 工具调用 + MCP 标准化 / 推理框架(ReAct → ToT → GoT → WoT 演进)/ 推理模型 LRM / 生产 7 层架构 / 主流框架对比(LangGraph/CrewAI/MAF/AutoGen/LlamaIndex/ADK)/ Morgan Stanley + Klarna + BBVA + Rakuten 真实部署案例 / 2026 趋势预判 / 合规与治理 / 生产清单。是 [[newtype-agent-architecture]](黄益贺帖子级判断)的"研究报告级"补充。
跨作者 evals 主题汇总。Anthropic 4 大教训(infrastructure noise 6 点差 / eval awareness 模型识破 / take-home test 寿命 / pass^k 数学)+ 学术派(SWE-Bench / Terminal-Bench / τ2-Bench / BrowseComp / 𝜏2 / OSWorld / CORE-Bench 全集)+ 王凯 / 老黄 / Cal Rueb 实战视角。框架选型(Harbor / Braintrust / LangSmith / Langfuse / Arize)+ PM 14 项自检 checklist。本 wiki 是 [[anthropic-engineering-demystifying-evals]](Phase A 锚 / Anthropic 单源 deep dive)的"横向跨作者拓展"
LLM 分布式训练综合。llm-interview-distributed(9 PDF / 分布式总览 + 流水线并行 + DataParallel/DDP + torch.multiprocessing + AMP 混合精度 + DeepSpeed + accelerate + ZeRO)+ vLLM / 推理优化栈。覆盖 4 大并行策略(DP/MP/PP/TP)、3D Parallelism、ZeRO 三阶段、Megatron + DeepSpeed 主流栈
LLM 内核基础综合。llm-interview-basics(Decoder 三种架构 prefix/causal/encoder-decoder + Layer Norm LN/RMS/Deep + 激活函数 GeLU/SwiGLU + Attention 升级 MQA/GQA/Flash + Transformer 操作 + 损失/相似度函数 + 复读机问题 + 8 大缓解策略)/ Karpathy nanochat(243 行代码复现 LM)/ newtype Karpathy(Software 2.0 神经网络权重)。覆盖 Transformer 三种范式、主流 LLM 配置(LLaMA/GPT/GLM)、Attention 演化、训练经验
LLM 微调与对齐综合。llm-interview-finetune(19 份 PDF / 微调基础 + PEFT + LoRA 系列 + QLoRA + 增量预训练 + RLHF + PPO + DPO + 显存优化 + 推理 + Prompting + SFT 数据)/ newtype 微调实战 + 王凯 LoRA 应用心得。覆盖全参 vs PEFT、LoRA + QLoRA、RLHF vs DPO、SFT 数据构建、显存优化策略
4 视角的 MCP 协议生态融合。newtype 老黄(DOS→Win95→互联网爆发演化预测 + 老黄自己做 Obsidian/Flux/Prompt House MCP + 常用 MCP 清单 + 配置 7 大坑)/ 王凯(FMP 金融 MCP + Chrome MCP 改造 + 飞书 CLI / 自建 MCP 解决数据准确性)/ 老 D(国内 rap.dev + 小红书 MCP server + Playwright)/ AWS 行业(常高伟 ANP 协议对比 MCP)。覆盖 MCP vs GUI Agent 之争、Smithery 失败、Sequential Thinking + Tavily 默认栈、MCP+n8n 工作流闭环
黄益贺 2025-03 → 2026-05 关于 MCP 的全量观察。基础概念 / 老黄自己做的 MCP / 常用 MCP 清单 / 配置排错 / DOS → Win95 演化预测 / 上下文工程 vs 提示词工程 / Skill + MCP 配合 / 巴菲特复刻 SOP
4 视角的 Prompt 工程融合。newtype 老黄(186 帖 + 4 个生产级模板 + 5 元素任务拆解 + Thinking-Claude 表演思考 + Ultra think 三档 + Karpathy Context Engineering)/ 王凯(PUA Claude 6000+ 字 + AI 当尺子量化 + 风险打分提示词 + 决策拷问 SOP)/ 老 D(三层提示词架构:元/系统/用户 + Markdown 仿写 SOP + 模仿博主 4 步)/ Anthropic 内部(Cal Rueb CLAUDE.md 反 pattern)。覆盖"Prompt 工程要不要学"反共识、Skill 化是终态、Prompt 调度 Prompt、Sequential Thinking 调度
5 视角的 RAG + 知识库工程融合。newtype 老黄(5 代架构演化 AnythingLLM→Cursor+Obsidian→Claude Code AI OS→newtype OS→wiki.newtype.pro / RAG 优化 5 关键点 / Milvus+MCP 数据库模型分离 / 自己→Obsidian 别人→NotebookLM 终态)/ LLM 面试技术派(14 份专题:R/A/G 三模块 + PDF 解析 + 表格识别 + 文本分块 + HYDE + 负难样本 + RAG-Fusion + GraphRAG)/ 老 D 反直觉教学("RAG 不是模型变强,是提示词被自动加强")/ 王凯(Agentic Search 强过 RAG + 自建数据 MCP)/ Cal Rueb(Anthropic 不用 RAG MCP)。覆盖 RAG vs Long Context vs NotebookLM 三向选择、GraphRAG 经济性、知识库哲学
4 视角的 Scaling Law + AGI + Software 3.0 融合。Karpathy 2025-06 演讲(Software 1.0/2.0/3.0 三段论 + LLM = OS/Utility/Fab 三类比 + LLM 心理学 + Iron Man Suit 4 原则 + Agentic Decade 2025-2035)/ Aschenbrenner Situational Awareness 165 页(AGI by 2027 + OOMs counting + Trillion-dollar cluster + Intelligence Explosion)/ 三派之争(朱啸虎应用层 / Cohere Aidan 务实 / 李开复天花板 / 老黄综合)/ 王凯"站在 AGI 视角看当下"+ Embiricos AGI 瓶颈 = 人类打字速度。覆盖 AGI 时间表分歧、Software 3.0 普及预测、Vibe Coding 自然语言编程