← Knowledge Notes
AI Product Practice / Knowledge note · Chinese

newtype · AI 工具栈实战与演化

黄益贺 2024-03 → 2026-05 的 AI 工具栈使用与推荐演化。本地模型层(Ollama/LM Studio/MLX)/ 前端层(AnythingLLM/Open WebUI/LobeChat/ChatWise/Cherry Studio)/ 知识库层(MaxKB/RAGFlow/Obsidian Copilot)/ 移动端(Enchanted/Apollo)/ 配置与性能(Mac mini M4 / 3060 / DeepSeek-R1 性能对比)/ 老黄日常组合(Gemini + Grok + Raycast + Cursor + NotebookLM)

Source collection:Newtype · Published here:2026-09-26 · Note updated:2026-05-16

AI工具本地模型工具选型

黄益贺 2024-03 → 2026-05 的 AI 工具栈使用与推荐演化。覆盖 178 帖 tools-stack 主题桶。聚焦"非技术个体怎么挑工具 + 怎么搭组合栈"。

何时打开:

  • 你想本地跑大模型,不知道用 Ollama 还是 LM Studio
  • 你想搭知识库,纠结 AnythingLLM / Open WebUI / RAGFlow / Obsidian + Copilot
  • 你想买 Mac mini M4 跑本地 AI,想知道值不值
  • 你想看老黄 2024 → 2026 工具栈推荐的演化(很多工具被淘汰了)

0. 演化时间线

graph TD
    A["2024-03 ~ 06<br/>本地模型 + 知识库<br/>(Ollama / LM Studio /<br/>Open WebUI / AnythingLLM)"] --> B["2024-08 ~ 11<br/>RAGFlow / MaxKB / Perplexica<br/>更强解析 + 本地搜索引擎"]
    B --> C["2024-12 ~ 2025-02<br/>DeepSeek-R1 风暴<br/>Mac mini 本地服务器<br/>Cherry Studio / ChatWise"]
    C --> D["2025-03 ~ 06<br/>MCP 时代到来<br/>客户端选 ChatWise/Raycast<br/>Obsidian + 自家 MCP"]
    D --> E["2025-07 ~ 12<br/>Claude Code 主战场<br/>Skills + Sub-agents + MCP<br/>本地模型边缘化"]
    E --> F["2026-01 ~<br/>OpenCode/newtype-os<br/>多 Agent 编排<br/>To Agent 接口"]

每个时代有不同的工具组合。老黄的关键 insight:工具会被新工具替代,但 接入这些工具的逻辑(API Key / 本地端口 / MCP)始终不变。

1. 老黄当前(2025-04~)的常用组合

来自帖 1176:

"Gemini + Grok + Raycast + Cursor + NotebookLM,这个组合非常给力。"

后期补充(帖 2148, 2535):

  • Claude Code 作为个人 AI OS 框架(4 大栈:Skills / MCP / Slash commands / Sub-agents)
  • newtype OS / newtype-cli 作为 Multi-Agent 内容生产团队

淘汰的工具(2024 推荐过但 2025 后老黄已弃):

  • AnythingLLM(从核心降为"备用 + 尝鲜")— Agent 功能初级,RAG 效果一般
  • Open WebUI(早期推荐,后期不再提)
  • LobeChat(早期部署 newtype.pro 用,后期不再用)
  • ChatWise(2025 上半年常推,2026-02 GitHub issue 显示停更,老黄默许)

保留的工具(2024 起就一直在用):

  • Ollama(本地模型运行,稳定王者)
  • LM Studio(配合 MLX 在 Mac 上的性能优势)
  • Obsidian(笔记 + AI 插件 + 自家 MCP)
  • Cursor(2024-09 → 至今,Vibe Coding 主力)

2. 本地模型运行层:Ollama vs LM Studio(2024-04 帖 53 精华)

老黄的"杂物梳理"经典帖,定义了 2024-2025 的标准:

工具 直观区别 优势
Ollama 命令行 模型多(可下载任何 GGUF) / 默认 5 分钟自动释放显存
LM Studio 图形化 集成度高(搜+下载+加载+对话) / 同时跑多模型 / 支持 MLX

核心区分:

  • 客户端模式: 自己跑大模型 + 自带前端聊天
  • 服务器模式: 只跑模型,开端口给其他应用(Anything LLM / Open WebUI / Python 脚本)调用

老黄的实战选择:

场景 选哪个
新手快速跑通 LM Studio(图形化,从模型搜索到对话一站式)
Mac M 芯片 + 追求性能 LM Studio(MLX 优化)
跑 Multi-Agent 框架(AutoGen/CrewAI) LM Studio(支持同时跑多个模型,每个 Agent 配不同模型)
服务器后端 Ollama(端口 11434 标准,生态适配最好)
Hugging Face 直接下载模型 Ollama(2024-10 支持,帖 544)
长期挂着 LM Studio(开着不释放;Ollama 默认 5 分钟释放,要改 OLLAMA_KEEP_ALIVE=-1)

重要环境变量(Ollama):

  • OLLAMA_HOST=0.0.0.0:监听全局(默认只监听 127.0.0.1,远程访问需改)
  • OLLAMA_KEEP_ALIVE=-1:不自动释放显存(常驻)
  • OLLAMA_MODELS=<path>:更改模型存储位置(默认 C 盘)

何时用:

  • 新手 → 装 LM Studio 一个就够
  • 要跑 Multi-Agent / Python 脚本 → 必须 Ollama 或 LM Studio 服务器模式
  • Mac M 芯片 → 优先选 LM Studio + MLX 模型

3. 前端聊天层(2024-2025 演化)

2024 早期(2024-03~05): AnythingLLM 占主导

  • 集成 Ollama / LM Studio / OpenAI 等所有后端
  • 支持 RAG(向量数据库默认 LanceDB)
  • 多 Workspace(每个工作区不同模型 + 不同文档)
  • Query Mode(只按文档回答,不自由发挥)
  • 2024-04(帖 111)上线 Agent 功能,但初级

2024 中期(2024-06~08): Open WebUI 流行

  • Docker 部署 / 给 Ollama 一个 ChatGPT 风格界面
  • 自带 RAG + 账号管理
  • 问题: admin 创建账号默认 pending 状态(帖 21);搜索增强用 searXng 容易 403

2024 后期(2024-09~12): Brave + 内置 AI

  • 浏览器选定文字 → 右键调 AI(Ollama)
  • 老黄表示"挺喜欢",希望加自定义

2025 上半年: ChatWise / Cherry Studio(国人做)

  • 帖 816(2025-02):"都是国人做的。都提供 API、本地接入。我个人更喜欢 ChatWise,清爽许多"
  • 帖 817:ChatWise 新版支持 Jina DeepResearch
  • 帖 1176(2025-04):ChatWise 仅 2 个用途 — 备用 + 尝鲜

2025 后期: 客户端逐渐让位于 Claude Code / Codex

  • 帖 1586(2025-08):"用 Claude Code 看到相对通用 Agent 的可能性"
  • 帖 2032(2026-01):"newtype Profile 集成进 OpenCode/Claude Code"

何时用:

  • 多模型对比 → Cherry Studio 或 ChatWise(轻量切换 + 备用)
  • 多 Agent Workflow → 直接走 Claude Code + Sub-agents(2025 后期方向)
  • 知识库聚合 → AnythingLLM(单机) 或 NotebookLM(云端)

4. 知识库层:从工具堆叠到 NotebookLM(2024-2026)

2024 工具大乱斗

工具 评价
AnythingLLM 通用聚合器,易上手,RAG 效果一般
Open WebUI + Ollama 自带 RAG,适合本地全本地化场景
MaxKB 适合企业内训(帖 149),iPanel 一键安装
RAGFlow 文档解析多样,效果优于 AnythingLLM(帖 490 对比)
QAnything 网易有道,云端版好用,本地部署痛苦
GraphRAG 微软,全局性问答,但成本极高(帖 360 单文档单问答 $11)

2025 简化:个人知识库终极方案(帖 2201 精华)

老黄 2026-01 给的两句话总结:

自己的东西 → Obsidian(local-first) 别人的东西 → NotebookLM(性能优先)

原因:

  • 自己的笔记不要相信任何云,Obsidian 每条笔记是 Markdown 文件,AI 极友好
  • 别人的资料(论文/报告/视频转写)放 NotebookLM,Source-Grounding 严格不胡说

详见 newtype 知识系统与 Life OS 全演化(待写,下一个 wiki)。

RAG 效果优化要点(累积自多个回答)

优化点 怎么做
文档预处理 PDF 转 Markdown(用 Marker / MinerU / Markitdown)/ 删除模糊表达 / 每节自包含
Embedding 模型 中文场景:nomic-embed-text 或 mxbai-embed-large;企业级用 OpenAI text-embedding-3-large
Chunk size + overlap 太小 → 切断语义;默认 1000-token chunk 一般 OK
Citations 检查 AnythingLLM 等支持,看引用文本块对不对
模型选择 RAG 对模型推理要求不低,7B 不够,优先 14B+/Qwen Max/Claude

5. Obsidian 生态(老黄的最爱)

Obsidian 核心插件

插件 干嘛
Copilot(老黄主推) AI 对话 + Vault QA(基于笔记的 RAG)
Text Generator 文本生成,可对接本地大模型
Web Clipper + Interpreter 自动剪藏 + AI 总结(支持 Ollama)
Smart Connections 笔记之间的语义关联

Copilot 设置要点(帖 218 精华)

  • Default Model: 选 OpenRouter / OpenAI / Ollama
  • Embedding: text-embedding-3-large(OpenAI)
  • 本地接入: LM Studio 用 localhost:1234/v1;Ollama 用本地命令行配置
  • Vault QA: 改 mode 从 Chat → Vault QA,让插件嵌入所有笔记建立索引

老黄的进化(2025-08 帖 1596)

  • Obsidian 用来存放笔记(完全本地化,Markdown for AI)
  • 不在 Obsidian 撰写笔记(杂七杂八功能干扰),用 Ulysses 写完再贴过去
  • 删光 Obsidian 里的 AI 插件,改用自家 Obsidian MCP + Claude
  • "记笔记本身就那些东西,我更多是思考怎么把我的东西再提纯、再精炼"

详见 newtype · MCP 协议与生态实战 §2.1 Obsidian MCP。

6. 老黄的硬件实战(M4 Mac mini / 3060)

Mac mini M4 作为轻量级 AI 服务器(2024-12 帖 677)

配置: M4 Mac mini + 24G 统一内存 模型测试(Qwen 2.5):

精度 模型大小 Token/秒 评价
Q4 7B 20 顺
Q4 14B 10 可接受 / 老黄最终选
Q8 7B 慢一档 算了
Q8 14B 慢一档 算了

Ollama 配置:

  • OLLAMA_KEEP_ALIVE=-1(常驻)
  • OLLAMA_HOST=0.0.0.0(局域网监听)

iOS App: Enchanted(丝滑)

DeepSeek-R1 跨设备性能(2025-02 帖 783)

设备 模型 Token/秒
3060 (16G) 7B 46(非常顺)
3060 (16G) 8B 44
3060 (16G) 14B 26(可接受)
M4 Mac mini (24G) 7B 19
M4 Mac mini (24G) 8B 17
M4 Mac mini (24G) 14B 10

结论: Mac mini 的优势是 功耗;追求性能用 PC + 显卡。

Mac vs Win 选择(帖 1015, 1269)

"不需要对比分析,你就看 OpenAI 这些公司的发布会,全都是 Mac。"

但日常本地用 / 跑 Python / 跑 Ollama,Mac 和 Win 区别没那么大。M 芯片优势在 MLX。

7. 移动端工具(2024-2025)

平台 工具 备注
iOS Enchanted 老黄主推,连 Ollama 丝滑
iOS Apollo $5,支持自定义后端(本地/OpenRouter/自建服务)
iOS Typingmind(网页快捷方式) 支持多模型
移动端通用 官方 APP(ChatGPT / Claude / Gemini) 最简单 / 老黄推荐起点
Mac 终端 Ghostty OpenAI 发布会用的,老黄知道但平时用 Cursor 终端

老黄实践(帖 777):

  • 不追求"全套移动方案"
  • iOS 上用 Enchanted 连家中 Mac mini Ollama
  • 在外面紧急用 → ChatGPT 官方 APP / Gemini 官方 APP

8. 关键工具组合公式

全本地配置(数据完全不上网)

Ollama(后端) + AnythingLLM/Open WebUI(前端) + Llama3/Qwen2.5(模型)
+ nomic-embed-text(嵌入) + LanceDB(默认向量库)

适用: 法律/合同/财报等敏感数据 / 离线场景

个人混合配置(老黄 2024-2025 中段)

Obsidian(笔记) + Copilot 插件(本地+云端切换)
+ OpenRouter(模型聚合) + Cursor(代码)
+ Perplexity(搜索)+ Anything LLM(资料库)

老黄当前(2025-04+)

Gemini + Grok + Raycast + Cursor + NotebookLM
+ Claude Code(配 Skills/MCP/Sub-agents)
+ Obsidian + 自家 Obsidian MCP
+ Prompt House + Prompt House MCP

Mac mini AI 服务器配置

Mac mini M4 24G + Ollama(Qwen 2.5 14B Q4)
+ OLLAMA_KEEP_ALIVE=-1 + OLLAMA_HOST=0.0.0.0
+ iOS Enchanted 连接局域网

9. 常见配置坑(归类整理)

Ollama 系列

  • Docker 安装报错 → 检查 M 芯片兼容性(帖 127)
  • 模型下到 C 盘满了 → 环境变量 OLLAMA_MODELS=<path>(帖 74 精华)
  • 中文模型胡说八道 → 改 modelfile.txt 加 TEMPLATE 和 PARAMETER(帖 42)
  • GPU 不工作 → 检查 GGML_CUDA / Layer offload(LM Studio 在 settings 里可调)
  • GPT4ALL? → 老黄不推荐,模型少 + 产品简陋

AnythingLLM 系列

  • 导入文档报错 fetch failed → 换 Embedding(默认那个 Hugging Face 没响应)(帖 30)
  • Workspace 文件位置改不了 → 当前版本可能不支持
  • 回答不到原文 → 1) 模型不够强(用 GPT-4 测)2) Chunk size/overlap 太小 3) 嵌入模型语言不支持

Open WebUI 系列

  • 创建账号默认 pending → admin 改 Default User Role 为 User(帖 21)
  • 重启后连不上 → Ollama 没启动

LM Studio 系列

  • 本地模型怎么用 → 启动服务器模式,端口 1234(默认)
  • MLX 模型怎么用 → 在搜索时勾选 MLX 版本
  • 手机连不上 → 可能软件不支持手机连接(Ollama + Enchanted 是兼容路径)

10. 工具选择决策树

你的核心需求是什么?
├── 单纯聊天 / 多模型对比
│   └── ChatWise / Cherry Studio / Raycast(Mac)
├── 跑本地大模型
│   ├── 新手图形化 → LM Studio
│   ├── 服务器/给其他 App 调用 → Ollama
│   └── Mac M 芯片追极致 → LM Studio + MLX
├── 知识库
│   ├── 自己笔记 → Obsidian + Copilot / Obsidian + MCP
│   ├── 别人资料(论文/报告)→ NotebookLM
│   ├── 团队/企业 → MaxKB / RAGFlow
│   └── 完全本地+敏感数据 → Ollama + AnythingLLM
├── 编程
│   ├── 主力 → Cursor / Claude Code
│   └── 长上下文 → Augment Code(老黄没用过,听过)
├── 行业 / 市场研究
│   └── Gemini Deep Research / Perplexity / Grok
├── 多 Agent 编排
│   └── Claude Code + Sub-agents / OpenCode + newtype-os(老黄做的)
└── Workflow 自动化
    └── n8n(配 MCP Server Trigger 转 MCP)/ Dify

11. 哪些 2024 推荐过的东西现在没人提了(被淘汰)

工具 2024 推荐时间 当前状态
LobeChat 2024-03 福利 老黄 newtype.pro 早不用了
Open WebUI 2024-03 让位于 ChatWise / Cherry Studio / 官方 APP
Phidata 2024-04 让位于 CrewAI / Claude Code
LLocalSearch 2024-04 让位于 NotebookLM / Perplexica / Perplexity
GraphRAG 2024-07 成本太高(单问答 $11),让位于 Source-Grounded NotebookLM
LightRAG 2025-02 让位于普通 RAG + 高质量 Embedding
Perplexica 2024-08 让位于 Perplexity / NotebookLM
MaxKB / RAGFlow 2024 ~ 2025-02 仅企业场景保留
AnythingLLM 2024-2025-04 降为"备用 + 尝鲜",不是主力
ChatWise 2025-02-2026-02 GitHub issue 显示停更,前途不明

Why 这个淘汰节奏值得关注:

  • 模型变强 → 应用层"中间件"被吃掉
  • MCP 出现 → 客户端集成的 RAG/Search 被外挂 MCP 替代
  • Claude Code / Codex 等 Agent 系统出现 → Workflow 类工具(Dify/Coze)被边缘化

12. 老黄的工具选择心法(总结)

心法 出处
盯最好的,国内 AI 不用考虑 帖 2063("既然要学要用,那就盯着最好的")
Mac 是 OpenAI 发布会标配,但 Win 跑 AI 也没问题 帖 1015
AI 时代,API 调用 > 本地部署(除非数据敏感) 帖 593, 874
本地大模型代码能力赶不上 Claude 3.5 Sonnet 帖 593
嵌入模型很重要,先跑通 OpenAI 嵌入,再降到本地 帖 886
AnythingLLM 易用,但 Agent 还初级,生产用 Claude Code 帖 449, 1586
工具选最流行的,拿不准就别折腾 帖 70
AI 知识库,最重要的不是 AI,而是知识 帖 717

13. 反 pattern

❌ ✅
听说 X 工具好就装上,不试就推荐 自己用过一遍再判断,用过同类对比
一味追求"全本地" 大多数场景 API 更省钱、效果更好,只有数据敏感才本地
Mac mini 跑 70B 本地大模型 24G 显存不够,会出怪结果,直接上云端
知识库塞所有资料 只塞清晰、自包含、含 QA 形式的高质量内容
用 7B 模型做 RAG 期待 GPT-4 效果 模型推理力不够,先用 GPT-4 验证再降到本地
用一个 AI 工具搞全部 v0 / Claude / Cursor 分工(详见 newtype · Vibe Coding 独立产品实战 §4)
把"装好工具"当目标 装工具是手段,形成可复用的 SOP 才是目标
死磕某个停更工具 工具会被替代,核心是接入逻辑(API + 端口 + MCP)

引用与延伸

主要引用: tools-stack 主题桶全 178 帖(2024-03 至 2026-05),无抽样。覆盖帖号包括(完整全量):11, 12, 15, 20, 21, 28, 29, 30, 32, 33, 34, 36, 39, 40, 42, 43, 44, 47, 52, 53, 56, 57, 64, 67, 68, 70, 73, 74, 80, 82, 83, 87, 90, 93, 95, 96, 98, 99, 101, 110, 111, 116, 122, 125, 127, 131, 133, 136, 140, 142, 147, 149, 155, 160, 161, 163, 164, 166, 172, 179, 180, 196, 214, 218, 220, 242, 259, 269, 276, 284, 305, 315, 353, 356, 360, 363, 377, 401, 422, 423, 431, 437, 444, 445, 449, 460, 469, 476, 490, 510, 526, 535, 544, 552, 563, 570, 573, 593, 612, 623, 656, 668, 673, 677, 690, 717, 766, 767, 770, 771, 772, 777, 780, 782, 783, 786, 791, 792, 793, 794, 795, 796, 816, 817, 824, 830, 831, 836, 841, 874, 882, 883, 921 等。

配套 wiki:

History

  • 2026-05-16 v1.0 创建 — Phase 1.1 wiki #6。基于 tools-stack 主题桶全 178 帖。无抽样。13 个维度组织:演化时间线 / 老黄当前组合 / Ollama vs LM Studio / 前端聊天层演化 / 知识库层 / Obsidian 生态 / 硬件实战 / 移动端 / 组合公式 / 配置坑 / 决策树 / 淘汰清单 / 选择心法 / 反 pattern。

来源与关联资料