505 帖,2024-03 至 2026-05。从单卡 3060 跑 7B,到 4 台 Mac mini M4 集群跑 Qwen 2.5 Coder 32B(18 tok/s)、M3 Ultra 双 512G 跑 DeepSeek 满血(20 tok/s),到 2026 OpenCode 黑卡 $200 用任何模型。
一句话:模型不再是稀缺品,稀缺的是"工程化集成它们的能力"。
0. 阅读路线
- 想了解 2024-2026 模型演化时间线 → §1
- 想做微调 → §3(Unsloth + GRPO 实操)
- 想知道硬件选哪个 → §4(Mac mini / 3060 / Jetson / M4 Max)
- 想理解 Scaling Law 之争 → §2.1
- 想做模型路由 / 多模型委员会 → §5
- 想了解输出长度瓶颈 → §2.2
- 工具配方推荐 → §6
1. 模型演化时间线 / 关键拐点
1.1 2024 H1:模型百花齐放,本地革命
核心事件:
| 日期 | 模型 / 事件 | 关键意义 |
|---|---|---|
| 2024-03 | Tencent 论文《More Agents Is All You Need》 | 数量补能力 / Llama2-13B × 15 票投打过 Llama2-70B(GSM8K 35%→59%) |
| 2024-04 | Cohere Command R+ (104B,RAG 增强) | 老黄第一次明确"知识库首选 Command R+,而非 GPT-4" |
| 2024-04 | NVIDIA Llama3-ChatQA-1.5-8B(论文) | Llama3 上 RAG 专项微调,LM Studio 上有 GGUF |
| 2024-04 | Meta Llama 3 8B / 70B 开源 | 70B 性能超 Claude Sonnet / Mistral Medium |
| 2024-04 | Mixtral 8x22B 开源 | MoE 架构成主流 |
| 2024-05 | OpenAI GPT-4o | 多模态 + 免费 |
| 2024-05 | 阿里 Qwen 1.5-110B / Qwen 2 | 中文开源跻身第一梯队 |
| 2024-06 | Gemini 1.5 Pro 大上下文 | 老黄初次推崇,但还要等 2.0 才成主力 |
| 2024-06 | Claude 3.5 Sonnet + Artifacts | 老黄"下个月不续费 ChatGPT Plus"(2024-07-01) |
| 2024-07 | GPT-4o mini($0.15/M in) | 价格屠夫,让 GraphRAG 跑得动 |
| 2024-07 | Meta Llama 3.1 405B 开源,128K 上下文 | 接近 GPT-4o |
| 2024-08 | 智谱 GLM-4-9B 微调一口气输出 1.1 万字 | 输出长度瓶颈被打破(老黄做了玄幻小说测试) |
| 2024-08 | xAI Grok 2 | 图像生成 + 识别 |
老黄 2024-Q1 至 Q2 主力组合:
- 本地:Mistral / Qwen 1.5-7B(Ollama)
- 嵌入:nomic-embed-text(本地)/ text-embedding-3-large(OpenAI)
- 云端:GPT-4 + Command R+(知识库)
1.2 2024 H2:Cursor 时代 + 多模态突破
| 日期 | 模型 / 事件 | 关键意义 |
|---|---|---|
| 2024-08 | Cursor 出圈 | 零代码做 Chrome 总结插件 10 分钟搞定(2024-08-31) |
| 2024-08 | 阿里 Qwen2-VL-2B / 7B / 72B | 国产多模态可用,理解 20 分钟视频 |
| 2024-09 | DeepSeek V2.5 | 合并 Chat + Coder |
| 2024-09 | OpenAI o1 / o1-mini | 慢思考 / 强化学习生成内部 CoT |
| 2024-09 | Qwen 2.5 / Qwen2.5-Coder / Qwen2.5-Math | 阿里全家桶 |
| 2024-10 | 阿里 Qwen 2.5 Coder 32B | 代码能力接近头部 |
| 2024-10 | NVIDIA Llama-3.1-Nemotron-70B | 击败 GPT-4o,140+ 模型,仅次 o1 |
| 2024-11 | Qwen 2.5 Coder 32B-Instruct | Mac mini M4 集群 18 tok/s(见 §4) |
| 2024-11 | Qwen 2.5-Turbo 1M 上下文 | 国产首个百万级 |
| 2024-11 | Pixtral Large / DeepSeek-R1-Lite | |
| 2024-11 | Thinking-Claude 浏览器插件 | 表演思考,提示词工程上限 |
| 2024-11 | M4 MAX 实测:跑 70B 量化 11 tok/s,35W 功耗 | |
| 2024-12 | Meta Llama 3.3-70B | 性能 = 3.1-405B,成本 1/10 |
| 2024-12 | Microsoft Phi-4 14B | 数学(GPQA / MATH)超 GPT-4o / Qwen 2.5-14B / Llama-3.3-70B |
| 2024-12 | Google Gemini 2.0 | 多模态 + 工具调用 + Agent / 老黄宣布"非常牛逼" |
| 2024-12 | Gemini 2.0 Flash Thinking | 慢思考多模态 |
| 2024-12 | DeepSeek R1 + APP 上线(2025-01-12) | 中文 R1 爆火 |
老黄 2024-Q4 主力切换:
- 主力:Claude 3.5 Sonnet(代码)+ Gemini 2.0(对话/搜索)
- 本地:Qwen 2.5-7B / 14B Q4
- 本地服务器:Mac mini M4(OLLAMA_KEEP_ALIVE=-1,搭配 Enchanted iOS)
1.3 2025 H1:推理模型爆发 + DeepSeek 时刻
| 日期 | 模型 / 事件 | 关键意义 |
|---|---|---|
| 2025-01 | DeepSeek R1 APP 上线 | 国民级 |
| 2025-01 | Microsoft Phi-4(14B) | 见上 |
| 2025-01 | 李开复采访:Scaling Law 在变慢,创业公司做超大模型成功率极低 | 见 §2.1 |
| 2025-01 | UC Berkeley DeepScaleR-1.5B:数学超 o1-preview,4500 美金 A100 | 小模型专项训练范式 |
| 2025-01 | DeepSeek-R1-1.5B 在 iPhone 12 mini 跑(PocketPal) | 端侧时代 |
| 2025-02 | 老黄用 Unsloth GRPO 微调 Qwen2.5 3B | T4 / 1 小时 / 9.9 vs 9.11 测试通过(见 §3) |
| 2025-02 | DeepSeek 满血本地部署成本曝光 | 不便宜,M3 Ultra 双 512G 约 20 tok/s |
| 2025-02 | xAI Grok 3 | 老黄"All in one 趋势,只有模式分,无模型分" |
| 2025-02 | GPT-4.5 | "贵得离谱" |
| 2025-02 | Claude 3.7 Sonnet | AI Coding 第一,Cursor 即时支持 |
| 2025-03 | Tencent Hunyuan / 阿里 QwQ-32B | 推理模型大爆发,QwQ-32B 在 M4 Pro 48G 跑 10 tok/s,强于 DeepSeek-R1 32B |
| 2025-03 | DeepSeek-V3-0324 | 白菜价 + Claude-3.7 十分之一成本近似效果 |
| 2025-03 | Google Gemma 3 27B 单 H100 | 介于 R1 和 V3 之间 |
| 2025-03 | Gemini 2.5 Pro | 老黄"扫代码库 + 文章建议神器,Cursor 订阅太超值" |
| 2025-04 | OpenAI GPT-image-1 API | 图像模型 API 化,Adobe/Figma/HeyGen/Wix 集成 |
| 2025-04 | Gemini 2.5 Flash 混合推理 | 可设 Thinking Budget |
| 2025-05 | Claude 4 Sonnet | 主动用 Sequential Thinking MCP,边做边解释 |
| 2025-05 | Claude 4 Opus(Mac 版 Prompt House) | "效率远超人类程序员" |
1.4 2025 H2:Code Agent 时代 + Kimi K2 崛起
| 日期 | 模型 / 事件 | 关键意义 |
|---|---|---|
| 2025-06 | GitHub Copilot Pro+ Claude 集成 | 老黄主战场切到这里(美国住宅 IP 稳定) |
| 2025-07 | Kimi K2 进 OpenRouter 编程榜第 4 | 国产首次进国际编程 Top 5 |
| 2025-07 | Anthropic Claude Code + Sub-agents | Haiku/Opus 模型分级,见 newtype · AI Coding 实战与工具栈演化 |
| 2025-09 | OpenAI Codex | "Anthropic 买关键词截胡" / 找出 Claude Code 找不到的 Bug |
| 2025-10 | Anthropic Claude Skills | 老黄做 Super Analyst / Super Writer |
| 2025-11 | Kimi K2 Thinking + Claude Code 直连 API | 触发老黄做 newtype AI OS(2025-11-09 帖 1965) |
| 2025-11 | 国产模型 Skills 测试:Kimi K2 > GLM-4.6 > Minimax M2 | Claude Code Router 测试 |
| 2025-11 | Gemini 3 Pro | 老黄"快速 + 思考"二选一,符合产品规划 / Codex 替代 Claude Code |
| 2025-11 | Claude Opus 4.5 | |
| 2025-12 | Gemini Deep Think Ultra 档 $200 | 模型委员会接班 |
| 2025-12 | NotebookLM 升级 Gemini 3 | 老黄宣布"最强知识库应用" |
1.5 2026 Q1:OpenCode 黑卡 + 国产模型实用化
| 日期 | 模型 / 事件 | 关键意义 |
|---|---|---|
| 2026-01 | OpenCode 黑卡 $200 任意模型(秒光) | API 商业新形态 |
| 2026-01 | GPT-5.2 | 老黄三个 Agent 都改 GPT-5.2 |
| 2026-01 | Gemini "Personal Intelligence" | Gmail / Maps / Photos 个性化 |
| 2026-02 | Kimi K2.5(2026-02 OpenRouter 最高用量模型) | OpenClaw 主用 |
| 2026-02 | Minimax M2.5 / GLM-5 / qwen3.5 256G 内存可跑 | 本地化降本 |
| 2026-03 | Perplexity Computer / Personal Computer $200 档 | 投资决策助手 |
| 2026-04 | Claude Opus 4.7(GitHub Copilot Pro+ 促销) | 老黄主力 |
| 2026-04 | DeepSeek V4 推理强 | 余不凡测试感言"专业领域推理出比较专业的答案" |
| 2026-04 | GitHub 暂停 Copilot 注册 | Agent 消耗算力扛不住,先稳老用户 |
| 2026-04 | Claude 要身份验证(护照 + 自拍) | 老黄宣布转 OpenCode |
| 2026-05 | Opus 4.7 / Sonnet 4.6 / Gemini 3.1 Pro Perplexity 模型委员会 | 三家分歧 + 共识分析 |
2. 三个核心辩论
2.1 Scaling Law 是否还成立?
两派观点:
派 A:Scaling Law 在变慢(李开复 2025-01 帖 708)
- 只有大厂能继续做超大模型,创业公司成功概率极低
- AI 应用需要的模型是够小、够快、够便宜、够厉害,不一定最大最通用
- 超大模型如做不到便宜可以不发,作为"老师"内部带小模型
- 2025 AI 加速商业化也加速淘汰
派 B:Scaling Law 依然成立(Cohere CEO Aidan Gomez 2024-10 帖 569)
- Scaling Law 在相当长时期内有效
- 但现实是,大多数公司业务还撑不起 GPT-4 级别的部署成本
- 趋势:通用模型 + 垂直模型并存,先用通用大模型原型 → 跑通了再做垂直微调
老黄判断(2024-08 帖 436):
"底层的通用大模型,哪家好或者便宜就用哪家。上层的垂直小模型,真正投入进去微调、优化,成为护城河。"
2.2 输出长度是真瓶颈(2024-08 帖 466 / 经典)
测试:让 LLM 写 1 万字玄幻小说
| 模型 | 表现 |
|---|---|
| ChatGPT | 摆烂,只给框架 + 第一章,催促就糊弄结尾 |
| Claude | 兢兢业业分章节,每章 3000 字 |
| 微调后 GLM4-9B | 一口气写 1.1 万字(Colab A100) |
老黄观点:
"今天限制大模型性能的,不是上下文长度(128K 已挺够了),而是输出长度。平均 2 千字、最多 3 千字真的不够用。智谱找到了解决办法。"(2024-08-28 帖 468)
2.3 TPU vs GPU(2025-11 帖 2055)
"第 132 期视频,我会科普一下 TPU 和 GPU 的区别。看到很多人在吹 TPU 能替代 GPU,太无知了。"
老黄对 NVDA / NBIS / TSLA 持长线观点,基于此判断买入 H100 / B200 仍有空间。
3. Unsloth + GRPO 微调实操(2025-02 帖 801 / 经典)
3.1 核心实操
对 Qwen2.5 3B 进行 GRPO 微调,显著提升逻辑推理能力。
- 平台:Google Colab T4 / 1 小时搞定
- 显存需求:
- 1.5B 模型 → 7G 显存
- 7B / 14B 模型 → 15G 显存
- 模型上传:自动上传 Hugging Face huangyihe/qwen2.5-r(Q4/Q5/Q8 三个 GGUF)
- 9.9 vs 9.11 测试:原版思维混乱,微调后答对且思路清晰
3.2 数据集格式很重要(2025-02 帖 807)
Unsloth 用 GSM8K 数据集(数学问题 + 详细解题步骤)。质量明显高于普通一问一答。
老黄商业想法:
"Unsloth 这套东西,降低了微调的门槛(小模型只需要 7G 显存),提升了模型的能力。如果有自己的方法论,有对应的案例(比如很多商业类博主),很适合做出对应的数据集拿去微调。产出 3B 的模型文件,给到自己的粉丝/用户,手机上使用(PocketPal)。这个在商业上有很大想象力。"
3.3 何时微调?(2024-09 帖 478)
微调除了能给模型新知识,还能提供新能力:
- Llama 中文能力差 → 微调一个中文版,RAG 解决不了
- Perplexity 团队对开源模型做微调,强化搜索能力
何时不微调:
- 只要知识层面提升,先试 RAG(成本低得多)
- 7B 以下模型对个人来说能力已经够强了,标准化 Markdown 笔记 → RAG 命中率足够
3.4 微调工具横向(2024-09 帖 513)
| 工具 | 特点 |
|---|---|
| Unsloth | 主力推荐,显存低,代码现成 |
| LlamaFactory | 低代码 UI(老黄"看过没用过,微调难点不在代码上") |
| Hugging Face PEFT | 框架级 |
| XTuner / Axolotl | 老外用 |
3.5 Llamafile 设想(2024-04 帖 25 / 2024-08 帖 447)
"也许以后每本新书、每套教材都会标配一个小模型。这个模型根据书籍内容微调过。由于采用 Llamafile 之类的技术,可以一个文件运行,非常方便。"
关键三个门槛:
- 部署门槛(Llamafile 已解决)
- 微调门槛(Unsloth 已解决)
- 数据集准备门槛(未解决,需要每个领域积累)
4. 硬件实测全记录
4.1 关键硬件配置 / 跑分
| 硬件 | 模型 / 测试 | 跑分 | 来源 |
|---|---|---|---|
| 3060 + 16G 内存(老黄 PC) | Qwen 1.5-7B Q4 | 流畅 | 2024-04 帖 50 |
| Macbook Pro 2017 | 跑不动开源模型,只能用 OpenAI API | - | 2024-04 帖 70 |
| Y7000P RTX4060 8G + 32G 内存 | qwen:14b Q4 | 时快时慢 | 2024-05 帖 220 |
| Macbook Pro M3 16M | Ollama 顺利,Docker 芯片不兼容 | 部分功能受限 | 2024-04 帖 127 |
| 自购服务器 32 核 + 256G + 双 3090 | Llama 70B | 跑得动 | 2024-05 帖 147(精华 RAG 帖) |
| M4 MacBook Pro 评测 | 70B 量化 | 11 tok/s,35W 功耗 | 2024-11 帖 596 |
| MacBook Pro M4 Pro 48G + 纳米屏 老黄主力 | QwQ-32B | 10 tok/s | 2025-02 帖 887 / 2025-03 帖 951 |
| MacBook Pro M4 Max 128G Daniel | DeepSeek R1 32B(Ollama) | 10-12 tok/s | 2025-02 帖 791 |
| DeepSeek R1 70B(Ollama) | 6 tok/s | 同上 | |
| 4 台 Mac mini M4 + 1 台 MBP M4 Max 集群(老黄,用 exo) | Qwen 2.5 Coder 32B | 18 tok/s | 2024-11 帖 607 |
| M3 Ultra 双 512G(他人) | DeepSeek 满血 671B | 20 tok/s | 2025-03 帖 943 |
| Mac mini M4 24G(老黄闲鱼 7K) | Qwen 2.5 14B Q4 | 10 tok/s | 2024-12 帖 677 |
| iPhone 12 mini | DeepSeek-R1-1.5B Q4(PocketPal) | "速度还行" | 2025-01-31 帖 768 |
| iPhone 17 Pro | Qwen3-8B Q4(PocketPal) | 12 tok/s | 2025-09 帖 1778 |
| Jetson Nano Super 8G($249,5月上市,老黄下单 2025-02 帖 774) | 小尺寸模型 | 低于 M4 Mac mini 和 3060 | 2025-01 帖 696 |
| GB10 / DGX Spark($3000,128G,NVDA GB10) | - | 1000T FP4,可堆叠 | 2025-05 帖 1211 |
4.2 硬件选购建议(老黄反复说)
- 新手起步:MacBook Pro M4 Max(无脑选)
- 预算 10 万:配工作站,4090 + i7 + 64G
- 重度使用:Mac mini M4 集群(国补价)或租 Colab Pro
- 不接受 macOS:跑 Stable Diffusion 等图像,优先 NVDA 显卡
4.3 关键 Ollama 设置(踩坑结论)
| 设置 | 值 | 作用 |
|---|---|---|
OLLAMA_MODELS |
自定义文件夹 | 不放 C 盘(Win 默认) |
OLLAMA_KEEP_ALIVE |
-1 |
不自动释放,5 分钟也不卸载 |
OLLAMA_HOST |
0.0.0.0 |
监听全局,局域网可访问 |
| 模型精度 | Q4(快)/ Q8(略慢) | 大多数场景 Q4 够用 |
| 上下文长度 | 32K-128K | Qwen 2.5 都 128K 上下文 |
4.4 Ollama 进阶(2025-09 帖 1786 / 2025-08 帖 1595)
- Ollama 客户端 + 内置联网搜索(2025-08)
- Ollama Turbo $20/月 云服务器跑大模型(2025-08)
- Ollama Cloud(2025-09)支持 deepseek-v3 / gpt-oss 等
- Hugging Face 模型直调(2024-10 帖 544)
5. 模型路由 / 多模型委员会
5.1 n8n Model Selector(2026-02 帖 1604 / 经典)
简单的搜索工作流:
- gpt-4.1-mini 做判断:简单请求输出"1",复杂(需要 Deep Research)输出"2"
- Model Selector 连两个 Perplexity 模型:sonar / sonar-deep-research
- AI Agent 根据规则路由
"这套东西已经很接近我想要的'智能模型路由'了。"
5.2 多 Agent 各配模型(老黄当前)
newtype OS / OpenCode 配置:
- Chief(Opus 4.7)— 统筹,最贵
- Deputy(Sonnet 4.5)— 派活儿
- Researcher(Gemini 2.5 Pro)— 大上下文 100 万 token
- Archivist(Haiku 4.5)— 记忆,便宜
- Writer / Editor(Sonnet 4.5)— 中性能
5.3 Perplexity 模型委员会(2026-03 帖 2560)
"Perplexity 这个'模型委员会'功能有点意思。它会派三个模型(Opus 4.6、GPT-5.4、Gemini 3.1 Pro,都开 Thinking)各自去调研,然后得出结论,看看都有哪些分歧和共识。"
5.4 Cherry Studio @ 多模型并行(2025-07 帖 1528)
@按钮添加多个模型,平行输出。适合对比同一问题的不同视角。
6. 当前(2026-05)推荐配方
6.1 普通用户(无开发需求)
- Gemini Pro(Google One $20)— 主力,GBP/Maps/Photos 个性化
- Grok 3 / 4.2(Twitter 蓝 V)— X 数据独占 + 直率风格
- 知识库 → NotebookLM(同包含)
- 网络:必须有美国住宅静态 IP
6.2 创作者(写作 + 内容)
- GitHub Copilot Pro+ $39(老黄主力)
- Claude Opus 4.7 / Sonnet 4.5
- Gemini 2.5 Pro
- OpenRouter API 备份(美国信用卡注册,绕过 Anthropic 直购)
- 客户端:newtype OS / Codex / OpenCode
6.3 严肃情报 / 投资
- Perplexity Max $200(Computer 等高级功能)
- Gemini Ultra $200(Deep Think)
- 跨模型校验:模型委员会(三家分歧 + 共识)
6.4 本地实验(数据隐私优先)
- Ollama / LM Studio 双装
- 模型组合:Qwen 2.5-14B Q4(中文)+ Gemma 3 27B(英文)
- 嵌入:nomic-embed-text(本地)/ text-embedding-3-large(OpenAI)
- 硬件门槛:Mac mini M4 24G 起,理想 MacBook Pro M4 Max 128G
6.5 微调(垂直场景)
- Unsloth + Google Colab Pro($10/月)
- 数据集格式:GSM8K 风(问题 + 解题步骤 + 答案)
- 模型选择:Qwen 2.5-1.5B / 3B(显存友好)
- 上传 Hugging Face → 用户 PocketPal 下载(手机跑)
7. 反直觉发现 / 不动锚
7.1 模型评测榜单 vs 真实使用
老黄反复说:亲手试一遍才知道哪个最适合。榜单可以参考但不能盲信。
举例:
- Qwen2 + nomic 在 GraphRAG 检索不出来,GPT-4o 成功(2024-08 帖 442)
- glm-4.6 跑 Skills 时不按 SOP,K2 严守(2025-11 帖 1940)
- Gemini 2.0 评测好,但实际写知识总结很平淡 → 老黄改用 Grok(2026-03 帖 2545)
7.2 厉害模型很多,目前没一家通杀
老黄 2025-01 帖 765 总结:
"厉害的模型很多,但是目前还没有哪一个能达到通杀的程度。所以一定得自己亲自上手,才知道哪一个最适合自己。"
7.3 模型 vs AI 应用是两回事
"GPT-4o 是模型,ChatGPT 是 AI 应用。这四款模型对应的官方应用有很多不同。"(2025-01 帖 766)
NotebookLM 是"严格模式 Gemini",Drive Gemini 是"宽容模式",Gemini APP 是"通用 + 联网 + 脑补"。同样模型,产品调教完全不同。
7.4 RAG 是"开卷考",微调是"上补习班"(2024-04 帖 85 / 经典比喻)
"微调就是上补习班,学完了都是自己的,内化了。而知识库就是买了一堆资料,每次要用的时候都去翻一下,并没有学进去、成为自己的东西。"
7.5 Pro Plan 实际成本(老黄 2025-07 帖 1718)
"Claude Code 最多两天就能回本。我目前是 100 美金档位,Plan Mode 使用 Opus 分析,经常让它 ULTRA THINK。一天用满两到三个 Session,挺划算的。"
按 OpenRouter API 价格算的话,日消耗 100 美金不是新鲜事(2025-07 帖 1543 老黄"上午两小时就用了 100 美金")。所以 Anthropic / OpenAI / Google 的订阅是巨亏抢市场。
7.6 模型订阅商业模型不可持续(2025-08 帖 1516)
"Claude 模型现在就是硬通货。谁提供更多的模型额度,谁的产品就会火(Kiro)。谁扛不住成本开始收缩,谁就要走下坡路(Cursor)。"
→ 后来 Cursor 真的撑不住,老黄 2025-07 退订转 Claude Code。再后来 Claude 封号 4 次,转 Codex / OpenCode。
7.7 模型能力推到顶后,数据是壁垒
"底层的通用大模型,哪家好或便宜就用哪家。上层的垂直小模型,真正投入进去微调、优化,成为护城河。"(2024-08 帖 436)
→ 验证:老黄做 newtype Profile 的真正壁垒是 Skills + Prompts 库 + 内容生产 SOP,而非模型本身。
8. 容易踩的坑
8.1 Ollama 在 Win 默认 C 盘下载模型
设 OLLAMA_MODELS 环境变量。
8.2 Llama 系列中文不行
换 Qwen 系列。
8.3 Ollama 加载 GGUF 才行(.bin 不行)
ModelScope 下来的 .bin 模型 Ollama 用不了。
8.4 LM Studio 模型文件需要两层文件夹
Hugging Face 下完模型,需要按 LM Studio 规则建两层文件夹,不能直接放。
8.5 GraphRAG 嵌入模型用本地经常报错
本地大模型(qwen2 + nomic)跑创建索引步骤可以,但嵌入环节常报错,需要魔改 openai_embeddings_llm.py(2024-07 帖 398)。
8.6 Cline 用 ollama 本地代码慢且差
3.5 Sonnet API 才是 cline 的搭档,本地小模型代码能力跟不上(2024-11 帖 593)。
8.7 PDF / PPT / Excel 进知识库
- PDF → 先转 Markdown(Marker / MinerU / markitdown)
- PPT → 先抽取所有文字成 md
- Excel → 别想了,目前 RAG 处理表格能力都差
8.8 同样问题,中文搜索 vs 英文搜索结果天差地别
老黄 2024-12 帖 693 Prompt:
Always reply in Chinese. Prefers English sources for online searches,
with Chinese sources as a last option. Always search the web for English
pages, even if questions are in Chinese. Translate questions to English
before searching.
9. 关联 wiki
- newtype 知识系统与 Life OS 全演化 — 知识系统全演化(本 wiki 的工具侧重)
- newtype · AI 工具栈实战与演化 — 工具栈演化(Ollama / LM Studio / AnythingLLM)
- newtype · AI Coding 实战与工具栈演化 — Cursor → Claude Code → Codex 全链路
- newtype · Agent 架构与多 Agent 编排 — More Agents Is All You Need 论文的实践延伸
- newtype · MCP 协议与生态实战 — Ollama Cloud / OpenRouter / Codex 上 Skills 的 MCP 生态
- newtype · RAG 实战与知识库演化 — RAG / GraphRAG / 嵌入模型选型
Wiki 来源:newtype 知识星球 2024-03 至 2026-05 主题帖 505 条,全量扫描,无抽样。重叠于 newtype 知识系统与 Life OS 全演化 的工具侧重和 newtype · AI 工具栈实战与演化 的时间线,本 wiki 专注模型评测、微调实操和硬件实测三个维度。