← Knowledge Notes
AI Engineering / Knowledge note · Chinese

newtype 模型评测、微调与硬件演化

黄益贺 2024-03 → 2026-05 模型评测/微调/硬件实测全演化。505 帖,涵盖 GPT/Claude/Gemini/Grok/DeepSeek/Qwen/Llama/Kimi/GLM/Minimax 演化、Mac 集群跑分、Unsloth GRPO 微调、Scaling Law 辩论、输出长度瓶颈、TPU vs GPU、底层通用+上层垂直微调战略、模型路由、模型委员会。

Source collection:Newtype · Published here:2026-09-26

模型评测模型微调AI 硬件

505 帖,2024-03 至 2026-05。从单卡 3060 跑 7B,到 4 台 Mac mini M4 集群跑 Qwen 2.5 Coder 32B(18 tok/s)、M3 Ultra 双 512G 跑 DeepSeek 满血(20 tok/s),到 2026 OpenCode 黑卡 $200 用任何模型。

一句话:模型不再是稀缺品,稀缺的是"工程化集成它们的能力"。


0. 阅读路线

  • 想了解 2024-2026 模型演化时间线 → §1
  • 想做微调 → §3(Unsloth + GRPO 实操)
  • 想知道硬件选哪个 → §4(Mac mini / 3060 / Jetson / M4 Max)
  • 想理解 Scaling Law 之争 → §2.1
  • 想做模型路由 / 多模型委员会 → §5
  • 想了解输出长度瓶颈 → §2.2
  • 工具配方推荐 → §6

1. 模型演化时间线 / 关键拐点

1.1 2024 H1:模型百花齐放,本地革命

核心事件:

日期 模型 / 事件 关键意义
2024-03 Tencent 论文《More Agents Is All You Need》 数量补能力 / Llama2-13B × 15 票投打过 Llama2-70B(GSM8K 35%→59%)
2024-04 Cohere Command R+ (104B,RAG 增强) 老黄第一次明确"知识库首选 Command R+,而非 GPT-4"
2024-04 NVIDIA Llama3-ChatQA-1.5-8B(论文) Llama3 上 RAG 专项微调,LM Studio 上有 GGUF
2024-04 Meta Llama 3 8B / 70B 开源 70B 性能超 Claude Sonnet / Mistral Medium
2024-04 Mixtral 8x22B 开源 MoE 架构成主流
2024-05 OpenAI GPT-4o 多模态 + 免费
2024-05 阿里 Qwen 1.5-110B / Qwen 2 中文开源跻身第一梯队
2024-06 Gemini 1.5 Pro 大上下文 老黄初次推崇,但还要等 2.0 才成主力
2024-06 Claude 3.5 Sonnet + Artifacts 老黄"下个月不续费 ChatGPT Plus"(2024-07-01)
2024-07 GPT-4o mini($0.15/M in) 价格屠夫,让 GraphRAG 跑得动
2024-07 Meta Llama 3.1 405B 开源,128K 上下文 接近 GPT-4o
2024-08 智谱 GLM-4-9B 微调一口气输出 1.1 万字 输出长度瓶颈被打破(老黄做了玄幻小说测试)
2024-08 xAI Grok 2 图像生成 + 识别

老黄 2024-Q1 至 Q2 主力组合:

  • 本地:Mistral / Qwen 1.5-7B(Ollama)
  • 嵌入:nomic-embed-text(本地)/ text-embedding-3-large(OpenAI)
  • 云端:GPT-4 + Command R+(知识库)

1.2 2024 H2:Cursor 时代 + 多模态突破

日期 模型 / 事件 关键意义
2024-08 Cursor 出圈 零代码做 Chrome 总结插件 10 分钟搞定(2024-08-31)
2024-08 阿里 Qwen2-VL-2B / 7B / 72B 国产多模态可用,理解 20 分钟视频
2024-09 DeepSeek V2.5 合并 Chat + Coder
2024-09 OpenAI o1 / o1-mini 慢思考 / 强化学习生成内部 CoT
2024-09 Qwen 2.5 / Qwen2.5-Coder / Qwen2.5-Math 阿里全家桶
2024-10 阿里 Qwen 2.5 Coder 32B 代码能力接近头部
2024-10 NVIDIA Llama-3.1-Nemotron-70B 击败 GPT-4o,140+ 模型,仅次 o1
2024-11 Qwen 2.5 Coder 32B-Instruct Mac mini M4 集群 18 tok/s(见 §4)
2024-11 Qwen 2.5-Turbo 1M 上下文 国产首个百万级
2024-11 Pixtral Large / DeepSeek-R1-Lite
2024-11 Thinking-Claude 浏览器插件 表演思考,提示词工程上限
2024-11 M4 MAX 实测:跑 70B 量化 11 tok/s,35W 功耗
2024-12 Meta Llama 3.3-70B 性能 = 3.1-405B,成本 1/10
2024-12 Microsoft Phi-4 14B 数学(GPQA / MATH)超 GPT-4o / Qwen 2.5-14B / Llama-3.3-70B
2024-12 Google Gemini 2.0 多模态 + 工具调用 + Agent / 老黄宣布"非常牛逼"
2024-12 Gemini 2.0 Flash Thinking 慢思考多模态
2024-12 DeepSeek R1 + APP 上线(2025-01-12) 中文 R1 爆火

老黄 2024-Q4 主力切换:

  • 主力:Claude 3.5 Sonnet(代码)+ Gemini 2.0(对话/搜索)
  • 本地:Qwen 2.5-7B / 14B Q4
  • 本地服务器:Mac mini M4(OLLAMA_KEEP_ALIVE=-1,搭配 Enchanted iOS)

1.3 2025 H1:推理模型爆发 + DeepSeek 时刻

日期 模型 / 事件 关键意义
2025-01 DeepSeek R1 APP 上线 国民级
2025-01 Microsoft Phi-4(14B) 见上
2025-01 李开复采访:Scaling Law 在变慢,创业公司做超大模型成功率极低 见 §2.1
2025-01 UC Berkeley DeepScaleR-1.5B:数学超 o1-preview,4500 美金 A100 小模型专项训练范式
2025-01 DeepSeek-R1-1.5B 在 iPhone 12 mini 跑(PocketPal) 端侧时代
2025-02 老黄用 Unsloth GRPO 微调 Qwen2.5 3B T4 / 1 小时 / 9.9 vs 9.11 测试通过(见 §3)
2025-02 DeepSeek 满血本地部署成本曝光 不便宜,M3 Ultra 双 512G 约 20 tok/s
2025-02 xAI Grok 3 老黄"All in one 趋势,只有模式分,无模型分"
2025-02 GPT-4.5 "贵得离谱"
2025-02 Claude 3.7 Sonnet AI Coding 第一,Cursor 即时支持
2025-03 Tencent Hunyuan / 阿里 QwQ-32B 推理模型大爆发,QwQ-32B 在 M4 Pro 48G 跑 10 tok/s,强于 DeepSeek-R1 32B
2025-03 DeepSeek-V3-0324 白菜价 + Claude-3.7 十分之一成本近似效果
2025-03 Google Gemma 3 27B 单 H100 介于 R1 和 V3 之间
2025-03 Gemini 2.5 Pro 老黄"扫代码库 + 文章建议神器,Cursor 订阅太超值"
2025-04 OpenAI GPT-image-1 API 图像模型 API 化,Adobe/Figma/HeyGen/Wix 集成
2025-04 Gemini 2.5 Flash 混合推理 可设 Thinking Budget
2025-05 Claude 4 Sonnet 主动用 Sequential Thinking MCP,边做边解释
2025-05 Claude 4 Opus(Mac 版 Prompt House) "效率远超人类程序员"

1.4 2025 H2:Code Agent 时代 + Kimi K2 崛起

日期 模型 / 事件 关键意义
2025-06 GitHub Copilot Pro+ Claude 集成 老黄主战场切到这里(美国住宅 IP 稳定)
2025-07 Kimi K2 进 OpenRouter 编程榜第 4 国产首次进国际编程 Top 5
2025-07 Anthropic Claude Code + Sub-agents Haiku/Opus 模型分级,见 newtype · AI Coding 实战与工具栈演化
2025-09 OpenAI Codex "Anthropic 买关键词截胡" / 找出 Claude Code 找不到的 Bug
2025-10 Anthropic Claude Skills 老黄做 Super Analyst / Super Writer
2025-11 Kimi K2 Thinking + Claude Code 直连 API 触发老黄做 newtype AI OS(2025-11-09 帖 1965)
2025-11 国产模型 Skills 测试:Kimi K2 > GLM-4.6 > Minimax M2 Claude Code Router 测试
2025-11 Gemini 3 Pro 老黄"快速 + 思考"二选一,符合产品规划 / Codex 替代 Claude Code
2025-11 Claude Opus 4.5
2025-12 Gemini Deep Think Ultra 档 $200 模型委员会接班
2025-12 NotebookLM 升级 Gemini 3 老黄宣布"最强知识库应用"

1.5 2026 Q1:OpenCode 黑卡 + 国产模型实用化

日期 模型 / 事件 关键意义
2026-01 OpenCode 黑卡 $200 任意模型(秒光) API 商业新形态
2026-01 GPT-5.2 老黄三个 Agent 都改 GPT-5.2
2026-01 Gemini "Personal Intelligence" Gmail / Maps / Photos 个性化
2026-02 Kimi K2.5(2026-02 OpenRouter 最高用量模型) OpenClaw 主用
2026-02 Minimax M2.5 / GLM-5 / qwen3.5 256G 内存可跑 本地化降本
2026-03 Perplexity Computer / Personal Computer $200 档 投资决策助手
2026-04 Claude Opus 4.7(GitHub Copilot Pro+ 促销) 老黄主力
2026-04 DeepSeek V4 推理强 余不凡测试感言"专业领域推理出比较专业的答案"
2026-04 GitHub 暂停 Copilot 注册 Agent 消耗算力扛不住,先稳老用户
2026-04 Claude 要身份验证(护照 + 自拍) 老黄宣布转 OpenCode
2026-05 Opus 4.7 / Sonnet 4.6 / Gemini 3.1 Pro Perplexity 模型委员会 三家分歧 + 共识分析

2. 三个核心辩论

2.1 Scaling Law 是否还成立?

两派观点:

派 A:Scaling Law 在变慢(李开复 2025-01 帖 708)

  • 只有大厂能继续做超大模型,创业公司成功概率极低
  • AI 应用需要的模型是够小、够快、够便宜、够厉害,不一定最大最通用
  • 超大模型如做不到便宜可以不发,作为"老师"内部带小模型
  • 2025 AI 加速商业化也加速淘汰

派 B:Scaling Law 依然成立(Cohere CEO Aidan Gomez 2024-10 帖 569)

  • Scaling Law 在相当长时期内有效
  • 但现实是,大多数公司业务还撑不起 GPT-4 级别的部署成本
  • 趋势:通用模型 + 垂直模型并存,先用通用大模型原型 → 跑通了再做垂直微调

老黄判断(2024-08 帖 436):

"底层的通用大模型,哪家好或者便宜就用哪家。上层的垂直小模型,真正投入进去微调、优化,成为护城河。"

2.2 输出长度是真瓶颈(2024-08 帖 466 / 经典)

测试:让 LLM 写 1 万字玄幻小说

模型 表现
ChatGPT 摆烂,只给框架 + 第一章,催促就糊弄结尾
Claude 兢兢业业分章节,每章 3000 字
微调后 GLM4-9B 一口气写 1.1 万字(Colab A100)

老黄观点:

"今天限制大模型性能的,不是上下文长度(128K 已挺够了),而是输出长度。平均 2 千字、最多 3 千字真的不够用。智谱找到了解决办法。"(2024-08-28 帖 468)

2.3 TPU vs GPU(2025-11 帖 2055)

"第 132 期视频,我会科普一下 TPU 和 GPU 的区别。看到很多人在吹 TPU 能替代 GPU,太无知了。"

老黄对 NVDA / NBIS / TSLA 持长线观点,基于此判断买入 H100 / B200 仍有空间。


3. Unsloth + GRPO 微调实操(2025-02 帖 801 / 经典)

3.1 核心实操

对 Qwen2.5 3B 进行 GRPO 微调,显著提升逻辑推理能力。

  • 平台:Google Colab T4 / 1 小时搞定
  • 显存需求:
    • 1.5B 模型 → 7G 显存
    • 7B / 14B 模型 → 15G 显存
  • 模型上传:自动上传 Hugging Face huangyihe/qwen2.5-r(Q4/Q5/Q8 三个 GGUF)
  • 9.9 vs 9.11 测试:原版思维混乱,微调后答对且思路清晰

3.2 数据集格式很重要(2025-02 帖 807)

Unsloth 用 GSM8K 数据集(数学问题 + 详细解题步骤)。质量明显高于普通一问一答。

老黄商业想法:

"Unsloth 这套东西,降低了微调的门槛(小模型只需要 7G 显存),提升了模型的能力。如果有自己的方法论,有对应的案例(比如很多商业类博主),很适合做出对应的数据集拿去微调。产出 3B 的模型文件,给到自己的粉丝/用户,手机上使用(PocketPal)。这个在商业上有很大想象力。"

3.3 何时微调?(2024-09 帖 478)

微调除了能给模型新知识,还能提供新能力:

  • Llama 中文能力差 → 微调一个中文版,RAG 解决不了
  • Perplexity 团队对开源模型做微调,强化搜索能力

何时不微调:

  • 只要知识层面提升,先试 RAG(成本低得多)
  • 7B 以下模型对个人来说能力已经够强了,标准化 Markdown 笔记 → RAG 命中率足够

3.4 微调工具横向(2024-09 帖 513)

工具 特点
Unsloth 主力推荐,显存低,代码现成
LlamaFactory 低代码 UI(老黄"看过没用过,微调难点不在代码上")
Hugging Face PEFT 框架级
XTuner / Axolotl 老外用

3.5 Llamafile 设想(2024-04 帖 25 / 2024-08 帖 447)

"也许以后每本新书、每套教材都会标配一个小模型。这个模型根据书籍内容微调过。由于采用 Llamafile 之类的技术,可以一个文件运行,非常方便。"

关键三个门槛:

  1. 部署门槛(Llamafile 已解决)
  2. 微调门槛(Unsloth 已解决)
  3. 数据集准备门槛(未解决,需要每个领域积累)

4. 硬件实测全记录

4.1 关键硬件配置 / 跑分

硬件 模型 / 测试 跑分 来源
3060 + 16G 内存(老黄 PC) Qwen 1.5-7B Q4 流畅 2024-04 帖 50
Macbook Pro 2017 跑不动开源模型,只能用 OpenAI API - 2024-04 帖 70
Y7000P RTX4060 8G + 32G 内存 qwen:14b Q4 时快时慢 2024-05 帖 220
Macbook Pro M3 16M Ollama 顺利,Docker 芯片不兼容 部分功能受限 2024-04 帖 127
自购服务器 32 核 + 256G + 双 3090 Llama 70B 跑得动 2024-05 帖 147(精华 RAG 帖)
M4 MacBook Pro 评测 70B 量化 11 tok/s,35W 功耗 2024-11 帖 596
MacBook Pro M4 Pro 48G + 纳米屏 老黄主力 QwQ-32B 10 tok/s 2025-02 帖 887 / 2025-03 帖 951
MacBook Pro M4 Max 128G Daniel DeepSeek R1 32B(Ollama) 10-12 tok/s 2025-02 帖 791
DeepSeek R1 70B(Ollama) 6 tok/s 同上
4 台 Mac mini M4 + 1 台 MBP M4 Max 集群(老黄,用 exo) Qwen 2.5 Coder 32B 18 tok/s 2024-11 帖 607
M3 Ultra 双 512G(他人) DeepSeek 满血 671B 20 tok/s 2025-03 帖 943
Mac mini M4 24G(老黄闲鱼 7K) Qwen 2.5 14B Q4 10 tok/s 2024-12 帖 677
iPhone 12 mini DeepSeek-R1-1.5B Q4(PocketPal) "速度还行" 2025-01-31 帖 768
iPhone 17 Pro Qwen3-8B Q4(PocketPal) 12 tok/s 2025-09 帖 1778
Jetson Nano Super 8G($249,5月上市,老黄下单 2025-02 帖 774) 小尺寸模型 低于 M4 Mac mini 和 3060 2025-01 帖 696
GB10 / DGX Spark($3000,128G,NVDA GB10) - 1000T FP4,可堆叠 2025-05 帖 1211

4.2 硬件选购建议(老黄反复说)

  • 新手起步:MacBook Pro M4 Max(无脑选)
  • 预算 10 万:配工作站,4090 + i7 + 64G
  • 重度使用:Mac mini M4 集群(国补价)或租 Colab Pro
  • 不接受 macOS:跑 Stable Diffusion 等图像,优先 NVDA 显卡

4.3 关键 Ollama 设置(踩坑结论)

设置 值 作用
OLLAMA_MODELS 自定义文件夹 不放 C 盘(Win 默认)
OLLAMA_KEEP_ALIVE -1 不自动释放,5 分钟也不卸载
OLLAMA_HOST 0.0.0.0 监听全局,局域网可访问
模型精度 Q4(快)/ Q8(略慢) 大多数场景 Q4 够用
上下文长度 32K-128K Qwen 2.5 都 128K 上下文

4.4 Ollama 进阶(2025-09 帖 1786 / 2025-08 帖 1595)

  • Ollama 客户端 + 内置联网搜索(2025-08)
  • Ollama Turbo $20/月 云服务器跑大模型(2025-08)
  • Ollama Cloud(2025-09)支持 deepseek-v3 / gpt-oss 等
  • Hugging Face 模型直调(2024-10 帖 544)

5. 模型路由 / 多模型委员会

5.1 n8n Model Selector(2026-02 帖 1604 / 经典)

简单的搜索工作流:

  1. gpt-4.1-mini 做判断:简单请求输出"1",复杂(需要 Deep Research)输出"2"
  2. Model Selector 连两个 Perplexity 模型:sonar / sonar-deep-research
  3. AI Agent 根据规则路由

"这套东西已经很接近我想要的'智能模型路由'了。"

5.2 多 Agent 各配模型(老黄当前)

newtype OS / OpenCode 配置:

  • Chief(Opus 4.7)— 统筹,最贵
  • Deputy(Sonnet 4.5)— 派活儿
  • Researcher(Gemini 2.5 Pro)— 大上下文 100 万 token
  • Archivist(Haiku 4.5)— 记忆,便宜
  • Writer / Editor(Sonnet 4.5)— 中性能

5.3 Perplexity 模型委员会(2026-03 帖 2560)

"Perplexity 这个'模型委员会'功能有点意思。它会派三个模型(Opus 4.6、GPT-5.4、Gemini 3.1 Pro,都开 Thinking)各自去调研,然后得出结论,看看都有哪些分歧和共识。"

5.4 Cherry Studio @ 多模型并行(2025-07 帖 1528)

@按钮添加多个模型,平行输出。适合对比同一问题的不同视角。


6. 当前(2026-05)推荐配方

6.1 普通用户(无开发需求)

  • Gemini Pro(Google One $20)— 主力,GBP/Maps/Photos 个性化
  • Grok 3 / 4.2(Twitter 蓝 V)— X 数据独占 + 直率风格
  • 知识库 → NotebookLM(同包含)
  • 网络:必须有美国住宅静态 IP

6.2 创作者(写作 + 内容)

  • GitHub Copilot Pro+ $39(老黄主力)
    • Claude Opus 4.7 / Sonnet 4.5
    • Gemini 2.5 Pro
  • OpenRouter API 备份(美国信用卡注册,绕过 Anthropic 直购)
  • 客户端:newtype OS / Codex / OpenCode

6.3 严肃情报 / 投资

  • Perplexity Max $200(Computer 等高级功能)
  • Gemini Ultra $200(Deep Think)
  • 跨模型校验:模型委员会(三家分歧 + 共识)

6.4 本地实验(数据隐私优先)

  • Ollama / LM Studio 双装
  • 模型组合:Qwen 2.5-14B Q4(中文)+ Gemma 3 27B(英文)
  • 嵌入:nomic-embed-text(本地)/ text-embedding-3-large(OpenAI)
  • 硬件门槛:Mac mini M4 24G 起,理想 MacBook Pro M4 Max 128G

6.5 微调(垂直场景)

  • Unsloth + Google Colab Pro($10/月)
  • 数据集格式:GSM8K 风(问题 + 解题步骤 + 答案)
  • 模型选择:Qwen 2.5-1.5B / 3B(显存友好)
  • 上传 Hugging Face → 用户 PocketPal 下载(手机跑)

7. 反直觉发现 / 不动锚

7.1 模型评测榜单 vs 真实使用

老黄反复说:亲手试一遍才知道哪个最适合。榜单可以参考但不能盲信。

举例:

  • Qwen2 + nomic 在 GraphRAG 检索不出来,GPT-4o 成功(2024-08 帖 442)
  • glm-4.6 跑 Skills 时不按 SOP,K2 严守(2025-11 帖 1940)
  • Gemini 2.0 评测好,但实际写知识总结很平淡 → 老黄改用 Grok(2026-03 帖 2545)

7.2 厉害模型很多,目前没一家通杀

老黄 2025-01 帖 765 总结:

"厉害的模型很多,但是目前还没有哪一个能达到通杀的程度。所以一定得自己亲自上手,才知道哪一个最适合自己。"

7.3 模型 vs AI 应用是两回事

"GPT-4o 是模型,ChatGPT 是 AI 应用。这四款模型对应的官方应用有很多不同。"(2025-01 帖 766)

NotebookLM 是"严格模式 Gemini",Drive Gemini 是"宽容模式",Gemini APP 是"通用 + 联网 + 脑补"。同样模型,产品调教完全不同。

7.4 RAG 是"开卷考",微调是"上补习班"(2024-04 帖 85 / 经典比喻)

"微调就是上补习班,学完了都是自己的,内化了。而知识库就是买了一堆资料,每次要用的时候都去翻一下,并没有学进去、成为自己的东西。"

7.5 Pro Plan 实际成本(老黄 2025-07 帖 1718)

"Claude Code 最多两天就能回本。我目前是 100 美金档位,Plan Mode 使用 Opus 分析,经常让它 ULTRA THINK。一天用满两到三个 Session,挺划算的。"

按 OpenRouter API 价格算的话,日消耗 100 美金不是新鲜事(2025-07 帖 1543 老黄"上午两小时就用了 100 美金")。所以 Anthropic / OpenAI / Google 的订阅是巨亏抢市场。

7.6 模型订阅商业模型不可持续(2025-08 帖 1516)

"Claude 模型现在就是硬通货。谁提供更多的模型额度,谁的产品就会火(Kiro)。谁扛不住成本开始收缩,谁就要走下坡路(Cursor)。"

→ 后来 Cursor 真的撑不住,老黄 2025-07 退订转 Claude Code。再后来 Claude 封号 4 次,转 Codex / OpenCode。

7.7 模型能力推到顶后,数据是壁垒

"底层的通用大模型,哪家好或便宜就用哪家。上层的垂直小模型,真正投入进去微调、优化,成为护城河。"(2024-08 帖 436)

→ 验证:老黄做 newtype Profile 的真正壁垒是 Skills + Prompts 库 + 内容生产 SOP,而非模型本身。


8. 容易踩的坑

8.1 Ollama 在 Win 默认 C 盘下载模型

设 OLLAMA_MODELS 环境变量。

8.2 Llama 系列中文不行

换 Qwen 系列。

8.3 Ollama 加载 GGUF 才行(.bin 不行)

ModelScope 下来的 .bin 模型 Ollama 用不了。

8.4 LM Studio 模型文件需要两层文件夹

Hugging Face 下完模型,需要按 LM Studio 规则建两层文件夹,不能直接放。

8.5 GraphRAG 嵌入模型用本地经常报错

本地大模型(qwen2 + nomic)跑创建索引步骤可以,但嵌入环节常报错,需要魔改 openai_embeddings_llm.py(2024-07 帖 398)。

8.6 Cline 用 ollama 本地代码慢且差

3.5 Sonnet API 才是 cline 的搭档,本地小模型代码能力跟不上(2024-11 帖 593)。

8.7 PDF / PPT / Excel 进知识库

  • PDF → 先转 Markdown(Marker / MinerU / markitdown)
  • PPT → 先抽取所有文字成 md
  • Excel → 别想了,目前 RAG 处理表格能力都差

8.8 同样问题,中文搜索 vs 英文搜索结果天差地别

老黄 2024-12 帖 693 Prompt:

Always reply in Chinese. Prefers English sources for online searches, 
with Chinese sources as a last option. Always search the web for English 
pages, even if questions are in Chinese. Translate questions to English 
before searching.

9. 关联 wiki


Wiki 来源:newtype 知识星球 2024-03 至 2026-05 主题帖 505 条,全量扫描,无抽样。重叠于 newtype 知识系统与 Life OS 全演化 的工具侧重和 newtype · AI 工具栈实战与演化 的时间线,本 wiki 专注模型评测、微调实操和硬件实测三个维度。