同一台 mac sudio 上用 mlx 跑的俩模型,在 mac mini 上用 dsh 评估。35b moe 还是太神了
---
# Qwen3.6-35b vs Qwen3.8-27B-4bit 全方位对比
**测试环境**:本地 oMLX(192.168.0.5:9870),真实 localai 模板(工具提示词/评分准则/审计模板),enable_thinking 关闭,共 **19 个用例 + 3 组补充测试**,两个模型同一 prompt 各跑一遍。
## 一、性能(决定性差异)
| 指标 | 35b | 3.8 | 结论 |
|---|---|---|---|
| 19 用例平均延迟 | **1.35s** | 3.47s | 35b 快 **2.5x** |
| 审计重任务(546 token 输入) | 4.8~5.7s | 10.6~14.1s | 35b 快 **2.5~3x** |
| 全程最慢单次 | 5.96s | 13.23s | 35b 无一次比 3.8 慢 |
prompt 缓存两个模型都没命中(cached_tokens=0),无缓存红利差异——**3.8 的慢是纯生成速度问题**(27B-4bit 在本机 oMLX 上内核效率不如 35b)。
## 二、功能质量
| 维度 | 35b | 3.8 | 胜负 |
|---|---|---|---|
| 中文对话(4 例) | 幽默更出彩("薛定谔的结论") | 比喻更生活化(餐馆点菜) | 平手~35b 微胜 |
| JSON 微调用(4 例) | 全过,字段正确 | 全过,字段正确 | **平手** |
| 评分(2 例) | S 级识别准确 | S 级识别准确 | **平手** |
| 全量审计 | memory 密度高、低价值句丢得干净 | critical 更贴近原文、memory 偏简 | 平手~35b 微胜 |
| 推理/代码(3 例) | 全对(斐波那契+复杂度/数学/找规律) | 全对 | **平手** |
| 指令遵循 | 完美 3 行格式 | 完美 3 行格式 | **平手** |
| 压缩记忆使用(3 例) | 正确取用 critical/memory | 正确取用 | **平手** |
## 三、工具回路(唯一的实质质量差异)
| 用例 | 35b | 3.8 |
|---|---|---|
| 列目录 | `/fs ls .` ✓ | `/fs ls .` ✓ |
| 读文件 | `/fs cat src/
main.rs` ✓ | `/fs cat src/
main.rs` ✓ |
| 当前目录 | **`/fs pwd` ✗(无效命令,正确是 `/pwd`)** | 直接回答(系统环境里有 cwd,合理) |
| 看插件 | **`/fs ls plugins/ 2>/dev/null \|\| ... \|\| /fs find ...` ✗ 编造不存在的 `/fs find` + shell 语法** | `/fs ls .` ✓ 干净 |
**35b 的 CLI/shell 知识更广,但会"超纲编命令"**;3.8 严格守工具词表。不过 35b 的错误在工具回路里是**可恢复的**(无效命令会返回 usage 文案,模型下一轮会纠正),代价只是多一轮调用(~1-2s)。
## 四、结论:推荐 **35b 继续做 default**
| 决策权重 | 理由 |
|---|---|
| **速度(最关键)** | 本地壳的体验核心就是响应快。2.5~3x 差距是决定性的,且无法靠提示词弥补 |
| 工具纪律(35b 短板) | **可修复**:base prompt 加一句"只能使用系统列出的命令,禁止发明子命令(如 /fs find)"即可;3.8 的优势代价是慢 2.5 倍 |
| 其余维度 | 全部平手,不构成翻盘理由 |
**给 35b 的补丁建议**(如果你采纳,我可以顺手加到 `CHAT_SYSTEM`):
> "工具命令只允许使用系统列出的:fs ls/cat/write/edit/stat/log 、run 、pwd 、mode 。禁止发明不存在的子命令或混入 shell 语法(`2>/dev/null`、`||`、管道等)。"
**备选方案**:如果你想留 3.8 做某些场景(比如它 critical 更贴近原文),可以让 memory 插件的审计/评分用 3.8 、chat 主对话用 35b——但按现在 2.5 倍延迟差距,审计任务用 3.8 会让记忆压缩明显变慢,我不推荐。
---