• 请不要在回答技术问题时复制粘贴 AI 生成的内容
1258
V2EX  ›  程序员

qwen3.8 27B 被低估了

  •  
  •   1258 · 1 day ago · 8852 views
    qwen3.8 27B 完全被低估了,讨论度不高。
    如果有人在年初跟我讲,可以用两张 3090 本地部署一个超越当时最强的 opus4.5 几代的模型,我会觉得是痴人说梦。
    感觉 qwen3.8 完全可以加入穿越者套餐了,穿越之自带太阳能发电板+本地部署 qwen3.8 27B 的硬件设备,再造人类文明完全不是问题吧
    54 replies    2026-08-18 21:16:23 +08:00
    yiranw09
        1
    yiranw09  
       1 day ago
    你指 runinfra 免费的 qwen3.8 27B ?很奇怪的是我始终无法把他接入 hermes ,一直报错 Context length exceeded (16 tokens). Cannot compress further.
    sentinelK
        2
    sentinelK  
       1 day ago   ❤️ 8
    没有网络检索能力的小模型就是渣。

    小模型意味着信息量储备少,没有非常深厚的常识基础,或者说常识的抽象程度很高。
    如果没有外部信息做支撑,很容易产生很多没有细节的“正确的废话”。

    最简单的办法,你用 llama.cpp 的默认 web 应用调用一下试试看,直接就变成弱智。

    能力强的小模型很像中年老板。能量大,但其实不太关注信息量和细节。他的能力都来自于和外界的串联。你把他手机收了直接降级成中年油腻老头。

    相反,老版本的大模型像是老教授,不太会玩手机,所以显得很笨,很脱离现实。
    1258
        3
    1258  
    OP
       1 day ago
    @sentinelK 好比喻,也可以比喻成能力很强的年轻程序员,没有 github 或者网络检索很难凭经验解决 bug ,只能力大砖飞
    1258
        4
    1258  
    OP
       1 day ago
    @yiranw09 runinfra 的 3.8 居然免费了吗?这个模型部署成本确实很低
    levn
        5
    levn  
       1 day ago
    都吹成本地的 opus4.6 了,还叫低估吗
    1258
        6
    1258  
    OP
       1 day ago
    @levn 是本地百无禁忌的 opus4.6 ,这很夸张了,你甚至可以要求他做坏事,或者在灰色地带赚钱,只需要付出电费。
    nguoidiqua
        7
    nguoidiqua  
       1 day ago
    其实 R 站讨论热度很高的,国内玩自己部署的还是相对较少。

    单看编程方面的跑分,略超 Opus 4.6 、MiniMax M3 、Gemini 3.5 ,略低于 Hy3 、Kimi K2.6 ,稍弱于 V4 Flash 0731 、Spark 1.1 、Gemini 3.7 、GLM-5.2 、Qwen3.7 Max 。(当然跑分这个东西仅供参考,各家跑分的排名都是出入较大的)

    不过目前反馈有:一、过度推理,xHigh 下面推理消耗的时间和 TOKEN 比 Medium 多几倍。二、偏科严重,相比 Qwen3.6 27B ,某些方面提升很大,某些方面反而倒退了。
    coefu
        8
    coefu  
       1 day ago   ❤️ 1
    1 ,deepseek harness + qwen3.8 27B ,自己修复自己 bug ,自己给自己写插件。

    2 ,联网,记忆,都让它自己写的插件。一个联网的小 case ,都还有很多搞不定。指点一条路,searxng 。记忆参考 benchmark: https://agentmemories.ai/home

    3 ,Hidden Dimension: 5120 ,Number of Layers: 64 ,dense 黄金比例下,参数有限,只能靠反复推理榨出更多智力,过度推理是代价,但是本地部署,无非多几度电罢了,终归能把任务完成。从 Hidden Dimension: 8192
    ,Number of Layers: 92 的 2.4T 里 蒸馏出来的 逻辑能力。就这么点参数,逻辑能力占多了,通用知识当然就少了。
    coefu
        9
    coefu  
       1 day ago
    它的对手是 早它几天开源的 Muse-Glimmer-30B ,glimmer 确实也很 ok ,但是 Hidden dimension 6656 ,Layers 52 ,比 27B 少了 12 层深度,虽然宽了点,表达更丰富。但是,在特定的领域里,比如 coding / math ,逻辑缜密性 比 表达能力更重要。这在具体任务上,通常就是 看起来在思考,但是最深层次的矛盾,总是擦肩而过,力有不逮的感觉。

    glimmer 适合写小说,写剧本,一定深度的任务。

    qwen3.8 是 coding 领域真正的生产力工具。
    necZhang711
        10
    necZhang711  
       1 day ago
    @nguoidiqua 求问,r 站是啥子
    zhuantouer
        11
    zhuantouer  
       1 day ago
    x 上讨论挺多的,看老外的评价口碑还可以

    m4 pro 试了下,10t/s 左右,的确思考过度,蹲一下他们的 moe a3b 的模型
    1258
        12
    1258  
    OP
       1 day ago
    @coefu 666 大佬好专业的回答,自托管生产力我觉得是里程碑,毕竟电费直接转生产力了,而且可预见的是这一脚油门下去后面还会出现更猛的
    1258
        13
    1258  
    OP
       1 day ago
    @necZhang711 reddit 呀
    coefu
        14
    coefu  
       1 day ago
    @1258 推理端,其实还有更省电的。

    最屌的是 ,近存计算,在 ssd 上面焊接一个 FPGA ,把算子烧进 FPGA ,直接绕过内存墙。不过这个得看 FPGA 的算力进展了。或许也要单独供电,但是肯定也比整机功耗低。

    现在瑞芯微 RK182X 系列 就是在 m.2 上面搞得 堆叠 RAM ,有 1TB 的带宽,直接悍在 FPGA 周边的。不过容量被瓶颈在 5G B ,搞不上去了。还得是看 存储厂商。
    realJamespond
        15
    realJamespond  
       1 day ago
    opencode 批量重构调用子 agent 没有 3.6 好用,想半天,3.6 上来就直接干活,都是 unsloth ud q6
    tt83
        16
    tt83  
       1 day ago
    阿里云为啥自己不部署这个模型,3.8 Max 还是太贵
    acerphoenix
        17
    acerphoenix  
       1 day ago   ❤️ 1
    @sentinelK 大模型只要不部署在私网不能联网,都可以自己外接 Agent 进行网络检索呀。就是现在单纯的哪个模型也没有网络检索能力呀,都是 Agent 给的。
    jaoyina
        18
    jaoyina  
       1 day ago
    27b 的 coding 能力能到啥水平?
    565656
        19
    565656  
       1 day ago
    @acerphoenix #17 有没有什么插件给 qwen3.8 联网的
    Nzelites
        20
    Nzelites  
       1 day ago
    27b 这么强那满血版的 3.8max 应该起飞啊 为什么好像口碑一般
    Gylx
        21
    Gylx  
       1 day ago
    :)
    ashong
        22
    ashong  
       1 day ago
    7900xtx 跑 3.8 27B Q5 量化, 搭配 DS harness 效果挺好的, 比搭配 opencode“聪明”一些,输出速度 55 ~ 80t/s
    LuoDiNate
        23
    LuoDiNate  
       1 day ago
    qwen 的小尺寸一直都是神作
    niubee1
        24
    niubee1  
       1 day ago
    想法不错,我已经去番茄开小说了
    LuoDiNate
        25
    LuoDiNate  
       1 day ago
    27b 到 0.8b 早就在推上被关注了
    https://x.com/sudoingX/status/2033020823846674546
    catazshadow
        26
    catazshadow  
       1 day ago
    @coefu 跟慕斯比这两个千问是真的慢
    ashuai
        27
    ashuai  
       1 day ago
    35b 怎么还不发
    coefu
        28
    coefu  
       1 day ago
    @catazshadow muse 在 llama.cpp 里,经常思考的时候,重开一个 slot ,确实比 qwen 一直用一个 slot 快。每次切 slot 都重新榨干带宽。
    coefu
        29
    coefu  
       1 day ago
    @Nzelites 2.4T 几乎没有个人有资源能跑起来,Q8 都接近 2.5TB 的参数量了。单看 模型参数,Hidden Dimension: 8192 ,Number of Layers: 92 ,92 层深度,再复杂的小说,数学推理,都能搞定。8192 的层宽,表达能力以及领域知识肯定非常丰富。
    levn
        30
    levn  
       23h 6m ago
    重复和循环的问题仍然会出现。medium 思考下比前代只是略有提高所以把 xhigh 设置为了默认。同时似乎染上了 opus 4.7-5 的那种非常令人讨厌的味道。
    1258
        31
    1258  
    OP
       21h 40m ago via Android
    @niubee1 ?来个书名?!
    restkhz
        32
    restkhz  
       20h 47m ago
    从 Qwen3.6-27B 开始“正确的废话”已经少了很多了...尤其是 3.6-27B ,答案质量比 Qwen3.5-122B-A10B 和 Qwen3.6-35B-A3B 好得多。很多时候未必需要搜索。
    已经不能拿着看 Gemma4,Qwen3 的眼光看这些小模型了。Gemma4-31B 就哪怕和 Qwen3.6-35B-A3B 比能力上都完全都不是一代的,虽然发布时间接近。


    3.8 不能说就是 opus4.6 的等级,有些指标差一些,有些指标超过。它知识量上和 3.6 比没很大提升,但是 Agent ,coding ,指令遵循能力已经很不错了。

    我这个实验室组周六就已经玩上 Qwen3.8-27B ,FP8 。有人跑 Agent 花了 40 分钟做了 3 个网页街机游戏。我也用它问了一些现代 EDR 和 shellcode loader 有关的问题,没开搜索,回答质量也非常好。能具体说出一些现代技术而且能解释为什么要这么做,具体原理,还能给出具体 API 。体验接近 DeepSeek V4 Flash 0731 。

    感觉这个东西已经到了可以当生产力工具的水平了。

    至于过度推理,3.6 就有这个问题了。27B 知识不足的情况下为了更好的质量只能靠时间换空间。不过对于自己本地部署来说我认为这是值得的。这就是那个不可能三角:好,便宜,快。你不能要求你只有 32GB vram 的情况下跑出 opus 的质量,还要求它快吧...

    不过确实热度不如 DeepSeek 0731.
    作为一个 27B 的 dense,推理成本应该比 0731 的激活 13B 高,应该会更贵。
    对于买 token 用的,和 0731 比 3.8 可能就又贵又慢了。

    ---------

    刚刚看了一下,artificialanalysis 给出了 52 分。
    超过了 opus 4.6.直接和 DeepSeek v4 flash 0731 一个分数了。
    wwhc
        33
    wwhc  
       20h 40m ago
    在我这测试 Qwen3.8 27B 智商比 DeepSeek v4 flash 0731 高,DeepSeek v4 flash 0731 的智力水平在 Qwen3.8 27B 和 Qwen3.6 27B/35B 之间
    flyws
        34
    flyws  
       14h 58m ago   ❤️ 1
    Qwen3.8 27B 确实很不错,我使用几天了,在 DGX Spark 上面的问题除了慢,还真挑不出了,对于我的一个改 PDF 的 use case ,它表现达到了 opus 水平,完成了我的要求。同样的 prompt 扔给 DeepSeek v4 Flash ,GLM 5.2 ,Kimi3 都没有做出来(都忽略了保持背景颜色一致)

    我并不是想表达 Qwen 3.8 27b 暴打更大的模型,但是当我本地跑起来 Opus 级别的模型的时候,确实有一种原子弹爆炸的感觉。我觉得没有被低估,只是本地跑 AI 模型的可能还是少数,但是我相信未来这会变成大多数(都说 token 类比水电煤了,自己发电不好吗
    mianma01
        35
    mianma01  
       14h 56m ago
    这个模型定价好贵啊
    BingoW
        36
    BingoW  
       14h 31m ago
    求个建议:我目前机箱和电源( 850w )都只支持单卡,目前是 2080ti 22G 魔改,能跑 4bit 量化版本 但是 KV 不够了,上下文太短。想换卡,换 3090 24G 还是 4080s 32G 魔改呢?
    wowo243
        37
    wowo243  
       14h 15m ago
    @565656 #19 接个 pi agent 然后 安装 pi-web-access 插件就可以了
    wcwcxiaobin
        38
    wcwcxiaobin  
       14h 12m ago
    @ashong 跑的什么框架速度这么快
    m4n
        39
    m4n  
       13h 7m ago
    这个模型如果单卡想跑 256K 上下文,最低显卡什么型号?现在价格都涨了,真搞不动
    ashong
        40
    ashong  
       12h 4m ago
    @wcwcxiaobin
    llama.cpp + vulkan 128k 上下文, kv cache q8_0

    用 DSH 分析并修改 181k 行代码的 Qt 项目 bug ,58 t/s 输入:4.5M tok 输出:29.3k tok
    ashuai
        41
    ashuai  
       12h 1m ago
    同一台 mac sudio 上用 mlx 跑的俩模型,在 mac mini 上用 dsh 评估。35b moe 还是太神了

    ---

    # Qwen3.6-35b vs Qwen3.8-27B-4bit 全方位对比

    **测试环境**:本地 oMLX(192.168.0.5:9870),真实 localai 模板(工具提示词/评分准则/审计模板),enable_thinking 关闭,共 **19 个用例 + 3 组补充测试**,两个模型同一 prompt 各跑一遍。

    ## 一、性能(决定性差异)

    | 指标 | 35b | 3.8 | 结论 |
    |---|---|---|---|
    | 19 用例平均延迟 | **1.35s** | 3.47s | 35b 快 **2.5x** |
    | 审计重任务(546 token 输入) | 4.8~5.7s | 10.6~14.1s | 35b 快 **2.5~3x** |
    | 全程最慢单次 | 5.96s | 13.23s | 35b 无一次比 3.8 慢 |

    prompt 缓存两个模型都没命中(cached_tokens=0),无缓存红利差异——**3.8 的慢是纯生成速度问题**(27B-4bit 在本机 oMLX 上内核效率不如 35b)。

    ## 二、功能质量

    | 维度 | 35b | 3.8 | 胜负 |
    |---|---|---|---|
    | 中文对话(4 例) | 幽默更出彩("薛定谔的结论") | 比喻更生活化(餐馆点菜) | 平手~35b 微胜 |
    | JSON 微调用(4 例) | 全过,字段正确 | 全过,字段正确 | **平手** |
    | 评分(2 例) | S 级识别准确 | S 级识别准确 | **平手** |
    | 全量审计 | memory 密度高、低价值句丢得干净 | critical 更贴近原文、memory 偏简 | 平手~35b 微胜 |
    | 推理/代码(3 例) | 全对(斐波那契+复杂度/数学/找规律) | 全对 | **平手** |
    | 指令遵循 | 完美 3 行格式 | 完美 3 行格式 | **平手** |
    | 压缩记忆使用(3 例) | 正确取用 critical/memory | 正确取用 | **平手** |

    ## 三、工具回路(唯一的实质质量差异)

    | 用例 | 35b | 3.8 |
    |---|---|---|
    | 列目录 | `/fs ls .` ✓ | `/fs ls .` ✓ |
    | 读文件 | `/fs cat src/main.rs` ✓ | `/fs cat src/main.rs` ✓ |
    | 当前目录 | **`/fs pwd` ✗(无效命令,正确是 `/pwd`)** | 直接回答(系统环境里有 cwd,合理) |
    | 看插件 | **`/fs ls plugins/ 2>/dev/null \|\| ... \|\| /fs find ...` ✗ 编造不存在的 `/fs find` + shell 语法** | `/fs ls .` ✓ 干净 |

    **35b 的 CLI/shell 知识更广,但会"超纲编命令"**;3.8 严格守工具词表。不过 35b 的错误在工具回路里是**可恢复的**(无效命令会返回 usage 文案,模型下一轮会纠正),代价只是多一轮调用(~1-2s)。

    ## 四、结论:推荐 **35b 继续做 default**

    | 决策权重 | 理由 |
    |---|---|
    | **速度(最关键)** | 本地壳的体验核心就是响应快。2.5~3x 差距是决定性的,且无法靠提示词弥补 |
    | 工具纪律(35b 短板) | **可修复**:base prompt 加一句"只能使用系统列出的命令,禁止发明子命令(如 /fs find)"即可;3.8 的优势代价是慢 2.5 倍 |
    | 其余维度 | 全部平手,不构成翻盘理由 |

    **给 35b 的补丁建议**(如果你采纳,我可以顺手加到 `CHAT_SYSTEM`):
    > "工具命令只允许使用系统列出的:fs ls/cat/write/edit/stat/log 、run 、pwd 、mode 。禁止发明不存在的子命令或混入 shell 语法(`2>/dev/null`、`||`、管道等)。"

    **备选方案**:如果你想留 3.8 做某些场景(比如它 critical 更贴近原文),可以让 memory 插件的审计/评分用 3.8 、chat 主对话用 35b——但按现在 2.5 倍延迟差距,审计任务用 3.8 会让记忆压缩明显变慢,我不推荐。

    ---
    jfds
        42
    jfds  
       11h 37m ago   ❤️ 1
    @sentinelK 搜索引擎方案不是一大把?随便哪个 agent 装个 skill 或者 mcp 都可以呀,这又不是啥问题
    coefu
        43
    coefu  
       10h 58m ago
    @flyws 用 dspark 加速,有加速了 9.5 倍的。
    jiezou
        44
    jiezou  
       10h 14m ago
    @BingoW 我也是 22g 魔改 有点勉强上下文吃不住
    MistyMoon
        45
    MistyMoon  
       9h 50m ago
    想什么呢...
    全世界最火的小模型了, Qwen3.8 27B 才出几天, 社区微调+量化加起来都 645 个了
    谷歌 Gemma 4 31B 都出了这么久, 也才 548 个
    睁眼看世界吧
    volvo007
        46
    volvo007  
       8h 41m ago via iPhone
    好家伙,我的双 A800 又能焕发青春了!
    hongchends1
        47
    hongchends1  
       8h 32m ago
    @sentinelK 你自己给它配一个 websearch 工具不就好了吗
    tisswb
        48
    tisswb  
       7h 19m ago
    @flyws #34 请问在 dgx spark 上 这种 27b 的稠密模型 速度大概有多少?
    ixx
        49
    ixx  
       6h 7m ago
    接 opencode 用过吗?我咋感觉稍微让他做一个复杂点的任务就干一半直接停了,不知道是不是上下文满了,让他继续任务也继不上。。
    Nzelites
        50
    Nzelites  
       4h 22m ago
    @coefu 倒不是说跑起来的问题,而是之前还有看到不少评价不如 4.8 但是又有看到评价 4.8 不如 4.6 ()
    总而言之感觉到了一定性能后 ai 的水平可能是一个比较捉摸不定的事情?
    wangxiaoer
        51
    wangxiaoer  
       4h 16m ago
    @sentinelK #2 检索能力不是工具调用,属于应用层的吗? 和模型本身有啥关系?
    sentinelK
        52
    sentinelK  
       3h 27m ago
    @acerphoenix
    @jfds
    @hongchends1
    @wangxiaoer

    你们这个上下文长度……
    楼主说:“感觉 qwen3.8 完全可以加入穿越者套餐了,穿越之自带太阳能发电板+本地部署 qwen3.8 27B 的硬件设备,再造人类文明完全不是问题吧”
    crisrock
        53
    crisrock  
       2h 14m ago via iPhone
    有人用 MacBook 本地跑过吗?需要多少内存?
    leonvxe
        54
    leonvxe  
       2h 3m ago
    为什么总有人拿 27b 的模型和 几 T 参数的模型比,是无知还是愚昧
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   2836 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 88ms · UTC 15:20 · PVG 23:20 · LAX 08:20 · JFK 11:20
    ♥ Do have faith in what you're doing.