SSang's recent timeline updates
SSang

SSang

V2EX member #535525, joined on 2021-03-02 14:09:51 +08:00
Today's activity rank 2077
72 S 8 B
32G 显存 Qwen3.8-27B-GGUF 配置分享
程序员  •  SSang  •  2h 23m ago  •  Lastly replied by zzutmebwd
34
大语言模型中规模和模型大小的关系?
Local LLM  •  SSang  •  Sep 6, 2025  •  Lastly replied by nlzy
5
翻译模型哪家强?
问与答  •  SSang  •  Mar 31, 2025  •  Lastly replied by silentcentralia
13
为 GoldenDict 中添加 AI 词典
分享创造  •  SSang  •  Mar 27, 2025  •  Lastly replied by SSang
5
PVE 显卡直通后如何使 noVNC 可用
Linux  •  SSang  •  Feb 8, 2025  •  Lastly replied by SSang
3
大佬们求一个馒头邀请
分享邀请码  •  SSang  •  Nov 15, 2024  •  Lastly replied by moon13v
16
杂牌显示器边缘像素点显示不全如何解决
问与答  •  SSang  •  Nov 4, 2024  •  Lastly replied by Tyrant1984
10
SSang's recent replies
4h 9m ago
Replied to a topic by SSang 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
@catazshadow 噢噢,就是直接 pcie 拆分 4 卡的是吧。确实 pcie 也听够了,我之前搞过一个 pcie x1 拆分 4 卡的,当时也测不出有什么差距,但后来不知道被我丢哪去了。
4h 25m ago
Replied to a topic by SSang 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
@lyonll 我有空也测测 turbo3 ,但其实 q4 我觉得就已经有些不太行了。

我就是体感劣化,有的是很明显的劣化的,就是很简单的任务,比如我让他改一个前端展示从 ID 改成获取名称展示,改了量化之后他直接开始一直循环不输出结果,这种就是明显的劣化了。

我 q8 跑就是很慢,但是基本上任务都能完成,但是 q4 还是会有概率出现乱回答或者死循环。

---

然后还有就是我个人感觉本地部署 prefill 速度比 decode 速度重要,decode 只要有 10tok/s 就有一点安慰作用了,但是我要是等几分钟他还在那转圈,就会开始怀疑是不是模型挂了还是报错了。

(我之前其实是有算过的,特别是长上下文编码的场景,prefill 速度会很大程度决定任务的总耗时,100k 左右的上下文,基本上要缓存命中到 98% 以上,decode 速度才会对总耗时有些影响)
4h 40m ago
Replied to a topic by SSang 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
@GuardX 反正我看了其他的帖子基本上也是这个结论:「 Q4 及以上质量良好,Q4 以下断崖式下降」
4h 41m ago
Replied to a topic by SSang 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
@GuardX 12G 能跑 q2 吧,上下文应该能到 128k ,不行就将降低到 64k ,kv 应该也只能跑 q4 ( q8 理论占用就要 8G 显存了),但我觉得 q2 写代码的话还是不太行的,你日常对话玩玩还行。
4h 44m ago
Replied to a topic by SSang 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
@catazshadow hh ,我也在考虑,但是现在好像 nvlink 都还是挺贵的状态。

这个 T10 是 Tesla 还是 Turing 啊?
4h 50m ago
Replied to a topic by SSang 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
@jhytxy 是 gemma4-31B 吗?我看 AA 上面的 Intelligence Index 还蛮低的,满血才 30 分,上一代的 qwen3.6-27B 满血都有 38 分了。他的 Q4 的会比 Qwen3.8-27B 的 Q8 量化还厉害吗?

上一代的 Qwen3.6-27B-Q4 对我来说也是不可用的状态。3.8 我这几天用下来感觉是达到可用水平了。
4h 57m ago
Replied to a topic by SSang 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
@realJamespond udq6kl,kvq8,mtp3,c64k 这个配置你主要是用在什么场景?

我这里的话 c64k 太小了,写代码一直在那 compact ,然后 kvq8 100tok/s 的 prefill 速度我写代码平均 ttft 都要 100 多秒,有点难受。
6h 58m ago
Replied to a topic by SSang 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
@catazshadow 确实是这样。V100 Q4 有时候也能 1000 多,应该不是算错,感觉是合理峰值。Q5 性能确实比 Q8 还更差,Q8 偶尔还能上 100.
7h 0m ago
Replied to a topic by SSang 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
@chengsitom 一天 4 度左右吧
8h 22m ago
Replied to a topic by SSang 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
我觉得 V100 用 Q4 KV 就是极限了,只有用 Q4 能到 500 左右的 prefill 速度,Q5 开始就几乎上不了 3 位数了。
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   3133 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 20ms · UTC 13:22 · PVG 21:22 · LAX 06:22 · JFK 09:22
♥ Do have faith in what you're doing.