alanying
V2EX  ›  DeepSeek

⚠️, DeepSeek-V4-Pro-0813 你们觉得怎么样? 我们部门内部盲测不如 GLM5.2

  •  
  •   alanying · 20h 46m ago · 2616 views
    光看榜单感觉也不是很靠谱。
    27 replies    2026-08-14 09:19:36 +08:00
    alanying
        1
    alanying  
    OP
       20h 45m ago
    其实是 Qwen3.8 > GLM5.2 > K3 > DPSKv4 Pro 的但是标题写 Qwen3.8 怕被喷
    shintendo
        2
    shintendo  
       20h 41m ago
    GLM5.2 > K3 是认真的吗
    foryou2023
        3
    foryou2023  
       20h 36m ago
    估计得重新测试了,官网刚刚才更新了更新日志,就是官方的 harness 还不发布,不知道啥时候发布。
    shintendo
        4
    shintendo  
       20h 33m ago
    @foryou2023 说是明天
    Miaoz
        5
    Miaoz  
       19h 42m ago   ❤️ 1
    GLM5.2 > K3 认真的吗 +1
    jackerbauer
        6
    jackerbauer  
       18h 54m ago
    主观太强
    jackerbauer
        7
    jackerbauer  
       18h 53m ago
    不过 GLM5.2 > K3 ,确实离谱
    cue
        8
    cue  
       18h 50m ago via iPhone
    你们部门……是千问团队吗……
    Qmanman
        9
    Qmanman  
       18h 49m ago via Android
    glm5.2 不太行
    isbase
        10
    isbase  
    PRO
       18h 12m ago via iPhone
    据说模型上错了 再用目前的版本试试
    alanying
        11
    alanying  
    OP
       18h 11m ago
    @jackerbauer @Miaoz @shintendo 确实主观性比较强


    @cue 🤣 我要是千问团队我都不敢对外讲,名声不好。
    alanying
        12
    alanying  
    OP
       18h 10m ago
    @isbase 还有这回事
    bowen628
        13
    bowen628  
       16h 59m ago
    官方 harness 已经发了,包名 @deepseek-ai/dsh ,这轮盲测可以顺手重跑一次。模型横评不固定壳,工具 schema 、prompt 拼法、上下文回放全会混进分数,最后测的其实是 model+harness 。利益相关:我参与 BitFun ,我们这边一直把 prompt 做成字节级稳定,SWE-Bench-Pro 那轮 KV cache 平均命中 98.67%;拿同一仓库在 DSH / BitFun 交叉跑,应该比只看榜单有意思。
    Tink
        14
    Tink  
       16h 58m ago
    测试方法是啥啊?
    exhades
        15
    exhades  
       16h 53m ago
    GLM5.2 是什么路边,我这边都是 K3 > qwen3.8max > dsv4Pro > GLM5.2
    cowcomic
        16
    cowcomic  
       16h 43m ago
    据说已经下架了
    xiaoz
        17
    xiaoz  
       16h 22m ago via Android
    @cowcomic DeepSeek 官方公众号已经宣布正式上线了。
    lsylsy2
        18
    lsylsy2  
       16h 4m ago
    @exhades v4pro 预览版我感想是不如 glm ,正式版还没测
    @xiaoz huggingface 撤回了,链接进去是 404
    renzhe8102
        19
    renzhe8102  
       15h 5m ago via Android
    @exhades k3 路边
    FantaMole
        20
    FantaMole  
       14h 24m ago
    之前在梁子的那个内部会议的纪要出来的时候,我就在论坛里的一个帖子提过 DeepSeek 一直是个小而美的公司,梁子本人是很有理想,但是其他人是要吃饭的,这个扁平化的理想主义管理架构在拉进来一堆人之后可能很难管。就 13 号这个混乱百出的样子,感觉可以一窥内部的失控样子

    DeepSeek Pro GA 没有让我感到有惊艳的地方,由于公司项目我搭了一套 AI Coding Framework ,所以只要模型不是太差,能够有 GLM5.2 级别的能力,大部分工作不会有太多体感差距。不过今天处理的一个复杂问题,处理结果不及预期,最后是用 opus5 处理掉的

    DeepSeek Harness ,刚刚才有空探索了一下项目,准备明天尝试一下。不过看知乎上的评价,感觉一堆人说了半天没有重点不知道说了什么东西,全在聊拓展性
    aarontian
        21
    aarontian  
       11h 28m ago
    你们部门的评测标准是模型命名是否符合社会主义核心价值观吗。。
    phrack
        22
    phrack  
       9h 20m ago
    @FantaMole 做量化交易的你说理想主义?

    你是说理想是赚钱吗?
    yuzo555
        23
    yuzo555  
       7h 59m ago
    官网的 API Pro 现在是对的模型了吗?消息很多
    FantaMole
        24
    FantaMole  
       7h 26m ago
    @phrack 因果颠倒,是已经靠量化恰饱饱了,恰到财富自由了,才开始有兴趣搞 DeepSeek 去追 AGI
    martinm
        25
    martinm  
       6h 50m ago via Android
    自用 K3 > GLM5.2 > DSV4 Pro ,

    顺便一说 KimiCode 开集群模式 + DSV4 Flash 子模型 绝配
    Auston
        26
    Auston  
       6h 41m ago
    有点怀疑你们部门的测试能力,哈哈哈,就跟我们公司一群人在那胡测一下,公司自研模型已经比肩 deepseek 和 glm 了,这你敢信?
    FakerLeung
        27
    FakerLeung  
       6h 26m ago
    笑死了,想起我们大部门的 7 月份的测试结果:
    deepseek-v4-flash-preview 不如 glm-4.7
    deepseek-v4-pro-preview 不如 glm-5.0
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   5092 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 64ms · UTC 07:46 · PVG 15:46 · LAX 00:46 · JFK 03:46
    ♥ Do have faith in what you're doing.