我进行了以下测试发现 Jev 完全没有任何价值完全是噱头,
- 我使用了 vllm+Qwen3.8 27B 本地部署,构造一个 prompt ,直接从接口输出 topk logprobs ,直接可以读取单选项 token 概率换算即可,不需要自定义采样,几行脚本就行都不需要很复杂的开发
- 各种官方用例端到端延迟 100ms 以内(包含网络延迟),并没有比官方的慢(实际上官方 API 基本上在 1000ms 以上),用小模型会更快
- 测试了官方给的各种简单和疑难案例,结果符合率 100%
- 对于非常明确的问题,Qwen 给出来的 choice 概率更明确更自信
- Qwen3.8 还可以做到 Jev 完全做不到的图片输入判断
- 使用 GPT 编造足够复杂和绕或者模糊或者专业的问题,Qwen 正确率高于 Jev
- 总结:基本就是个本科生机器学习课后作业水平的垃圾玩意儿,现在真的很多人都是 LLM 出来以后才知道 AI ,感性理解 AI ,基本不懂原理,很容易被忽悠