已收录

灵犀专业版实测:13款大模型智力大考,GLM-5.3-Flash满分夺冠仅耗4灵点!

熠林
熠林 Lv.2 潜力创作者

Lv.2 潜力创作者

一、测试背景与规则

近期国产大模型密集更新,各家厂商纷纷推出新版本。为了直观对比各模型的真实智力水平,我准备了一份包含 40 道题目的智力测试卷,满分 81 分,全部为客观单选题。测试要求模型仅依靠自身知识储备作答,禁止使用联网搜索功能。

智力测试卷:https://www.kdocs.cn/l/cuTHQZstOcer

灵犀专业版版本:v1.2.45

📌

统一提示词:

这个文件夹里面有一份智力测试题,请你回答一下里面的问题并把答案填写到回答区,题目有且只有一个正确答案,记住不要使用联网功能查询答案,只利用你现有的知识能力来回答,回答完成后把文件重命名,文件后缀加上pro模型,放置到《作答试卷收录》文件夹中。

二、各大模型智力测试

按照上述提示词,依次让 13 款内置模型在本地运行并作答,记录各模型的文件备份方式、耗时与灵点消耗。

1.Pro模型

原文件自动备份,耗时2分09秒,消耗13灵点。

2.Max模型

授权备份原文件,耗时3分53秒,消耗19灵点。

3.Qwen3.8-Flash模型

原文件自动备份,耗时9分49秒,消耗15灵点。

4.Qwen3.8-Max模型

原文件未备份,耗时29分36秒,消耗328灵点。

5.DeepSeek V4 Flash模型

原文件自动备份,耗时2分30秒,消耗10灵点。

6.DeepSeek V4 Pro模型

原文件自动备份,耗时8分15秒,消耗82灵点。

7.Xiaomi MiMo-V2.5 Pro模型

原文件未备份,耗时3分33秒,消耗123灵点。

8.GLM-5.3-Flash模型

原文件自动备份,耗时2分22秒,消耗4灵点。

9.GLM-5.2模型

原文件自动备份,耗时8分53秒,消耗182灵点。

10.GLM-5.3模型

原文件自动备份,耗时1分05秒,消耗32灵点。

11.MiniMax-M3模型

原文件自动备份,耗时2分59秒,消耗29灵点。

12.Doubao-Seed-2.1 Pro模型

原文件自动备份,耗时4分40秒,消耗69灵点。

13.Kimi-K3模型

授权备份原文件,耗时3分46秒,消耗17灵点。

三、阅卷评分

经过两个多小时的测试,13款模型全部完成作答。

我继续使用 DeepSeek V4 Flash 作为"阅卷老师",将各模型的答案与标准答案逐一比对,计算得分。

📌

输入提示词:

这个文件里面有智力大测试的答案,帮我把《作答试卷收录》中各个大模型的答案分别和正确答案进行对比,依次列出各个大模型的答案和对应的得分,并汇总各个大模型所有的分数。

智力测试得分:https://www.kdocs.cn/l/csUq3S81Iw9W

四、总结

  1. 性价比之王是 GLM-5.3-Flash:满分、2 分 22 秒、仅 4 灵点,三项指标全部拉满,堪称本次测试的最大赢家。

  1. Flash 系集体表现出色:四款满分模型中有三款(GLM-5.3-Flash、DeepSeek V4 Flash、Qwen3.8-Flash)是轻量 Flash 版本,说明在常规智力题上,轻量模型已完全够用。

  1. Pro版本大模型未必更强:Qwen3.8-Max 和 GLM-5.2 消耗的灵点分别是同门 Flash 版的 20 倍和 45 倍,得分反而更低。参数更大、推理更久,并不等于答得更对。

排名

模型

正确率

得分

耗时

灵点消耗

🥇 1

GLM-5.3-Flash

100.0%

81/81

2分22秒

4

🥈 2

DeepSeek V4 Flash

100.0%

81/81

2分30秒

10

🥉 3

Doubao-Seed-2.1 Pro

100.0%

81/81

4分40秒

69

4

Qwen3.8-Flash

100.0%

81/81

9分49秒

15

5

Max

97.5%

79/81

3分53秒

19

6

pro

96.3%

78/81

2分09秒

13

7

Kimi-K3

96.3%

78/81

3分46秒

17

8

Qwen3.8-Max

96.3%

78/81

29分36秒

328

9

GLM-5.3

95.1%

77/81

1分05秒

32

10

GLM-5.2

95.1%

77/81

8分53秒

182

11

DeepSeek V4 Pro

93.8%

76/81

8分15秒

82

12

MiniMax-M3

91.4%

74/81

2分59秒

29

13

Xiaomi MiMo-V2.5 Pro

87.7%

71/81

3分33秒

123

浏览 191
收藏
13
分享
13 +1
12
+1
全部评论 12
 
24366426
一直用的DeepSeek V4 Flash,没想到还有比它消耗还少的
   江西省
举报
1
1
熠林
熠林Lv.2 潜力创作者

Lv.2 潜力创作者

这点确实也出乎我的意料,又省又快
·
举报
0
0
 
懿喵
好样的,为你点赞
   福建省
举报
1
1
熠林
熠林Lv.2 潜力创作者

Lv.2 潜力创作者

感谢点赞
· 浙江省
举报
1
0
 
廖兵
厉害厉害,很有参考价值
   四川省
举报
1
1
熠林
熠林Lv.2 潜力创作者

Lv.2 潜力创作者

哈哈哈,能帮到大家参考就好
· 浙江省
举报
1
0
 
一点等待
现在的flash大模型都挺能打的,多数任务已经不需要用贵的模型了
举报
1
1
熠林
熠林Lv.2 潜力创作者

Lv.2 潜力创作者

没错,而且据官方透露,内置的大模型思考强度默认为低,flash日常使用也是完全足够了
· 浙江省
举报
1
0
 
无界
无界 Lv.2 潜力创作者

Lv.2 潜力创作者

我以后就用GLM-5.3-Flash了
   山东省
举报
1
1
熠林
熠林Lv.2 潜力创作者

Lv.2 潜力创作者

可以,而且DeepSeek V4 Flash依旧能打
· 浙江省
举报
1
0
 
董
辛苦辛苦,很有参考意义,很棒
举报
1
1
熠林
熠林Lv.2 潜力创作者

Lv.2 潜力创作者

感谢支持
· 浙江省
举报
1
0