| #57#57 |
Step 3.7 Flashlow
|
7.3… |
Stepfun |
$0.341
…
|
15.74s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 无答案: 1
响应时间(平均)15.74s
响应时间(最大)124.75s
响应时间(总计)330.63s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 68.3%
- 输入令牌
- 40,101
- 输出令牌
- 289,325
- 推理令牌
- 0
- 响应时间(平均)
- 15.74s
- 响应时间(总计)
- 330.63s
- 响应时间(最大)
- 124.75s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.02s
响应时间(最大)12.52s
响应时间(总计)16.10s
-
编程
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.46s
响应时间(最大)12.69s
响应时间(总计)28.38s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.98s
响应时间(最大)7.98s
响应时间(总计)7.98s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.29s
响应时间(最大)3.15s
响应时间(总计)4.58s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)43.31s
响应时间(最大)72.27s
响应时间(总计)129.92s
-
通用智能
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.00s
响应时间(最大)7.00s
响应时间(总计)7.00s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.58s
响应时间(最大)1.80s
响应时间(总计)3.16s
-
谜题求解
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.84s
响应时间(最大)3.42s
响应时间(总计)5.52s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.25s
响应时间(最大)3.25s
响应时间(总计)3.25s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)124.75s
响应时间(最大)124.75s
响应时间(总计)124.75s
|
| #3🥉 #3 |
Gemini 3.5 Flashlow
|
9.4… |
Google |
$0.349
…
|
3.27s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.27s
响应时间(最大)9.05s
响应时间(总计)68.65s
…
|
- 总测试数
- 21
- 错误测试数
- 2
- 尝试通过率
- 90.5%
- 输入令牌
- 36,938
- 输出令牌
- 2,033
- 推理令牌
- 30,519
- 响应时间(平均)
- 3.27s
- 响应时间(总计)
- 68.65s
- 响应时间(最大)
- 9.05s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.52s
响应时间(最大)5.40s
响应时间(总计)10.08s
-
编程
: 7.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.71s
响应时间(最大)9.05s
响应时间(总计)20.13s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.44s
响应时间(最大)6.44s
响应时间(总计)6.44s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.81s
响应时间(最大)2.32s
响应时间(总计)3.63s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.39s
响应时间(最大)4.44s
响应时间(总计)10.16s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.27s
响应时间(最大)2.27s
响应时间(总计)2.27s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.86s
响应时间(最大)2.10s
响应时间(总计)3.73s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.35s
响应时间(最大)3.25s
响应时间(总计)7.06s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.27s
响应时间(最大)3.27s
响应时间(总计)3.27s
-
常识问答
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.88s
响应时间(最大)1.88s
响应时间(总计)1.88s
|
| #22#22 |
Step 3.7 Flashmedium
|
8.0… |
Stepfun |
$0.376
…
|
20.35s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 1 无答案: 1
响应时间(平均)20.35s
响应时间(最大)113.98s
响应时间(总计)427.42s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 73.0%
- 输入令牌
- 39,981
- 输出令牌
- 319,958
- 推理令牌
- 0
- 响应时间(平均)
- 20.35s
- 响应时间(总计)
- 427.42s
- 响应时间(最大)
- 113.98s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)9.65s
响应时间(最大)35.08s
响应时间(总计)38.62s
-
编程
: 8.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)27.42s
响应时间(最大)60.98s
响应时间(总计)82.26s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.06s
响应时间(最大)9.06s
响应时间(总计)9.06s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.75s
响应时间(最大)3.35s
响应时间(总计)5.49s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)48.27s
响应时间(最大)97.10s
响应时间(总计)144.81s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.85s
响应时间(最大)6.85s
响应时间(总计)6.85s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.83s
响应时间(最大)2.21s
响应时间(总计)3.65s
-
谜题求解
: 5.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)6.19s
响应时间(最大)12.51s
响应时间(总计)18.56s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.16s
响应时间(最大)4.16s
响应时间(总计)4.16s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)113.98s
响应时间(最大)113.98s
响应时间(总计)113.98s
|
| #28#28 |
Gemini 2.5 Flashmedium
|
7.8… |
Google |
$0.379
…
|
15.49s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 1
响应时间(平均)15.49s
响应时间(最大)95.48s
响应时间(总计)325.39s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 69.8%
- 输入令牌
- 34,476
- 输出令牌
- 1,930
- 推理令牌
- 145,145
- 响应时间(平均)
- 15.49s
- 响应时间(总计)
- 325.39s
- 响应时间(最大)
- 95.48s
-
反AI技巧
: 8.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.30s
响应时间(最大)15.56s
响应时间(总计)25.21s
-
编程
: 7.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)41.01s
响应时间(最大)92.88s
响应时间(总计)123.04s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)28.44s
响应时间(最大)28.44s
响应时间(总计)28.44s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.06s
响应时间(最大)5.06s
响应时间(总计)8.11s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)37.34s
响应时间(最大)95.48s
响应时间(总计)112.01s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.86s
响应时间(最大)4.86s
响应时间(总计)4.86s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.62s
响应时间(最大)2.78s
响应时间(总计)5.24s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.18s
响应时间(最大)4.05s
响应时间(总计)9.54s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.20s
响应时间(最大)6.20s
响应时间(总计)6.20s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.76s
响应时间(最大)2.76s
响应时间(总计)2.76s
|
| #35#35 |
Gemini 3 PRO Previewmedium
|
7.6… |
Google |
$0.385
↑
…
|
9.05s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 4 答案错误: 3
响应时间(平均)9.05s
响应时间(最大)26.24s
响应时间(总计)90.53s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 66.7%
- 输入令牌
- 28,848
- 输出令牌
- 1,490
- 推理令牌
- 10,102
- 响应时间(平均)
- 9.05s
- 响应时间(总计)
- 90.53s
- 响应时间(最大)
- 26.24s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.99s
响应时间(最大)26.24s
响应时间(总计)29.99s
-
编程
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 3
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.37s
响应时间(最大)10.37s
响应时间(总计)10.37s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.84s
响应时间(最大)10.84s
响应时间(总计)10.84s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)7.01s
响应时间(最大)7.01s
响应时间(总计)7.01s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.34s
响应时间(最大)9.34s
响应时间(总计)9.34s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.26s
响应时间(最大)3.26s
响应时间(总计)3.26s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.88s
响应时间(最大)4.23s
响应时间(总计)7.77s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.96s
响应时间(最大)11.96s
响应时间(总计)11.96s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #129#129 |
MiniMax M2.5medium
|
5.3… |
Minimax |
$0.385
↓
…
|
65.37s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 超时: 4 未遵循指令: 3 无效工具调用: 1 无答案: 1
响应时间(平均)65.37s
响应时间(最大)251.36s
响应时间(总计)849.76s
…
|
- 总测试数
- 21
- 错误测试数
- 16
- 尝试通过率
- 46.0%
- 输入令牌
- 43,706
- 输出令牌
- 109,495
- 推理令牌
- 330,814
- 响应时间(平均)
- 65.37s
- 响应时间(总计)
- 849.76s
- 响应时间(最大)
- 251.36s
-
反AI技巧
: 7.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 超时: 1
响应时间(平均)20.82s
响应时间(最大)32.42s
响应时间(总计)41.63s
-
编程
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 超时: 1 答案错误: 1
响应时间(平均)188.58s
响应时间(最大)251.36s
响应时间(总计)377.16s
-
综合
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)60.39s
响应时间(最大)60.39s
响应时间(总计)60.39s
-
数据解析与提取
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)7.48s
响应时间(最大)7.48s
响应时间(总计)7.48s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)237.27s
响应时间(最大)237.27s
响应时间(总计)237.27s
-
通用智能
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)6.63s
响应时间(最大)6.63s
响应时间(总计)6.63s
-
指令遵循
: 7.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)621ms
响应时间(最大)621ms
响应时间(总计)621ms
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)11.21s
响应时间(最大)17.37s
响应时间(总计)22.43s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.35s
响应时间(最大)15.35s
响应时间(总计)15.35s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)80.79s
响应时间(最大)80.79s
响应时间(总计)80.79s
|
| #24#24 |
GPT-5.2 Chatnone
|
7.9… |
OpenAI |
$0.393
…
|
7.13s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 1
响应时间(平均)7.13s
响应时间(最大)38.52s
响应时间(总计)149.69s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 74.6%
- 输入令牌
- 34,212
- 输出令牌
- 23,744
- 推理令牌
- 0
- 响应时间(平均)
- 7.13s
- 响应时间(总计)
- 149.69s
- 响应时间(最大)
- 38.52s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.40s
响应时间(最大)4.78s
响应时间(总计)13.59s
-
编程
: 8.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.82s
响应时间(最大)13.35s
响应时间(总计)29.45s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.12s
响应时间(最大)9.12s
响应时间(总计)9.12s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.05s
响应时间(最大)3.33s
响应时间(总计)6.10s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)17.78s
响应时间(最大)38.52s
响应时间(总计)53.33s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.20s
响应时间(最大)3.20s
响应时间(总计)3.20s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.51s
响应时间(最大)6.55s
响应时间(总计)11.02s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.10s
响应时间(最大)5.04s
响应时间(总计)12.31s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.68s
响应时间(最大)4.68s
响应时间(总计)4.68s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.89s
响应时间(最大)6.89s
响应时间(总计)6.89s
|
| #66#66 |
Qwen3.5-35B-A3Bmedium
|
7.1… |
Qwen |
$0.401
↓
…
|
72.57s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 5 无答案: 2 答案错误: 2 API 错误: 1
响应时间(平均)72.57s
响应时间(最大)409.98s
响应时间(总计)1524.04s
…
|
- 总测试数
- 21
- 错误测试数
- 10
- 尝试通过率
- 69.8%
- 输入令牌
- 42,196
- 输出令牌
- 40,630
- 推理令牌
- 353,577
- 响应时间(平均)
- 72.57s
- 响应时间(总计)
- 1524.04s
- 响应时间(最大)
- 409.98s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.13s
响应时间(最大)34.96s
响应时间(总计)84.53s
-
编程
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 超时: 1
响应时间(平均)206.65s
响应时间(最大)409.98s
响应时间(总计)619.94s
-
综合
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)75.34s
响应时间(最大)75.34s
响应时间(总计)75.34s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)59.33s
响应时间(最大)97.12s
响应时间(总计)118.65s
-
领域专项
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 答案错误: 1
响应时间(平均)88.34s
响应时间(最大)106.00s
响应时间(总计)265.01s
-
通用智能
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)30.30s
响应时间(最大)30.30s
响应时间(总计)30.30s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)24.45s
响应时间(最大)43.36s
响应时间(总计)48.89s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)33.13s
响应时间(最大)64.81s
响应时间(总计)99.38s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.65s
响应时间(最大)4.65s
响应时间(总计)4.65s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)177.35s
响应时间(最大)177.35s
响应时间(总计)177.35s
|
| #63#63 |
GPT-5.3 Chatnone
|
7.2… |
OpenAI |
$0.433
…
|
6.34s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 未遵循指令: 2
响应时间(平均)6.34s
响应时间(最大)18.33s
响应时间(总计)133.13s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 66.7%
- 输入令牌
- 34,209
- 输出令牌
- 26,617
- 推理令牌
- 0
- 响应时间(平均)
- 6.34s
- 响应时间(总计)
- 133.13s
- 响应时间(最大)
- 18.33s
-
反AI技巧
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)3.86s
响应时间(最大)7.35s
响应时间(总计)15.44s
-
编程
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)10.52s
响应时间(最大)11.72s
响应时间(总计)31.55s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.96s
响应时间(最大)11.96s
响应时间(总计)11.96s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.21s
响应时间(最大)2.52s
响应时间(总计)4.42s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)13.01s
响应时间(最大)18.33s
响应时间(总计)39.04s
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.99s
响应时间(最大)1.99s
响应时间(总计)1.99s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.51s
响应时间(最大)4.60s
响应时间(总计)7.01s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.99s
响应时间(最大)3.16s
响应时间(总计)8.97s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.36s
响应时间(最大)8.36s
响应时间(总计)8.36s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.38s
响应时间(最大)4.38s
响应时间(总计)4.38s
|
| #78#78 |
Qwen3.6 27Bmedium
|
6.8… |
Qwen |
$0.444
↑
…
|
59.71s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 无答案: 3 未遵循指令: 1 无效工具调用: 1
响应时间(平均)59.71s
响应时间(最大)168.22s
响应时间(总计)1254.01s
…
|
- 总测试数
- 21
- 错误测试数
- 11
- 尝试通过率
- 60.3%
- 输入令牌
- 39,376
- 输出令牌
- 16,189
- 推理令牌
- 122,521
- 响应时间(平均)
- 59.71s
- 响应时间(总计)
- 1254.01s
- 响应时间(最大)
- 168.22s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)12.62s
响应时间(最大)18.61s
响应时间(总计)50.50s
-
编程
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)142.99s
响应时间(最大)168.22s
响应时间(总计)428.96s
-
综合
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)83.07s
响应时间(最大)83.07s
响应时间(总计)83.07s
-
数据解析与提取
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 2
响应时间(平均)37.30s
响应时间(最大)54.01s
响应时间(总计)74.60s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)73.38s
响应时间(最大)101.55s
响应时间(总计)220.15s
-
通用智能
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)39.53s
响应时间(最大)39.53s
响应时间(总计)39.53s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)37.96s
响应时间(最大)47.48s
响应时间(总计)75.92s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)61.14s
响应时间(最大)97.76s
响应时间(总计)183.42s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)16.88s
响应时间(最大)16.88s
响应时间(总计)16.88s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)80.99s
响应时间(最大)80.99s
响应时间(总计)80.99s
|
| #59#59 |
GLM 5V Turbomedium
|
7.2… |
Z.ai |
$0.457
…
|
23.08s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 无效工具调用: 2 未遵循指令: 1
响应时间(平均)23.08s
响应时间(最大)95.88s
响应时间(总计)484.63s
…
|
- 总测试数
- 21
- 错误测试数
- 10
- 尝试通过率
- 68.3%
- 输入令牌
- 44,615
- 输出令牌
- 2,347
- 推理令牌
- 98,415
- 响应时间(平均)
- 23.08s
- 响应时间(总计)
- 484.63s
- 响应时间(最大)
- 95.88s
-
反AI技巧
: 7.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)10.76s
响应时间(最大)14.40s
响应时间(总计)43.02s
-
编程
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)63.38s
响应时间(最大)95.88s
响应时间(总计)190.15s
-
综合
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)15.06s
响应时间(最大)15.06s
响应时间(总计)15.06s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.60s
响应时间(最大)9.92s
响应时间(总计)19.19s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)38.15s
响应时间(最大)67.08s
响应时间(总计)114.45s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.09s
响应时间(最大)11.09s
响应时间(总计)11.09s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.74s
响应时间(最大)5.23s
响应时间(总计)7.47s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.24s
响应时间(最大)16.95s
响应时间(总计)30.72s
-
工具调用
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)12.53s
响应时间(最大)12.53s
响应时间(总计)12.53s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)40.96s
响应时间(最大)40.96s
响应时间(总计)40.96s
|
| #8#8 |
Claude Opus 4.7none已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
8.9… |
Anthropic |
$0.505
…
|
3.02s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)3.02s
响应时间(最大)18.27s
响应时间(总计)57.44s
…
|
- 总测试数
- 19
- 错误测试数
- 3
- 尝试通过率
- 84.2%
- 输入令牌
- 69,576
- 输出令牌
- 6,265
- 推理令牌
- 0
- 响应时间(平均)
- 3.02s
- 响应时间(总计)
- 57.44s
- 响应时间(最大)
- 18.27s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.12s
响应时间(最大)3.75s
响应时间(总计)8.50s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.84s
响应时间(最大)2.84s
响应时间(总计)2.84s
-
综合
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)18.27s
响应时间(最大)18.27s
响应时间(总计)18.27s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.15s
响应时间(最大)2.33s
响应时间(总计)4.29s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.19s
响应时间(最大)1.40s
响应时间(总计)3.58s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.47s
响应时间(最大)3.47s
响应时间(总计)3.47s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.46s
响应时间(最大)1.68s
响应时间(总计)2.91s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.46s
响应时间(最大)3.72s
响应时间(总计)7.38s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.74s
响应时间(最大)4.74s
响应时间(总计)4.74s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.46s
响应时间(最大)1.46s
响应时间(总计)1.46s
|
| #5#5 |
Qwen3.7 Maxmedium
|
9.1… |
Qwen |
$0.523
↓
…
|
16.02s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)16.02s
响应时间(最大)59.98s
响应时间(总计)336.51s
…
|
- 总测试数
- 21
- 错误测试数
- 3
- 尝试通过率
- 88.9%
- 输入令牌
- 42,360
- 输出令牌
- 2,129
- 推理令牌
- 122,959
- 响应时间(平均)
- 16.02s
- 响应时间(总计)
- 336.51s
- 响应时间(最大)
- 59.98s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.36s
响应时间(最大)8.75s
响应时间(总计)25.44s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)35.31s
响应时间(最大)59.98s
响应时间(总计)105.93s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)19.60s
响应时间(最大)19.60s
响应时间(总计)19.60s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.80s
响应时间(最大)10.25s
响应时间(总计)17.60s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)24.94s
响应时间(最大)29.00s
响应时间(总计)74.81s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.70s
响应时间(最大)11.70s
响应时间(总计)11.70s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.46s
响应时间(最大)10.17s
响应时间(总计)14.92s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.84s
响应时间(最大)11.71s
响应时间(总计)26.51s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.63s
响应时间(最大)6.63s
响应时间(总计)6.63s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)33.37s
响应时间(最大)33.37s
响应时间(总计)33.37s
|
| #45#45 |
GPT-5.4 Minimedium
|
7.5… |
OpenAI |
$0.526
…
|
22.34s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 3
响应时间(平均)22.34s
响应时间(最大)138.75s
响应时间(总计)469.20s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 73.0%
- 输入令牌
- 34,116
- 输出令牌
- 2,181
- 推理令牌
- 108,937
- 响应时间(平均)
- 22.34s
- 响应时间(总计)
- 469.20s
- 响应时间(最大)
- 138.75s
-
反AI技巧
: 8.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.05s
响应时间(最大)6.69s
响应时间(总计)16.20s
-
编程
: 8.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)57.87s
响应时间(最大)138.75s
响应时间(总计)173.61s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.81s
响应时间(最大)17.81s
响应时间(总计)17.81s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.43s
响应时间(最大)3.39s
响应时间(总计)4.87s
-
领域专项
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)65.31s
响应时间(最大)102.91s
响应时间(总计)195.92s
-
通用智能
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.72s
响应时间(最大)3.72s
响应时间(总计)3.72s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.13s
响应时间(最大)2.45s
响应时间(总计)4.25s
-
谜题求解
: 7.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.37s
响应时间(最大)7.27s
响应时间(总计)13.11s
-
工具调用
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)9.62s
响应时间(最大)9.62s
响应时间(总计)9.62s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)30.10s
响应时间(最大)30.10s
响应时间(总计)30.10s
|
| #30#30 |
Qwen3.5-27Bmedium
|
7.8… |
Qwen |
$0.536
↓
…
|
68.39s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 2 额外格式: 1 超时: 1
响应时间(平均)68.39s
响应时间(最大)234.36s
响应时间(总计)1436.24s
…
|
- 总测试数
- 21
- 错误测试数
- 8
- 尝试通过率
- 73.0%
- 输入令牌
- 42,164
- 输出令牌
- 8,534
- 推理令牌
- 329,289
- 响应时间(平均)
- 68.39s
- 响应时间(总计)
- 1436.24s
- 响应时间(最大)
- 234.36s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)19.75s
响应时间(最大)49.95s
响应时间(总计)79.01s
-
编程
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)160.69s
响应时间(最大)234.36s
响应时间(总计)482.07s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)163.96s
响应时间(最大)163.96s
响应时间(总计)163.96s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)30.26s
响应时间(最大)32.03s
响应时间(总计)60.52s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)79.53s
响应时间(最大)95.52s
响应时间(总计)238.59s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)101.41s
响应时间(最大)101.41s
响应时间(总计)101.41s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)19.66s
响应时间(最大)32.25s
响应时间(总计)39.32s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)59.60s
响应时间(最大)123.57s
响应时间(总计)178.80s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.45s
响应时间(最大)7.45s
响应时间(总计)7.45s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)85.11s
响应时间(最大)85.11s
响应时间(总计)85.11s
|
| #68#68 |
Claude Opus 4.8none
|
7.0… |
Anthropic |
$0.539
…
|
3.47s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 额外格式: 3 未遵循指令: 1 无答案: 1
响应时间(平均)3.47s
响应时间(最大)17.73s
响应时间(总计)72.90s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 61.9%
- 输入令牌
- 67,104
- 输出令牌
- 8,107
- 推理令牌
- 0
- 响应时间(平均)
- 3.47s
- 响应时间(总计)
- 72.90s
- 响应时间(最大)
- 17.73s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2
响应时间(平均)3.40s
响应时间(最大)6.36s
响应时间(总计)13.58s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)3.29s
响应时间(最大)4.34s
响应时间(总计)9.88s
-
综合
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.73s
响应时间(最大)17.73s
响应时间(总计)17.73s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.77s
响应时间(最大)1.93s
响应时间(总计)3.53s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.66s
响应时间(最大)2.16s
响应时间(总计)4.99s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.48s
响应时间(最大)3.48s
响应时间(总计)3.48s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.37s
响应时间(最大)1.40s
响应时间(总计)2.73s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)2.74s
响应时间(最大)3.46s
响应时间(总计)8.22s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.35s
响应时间(最大)5.35s
响应时间(总计)5.35s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)3.41s
响应时间(最大)3.41s
响应时间(总计)3.41s
|
| #100#100 |
Grok Build 0.1none已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.0… |
X AI |
$0.547
…
|
28.69s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 API 错误: 3 未遵循指令: 2
响应时间(平均)28.69s
响应时间(最大)138.35s
响应时间(总计)459.00s
…
|
- 总测试数
- 19
- 错误测试数
- 12
- 尝试通过率
- 50.9%
- 输入令牌
- 11,793
- 输出令牌
- 267,275
- 推理令牌
- 0
- 响应时间(平均)
- 28.69s
- 响应时间(总计)
- 459.00s
- 响应时间(最大)
- 138.35s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.30s
响应时间(最大)9.80s
响应时间(总计)25.20s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.41s
响应时间(最大)21.41s
响应时间(总计)21.41s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)9.33s
响应时间(最大)9.33s
响应时间(总计)9.33s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)103.71s
响应时间(最大)138.35s
响应时间(总计)311.13s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)12.47s
响应时间(最大)12.47s
响应时间(总计)12.47s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.36s
响应时间(最大)11.05s
响应时间(总计)14.73s
-
谜题求解
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)9.55s
响应时间(最大)18.18s
响应时间(总计)28.65s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)36.09s
响应时间(最大)36.09s
响应时间(总计)36.09s
|
| #42#42 |
GPT-5.2medium
|
7.5… |
OpenAI |
$0.548
…
|
16.88s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 3 答案错误: 3 无答案: 1 超时: 1
响应时间(平均)16.88s
响应时间(最大)77.80s
响应时间(总计)236.34s
…
|
- 总测试数
- 21
- 错误测试数
- 8
- 尝试通过率
- 71.4%
- 输入令牌
- 33,967
- 输出令牌
- 2,901
- 推理令牌
- 31,932
- 响应时间(平均)
- 16.88s
- 响应时间(总计)
- 236.34s
- 响应时间(最大)
- 77.80s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)7.81s
响应时间(最大)14.34s
响应时间(总计)15.62s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)22.73s
响应时间(最大)31.19s
响应时间(总计)68.20s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.06s
响应时间(最大)14.06s
响应时间(总计)14.06s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.15s
响应时间(最大)3.15s
响应时间(总计)3.15s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)77.80s
响应时间(最大)77.80s
响应时间(总计)77.80s
-
通用智能
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.32s
响应时间(最大)4.32s
响应时间(总计)4.32s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.12s
响应时间(最大)3.12s
响应时间(总计)3.12s
-
谜题求解
: 7.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)5.80s
响应时间(最大)6.45s
响应时间(总计)11.61s
-
工具调用
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)10.30s
响应时间(最大)10.30s
响应时间(总计)10.30s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)28.18s
响应时间(最大)28.18s
响应时间(总计)28.18s
|
| #7#7 |
Gemini 3.5 Flashmedium
|
9.0… |
Google |
$0.582
…
|
4.94s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)4.94s
响应时间(最大)18.07s
响应时间(总计)103.79s
…
|
- 总测试数
- 21
- 错误测试数
- 3
- 尝试通过率
- 87.3%
- 输入令牌
- 36,936
- 输出令牌
- 2,001
- 推理令牌
- 56,408
- 响应时间(平均)
- 4.94s
- 响应时间(总计)
- 103.79s
- 响应时间(最大)
- 18.07s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.09s
响应时间(最大)2.56s
响应时间(总计)8.35s
-
编程
: 7.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)12.63s
响应时间(最大)18.07s
响应时间(总计)37.89s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.05s
响应时间(最大)12.05s
响应时间(总计)12.05s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.07s
响应时间(最大)5.60s
响应时间(总计)8.14s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.24s
响应时间(最大)6.43s
响应时间(总计)15.73s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.52s
响应时间(最大)2.52s
响应时间(总计)2.52s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.70s
响应时间(最大)3.07s
响应时间(总计)5.40s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.38s
响应时间(最大)2.55s
响应时间(总计)7.15s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.81s
响应时间(最大)3.81s
响应时间(总计)3.81s
-
常识问答
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.75s
响应时间(最大)2.75s
响应时间(总计)2.75s
|
| #29#29 |
Qwen3.5-122B-A10Bmedium
|
7.8… |
Qwen |
$0.588
↓
…
|
42.49s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 超时: 2
响应时间(平均)42.49s
响应时间(最大)168.16s
响应时间(总计)892.30s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 73.0%
- 输入令牌
- 41,832
- 输出令牌
- 26,187
- 推理令牌
- 251,028
- 响应时间(平均)
- 42.49s
- 响应时间(总计)
- 892.30s
- 响应时间(最大)
- 168.16s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.75s
响应时间(最大)18.03s
响应时间(总计)39.01s
-
编程
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)114.48s
响应时间(最大)168.16s
响应时间(总计)343.44s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)107.79s
响应时间(最大)107.79s
响应时间(总计)107.79s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.41s
响应时间(最大)29.79s
响应时间(总计)46.83s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)63.40s
响应时间(最大)119.29s
响应时间(总计)190.20s
-
通用智能
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)34.11s
响应时间(最大)34.11s
响应时间(总计)34.11s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.88s
响应时间(最大)15.44s
响应时间(总计)19.76s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.89s
响应时间(最大)31.99s
响应时间(总计)53.68s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.60s
响应时间(最大)4.60s
响应时间(总计)4.60s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)52.87s
响应时间(最大)52.87s
响应时间(总计)52.87s
|
| #65#65 |
Grok 4.20medium
|
7.1… |
X AI |
$0.609
↓
…
|
27.68s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 2 额外格式: 1
响应时间(平均)27.68s
响应时间(最大)199.66s
响应时间(总计)581.26s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 63.5%
- 输入令牌
- 44,433
- 输出令牌
- 1,819
- 推理令牌
- 219,524
- 响应时间(平均)
- 27.68s
- 响应时间(总计)
- 581.26s
- 响应时间(最大)
- 199.66s
-
反AI技巧
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.95s
响应时间(最大)5.68s
响应时间(总计)15.80s
-
编程
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)109.93s
响应时间(最大)199.66s
响应时间(总计)329.79s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.40s
响应时间(最大)17.40s
响应时间(总计)17.40s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.17s
响应时间(最大)5.02s
响应时间(总计)8.34s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)27.03s
响应时间(最大)29.87s
响应时间(总计)81.10s
-
通用智能
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)24.48s
响应时间(最大)24.48s
响应时间(总计)24.48s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.26s
响应时间(最大)4.46s
响应时间(总计)8.52s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.22s
响应时间(最大)11.63s
响应时间(总计)18.66s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)13.68s
响应时间(最大)13.68s
响应时间(总计)13.68s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)63.48s
响应时间(最大)63.48s
响应时间(总计)63.48s
|
| #38#38 |
Grok 4.3medium
|
7.6… |
X AI |
$0.614
…
|
47.51s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 2 额外格式: 1
响应时间(平均)47.51s
响应时间(最大)216.69s
响应时间(总计)997.68s
…
|
- 总测试数
- 21
- 错误测试数
- 8
- 尝试通过率
- 71.4%
- 输入令牌
- 44,472
- 输出令牌
- 1,981
- 推理令牌
- 221,382
- 响应时间(平均)
- 47.51s
- 响应时间(总计)
- 997.68s
- 响应时间(最大)
- 216.69s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.83s
响应时间(最大)11.20s
响应时间(总计)35.31s
-
编程
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)41.23s
响应时间(最大)64.81s
响应时间(总计)123.69s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)63.99s
响应时间(最大)63.99s
响应时间(总计)63.99s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)18.97s
响应时间(最大)26.99s
响应时间(总计)37.93s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)181.74s
响应时间(最大)216.69s
响应时间(总计)545.21s
-
通用智能
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)24.70s
响应时间(最大)24.70s
响应时间(总计)24.70s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)18.58s
响应时间(最大)31.48s
响应时间(总计)37.15s
-
谜题求解
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)22.52s
响应时间(最大)51.75s
响应时间(总计)67.57s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.66s
响应时间(最大)17.66s
响应时间(总计)17.66s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)44.47s
响应时间(最大)44.47s
响应时间(总计)44.47s
|
| #1🥇 #1 |
Gemini 3 Flash Previewmedium
|
9.8… |
Google |
$0.667
…
|
18.64s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)18.64s
响应时间(最大)117.26s
响应时间(总计)391.35s
…
|
- 总测试数
- 21
- 错误测试数
- 1
- 尝试通过率
- 98.4%
- 输入令牌
- 37,017
- 输出令牌
- 2,006
- 推理令牌
- 214,153
- 响应时间(平均)
- 18.64s
- 响应时间(总计)
- 391.35s
- 响应时间(最大)
- 117.26s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.88s
响应时间(最大)5.73s
响应时间(总计)15.53s
-
编程
: 8.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)84.40s
响应时间(最大)117.26s
响应时间(总计)253.21s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)22.42s
响应时间(最大)22.42s
响应时间(总计)22.42s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.43s
响应时间(最大)6.18s
响应时间(总计)10.86s
-
领域专项
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.27s
响应时间(最大)34.09s
响应时间(总计)45.80s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.19s
响应时间(最大)5.19s
响应时间(总计)5.19s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.04s
响应时间(最大)4.70s
响应时间(总计)8.08s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.05s
响应时间(最大)5.64s
响应时间(总计)12.15s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.60s
响应时间(最大)12.60s
响应时间(总计)12.60s
-
常识问答
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.50s
响应时间(最大)5.50s
响应时间(总计)5.50s
|
| #11#11 |
Claude Opus 4.7medium
|
8.7… |
Anthropic |
$0.679
…
|
4.73s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 超时: 1
响应时间(平均)4.73s
响应时间(最大)23.18s
响应时间(总计)94.51s
…
|
- 总测试数
- 21
- 错误测试数
- 4
- 尝试通过率
- 82.5%
- 输入令牌
- 65,406
- 输出令牌
- 11,858
- 推理令牌
- 2,198
- 响应时间(平均)
- 4.73s
- 响应时间(总计)
- 94.51s
- 响应时间(最大)
- 23.18s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.85s
响应时间(最大)2.71s
响应时间(总计)7.38s
-
编程
: 7.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)12.96s
响应时间(最大)23.18s
响应时间(总计)38.89s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.45s
响应时间(最大)21.45s
响应时间(总计)21.45s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.37s
响应时间(最大)3.30s
响应时间(总计)4.74s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)1.17s
响应时间(最大)1.40s
响应时间(总计)2.35s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.87s
响应时间(最大)2.87s
响应时间(总计)2.87s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.57s
响应时间(最大)1.66s
响应时间(总计)3.14s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.43s
响应时间(最大)2.89s
响应时间(总计)7.28s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.17s
响应时间(最大)4.17s
响应时间(总计)4.17s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.25s
响应时间(最大)2.25s
响应时间(总计)2.25s
|
| #80#80 |
Mimo V2 Omnimedium
|
6.7… |
Xiaomi |
$0.683
↓
…
|
41.16s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 2 无答案: 2 API 错误: 1 额外格式: 1
响应时间(平均)41.16s
响应时间(最大)299.23s
响应时间(总计)823.26s
…
|
- 总测试数
- 21
- 错误测试数
- 11
- 尝试通过率
- 55.6%
- 输入令牌
- 37,007
- 输出令牌
- 1,952
- 推理令牌
- 357,306
- 响应时间(平均)
- 41.16s
- 响应时间(总计)
- 823.26s
- 响应时间(最大)
- 299.23s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.75s
响应时间(最大)4.59s
响应时间(总计)10.98s
-
编程
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 无答案: 1 答案错误: 1
响应时间(平均)183.89s
响应时间(最大)299.23s
响应时间(总计)367.78s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)25.87s
响应时间(最大)25.87s
响应时间(总计)25.87s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.04s
响应时间(最大)4.12s
响应时间(总计)6.07s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 无答案: 1 答案错误: 1
响应时间(平均)47.89s
响应时间(最大)134.52s
响应时间(总计)143.67s
-
通用智能
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.61s
响应时间(最大)3.61s
响应时间(总计)3.61s
-
指令遵循
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.99s
响应时间(最大)7.14s
响应时间(总计)9.99s
-
谜题求解
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.38s
响应时间(最大)3.69s
响应时间(总计)7.13s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.98s
响应时间(最大)13.98s
响应时间(总计)13.98s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)234.19s
响应时间(最大)234.19s
响应时间(总计)234.19s
|
| #15#15 |
GPT-5.3-Codexmedium
|
8.4… |
OpenAI |
$0.740
…
|
16.22s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 2
响应时间(平均)16.22s
响应时间(最大)100.93s
响应时间(总计)340.67s
…
|
- 总测试数
- 21
- 错误测试数
- 6
- 尝试通过率
- 82.5%
- 输入令牌
- 34,299
- 输出令牌
- 2,357
- 推理令牌
- 46,189
- 响应时间(平均)
- 16.22s
- 响应时间(总计)
- 340.67s
- 响应时间(最大)
- 100.93s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.16s
响应时间(最大)6.68s
响应时间(总计)16.63s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)19.50s
响应时间(最大)27.96s
响应时间(总计)58.49s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)19.56s
响应时间(最大)19.56s
响应时间(总计)19.56s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.07s
响应时间(最大)3.59s
响应时间(总计)6.15s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)64.31s
响应时间(最大)100.93s
响应时间(总计)192.94s
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.87s
响应时间(最大)4.87s
响应时间(总计)4.87s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.04s
响应时间(最大)3.44s
响应时间(总计)6.07s
-
谜题求解
: 9.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)5.05s
响应时间(最大)8.73s
响应时间(总计)15.15s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.37s
响应时间(最大)6.37s
响应时间(总计)6.37s
-
常识问答
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)14.43s
响应时间(最大)14.43s
响应时间(总计)14.43s
|
| #13#13 |
Grok 4.20 Betamedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
8.5… |
X AI |
$0.750
↑
…
|
9.75s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)9.75s
响应时间(最大)31.36s
响应时间(总计)175.48s
…
|
- 总测试数
- 18
- 错误测试数
- 4
- 尝试通过率
- 81.5%
- 输入令牌
- 35,955
- 输出令牌
- 1,647
- 推理令牌
- 91,565
- 响应时间(平均)
- 9.75s
- 响应时间(总计)
- 175.48s
- 响应时间(最大)
- 31.36s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.16s
响应时间(最大)3.44s
响应时间(总计)12.65s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)31.36s
响应时间(最大)31.36s
响应时间(总计)31.36s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)20.93s
响应时间(最大)20.93s
响应时间(总计)20.93s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.01s
响应时间(最大)4.27s
响应时间(总计)8.02s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)21.33s
响应时间(最大)24.21s
响应时间(总计)64.00s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.78s
响应时间(最大)5.78s
响应时间(总计)5.78s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.89s
响应时间(最大)5.89s
响应时间(总计)9.78s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.52s
响应时间(最大)4.53s
响应时间(总计)10.57s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)12.39s
响应时间(最大)12.39s
响应时间(总计)12.39s
|
| #60#60 |
Kimi K2.6medium
|
7.2… |
Moonshot AI |
$0.891
↓
…
|
71.67s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 3 答案错误: 3 未遵循指令: 2 无答案: 1
响应时间(平均)71.67s
响应时间(最大)406.78s
响应时间(总计)1433.36s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 65.1%
- 输入令牌
- 29,450
- 输出令牌
- 102,923
- 推理令牌
- 254,094
- 响应时间(平均)
- 71.67s
- 响应时间(总计)
- 1433.36s
- 响应时间(最大)
- 406.78s
-
反AI技巧
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)11.59s
响应时间(最大)23.94s
响应时间(总计)46.37s
-
编程
: 5.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 超时: 1
响应时间(平均)214.42s
响应时间(最大)406.78s
响应时间(总计)643.25s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)40.96s
响应时间(最大)40.96s
响应时间(总计)40.96s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)20.38s
响应时间(最大)22.88s
响应时间(总计)40.76s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2
响应时间(平均)202.38s
响应时间(最大)215.85s
响应时间(总计)404.76s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.83s
响应时间(最大)17.83s
响应时间(总计)17.83s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.53s
响应时间(最大)19.15s
响应时间(总计)25.06s
-
谜题求解
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)25.06s
响应时间(最大)56.89s
响应时间(总计)75.19s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.92s
响应时间(最大)8.92s
响应时间(总计)8.92s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)130.27s
响应时间(最大)130.27s
响应时间(总计)130.27s
|
| #6#6 |
GPT-5.5low
|
9.0… |
OpenAI |
$0.907
…
|
9.76s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)9.76s
响应时间(最大)56.19s
响应时间(总计)204.92s
…
|
- 总测试数
- 21
- 错误测试数
- 3
- 尝试通过率
- 85.7%
- 输入令牌
- 34,209
- 输出令牌
- 2,046
- 推理令牌
- 22,460
- 响应时间(平均)
- 9.76s
- 响应时间(总计)
- 204.92s
- 响应时间(最大)
- 56.19s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.41s
响应时间(最大)6.32s
响应时间(总计)17.64s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.04s
响应时间(最大)21.06s
响应时间(总计)45.11s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.56s
响应时间(最大)9.56s
响应时间(总计)9.56s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.28s
响应时间(最大)5.13s
响应时间(总计)6.56s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)28.05s
响应时间(最大)56.19s
响应时间(总计)84.16s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.17s
响应时间(最大)5.17s
响应时间(总计)5.17s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.74s
响应时间(最大)3.99s
响应时间(总计)7.48s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.74s
响应时间(最大)5.61s
响应时间(总计)14.21s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.96s
响应时间(最大)4.96s
响应时间(总计)4.96s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.06s
响应时间(最大)10.06s
响应时间(总计)10.06s
|
| #47#47 |
Grok Build 0.1medium
|
7.4… |
X AI |
$0.927
…
|
49.90s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 额外格式: 3
响应时间(平均)49.90s
响应时间(最大)252.69s
响应时间(总计)1047.92s
…
|
- 总测试数
- 21
- 错误测试数
- 8
- 尝试通过率
- 61.9%
- 输入令牌
- 44,418
- 输出令牌
- 2,782
- 推理令牌
- 438,018
- 响应时间(平均)
- 49.90s
- 响应时间(总计)
- 1047.92s
- 响应时间(最大)
- 252.69s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)7.43s
响应时间(最大)10.89s
响应时间(总计)29.72s
-
编程
: 5.7
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)108.46s
响应时间(最大)200.16s
响应时间(总计)325.39s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)32.81s
响应时间(最大)32.81s
响应时间(总计)32.81s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.72s
响应时间(最大)12.13s
响应时间(总计)21.44s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)158.00s
响应时间(最大)252.69s
响应时间(总计)474.01s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)18.41s
响应时间(最大)18.41s
响应时间(总计)18.41s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.36s
响应时间(最大)20.80s
响应时间(总计)24.73s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)18.26s
响应时间(最大)44.40s
响应时间(总计)54.79s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.12s
响应时间(最大)13.12s
响应时间(总计)13.12s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)53.51s
响应时间(最大)53.51s
响应时间(总计)53.51s
|