| #34#34 |
Qwen3.7 Maxnone
|
7.7… |
Qwen |
$0.054
↓
…
|
1.30s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7
响应时间(平均)1.30s
响应时间(最大)3.92s
响应时间(总计)27.21s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 66.7%
- 输入令牌
- 37,107
- 输出令牌
- 1,994
- 推理令牌
- 0
- 响应时间(平均)
- 1.30s
- 响应时间(总计)
- 27.21s
- 响应时间(最大)
- 3.92s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.08s
响应时间(最大)1.39s
响应时间(总计)4.30s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.35s
响应时间(最大)1.63s
响应时间(总计)4.04s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.17s
响应时间(最大)2.17s
响应时间(总计)2.17s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.35s
响应时间(最大)1.43s
响应时间(总计)2.69s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)975ms
响应时间(最大)1.08s
响应时间(总计)2.92s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.04s
响应时间(最大)1.04s
响应时间(总计)1.04s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)943ms
响应时间(最大)974ms
响应时间(总计)1.89s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.13s
响应时间(最大)1.29s
响应时间(总计)3.40s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.92s
响应时间(最大)3.92s
响应时间(总计)3.92s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)856ms
响应时间(最大)856ms
响应时间(总计)856ms
|
| #36#36 |
Qwen3.5 Plus 2026-04-20medium
|
7.6… |
Qwen |
$0.317
↓
…
|
46.36s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8
响应时间(平均)46.36s
响应时间(最大)189.38s
响应时间(总计)973.57s
…
|
- 总测试数
- 21
- 错误测试数
- 8
- 尝试通过率
- 66.7%
- 输入令牌
- 42,097
- 输出令牌
- 2,280
- 推理令牌
- 166,613
- 响应时间(平均)
- 46.36s
- 响应时间(总计)
- 973.57s
- 响应时间(最大)
- 189.38s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.84s
响应时间(最大)15.11s
响应时间(总计)43.36s
-
编程
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)125.25s
响应时间(最大)189.38s
响应时间(总计)375.76s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)92.41s
响应时间(最大)92.41s
响应时间(总计)92.41s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)38.32s
响应时间(最大)41.70s
响应时间(总计)76.63s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)53.10s
响应时间(最大)90.70s
响应时间(总计)159.30s
-
通用智能
: 4.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)25.30s
响应时间(最大)25.30s
响应时间(总计)25.30s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)20.25s
响应时间(最大)21.65s
响应时间(总计)40.50s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.67s
响应时间(最大)24.83s
响应时间(总计)53.02s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.72s
响应时间(最大)14.72s
响应时间(总计)14.72s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)92.57s
响应时间(最大)92.57s
响应时间(总计)92.57s
|
| #37#37 |
Gemma 4 26B A4Bmedium
|
7.6… |
Google |
$0.045
↓
…
|
63.41s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 无答案: 2 超时: 2
响应时间(平均)63.41s
响应时间(最大)369.32s
响应时间(总计)1268.28s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 69.8%
- 输入令牌
- 40,252
- 输出令牌
- 28,000
- 推理令牌
- 100,490
- 响应时间(平均)
- 63.41s
- 响应时间(总计)
- 1268.28s
- 响应时间(最大)
- 369.32s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.20s
响应时间(最大)9.64s
响应时间(总计)24.78s
-
编程
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 2 超时: 1
响应时间(平均)272.54s
响应时间(最大)369.32s
响应时间(总计)817.61s
-
综合
: 9.6
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)73.55s
响应时间(最大)73.55s
响应时间(总计)73.55s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)16.51s
响应时间(最大)20.57s
响应时间(总计)33.02s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)23.62s
响应时间(最大)27.00s
响应时间(总计)47.23s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)29.76s
响应时间(最大)29.76s
响应时间(总计)29.76s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.54s
响应时间(最大)21.25s
响应时间(总计)35.08s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.79s
响应时间(最大)6.85s
响应时间(总计)17.36s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.01s
响应时间(最大)9.01s
响应时间(总计)9.01s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)180.87s
响应时间(最大)180.87s
响应时间(总计)180.87s
|
| #38#38 |
Grok 4.3medium
|
7.6… |
X AI |
$0.614
…
|
47.51s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 2 额外格式: 1
响应时间(平均)47.51s
响应时间(最大)216.69s
响应时间(总计)997.68s
…
|
- 总测试数
- 21
- 错误测试数
- 8
- 尝试通过率
- 71.4%
- 输入令牌
- 44,472
- 输出令牌
- 1,981
- 推理令牌
- 221,382
- 响应时间(平均)
- 47.51s
- 响应时间(总计)
- 997.68s
- 响应时间(最大)
- 216.69s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.83s
响应时间(最大)11.20s
响应时间(总计)35.31s
-
编程
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)41.23s
响应时间(最大)64.81s
响应时间(总计)123.69s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)63.99s
响应时间(最大)63.99s
响应时间(总计)63.99s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)18.97s
响应时间(最大)26.99s
响应时间(总计)37.93s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)181.74s
响应时间(最大)216.69s
响应时间(总计)545.21s
-
通用智能
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)24.70s
响应时间(最大)24.70s
响应时间(总计)24.70s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)18.58s
响应时间(最大)31.48s
响应时间(总计)37.15s
-
谜题求解
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)22.52s
响应时间(最大)51.75s
响应时间(总计)67.57s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.66s
响应时间(最大)17.66s
响应时间(总计)17.66s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)44.47s
响应时间(最大)44.47s
响应时间(总计)44.47s
|
| #39#39 |
Qwen3.6 Flashmedium
|
7.5… |
Qwen |
$0.288
↓
…
|
19.25s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 未遵循指令: 1
响应时间(平均)19.25s
响应时间(最大)122.87s
响应时间(总计)404.20s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 71.4%
- 输入令牌
- 42,362
- 输出令牌
- 2,995
- 推理令牌
- 245,358
- 响应时间(平均)
- 19.25s
- 响应时间(总计)
- 404.20s
- 响应时间(最大)
- 122.87s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.10s
响应时间(最大)9.60s
响应时间(总计)24.39s
-
编程
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)42.85s
响应时间(最大)78.01s
响应时间(总计)128.55s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)20.28s
响应时间(最大)20.28s
响应时间(总计)20.28s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.65s
响应时间(最大)10.35s
响应时间(总计)19.31s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)14.65s
响应时间(最大)26.85s
响应时间(总计)43.95s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.88s
响应时间(最大)9.88s
响应时间(总计)9.88s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.05s
响应时间(最大)6.94s
响应时间(总计)12.10s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)6.29s
响应时间(最大)8.18s
响应时间(总计)18.87s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.00s
响应时间(最大)4.00s
响应时间(总计)4.00s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)122.87s
响应时间(最大)122.87s
响应时间(总计)122.87s
|
| #40#40 |
Gemini 3.1 Flash Lite Previewmedium
|
7.5… |
Google |
$0.068
…
|
3.96s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 未遵循指令: 1
响应时间(平均)3.96s
响应时间(最大)14.93s
响应时间(总计)83.06s
…
|
- 总测试数
- 21
- 错误测试数
- 8
- 尝试通过率
- 61.9%
- 输入令牌
- 37,786
- 输出令牌
- 2,210
- 推理令牌
- 36,744
- 响应时间(平均)
- 3.96s
- 响应时间(总计)
- 83.06s
- 响应时间(最大)
- 14.93s
-
反AI技巧
: 9.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.33s
响应时间(最大)3.89s
响应时间(总计)9.30s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.09s
响应时间(最大)4.34s
响应时间(总计)12.27s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.93s
响应时间(最大)14.93s
响应时间(总计)14.93s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.29s
响应时间(最大)2.31s
响应时间(总计)4.59s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)4.21s
响应时间(最大)5.86s
响应时间(总计)12.62s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.16s
响应时间(最大)3.16s
响应时间(总计)3.16s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.91s
响应时间(最大)1.93s
响应时间(总计)3.82s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.30s
响应时间(最大)9.55s
响应时间(总计)15.89s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.80s
响应时间(最大)3.80s
响应时间(总计)3.80s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.68s
响应时间(最大)2.68s
响应时间(总计)2.68s
|
| #42#42 |
GPT-5.2medium
|
7.5… |
OpenAI |
$0.548
…
|
16.88s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 3 答案错误: 3 无答案: 1 超时: 1
响应时间(平均)16.88s
响应时间(最大)77.80s
响应时间(总计)236.34s
…
|
- 总测试数
- 21
- 错误测试数
- 8
- 尝试通过率
- 71.4%
- 输入令牌
- 33,967
- 输出令牌
- 2,901
- 推理令牌
- 31,932
- 响应时间(平均)
- 16.88s
- 响应时间(总计)
- 236.34s
- 响应时间(最大)
- 77.80s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)7.81s
响应时间(最大)14.34s
响应时间(总计)15.62s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)22.73s
响应时间(最大)31.19s
响应时间(总计)68.20s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.06s
响应时间(最大)14.06s
响应时间(总计)14.06s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.15s
响应时间(最大)3.15s
响应时间(总计)3.15s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)77.80s
响应时间(最大)77.80s
响应时间(总计)77.80s
-
通用智能
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.32s
响应时间(最大)4.32s
响应时间(总计)4.32s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.12s
响应时间(最大)3.12s
响应时间(总计)3.12s
-
谜题求解
: 7.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)5.80s
响应时间(最大)6.45s
响应时间(总计)11.61s
-
工具调用
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)10.30s
响应时间(最大)10.30s
响应时间(总计)10.30s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)28.18s
响应时间(最大)28.18s
响应时间(总计)28.18s
|
| #43#43 |
MiMo-V2.5-Promedium
|
7.5… |
Xiaomi |
$0.106
↓
…
|
26.13s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 3 答案错误: 3 未遵循指令: 2 API 错误: 1
响应时间(平均)26.13s
响应时间(最大)130.77s
响应时间(总计)548.65s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 68.3%
- 输入令牌
- 40,854
- 输出令牌
- 5,015
- 推理令牌
- 97,742
- 响应时间(平均)
- 26.13s
- 响应时间(总计)
- 548.65s
- 响应时间(最大)
- 130.77s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.26s
响应时间(最大)6.38s
响应时间(总计)13.06s
-
编程
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 额外格式: 1
响应时间(平均)92.07s
响应时间(最大)130.77s
响应时间(总计)276.20s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)53.36s
响应时间(最大)53.36s
响应时间(总计)53.36s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)18.81s
响应时间(最大)20.29s
响应时间(总计)37.61s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2
响应时间(平均)37.87s
响应时间(最大)84.22s
响应时间(总计)113.60s
-
通用智能
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.02s
响应时间(最大)4.02s
响应时间(总计)4.02s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.77s
响应时间(最大)3.21s
响应时间(总计)5.54s
-
谜题求解
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)5.31s
响应时间(最大)9.12s
响应时间(总计)15.94s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)16.87s
响应时间(最大)16.87s
响应时间(总计)16.87s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)12.46s
响应时间(最大)12.46s
响应时间(总计)12.46s
|
| #44#44 |
Gemini 3.1 Flash Litemedium
|
7.5… |
Google |
$0.071
…
|
3.23s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 未遵循指令: 1
响应时间(平均)3.23s
响应时间(最大)10.87s
响应时间(总计)67.80s
…
|
- 总测试数
- 21
- 错误测试数
- 8
- 尝试通过率
- 65.1%
- 输入令牌
- 36,808
- 输出令牌
- 2,254
- 推理令牌
- 38,300
- 响应时间(平均)
- 3.23s
- 响应时间(总计)
- 67.80s
- 响应时间(最大)
- 10.87s
-
反AI技巧
: 9.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.39s
响应时间(最大)3.58s
响应时间(总计)9.57s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.81s
响应时间(最大)4.25s
响应时间(总计)11.44s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.87s
响应时间(最大)10.87s
响应时间(总计)10.87s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.60s
响应时间(最大)2.69s
响应时间(总计)5.19s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)3.16s
响应时间(最大)3.89s
响应时间(总计)9.49s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.60s
响应时间(最大)2.60s
响应时间(总计)2.60s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.59s
响应时间(最大)3.04s
响应时间(总计)5.17s
-
谜题求解
: 7.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.95s
响应时间(最大)2.48s
响应时间(总计)5.84s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.55s
响应时间(最大)4.55s
响应时间(总计)4.55s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.08s
响应时间(最大)3.08s
响应时间(总计)3.08s
|
| #45#45 |
GPT-5.4 Minimedium
|
7.5… |
OpenAI |
$0.526
…
|
22.34s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 3
响应时间(平均)22.34s
响应时间(最大)138.75s
响应时间(总计)469.20s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 73.0%
- 输入令牌
- 34,116
- 输出令牌
- 2,181
- 推理令牌
- 108,937
- 响应时间(平均)
- 22.34s
- 响应时间(总计)
- 469.20s
- 响应时间(最大)
- 138.75s
-
反AI技巧
: 8.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.05s
响应时间(最大)6.69s
响应时间(总计)16.20s
-
编程
: 8.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)57.87s
响应时间(最大)138.75s
响应时间(总计)173.61s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.81s
响应时间(最大)17.81s
响应时间(总计)17.81s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.43s
响应时间(最大)3.39s
响应时间(总计)4.87s
-
领域专项
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)65.31s
响应时间(最大)102.91s
响应时间(总计)195.92s
-
通用智能
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.72s
响应时间(最大)3.72s
响应时间(总计)3.72s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.13s
响应时间(最大)2.45s
响应时间(总计)4.25s
-
谜题求解
: 7.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.37s
响应时间(最大)7.27s
响应时间(总计)13.11s
-
工具调用
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)9.62s
响应时间(最大)9.62s
响应时间(总计)9.62s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)30.10s
响应时间(最大)30.10s
响应时间(总计)30.10s
|
| #46#46 |
Qwen3.6 35B A3Bmedium
|
7.4… |
Qwen |
$0.146
↑
…
|
18.08s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 API 错误: 2 未遵循指令: 1 无答案: 1
响应时间(平均)18.08s
响应时间(最大)86.11s
响应时间(总计)343.61s
…
|
- 总测试数
- 21
- 错误测试数
- 8
- 尝试通过率
- 63.5%
- 输入令牌
- 16,385
- 输出令牌
- 19,632
- 推理令牌
- 130,219
- 响应时间(平均)
- 18.08s
- 响应时间(总计)
- 343.61s
- 响应时间(最大)
- 86.11s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.02s
响应时间(最大)8.79s
响应时间(总计)24.07s
-
编程
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)50.55s
响应时间(最大)86.11s
响应时间(总计)151.65s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.99s
响应时间(最大)13.75s
响应时间(总计)25.99s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)22.50s
响应时间(最大)45.02s
响应时间(总计)67.51s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)8.66s
响应时间(最大)8.66s
响应时间(总计)8.66s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.50s
响应时间(最大)10.22s
响应时间(总计)15.00s
-
谜题求解
: 8.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.95s
响应时间(最大)8.42s
响应时间(总计)17.84s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)32.90s
响应时间(最大)32.90s
响应时间(总计)32.90s
|
| #47#47 |
Grok Build 0.1medium
|
7.4… |
X AI |
$0.927
…
|
49.90s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 额外格式: 3
响应时间(平均)49.90s
响应时间(最大)252.69s
响应时间(总计)1047.92s
…
|
- 总测试数
- 21
- 错误测试数
- 8
- 尝试通过率
- 61.9%
- 输入令牌
- 44,418
- 输出令牌
- 2,782
- 推理令牌
- 438,018
- 响应时间(平均)
- 49.90s
- 响应时间(总计)
- 1047.92s
- 响应时间(最大)
- 252.69s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)7.43s
响应时间(最大)10.89s
响应时间(总计)29.72s
-
编程
: 5.7
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)108.46s
响应时间(最大)200.16s
响应时间(总计)325.39s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)32.81s
响应时间(最大)32.81s
响应时间(总计)32.81s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.72s
响应时间(最大)12.13s
响应时间(总计)21.44s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)158.00s
响应时间(最大)252.69s
响应时间(总计)474.01s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)18.41s
响应时间(最大)18.41s
响应时间(总计)18.41s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.36s
响应时间(最大)20.80s
响应时间(总计)24.73s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)18.26s
响应时间(最大)44.40s
响应时间(总计)54.79s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.12s
响应时间(最大)13.12s
响应时间(总计)13.12s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)53.51s
响应时间(最大)53.51s
响应时间(总计)53.51s
|
| #48#48 |
Gemini 3 Flash Previewnone
|
7.4… |
Google |
$0.025
…
|
1.65s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8
响应时间(平均)1.65s
响应时间(最大)3.56s
响应时间(总计)23.07s
…
|
- 总测试数
- 21
- 错误测试数
- 8
- 尝试通过率
- 66.7%
- 输入令牌
- 37,011
- 输出令牌
- 1,885
- 推理令牌
- 0
- 响应时间(平均)
- 1.65s
- 响应时间(总计)
- 23.07s
- 响应时间(最大)
- 3.56s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.25s
响应时间(最大)1.59s
响应时间(总计)2.49s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.80s
响应时间(最大)2.79s
响应时间(总计)5.40s
-
综合
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.56s
响应时间(最大)3.56s
响应时间(总计)3.56s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.41s
响应时间(最大)1.41s
响应时间(总计)1.41s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)963ms
响应时间(最大)963ms
响应时间(总计)963ms
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.13s
响应时间(最大)1.13s
响应时间(总计)1.13s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.58s
响应时间(最大)1.58s
响应时间(总计)1.58s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.05s
响应时间(最大)1.06s
响应时间(总计)2.11s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.35s
响应时间(最大)3.35s
响应时间(总计)3.35s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.07s
响应时间(最大)1.07s
响应时间(总计)1.07s
|
| #49#49 |
Qwen3.5-Flashmedium
|
7.4… |
Qwen |
$0.080
↓
…
|
63.29s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 超时: 3 API 错误: 1 未遵循指令: 1
响应时间(平均)63.29s
响应时间(最大)234.29s
响应时间(总计)1265.85s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 71.4%
- 输入令牌
- 38,926
- 输出令牌
- 2,088
- 推理令牌
- 294,598
- 响应时间(平均)
- 63.29s
- 响应时间(总计)
- 1265.85s
- 响应时间(最大)
- 234.29s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)59.11s
响应时间(最大)168.31s
响应时间(总计)236.44s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)58.87s
响应时间(最大)68.14s
响应时间(总计)176.60s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.78s
响应时间(最大)17.78s
响应时间(总计)17.78s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)56.99s
响应时间(最大)80.14s
响应时间(总计)113.98s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)146.50s
响应时间(最大)234.29s
响应时间(总计)439.49s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)40.05s
响应时间(最大)40.05s
响应时间(总计)40.05s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)63.49s
响应时间(最大)111.61s
响应时间(总计)126.98s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)27.61s
响应时间(最大)31.84s
响应时间(总计)55.21s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.33s
响应时间(最大)10.33s
响应时间(总计)10.33s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)48.98s
响应时间(最大)48.98s
响应时间(总计)48.98s
|
| #50#50 |
Gemini 3.1 Flash Lite Previewlow
|
7.4… |
Google |
$0.026
…
|
2.77s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 未遵循指令: 1
响应时间(平均)2.77s
响应时间(最大)11.91s
响应时间(总计)58.12s
…
|
- 总测试数
- 21
- 错误测试数
- 8
- 尝试通过率
- 61.9%
- 输入令牌
- 32,715
- 输出令牌
- 2,286
- 推理令牌
- 9,166
- 响应时间(平均)
- 2.77s
- 响应时间(总计)
- 58.12s
- 响应时间(最大)
- 11.91s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.12s
响应时间(最大)3.18s
响应时间(总计)8.50s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.39s
响应时间(最大)2.20s
响应时间(总计)4.16s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)11.91s
响应时间(最大)11.91s
响应时间(总计)11.91s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.00s
响应时间(最大)3.74s
响应时间(总计)5.99s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.36s
响应时间(最大)3.51s
响应时间(总计)7.07s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.54s
响应时间(最大)1.54s
响应时间(总计)1.54s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.49s
响应时间(最大)1.66s
响应时间(总计)2.99s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.69s
响应时间(最大)1.89s
响应时间(总计)5.08s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.54s
响应时间(最大)9.54s
响应时间(总计)9.54s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.35s
响应时间(最大)1.35s
响应时间(总计)1.35s
|
| #52#52 |
Claude Sonnet 4.6medium
|
7.4… |
Anthropic |
$1.418
…
|
17.06s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 额外格式: 3 超时: 1
响应时间(平均)17.06s
响应时间(最大)46.35s
响应时间(总计)221.83s
…
|
- 总测试数
- 21
- 错误测试数
- 8
- 尝试通过率
- 65.1%
- 输入令牌
- 49,112
- 输出令牌
- 54,703
- 推理令牌
- 29,970
- 响应时间(平均)
- 17.06s
- 响应时间(总计)
- 221.83s
- 响应时间(最大)
- 46.35s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)2.98s
响应时间(最大)4.95s
响应时间(总计)5.97s
-
编程
: 5.7
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)33.29s
响应时间(最大)35.76s
响应时间(总计)99.86s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)46.35s
响应时间(最大)46.35s
响应时间(总计)46.35s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.90s
响应时间(最大)13.90s
响应时间(总计)13.90s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 超时: 1 答案错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.94s
响应时间(最大)4.94s
响应时间(总计)4.94s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.61s
响应时间(最大)2.61s
响应时间(总计)2.61s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.31s
响应时间(最大)6.24s
响应时间(总计)10.62s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.48s
响应时间(最大)7.48s
响应时间(总计)7.48s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)30.09s
响应时间(最大)30.09s
响应时间(总计)30.09s
|
| #53#53 |
Gemini 3.1 Flash Litehigh已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
7.3… |
Google |
$2.044
…
|
61.96s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 3 无答案: 1
响应时间(平均)61.96s
响应时间(最大)149.23s
响应时间(总计)1115.31s
…
|
- 总测试数
- 18
- 错误测试数
- 8
- 尝试通过率
- 68.5%
- 输入令牌
- 29,134
- 输出令牌
- 1,984
- 推理令牌
- 1,355,583
- 响应时间(平均)
- 61.96s
- 响应时间(总计)
- 1115.31s
- 响应时间(最大)
- 149.23s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)37.16s
响应时间(最大)140.53s
响应时间(总计)148.65s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)137.63s
响应时间(最大)137.63s
响应时间(总计)137.63s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)149.23s
响应时间(最大)149.23s
响应时间(总计)149.23s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.49s
响应时间(最大)4.96s
响应时间(总计)8.98s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)139.90s
响应时间(最大)141.40s
响应时间(总计)419.69s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)45.69s
响应时间(最大)45.69s
响应时间(总计)45.69s
-
指令遵循
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)23.26s
响应时间(最大)43.87s
响应时间(总计)46.51s
-
谜题求解
: 5.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2
响应时间(平均)50.83s
响应时间(最大)144.85s
响应时间(总计)152.49s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.44s
响应时间(最大)6.44s
响应时间(总计)6.44s
|
| #54#54 |
GPT-5 Minimedium
|
7.3… |
OpenAI |
$0.159
…
|
23.64s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 3 超时: 1
响应时间(平均)23.64s
响应时间(最大)88.15s
响应时间(总计)496.44s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 63.5%
- 输入令牌
- 37,100
- 输出令牌
- 6,801
- 推理令牌
- 67,690
- 响应时间(平均)
- 23.64s
- 响应时间(总计)
- 496.44s
- 响应时间(最大)
- 88.15s
-
反AI技巧
: 7.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)13.86s
响应时间(最大)26.00s
响应时间(总计)55.45s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)27.63s
响应时间(最大)38.31s
响应时间(总计)82.89s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)88.15s
响应时间(最大)88.15s
响应时间(总计)88.15s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.58s
响应时间(最大)13.87s
响应时间(总计)25.16s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)44.63s
响应时间(最大)82.55s
响应时间(总计)133.89s
-
通用智能
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)13.50s
响应时间(最大)13.50s
响应时间(总计)13.50s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.59s
响应时间(最大)13.66s
响应时间(总计)23.18s
-
谜题求解
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)15.20s
响应时间(最大)18.90s
响应时间(总计)45.59s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)18.64s
响应时间(最大)18.64s
响应时间(总计)18.64s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.99s
响应时间(最大)9.99s
响应时间(总计)9.99s
|
| #56#56 |
MiMo-V2.5medium
|
7.3… |
Xiaomi |
$0.063
↓
…
|
27.11s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 额外格式: 2 未遵循指令: 1 无答案: 1
响应时间(平均)27.11s
响应时间(最大)162.44s
响应时间(总计)569.38s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 69.8%
- 输入令牌
- 41,838
- 输出令牌
- 2,827
- 推理令牌
- 198,898
- 响应时间(平均)
- 27.11s
- 响应时间(总计)
- 569.38s
- 响应时间(最大)
- 162.44s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.14s
响应时间(最大)12.41s
响应时间(总计)16.57s
-
编程
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)97.14s
响应时间(最大)162.44s
响应时间(总计)291.41s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)16.86s
响应时间(最大)16.86s
响应时间(总计)16.86s
-
数据解析与提取
: 2.7
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)6.33s
响应时间(最大)7.45s
响应时间(总计)12.67s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)34.53s
响应时间(最大)86.93s
响应时间(总计)103.59s
-
通用智能
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)5.37s
响应时间(最大)5.37s
响应时间(总计)5.37s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.80s
响应时间(最大)1.81s
响应时间(总计)3.60s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)20.25s
响应时间(最大)57.93s
响应时间(总计)60.76s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.29s
响应时间(最大)7.29s
响应时间(总计)7.29s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)51.29s
响应时间(最大)51.29s
响应时间(总计)51.29s
|
| #57#57 |
Step 3.7 Flashlow
|
7.3… |
Stepfun |
$0.341
…
|
15.74s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 无答案: 1
响应时间(平均)15.74s
响应时间(最大)124.75s
响应时间(总计)330.63s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 68.3%
- 输入令牌
- 40,101
- 输出令牌
- 289,325
- 推理令牌
- 0
- 响应时间(平均)
- 15.74s
- 响应时间(总计)
- 330.63s
- 响应时间(最大)
- 124.75s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.02s
响应时间(最大)12.52s
响应时间(总计)16.10s
-
编程
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.46s
响应时间(最大)12.69s
响应时间(总计)28.38s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.98s
响应时间(最大)7.98s
响应时间(总计)7.98s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.29s
响应时间(最大)3.15s
响应时间(总计)4.58s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)43.31s
响应时间(最大)72.27s
响应时间(总计)129.92s
-
通用智能
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.00s
响应时间(最大)7.00s
响应时间(总计)7.00s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.58s
响应时间(最大)1.80s
响应时间(总计)3.16s
-
谜题求解
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.84s
响应时间(最大)3.42s
响应时间(总计)5.52s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.25s
响应时间(最大)3.25s
响应时间(总计)3.25s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)124.75s
响应时间(最大)124.75s
响应时间(总计)124.75s
|
| #58#58 |
Gemini 3.1 Flash Lite Previewnone
|
7.2… |
Google |
$0.018
…
|
1.21s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 未遵循指令: 2
响应时间(平均)1.21s
响应时间(最大)3.39s
响应时间(总计)25.45s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 60.3%
- 输入令牌
- 37,582
- 输出令牌
- 5,547
- 推理令牌
- 0
- 响应时间(平均)
- 1.21s
- 响应时间(总计)
- 25.45s
- 响应时间(最大)
- 3.39s
-
反AI技巧
: 7.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.04s
响应时间(最大)1.47s
响应时间(总计)4.17s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)967ms
响应时间(最大)1.47s
响应时间(总计)2.90s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.20s
响应时间(最大)3.20s
响应时间(总计)3.20s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.22s
响应时间(最大)1.33s
响应时间(总计)2.44s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)942ms
响应时间(最大)1.12s
响应时间(总计)2.83s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)741ms
响应时间(最大)741ms
响应时间(总计)741ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.13s
响应时间(最大)1.14s
响应时间(总计)2.27s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)900ms
响应时间(最大)962ms
响应时间(总计)2.70s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.39s
响应时间(最大)3.39s
响应时间(总计)3.39s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)814ms
响应时间(最大)814ms
响应时间(总计)814ms
|
| #59#59 |
GLM 5V Turbomedium
|
7.2… |
Z.ai |
$0.457
…
|
23.08s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 无效工具调用: 2 未遵循指令: 1
响应时间(平均)23.08s
响应时间(最大)95.88s
响应时间(总计)484.63s
…
|
- 总测试数
- 21
- 错误测试数
- 10
- 尝试通过率
- 68.3%
- 输入令牌
- 44,615
- 输出令牌
- 2,347
- 推理令牌
- 98,415
- 响应时间(平均)
- 23.08s
- 响应时间(总计)
- 484.63s
- 响应时间(最大)
- 95.88s
-
反AI技巧
: 7.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)10.76s
响应时间(最大)14.40s
响应时间(总计)43.02s
-
编程
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)63.38s
响应时间(最大)95.88s
响应时间(总计)190.15s
-
综合
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)15.06s
响应时间(最大)15.06s
响应时间(总计)15.06s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.60s
响应时间(最大)9.92s
响应时间(总计)19.19s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)38.15s
响应时间(最大)67.08s
响应时间(总计)114.45s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.09s
响应时间(最大)11.09s
响应时间(总计)11.09s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.74s
响应时间(最大)5.23s
响应时间(总计)7.47s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.24s
响应时间(最大)16.95s
响应时间(总计)30.72s
-
工具调用
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)12.53s
响应时间(最大)12.53s
响应时间(总计)12.53s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)40.96s
响应时间(最大)40.96s
响应时间(总计)40.96s
|
| #60#60 |
Kimi K2.6medium
|
7.2… |
Moonshot AI |
$0.891
↓
…
|
71.67s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 3 答案错误: 3 未遵循指令: 2 无答案: 1
响应时间(平均)71.67s
响应时间(最大)406.78s
响应时间(总计)1433.36s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 65.1%
- 输入令牌
- 29,450
- 输出令牌
- 102,923
- 推理令牌
- 254,094
- 响应时间(平均)
- 71.67s
- 响应时间(总计)
- 1433.36s
- 响应时间(最大)
- 406.78s
-
反AI技巧
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)11.59s
响应时间(最大)23.94s
响应时间(总计)46.37s
-
编程
: 5.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 超时: 1
响应时间(平均)214.42s
响应时间(最大)406.78s
响应时间(总计)643.25s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)40.96s
响应时间(最大)40.96s
响应时间(总计)40.96s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)20.38s
响应时间(最大)22.88s
响应时间(总计)40.76s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2
响应时间(平均)202.38s
响应时间(最大)215.85s
响应时间(总计)404.76s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.83s
响应时间(最大)17.83s
响应时间(总计)17.83s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.53s
响应时间(最大)19.15s
响应时间(总计)25.06s
-
谜题求解
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)25.06s
响应时间(最大)56.89s
响应时间(总计)75.19s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.92s
响应时间(最大)8.92s
响应时间(总计)8.92s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)130.27s
响应时间(最大)130.27s
响应时间(总计)130.27s
|
| #61#61 |
Gemini 3.1 Flash Litelow
|
7.2… |
Google |
$0.028
…
|
1.89s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9
响应时间(平均)1.89s
响应时间(最大)5.66s
响应时间(总计)39.62s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 61.9%
- 输入令牌
- 36,892
- 输出令牌
- 2,732
- 推理令牌
- 9,260
- 响应时间(平均)
- 1.89s
- 响应时间(总计)
- 39.62s
- 响应时间(最大)
- 5.66s
-
反AI技巧
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.84s
响应时间(最大)3.08s
响应时间(总计)7.37s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.53s
响应时间(最大)1.97s
响应时间(总计)4.58s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.48s
响应时间(最大)4.48s
响应时间(总计)4.48s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.44s
响应时间(最大)1.51s
响应时间(总计)2.89s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.52s
响应时间(最大)1.63s
响应时间(总计)4.57s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.37s
响应时间(最大)1.37s
响应时间(总计)1.37s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.52s
响应时间(最大)1.68s
响应时间(总计)3.04s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.40s
响应时间(最大)1.41s
响应时间(总计)4.20s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.66s
响应时间(最大)5.66s
响应时间(总计)5.66s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.46s
响应时间(最大)1.46s
响应时间(总计)1.46s
|
| #62#62 |
Step 3.5 Flashmedium
|
7.2… |
Stepfun |
$0.070
↑
…
|
72.53s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 3 无答案: 1 超时: 1
响应时间(平均)72.53s
响应时间(最大)453.94s
响应时间(总计)1015.47s
…
|
- 总测试数
- 20
- 错误测试数
- 9
- 尝试通过率
- 56.7%
- 输入令牌
- 34,431
- 输出令牌
- 91,587
- 推理令牌
- 195,973
- 响应时间(平均)
- 72.53s
- 响应时间(总计)
- 1015.47s
- 响应时间(最大)
- 453.94s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)40.57s
响应时间(最大)110.43s
响应时间(总计)121.72s
-
编程
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 超时: 1
响应时间(平均)258.38s
响应时间(最大)453.94s
响应时间(总计)516.77s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)29.57s
响应时间(最大)29.57s
响应时间(总计)29.57s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.01s
响应时间(最大)15.01s
响应时间(总计)15.01s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)170.45s
响应时间(最大)170.45s
响应时间(总计)170.45s
-
通用智能
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)22.39s
响应时间(最大)22.39s
响应时间(总计)22.39s
-
指令遵循
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.78s
响应时间(最大)4.78s
响应时间(总计)4.78s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)7.22s
响应时间(最大)10.60s
响应时间(总计)14.44s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.91s
响应时间(最大)11.91s
响应时间(总计)11.91s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)108.45s
响应时间(最大)108.45s
响应时间(总计)108.45s
|
| #63#63 |
GPT-5.3 Chatnone
|
7.2… |
OpenAI |
$0.433
…
|
6.34s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 未遵循指令: 2
响应时间(平均)6.34s
响应时间(最大)18.33s
响应时间(总计)133.13s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 66.7%
- 输入令牌
- 34,209
- 输出令牌
- 26,617
- 推理令牌
- 0
- 响应时间(平均)
- 6.34s
- 响应时间(总计)
- 133.13s
- 响应时间(最大)
- 18.33s
-
反AI技巧
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)3.86s
响应时间(最大)7.35s
响应时间(总计)15.44s
-
编程
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)10.52s
响应时间(最大)11.72s
响应时间(总计)31.55s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.96s
响应时间(最大)11.96s
响应时间(总计)11.96s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.21s
响应时间(最大)2.52s
响应时间(总计)4.42s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)13.01s
响应时间(最大)18.33s
响应时间(总计)39.04s
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.99s
响应时间(最大)1.99s
响应时间(总计)1.99s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.51s
响应时间(最大)4.60s
响应时间(总计)7.01s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.99s
响应时间(最大)3.16s
响应时间(总计)8.97s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.36s
响应时间(最大)8.36s
响应时间(总计)8.36s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.38s
响应时间(最大)4.38s
响应时间(总计)4.38s
|
| #64#64 |
MiMo-V2-Flashmedium
|
7.2… |
Xiaomi |
$0.043
↑
…
|
20.11s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 API 错误: 1 额外格式: 1 未遵循指令: 1 超时: 1
响应时间(平均)20.11s
响应时间(最大)96.01s
响应时间(总计)301.59s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 65.1%
- 输入令牌
- 40,111
- 输出令牌
- 12,476
- 推理令牌
- 125,039
- 响应时间(平均)
- 20.11s
- 响应时间(总计)
- 301.59s
- 响应时间(最大)
- 96.01s
-
反AI技巧
: 8.1
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)15.85s
响应时间(最大)20.83s
响应时间(总计)47.55s
-
编程
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)10.71s
响应时间(最大)17.72s
响应时间(总计)32.13s
-
综合
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)75.68s
响应时间(最大)75.68s
响应时间(总计)75.68s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)96.01s
响应时间(最大)96.01s
响应时间(总计)96.01s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.20s
响应时间(最大)4.20s
响应时间(总计)4.20s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.28s
响应时间(最大)7.37s
响应时间(总计)8.55s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.87s
响应时间(最大)5.26s
响应时间(总计)7.74s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)27.78s
响应时间(最大)27.78s
响应时间(总计)27.78s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.96s
响应时间(最大)1.96s
响应时间(总计)1.96s
|
| #65#65 |
Grok 4.20medium
|
7.1… |
X AI |
$0.609
↓
…
|
27.68s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 2 额外格式: 1
响应时间(平均)27.68s
响应时间(最大)199.66s
响应时间(总计)581.26s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 63.5%
- 输入令牌
- 44,433
- 输出令牌
- 1,819
- 推理令牌
- 219,524
- 响应时间(平均)
- 27.68s
- 响应时间(总计)
- 581.26s
- 响应时间(最大)
- 199.66s
-
反AI技巧
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.95s
响应时间(最大)5.68s
响应时间(总计)15.80s
-
编程
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)109.93s
响应时间(最大)199.66s
响应时间(总计)329.79s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.40s
响应时间(最大)17.40s
响应时间(总计)17.40s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.17s
响应时间(最大)5.02s
响应时间(总计)8.34s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)27.03s
响应时间(最大)29.87s
响应时间(总计)81.10s
-
通用智能
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)24.48s
响应时间(最大)24.48s
响应时间(总计)24.48s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.26s
响应时间(最大)4.46s
响应时间(总计)8.52s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.22s
响应时间(最大)11.63s
响应时间(总计)18.66s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)13.68s
响应时间(最大)13.68s
响应时间(总计)13.68s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)63.48s
响应时间(最大)63.48s
响应时间(总计)63.48s
|
| #66#66 |
Qwen3.5-35B-A3Bmedium
|
7.1… |
Qwen |
$0.401
↓
…
|
72.57s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 5 无答案: 2 答案错误: 2 API 错误: 1
响应时间(平均)72.57s
响应时间(最大)409.98s
响应时间(总计)1524.04s
…
|
- 总测试数
- 21
- 错误测试数
- 10
- 尝试通过率
- 69.8%
- 输入令牌
- 42,196
- 输出令牌
- 40,630
- 推理令牌
- 353,577
- 响应时间(平均)
- 72.57s
- 响应时间(总计)
- 1524.04s
- 响应时间(最大)
- 409.98s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.13s
响应时间(最大)34.96s
响应时间(总计)84.53s
-
编程
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 超时: 1
响应时间(平均)206.65s
响应时间(最大)409.98s
响应时间(总计)619.94s
-
综合
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)75.34s
响应时间(最大)75.34s
响应时间(总计)75.34s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)59.33s
响应时间(最大)97.12s
响应时间(总计)118.65s
-
领域专项
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 答案错误: 1
响应时间(平均)88.34s
响应时间(最大)106.00s
响应时间(总计)265.01s
-
通用智能
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)30.30s
响应时间(最大)30.30s
响应时间(总计)30.30s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)24.45s
响应时间(最大)43.36s
响应时间(总计)48.89s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)33.13s
响应时间(最大)64.81s
响应时间(总计)99.38s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.65s
响应时间(最大)4.65s
响应时间(总计)4.65s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)177.35s
响应时间(最大)177.35s
响应时间(总计)177.35s
|
| #68#68 |
Claude Opus 4.8none
|
7.0… |
Anthropic |
$0.539
…
|
3.47s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 额外格式: 3 未遵循指令: 1 无答案: 1
响应时间(平均)3.47s
响应时间(最大)17.73s
响应时间(总计)72.90s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 61.9%
- 输入令牌
- 67,104
- 输出令牌
- 8,107
- 推理令牌
- 0
- 响应时间(平均)
- 3.47s
- 响应时间(总计)
- 72.90s
- 响应时间(最大)
- 17.73s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2
响应时间(平均)3.40s
响应时间(最大)6.36s
响应时间(总计)13.58s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)3.29s
响应时间(最大)4.34s
响应时间(总计)9.88s
-
综合
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.73s
响应时间(最大)17.73s
响应时间(总计)17.73s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.77s
响应时间(最大)1.93s
响应时间(总计)3.53s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.66s
响应时间(最大)2.16s
响应时间(总计)4.99s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.48s
响应时间(最大)3.48s
响应时间(总计)3.48s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.37s
响应时间(最大)1.40s
响应时间(总计)2.73s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)2.74s
响应时间(最大)3.46s
响应时间(总计)8.22s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.35s
响应时间(最大)5.35s
响应时间(总计)5.35s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)3.41s
响应时间(最大)3.41s
响应时间(总计)3.41s
|