| #118#118 |
Owl Alphanone
|
5.7… |
Openrouter |
$0.000
…
|
8.80s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 3 额外格式: 1
响应时间(平均)8.80s
响应时间(最大)47.10s
响应时间(总计)176.09s
…
|
- 总测试数
- 20
- 错误测试数
- 13
- 尝试通过率
- 38.3%
- 输入令牌
- 39,406
- 输出令牌
- 4,802
- 推理令牌
- 0
- 响应时间(平均)
- 8.80s
- 响应时间(总计)
- 176.09s
- 响应时间(最大)
- 47.10s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)2.78s
响应时间(最大)3.09s
响应时间(总计)11.10s
-
编程
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)39.68s
响应时间(最大)47.10s
响应时间(总计)79.37s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)21.74s
响应时间(最大)21.74s
响应时间(总计)21.74s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.60s
响应时间(最大)3.92s
响应时间(总计)7.19s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.00s
响应时间(最大)4.69s
响应时间(总计)8.99s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.61s
响应时间(最大)4.61s
响应时间(总计)4.61s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.63s
响应时间(最大)2.77s
响应时间(总计)5.27s
-
谜题求解
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)4.18s
响应时间(最大)8.27s
响应时间(总计)12.54s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)22.78s
响应时间(最大)22.78s
响应时间(总计)22.78s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.50s
响应时间(最大)2.50s
响应时间(总计)2.50s
|
| #129#129 |
Mistral Small 4medium
|
5.4… |
Mistral |
$0.056
…
|
8.35s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 API 错误: 2 未遵循指令: 2
响应时间(平均)8.35s
响应时间(最大)59.15s
响应时间(总计)167.08s
…
|
- 总测试数
- 20
- 错误测试数
- 15
- 尝试通过率
- 45.0%
- 输入令牌
- 39,834
- 输出令牌
- 21,871
- 推理令牌
- 68,349
- 响应时间(平均)
- 8.35s
- 响应时间(总计)
- 167.08s
- 响应时间(最大)
- 59.15s
-
反AI技巧
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.67s
响应时间(最大)5.03s
响应时间(总计)10.66s
-
编程
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)44.82s
响应时间(最大)59.15s
响应时间(总计)89.64s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)25.25s
响应时间(最大)25.25s
响应时间(总计)25.25s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)1.23s
响应时间(最大)1.96s
响应时间(总计)2.46s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)6.11s
响应时间(最大)13.72s
响应时间(总计)18.34s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.05s
响应时间(最大)2.05s
响应时间(总计)2.05s
-
指令遵循
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.38s
响应时间(最大)1.61s
响应时间(总计)2.75s
-
谜题求解
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)2.17s
响应时间(最大)2.60s
响应时间(总计)6.50s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.50s
响应时间(最大)3.50s
响应时间(总计)3.50s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.92s
响应时间(最大)5.92s
响应时间(总计)5.92s
|
| #2🥈 #2 |
Gemini 3.5 Flashhigh
|
9.6… |
Google |
$0.994
…
|
8.30s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)8.30s
响应时间(最大)34.82s
响应时间(总计)165.92s
…
|
- 总测试数
- 20
- 错误测试数
- 1
- 尝试通过率
- 96.7%
- 输入令牌
- 34,591
- 输出令牌
- 1,969
- 推理令牌
- 102,679
- 响应时间(平均)
- 8.30s
- 响应时间(总计)
- 165.92s
- 响应时间(最大)
- 34.82s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.57s
响应时间(最大)3.60s
响应时间(总计)10.27s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)24.62s
响应时间(最大)34.82s
响应时间(总计)49.24s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)22.37s
响应时间(最大)22.37s
响应时间(总计)22.37s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.43s
响应时间(最大)8.51s
响应时间(总计)12.87s
-
领域专项
: 7.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)14.09s
响应时间(最大)22.00s
响应时间(总计)42.27s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.63s
响应时间(最大)3.63s
响应时间(总计)3.63s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.35s
响应时间(最大)3.42s
响应时间(总计)6.69s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.23s
响应时间(最大)3.68s
响应时间(总计)9.69s
-
工具调用
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.96s
响应时间(最大)4.96s
响应时间(总计)4.96s
-
常识问答
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.94s
响应时间(最大)3.94s
响应时间(总计)3.94s
|
| #157#157 |
Ling-2.6-1Tnone
|
4.3… |
Inclusionai |
$0.005
…
|
7.72s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 API 错误: 2 未遵循指令: 2 无效工具调用: 1
响应时间(平均)7.72s
响应时间(最大)25.72s
响应时间(总计)139.00s
…
|
- 总测试数
- 20
- 错误测试数
- 17
- 尝试通过率
- 15.0%
- 输入令牌
- 34,905
- 输出令牌
- 2,434
- 推理令牌
- 0
- 响应时间(平均)
- 7.72s
- 响应时间(总计)
- 139.00s
- 响应时间(最大)
- 25.72s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)6.55s
响应时间(最大)9.41s
响应时间(总计)26.19s
-
编程
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)10.57s
响应时间(最大)10.57s
响应时间(总计)10.57s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)23.53s
响应时间(最大)23.53s
响应时间(总计)23.53s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.37s
响应时间(最大)1.37s
响应时间(总计)2.73s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.04s
响应时间(最大)1.08s
响应时间(总计)3.11s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)20.34s
响应时间(最大)20.34s
响应时间(总计)20.34s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.36s
响应时间(最大)9.81s
响应时间(总计)10.73s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)5.36s
响应时间(最大)13.26s
响应时间(总计)16.09s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)25.72s
响应时间(最大)25.72s
响应时间(总计)25.72s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #30#30 |
GPT-5.2 Chatnone
|
7.9… |
OpenAI |
$0.352
…
|
6.82s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 1
响应时间(平均)6.82s
响应时间(最大)38.52s
响应时间(总计)136.34s
…
|
- 总测试数
- 20
- 错误测试数
- 7
- 尝试通过率
- 73.3%
- 输入令牌
- 31,593
- 输出令牌
- 21,144
- 推理令牌
- 0
- 响应时间(平均)
- 6.82s
- 响应时间(总计)
- 136.34s
- 响应时间(最大)
- 38.52s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.40s
响应时间(最大)4.78s
响应时间(总计)13.59s
-
编程
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)8.05s
响应时间(最大)8.97s
响应时间(总计)16.09s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.12s
响应时间(最大)9.12s
响应时间(总计)9.12s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.05s
响应时间(最大)3.33s
响应时间(总计)6.10s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)17.78s
响应时间(最大)38.52s
响应时间(总计)53.33s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.20s
响应时间(最大)3.20s
响应时间(总计)3.20s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.51s
响应时间(最大)6.55s
响应时间(总计)11.02s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.10s
响应时间(最大)5.04s
响应时间(总计)12.31s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.68s
响应时间(最大)4.68s
响应时间(总计)4.68s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.89s
响应时间(最大)6.89s
响应时间(总计)6.89s
|
| #115#115 |
Laguna Xs.2medium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.8… |
Poolside |
$0.000
…
|
6.73s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 API 错误: 4 无答案: 2 无效工具调用: 1
响应时间(平均)6.73s
响应时间(最大)29.11s
响应时间(总计)100.98s
…
|
- 总测试数
- 19
- 错误测试数
- 13
- 尝试通过率
- 50.9%
- 输入令牌
- 39,481
- 输出令牌
- 54,218
- 推理令牌
- 0
- 响应时间(平均)
- 6.73s
- 响应时间(总计)
- 100.98s
- 响应时间(最大)
- 29.11s
-
反AI技巧
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)2.68s
响应时间(最大)3.09s
响应时间(总计)8.04s
-
编程
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)14.36s
响应时间(最大)14.36s
响应时间(总计)14.36s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)15.92s
响应时间(最大)15.92s
响应时间(总计)15.92s
-
数据解析与提取
: 7.1
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)9.34s
响应时间(最大)16.71s
响应时间(总计)18.68s
-
领域专项
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)11.12s
响应时间(最大)29.11s
响应时间(总计)33.35s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.68s
响应时间(最大)2.03s
响应时间(总计)3.36s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)1.93s
响应时间(最大)1.97s
响应时间(总计)3.87s
-
工具调用
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)3.39s
响应时间(最大)3.39s
响应时间(总计)3.39s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #53#53 |
GPT-5.3 Chatnone
|
7.4… |
OpenAI |
$0.402
…
|
6.13s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 2
响应时间(平均)6.13s
响应时间(最大)18.33s
响应时间(总计)122.61s
…
|
- 总测试数
- 20
- 错误测试数
- 8
- 尝试通过率
- 68.3%
- 输入令牌
- 31,590
- 输出令牌
- 24,757
- 推理令牌
- 0
- 响应时间(平均)
- 6.13s
- 响应时间(总计)
- 122.61s
- 响应时间(最大)
- 18.33s
-
反AI技巧
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)3.86s
响应时间(最大)7.35s
响应时间(总计)15.44s
-
编程
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.52s
响应时间(最大)11.72s
响应时间(总计)21.03s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.96s
响应时间(最大)11.96s
响应时间(总计)11.96s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.21s
响应时间(最大)2.52s
响应时间(总计)4.42s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)13.01s
响应时间(最大)18.33s
响应时间(总计)39.04s
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.99s
响应时间(最大)1.99s
响应时间(总计)1.99s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.51s
响应时间(最大)4.60s
响应时间(总计)7.01s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.99s
响应时间(最大)3.16s
响应时间(总计)8.97s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.36s
响应时间(最大)8.36s
响应时间(总计)8.36s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.38s
响应时间(最大)4.38s
响应时间(总计)4.38s
|
| #97#97 |
Gemma 4 26B A4Bnone
|
6.2… |
Google |
$0.003
↓
…
|
5.96s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 2 超时: 1
响应时间(平均)5.96s
响应时间(最大)57.10s
响应时间(总计)119.22s
…
|
- 总测试数
- 20
- 错误测试数
- 12
- 尝试通过率
- 46.7%
- 输入令牌
- 36,978
- 输出令牌
- 1,815
- 推理令牌
- 0
- 响应时间(平均)
- 5.96s
- 响应时间(总计)
- 119.22s
- 响应时间(最大)
- 57.10s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.28s
响应时间(最大)2.09s
响应时间(总计)5.13s
-
编程
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)3.83s
响应时间(最大)7.07s
响应时间(总计)7.66s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)30.53s
响应时间(最大)30.53s
响应时间(总计)30.53s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.70s
响应时间(最大)2.21s
响应时间(总计)3.41s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.49s
响应时间(最大)4.23s
响应时间(总计)7.48s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.54s
响应时间(最大)3.54s
响应时间(总计)3.54s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)690ms
响应时间(最大)878ms
响应时间(总计)1.38s
-
谜题求解
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)744ms
响应时间(最大)972ms
响应时间(总计)2.23s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)57.10s
响应时间(最大)57.10s
响应时间(总计)57.10s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)778ms
响应时间(最大)778ms
响应时间(总计)778ms
|
| #12#12 |
Gemini 3 Flash Previewlow
|
8.6… |
Google |
$0.106
…
|
5.81s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)5.81s
响应时间(最大)14.72s
响应时间(总计)116.25s
…
|
- 总测试数
- 20
- 错误测试数
- 4
- 尝试通过率
- 81.7%
- 输入令牌
- 33,766
- 输出令牌
- 2,070
- 推理令牌
- 27,348
- 响应时间(平均)
- 5.81s
- 响应时间(总计)
- 116.25s
- 响应时间(最大)
- 14.72s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.48s
响应时间(最大)4.31s
响应时间(总计)13.94s
-
编程
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.66s
响应时间(最大)6.94s
响应时间(总计)13.31s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.27s
响应时间(最大)3.27s
响应时间(总计)3.27s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.40s
响应时间(最大)14.72s
响应时间(总计)18.80s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)8.05s
响应时间(最大)14.40s
响应时间(总计)24.15s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.68s
响应时间(最大)3.68s
响应时间(总计)3.68s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.02s
响应时间(最大)7.35s
响应时间(总计)14.03s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.77s
响应时间(最大)10.27s
响应时间(总计)17.32s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.99s
响应时间(最大)4.99s
响应时间(总计)4.99s
-
常识问答
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.75s
响应时间(最大)2.75s
响应时间(总计)2.75s
|
| #139#139 |
Nemotron 3 Supernone
|
5.0… |
NVIDIA |
$0.006
↑
…
|
5.47s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 2
响应时间(平均)5.47s
响应时间(最大)16.45s
响应时间(总计)109.43s
…
|
- 总测试数
- 20
- 错误测试数
- 15
- 尝试通过率
- 33.3%
- 输入令牌
- 33,717
- 输出令牌
- 6,186
- 推理令牌
- 0
- 响应时间(平均)
- 5.47s
- 响应时间(总计)
- 109.43s
- 响应时间(最大)
- 16.45s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)4.46s
响应时间(最大)9.94s
响应时间(总计)17.83s
-
编程
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.02s
响应时间(最大)3.05s
响应时间(总计)6.04s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)16.45s
响应时间(最大)16.45s
响应时间(总计)16.45s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.92s
响应时间(最大)13.23s
响应时间(总计)15.84s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)6.23s
响应时间(最大)14.38s
响应时间(总计)18.70s
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)950ms
响应时间(最大)950ms
响应时间(总计)950ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)804ms
响应时间(最大)921ms
响应时间(总计)1.61s
-
谜题求解
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.36s
响应时间(最大)3.27s
响应时间(总计)7.07s
-
工具调用
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)16.00s
响应时间(最大)16.00s
响应时间(总计)16.00s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)8.94s
响应时间(最大)8.94s
响应时间(总计)8.94s
|
| #72#72 |
Claude Sonnet 4.6none
|
7.0… |
Anthropic |
$0.306
…
|
5.27s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 4 答案错误: 4 未遵循指令: 1
响应时间(平均)5.27s
响应时间(最大)23.84s
响应时间(总计)68.50s
…
|
- 总测试数
- 20
- 错误测试数
- 9
- 尝试通过率
- 58.3%
- 输入令牌
- 54,721
- 输出令牌
- 9,450
- 推理令牌
- 0
- 响应时间(平均)
- 5.27s
- 响应时间(总计)
- 68.50s
- 响应时间(最大)
- 23.84s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 答案错误: 1
响应时间(平均)2.94s
响应时间(最大)4.83s
响应时间(总计)5.88s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)6.73s
响应时间(最大)9.79s
响应时间(总计)13.46s
-
综合
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.84s
响应时间(最大)23.84s
响应时间(总计)23.84s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.43s
响应时间(最大)3.43s
响应时间(总计)3.43s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.54s
响应时间(最大)3.54s
响应时间(总计)3.54s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.56s
响应时间(最大)2.56s
响应时间(总计)2.56s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.96s
响应时间(最大)1.96s
响应时间(总计)1.96s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)2.53s
响应时间(最大)2.54s
响应时间(总计)5.06s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.11s
响应时间(最大)4.11s
响应时间(总计)4.11s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.67s
响应时间(最大)4.67s
响应时间(总计)4.67s
|
| #119#119 |
Hunter Alphanone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.7… |
OpenRouter |
$0.000
…
|
4.70s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 2 API 错误: 1
响应时间(平均)4.70s
响应时间(最大)15.17s
响应时间(总计)79.86s
…
|
- 总测试数
- 18
- 错误测试数
- 12
- 尝试通过率
- 46.3%
- 输入令牌
- 34,329
- 输出令牌
- 2,264
- 推理令牌
- 0
- 响应时间(平均)
- 4.70s
- 响应时间(总计)
- 79.86s
- 响应时间(最大)
- 15.17s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)3.81s
响应时间(最大)6.85s
响应时间(总计)15.23s
-
编程
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)15.17s
响应时间(最大)15.17s
响应时间(总计)15.17s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.49s
响应时间(最大)14.02s
响应时间(总计)16.98s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.33s
响应时间(最大)2.94s
响应时间(总计)6.99s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.71s
响应时间(最大)2.71s
响应时间(总计)2.71s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.82s
响应时间(最大)2.92s
响应时间(总计)5.65s
-
谜题求解
: 5.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)3.71s
响应时间(最大)5.43s
响应时间(总计)11.13s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.02s
响应时间(最大)6.02s
响应时间(总计)6.02s
|
| #110#110 |
Qwen3.5 Plus 2026-04-20none
|
5.8… |
Qwen |
$0.031
↓
…
|
4.57s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 2
响应时间(平均)4.57s
响应时间(最大)33.34s
响应时间(总计)91.37s
…
|
- 总测试数
- 20
- 错误测试数
- 13
- 尝试通过率
- 43.3%
- 输入令牌
- 36,069
- 输出令牌
- 11,139
- 推理令牌
- 0
- 响应时间(平均)
- 4.57s
- 响应时间(总计)
- 91.37s
- 响应时间(最大)
- 33.34s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.88s
响应时间(最大)4.81s
响应时间(总计)7.53s
-
编程
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.08s
响应时间(最大)3.20s
响应时间(总计)4.17s
-
综合
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)13.32s
响应时间(最大)13.32s
响应时间(总计)13.32s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.82s
响应时间(最大)3.86s
响应时间(总计)5.65s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.43s
响应时间(最大)10.83s
响应时间(总计)13.28s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.41s
响应时间(最大)1.41s
响应时间(总计)1.41s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.17s
响应时间(最大)1.33s
响应时间(总计)2.35s
-
谜题求解
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.97s
响应时间(最大)3.43s
响应时间(总计)5.91s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.42s
响应时间(最大)4.42s
响应时间(总计)4.42s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)33.34s
响应时间(最大)33.34s
响应时间(总计)33.34s
|
| #7#7 |
Claude Opus 4.7medium
|
8.9… |
Anthropic |
$0.624
…
|
4.48s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)4.48s
响应时间(最大)23.18s
响应时间(总计)85.21s
…
|
- 总测试数
- 20
- 错误测试数
- 3
- 尝试通过率
- 85.0%
- 输入令牌
- 61,569
- 输出令牌
- 10,439
- 推理令牌
- 2,198
- 响应时间(平均)
- 4.48s
- 响应时间(总计)
- 85.21s
- 响应时间(最大)
- 23.18s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.85s
响应时间(最大)2.71s
响应时间(总计)7.38s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.79s
响应时间(最大)23.18s
响应时间(总计)29.59s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.45s
响应时间(最大)21.45s
响应时间(总计)21.45s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.37s
响应时间(最大)3.30s
响应时间(总计)4.74s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)1.17s
响应时间(最大)1.40s
响应时间(总计)2.35s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.87s
响应时间(最大)2.87s
响应时间(总计)2.87s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.57s
响应时间(最大)1.66s
响应时间(总计)3.14s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.43s
响应时间(最大)2.89s
响应时间(总计)7.28s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.17s
响应时间(最大)4.17s
响应时间(总计)4.17s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.25s
响应时间(最大)2.25s
响应时间(总计)2.25s
|
| #6#6 |
Gemini 3.5 Flashmedium
|
9.0… |
Google |
$0.472
…
|
4.29s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)4.29s
响应时间(最大)12.05s
响应时间(总计)85.72s
…
|
- 总测试数
- 20
- 错误测试数
- 3
- 尝试通过率
- 86.7%
- 输入令牌
- 33,933
- 输出令牌
- 1,995
- 推理令牌
- 44,792
- 响应时间(平均)
- 4.29s
- 响应时间(总计)
- 85.72s
- 响应时间(最大)
- 12.05s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.09s
响应时间(最大)2.56s
响应时间(总计)8.35s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)9.91s
响应时间(最大)11.59s
响应时间(总计)19.82s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.05s
响应时间(最大)12.05s
响应时间(总计)12.05s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.07s
响应时间(最大)5.60s
响应时间(总计)8.14s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.24s
响应时间(最大)6.43s
响应时间(总计)15.73s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.52s
响应时间(最大)2.52s
响应时间(总计)2.52s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.70s
响应时间(最大)3.07s
响应时间(总计)5.40s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.38s
响应时间(最大)2.55s
响应时间(总计)7.15s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.81s
响应时间(最大)3.81s
响应时间(总计)3.81s
-
常识问答
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.75s
响应时间(最大)2.75s
响应时间(总计)2.75s
|
| #108#108 |
GLM 5.1none
|
5.8… |
Z.ai |
$0.056
↓
…
|
4.20s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 无效工具调用: 1
响应时间(平均)4.20s
响应时间(最大)32.57s
响应时间(总计)83.95s
…
|
- 总测试数
- 20
- 错误测试数
- 13
- 尝试通过率
- 43.3%
- 输入令牌
- 44,535
- 输出令牌
- 3,748
- 推理令牌
- 0
- 响应时间(平均)
- 4.20s
- 响应时间(总计)
- 83.95s
- 响应时间(最大)
- 32.57s
-
反AI技巧
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.11s
响应时间(最大)3.94s
响应时间(总计)8.46s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)6.33s
响应时间(最大)9.79s
响应时间(总计)12.65s
-
综合
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)32.57s
响应时间(最大)32.57s
响应时间(总计)32.57s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.08s
响应时间(最大)1.62s
响应时间(总计)2.15s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.99s
响应时间(最大)3.99s
响应时间(总计)5.98s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)790ms
响应时间(最大)790ms
响应时间(总计)790ms
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.98s
响应时间(最大)2.28s
响应时间(总计)3.97s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.45s
响应时间(最大)2.09s
响应时间(总计)4.36s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.68s
响应时间(最大)10.68s
响应时间(总计)10.68s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.34s
响应时间(最大)2.34s
响应时间(总计)2.34s
|
| #79#79 |
Gemma 4 31Bnone
|
6.7… |
Google |
$0.003
↓
…
|
4.05s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 API 错误: 2 未遵循指令: 1
响应时间(平均)4.05s
响应时间(最大)26.13s
响应时间(总计)72.97s
…
|
- 总测试数
- 20
- 错误测试数
- 10
- 尝试通过率
- 50.0%
- 输入令牌
- 17,818
- 输出令牌
- 1,398
- 推理令牌
- 0
- 响应时间(平均)
- 4.05s
- 响应时间(总计)
- 72.97s
- 响应时间(最大)
- 26.13s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.85s
响应时间(最大)4.45s
响应时间(总计)7.40s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)14.84s
响应时间(最大)26.13s
响应时间(总计)29.68s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.25s
响应时间(最大)3.02s
响应时间(总计)4.51s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.22s
响应时间(最大)4.68s
响应时间(总计)9.67s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.09s
响应时间(最大)2.09s
响应时间(总计)2.09s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.84s
响应时间(最大)4.45s
响应时间(总计)5.68s
-
谜题求解
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)4.23s
响应时间(最大)7.63s
响应时间(总计)12.69s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.25s
响应时间(最大)1.25s
响应时间(总计)1.25s
|
| #96#96 |
GLM 5none
|
6.3… |
Z.ai |
$0.025
↑
…
|
3.95s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11
响应时间(平均)3.95s
响应时间(最大)11.07s
响应时间(总计)51.38s
…
|
- 总测试数
- 20
- 错误测试数
- 11
- 尝试通过率
- 46.7%
- 输入令牌
- 34,537
- 输出令牌
- 1,985
- 推理令牌
- 0
- 响应时间(平均)
- 3.95s
- 响应时间(总计)
- 51.38s
- 响应时间(最大)
- 11.07s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.37s
响应时间(最大)3.39s
响应时间(总计)4.75s
-
编程
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)5.18s
响应时间(最大)8.84s
响应时间(总计)10.37s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.98s
响应时间(最大)4.98s
响应时间(总计)4.98s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.78s
响应时间(最大)5.78s
响应时间(总计)5.78s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.24s
响应时间(最大)2.24s
响应时间(总计)2.24s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.27s
响应时间(最大)3.27s
响应时间(总计)3.27s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.48s
响应时间(最大)1.48s
响应时间(总计)1.48s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.91s
响应时间(最大)2.08s
响应时间(总计)3.82s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.07s
响应时间(最大)11.07s
响应时间(总计)11.07s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.62s
响应时间(最大)3.62s
响应时间(总计)3.62s
|
| #35#35 |
Gemini 3.1 Flash Lite Previewmedium
|
7.7… |
Google |
$0.063
…
|
3.94s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 1
响应时间(平均)3.94s
响应时间(最大)14.93s
响应时间(总计)78.74s
…
|
- 总测试数
- 20
- 错误测试数
- 7
- 尝试通过率
- 65.0%
- 输入令牌
- 34,781
- 输出令牌
- 2,204
- 推理令牌
- 33,657
- 响应时间(平均)
- 3.94s
- 响应时间(总计)
- 78.74s
- 响应时间(最大)
- 14.93s
-
反AI技巧
: 9.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.33s
响应时间(最大)3.89s
响应时间(总计)9.30s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.98s
响应时间(最大)4.34s
响应时间(总计)7.95s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.93s
响应时间(最大)14.93s
响应时间(总计)14.93s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.29s
响应时间(最大)2.31s
响应时间(总计)4.59s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)4.21s
响应时间(最大)5.86s
响应时间(总计)12.62s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.16s
响应时间(最大)3.16s
响应时间(总计)3.16s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.91s
响应时间(最大)1.93s
响应时间(总计)3.82s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.30s
响应时间(最大)9.55s
响应时间(总计)15.89s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.80s
响应时间(最大)3.80s
响应时间(总计)3.80s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.68s
响应时间(最大)2.68s
响应时间(总计)2.68s
|
| #114#114 |
Qwen3.6 27Bnone
|
5.8… |
Qwen |
$0.027
↓
…
|
3.85s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 2 无效工具调用: 1
响应时间(平均)3.85s
响应时间(最大)11.82s
响应时间(总计)77.09s
…
|
- 总测试数
- 20
- 错误测试数
- 13
- 尝试通过率
- 50.0%
- 输入令牌
- 49,880
- 输出令牌
- 3,804
- 推理令牌
- 0
- 响应时间(平均)
- 3.85s
- 响应时间(总计)
- 77.09s
- 响应时间(最大)
- 11.82s
-
反AI技巧
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.83s
响应时间(最大)7.62s
响应时间(总计)11.33s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.75s
响应时间(最大)10.18s
响应时间(总计)11.51s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)9.95s
响应时间(最大)9.95s
响应时间(总计)9.95s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.06s
响应时间(最大)2.39s
响应时间(总计)4.11s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.03s
响应时间(最大)4.83s
响应时间(总计)9.08s
-
通用智能
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.07s
响应时间(最大)1.07s
响应时间(总计)1.07s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.92s
响应时间(最大)1.94s
响应时间(总计)3.83s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)5.15s
响应时间(最大)11.82s
响应时间(总计)15.45s
-
工具调用
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.74s
响应时间(最大)6.74s
响应时间(总计)6.74s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.03s
响应时间(最大)4.03s
响应时间(总计)4.03s
|
| #151#151 |
Qwen3.6 35B A3Bnone
|
4.7… |
Qwen |
$0.031
↑
…
|
3.84s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 API 错误: 2 未遵循指令: 2
响应时间(平均)3.84s
响应时间(最大)22.52s
响应时间(总计)69.12s
…
|
- 总测试数
- 20
- 错误测试数
- 16
- 尝试通过率
- 31.7%
- 输入令牌
- 16,488
- 输出令牌
- 27,747
- 推理令牌
- 0
- 响应时间(平均)
- 3.84s
- 响应时间(总计)
- 69.12s
- 响应时间(最大)
- 22.52s
-
反AI技巧
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.10s
响应时间(最大)6.15s
响应时间(总计)8.41s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)12.29s
响应时间(最大)22.52s
响应时间(总计)24.58s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.46s
响应时间(最大)2.03s
响应时间(总计)2.93s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)7.45s
响应时间(最大)12.46s
响应时间(总计)22.35s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.51s
响应时间(最大)3.51s
响应时间(总计)3.51s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.86s
响应时间(最大)2.83s
响应时间(总计)3.73s
-
谜题求解
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2 答案错误: 1
响应时间(平均)1.07s
响应时间(最大)1.24s
响应时间(总计)3.20s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)414ms
响应时间(最大)414ms
响应时间(总计)414ms
|
| #104#104 |
Qwen3.5-Flashnone
|
5.9… |
Qwen |
$0.004
↓
…
|
3.74s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12
响应时间(平均)3.74s
响应时间(最大)27.18s
响应时间(总计)74.71s
…
|
- 总测试数
- 20
- 错误测试数
- 12
- 尝试通过率
- 41.7%
- 输入令牌
- 43,598
- 输出令牌
- 4,270
- 推理令牌
- 0
- 响应时间(平均)
- 3.74s
- 响应时间(总计)
- 74.71s
- 响应时间(最大)
- 27.18s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.32s
响应时间(最大)3.89s
响应时间(总计)5.30s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)993ms
响应时间(最大)1.29s
响应时间(总计)1.99s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.22s
响应时间(最大)6.22s
响应时间(总计)6.22s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.57s
响应时间(最大)1.83s
响应时间(总计)3.14s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)905ms
响应时间(最大)1.10s
响应时间(总计)2.71s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)803ms
响应时间(最大)803ms
响应时间(总计)803ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)8.81s
响应时间(最大)13.73s
响应时间(总计)17.61s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)10.89s
响应时间(最大)27.18s
响应时间(总计)32.68s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.67s
响应时间(最大)3.67s
响应时间(总计)3.67s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)588ms
响应时间(最大)588ms
响应时间(总计)588ms
|
| #62#62 |
Claude Opus 4.8none
|
7.3… |
Anthropic |
$0.519
…
|
3.51s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 3 答案错误: 3 未遵循指令: 1 无答案: 1
响应时间(平均)3.51s
响应时间(最大)17.73s
响应时间(总计)70.19s
…
|
- 总测试数
- 20
- 错误测试数
- 8
- 尝试通过率
- 65.0%
- 输入令牌
- 63,282
- 输出令牌
- 8,098
- 推理令牌
- 0
- 响应时间(平均)
- 3.51s
- 响应时间(总计)
- 70.19s
- 响应时间(最大)
- 17.73s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2
响应时间(平均)3.40s
响应时间(最大)6.36s
响应时间(总计)13.58s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.59s
响应时间(最大)4.34s
响应时间(总计)7.17s
-
综合
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.73s
响应时间(最大)17.73s
响应时间(总计)17.73s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.77s
响应时间(最大)1.93s
响应时间(总计)3.53s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.66s
响应时间(最大)2.16s
响应时间(总计)4.99s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.48s
响应时间(最大)3.48s
响应时间(总计)3.48s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.37s
响应时间(最大)1.40s
响应时间(总计)2.73s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)2.74s
响应时间(最大)3.46s
响应时间(总计)8.22s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.35s
响应时间(最大)5.35s
响应时间(总计)5.35s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)3.41s
响应时间(最大)3.41s
响应时间(总计)3.41s
|
| #111#111 |
Qwen3.5-35B-A3Bnone
|
5.8… |
Qwen |
$0.011
↓
…
|
3.50s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 2
响应时间(平均)3.50s
响应时间(最大)47.43s
响应时间(总计)70.00s
…
|
- 总测试数
- 20
- 错误测试数
- 13
- 尝试通过率
- 45.0%
- 输入令牌
- 45,353
- 输出令牌
- 4,334
- 推理令牌
- 0
- 响应时间(平均)
- 3.50s
- 响应时间(总计)
- 70.00s
- 响应时间(最大)
- 47.43s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.43s
响应时间(最大)4.39s
响应时间(总计)5.71s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.72s
响应时间(最大)2.67s
响应时间(总计)3.43s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)47.43s
响应时间(最大)47.43s
响应时间(总计)47.43s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.16s
响应时间(最大)1.42s
响应时间(总计)2.33s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)485ms
响应时间(最大)549ms
响应时间(总计)1.45s
-
通用智能
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.19s
响应时间(最大)1.19s
响应时间(总计)1.19s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)809ms
响应时间(最大)983ms
响应时间(总计)1.62s
-
谜题求解
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.35s
响应时间(最大)2.26s
响应时间(总计)4.05s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.30s
响应时间(最大)2.30s
响应时间(总计)2.30s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)493ms
响应时间(最大)493ms
响应时间(总计)493ms
|
| #131#131 |
Qwen3.5-122B-A10Bnone
|
5.4… |
Qwen |
$0.019
↓
…
|
3.38s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 未遵循指令: 2
响应时间(平均)3.38s
响应时间(最大)46.00s
响应时间(总计)67.55s
…
|
- 总测试数
- 20
- 错误测试数
- 14
- 尝试通过率
- 33.3%
- 输入令牌
- 44,894
- 输出令牌
- 3,374
- 推理令牌
- 0
- 响应时间(平均)
- 3.38s
- 响应时间(总计)
- 67.55s
- 响应时间(最大)
- 46.00s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.59s
响应时间(最大)3.60s
响应时间(总计)6.38s
-
编程
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.14s
响应时间(最大)3.44s
响应时间(总计)4.29s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)46.00s
响应时间(最大)46.00s
响应时间(总计)46.00s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.01s
响应时间(最大)1.06s
响应时间(总计)2.02s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)465ms
响应时间(最大)492ms
响应时间(总计)1.39s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.12s
响应时间(最大)1.12s
响应时间(总计)1.12s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)513ms
响应时间(最大)570ms
响应时间(总计)1.03s
-
谜题求解
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.00s
响应时间(最大)1.41s
响应时间(总计)3.00s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.04s
响应时间(最大)2.04s
响应时间(总计)2.04s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)295ms
响应时间(最大)295ms
响应时间(总计)295ms
|
| #69#69 |
Qwen3.6 Max Previewnone
|
7.1… |
Qwen |
$0.072
↓
…
|
3.31s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9
响应时间(平均)3.31s
响应时间(最大)20.51s
响应时间(总计)66.17s
…
|
- 总测试数
- 20
- 错误测试数
- 9
- 尝试通过率
- 61.7%
- 输入令牌
- 39,668
- 输出令牌
- 4,773
- 推理令牌
- 0
- 响应时间(平均)
- 3.31s
- 响应时间(总计)
- 66.17s
- 响应时间(最大)
- 20.51s
-
反AI技巧
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.63s
响应时间(最大)5.57s
响应时间(总计)10.53s
-
编程
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.06s
响应时间(最大)3.45s
响应时间(总计)6.12s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)20.51s
响应时间(最大)20.51s
响应时间(总计)20.51s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.87s
响应时间(最大)3.54s
响应时间(总计)5.74s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.22s
响应时间(最大)1.25s
响应时间(总计)3.67s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.62s
响应时间(最大)1.62s
响应时间(总计)1.62s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.40s
响应时间(最大)1.46s
响应时间(总计)2.79s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.65s
响应时间(最大)3.59s
响应时间(总计)7.94s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.27s
响应时间(最大)5.27s
响应时间(总计)5.27s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.97s
响应时间(最大)1.97s
响应时间(总计)1.97s
|
| #36#36 |
Gemini 3.1 Flash Litemedium
|
7.7… |
Google |
$0.065
…
|
3.18s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 1
响应时间(平均)3.18s
响应时间(最大)10.87s
响应时间(总计)63.55s
…
|
- 总测试数
- 20
- 错误测试数
- 7
- 尝试通过率
- 68.3%
- 输入令牌
- 33,803
- 输出令牌
- 2,248
- 推理令牌
- 35,390
- 响应时间(平均)
- 3.18s
- 响应时间(总计)
- 63.55s
- 响应时间(最大)
- 10.87s
-
反AI技巧
: 9.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.39s
响应时间(最大)3.58s
响应时间(总计)9.57s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.59s
响应时间(最大)3.93s
响应时间(总计)7.19s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.87s
响应时间(最大)10.87s
响应时间(总计)10.87s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.60s
响应时间(最大)2.69s
响应时间(总计)5.19s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)3.16s
响应时间(最大)3.89s
响应时间(总计)9.49s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.60s
响应时间(最大)2.60s
响应时间(总计)2.60s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.59s
响应时间(最大)3.04s
响应时间(总计)5.17s
-
谜题求解
: 7.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.95s
响应时间(最大)2.48s
响应时间(总计)5.84s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.55s
响应时间(最大)4.55s
响应时间(总计)4.55s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.08s
响应时间(最大)3.08s
响应时间(总计)3.08s
|
| #105#105 |
GLM 5V Turbonone
|
5.9… |
Z.ai |
$0.049
…
|
3.04s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 2
响应时间(平均)3.04s
响应时间(最大)6.51s
响应时间(总计)60.88s
…
|
- 总测试数
- 20
- 错误测试数
- 12
- 尝试通过率
- 40.0%
- 输入令牌
- 34,502
- 输出令牌
- 1,760
- 推理令牌
- 0
- 响应时间(平均)
- 3.04s
- 响应时间(总计)
- 60.88s
- 响应时间(最大)
- 6.51s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)3.13s
响应时间(最大)5.90s
响应时间(总计)12.50s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.77s
响应时间(最大)5.30s
响应时间(总计)7.54s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.51s
响应时间(最大)6.51s
响应时间(总计)6.51s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.81s
响应时间(最大)5.69s
响应时间(总计)7.62s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.09s
响应时间(最大)2.39s
响应时间(总计)6.26s
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.22s
响应时间(最大)2.22s
响应时间(总计)2.22s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.97s
响应时间(最大)2.43s
响应时间(总计)3.93s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.40s
响应时间(最大)3.81s
响应时间(总计)7.21s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.86s
响应时间(最大)4.86s
响应时间(总计)4.86s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.23s
响应时间(最大)2.23s
响应时间(总计)2.23s
|
| #9#9 |
Claude Opus 4.7none已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
8.9… |
Anthropic |
$0.505
…
|
3.02s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)3.02s
响应时间(最大)18.27s
响应时间(总计)57.44s
…
|
- 总测试数
- 19
- 错误测试数
- 3
- 尝试通过率
- 84.2%
- 输入令牌
- 69,576
- 输出令牌
- 6,265
- 推理令牌
- 0
- 响应时间(平均)
- 3.02s
- 响应时间(总计)
- 57.44s
- 响应时间(最大)
- 18.27s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.12s
响应时间(最大)3.75s
响应时间(总计)8.50s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.84s
响应时间(最大)2.84s
响应时间(总计)2.84s
-
综合
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)18.27s
响应时间(最大)18.27s
响应时间(总计)18.27s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.15s
响应时间(最大)2.33s
响应时间(总计)4.29s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.19s
响应时间(最大)1.40s
响应时间(总计)3.58s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.47s
响应时间(最大)3.47s
响应时间(总计)3.47s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.46s
响应时间(最大)1.68s
响应时间(总计)2.91s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.46s
响应时间(最大)3.72s
响应时间(总计)7.38s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.74s
响应时间(最大)4.74s
响应时间(总计)4.74s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.46s
响应时间(最大)1.46s
响应时间(总计)1.46s
|
| #120#120 |
GLM 4.7 Flashnone
|
5.6… |
Z.ai |
$0.004
…
|
3.01s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 未遵循指令: 1 无效工具调用: 1
响应时间(平均)3.01s
响应时间(最大)7.05s
响应时间(总计)39.12s
…
|
- 总测试数
- 20
- 错误测试数
- 14
- 尝试通过率
- 38.3%
- 输入令牌
- 36,147
- 输出令牌
- 2,515
- 推理令牌
- 0
- 响应时间(平均)
- 3.01s
- 响应时间(总计)
- 39.12s
- 响应时间(最大)
- 7.05s
-
反AI技巧
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)5.51s
响应时间(最大)6.59s
响应时间(总计)11.02s
-
编程
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.35s
响应时间(最大)5.57s
响应时间(总计)6.70s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)3.22s
响应时间(最大)3.22s
响应时间(总计)3.22s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.82s
响应时间(最大)4.82s
响应时间(总计)4.82s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)744ms
响应时间(最大)744ms
响应时间(总计)744ms
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.59s
响应时间(最大)1.59s
响应时间(总计)1.59s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)888ms
响应时间(最大)888ms
响应时间(总计)888ms
-
谜题求解
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.20s
响应时间(最大)1.27s
响应时间(总计)2.39s
-
工具调用
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.05s
响应时间(最大)7.05s
响应时间(总计)7.05s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)692ms
响应时间(最大)692ms
响应时间(总计)692ms
|