| #91#91 |
Qwen3.5-Flashnone
|
6.0… |
Qwen |
$0.006… |
3.11s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11
响应时间(平均)3.11s
响应时间(最大)13.73s
响应时间(总计)59.03s
…
|
- 总测试数
- 19
- 错误测试数
- 11
- 尝试通过率
- 43.9%
- 输出令牌
- 4,275
- 推理令牌
- 0
- 响应时间(平均)
- 3.11s
- 响应时间(总计)
- 59.03s
- 响应时间(最大)
- 13.73s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.32s
响应时间(最大)3.89s
响应时间(总计)5.30s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.29s
响应时间(最大)1.29s
响应时间(总计)1.29s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.22s
响应时间(最大)6.22s
响应时间(总计)6.22s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.57s
响应时间(最大)1.83s
响应时间(总计)3.14s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)905ms
响应时间(最大)1.10s
响应时间(总计)2.71s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)803ms
响应时间(最大)803ms
响应时间(总计)803ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)8.81s
响应时间(最大)13.73s
响应时间(总计)17.61s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)5.90s
响应时间(最大)12.19s
响应时间(总计)17.69s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.67s
响应时间(最大)3.67s
响应时间(总计)3.67s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)588ms
响应时间(最大)588ms
响应时间(总计)588ms
|
| #92#92 |
Qwen3.5 Plus 2026-04-20none
|
5.9… |
Qwen |
$0.040… |
4.77s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 1
响应时间(平均)4.77s
响应时间(最大)33.34s
响应时间(总计)90.58s
…
|
- 总测试数
- 19
- 错误测试数
- 12
- 尝试通过率
- 45.6%
- 输出令牌
- 11,150
- 推理令牌
- 0
- 响应时间(平均)
- 4.77s
- 响应时间(总计)
- 90.58s
- 响应时间(最大)
- 33.34s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.88s
响应时间(最大)4.81s
响应时间(总计)7.53s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.20s
响应时间(最大)3.20s
响应时间(总计)3.20s
-
综合
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)13.32s
响应时间(最大)13.32s
响应时间(总计)13.32s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.82s
响应时间(最大)3.86s
响应时间(总计)5.65s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.43s
响应时间(最大)10.83s
响应时间(总计)13.28s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.41s
响应时间(最大)1.41s
响应时间(总计)1.41s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.17s
响应时间(最大)1.33s
响应时间(总计)2.35s
-
谜题求解
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.03s
响应时间(最大)3.60s
响应时间(总计)6.09s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.42s
响应时间(最大)4.42s
响应时间(总计)4.42s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)33.34s
响应时间(最大)33.34s
响应时间(总计)33.34s
|
| #93#93 |
Qwen3.5-35B-A3Bnone
|
5.9… |
Qwen |
$0.016… |
3.64s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 2
响应时间(平均)3.64s
响应时间(最大)47.43s
响应时间(总计)69.23s
…
|
- 总测试数
- 19
- 错误测试数
- 12
- 尝试通过率
- 47.4%
- 输出令牌
- 4,311
- 推理令牌
- 0
- 响应时间(平均)
- 3.64s
- 响应时间(总计)
- 69.23s
- 响应时间(最大)
- 47.43s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.43s
响应时间(最大)4.39s
响应时间(总计)5.71s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.67s
响应时间(最大)2.67s
响应时间(总计)2.67s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)47.43s
响应时间(最大)47.43s
响应时间(总计)47.43s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.16s
响应时间(最大)1.42s
响应时间(总计)2.33s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)485ms
响应时间(最大)549ms
响应时间(总计)1.45s
-
通用智能
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.19s
响应时间(最大)1.19s
响应时间(总计)1.19s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)809ms
响应时间(最大)983ms
响应时间(总计)1.62s
-
谜题求解
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.34s
响应时间(最大)2.25s
响应时间(总计)4.03s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.30s
响应时间(最大)2.30s
响应时间(总计)2.30s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)493ms
响应时间(最大)493ms
响应时间(总计)493ms
|
| #94#94 |
MiMo-V2-Pronone
|
5.9… |
Xiaomi |
$0.043… |
2.35s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 2
响应时间(平均)2.35s
响应时间(最大)6.58s
响应时间(总计)44.69s
…
|
- 总测试数
- 19
- 错误测试数
- 12
- 尝试通过率
- 45.6%
- 输出令牌
- 2,344
- 推理令牌
- 0
- 响应时间(平均)
- 2.35s
- 响应时间(总计)
- 44.69s
- 响应时间(最大)
- 6.58s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.80s
响应时间(最大)2.62s
响应时间(总计)7.19s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.82s
响应时间(最大)3.82s
响应时间(总计)3.82s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.58s
响应时间(最大)6.58s
响应时间(总计)6.58s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.39s
响应时间(最大)1.42s
响应时间(总计)2.78s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.78s
响应时间(最大)2.49s
响应时间(总计)5.34s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.44s
响应时间(最大)2.44s
响应时间(总计)2.44s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.51s
响应时间(最大)2.95s
响应时间(总计)5.02s
-
谜题求解
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.83s
响应时间(最大)2.15s
响应时间(总计)5.50s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.39s
响应时间(最大)4.39s
响应时间(总计)4.39s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.63s
响应时间(最大)1.63s
响应时间(总计)1.63s
|
| #95#95 |
Qwen3.5-27Bnone
|
5.9… |
Qwen |
$0.016… |
1.68s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 2
响应时间(平均)1.68s
响应时间(最大)9.39s
响应时间(总计)31.92s
…
|
- 总测试数
- 19
- 错误测试数
- 12
- 尝试通过率
- 42.1%
- 输出令牌
- 3,555
- 推理令牌
- 0
- 响应时间(平均)
- 1.68s
- 响应时间(总计)
- 31.92s
- 响应时间(最大)
- 9.39s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)788ms
响应时间(最大)1.34s
响应时间(总计)3.15s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.51s
响应时间(最大)2.51s
响应时间(总计)2.51s
-
综合
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.39s
响应时间(最大)9.39s
响应时间(总计)9.39s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.43s
响应时间(最大)1.45s
响应时间(总计)2.86s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)540ms
响应时间(最大)649ms
响应时间(总计)1.62s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.51s
响应时间(最大)2.51s
响应时间(总计)2.51s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)815ms
响应时间(最大)973ms
响应时间(总计)1.63s
-
谜题求解
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.37s
响应时间(最大)2.23s
响应时间(总计)4.12s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.54s
响应时间(最大)3.54s
响应时间(总计)3.54s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)599ms
响应时间(最大)599ms
响应时间(总计)599ms
|
| #96#96 |
Qwen3.6 27Bnone
|
5.8… |
Qwen |
$0.031… |
4.00s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 2 无效工具调用: 1
响应时间(平均)4.00s
响应时间(最大)12.08s
响应时间(总计)76.04s
…
|
- 总测试数
- 19
- 错误测试数
- 12
- 尝试通过率
- 52.6%
- 输出令牌
- 3,786
- 推理令牌
- 0
- 响应时间(平均)
- 4.00s
- 响应时间(总计)
- 76.04s
- 响应时间(最大)
- 12.08s
-
反AI技巧
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.83s
响应时间(最大)7.62s
响应时间(总计)11.33s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.18s
响应时间(最大)10.18s
响应时间(总计)10.18s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)9.95s
响应时间(最大)9.95s
响应时间(总计)9.95s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.06s
响应时间(最大)2.39s
响应时间(总计)4.11s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.03s
响应时间(最大)4.83s
响应时间(总计)9.08s
-
通用智能
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.07s
响应时间(最大)1.07s
响应时间(总计)1.07s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.92s
响应时间(最大)1.94s
响应时间(总计)3.83s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)5.24s
响应时间(最大)12.08s
响应时间(总计)15.71s
-
工具调用
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.74s
响应时间(最大)6.74s
响应时间(总计)6.74s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.03s
响应时间(最大)4.03s
响应时间(总计)4.03s
|
| #97#97 |
Cobuddymedium
|
5.8… |
Baidu |
$0.000… |
36.50s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 未遵循指令: 3 无效工具调用: 1
响应时间(平均)36.50s
响应时间(最大)309.02s
响应时间(总计)693.45s
…
|
- 总测试数
- 19
- 错误测试数
- 12
- 尝试通过率
- 54.4%
- 输出令牌
- 1,648
- 推理令牌
- 96,062
- 响应时间(平均)
- 36.50s
- 响应时间(总计)
- 693.45s
- 响应时间(最大)
- 309.02s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.00s
响应时间(最大)11.53s
响应时间(总计)39.99s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)53.59s
响应时间(最大)53.59s
响应时间(总计)53.59s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)47.38s
响应时间(最大)47.38s
响应时间(总计)47.38s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.36s
响应时间(最大)26.57s
响应时间(总计)34.71s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)128.15s
响应时间(最大)309.02s
响应时间(总计)384.46s
-
通用智能
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)23.23s
响应时间(最大)23.23s
响应时间(总计)23.23s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.60s
响应时间(最大)14.49s
响应时间(总计)23.20s
-
谜题求解
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)12.91s
响应时间(最大)24.40s
响应时间(总计)38.72s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.19s
响应时间(最大)11.19s
响应时间(总计)11.19s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)36.98s
响应时间(最大)36.98s
响应时间(总计)36.98s
|
| #98#98 |
Owl Alphanone
|
5.8… |
Openrouter |
$0.000… |
6.83s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 3
响应时间(平均)6.83s
响应时间(最大)32.27s
响应时间(总计)129.73s
…
|
- 总测试数
- 19
- 错误测试数
- 12
- 尝试通过率
- 43.9%
- 输出令牌
- 1,685
- 推理令牌
- 0
- 响应时间(平均)
- 6.83s
- 响应时间(总计)
- 129.73s
- 响应时间(最大)
- 32.27s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)2.78s
响应时间(最大)3.09s
响应时间(总计)11.10s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)32.27s
响应时间(最大)32.27s
响应时间(总计)32.27s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)21.74s
响应时间(最大)21.74s
响应时间(总计)21.74s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.60s
响应时间(最大)3.92s
响应时间(总计)7.19s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.00s
响应时间(最大)4.69s
响应时间(总计)8.99s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.61s
响应时间(最大)4.61s
响应时间(总计)4.61s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.63s
响应时间(最大)2.77s
响应时间(总计)5.27s
-
谜题求解
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)4.43s
响应时间(最大)8.27s
响应时间(总计)13.28s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)22.78s
响应时间(最大)22.78s
响应时间(总计)22.78s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.50s
响应时间(最大)2.50s
响应时间(总计)2.50s
|
| #99#99 |
GLM 4.7 Flashnone
|
5.8… |
Z.ai |
$0.003… |
3.13s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 1 无效工具调用: 1
响应时间(平均)3.13s
响应时间(最大)7.05s
响应时间(总计)37.60s
…
|
- 总测试数
- 19
- 错误测试数
- 13
- 尝试通过率
- 40.4%
- 输出令牌
- 2,498
- 推理令牌
- 0
- 响应时间(平均)
- 3.13s
- 响应时间(总计)
- 37.60s
- 响应时间(最大)
- 7.05s
-
反AI技巧
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)5.51s
响应时间(最大)6.59s
响应时间(总计)11.02s
-
编程
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.57s
响应时间(最大)5.57s
响应时间(总计)5.57s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)3.22s
响应时间(最大)3.22s
响应时间(总计)3.22s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.82s
响应时间(最大)4.82s
响应时间(总计)4.82s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)744ms
响应时间(最大)744ms
响应时间(总计)744ms
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.59s
响应时间(最大)1.59s
响应时间(总计)1.59s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)888ms
响应时间(最大)888ms
响应时间(总计)888ms
-
谜题求解
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.00s
响应时间(最大)1.12s
响应时间(总计)2.00s
-
工具调用
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.05s
响应时间(最大)7.05s
响应时间(总计)7.05s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)692ms
响应时间(最大)692ms
响应时间(总计)692ms
|
| #100#100 |
GPT-5.4none
|
5.7… |
OpenAI |
$0.105… |
1.48s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 1
响应时间(平均)1.48s
响应时间(最大)2.95s
响应时间(总计)28.20s
…
|
- 总测试数
- 19
- 错误测试数
- 12
- 尝试通过率
- 40.4%
- 输出令牌
- 2,357
- 推理令牌
- 0
- 响应时间(平均)
- 1.48s
- 响应时间(总计)
- 28.20s
- 响应时间(最大)
- 2.95s
-
反AI技巧
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.21s
响应时间(最大)2.58s
响应时间(总计)4.85s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.95s
响应时间(最大)2.95s
响应时间(总计)2.95s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.89s
响应时间(最大)2.89s
响应时间(总计)2.89s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.04s
响应时间(最大)1.06s
响应时间(总计)2.08s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.07s
响应时间(最大)1.54s
响应时间(总计)3.22s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.78s
响应时间(最大)1.78s
响应时间(总计)1.78s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.07s
响应时间(最大)1.17s
响应时间(总计)2.15s
-
谜题求解
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.52s
响应时间(最大)1.82s
响应时间(总计)4.56s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.75s
响应时间(最大)2.75s
响应时间(总计)2.75s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)990ms
响应时间(最大)990ms
响应时间(总计)990ms
|
| #101#101 |
gpt-oss-120bmedium
|
5.7… |
OpenAI |
$0.011… |
16.95s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 未遵循指令: 4
响应时间(平均)16.95s
响应时间(最大)50.92s
响应时间(总计)203.39s
…
|
- 总测试数
- 19
- 错误测试数
- 12
- 尝试通过率
- 49.1%
- 输出令牌
- 16,594
- 推理令牌
- 40,637
- 响应时间(平均)
- 16.95s
- 响应时间(总计)
- 203.39s
- 响应时间(最大)
- 50.92s
-
反AI技巧
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)10.21s
响应时间(最大)19.76s
响应时间(总计)20.43s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)26.33s
响应时间(最大)26.33s
响应时间(总计)26.33s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)31.18s
响应时间(最大)31.18s
响应时间(总计)31.18s
-
数据解析与提取
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.98s
响应时间(最大)1.98s
响应时间(总计)1.98s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)50.92s
响应时间(最大)50.92s
响应时间(总计)50.92s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)7.90s
响应时间(最大)7.90s
响应时间(总计)7.90s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.63s
响应时间(最大)7.63s
响应时间(总计)7.63s
-
谜题求解
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2 答案错误: 1
响应时间(平均)11.80s
响应时间(最大)12.60s
响应时间(总计)23.61s
-
工具调用
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.91s
响应时间(最大)6.91s
响应时间(总计)6.91s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)26.51s
响应时间(最大)26.51s
响应时间(总计)26.51s
|
| #102#102 |
Kimi K2.6none
|
5.7… |
Moonshot AI |
$0.039… |
2.02s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 2
响应时间(平均)2.02s
响应时间(最大)6.65s
响应时间(总计)38.29s
…
|
- 总测试数
- 19
- 错误测试数
- 12
- 尝试通过率
- 40.4%
- 输出令牌
- 2,990
- 推理令牌
- 0
- 响应时间(平均)
- 2.02s
- 响应时间(总计)
- 38.29s
- 响应时间(最大)
- 6.65s
-
反AI技巧
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.39s
响应时间(最大)2.96s
响应时间(总计)5.56s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.65s
响应时间(最大)6.65s
响应时间(总计)6.65s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.38s
响应时间(最大)3.38s
响应时间(总计)3.38s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.32s
响应时间(最大)1.39s
响应时间(总计)2.64s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.48s
响应时间(最大)1.85s
响应时间(总计)4.45s
-
通用智能
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.55s
响应时间(最大)1.55s
响应时间(总计)1.55s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.64s
响应时间(最大)1.80s
响应时间(总计)3.28s
-
谜题求解
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.66s
响应时间(最大)1.81s
响应时间(总计)4.98s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.46s
响应时间(最大)4.46s
响应时间(总计)4.46s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.36s
响应时间(最大)1.36s
响应时间(总计)1.36s
|
| #103#103 |
GLM 5.1none
|
5.7… |
Z.ai |
$0.053… |
4.23s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 1 无效工具调用: 1
响应时间(平均)4.23s
响应时间(最大)32.57s
响应时间(总计)80.36s
…
|
- 总测试数
- 19
- 错误测试数
- 13
- 尝试通过率
- 42.1%
- 输出令牌
- 3,731
- 推理令牌
- 0
- 响应时间(平均)
- 4.23s
- 响应时间(总计)
- 80.36s
- 响应时间(最大)
- 32.57s
-
反AI技巧
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.11s
响应时间(最大)3.94s
响应时间(总计)8.46s
-
编程
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.79s
响应时间(最大)9.79s
响应时间(总计)9.79s
-
综合
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)32.57s
响应时间(最大)32.57s
响应时间(总计)32.57s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.08s
响应时间(最大)1.62s
响应时间(总计)2.15s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.99s
响应时间(最大)3.99s
响应时间(总计)5.98s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)790ms
响应时间(最大)790ms
响应时间(总计)790ms
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.58s
响应时间(最大)1.69s
响应时间(总计)3.17s
-
谜题求解
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.48s
响应时间(最大)2.09s
响应时间(总计)4.44s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.68s
响应时间(最大)10.68s
响应时间(总计)10.68s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.34s
响应时间(最大)2.34s
响应时间(总计)2.34s
|
| #104#104 |
MiMo-V2.5-Pronone
|
5.7… |
Xiaomi |
$0.035… |
1.88s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 3
响应时间(平均)1.88s
响应时间(最大)8.32s
响应时间(总计)35.63s
…
|
- 总测试数
- 19
- 错误测试数
- 13
- 尝试通过率
- 43.9%
- 输出令牌
- 3,040
- 推理令牌
- 0
- 响应时间(平均)
- 1.88s
- 响应时间(总计)
- 35.63s
- 响应时间(最大)
- 8.32s
-
反AI技巧
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)2.67s
响应时间(最大)8.32s
响应时间(总计)10.67s
-
编程
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.39s
响应时间(最大)2.39s
响应时间(总计)2.39s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.54s
响应时间(最大)3.54s
响应时间(总计)3.54s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.32s
响应时间(最大)1.42s
响应时间(总计)2.64s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)877ms
响应时间(最大)904ms
响应时间(总计)2.63s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.58s
响应时间(最大)2.58s
响应时间(总计)2.58s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.03s
响应时间(最大)1.10s
响应时间(总计)2.06s
-
谜题求解
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.32s
响应时间(最大)1.66s
响应时间(总计)3.95s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.30s
响应时间(最大)3.30s
响应时间(总计)3.30s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.89s
响应时间(最大)1.89s
响应时间(总计)1.89s
|
| #105#105 |
Hunter Alphanone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.7… |
OpenRouter |
$0.000… |
4.58s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 2 API 错误: 1
响应时间(平均)4.58s
响应时间(最大)15.17s
响应时间(总计)77.92s
…
|
- 总测试数
- 18
- 错误测试数
- 12
- 尝试通过率
- 46.3%
- 输出令牌
- 2,278
- 推理令牌
- 0
- 响应时间(平均)
- 4.58s
- 响应时间(总计)
- 77.92s
- 响应时间(最大)
- 15.17s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)3.81s
响应时间(最大)6.85s
响应时间(总计)15.23s
-
编程
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)15.17s
响应时间(最大)15.17s
响应时间(总计)15.17s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.49s
响应时间(最大)14.02s
响应时间(总计)16.98s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.33s
响应时间(最大)2.94s
响应时间(总计)6.99s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.71s
响应时间(最大)2.71s
响应时间(总计)2.71s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.82s
响应时间(最大)2.92s
响应时间(总计)5.65s
-
谜题求解
: 5.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)3.06s
响应时间(最大)3.50s
响应时间(总计)9.19s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.02s
响应时间(最大)6.02s
响应时间(总计)6.02s
|
| #106#106 |
DeepSeek V3.2none
|
5.7… |
DeepSeek |
$0.016… |
13.43s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 额外格式: 2 未遵循指令: 1 无效工具调用: 1
响应时间(平均)13.43s
响应时间(最大)115.89s
响应时间(总计)255.10s
…
|
- 总测试数
- 19
- 错误测试数
- 12
- 尝试通过率
- 49.1%
- 输出令牌
- 7,194
- 推理令牌
- 0
- 响应时间(平均)
- 13.43s
- 响应时间(总计)
- 255.10s
- 响应时间(最大)
- 115.89s
-
反AI技巧
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 未遵循指令: 1 答案错误: 1
响应时间(平均)9.35s
响应时间(最大)16.77s
响应时间(总计)37.40s
-
编程
: 2.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.63s
响应时间(最大)7.63s
响应时间(总计)7.63s
-
综合
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)115.89s
响应时间(最大)115.89s
响应时间(总计)115.89s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.42s
响应时间(最大)16.20s
响应时间(总计)18.84s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)4.17s
响应时间(最大)9.09s
响应时间(总计)12.51s
-
通用智能
: 7.6
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.32s
响应时间(最大)9.32s
响应时间(总计)9.32s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.52s
响应时间(最大)1.99s
响应时间(总计)3.04s
-
谜题求解
: 7.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.13s
响应时间(最大)10.09s
响应时间(总计)21.40s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.85s
响应时间(最大)11.85s
响应时间(总计)11.85s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.23s
响应时间(最大)17.23s
响应时间(总计)17.23s
|
| #107#107 |
Qwen3.6 Flashnone
|
5.6… |
Qwen |
$0.018… |
1.60s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 1 无效工具调用: 1
响应时间(平均)1.60s
响应时间(最大)4.60s
响应时间(总计)30.43s
…
|
- 总测试数
- 19
- 错误测试数
- 12
- 尝试通过率
- 36.8%
- 输出令牌
- 4,170
- 推理令牌
- 0
- 响应时间(平均)
- 1.60s
- 响应时间(总计)
- 30.43s
- 响应时间(最大)
- 4.60s
-
反AI技巧
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.63s
响应时间(最大)4.60s
响应时间(总计)6.51s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.23s
响应时间(最大)2.23s
响应时间(总计)2.23s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)4.22s
响应时间(最大)4.22s
响应时间(总计)4.22s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.13s
响应时间(最大)3.35s
响应时间(总计)4.26s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.11s
响应时间(最大)1.89s
响应时间(总计)3.32s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)947ms
响应时间(最大)947ms
响应时间(总计)947ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.10s
响应时间(最大)1.36s
响应时间(总计)2.19s
-
谜题求解
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.20s
响应时间(最大)1.77s
响应时间(总计)3.61s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.49s
响应时间(最大)2.49s
响应时间(总计)2.49s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)649ms
响应时间(最大)649ms
响应时间(总计)649ms
|
| #108#108 |
MiniMax M2.5medium
|
5.5… |
Minimax |
$0.273… |
43.39s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 超时: 4 未遵循指令: 3 无效工具调用: 1
响应时间(平均)43.39s
响应时间(最大)237.27s
响应时间(总计)477.26s
…
|
- 总测试数
- 19
- 错误测试数
- 14
- 尝试通过率
- 52.6%
- 输出令牌
- 108,324
- 推理令牌
- 224,957
- 响应时间(平均)
- 43.39s
- 响应时间(总计)
- 477.26s
- 响应时间(最大)
- 237.27s
-
反AI技巧
: 7.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 超时: 1
响应时间(平均)20.82s
响应时间(最大)32.42s
响应时间(总计)41.63s
-
编程
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)60.39s
响应时间(最大)60.39s
响应时间(总计)60.39s
-
数据解析与提取
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)7.48s
响应时间(最大)7.48s
响应时间(总计)7.48s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)237.27s
响应时间(最大)237.27s
响应时间(总计)237.27s
-
通用智能
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)6.63s
响应时间(最大)6.63s
响应时间(总计)6.63s
-
指令遵循
: 7.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.64s
响应时间(最大)4.64s
响应时间(总计)4.64s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)11.54s
响应时间(最大)17.37s
响应时间(总计)23.08s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.35s
响应时间(最大)15.35s
响应时间(总计)15.35s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)80.79s
响应时间(最大)80.79s
响应时间(总计)80.79s
|
| #109#109 |
Mistral Small 4medium
|
5.5… |
Mistral |
$0.035… |
5.65s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 API 错误: 2 未遵循指令: 2
响应时间(平均)5.65s
响应时间(最大)30.49s
响应时间(总计)107.44s
…
|
- 总测试数
- 19
- 错误测试数
- 14
- 尝试通过率
- 47.4%
- 输出令牌
- 15,102
- 推理令牌
- 40,965
- 响应时间(平均)
- 5.65s
- 响应时间(总计)
- 107.44s
- 响应时间(最大)
- 30.49s
-
反AI技巧
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.67s
响应时间(最大)5.03s
响应时间(总计)10.66s
-
编程
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)30.49s
响应时间(最大)30.49s
响应时间(总计)30.49s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)25.25s
响应时间(最大)25.25s
响应时间(总计)25.25s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)1.23s
响应时间(最大)1.96s
响应时间(总计)2.46s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)6.11s
响应时间(最大)13.72s
响应时间(总计)18.34s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.05s
响应时间(最大)2.05s
响应时间(总计)2.05s
-
指令遵循
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.38s
响应时间(最大)1.61s
响应时间(总计)2.75s
-
谜题求解
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)2.00s
响应时间(最大)2.60s
响应时间(总计)6.01s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.50s
响应时间(最大)3.50s
响应时间(总计)3.50s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.92s
响应时间(最大)5.92s
响应时间(总计)5.92s
|
| #110#110 |
Grok 4.20 Betanone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.5… |
X AI |
$0.091… |
1.19s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 1 无效工具调用: 1
响应时间(平均)1.19s
响应时间(最大)6.48s
响应时间(总计)21.37s
…
|
- 总测试数
- 18
- 错误测试数
- 13
- 尝试通过率
- 35.2%
- 输出令牌
- 1,591
- 推理令牌
- 0
- 响应时间(平均)
- 1.19s
- 响应时间(总计)
- 21.37s
- 响应时间(最大)
- 6.48s
-
反AI技巧
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)597ms
响应时间(最大)866ms
响应时间(总计)2.39s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.14s
响应时间(最大)1.14s
响应时间(总计)1.14s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)6.48s
响应时间(最大)6.48s
响应时间(总计)6.48s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)601ms
响应时间(最大)634ms
响应时间(总计)1.20s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)611ms
响应时间(最大)616ms
响应时间(总计)1.83s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)541ms
响应时间(最大)541ms
响应时间(总计)541ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)687ms
响应时间(最大)952ms
响应时间(总计)1.37s
-
谜题求解
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)541ms
响应时间(最大)677ms
响应时间(总计)1.62s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.79s
响应时间(最大)4.79s
响应时间(总计)4.79s
|
| #111#111 |
Elephant Alphamedium
|
5.5… |
Openrouter |
$0.000… |
1.27s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 2 无效工具调用: 1
响应时间(平均)1.27s
响应时间(最大)3.70s
响应时间(总计)22.82s
…
|
- 总测试数
- 19
- 错误测试数
- 12
- 尝试通过率
- 35.2%
- 输出令牌
- 2,596
- 推理令牌
- 0
- 响应时间(平均)
- 1.27s
- 响应时间(总计)
- 22.82s
- 响应时间(最大)
- 3.70s
-
反AI技巧
: 6.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.19s
响应时间(最大)2.04s
响应时间(总计)4.75s
-
编程
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.30s
响应时间(最大)1.30s
响应时间(总计)1.30s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.70s
响应时间(最大)3.70s
响应时间(总计)3.70s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)979ms
响应时间(最大)1.02s
响应时间(总计)1.96s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)925ms
响应时间(最大)1.16s
响应时间(总计)2.77s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)920ms
响应时间(最大)920ms
响应时间(总计)920ms
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)987ms
响应时间(最大)1.13s
响应时间(总计)1.97s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)867ms
响应时间(最大)972ms
响应时间(总计)2.60s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)2.83s
响应时间(最大)2.83s
响应时间(总计)2.83s
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #112#112 |
Qwen3.5-122B-A10Bnone
|
5.5… |
Qwen |
$0.022… |
3.52s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 2
响应时间(平均)3.52s
响应时间(最大)46.00s
响应时间(总计)66.80s
…
|
- 总测试数
- 19
- 错误测试数
- 13
- 尝试通过率
- 36.8%
- 输出令牌
- 3,350
- 推理令牌
- 0
- 响应时间(平均)
- 3.52s
- 响应时间(总计)
- 66.80s
- 响应时间(最大)
- 46.00s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.59s
响应时间(最大)3.60s
响应时间(总计)6.38s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.44s
响应时间(最大)3.44s
响应时间(总计)3.44s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)46.00s
响应时间(最大)46.00s
响应时间(总计)46.00s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.01s
响应时间(最大)1.06s
响应时间(总计)2.02s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)465ms
响应时间(最大)492ms
响应时间(总计)1.39s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.12s
响应时间(最大)1.12s
响应时间(总计)1.12s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)585ms
响应时间(最大)715ms
响应时间(总计)1.17s
-
谜题求解
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)982ms
响应时间(最大)1.36s
响应时间(总计)2.95s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.04s
响应时间(最大)2.04s
响应时间(总计)2.04s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)295ms
响应时间(最大)295ms
响应时间(总计)295ms
|
| #113#113 |
Nemotron 3 Nano Omni 30b A3b Reasoningmedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.4… |
NVIDIA |
$0.000… |
17.15s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 未遵循指令: 1 无答案: 1
响应时间(平均)17.15s
响应时间(最大)147.45s
响应时间(总计)222.94s
…
|
- 总测试数
- 19
- 错误测试数
- 9
- 尝试通过率
- 53.9%
- 输出令牌
- 48,462
- 推理令牌
- 180,793
- 响应时间(平均)
- 17.15s
- 响应时间(总计)
- 222.94s
- 响应时间(最大)
- 147.45s
-
反AI技巧
: 7.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.20s
响应时间(最大)1.48s
响应时间(总计)3.59s
-
编程
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)38.09s
响应时间(最大)38.09s
响应时间(总计)38.09s
-
综合
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.72s
响应时间(最大)3.88s
响应时间(总计)5.43s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)56.67s
响应时间(最大)147.45s
响应时间(总计)170.02s
-
通用智能
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 7.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.53s
响应时间(最大)1.56s
响应时间(总计)3.07s
-
谜题求解
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.37s
响应时间(最大)1.57s
响应时间(总计)2.74s
-
工具调用
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #114#114 |
Kimi K2.5none
|
5.4… |
Moonshot AI |
$0.017… |
12.58s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13
响应时间(平均)12.58s
响应时间(最大)42.13s
响应时间(总计)150.95s
…
|
- 总测试数
- 19
- 错误测试数
- 13
- 尝试通过率
- 38.6%
- 输出令牌
- 2,679
- 推理令牌
- 0
- 响应时间(平均)
- 12.58s
- 响应时间(总计)
- 150.95s
- 响应时间(最大)
- 42.13s
-
反AI技巧
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)6.24s
响应时间(最大)11.38s
响应时间(总计)12.48s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)38.78s
响应时间(最大)38.78s
响应时间(总计)38.78s
-
综合
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)19.16s
响应时间(最大)19.16s
响应时间(总计)19.16s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)42.13s
响应时间(最大)42.13s
响应时间(总计)42.13s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.38s
响应时间(最大)4.38s
响应时间(总计)4.38s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.00s
响应时间(最大)4.00s
响应时间(总计)4.00s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.67s
响应时间(最大)2.67s
响应时间(总计)2.67s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)4.73s
响应时间(最大)7.81s
响应时间(总计)9.45s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.99s
响应时间(最大)13.99s
响应时间(总计)13.99s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.90s
响应时间(最大)3.90s
响应时间(总计)3.90s
|
| #115#115 |
Grok 4.20none
|
5.4… |
X AI |
$0.095… |
1.11s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 额外格式: 1 无效工具调用: 1
响应时间(平均)1.11s
响应时间(最大)6.04s
响应时间(总计)20.02s
…
|
- 总测试数
- 18
- 错误测试数
- 12
- 尝试通过率
- 35.2%
- 输出令牌
- 1,967
- 推理令牌
- 0
- 响应时间(平均)
- 1.11s
- 响应时间(总计)
- 20.02s
- 响应时间(最大)
- 6.04s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)501ms
响应时间(最大)839ms
响应时间(总计)2.01s
-
编程
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.22s
响应时间(最大)1.22s
响应时间(总计)1.22s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)6.04s
响应时间(最大)6.04s
响应时间(总计)6.04s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)522ms
响应时间(最大)537ms
响应时间(总计)1.04s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1
响应时间(平均)687ms
响应时间(最大)821ms
响应时间(总计)2.06s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)659ms
响应时间(最大)659ms
响应时间(总计)659ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)455ms
响应时间(最大)505ms
响应时间(总计)910ms
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)487ms
响应时间(最大)539ms
响应时间(总计)1.46s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.63s
响应时间(最大)4.63s
响应时间(总计)4.63s
|
| #116#116 |
GLM 5 Turbonone
|
5.4… |
Z.ai |
$0.032… |
2.91s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 2
响应时间(平均)2.91s
响应时间(最大)8.21s
响应时间(总计)55.35s
…
|
- 总测试数
- 19
- 错误测试数
- 13
- 尝试通过率
- 35.1%
- 输出令牌
- 1,791
- 推理令牌
- 0
- 响应时间(平均)
- 2.91s
- 响应时间(总计)
- 55.35s
- 响应时间(最大)
- 8.21s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.84s
响应时间(最大)4.15s
响应时间(总计)11.35s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.93s
响应时间(最大)3.93s
响应时间(总计)3.93s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.89s
响应时间(最大)4.89s
响应时间(总计)4.89s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.47s
响应时间(最大)2.48s
响应时间(总计)4.95s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.97s
响应时间(最大)2.65s
响应时间(总计)5.92s
-
通用智能
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.18s
响应时间(最大)2.18s
响应时间(总计)2.18s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.13s
响应时间(最大)2.53s
响应时间(总计)4.27s
-
谜题求解
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.43s
响应时间(最大)2.69s
响应时间(总计)7.28s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.21s
响应时间(最大)8.21s
响应时间(总计)8.21s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.37s
响应时间(最大)2.37s
响应时间(总计)2.37s
|
| #117#117 |
Laguna M.1none已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.4… |
Poolside |
$0.000… |
2.89s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 无效工具调用: 1
响应时间(平均)2.89s
响应时间(最大)15.42s
响应时间(总计)43.40s
…
|
- 总测试数
- 19
- 错误测试数
- 11
- 尝试通过率
- 40.0%
- 输出令牌
- 2,068
- 推理令牌
- 0
- 响应时间(平均)
- 2.89s
- 响应时间(总计)
- 43.40s
- 响应时间(最大)
- 15.42s
-
反AI技巧
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)705ms
响应时间(最大)975ms
响应时间(总计)2.12s
-
编程
: 7.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.93s
响应时间(最大)2.93s
响应时间(总计)2.93s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)4.32s
响应时间(最大)4.32s
响应时间(总计)4.32s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.37s
响应时间(最大)5.76s
响应时间(总计)6.73s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)5.50s
响应时间(最大)15.42s
响应时间(总计)16.50s
-
通用智能
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)683ms
响应时间(最大)691ms
响应时间(总计)1.37s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)948ms
响应时间(最大)1.32s
响应时间(总计)1.90s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.54s
响应时间(最大)7.54s
响应时间(总计)7.54s
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #118#118 |
Elephant Alphanone
|
5.3… |
Openrouter |
$0.000… |
1.23s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 3 无效工具调用: 1
响应时间(平均)1.23s
响应时间(最大)3.81s
响应时间(总计)22.16s
…
|
- 总测试数
- 19
- 错误测试数
- 13
- 尝试通过率
- 31.5%
- 输出令牌
- 2,573
- 推理令牌
- 0
- 响应时间(平均)
- 1.23s
- 响应时间(总计)
- 22.16s
- 响应时间(最大)
- 3.81s
-
反AI技巧
: 6.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)963ms
响应时间(最大)1.68s
响应时间(总计)3.85s
-
编程
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.39s
响应时间(最大)1.39s
响应时间(总计)1.39s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.81s
响应时间(最大)3.81s
响应时间(总计)3.81s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.04s
响应时间(最大)1.05s
响应时间(总计)2.08s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)927ms
响应时间(最大)1.17s
响应时间(总计)2.78s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)854ms
响应时间(最大)854ms
响应时间(总计)854ms
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.03s
响应时间(最大)1.17s
响应时间(总计)2.07s
-
谜题求解
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)849ms
响应时间(最大)925ms
响应时间(总计)2.55s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)2.79s
响应时间(最大)2.79s
响应时间(总计)2.79s
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #119#119 |
Laguna Xs.2none已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.3… |
Poolside |
$0.000… |
806ms… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 未遵循指令: 1 无效工具调用: 1
响应时间(平均)806ms
响应时间(最大)2.01s
响应时间(总计)12.09s
…
|
- 总测试数
- 19
- 错误测试数
- 10
- 尝试通过率
- 33.3%
- 输出令牌
- 2,826
- 推理令牌
- 0
- 响应时间(平均)
- 806ms
- 响应时间(总计)
- 12.09s
- 响应时间(最大)
- 2.01s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)534ms
响应时间(最大)906ms
响应时间(总计)1.60s
-
编程
: 2.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.96s
响应时间(最大)1.96s
响应时间(总计)1.96s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.01s
响应时间(最大)2.01s
响应时间(总计)2.01s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)646ms
响应时间(最大)658ms
响应时间(总计)1.29s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)371ms
响应时间(最大)419ms
响应时间(总计)1.11s
-
通用智能
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)439ms
响应时间(最大)448ms
响应时间(总计)878ms
-
谜题求解
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)653ms
响应时间(最大)850ms
响应时间(总计)1.31s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)1.93s
响应时间(最大)1.93s
响应时间(总计)1.93s
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #120#120 |
Ling-2.6-flashnone
|
5.3… |
Inclusionai |
$0.001… |
9.76s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 2 无效工具调用: 2
响应时间(平均)9.76s
响应时间(最大)35.34s
响应时间(总计)185.37s
…
|
- 总测试数
- 19
- 错误测试数
- 13
- 尝试通过率
- 35.1%
- 输出令牌
- 2,878
- 推理令牌
- 0
- 响应时间(平均)
- 9.76s
- 响应时间(总计)
- 185.37s
- 响应时间(最大)
- 35.34s
-
反AI技巧
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)11.81s
响应时间(最大)16.60s
响应时间(总计)47.23s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.21s
响应时间(最大)11.21s
响应时间(总计)11.21s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)35.34s
响应时间(最大)35.34s
响应时间(总计)35.34s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)8.48s
响应时间(最大)12.71s
响应时间(总计)16.96s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)4.95s
响应时间(最大)7.65s
响应时间(总计)14.84s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.45s
响应时间(最大)1.45s
响应时间(总计)1.45s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.52s
响应时间(最大)8.19s
响应时间(总计)11.04s
-
谜题求解
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)9.14s
响应时间(最大)17.06s
响应时间(总计)27.42s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)18.80s
响应时间(最大)18.80s
响应时间(总计)18.80s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.06s
响应时间(最大)1.06s
响应时间(总计)1.06s
|