| #61#61 |
KAT-Coder-Pro V2.5low
|
7.4… |
Kwaipilot |
$0.387
…
|
19.47s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 API 错误: 1
响应时间(平均)19.47s
响应时间(最大)209.15s
响应时间(总计)428.31s
…
|
- 总测试数
- 22
- 错误测试数
- 11
- 尝试通过率
- 69.7%
- 输入令牌
- 87,673
- 输出令牌
- 7,166
- 推理令牌
- 101,474
- 响应时间(平均)
- 19.47s
- 响应时间(总计)
- 428.31s
- 响应时间(最大)
- 209.15s
-
反AI技巧
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.20s
响应时间(最大)9.56s
响应时间(总计)16.82s
-
编程
: 7.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)24.87s
响应时间(最大)51.34s
响应时间(总计)74.61s
-
综合
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)111.87s
响应时间(最大)209.15s
响应时间(总计)223.74s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.19s
响应时间(最大)4.83s
响应时间(总计)8.37s
-
领域专项
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)17.52s
响应时间(最大)44.39s
响应时间(总计)52.55s
-
通用智能
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.32s
响应时间(最大)2.32s
响应时间(总计)2.32s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.53s
响应时间(最大)3.03s
响应时间(总计)5.07s
-
谜题求解
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.11s
响应时间(最大)4.16s
响应时间(总计)9.33s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)18.45s
响应时间(最大)18.45s
响应时间(总计)18.45s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.06s
响应时间(最大)17.06s
响应时间(总计)17.06s
|
| #134#134 |
Kimi K2.6none
|
5.8… |
Moonshot AI |
$0.233
↑
…
|
19.58s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 3 无答案: 1
响应时间(平均)19.58s
响应时间(最大)238.89s
响应时间(总计)430.85s
…
|
- 总测试数
- 22
- 错误测试数
- 15
- 尝试通过率
- 34.9%
- 输入令牌
- 116,970
- 输出令牌
- 30,253
- 推理令牌
- 0
- 响应时间(平均)
- 19.58s
- 响应时间(总计)
- 430.85s
- 响应时间(最大)
- 238.89s
-
反AI技巧
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.39s
响应时间(最大)2.96s
响应时间(总计)5.56s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)82.57s
响应时间(最大)238.89s
响应时间(总计)247.72s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)77.83s
响应时间(最大)152.28s
响应时间(总计)155.66s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.32s
响应时间(最大)1.39s
响应时间(总计)2.64s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.48s
响应时间(最大)1.85s
响应时间(总计)4.45s
-
通用智能
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.55s
响应时间(最大)1.55s
响应时间(总计)1.55s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.64s
响应时间(最大)1.80s
响应时间(总计)3.28s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.40s
响应时间(最大)1.81s
响应时间(总计)4.19s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.46s
响应时间(最大)4.46s
响应时间(总计)4.46s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.36s
响应时间(最大)1.36s
响应时间(总计)1.36s
|
| #109#109 |
MiMo-V2-Flashmedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.3… |
Xiaomi |
$0.043
↑
…
|
20.11s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 API 错误: 1 额外格式: 1 未遵循指令: 1 超时: 1
响应时间(平均)20.11s
响应时间(最大)96.01s
响应时间(总计)301.59s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 62.1%
- 输入令牌
- 40,111
- 输出令牌
- 12,476
- 推理令牌
- 125,039
- 响应时间(平均)
- 20.11s
- 响应时间(总计)
- 301.59s
- 响应时间(最大)
- 96.01s
-
反AI技巧
: 8.1
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)15.85s
响应时间(最大)20.83s
响应时间(总计)47.55s
-
编程
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)10.71s
响应时间(最大)17.72s
响应时间(总计)32.13s
-
综合
: 4.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)75.68s
响应时间(最大)75.68s
响应时间(总计)75.68s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)96.01s
响应时间(最大)96.01s
响应时间(总计)96.01s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.20s
响应时间(最大)4.20s
响应时间(总计)4.20s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.28s
响应时间(最大)7.37s
响应时间(总计)8.55s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.87s
响应时间(最大)5.26s
响应时间(总计)7.74s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)27.78s
响应时间(最大)27.78s
响应时间(总计)27.78s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.96s
响应时间(最大)1.96s
响应时间(总计)1.96s
|
| #66#66 |
Step 3.7 Flashlow
|
7.3… |
Stepfun |
$0.454
…
|
20.68s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 无效工具调用: 1 无答案: 1
响应时间(平均)20.68s
响应时间(最大)124.75s
响应时间(总计)455.01s
…
|
- 总测试数
- 22
- 错误测试数
- 10
- 尝试通过率
- 68.2%
- 输入令牌
- 103,833
- 输出令牌
- 376,581
- 推理令牌
- 0
- 响应时间(平均)
- 20.68s
- 响应时间(总计)
- 455.01s
- 响应时间(最大)
- 124.75s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.02s
响应时间(最大)12.52s
响应时间(总计)16.10s
-
编程
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.46s
响应时间(最大)12.69s
响应时间(总计)28.38s
-
综合
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)66.18s
响应时间(最大)124.39s
响应时间(总计)132.37s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.29s
响应时间(最大)3.15s
响应时间(总计)4.58s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)43.31s
响应时间(最大)72.27s
响应时间(总计)129.92s
-
通用智能
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.00s
响应时间(最大)7.00s
响应时间(总计)7.00s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.58s
响应时间(最大)1.80s
响应时间(总计)3.16s
-
谜题求解
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.84s
响应时间(最大)3.42s
响应时间(总计)5.52s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.25s
响应时间(最大)3.25s
响应时间(总计)3.25s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)124.75s
响应时间(最大)124.75s
响应时间(总计)124.75s
|
| #68#68 |
KAT-Coder-Pro V2.5high
|
7.2… |
Kwaipilot |
$0.482
…
|
20.83s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 无效工具调用: 1
响应时间(平均)20.83s
响应时间(最大)199.97s
响应时间(总计)458.31s
…
|
- 总测试数
- 22
- 错误测试数
- 11
- 尝试通过率
- 63.6%
- 输入令牌
- 106,076
- 输出令牌
- 9,071
- 推理令牌
- 127,093
- 响应时间(平均)
- 20.83s
- 响应时间(总计)
- 458.31s
- 响应时间(最大)
- 199.97s
-
反AI技巧
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.17s
响应时间(最大)4.99s
响应时间(总计)12.67s
-
编程
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)22.00s
响应时间(最大)35.74s
响应时间(总计)65.99s
-
综合
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)106.70s
响应时间(最大)199.97s
响应时间(总计)213.41s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.13s
响应时间(最大)4.56s
响应时间(总计)8.26s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)35.33s
响应时间(最大)95.65s
响应时间(总计)105.99s
-
通用智能
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.27s
响应时间(最大)3.27s
响应时间(总计)3.27s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.67s
响应时间(最大)2.87s
响应时间(总计)5.33s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.38s
响应时间(最大)4.30s
响应时间(总计)10.13s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)28.04s
响应时间(最大)28.04s
响应时间(总计)28.04s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.22s
响应时间(最大)5.22s
响应时间(总计)5.22s
|
| #25#25 |
Gemini 2.5 Flashmedium
|
8.2… |
Google |
$0.643
…
|
21.18s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 1
响应时间(平均)21.18s
响应时间(最大)140.50s
响应时间(总计)465.89s
…
|
- 总测试数
- 22
- 错误测试数
- 7
- 尝试通过率
- 71.2%
- 输入令牌
- 132,498
- 输出令牌
- 12,739
- 推理令牌
- 228,464
- 响应时间(平均)
- 21.18s
- 响应时间(总计)
- 465.89s
- 响应时间(最大)
- 140.50s
-
反AI技巧
: 8.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.30s
响应时间(最大)15.56s
响应时间(总计)25.21s
-
编程
: 7.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)41.01s
响应时间(最大)92.88s
响应时间(总计)123.04s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)84.47s
响应时间(最大)140.50s
响应时间(总计)168.94s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.06s
响应时间(最大)5.06s
响应时间(总计)8.11s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)37.34s
响应时间(最大)95.48s
响应时间(总计)112.01s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.86s
响应时间(最大)4.86s
响应时间(总计)4.86s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.62s
响应时间(最大)2.78s
响应时间(总计)5.24s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.18s
响应时间(最大)4.05s
响应时间(总计)9.54s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.20s
响应时间(最大)6.20s
响应时间(总计)6.20s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.76s
响应时间(最大)2.76s
响应时间(总计)2.76s
|
| #7#7 |
Gemini 3.1 Pro Previewmedium
|
9.2… |
Google |
$1.361
…
|
21.47s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)21.47s
响应时间(最大)88.68s
响应时间(总计)322.08s
…
|
- 总测试数
- 22
- 错误测试数
- 2
- 尝试通过率
- 90.9%
- 输入令牌
- 92,287
- 输出令牌
- 5,232
- 推理令牌
- 92,726
- 响应时间(平均)
- 21.47s
- 响应时间(总计)
- 322.08s
- 响应时间(最大)
- 88.68s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.90s
响应时间(最大)9.52s
响应时间(总计)15.80s
-
编程
: 7.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)40.17s
响应时间(最大)88.68s
响应时间(总计)120.52s
-
综合
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)40.39s
响应时间(最大)40.61s
响应时间(总计)80.77s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.72s
响应时间(最大)7.72s
响应时间(总计)7.72s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)32.73s
响应时间(最大)32.73s
响应时间(总计)32.73s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.77s
响应时间(最大)11.77s
响应时间(总计)11.77s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.56s
响应时间(最大)9.56s
响应时间(总计)9.56s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.90s
响应时间(最大)8.49s
响应时间(总计)13.79s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.15s
响应时间(最大)23.15s
响应时间(总计)23.15s
-
常识问答
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.27s
响应时间(最大)6.27s
响应时间(总计)6.27s
|
| #202#202 |
gpt-oss-120bnone
|
3.7… |
OpenAI |
$0.010
↓
…
|
21.61s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 API 错误: 3 未遵循指令: 2
响应时间(平均)21.61s
响应时间(最大)113.71s
响应时间(总计)345.79s
…
|
- 总测试数
- 19
- 错误测试数
- 13
- 尝试通过率
- 33.3%
- 输入令牌
- 9,081
- 输出令牌
- 51,664
- 推理令牌
- 0
- 响应时间(平均)
- 21.61s
- 响应时间(总计)
- 345.79s
- 响应时间(最大)
- 113.71s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)32.84s
响应时间(最大)113.71s
响应时间(总计)131.35s
-
编程
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.57s
响应时间(最大)9.57s
响应时间(总计)9.57s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)7.12s
响应时间(最大)7.12s
响应时间(总计)7.12s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)34.98s
响应时间(最大)68.97s
响应时间(总计)104.94s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.79s
响应时间(最大)10.79s
响应时间(总计)10.79s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.06s
响应时间(最大)5.85s
响应时间(总计)10.12s
-
谜题求解
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)8.21s
响应时间(最大)11.82s
响应时间(总计)24.62s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)47.29s
响应时间(最大)47.29s
响应时间(总计)47.29s
|
| #117#117 |
gpt-oss-120bmedium
|
6.1… |
OpenAI |
$0.019
↓
…
|
21.91s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 3 无效工具调用: 1
响应时间(平均)21.91s
响应时间(最大)68.16s
响应时间(总计)328.70s
…
|
- 总测试数
- 22
- 错误测试数
- 13
- 尝试通过率
- 50.0%
- 输入令牌
- 108,747
- 输出令牌
- 29,772
- 推理令牌
- 68,044
- 响应时间(平均)
- 21.91s
- 响应时间(总计)
- 328.70s
- 响应时间(最大)
- 68.16s
-
反AI技巧
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)10.21s
响应时间(最大)19.76s
响应时间(总计)20.43s
-
编程
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)38.37s
响应时间(最大)68.16s
响应时间(总计)115.10s
-
综合
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)23.96s
响应时间(最大)31.18s
响应时间(总计)47.91s
-
数据解析与提取
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.98s
响应时间(最大)1.98s
响应时间(总计)1.98s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)50.92s
响应时间(最大)50.92s
响应时间(总计)50.92s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)7.90s
响应时间(最大)7.90s
响应时间(总计)7.90s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.63s
响应时间(最大)7.63s
响应时间(总计)7.63s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)21.71s
响应时间(最大)32.40s
响应时间(总计)43.41s
-
工具调用
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.91s
响应时间(最大)6.91s
响应时间(总计)6.91s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)26.51s
响应时间(最大)26.51s
响应时间(总计)26.51s
|
| #106#106 |
Mimo V2 PROmedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.3… |
Xiaomi |
$0.333
↑
…
|
22.16s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 API 错误: 1 额外格式: 1 未遵循指令: 1 超时: 1
响应时间(平均)22.16s
响应时间(最大)136.29s
响应时间(总计)443.22s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 69.7%
- 输入令牌
- 40,961
- 输出令牌
- 2,518
- 推理令牌
- 81,801
- 响应时间(平均)
- 22.16s
- 响应时间(总计)
- 443.22s
- 响应时间(最大)
- 136.29s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.86s
响应时间(最大)3.92s
响应时间(总计)11.45s
-
编程
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)94.21s
响应时间(最大)136.29s
响应时间(总计)188.41s
-
综合
: 2.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)64.71s
响应时间(最大)64.71s
响应时间(总计)64.71s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.20s
响应时间(最大)17.44s
响应时间(总计)34.40s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)8.82s
响应时间(最大)14.48s
响应时间(总计)26.47s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.92s
响应时间(最大)4.92s
响应时间(总计)4.92s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.36s
响应时间(最大)4.35s
响应时间(总计)6.72s
-
谜题求解
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 未遵循指令: 1
响应时间(平均)5.08s
响应时间(最大)6.41s
响应时间(总计)15.23s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.19s
响应时间(最大)8.19s
响应时间(总计)8.19s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)82.71s
响应时间(最大)82.71s
响应时间(总计)82.71s
|
| #21#21 |
GPT-5.2medium
|
8.4… |
OpenAI |
$0.951
…
|
22.62s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 3 答案错误: 3 无答案: 1 超时: 1
响应时间(平均)22.62s
响应时间(最大)102.93s
响应时间(总计)339.28s
…
|
- 总测试数
- 22
- 错误测试数
- 8
- 尝试通过率
- 72.7%
- 输入令牌
- 105,004
- 输出令牌
- 9,914
- 推理令牌
- 44,868
- 响应时间(平均)
- 22.62s
- 响应时间(总计)
- 339.28s
- 响应时间(最大)
- 102.93s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)7.81s
响应时间(最大)14.34s
响应时间(总计)15.62s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)22.73s
响应时间(最大)31.19s
响应时间(总计)68.20s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)58.50s
响应时间(最大)102.93s
响应时间(总计)116.99s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.15s
响应时间(最大)3.15s
响应时间(总计)3.15s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)77.80s
响应时间(最大)77.80s
响应时间(总计)77.80s
-
通用智能
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.32s
响应时间(最大)4.32s
响应时间(总计)4.32s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.12s
响应时间(最大)3.12s
响应时间(总计)3.12s
-
谜题求解
: 7.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)5.80s
响应时间(最大)6.45s
响应时间(总计)11.61s
-
工具调用
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)10.30s
响应时间(最大)10.30s
响应时间(总计)10.30s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)28.18s
响应时间(最大)28.18s
响应时间(总计)28.18s
|
| #49#49 |
GLM 5 Turbomedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
7.6… |
Z.ai |
$0.323
↑
…
|
23.00s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 1 无答案: 1 超时: 1
响应时间(平均)23.00s
响应时间(最大)194.23s
响应时间(总计)482.97s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 71.2%
- 输入令牌
- 35,593
- 输出令牌
- 12,245
- 推理令牌
- 62,277
- 响应时间(平均)
- 23.00s
- 响应时间(总计)
- 482.97s
- 响应时间(最大)
- 194.23s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.82s
响应时间(最大)7.69s
响应时间(总计)19.26s
-
编程
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)45.90s
响应时间(最大)95.57s
响应时间(总计)137.71s
-
综合
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.88s
响应时间(最大)13.88s
响应时间(总计)13.88s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.19s
响应时间(最大)6.42s
响应时间(总计)12.38s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)71.07s
响应时间(最大)194.23s
响应时间(总计)213.22s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.05s
响应时间(最大)10.05s
响应时间(总计)10.05s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.38s
响应时间(最大)5.70s
响应时间(总计)10.77s
-
谜题求解
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)5.23s
响应时间(最大)7.26s
响应时间(总计)15.69s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.84s
响应时间(最大)9.84s
响应时间(总计)9.84s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)40.17s
响应时间(最大)40.17s
响应时间(总计)40.17s
|
| #91#91 |
GLM 5V Turbomedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.7… |
Z.ai |
$0.457
…
|
23.08s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 无效工具调用: 2 未遵循指令: 1
响应时间(平均)23.08s
响应时间(最大)95.88s
响应时间(总计)484.63s
…
|
- 总测试数
- 21
- 错误测试数
- 10
- 尝试通过率
- 65.2%
- 输入令牌
- 44,615
- 输出令牌
- 2,347
- 推理令牌
- 98,415
- 响应时间(平均)
- 23.08s
- 响应时间(总计)
- 484.63s
- 响应时间(最大)
- 95.88s
-
反AI技巧
: 7.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)10.76s
响应时间(最大)14.40s
响应时间(总计)43.02s
-
编程
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)63.38s
响应时间(最大)95.88s
响应时间(总计)190.15s
-
综合
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)15.06s
响应时间(最大)15.06s
响应时间(总计)15.06s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.60s
响应时间(最大)9.92s
响应时间(总计)19.19s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)38.15s
响应时间(最大)67.08s
响应时间(总计)114.45s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.09s
响应时间(最大)11.09s
响应时间(总计)11.09s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.74s
响应时间(最大)5.23s
响应时间(总计)7.47s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.24s
响应时间(最大)16.95s
响应时间(总计)30.72s
-
工具调用
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)12.53s
响应时间(最大)12.53s
响应时间(总计)12.53s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)40.96s
响应时间(最大)40.96s
响应时间(总计)40.96s
|
| #18#18 |
GPT-5.4medium
|
8.5… |
OpenAI |
$1.533
…
|
23.10s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 2
响应时间(平均)23.10s
响应时间(最大)100.41s
响应时间(总计)508.26s
…
|
- 总测试数
- 22
- 错误测试数
- 7
- 尝试通过率
- 77.3%
- 输入令牌
- 81,127
- 输出令牌
- 6,155
- 推理令牌
- 82,515
- 响应时间(平均)
- 23.10s
- 响应时间(总计)
- 508.26s
- 响应时间(最大)
- 100.41s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.11s
响应时间(最大)6.42s
响应时间(总计)16.42s
-
编程
: 8.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)44.36s
响应时间(最大)96.94s
响应时间(总计)133.08s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)29.77s
响应时间(最大)38.97s
响应时间(总计)59.55s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.32s
响应时间(最大)5.40s
响应时间(总计)10.64s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)74.27s
响应时间(最大)100.41s
响应时间(总计)222.80s
-
通用智能
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.92s
响应时间(最大)4.92s
响应时间(总计)4.92s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.11s
响应时间(最大)3.68s
响应时间(总计)6.22s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)9.14s
响应时间(最大)18.14s
响应时间(总计)27.41s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.28s
响应时间(最大)13.28s
响应时间(总计)13.28s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)13.95s
响应时间(最大)13.95s
响应时间(总计)13.95s
|
| #38#38 |
GLM 5.2medium
|
7.8… |
Z.ai |
$0.068
↓
…
|
23.28s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 无答案: 2 超时: 1
响应时间(平均)23.28s
响应时间(最大)101.36s
响应时间(总计)488.94s
…
|
- 总测试数
- 21
- 错误测试数
- 6
- 尝试通过率
- 80.3%
- 输入令牌
- 37,199
- 输出令牌
- 12,261
- 推理令牌
- 49,500
- 响应时间(平均)
- 23.28s
- 响应时间(总计)
- 488.94s
- 响应时间(最大)
- 101.36s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.89s
响应时间(最大)7.10s
响应时间(总计)23.56s
-
编程
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)40.96s
响应时间(最大)60.28s
响应时间(总计)122.88s
-
综合
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)51.96s
响应时间(最大)51.96s
响应时间(总计)51.96s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.44s
响应时间(最大)16.02s
响应时间(总计)26.88s
-
领域专项
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 超时: 1 答案错误: 1
响应时间(平均)45.47s
响应时间(最大)101.36s
响应时间(总计)136.40s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.39s
响应时间(最大)17.39s
响应时间(总计)17.39s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.90s
响应时间(最大)10.13s
响应时间(总计)15.80s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)13.13s
响应时间(最大)25.90s
响应时间(总计)39.40s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)20.41s
响应时间(最大)20.41s
响应时间(总计)20.41s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)34.25s
响应时间(最大)34.25s
响应时间(总计)34.25s
|
| #181#181 |
Grok 4.1 Fastmedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.7… |
X AI |
$0.069
↑
…
|
23.85s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 4 答案错误: 4 无答案: 1 超时: 1
响应时间(平均)23.85s
响应时间(最大)121.79s
响应时间(总计)286.16s
…
|
- 总测试数
- 19
- 错误测试数
- 10
- 尝试通过率
- 53.0%
- 输入令牌
- 42,845
- 输出令牌
- 2,006
- 推理令牌
- 96,334
- 响应时间(平均)
- 23.85s
- 响应时间(总计)
- 286.16s
- 响应时间(最大)
- 121.79s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.81s
响应时间(最大)5.65s
响应时间(总计)7.62s
-
编程
: 7.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)23.58s
响应时间(最大)23.58s
响应时间(总计)23.58s
-
综合
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)37.64s
响应时间(最大)37.64s
响应时间(总计)37.64s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.63s
响应时间(最大)6.63s
响应时间(总计)6.63s
-
领域专项
: 5.8
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)121.79s
响应时间(最大)121.79s
响应时间(总计)121.79s
-
通用智能
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)16.25s
响应时间(最大)16.25s
响应时间(总计)16.25s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.63s
响应时间(最大)4.63s
响应时间(总计)4.63s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)7.40s
响应时间(最大)7.79s
响应时间(总计)14.81s
-
工具调用
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)27.71s
响应时间(最大)27.71s
响应时间(总计)27.71s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)25.52s
响应时间(最大)25.52s
响应时间(总计)25.52s
|
| #80#80 |
KAT-Coder-Pro V2.5medium
|
6.9… |
Kwaipilot |
$0.467
…
|
24.04s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 API 错误: 1 未遵循指令: 1
响应时间(平均)24.04s
响应时间(最大)257.00s
响应时间(总计)528.92s
…
|
- 总测试数
- 22
- 错误测试数
- 11
- 尝试通过率
- 63.6%
- 输入令牌
- 87,907
- 输出令牌
- 7,213
- 推理令牌
- 128,251
- 响应时间(平均)
- 24.04s
- 响应时间(总计)
- 528.92s
- 响应时间(最大)
- 257.00s
-
反AI技巧
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.90s
响应时间(最大)6.99s
响应时间(总计)15.61s
-
编程
: 7.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)33.10s
响应时间(最大)71.91s
响应时间(总计)99.31s
-
综合
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)135.75s
响应时间(最大)257.00s
响应时间(总计)271.50s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.70s
响应时间(最大)5.34s
响应时间(总计)9.39s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)29.03s
响应时间(最大)81.45s
响应时间(总计)87.10s
-
通用智能
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.35s
响应时间(最大)2.35s
响应时间(总计)2.35s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.58s
响应时间(最大)2.93s
响应时间(总计)5.16s
-
谜题求解
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.20s
响应时间(最大)3.85s
响应时间(总计)9.60s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)19.02s
响应时间(最大)19.02s
响应时间(总计)19.02s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.87s
响应时间(最大)9.87s
响应时间(总计)9.87s
|
| #149#149 |
Hy3 previewlow已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.5… |
Tencent |
$0.015
↕
…
|
24.56s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 7 答案错误: 4
响应时间(平均)24.56s
响应时间(最大)78.74s
响应时间(总计)368.35s
…
|
- 总测试数
- 21
- 错误测试数
- 11
- 尝试通过率
- 50.0%
- 输入令牌
- 21,045
- 输出令牌
- 63,460
- 推理令牌
- 0
- 响应时间(平均)
- 24.56s
- 响应时间(总计)
- 368.35s
- 响应时间(最大)
- 78.74s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)9.32s
响应时间(最大)12.36s
响应时间(总计)27.96s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)27.94s
响应时间(最大)27.94s
响应时间(总计)27.94s
-
综合
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)78.74s
响应时间(最大)78.74s
响应时间(总计)78.74s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)5.85s
响应时间(最大)5.85s
响应时间(总计)5.85s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)40.44s
响应时间(最大)46.32s
响应时间(总计)121.31s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.98s
响应时间(最大)22.24s
响应时间(总计)31.97s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)7.51s
响应时间(最大)7.86s
响应时间(总计)15.02s
-
工具调用
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)17.84s
响应时间(最大)17.84s
响应时间(总计)17.84s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)41.74s
响应时间(最大)41.74s
响应时间(总计)41.74s
|
| #16#16 |
Muse Spark 1.1medium
|
8.6… |
Meta |
$1.357
…
|
24.97s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 2 无效工具调用: 1
响应时间(平均)24.97s
响应时间(最大)165.38s
响应时间(总计)549.31s
…
|
- 总测试数
- 22
- 错误测试数
- 7
- 尝试通过率
- 72.7%
- 输入令牌
- 142,567
- 输出令牌
- 7,905
- 推理令牌
- 269,225
- 响应时间(平均)
- 24.97s
- 响应时间(总计)
- 549.31s
- 响应时间(最大)
- 165.38s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.72s
响应时间(最大)13.09s
响应时间(总计)22.87s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.66s
响应时间(最大)19.49s
响应时间(总计)46.98s
-
综合
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)42.62s
响应时间(最大)58.91s
响应时间(总计)85.24s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.96s
响应时间(最大)5.75s
响应时间(总计)9.92s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)71.45s
响应时间(最大)165.38s
响应时间(总计)214.34s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.41s
响应时间(最大)4.41s
响应时间(总计)4.41s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)6.31s
响应时间(最大)7.84s
响应时间(总计)12.62s
-
谜题求解
: 7.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)42.49s
响应时间(最大)111.97s
响应时间(总计)127.48s
-
工具调用
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.99s
响应时间(最大)6.99s
响应时间(总计)6.99s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)18.45s
响应时间(最大)18.45s
响应时间(总计)18.45s
|
| #121#121 |
Qwen3.5-Flashnone
|
6.1… |
Qwen |
$0.073
↓
…
|
25.28s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 无效工具调用: 1
响应时间(平均)25.28s
响应时间(最大)480.96s
响应时间(总计)556.24s
…
|
- 总测试数
- 22
- 错误测试数
- 14
- 尝试通过率
- 39.4%
- 输入令牌
- 282,347
- 输出令牌
- 209,201
- 推理令牌
- 0
- 响应时间(平均)
- 25.28s
- 响应时间(总计)
- 556.24s
- 响应时间(最大)
- 480.96s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.32s
响应时间(最大)3.89s
响应时间(总计)5.30s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)850ms
响应时间(最大)1.29s
响应时间(总计)2.55s
-
综合
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)243.59s
响应时间(最大)480.96s
响应时间(总计)487.17s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.57s
响应时间(最大)1.83s
响应时间(总计)3.14s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)905ms
响应时间(最大)1.10s
响应时间(总计)2.71s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)803ms
响应时间(最大)803ms
响应时间(总计)803ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)8.81s
响应时间(最大)13.73s
响应时间(总计)17.61s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)10.89s
响应时间(最大)27.18s
响应时间(总计)32.68s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.67s
响应时间(最大)3.67s
响应时间(总计)3.67s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)588ms
响应时间(最大)588ms
响应时间(总计)588ms
|
| #90#90 |
KAT-Coder-Pro V2.5none
|
6.7… |
Kwaipilot |
$0.476
…
|
25.56s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 无效工具调用: 1
响应时间(平均)25.56s
响应时间(最大)335.41s
响应时间(总计)562.43s
…
|
- 总测试数
- 22
- 错误测试数
- 11
- 尝试通过率
- 68.2%
- 输入令牌
- 98,499
- 输出令牌
- 135,861
- 推理令牌
- 0
- 响应时间(平均)
- 25.56s
- 响应时间(总计)
- 562.43s
- 响应时间(最大)
- 335.41s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.58s
响应时间(最大)7.94s
响应时间(总计)18.33s
-
编程
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)22.52s
响应时间(最大)30.63s
响应时间(总计)67.55s
-
综合
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)183.08s
响应时间(最大)335.41s
响应时间(总计)366.16s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.07s
响应时间(最大)5.35s
响应时间(总计)10.15s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)21.64s
响应时间(最大)53.57s
响应时间(总计)64.92s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.16s
响应时间(最大)5.16s
响应时间(总计)5.16s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.61s
响应时间(最大)2.82s
响应时间(总计)5.23s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.03s
响应时间(最大)4.12s
响应时间(总计)9.10s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.93s
响应时间(最大)5.93s
响应时间(总计)5.93s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.91s
响应时间(最大)9.91s
响应时间(总计)9.91s
|
| #40#40 |
Claude Sonnet 4.6medium
|
7.8… |
Anthropic |
$2.057
…
|
25.91s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 额外格式: 3 超时: 1
响应时间(平均)25.91s
响应时间(最大)140.96s
响应时间(总计)362.78s
…
|
- 总测试数
- 22
- 错误测试数
- 8
- 尝试通过率
- 66.7%
- 输入令牌
- 106,292
- 输出令牌
- 80,748
- 推理令牌
- 35,117
- 响应时间(平均)
- 25.91s
- 响应时间(总计)
- 362.78s
- 响应时间(最大)
- 140.96s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)2.98s
响应时间(最大)4.95s
响应时间(总计)5.97s
-
编程
: 5.7
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)33.29s
响应时间(最大)35.76s
响应时间(总计)99.86s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)93.65s
响应时间(最大)140.96s
响应时间(总计)187.31s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.90s
响应时间(最大)13.90s
响应时间(总计)13.90s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 超时: 1 答案错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.94s
响应时间(最大)4.94s
响应时间(总计)4.94s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.61s
响应时间(最大)2.61s
响应时间(总计)2.61s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.31s
响应时间(最大)6.24s
响应时间(总计)10.62s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.48s
响应时间(最大)7.48s
响应时间(总计)7.48s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)30.09s
响应时间(最大)30.09s
响应时间(总计)30.09s
|
| #56#56 |
GPT-5.4 Minimedium
|
7.5… |
OpenAI |
$0.756
…
|
25.94s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 3 无效工具调用: 1
响应时间(平均)25.94s
响应时间(最大)138.75s
响应时间(总计)570.66s
…
|
- 总测试数
- 22
- 错误测试数
- 10
- 尝试通过率
- 71.2%
- 输入令牌
- 97,155
- 输出令牌
- 6,211
- 推理令牌
- 145,544
- 响应时间(平均)
- 25.94s
- 响应时间(总计)
- 570.66s
- 响应时间(最大)
- 138.75s
-
反AI技巧
: 8.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.05s
响应时间(最大)6.69s
响应时间(总计)16.20s
-
编程
: 8.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)57.87s
响应时间(最大)138.75s
响应时间(总计)173.61s
-
综合
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)59.64s
响应时间(最大)101.47s
响应时间(总计)119.27s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.43s
响应时间(最大)3.39s
响应时间(总计)4.87s
-
领域专项
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)65.31s
响应时间(最大)102.91s
响应时间(总计)195.92s
-
通用智能
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.72s
响应时间(最大)3.72s
响应时间(总计)3.72s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.13s
响应时间(最大)2.45s
响应时间(总计)4.25s
-
谜题求解
: 7.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.37s
响应时间(最大)7.27s
响应时间(总计)13.11s
-
工具调用
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)9.62s
响应时间(最大)9.62s
响应时间(总计)9.62s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)30.10s
响应时间(最大)30.10s
响应时间(总计)30.10s
|
| #29#29 |
Step 3.7 Flashmedium
|
8.0… |
Stepfun |
$0.515
…
|
26.37s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 1 无效工具调用: 1 无答案: 1
响应时间(平均)26.37s
响应时间(最大)152.83s
响应时间(总计)580.25s
…
|
- 总测试数
- 22
- 错误测试数
- 8
- 尝试通过率
- 72.7%
- 输入令牌
- 114,062
- 输出令牌
- 427,572
- 推理令牌
- 0
- 响应时间(平均)
- 26.37s
- 响应时间(总计)
- 580.25s
- 响应时间(最大)
- 152.83s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)9.65s
响应时间(最大)35.08s
响应时间(总计)38.62s
-
编程
: 8.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)27.42s
响应时间(最大)60.98s
响应时间(总计)82.26s
-
综合
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)80.94s
响应时间(最大)152.83s
响应时间(总计)161.89s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.75s
响应时间(最大)3.35s
响应时间(总计)5.49s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)48.27s
响应时间(最大)97.10s
响应时间(总计)144.81s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.85s
响应时间(最大)6.85s
响应时间(总计)6.85s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.83s
响应时间(最大)2.21s
响应时间(总计)3.65s
-
谜题求解
: 5.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)6.19s
响应时间(最大)12.51s
响应时间(总计)18.56s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.16s
响应时间(最大)4.16s
响应时间(总计)4.16s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)113.98s
响应时间(最大)113.98s
响应时间(总计)113.98s
|
| #26#26 |
GPT-5 Minimedium
|
8.1… |
OpenAI |
$0.237
…
|
27.63s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 3 无答案: 1 超时: 1
响应时间(平均)27.63s
响应时间(最大)111.48s
响应时间(总计)607.92s
…
|
- 总测试数
- 22
- 错误测试数
- 10
- 尝试通过率
- 63.6%
- 输入令牌
- 98,374
- 输出令牌
- 14,434
- 推理令牌
- 91,498
- 响应时间(平均)
- 27.63s
- 响应时间(总计)
- 607.92s
- 响应时间(最大)
- 111.48s
-
反AI技巧
: 7.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)13.86s
响应时间(最大)26.00s
响应时间(总计)55.45s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)27.63s
响应时间(最大)38.31s
响应时间(总计)82.89s
-
综合
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)99.82s
响应时间(最大)111.48s
响应时间(总计)199.63s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.58s
响应时间(最大)13.87s
响应时间(总计)25.16s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)44.63s
响应时间(最大)82.55s
响应时间(总计)133.89s
-
通用智能
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)13.50s
响应时间(最大)13.50s
响应时间(总计)13.50s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.59s
响应时间(最大)13.66s
响应时间(总计)23.18s
-
谜题求解
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)15.20s
响应时间(最大)18.90s
响应时间(总计)45.59s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)18.64s
响应时间(最大)18.64s
响应时间(总计)18.64s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.99s
响应时间(最大)9.99s
响应时间(总计)9.99s
|
| #198#198 |
Grok Build 0.1none已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.0… |
X AI |
$0.547
…
|
28.69s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 API 错误: 3 未遵循指令: 2
响应时间(平均)28.69s
响应时间(最大)138.35s
响应时间(总计)459.00s
…
|
- 总测试数
- 19
- 错误测试数
- 12
- 尝试通过率
- 43.9%
- 输入令牌
- 11,793
- 输出令牌
- 267,275
- 推理令牌
- 0
- 响应时间(平均)
- 28.69s
- 响应时间(总计)
- 459.00s
- 响应时间(最大)
- 138.35s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.30s
响应时间(最大)9.80s
响应时间(总计)25.20s
-
编程
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.41s
响应时间(最大)21.41s
响应时间(总计)21.41s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)9.33s
响应时间(最大)9.33s
响应时间(总计)9.33s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)103.71s
响应时间(最大)138.35s
响应时间(总计)311.13s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)12.47s
响应时间(最大)12.47s
响应时间(总计)12.47s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.36s
响应时间(最大)11.05s
响应时间(总计)14.73s
-
谜题求解
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)9.55s
响应时间(最大)18.18s
响应时间(总计)28.65s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)36.09s
响应时间(最大)36.09s
响应时间(总计)36.09s
|
| #74#74 |
Grok 4.20medium
|
7.1… |
X AI |
$0.777
↓
…
|
29.47s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 2 额外格式: 1 无效工具调用: 1
响应时间(平均)29.47s
响应时间(最大)199.66s
响应时间(总计)648.35s
…
|
- 总测试数
- 22
- 错误测试数
- 10
- 尝试通过率
- 63.6%
- 输入令牌
- 102,791
- 输出令牌
- 5,363
- 推理令牌
- 253,977
- 响应时间(平均)
- 29.47s
- 响应时间(总计)
- 648.35s
- 响应时间(最大)
- 199.66s
-
反AI技巧
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.95s
响应时间(最大)5.68s
响应时间(总计)15.80s
-
编程
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)109.93s
响应时间(最大)199.66s
响应时间(总计)329.79s
-
综合
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)42.25s
响应时间(最大)67.09s
响应时间(总计)84.49s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.17s
响应时间(最大)5.02s
响应时间(总计)8.34s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)27.03s
响应时间(最大)29.87s
响应时间(总计)81.10s
-
通用智能
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)24.48s
响应时间(最大)24.48s
响应时间(总计)24.48s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.26s
响应时间(最大)4.46s
响应时间(总计)8.52s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.22s
响应时间(最大)11.63s
响应时间(总计)18.66s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)13.68s
响应时间(最大)13.68s
响应时间(总计)13.68s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)63.48s
响应时间(最大)63.48s
响应时间(总计)63.48s
|
| #167#167 |
North Mini Codenone
|
5.1… |
Cohere |
$0.000
…
|
29.95s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 额外格式: 2 未遵循指令: 2 无效工具调用: 2
响应时间(平均)29.95s
响应时间(最大)159.85s
响应时间(总计)658.82s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 18.2%
- 输入令牌
- 130,492
- 输出令牌
- 26,786
- 推理令牌
- 0
- 响应时间(平均)
- 29.95s
- 响应时间(总计)
- 658.82s
- 响应时间(最大)
- 159.85s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 答案错误: 2
响应时间(平均)22.48s
响应时间(最大)51.34s
响应时间(总计)89.90s
-
编程
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)21.96s
响应时间(最大)44.81s
响应时间(总计)65.89s
-
综合
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)96.20s
响应时间(最大)159.85s
响应时间(总计)192.40s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)28.00s
响应时间(最大)42.87s
响应时间(总计)55.99s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)14.73s
响应时间(最大)32.97s
响应时间(总计)44.19s
-
通用智能
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)34.77s
响应时间(最大)34.77s
响应时间(总计)34.77s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)30.68s
响应时间(最大)37.37s
响应时间(总计)61.35s
-
谜题求解
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2 答案错误: 1
响应时间(平均)24.43s
响应时间(最大)48.56s
响应时间(总计)73.30s
-
工具调用
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.64s
响应时间(最大)3.64s
响应时间(总计)3.64s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)37.37s
响应时间(最大)37.37s
响应时间(总计)37.37s
|
| #27#27 |
Muse Spark 1.1high
|
8.1… |
Meta |
$1.694
…
|
31.49s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 2 无效工具调用: 2 API 错误: 1 无答案: 1
响应时间(平均)31.49s
响应时间(最大)196.03s
响应时间(总计)661.28s
…
|
- 总测试数
- 22
- 错误测试数
- 10
- 尝试通过率
- 69.7%
- 输入令牌
- 129,423
- 输出令牌
- 8,077
- 推理令牌
- 352,421
- 响应时间(平均)
- 31.49s
- 响应时间(总计)
- 661.28s
- 响应时间(最大)
- 196.03s
-
反AI技巧
: 7.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)8.60s
响应时间(最大)15.63s
响应时间(总计)34.39s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)22.92s
响应时间(最大)27.22s
响应时间(总计)68.75s
-
综合
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)70.25s
响应时间(最大)78.10s
响应时间(总计)140.51s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.40s
响应时间(最大)10.84s
响应时间(总计)16.81s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)67.39s
响应时间(最大)80.62s
响应时间(总计)134.78s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.73s
响应时间(最大)7.73s
响应时间(总计)7.73s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)7.81s
响应时间(最大)9.13s
响应时间(总计)15.62s
-
谜题求解
: 7.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)69.96s
响应时间(最大)196.03s
响应时间(总计)209.89s
-
工具调用
: 9.6
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.88s
响应时间(最大)9.88s
响应时间(总计)9.88s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)22.93s
响应时间(最大)22.93s
响应时间(总计)22.93s
|
| #98#98 |
MiMo-V2.5medium
|
6.5… |
Xiaomi |
$0.082
↓
…
|
32.20s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 额外格式: 2 未遵循指令: 1 无效工具调用: 1 无答案: 1
响应时间(平均)32.20s
响应时间(最大)162.44s
响应时间(总计)708.46s
…
|
- 总测试数
- 22
- 错误测试数
- 10
- 尝试通过率
- 69.7%
- 输入令牌
- 105,447
- 输出令牌
- 7,120
- 推理令牌
- 230,682
- 响应时间(平均)
- 32.20s
- 响应时间(总计)
- 708.46s
- 响应时间(最大)
- 162.44s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.14s
响应时间(最大)12.41s
响应时间(总计)16.57s
-
编程
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)97.14s
响应时间(最大)162.44s
响应时间(总计)291.41s
-
综合
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)77.97s
响应时间(最大)139.08s
响应时间(总计)155.93s
-
数据解析与提取
: 2.7
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)6.33s
响应时间(最大)7.45s
响应时间(总计)12.67s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)34.53s
响应时间(最大)86.93s
响应时间(总计)103.59s
-
通用智能
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)5.37s
响应时间(最大)5.37s
响应时间(总计)5.37s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.80s
响应时间(最大)1.81s
响应时间(总计)3.60s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)20.25s
响应时间(最大)57.93s
响应时间(总计)60.76s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.29s
响应时间(最大)7.29s
响应时间(总计)7.29s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)51.29s
响应时间(最大)51.29s
响应时间(总计)51.29s
|