| #119#119 |
GLM 5.3 Flashhigh
|
7.3… |
Z.ai |
$0.029
…
|
25.36s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 额外格式: 2 未遵循指令: 1 无效工具调用: 1 无答案: 1
响应时间(平均)25.36s
响应时间(最大)163.41s
响应时间(总计)558.01s
…
|
- 总测试数
- 22
- 错误测试数
- 9
- 尝试通过率
- 66.7%
- 输入令牌
- 113,003
- 输出令牌
- 11,558
- 推理令牌
- 66,760
- 响应时间(平均)
- 25.36s
- 响应时间(总计)
- 558.01s
- 响应时间(最大)
- 163.41s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.50s
响应时间(最大)4.15s
响应时间(总计)9.98s
-
编程
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)19.62s
响应时间(最大)29.56s
响应时间(总计)58.85s
-
综合
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)91.11s
响应时间(最大)159.67s
响应时间(总计)182.22s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)2.73s
响应时间(最大)2.91s
响应时间(总计)5.47s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1
响应时间(平均)85.92s
响应时间(最大)163.41s
响应时间(总计)257.76s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.33s
响应时间(最大)3.33s
响应时间(总计)3.33s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.06s
响应时间(最大)2.15s
响应时间(总计)4.12s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.04s
响应时间(最大)3.88s
响应时间(总计)9.12s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.64s
响应时间(最大)15.64s
响应时间(总计)15.64s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)11.52s
响应时间(最大)11.52s
响应时间(总计)11.52s
|
| #120#120 |
Gemini 3.1 Flash Litemedium
|
7.3… |
Google |
$0.120
…
|
4.38s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 未遵循指令: 1 无效工具调用: 1
响应时间(平均)4.38s
响应时间(最大)26.22s
响应时间(总计)96.32s
…
|
- 总测试数
- 22
- 错误测试数
- 9
- 尝试通过率
- 62.1%
- 输入令牌
- 104,925
- 输出令牌
- 9,168
- 推理令牌
- 53,188
- 响应时间(平均)
- 4.38s
- 响应时间(总计)
- 96.32s
- 响应时间(最大)
- 26.22s
-
反AI技巧
: 9.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.39s
响应时间(最大)3.58s
响应时间(总计)9.57s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.81s
响应时间(最大)4.25s
响应时间(总计)11.44s
-
综合
: 7.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)18.55s
响应时间(最大)26.22s
响应时间(总计)37.09s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.60s
响应时间(最大)2.69s
响应时间(总计)5.19s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)3.93s
响应时间(最大)4.71s
响应时间(总计)11.79s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.60s
响应时间(最大)2.60s
响应时间(总计)2.60s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.59s
响应时间(最大)3.04s
响应时间(总计)5.17s
-
谜题求解
: 7.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.95s
响应时间(最大)2.48s
响应时间(总计)5.84s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.55s
响应时间(最大)4.55s
响应时间(总计)4.55s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.08s
响应时间(最大)3.08s
响应时间(总计)3.08s
|
| #121#121 |
Qwen3.7 Plusnone
|
7.3… |
Qwen |
$0.106
↓
…
|
12.11s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 1
响应时间(平均)12.11s
响应时间(最大)206.03s
响应时间(总计)266.40s
…
|
- 总测试数
- 22
- 错误测试数
- 10
- 尝试通过率
- 54.6%
- 输入令牌
- 98,833
- 输出令牌
- 58,097
- 推理令牌
- 0
- 响应时间(平均)
- 12.11s
- 响应时间(总计)
- 266.40s
- 响应时间(最大)
- 206.03s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.38s
响应时间(最大)2.69s
响应时间(总计)5.51s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.15s
响应时间(最大)4.39s
响应时间(总计)6.44s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)117.70s
响应时间(最大)206.03s
响应时间(总计)235.40s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.43s
响应时间(最大)1.57s
响应时间(总计)2.86s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.04s
响应时间(最大)1.33s
响应时间(总计)3.12s
-
通用智能
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.33s
响应时间(最大)1.33s
响应时间(总计)1.33s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)929ms
响应时间(最大)1.05s
响应时间(总计)1.86s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.71s
响应时间(最大)2.65s
响应时间(总计)5.13s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.54s
响应时间(最大)3.54s
响应时间(总计)3.54s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.21s
响应时间(最大)1.21s
响应时间(总计)1.21s
|
| #122#122 |
DeepSeek V4 Flash 0731medium
|
7.3… |
DeepSeek |
$0.106
…
|
84.66s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 无答案: 3 额外格式: 1 无效工具调用: 1 超时: 1
响应时间(平均)84.66s
响应时间(最大)288.78s
响应时间(总计)1862.46s
…
|
- 总测试数
- 22
- 错误测试数
- 11
- 尝试通过率
- 71.2%
- 输入令牌
- 89,819
- 输出令牌
- 58,398
- 推理令牌
- 492,457
- 响应时间(平均)
- 84.66s
- 响应时间(总计)
- 1862.46s
- 响应时间(最大)
- 288.78s
-
反AI技巧
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.95s
响应时间(最大)46.36s
响应时间(总计)71.81s
-
编程
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 2
响应时间(平均)198.78s
响应时间(最大)288.78s
响应时间(总计)596.34s
-
综合
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)150.58s
响应时间(最大)270.49s
响应时间(总计)301.16s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.21s
响应时间(最大)5.51s
响应时间(总计)10.43s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)203.11s
响应时间(最大)208.43s
响应时间(总计)609.33s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)12.16s
响应时间(最大)12.16s
响应时间(总计)12.16s
-
指令遵循
: 8.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)2.42s
响应时间(最大)2.86s
响应时间(总计)4.84s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)65.12s
响应时间(最大)182.97s
响应时间(总计)195.36s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.41s
响应时间(最大)4.41s
响应时间(总计)4.41s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)56.64s
响应时间(最大)56.64s
响应时间(总计)56.64s
|
| #123#123 |
Claude Opus 4.8none
|
7.3… |
Anthropic |
$1.166
…
|
4.92s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 额外格式: 3 未遵循指令: 1 无答案: 1
响应时间(平均)4.92s
响应时间(最大)35.03s
响应时间(总计)108.24s
…
|
- 总测试数
- 22
- 错误测试数
- 9
- 尝试通过率
- 63.6%
- 输入令牌
- 149,203
- 输出令牌
- 16,797
- 推理令牌
- 0
- 响应时间(平均)
- 4.92s
- 响应时间(总计)
- 108.24s
- 响应时间(最大)
- 35.03s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2
响应时间(平均)3.40s
响应时间(最大)6.36s
响应时间(总计)13.58s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)3.29s
响应时间(最大)4.34s
响应时间(总计)9.88s
-
综合
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)26.38s
响应时间(最大)35.03s
响应时间(总计)52.76s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.77s
响应时间(最大)1.93s
响应时间(总计)3.53s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.76s
响应时间(最大)2.16s
响应时间(总计)5.29s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.48s
响应时间(最大)3.48s
响应时间(总计)3.48s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.37s
响应时间(最大)1.40s
响应时间(总计)2.73s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)2.74s
响应时间(最大)3.46s
响应时间(总计)8.22s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.35s
响应时间(最大)5.35s
响应时间(总计)5.35s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)3.41s
响应时间(最大)3.41s
响应时间(总计)3.41s
|
| #124#124 |
Kimi K2.6medium
|
7.2… |
Moonshot AI |
$1.247
↑
…
|
115.89s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 3 答案错误: 3 未遵循指令: 2 无效工具调用: 1 无答案: 1
响应时间(平均)115.89s
响应时间(最大)876.20s
响应时间(总计)2433.66s
…
|
- 总测试数
- 22
- 错误测试数
- 10
- 尝试通过率
- 63.6%
- 输入令牌
- 68,913
- 输出令牌
- 64,654
- 推理令牌
- 282,865
- 响应时间(平均)
- 115.89s
- 响应时间(总计)
- 2433.66s
- 响应时间(最大)
- 876.20s
-
反AI技巧
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)11.59s
响应时间(最大)23.94s
响应时间(总计)46.37s
-
编程
: 5.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 超时: 1
响应时间(平均)214.42s
响应时间(最大)406.78s
响应时间(总计)643.25s
-
综合
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)458.58s
响应时间(最大)876.20s
响应时间(总计)917.16s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)20.38s
响应时间(最大)22.88s
响应时间(总计)40.76s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2
响应时间(平均)264.43s
响应时间(最大)339.95s
响应时间(总计)528.86s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.83s
响应时间(最大)17.83s
响应时间(总计)17.83s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.53s
响应时间(最大)19.15s
响应时间(总计)25.06s
-
谜题求解
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)25.06s
响应时间(最大)56.89s
响应时间(总计)75.19s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.92s
响应时间(最大)8.92s
响应时间(总计)8.92s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)130.27s
响应时间(最大)130.27s
响应时间(总计)130.27s
|
| #125#125 |
KAT-Coder-Pro V2.5high
|
7.2… |
Kwaipilot |
$0.506
…
|
22.11s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 无效工具调用: 1
响应时间(平均)22.11s
响应时间(最大)199.97s
响应时间(总计)486.31s
…
|
- 总测试数
- 22
- 错误测试数
- 11
- 尝试通过率
- 63.6%
- 输入令牌
- 106,085
- 输出令牌
- 9,071
- 推理令牌
- 135,288
- 响应时间(平均)
- 22.11s
- 响应时间(总计)
- 486.31s
- 响应时间(最大)
- 199.97s
-
反AI技巧
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.17s
响应时间(最大)4.99s
响应时间(总计)12.67s
-
编程
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)22.00s
响应时间(最大)35.74s
响应时间(总计)65.99s
-
综合
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)106.70s
响应时间(最大)199.97s
响应时间(总计)213.41s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.13s
响应时间(最大)4.56s
响应时间(总计)8.26s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)44.66s
响应时间(最大)95.65s
响应时间(总计)133.99s
-
通用智能
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.27s
响应时间(最大)3.27s
响应时间(总计)3.27s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.67s
响应时间(最大)2.87s
响应时间(总计)5.33s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.38s
响应时间(最大)4.30s
响应时间(总计)10.13s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)28.04s
响应时间(最大)28.04s
响应时间(总计)28.04s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.22s
响应时间(最大)5.22s
响应时间(总计)5.22s
|
| #126#126 |
Muse Glimmer 30Bhigh
|
7.2… |
Meta |
$0.397
↓
…
|
66.70s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 未遵循指令: 3 无答案: 2
响应时间(平均)66.70s
响应时间(最大)451.90s
响应时间(总计)1467.39s
…
|
- 总测试数
- 22
- 错误测试数
- 12
- 尝试通过率
- 65.2%
- 输入令牌
- 103,494
- 输出令牌
- 100,589
- 推理令牌
- 270,217
- 响应时间(平均)
- 66.70s
- 响应时间(总计)
- 1467.39s
- 响应时间(最大)
- 451.90s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)13.18s
响应时间(最大)27.66s
响应时间(总计)52.71s
-
编程
: 8.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)95.97s
响应时间(最大)127.91s
响应时间(总计)287.92s
-
综合
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)115.38s
响应时间(最大)161.28s
响应时间(总计)230.76s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)14.89s
响应时间(最大)16.84s
响应时间(总计)29.77s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)182.58s
响应时间(最大)451.90s
响应时间(总计)547.75s
-
通用智能
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)6.36s
响应时间(最大)6.36s
响应时间(总计)6.36s
-
指令遵循
: 8.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)8.62s
响应时间(最大)8.74s
响应时间(总计)17.23s
-
谜题求解
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)64.76s
响应时间(最大)173.50s
响应时间(总计)194.28s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.41s
响应时间(最大)6.41s
响应时间(总计)6.41s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)94.20s
响应时间(最大)94.20s
响应时间(总计)94.20s
|
| #128#128 |
Qwen3.7 Flashlow
|
7.2… |
Qwen |
$0.043
…
|
38.05s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 未遵循指令: 3 API 错误: 1
响应时间(平均)38.05s
响应时间(最大)394.54s
响应时间(总计)837.05s
…
|
- 总测试数
- 22
- 错误测试数
- 11
- 尝试通过率
- 66.7%
- 输入令牌
- 92,191
- 输出令牌
- 14,286
- 推理令牌
- 289,733
- 响应时间(平均)
- 38.05s
- 响应时间(总计)
- 837.05s
- 响应时间(最大)
- 394.54s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.29s
响应时间(最大)17.58s
响应时间(总计)41.18s
-
编程
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)42.36s
响应时间(最大)61.83s
响应时间(总计)127.09s
-
综合
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)217.77s
响应时间(最大)394.54s
响应时间(总计)435.53s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.44s
响应时间(最大)17.97s
响应时间(总计)30.88s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)37.60s
响应时间(最大)49.39s
响应时间(总计)112.81s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)14.37s
响应时间(最大)14.37s
响应时间(总计)14.37s
-
指令遵循
: 8.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)9.88s
响应时间(最大)11.25s
响应时间(总计)19.75s
-
谜题求解
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)9.79s
响应时间(最大)14.36s
响应时间(总计)29.36s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.66s
响应时间(最大)7.66s
响应时间(总计)7.66s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)18.42s
响应时间(最大)18.42s
响应时间(总计)18.42s
|
| #129#129 |
Muse Glimmer 30Bmedium
|
7.2… |
Meta |
$0.211
↓
…
|
30.64s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 1 无答案: 1
响应时间(平均)30.64s
响应时间(最大)181.08s
响应时间(总计)674.01s
…
|
- 总测试数
- 22
- 错误测试数
- 11
- 尝试通过率
- 63.6%
- 输入令牌
- 116,513
- 输出令牌
- 33,065
- 推理令牌
- 135,009
- 响应时间(平均)
- 30.64s
- 响应时间(总计)
- 674.01s
- 响应时间(最大)
- 181.08s
-
反AI技巧
: 9.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.36s
响应时间(最大)12.64s
响应时间(总计)29.44s
-
编程
: 8.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)33.67s
响应时间(最大)43.94s
响应时间(总计)101.00s
-
综合
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)76.48s
响应时间(最大)106.02s
响应时间(总计)152.97s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.20s
响应时间(最大)9.97s
响应时间(总计)14.40s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)44.62s
响应时间(最大)102.94s
响应时间(总计)133.85s
-
通用智能
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)5.16s
响应时间(最大)5.16s
响应时间(总计)5.16s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.34s
响应时间(最大)6.25s
响应时间(总计)10.69s
-
谜题求解
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)64.73s
响应时间(最大)181.08s
响应时间(总计)194.18s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.64s
响应时间(最大)5.64s
响应时间(总计)5.64s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)26.69s
响应时间(最大)26.69s
响应时间(总计)26.69s
|
| #130#130 |
Qwen3.5-122B-A10Bmedium
|
7.1… |
Qwen |
$1.207
↑
…
|
65.67s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 超时: 2 无效工具调用: 1
响应时间(平均)65.67s
响应时间(最大)519.30s
响应时间(总计)1444.68s
…
|
- 总测试数
- 22
- 错误测试数
- 8
- 尝试通过率
- 71.2%
- 输入令牌
- 124,780
- 输出令牌
- 47,694
- 推理令牌
- 439,825
- 响应时间(平均)
- 65.67s
- 响应时间(总计)
- 1444.68s
- 响应时间(最大)
- 519.30s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.75s
响应时间(最大)18.03s
响应时间(总计)39.01s
-
编程
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)114.48s
响应时间(最大)168.16s
响应时间(总计)343.44s
-
综合
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)313.55s
响应时间(最大)519.30s
响应时间(总计)627.09s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.41s
响应时间(最大)29.79s
响应时间(总计)46.83s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)74.43s
响应时间(最大)119.29s
响应时间(总计)223.29s
-
通用智能
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)34.11s
响应时间(最大)34.11s
响应时间(总计)34.11s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.88s
响应时间(最大)15.44s
响应时间(总计)19.76s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.89s
响应时间(最大)31.99s
响应时间(总计)53.68s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.60s
响应时间(最大)4.60s
响应时间(总计)4.60s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)52.87s
响应时间(最大)52.87s
响应时间(总计)52.87s
|
| #131#131 |
Muse Glimmer 30Blow
|
7.1… |
Meta |
$0.143
↓
…
|
18.64s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 3 无效工具调用: 1 无答案: 1
响应时间(平均)18.64s
响应时间(最大)234.92s
响应时间(总计)410.18s
…
|
- 总测试数
- 22
- 错误测试数
- 11
- 尝试通过率
- 63.6%
- 输入令牌
- 130,312
- 输出令牌
- 33,867
- 推理令牌
- 62,103
- 响应时间(平均)
- 18.64s
- 响应时间(总计)
- 410.18s
- 响应时间(最大)
- 234.92s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.57s
响应时间(最大)5.96s
响应时间(总计)14.27s
-
编程
: 8.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)16.52s
响应时间(最大)21.60s
响应时间(总计)49.55s
-
综合
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 无答案: 1
响应时间(平均)131.97s
响应时间(最大)234.92s
响应时间(总计)263.94s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.17s
响应时间(最大)4.56s
响应时间(总计)8.34s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)11.48s
响应时间(最大)22.96s
响应时间(总计)34.44s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.50s
响应时间(最大)2.50s
响应时间(总计)2.50s
-
指令遵循
: 8.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.60s
响应时间(最大)3.76s
响应时间(总计)7.20s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)5.06s
响应时间(最大)7.57s
响应时间(总计)15.18s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.04s
响应时间(最大)5.04s
响应时间(总计)5.04s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.71s
响应时间(最大)9.71s
响应时间(总计)9.71s
|
| #132#132 |
Step 3.7 Flashlow
|
7.1… |
Stepfun |
$0.390
…
|
17.87s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 无效工具调用: 1 无答案: 1
响应时间(平均)17.87s
响应时间(最大)124.75s
响应时间(总计)393.04s
…
|
- 总测试数
- 22
- 错误测试数
- 11
- 尝试通过率
- 63.6%
- 输入令牌
- 103,842
- 输出令牌
- 320,393
- 推理令牌
- 0
- 响应时间(平均)
- 17.87s
- 响应时间(总计)
- 393.04s
- 响应时间(最大)
- 124.75s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.02s
响应时间(最大)12.52s
响应时间(总计)16.10s
-
编程
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.46s
响应时间(最大)12.69s
响应时间(总计)28.38s
-
综合
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)66.18s
响应时间(最大)124.39s
响应时间(总计)132.37s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.29s
响应时间(最大)3.15s
响应时间(总计)4.58s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)22.65s
响应时间(最大)45.52s
响应时间(总计)67.95s
-
通用智能
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.00s
响应时间(最大)7.00s
响应时间(总计)7.00s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.58s
响应时间(最大)1.80s
响应时间(总计)3.16s
-
谜题求解
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.84s
响应时间(最大)3.42s
响应时间(总计)5.52s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.25s
响应时间(最大)3.25s
响应时间(总计)3.25s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)124.75s
响应时间(最大)124.75s
响应时间(总计)124.75s
|
| #133#133 |
Solar Pro 4high
|
7.1… |
Upstage |
$0.046
…
|
120.58s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 3 API 错误: 1 额外格式: 1 无答案: 1
响应时间(平均)120.58s
响应时间(最大)491.07s
响应时间(总计)2652.77s
…
|
- 总测试数
- 22
- 错误测试数
- 11
- 尝试通过率
- 62.1%
- 输入令牌
- 79,740
- 输出令牌
- 23,357
- 推理令牌
- 339,837
- 响应时间(平均)
- 120.58s
- 响应时间(总计)
- 2652.77s
- 响应时间(最大)
- 491.07s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)58.83s
响应时间(最大)90.66s
响应时间(总计)235.34s
-
编程
: 5.7
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)244.73s
响应时间(最大)404.04s
响应时间(总计)734.20s
-
综合
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)167.40s
响应时间(最大)276.53s
响应时间(总计)334.80s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)62.46s
响应时间(最大)76.58s
响应时间(总计)124.93s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)280.84s
响应时间(最大)491.07s
响应时间(总计)842.52s
-
通用智能
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)42.22s
响应时间(最大)42.22s
响应时间(总计)42.22s
-
指令遵循
: 7.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)41.51s
响应时间(最大)59.98s
响应时间(总计)83.02s
-
谜题求解
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)55.22s
响应时间(最大)83.57s
响应时间(总计)165.66s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.96s
响应时间(最大)8.96s
响应时间(总计)8.96s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)81.13s
响应时间(最大)81.13s
响应时间(总计)81.13s
|
| #134#134 |
Grok 4.3medium
|
7.0… |
X AI |
$0.741
…
|
44.21s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 2 额外格式: 1 无答案: 1
响应时间(平均)44.21s
响应时间(最大)216.69s
响应时间(总计)972.64s
…
|
- 总测试数
- 22
- 错误测试数
- 10
- 尝试通过率
- 66.7%
- 输入令牌
- 140,244
- 输出令牌
- 13,739
- 推理令牌
- 212,165
- 响应时间(平均)
- 44.21s
- 响应时间(总计)
- 972.64s
- 响应时间(最大)
- 216.69s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.83s
响应时间(最大)11.20s
响应时间(总计)35.31s
-
编程
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)41.23s
响应时间(最大)64.81s
响应时间(总计)123.69s
-
综合
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)55.07s
响应时间(最大)63.99s
响应时间(总计)110.13s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)18.97s
响应时间(最大)26.99s
响应时间(总计)37.93s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)158.01s
响应时间(最大)216.69s
响应时间(总计)474.02s
-
通用智能
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)24.70s
响应时间(最大)24.70s
响应时间(总计)24.70s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)18.58s
响应时间(最大)31.48s
响应时间(总计)37.15s
-
谜题求解
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)22.52s
响应时间(最大)51.75s
响应时间(总计)67.57s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.66s
响应时间(最大)17.66s
响应时间(总计)17.66s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)44.47s
响应时间(最大)44.47s
响应时间(总计)44.47s
|
| #135#135 |
GPT-5.6 Solnone
|
7.0… |
OpenAI |
$0.201
↓
…
|
2.17s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 1
响应时间(平均)2.17s
响应时间(最大)12.81s
响应时间(总计)47.66s
…
|
- 总测试数
- 22
- 错误测试数
- 10
- 尝试通过率
- 63.6%
- 输入令牌
- 78,602
- 输出令牌
- 4,357
- 推理令牌
- 0
- 响应时间(平均)
- 2.17s
- 响应时间(总计)
- 47.66s
- 响应时间(最大)
- 12.81s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.27s
响应时间(最大)2.37s
响应时间(总计)5.09s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.39s
响应时间(最大)2.12s
响应时间(总计)4.16s
-
综合
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)8.37s
响应时间(最大)12.81s
响应时间(总计)16.74s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.53s
响应时间(最大)1.63s
响应时间(总计)3.05s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.44s
响应时间(最大)1.70s
响应时间(总计)4.31s
-
通用智能
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.52s
响应时间(最大)1.52s
响应时间(总计)1.52s
-
指令遵循
: 8.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.33s
响应时间(最大)1.38s
响应时间(总计)2.66s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.49s
响应时间(最大)2.05s
响应时间(总计)4.47s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.70s
响应时间(最大)3.70s
响应时间(总计)3.70s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.95s
响应时间(最大)1.95s
响应时间(总计)1.95s
|
| #136#136 |
DeepSeek V3.2medium
|
7.0… |
DeepSeek |
$0.078
↑
…
|
68.43s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 API 错误: 2 超时: 2 未遵循指令: 1 无效工具调用: 1
响应时间(平均)68.43s
响应时间(最大)376.10s
响应时间(总计)1505.53s
…
|
- 总测试数
- 22
- 错误测试数
- 11
- 尝试通过率
- 65.2%
- 输入令牌
- 101,056
- 输出令牌
- 11,832
- 推理令牌
- 116,955
- 响应时间(平均)
- 68.43s
- 响应时间(总计)
- 1505.53s
- 响应时间(最大)
- 376.10s
-
反AI技巧
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)24.23s
响应时间(最大)29.86s
响应时间(总计)96.93s
-
编程
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)248.68s
响应时间(最大)376.10s
响应时间(总计)746.04s
-
综合
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)79.92s
响应时间(最大)93.11s
响应时间(总计)159.83s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)36.09s
响应时间(最大)39.12s
响应时间(总计)72.18s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)22.94s
响应时间(最大)30.66s
响应时间(总计)68.82s
-
通用智能
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)58.29s
响应时间(最大)58.29s
响应时间(总计)58.29s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)35.78s
响应时间(最大)47.30s
响应时间(总计)71.56s
-
谜题求解
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)37.69s
响应时间(最大)59.22s
响应时间(总计)113.08s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)34.81s
响应时间(最大)34.81s
响应时间(总计)34.81s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)83.99s
响应时间(最大)83.99s
响应时间(总计)83.99s
|
| #138#138 |
GPT-5.5none
|
7.0… |
OpenAI |
$0.544
…
|
2.35s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10
响应时间(平均)2.35s
响应时间(最大)12.24s
响应时间(总计)51.78s
…
|
- 总测试数
- 22
- 错误测试数
- 10
- 尝试通过率
- 59.1%
- 输入令牌
- 79,294
- 输出令牌
- 4,915
- 推理令牌
- 0
- 响应时间(平均)
- 2.35s
- 响应时间(总计)
- 51.78s
- 响应时间(最大)
- 12.24s
-
反AI技巧
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.31s
响应时间(最大)2.08s
响应时间(总计)5.25s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.35s
响应时间(最大)2.05s
响应时间(总计)4.05s
-
综合
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)8.90s
响应时间(最大)12.24s
响应时间(总计)17.80s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.18s
响应时间(最大)1.24s
响应时间(总计)2.37s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.27s
响应时间(最大)1.39s
响应时间(总计)3.82s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.41s
响应时间(最大)3.41s
响应时间(总计)3.41s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.15s
响应时间(最大)1.19s
响应时间(总计)2.31s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.29s
响应时间(最大)1.56s
响应时间(总计)3.87s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.90s
响应时间(最大)3.90s
响应时间(总计)3.90s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.01s
响应时间(最大)5.01s
响应时间(总计)5.01s
|
| #139#139 |
Mercury 2medium
|
7.0… |
Inception |
$0.094
…
|
2.95s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 未遵循指令: 3 无效工具调用: 1
响应时间(平均)2.95s
响应时间(最大)14.63s
响应时间(总计)61.89s
…
|
- 总测试数
- 22
- 错误测试数
- 12
- 尝试通过率
- 53.0%
- 输入令牌
- 110,515
- 输出令牌
- 10,325
- 推理令牌
- 77,229
- 响应时间(平均)
- 2.95s
- 响应时间(总计)
- 61.89s
- 响应时间(最大)
- 14.63s
-
反AI技巧
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.12s
响应时间(最大)2.46s
响应时间(总计)4.49s
-
编程
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.04s
响应时间(最大)3.06s
响应时间(总计)6.11s
-
综合
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)7.84s
响应时间(最大)12.40s
响应时间(总计)15.69s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.11s
响应时间(最大)1.47s
响应时间(总计)2.21s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)8.06s
响应时间(最大)14.63s
响应时间(总计)24.19s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)821ms
响应时间(最大)821ms
响应时间(总计)821ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.07s
响应时间(最大)1.07s
响应时间(总计)1.07s
-
谜题求解
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)949ms
响应时间(最大)1.18s
响应时间(总计)2.85s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.89s
响应时间(最大)1.89s
响应时间(总计)1.89s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.58s
响应时间(最大)2.58s
响应时间(总计)2.58s
|
| #140#140 |
Grok 4.20medium
|
7.0… |
X AI |
$0.805
↓
…
|
32.56s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 额外格式: 2 未遵循指令: 2 无效工具调用: 1
响应时间(平均)32.56s
响应时间(最大)199.66s
响应时间(总计)716.36s
…
|
- 总测试数
- 22
- 错误测试数
- 11
- 尝试通过率
- 60.6%
- 输入令牌
- 102,986
- 输出令牌
- 5,860
- 推理令牌
- 264,399
- 响应时间(平均)
- 32.56s
- 响应时间(总计)
- 716.36s
- 响应时间(最大)
- 199.66s
-
反AI技巧
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.95s
响应时间(最大)5.68s
响应时间(总计)15.80s
-
编程
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)109.93s
响应时间(最大)199.66s
响应时间(总计)329.79s
-
综合
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)42.25s
响应时间(最大)67.09s
响应时间(总计)84.49s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.17s
响应时间(最大)5.02s
响应时间(总计)8.34s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 答案错误: 1
响应时间(平均)49.71s
响应时间(最大)94.92s
响应时间(总计)149.12s
-
通用智能
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)24.48s
响应时间(最大)24.48s
响应时间(总计)24.48s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.26s
响应时间(最大)4.46s
响应时间(总计)8.52s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.22s
响应时间(最大)11.63s
响应时间(总计)18.66s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)13.68s
响应时间(最大)13.68s
响应时间(总计)13.68s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)63.48s
响应时间(最大)63.48s
响应时间(总计)63.48s
|
| #142#142 |
Kimi K2.5medium
|
7.0… |
Moonshot AI |
$0.479
↓
…
|
98.19s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 2 无答案: 2 超时: 2 无效工具调用: 1
响应时间(平均)98.19s
响应时间(最大)281.00s
响应时间(总计)1571.05s
…
|
- 总测试数
- 22
- 错误测试数
- 12
- 尝试通过率
- 63.6%
- 输入令牌
- 118,496
- 输出令牌
- 53,522
- 推理令牌
- 167,420
- 响应时间(平均)
- 98.19s
- 响应时间(总计)
- 1571.05s
- 响应时间(最大)
- 281.00s
-
反AI技巧
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)51.38s
响应时间(最大)85.28s
响应时间(总计)102.75s
-
编程
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 超时: 1
响应时间(平均)217.49s
响应时间(最大)281.00s
响应时间(总计)652.48s
-
综合
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)89.19s
响应时间(最大)107.01s
响应时间(总计)178.38s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)49.78s
响应时间(最大)49.78s
响应时间(总计)49.78s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)111.65s
响应时间(最大)137.29s
响应时间(总计)223.30s
-
通用智能
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)69.73s
响应时间(最大)69.73s
响应时间(总计)69.73s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)92.47s
响应时间(最大)92.47s
响应时间(总计)92.47s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)43.23s
响应时间(最大)82.75s
响应时间(总计)86.47s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)31.74s
响应时间(最大)31.74s
响应时间(总计)31.74s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)83.95s
响应时间(最大)83.95s
响应时间(总计)83.95s
|
| #143#143 |
KAT-Coder-Pro V2.5medium
|
6.9… |
Kwaipilot |
$0.478
…
|
24.87s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 API 错误: 1 未遵循指令: 1
响应时间(平均)24.87s
响应时间(最大)257.00s
响应时间(总计)547.14s
…
|
- 总测试数
- 22
- 错误测试数
- 11
- 尝试通过率
- 65.2%
- 输入令牌
- 87,916
- 输出令牌
- 7,213
- 推理令牌
- 132,162
- 响应时间(平均)
- 24.87s
- 响应时间(总计)
- 547.14s
- 响应时间(最大)
- 257.00s
-
反AI技巧
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.90s
响应时间(最大)6.99s
响应时间(总计)15.61s
-
编程
: 7.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)33.10s
响应时间(最大)71.91s
响应时间(总计)99.31s
-
综合
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)135.75s
响应时间(最大)257.00s
响应时间(总计)271.50s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.70s
响应时间(最大)5.34s
响应时间(总计)9.39s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)35.11s
响应时间(最大)81.45s
响应时间(总计)105.33s
-
通用智能
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.35s
响应时间(最大)2.35s
响应时间(总计)2.35s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.58s
响应时间(最大)2.93s
响应时间(总计)5.16s
-
谜题求解
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.20s
响应时间(最大)3.85s
响应时间(总计)9.60s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)19.02s
响应时间(最大)19.02s
响应时间(总计)19.02s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.87s
响应时间(最大)9.87s
响应时间(总计)9.87s
|
| #144#144 |
Claude Fable 5.1low
|
6.9… |
Anthropic |
$2.565
…
|
10.33s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 4 答案错误: 4 未遵循指令: 3
响应时间(平均)10.33s
响应时间(最大)33.10s
响应时间(总计)227.37s
…
|
- 总测试数
- 22
- 错误测试数
- 11
- 尝试通过率
- 56.1%
- 输入令牌
- 134,582
- 输出令牌
- 8,955
- 推理令牌
- 15,420
- 响应时间(平均)
- 10.33s
- 响应时间(总计)
- 227.37s
- 响应时间(最大)
- 33.10s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2
响应时间(平均)4.54s
响应时间(最大)4.91s
响应时间(总计)18.16s
-
编程
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2 额外格式: 1
响应时间(平均)6.75s
响应时间(最大)7.70s
响应时间(总计)20.24s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)29.40s
响应时间(最大)33.10s
响应时间(总计)58.80s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.71s
响应时间(最大)4.86s
响应时间(总计)9.43s
-
领域专项
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)19.30s
响应时间(最大)19.72s
响应时间(总计)57.90s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.62s
响应时间(最大)5.62s
响应时间(总计)5.62s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)5.24s
响应时间(最大)5.70s
响应时间(总计)10.49s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.78s
响应时间(最大)5.07s
响应时间(总计)14.33s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.22s
响应时间(最大)13.22s
响应时间(总计)13.22s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)19.18s
响应时间(最大)19.18s
响应时间(总计)19.18s
|
| #145#145 |
Qwen3.7 Flashmedium
|
6.9… |
Qwen |
$0.065
…
|
47.38s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 未遵循指令: 3 无效工具调用: 1
响应时间(平均)47.38s
响应时间(最大)593.64s
响应时间(总计)1042.43s
…
|
- 总测试数
- 22
- 错误测试数
- 12
- 尝试通过率
- 63.6%
- 输入令牌
- 114,477
- 输出令牌
- 12,786
- 推理令牌
- 457,290
- 响应时间(平均)
- 47.38s
- 响应时间(总计)
- 1042.43s
- 响应时间(最大)
- 593.64s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.56s
响应时间(最大)13.35s
响应时间(总计)38.24s
-
编程
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)46.78s
响应时间(最大)66.13s
响应时间(总计)140.34s
-
综合
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)314.17s
响应时间(最大)593.64s
响应时间(总计)628.34s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.42s
响应时间(最大)15.63s
响应时间(总计)30.85s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)38.02s
响应时间(最大)50.61s
响应时间(总计)114.07s
-
通用智能
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)10.18s
响应时间(最大)10.18s
响应时间(总计)10.18s
-
指令遵循
: 5.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)9.27s
响应时间(最大)10.40s
响应时间(总计)18.54s
-
谜题求解
: 7.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)8.30s
响应时间(最大)10.90s
响应时间(总计)24.90s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.80s
响应时间(最大)7.80s
响应时间(总计)7.80s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)29.17s
响应时间(最大)29.17s
响应时间(总计)29.17s
|
| #147#147 |
Gemini 3.5 Flashnone
|
6.9… |
Google |
$1.093
…
|
10.18s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 4 答案错误: 4
响应时间(平均)10.18s
响应时间(最大)64.36s
响应时间(总计)183.29s
…
|
- 总测试数
- 22
- 错误测试数
- 8
- 尝试通过率
- 69.7%
- 输入令牌
- 13,852
- 输出令牌
- 119,100
- 推理令牌
- 0
- 响应时间(平均)
- 10.18s
- 响应时间(总计)
- 183.29s
- 响应时间(最大)
- 64.36s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.53s
响应时间(最大)3.43s
响应时间(总计)10.12s
-
编程
: 8.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)34.69s
响应时间(最大)64.36s
响应时间(总计)104.06s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)8.10s
响应时间(最大)8.10s
响应时间(总计)8.10s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)12.18s
响应时间(最大)14.00s
响应时间(总计)36.54s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.46s
响应时间(最大)3.46s
响应时间(总计)3.46s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.38s
响应时间(最大)3.40s
响应时间(总计)6.76s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.13s
响应时间(最大)3.33s
响应时间(总计)9.39s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.87s
响应时间(最大)4.87s
响应时间(总计)4.87s
|