| #62#62 |
Step 3.5 Flashmedium
|
7.2… |
Stepfun |
$0.070
↑
…
|
72.53s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 3 无答案: 1 超时: 1
响应时间(平均)72.53s
响应时间(最大)453.94s
响应时间(总计)1015.47s
…
|
- 总测试数
- 20
- 错误测试数
- 9
- 尝试通过率
- 56.7%
- 输入令牌
- 34,431
- 输出令牌
- 91,587
- 推理令牌
- 195,973
- 响应时间(平均)
- 72.53s
- 响应时间(总计)
- 1015.47s
- 响应时间(最大)
- 453.94s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)40.57s
响应时间(最大)110.43s
响应时间(总计)121.72s
-
编程
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 超时: 1
响应时间(平均)258.38s
响应时间(最大)453.94s
响应时间(总计)516.77s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)29.57s
响应时间(最大)29.57s
响应时间(总计)29.57s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.01s
响应时间(最大)15.01s
响应时间(总计)15.01s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)170.45s
响应时间(最大)170.45s
响应时间(总计)170.45s
-
通用智能
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)22.39s
响应时间(最大)22.39s
响应时间(总计)22.39s
-
指令遵循
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.78s
响应时间(最大)4.78s
响应时间(总计)4.78s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)7.22s
响应时间(最大)10.60s
响应时间(总计)14.44s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.91s
响应时间(最大)11.91s
响应时间(总计)11.91s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)108.45s
响应时间(最大)108.45s
响应时间(总计)108.45s
|
| #44#44 |
Gemini 3.1 Flash Litemedium
|
7.5… |
Google |
$0.071
…
|
3.23s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 未遵循指令: 1
响应时间(平均)3.23s
响应时间(最大)10.87s
响应时间(总计)67.80s
…
|
- 总测试数
- 21
- 错误测试数
- 8
- 尝试通过率
- 65.1%
- 输入令牌
- 36,808
- 输出令牌
- 2,254
- 推理令牌
- 38,300
- 响应时间(平均)
- 3.23s
- 响应时间(总计)
- 67.80s
- 响应时间(最大)
- 10.87s
-
反AI技巧
: 9.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.39s
响应时间(最大)3.58s
响应时间(总计)9.57s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.81s
响应时间(最大)4.25s
响应时间(总计)11.44s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.87s
响应时间(最大)10.87s
响应时间(总计)10.87s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.60s
响应时间(最大)2.69s
响应时间(总计)5.19s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)3.16s
响应时间(最大)3.89s
响应时间(总计)9.49s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.60s
响应时间(最大)2.60s
响应时间(总计)2.60s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.59s
响应时间(最大)3.04s
响应时间(总计)5.17s
-
谜题求解
: 7.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.95s
响应时间(最大)2.48s
响应时间(总计)5.84s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.55s
响应时间(最大)4.55s
响应时间(总计)4.55s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.08s
响应时间(最大)3.08s
响应时间(总计)3.08s
|
| #74#74 |
Qwen3.6 Max Previewnone
|
6.9… |
Qwen |
$0.075
↓
…
|
3.30s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10
响应时间(平均)3.30s
响应时间(最大)20.51s
响应时间(总计)69.40s
…
|
- 总测试数
- 21
- 错误测试数
- 10
- 尝试通过率
- 58.7%
- 输入令牌
- 42,509
- 输出令牌
- 4,779
- 推理令牌
- 0
- 响应时间(平均)
- 3.30s
- 响应时间(总计)
- 69.40s
- 响应时间(最大)
- 20.51s
-
反AI技巧
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.63s
响应时间(最大)5.57s
响应时间(总计)10.53s
-
编程
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)3.12s
响应时间(最大)3.45s
响应时间(总计)9.35s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)20.51s
响应时间(最大)20.51s
响应时间(总计)20.51s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.87s
响应时间(最大)3.54s
响应时间(总计)5.74s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.22s
响应时间(最大)1.25s
响应时间(总计)3.67s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.62s
响应时间(最大)1.62s
响应时间(总计)1.62s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.40s
响应时间(最大)1.46s
响应时间(总计)2.79s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.65s
响应时间(最大)3.59s
响应时间(总计)7.94s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.27s
响应时间(最大)5.27s
响应时间(总计)5.27s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.97s
响应时间(最大)1.97s
响应时间(总计)1.97s
|
| #103#103 |
DeepSeek V4 Prohigh
|
6.0… |
DeepSeek |
$0.079
↓
…
|
65.21s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 5 答案错误: 4 超时: 3 未遵循指令: 1
响应时间(平均)65.21s
响应时间(最大)358.35s
响应时间(总计)1304.19s
…
|
- 总测试数
- 21
- 错误测试数
- 13
- 尝试通过率
- 52.4%
- 输入令牌
- 32,240
- 输出令牌
- 12,250
- 推理令牌
- 72,257
- 响应时间(平均)
- 65.21s
- 响应时间(总计)
- 1304.19s
- 响应时间(最大)
- 358.35s
-
反AI技巧
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)16.53s
响应时间(最大)39.91s
响应时间(总计)66.11s
-
编程
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 API 错误: 1
响应时间(平均)118.23s
响应时间(最大)184.68s
响应时间(总计)236.45s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)65.02s
响应时间(最大)65.02s
响应时间(总计)65.02s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)23.62s
响应时间(最大)36.44s
响应时间(总计)47.24s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 超时: 1 答案错误: 1
响应时间(平均)205.66s
响应时间(最大)358.35s
响应时间(总计)616.97s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)25.09s
响应时间(最大)25.09s
响应时间(总计)25.09s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)41.16s
响应时间(最大)43.56s
响应时间(总计)82.32s
-
谜题求解
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)34.84s
响应时间(最大)76.46s
响应时间(总计)104.52s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.33s
响应时间(最大)21.33s
响应时间(总计)21.33s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)39.14s
响应时间(最大)39.14s
响应时间(总计)39.14s
|
| #124#124 |
Kimi K2.6none
|
5.5… |
Moonshot AI |
$0.079
↓
…
|
13.27s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 3
响应时间(平均)13.27s
响应时间(最大)238.89s
响应时间(总计)278.57s
…
|
- 总测试数
- 21
- 错误测试数
- 14
- 尝试通过率
- 36.5%
- 输入令牌
- 32,916
- 输出令牌
- 16,410
- 推理令牌
- 0
- 响应时间(平均)
- 13.27s
- 响应时间(总计)
- 278.57s
- 响应时间(最大)
- 238.89s
-
反AI技巧
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.39s
响应时间(最大)2.96s
响应时间(总计)5.56s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)82.57s
响应时间(最大)238.89s
响应时间(总计)247.72s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.38s
响应时间(最大)3.38s
响应时间(总计)3.38s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.32s
响应时间(最大)1.39s
响应时间(总计)2.64s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.48s
响应时间(最大)1.85s
响应时间(总计)4.45s
-
通用智能
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.55s
响应时间(最大)1.55s
响应时间(总计)1.55s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.64s
响应时间(最大)1.80s
响应时间(总计)3.28s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.40s
响应时间(最大)1.81s
响应时间(总计)4.19s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.46s
响应时间(最大)4.46s
响应时间(总计)4.46s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.36s
响应时间(最大)1.36s
响应时间(总计)1.36s
|
| #49#49 |
Qwen3.5-Flashmedium
|
7.4… |
Qwen |
$0.080
↓
…
|
63.29s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 超时: 3 API 错误: 1 未遵循指令: 1
响应时间(平均)63.29s
响应时间(最大)234.29s
响应时间(总计)1265.85s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 71.4%
- 输入令牌
- 38,926
- 输出令牌
- 2,088
- 推理令牌
- 294,598
- 响应时间(平均)
- 63.29s
- 响应时间(总计)
- 1265.85s
- 响应时间(最大)
- 234.29s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)59.11s
响应时间(最大)168.31s
响应时间(总计)236.44s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)58.87s
响应时间(最大)68.14s
响应时间(总计)176.60s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.78s
响应时间(最大)17.78s
响应时间(总计)17.78s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)56.99s
响应时间(最大)80.14s
响应时间(总计)113.98s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)146.50s
响应时间(最大)234.29s
响应时间(总计)439.49s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)40.05s
响应时间(最大)40.05s
响应时间(总计)40.05s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)63.49s
响应时间(最大)111.61s
响应时间(总计)126.98s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)27.61s
响应时间(最大)31.84s
响应时间(总计)55.21s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.33s
响应时间(最大)10.33s
响应时间(总计)10.33s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)48.98s
响应时间(最大)48.98s
响应时间(总计)48.98s
|
| #94#94 |
GPT-5 Nanomedium
|
6.3… |
OpenAI |
$0.081
…
|
42.51s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 2 超时: 1
响应时间(平均)42.51s
响应时间(最大)204.02s
响应时间(总计)595.09s
…
|
- 总测试数
- 21
- 错误测试数
- 12
- 尝试通过率
- 57.1%
- 输入令牌
- 34,108
- 输出令牌
- 5,464
- 推理令牌
- 192,064
- 响应时间(平均)
- 42.51s
- 响应时间(总计)
- 595.09s
- 响应时间(最大)
- 204.02s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)25.50s
响应时间(最大)37.73s
响应时间(总计)51.00s
-
编程
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)41.62s
响应时间(最大)54.86s
响应时间(总计)124.86s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)65.96s
响应时间(最大)65.96s
响应时间(总计)65.96s
-
数据解析与提取
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)21.42s
响应时间(最大)21.42s
响应时间(总计)21.42s
-
领域专项
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)204.02s
响应时间(最大)204.02s
响应时间(总计)204.02s
-
通用智能
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)17.51s
响应时间(最大)17.51s
响应时间(总计)17.51s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.64s
响应时间(最大)15.64s
响应时间(总计)15.64s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)20.63s
响应时间(最大)22.94s
响应时间(总计)41.26s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)33.30s
响应时间(最大)33.30s
响应时间(总计)33.30s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)20.13s
响应时间(最大)20.13s
响应时间(总计)20.13s
|
| #106#106 |
Grok 4.20 Betanone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.8… |
X AI |
$0.087
↓
…
|
1.19s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 1 无效工具调用: 1
响应时间(平均)1.19s
响应时间(最大)6.48s
响应时间(总计)21.43s
…
|
- 总测试数
- 18
- 错误测试数
- 12
- 尝试通过率
- 37.0%
- 输入令牌
- 40,597
- 输出令牌
- 1,657
- 推理令牌
- 0
- 响应时间(平均)
- 1.19s
- 响应时间(总计)
- 21.43s
- 响应时间(最大)
- 6.48s
-
反AI技巧
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)597ms
响应时间(最大)866ms
响应时间(总计)2.39s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.14s
响应时间(最大)1.14s
响应时间(总计)1.14s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)6.48s
响应时间(最大)6.48s
响应时间(总计)6.48s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)601ms
响应时间(最大)634ms
响应时间(总计)1.20s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)611ms
响应时间(最大)616ms
响应时间(总计)1.83s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)541ms
响应时间(最大)541ms
响应时间(总计)541ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)649ms
响应时间(最大)952ms
响应时间(总计)1.30s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)586ms
响应时间(最大)813ms
响应时间(总计)1.76s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.79s
响应时间(最大)4.79s
响应时间(总计)4.79s
|
| #43#43 |
MiMo-V2.5-Promedium
|
7.5… |
Xiaomi |
$0.106
↓
…
|
26.13s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 3 答案错误: 3 未遵循指令: 2 API 错误: 1
响应时间(平均)26.13s
响应时间(最大)130.77s
响应时间(总计)548.65s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 68.3%
- 输入令牌
- 40,854
- 输出令牌
- 5,015
- 推理令牌
- 97,742
- 响应时间(平均)
- 26.13s
- 响应时间(总计)
- 548.65s
- 响应时间(最大)
- 130.77s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.26s
响应时间(最大)6.38s
响应时间(总计)13.06s
-
编程
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 额外格式: 1
响应时间(平均)92.07s
响应时间(最大)130.77s
响应时间(总计)276.20s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)53.36s
响应时间(最大)53.36s
响应时间(总计)53.36s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)18.81s
响应时间(最大)20.29s
响应时间(总计)37.61s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2
响应时间(平均)37.87s
响应时间(最大)84.22s
响应时间(总计)113.60s
-
通用智能
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.02s
响应时间(最大)4.02s
响应时间(总计)4.02s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.77s
响应时间(最大)3.21s
响应时间(总计)5.54s
-
谜题求解
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)5.31s
响应时间(最大)9.12s
响应时间(总计)15.94s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)16.87s
响应时间(最大)16.87s
响应时间(总计)16.87s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)12.46s
响应时间(最大)12.46s
响应时间(总计)12.46s
|
| #70#70 |
GPT-5.4 Nanomedium
|
7.0… |
OpenAI |
$0.107
…
|
11.95s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 未遵循指令: 2
响应时间(平均)11.95s
响应时间(最大)94.06s
响应时间(总计)250.98s
…
|
- 总测试数
- 21
- 错误测试数
- 10
- 尝试通过率
- 63.5%
- 输入令牌
- 35,434
- 输出令牌
- 3,014
- 推理令牌
- 76,520
- 响应时间(平均)
- 11.95s
- 响应时间(总计)
- 250.98s
- 响应时间(最大)
- 94.06s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.52s
响应时间(最大)7.74s
响应时间(总计)18.10s
-
编程
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)19.12s
响应时间(最大)28.80s
响应时间(总计)57.37s
-
综合
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)24.13s
响应时间(最大)24.13s
响应时间(总计)24.13s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.54s
响应时间(最大)3.33s
响应时间(总计)5.08s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)38.18s
响应时间(最大)94.06s
响应时间(总计)114.53s
-
通用智能
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.15s
响应时间(最大)4.15s
响应时间(总计)4.15s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.88s
响应时间(最大)2.61s
响应时间(总计)3.75s
-
谜题求解
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)3.79s
响应时间(最大)4.02s
响应时间(总计)11.36s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.71s
响应时间(最大)7.71s
响应时间(总计)7.71s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.81s
响应时间(最大)4.81s
响应时间(总计)4.81s
|
| #32#32 |
Gemini 3.5 Flashminimal
|
7.7… |
Google |
$0.108
…
|
1.57s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 1 无效工具调用: 1
响应时间(平均)1.57s
响应时间(最大)5.51s
响应时间(总计)33.02s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 68.3%
- 输入令牌
- 39,847
- 输出令牌
- 5,277
- 推理令牌
- 0
- 响应时间(平均)
- 1.57s
- 响应时间(总计)
- 33.02s
- 响应时间(最大)
- 5.51s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)892ms
响应时间(最大)1.38s
响应时间(总计)3.57s
-
编程
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.75s
响应时间(最大)5.51s
响应时间(总计)8.26s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)3.56s
响应时间(最大)3.56s
响应时间(总计)3.56s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.66s
响应时间(最大)2.11s
响应时间(总计)3.32s
-
领域专项
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)899ms
响应时间(最大)1.04s
响应时间(总计)2.70s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)922ms
响应时间(最大)922ms
响应时间(总计)922ms
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)893ms
响应时间(最大)964ms
响应时间(总计)1.79s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.45s
响应时间(最大)2.30s
响应时间(总计)4.36s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.79s
响应时间(最大)2.79s
响应时间(总计)2.79s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.76s
响应时间(最大)1.76s
响应时间(总计)1.76s
|
| #16#16 |
Gemini 3 Flash Previewlow
|
8.4… |
Google |
$0.111
…
|
5.76s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5
响应时间(平均)5.76s
响应时间(最大)14.72s
响应时间(总计)120.93s
…
|
- 总测试数
- 21
- 错误测试数
- 5
- 尝试通过率
- 79.4%
- 输入令牌
- 36,769
- 输出令牌
- 2,076
- 推理令牌
- 28,518
- 响应时间(平均)
- 5.76s
- 响应时间(总计)
- 120.93s
- 响应时间(最大)
- 14.72s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.48s
响应时间(最大)4.31s
响应时间(总计)13.94s
-
编程
: 5.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)6.00s
响应时间(最大)6.94s
响应时间(总计)18.00s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.27s
响应时间(最大)3.27s
响应时间(总计)3.27s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.40s
响应时间(最大)14.72s
响应时间(总计)18.80s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)8.05s
响应时间(最大)14.40s
响应时间(总计)24.15s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.68s
响应时间(最大)3.68s
响应时间(总计)3.68s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.02s
响应时间(最大)7.35s
响应时间(总计)14.03s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.77s
响应时间(最大)10.27s
响应时间(总计)17.32s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.99s
响应时间(最大)4.99s
响应时间(总计)4.99s
-
常识问答
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.75s
响应时间(最大)2.75s
响应时间(总计)2.75s
|
| #125#125 |
GPT-5.4none
|
5.5… |
OpenAI |
$0.122
…
|
1.42s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 1
响应时间(平均)1.42s
响应时间(最大)2.95s
响应时间(总计)29.87s
…
|
- 总测试数
- 21
- 错误测试数
- 14
- 尝试通过率
- 36.5%
- 输入令牌
- 34,212
- 输出令牌
- 2,417
- 推理令牌
- 0
- 响应时间(平均)
- 1.42s
- 响应时间(总计)
- 29.87s
- 响应时间(最大)
- 2.95s
-
反AI技巧
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.21s
响应时间(最大)2.58s
响应时间(总计)4.85s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.62s
响应时间(最大)2.95s
响应时间(总计)4.85s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.89s
响应时间(最大)2.89s
响应时间(总计)2.89s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.04s
响应时间(最大)1.06s
响应时间(总计)2.08s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.07s
响应时间(最大)1.54s
响应时间(总计)3.22s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.78s
响应时间(最大)1.78s
响应时间(总计)1.78s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.07s
响应时间(最大)1.17s
响应时间(总计)2.15s
-
谜题求解
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.44s
响应时间(最大)1.82s
响应时间(总计)4.33s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.75s
响应时间(最大)2.75s
响应时间(总计)2.75s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)990ms
响应时间(最大)990ms
响应时间(总计)990ms
|
| #130#130 |
MiniMax M2.7medium
|
5.3… |
Minimax |
$0.124
↓
…
|
38.18s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 5 超时: 2 API 错误: 1 无效工具调用: 1 无答案: 1
响应时间(平均)38.18s
响应时间(最大)196.21s
响应时间(总计)763.60s
…
|
- 总测试数
- 21
- 错误测试数
- 16
- 尝试通过率
- 46.0%
- 输入令牌
- 34,371
- 输出令牌
- 8,981
- 推理令牌
- 89,812
- 响应时间(平均)
- 38.18s
- 响应时间(总计)
- 763.60s
- 响应时间(最大)
- 196.21s
-
反AI技巧
: 7.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)40.32s
响应时间(最大)117.04s
响应时间(总计)161.28s
-
编程
: 5.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 无答案: 1
响应时间(平均)101.89s
响应时间(最大)196.21s
响应时间(总计)305.67s
-
综合
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)41.03s
响应时间(最大)41.03s
响应时间(总计)41.03s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)21.95s
响应时间(最大)24.88s
响应时间(总计)43.89s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 答案错误: 1
响应时间(平均)19.00s
响应时间(最大)21.63s
响应时间(总计)38.01s
-
通用智能
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)38.70s
响应时间(最大)38.70s
响应时间(总计)38.70s
-
指令遵循
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)12.80s
响应时间(最大)15.23s
响应时间(总计)25.60s
-
谜题求解
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)24.87s
响应时间(最大)46.29s
响应时间(总计)74.61s
-
工具调用
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)12.05s
响应时间(最大)12.05s
响应时间(总计)12.05s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)22.77s
响应时间(最大)22.77s
响应时间(总计)22.77s
|
| #67#67 |
MiniMax M3medium
|
7.1… |
Minimax |
$0.131
…
|
68.17s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 3 答案错误: 3 未遵循指令: 2 额外格式: 1 无答案: 1
响应时间(平均)68.17s
响应时间(最大)431.03s
响应时间(总计)1363.38s
…
|
- 总测试数
- 21
- 错误测试数
- 10
- 尝试通过率
- 65.1%
- 输入令牌
- 46,546
- 输出令牌
- 49,036
- 推理令牌
- 92,543
- 响应时间(平均)
- 68.17s
- 响应时间(总计)
- 1363.38s
- 响应时间(最大)
- 431.03s
-
反AI技巧
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)14.95s
响应时间(最大)44.99s
响应时间(总计)59.78s
-
编程
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 超时: 1
响应时间(平均)144.74s
响应时间(最大)218.40s
响应时间(总计)434.22s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)65.30s
响应时间(最大)65.30s
响应时间(总计)65.30s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.92s
响应时间(最大)16.89s
响应时间(总计)29.85s
-
领域专项
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2
响应时间(平均)233.13s
响应时间(最大)431.03s
响应时间(总计)466.26s
-
通用智能
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)33.25s
响应时间(最大)33.25s
响应时间(总计)33.25s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.14s
响应时间(最大)6.80s
响应时间(总计)12.27s
-
谜题求解
: 7.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)49.91s
响应时间(最大)128.09s
响应时间(总计)149.74s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.91s
响应时间(最大)11.91s
响应时间(总计)11.91s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)100.80s
响应时间(最大)100.80s
响应时间(总计)100.80s
|
| #46#46 |
Qwen3.6 35B A3Bmedium
|
7.4… |
Qwen |
$0.146
↑
…
|
18.08s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 API 错误: 2 未遵循指令: 1 无答案: 1
响应时间(平均)18.08s
响应时间(最大)86.11s
响应时间(总计)343.61s
…
|
- 总测试数
- 21
- 错误测试数
- 8
- 尝试通过率
- 63.5%
- 输入令牌
- 16,385
- 输出令牌
- 19,632
- 推理令牌
- 130,219
- 响应时间(平均)
- 18.08s
- 响应时间(总计)
- 343.61s
- 响应时间(最大)
- 86.11s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.02s
响应时间(最大)8.79s
响应时间(总计)24.07s
-
编程
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)50.55s
响应时间(最大)86.11s
响应时间(总计)151.65s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.99s
响应时间(最大)13.75s
响应时间(总计)25.99s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)22.50s
响应时间(最大)45.02s
响应时间(总计)67.51s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)8.66s
响应时间(最大)8.66s
响应时间(总计)8.66s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.50s
响应时间(最大)10.22s
响应时间(总计)15.00s
-
谜题求解
: 8.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.95s
响应时间(最大)8.42s
响应时间(总计)17.84s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)32.90s
响应时间(最大)32.90s
响应时间(总计)32.90s
|
| #54#54 |
GPT-5 Minimedium
|
7.3… |
OpenAI |
$0.159
…
|
23.64s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 3 超时: 1
响应时间(平均)23.64s
响应时间(最大)88.15s
响应时间(总计)496.44s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 63.5%
- 输入令牌
- 37,100
- 输出令牌
- 6,801
- 推理令牌
- 67,690
- 响应时间(平均)
- 23.64s
- 响应时间(总计)
- 496.44s
- 响应时间(最大)
- 88.15s
-
反AI技巧
: 7.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)13.86s
响应时间(最大)26.00s
响应时间(总计)55.45s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)27.63s
响应时间(最大)38.31s
响应时间(总计)82.89s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)88.15s
响应时间(最大)88.15s
响应时间(总计)88.15s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.58s
响应时间(最大)13.87s
响应时间(总计)25.16s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)44.63s
响应时间(最大)82.55s
响应时间(总计)133.89s
-
通用智能
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)13.50s
响应时间(最大)13.50s
响应时间(总计)13.50s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.59s
响应时间(最大)13.66s
响应时间(总计)23.18s
-
谜题求解
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)15.20s
响应时间(最大)18.90s
响应时间(总计)45.59s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)18.64s
响应时间(最大)18.64s
响应时间(总计)18.64s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.99s
响应时间(最大)9.99s
响应时间(总计)9.99s
|
| #19#19 |
Seed-2.0-Litemedium
|
8.2… |
Bytedance Seed |
$0.175
…
|
47.07s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 2
响应时间(平均)47.07s
响应时间(最大)254.92s
响应时间(总计)988.37s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 76.2%
- 输入令牌
- 46,740
- 输出令牌
- 3,230
- 推理令牌
- 78,406
- 响应时间(平均)
- 47.07s
- 响应时间(总计)
- 988.37s
- 响应时间(最大)
- 254.92s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.99s
响应时间(最大)48.33s
响应时间(总计)71.98s
-
编程
: 8.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)156.74s
响应时间(最大)254.92s
响应时间(总计)470.22s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)37.67s
响应时间(最大)37.67s
响应时间(总计)37.67s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.07s
响应时间(最大)12.19s
响应时间(总计)18.14s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)88.74s
响应时间(最大)168.71s
响应时间(总计)266.21s
-
通用智能
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)18.25s
响应时间(最大)18.25s
响应时间(总计)18.25s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.26s
响应时间(最大)9.02s
响应时间(总计)14.52s
-
谜题求解
: 9.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)10.23s
响应时间(最大)11.54s
响应时间(总计)30.68s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.38s
响应时间(最大)12.38s
响应时间(总计)12.38s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)48.32s
响应时间(最大)48.32s
响应时间(总计)48.32s
|
| #18#18 |
Qwen3.7 Plusmedium
|
8.2… |
Qwen |
$0.221
…
|
38.95s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 超时: 1
响应时间(平均)38.95s
响应时间(最大)178.04s
响应时间(总计)817.85s
…
|
- 总测试数
- 21
- 错误测试数
- 6
- 尝试通过率
- 77.8%
- 输入令牌
- 40,939
- 输出令牌
- 2,125
- 推理令牌
- 125,754
- 响应时间(平均)
- 38.95s
- 响应时间(总计)
- 817.85s
- 响应时间(最大)
- 178.04s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.58s
响应时间(最大)12.75s
响应时间(总计)34.33s
-
编程
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)108.60s
响应时间(最大)178.04s
响应时间(总计)325.79s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)65.24s
响应时间(最大)65.24s
响应时间(总计)65.24s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.75s
响应时间(最大)23.18s
响应时间(总计)43.49s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)45.35s
响应时间(最大)88.89s
响应时间(总计)136.04s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)25.48s
响应时间(最大)25.48s
响应时间(总计)25.48s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)16.13s
响应时间(最大)17.18s
响应时间(总计)32.26s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)16.38s
响应时间(最大)19.42s
响应时间(总计)49.14s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.02s
响应时间(最大)15.02s
响应时间(总计)15.02s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)91.07s
响应时间(最大)91.07s
响应时间(总计)91.07s
|
| #17#17 |
GLM 5medium
|
8.3… |
Z.ai |
$0.228
↓
…
|
33.54s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1 无答案: 1 超时: 1
响应时间(平均)33.54s
响应时间(最大)99.85s
响应时间(总计)435.99s
…
|
- 总测试数
- 21
- 错误测试数
- 6
- 尝试通过率
- 82.5%
- 输入令牌
- 35,224
- 输出令牌
- 21,570
- 推理令牌
- 102,996
- 响应时间(平均)
- 33.54s
- 响应时间(总计)
- 435.99s
- 响应时间(最大)
- 99.85s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.66s
响应时间(最大)25.06s
响应时间(总计)47.32s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)74.30s
响应时间(最大)99.85s
响应时间(总计)222.91s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)28.96s
响应时间(最大)28.96s
响应时间(总计)28.96s
-
数据解析与提取
: 7.1
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)8.90s
响应时间(最大)8.90s
响应时间(总计)8.90s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)14.69s
响应时间(最大)14.69s
响应时间(总计)14.69s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.25s
响应时间(最大)7.25s
响应时间(总计)7.25s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.33s
响应时间(最大)16.34s
响应时间(总计)22.66s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.93s
响应时间(最大)15.93s
响应时间(总计)15.93s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)67.37s
响应时间(最大)67.37s
响应时间(总计)67.37s
|
| #91#91 |
GPT-5.5none
|
6.4… |
OpenAI |
$0.231
…
|
1.89s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11
响应时间(平均)1.89s
响应时间(最大)5.56s
响应时间(总计)39.64s
…
|
- 总测试数
- 21
- 错误测试数
- 11
- 尝试通过率
- 54.0%
- 输入令牌
- 34,212
- 输出令牌
- 1,971
- 推理令牌
- 0
- 响应时间(平均)
- 1.89s
- 响应时间(总计)
- 39.64s
- 响应时间(最大)
- 5.56s
-
反AI技巧
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.31s
响应时间(最大)2.08s
响应时间(总计)5.25s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.35s
响应时间(最大)2.05s
响应时间(总计)4.05s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.56s
响应时间(最大)5.56s
响应时间(总计)5.56s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.18s
响应时间(最大)1.24s
响应时间(总计)2.37s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.31s
响应时间(最大)1.39s
响应时间(总计)3.92s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.41s
响应时间(最大)3.41s
响应时间(总计)3.41s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.15s
响应时间(最大)1.19s
响应时间(总计)2.31s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.29s
响应时间(最大)1.56s
响应时间(总计)3.87s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.90s
响应时间(最大)3.90s
响应时间(总计)3.90s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.01s
响应时间(最大)5.01s
响应时间(总计)5.01s
|
| #39#39 |
Qwen3.6 Flashmedium
|
7.5… |
Qwen |
$0.288
↓
…
|
19.25s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 未遵循指令: 1
响应时间(平均)19.25s
响应时间(最大)122.87s
响应时间(总计)404.20s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 71.4%
- 输入令牌
- 42,362
- 输出令牌
- 2,995
- 推理令牌
- 245,358
- 响应时间(平均)
- 19.25s
- 响应时间(总计)
- 404.20s
- 响应时间(最大)
- 122.87s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.10s
响应时间(最大)9.60s
响应时间(总计)24.39s
-
编程
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)42.85s
响应时间(最大)78.01s
响应时间(总计)128.55s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)20.28s
响应时间(最大)20.28s
响应时间(总计)20.28s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.65s
响应时间(最大)10.35s
响应时间(总计)19.31s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)14.65s
响应时间(最大)26.85s
响应时间(总计)43.95s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.88s
响应时间(最大)9.88s
响应时间(总计)9.88s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.05s
响应时间(最大)6.94s
响应时间(总计)12.10s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)6.29s
响应时间(最大)8.18s
响应时间(总计)18.87s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.00s
响应时间(最大)4.00s
响应时间(总计)4.00s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)122.87s
响应时间(最大)122.87s
响应时间(总计)122.87s
|
| #55#55 |
GLM 5.1medium
|
7.3… |
Z.ai |
$0.292
↓
…
|
33.67s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 超时: 2 API 错误: 1 额外格式: 1 无答案: 1
响应时间(平均)33.67s
响应时间(最大)172.60s
响应时间(总计)673.41s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 68.3%
- 输入令牌
- 32,995
- 输出令牌
- 11,655
- 推理令牌
- 75,421
- 响应时间(平均)
- 33.67s
- 响应时间(总计)
- 673.41s
- 响应时间(最大)
- 172.60s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.31s
响应时间(最大)14.20s
响应时间(总计)33.24s
-
编程
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 无答案: 1 超时: 1
响应时间(平均)109.63s
响应时间(最大)172.60s
响应时间(总计)328.90s
-
综合
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)43.11s
响应时间(最大)43.11s
响应时间(总计)43.11s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.33s
响应时间(最大)9.40s
响应时间(总计)18.66s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)29.77s
响应时间(最大)32.22s
响应时间(总计)89.30s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)20.95s
响应时间(最大)20.95s
响应时间(总计)20.95s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.47s
响应时间(最大)10.16s
响应时间(总计)14.94s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)31.64s
响应时间(最大)46.04s
响应时间(总计)94.91s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)29.40s
响应时间(最大)29.40s
响应时间(总计)29.40s
|
| #26#26 |
Qwen3.6 Plusmedium
|
7.9… |
Qwen |
$0.294
↑
…
|
30.70s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 API 错误: 1 未遵循指令: 1
响应时间(平均)30.70s
响应时间(最大)201.68s
响应时间(总计)613.99s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 69.8%
- 输入令牌
- 41,565
- 输出令牌
- 1,853
- 推理令牌
- 141,973
- 响应时间(平均)
- 30.70s
- 响应时间(总计)
- 613.99s
- 响应时间(最大)
- 201.68s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.90s
响应时间(最大)19.37s
响应时间(总计)39.60s
-
编程
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)153.12s
响应时间(最大)201.68s
响应时间(总计)306.23s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)34.95s
响应时间(最大)34.95s
响应时间(总计)34.95s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.95s
响应时间(最大)15.40s
响应时间(总计)29.90s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)29.59s
响应时间(最大)43.55s
响应时间(总计)88.77s
-
通用智能
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)27.05s
响应时间(最大)27.05s
响应时间(总计)27.05s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.54s
响应时间(最大)11.67s
响应时间(总计)15.07s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.34s
响应时间(最大)7.52s
响应时间(总计)19.03s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.87s
响应时间(最大)5.87s
响应时间(总计)5.87s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)47.51s
响应时间(最大)47.51s
响应时间(总计)47.51s
|
| #25#25 |
Qwen3.5 Plus 2026-02-15medium
|
7.9… |
Qwen |
$0.310
↓
…
|
73.79s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 超时: 2 API 错误: 1
响应时间(平均)73.79s
响应时间(最大)266.69s
响应时间(总计)1033.07s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 73.0%
- 输入令牌
- 40,918
- 输出令牌
- 2,159
- 推理令牌
- 189,604
- 响应时间(平均)
- 73.79s
- 响应时间(总计)
- 1033.07s
- 响应时间(最大)
- 266.69s
-
反AI技巧
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)45.78s
响应时间(最大)81.20s
响应时间(总计)91.57s
-
编程
: 6.6
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)180.70s
响应时间(最大)266.69s
响应时间(总计)542.10s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)46.85s
响应时间(最大)46.85s
响应时间(总计)46.85s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)46.91s
响应时间(最大)46.91s
响应时间(总计)46.91s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)17.50s
响应时间(最大)17.50s
响应时间(总计)17.50s
-
通用智能
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)79.86s
响应时间(最大)79.86s
响应时间(总计)79.86s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)31.93s
响应时间(最大)31.93s
响应时间(总计)31.93s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)32.50s
响应时间(最大)49.12s
响应时间(总计)65.01s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.54s
响应时间(最大)7.54s
响应时间(总计)7.54s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)103.81s
响应时间(最大)103.81s
响应时间(总计)103.81s
|
| #77#77 |
Claude Sonnet 4.6none
|
6.8… |
Anthropic |
$0.316
…
|
5.04s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 额外格式: 4 未遵循指令: 1
响应时间(平均)5.04s
响应时间(最大)23.84s
响应时间(总计)70.60s
…
|
- 总测试数
- 21
- 错误测试数
- 10
- 尝试通过率
- 55.6%
- 输入令牌
- 57,886
- 输出令牌
- 9,465
- 推理令牌
- 0
- 响应时间(平均)
- 5.04s
- 响应时间(总计)
- 70.60s
- 响应时间(最大)
- 23.84s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 答案错误: 1
响应时间(平均)2.94s
响应时间(最大)4.83s
响应时间(总计)5.88s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)5.19s
响应时间(最大)9.79s
响应时间(总计)15.56s
-
综合
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.84s
响应时间(最大)23.84s
响应时间(总计)23.84s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.43s
响应时间(最大)3.43s
响应时间(总计)3.43s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.54s
响应时间(最大)3.54s
响应时间(总计)3.54s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.56s
响应时间(最大)2.56s
响应时间(总计)2.56s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.96s
响应时间(最大)1.96s
响应时间(总计)1.96s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)2.53s
响应时间(最大)2.54s
响应时间(总计)5.06s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.11s
响应时间(最大)4.11s
响应时间(总计)4.11s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.67s
响应时间(最大)4.67s
响应时间(总计)4.67s
|
| #36#36 |
Qwen3.5 Plus 2026-04-20medium
|
7.6… |
Qwen |
$0.317
↓
…
|
46.36s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8
响应时间(平均)46.36s
响应时间(最大)189.38s
响应时间(总计)973.57s
…
|
- 总测试数
- 21
- 错误测试数
- 8
- 尝试通过率
- 66.7%
- 输入令牌
- 42,097
- 输出令牌
- 2,280
- 推理令牌
- 166,613
- 响应时间(平均)
- 46.36s
- 响应时间(总计)
- 973.57s
- 响应时间(最大)
- 189.38s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.84s
响应时间(最大)15.11s
响应时间(总计)43.36s
-
编程
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)125.25s
响应时间(最大)189.38s
响应时间(总计)375.76s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)92.41s
响应时间(最大)92.41s
响应时间(总计)92.41s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)38.32s
响应时间(最大)41.70s
响应时间(总计)76.63s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)53.10s
响应时间(最大)90.70s
响应时间(总计)159.30s
-
通用智能
: 4.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)25.30s
响应时间(最大)25.30s
响应时间(总计)25.30s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)20.25s
响应时间(最大)21.65s
响应时间(总计)40.50s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.67s
响应时间(最大)24.83s
响应时间(总计)53.02s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.72s
响应时间(最大)14.72s
响应时间(总计)14.72s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)92.57s
响应时间(最大)92.57s
响应时间(总计)92.57s
|
| #23#23 |
GLM 5 Turbomedium
|
8.0… |
Z.ai |
$0.323
↑
…
|
23.00s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 1 无答案: 1 超时: 1
响应时间(平均)23.00s
响应时间(最大)194.23s
响应时间(总计)482.97s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 74.6%
- 输入令牌
- 35,593
- 输出令牌
- 12,245
- 推理令牌
- 62,277
- 响应时间(平均)
- 23.00s
- 响应时间(总计)
- 482.97s
- 响应时间(最大)
- 194.23s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.82s
响应时间(最大)7.69s
响应时间(总计)19.26s
-
编程
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)45.90s
响应时间(最大)95.57s
响应时间(总计)137.71s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.88s
响应时间(最大)13.88s
响应时间(总计)13.88s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.19s
响应时间(最大)6.42s
响应时间(总计)12.38s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)71.07s
响应时间(最大)194.23s
响应时间(总计)213.22s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.05s
响应时间(最大)10.05s
响应时间(总计)10.05s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.38s
响应时间(最大)5.70s
响应时间(总计)10.77s
-
谜题求解
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)5.23s
响应时间(最大)7.26s
响应时间(总计)15.69s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.84s
响应时间(最大)9.84s
响应时间(总计)9.84s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)40.17s
响应时间(最大)40.17s
响应时间(总计)40.17s
|
| #76#76 |
Kimi K2.5medium
|
6.8… |
Moonshot AI |
$0.328
↓
…
|
98.43s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 2 无答案: 2 超时: 2
响应时间(平均)98.43s
响应时间(最大)281.00s
响应时间(总计)1378.03s
…
|
- 总测试数
- 21
- 错误测试数
- 11
- 尝试通过率
- 68.3%
- 输入令牌
- 34,312
- 输出令牌
- 48,379
- 推理令牌
- 157,747
- 响应时间(平均)
- 98.43s
- 响应时间(总计)
- 1378.03s
- 响应时间(最大)
- 281.00s
-
反AI技巧
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)51.38s
响应时间(最大)85.28s
响应时间(总计)102.75s
-
编程
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 超时: 1
响应时间(平均)217.49s
响应时间(最大)281.00s
响应时间(总计)652.48s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)71.37s
响应时间(最大)71.37s
响应时间(总计)71.37s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)49.78s
响应时间(最大)49.78s
响应时间(总计)49.78s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)137.29s
响应时间(最大)137.29s
响应时间(总计)137.29s
-
通用智能
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)69.73s
响应时间(最大)69.73s
响应时间(总计)69.73s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)92.47s
响应时间(最大)92.47s
响应时间(总计)92.47s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)43.23s
响应时间(最大)82.75s
响应时间(总计)86.47s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)31.74s
响应时间(最大)31.74s
响应时间(总计)31.74s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)83.95s
响应时间(最大)83.95s
响应时间(总计)83.95s
|
| #51#51 |
Mimo V2 PROmedium
|
7.4… |
Xiaomi |
$0.333
↑
…
|
22.16s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 API 错误: 1 额外格式: 1 未遵循指令: 1 超时: 1
响应时间(平均)22.16s
响应时间(最大)136.29s
响应时间(总计)443.22s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 73.0%
- 输入令牌
- 40,961
- 输出令牌
- 2,518
- 推理令牌
- 81,801
- 响应时间(平均)
- 22.16s
- 响应时间(总计)
- 443.22s
- 响应时间(最大)
- 136.29s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.86s
响应时间(最大)3.92s
响应时间(总计)11.45s
-
编程
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)94.21s
响应时间(最大)136.29s
响应时间(总计)188.41s
-
综合
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)64.71s
响应时间(最大)64.71s
响应时间(总计)64.71s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.20s
响应时间(最大)17.44s
响应时间(总计)34.40s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)8.82s
响应时间(最大)14.48s
响应时间(总计)26.47s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.92s
响应时间(最大)4.92s
响应时间(总计)4.92s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.36s
响应时间(最大)4.35s
响应时间(总计)6.72s
-
谜题求解
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 未遵循指令: 1
响应时间(平均)5.08s
响应时间(最大)6.41s
响应时间(总计)15.23s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.19s
响应时间(最大)8.19s
响应时间(总计)8.19s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)82.71s
响应时间(最大)82.71s
响应时间(总计)82.71s
|