| #146#146 |
GPT-5.4none
|
5.8… |
OpenAI |
$0.397
…
|
2.07s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 未遵循指令: 1
响应时间(平均)2.07s
响应时间(最大)15.63s
响应时间(总计)45.51s
…
|
- 总测试数
- 22
- 错误测试数
- 15
- 尝试通过率
- 34.9%
- 输入令牌
- 108,632
- 输出令牌
- 8,321
- 推理令牌
- 0
- 响应时间(平均)
- 2.07s
- 响应时间(总计)
- 45.51s
- 响应时间(最大)
- 15.63s
-
反AI技巧
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.21s
响应时间(最大)2.58s
响应时间(总计)4.85s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.62s
响应时间(最大)2.95s
响应时间(总计)4.85s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)9.26s
响应时间(最大)15.63s
响应时间(总计)18.52s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.04s
响应时间(最大)1.06s
响应时间(总计)2.08s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.07s
响应时间(最大)1.54s
响应时间(总计)3.22s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.78s
响应时间(最大)1.78s
响应时间(总计)1.78s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.07s
响应时间(最大)1.17s
响应时间(总计)2.15s
-
谜题求解
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.44s
响应时间(最大)1.82s
响应时间(总计)4.33s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.75s
响应时间(最大)2.75s
响应时间(总计)2.75s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)990ms
响应时间(最大)990ms
响应时间(总计)990ms
|
| #148#148 |
GLM 5none
|
5.7… |
Z.ai |
$0.041
↑
…
|
4.03s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12
响应时间(平均)4.03s
响应时间(最大)11.07s
响应时间(总计)56.37s
…
|
- 总测试数
- 21
- 错误测试数
- 12
- 尝试通过率
- 42.4%
- 输入令牌
- 37,135
- 输出令牌
- 1,989
- 推理令牌
- 0
- 响应时间(平均)
- 4.03s
- 响应时间(总计)
- 56.37s
- 响应时间(最大)
- 11.07s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.37s
响应时间(最大)3.39s
响应时间(总计)4.75s
-
编程
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)5.12s
响应时间(最大)8.84s
响应时间(总计)15.36s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.98s
响应时间(最大)4.98s
响应时间(总计)4.98s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.78s
响应时间(最大)5.78s
响应时间(总计)5.78s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.24s
响应时间(最大)2.24s
响应时间(总计)2.24s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.27s
响应时间(最大)3.27s
响应时间(总计)3.27s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.48s
响应时间(最大)1.48s
响应时间(总计)1.48s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.91s
响应时间(最大)2.08s
响应时间(总计)3.82s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.07s
响应时间(最大)11.07s
响应时间(总计)11.07s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.62s
响应时间(最大)3.62s
响应时间(总计)3.62s
|
| #150#150 |
Qwen3.5-122B-A10Bnone
|
5.7… |
Qwen |
$0.247
↓
…
|
12.92s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 2 无效工具调用: 1
响应时间(平均)12.92s
响应时间(最大)212.63s
响应时间(总计)284.21s
…
|
- 总测试数
- 22
- 错误测试数
- 16
- 尝试通过率
- 33.3%
- 输入令牌
- 241,566
- 输出令牌
- 88,458
- 推理令牌
- 0
- 响应时间(平均)
- 12.92s
- 响应时间(总计)
- 284.21s
- 响应时间(最大)
- 212.63s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.59s
响应时间(最大)3.60s
响应时间(总计)6.38s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.77s
响应时间(最大)4.03s
响应时间(总计)8.32s
-
综合
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)129.31s
响应时间(最大)212.63s
响应时间(总计)258.63s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.01s
响应时间(最大)1.06s
响应时间(总计)2.02s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)465ms
响应时间(最大)492ms
响应时间(总计)1.39s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.12s
响应时间(最大)1.12s
响应时间(总计)1.12s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)513ms
响应时间(最大)570ms
响应时间(总计)1.03s
-
谜题求解
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.00s
响应时间(最大)1.41s
响应时间(总计)3.00s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.04s
响应时间(最大)2.04s
响应时间(总计)2.04s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)295ms
响应时间(最大)295ms
响应时间(总计)295ms
|
| #151#151 |
Gemini 3.1 Flash Litehigh已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.6… |
Google |
$2.044
…
|
61.96s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 3 无答案: 1
响应时间(平均)61.96s
响应时间(最大)149.23s
响应时间(总计)1115.31s
…
|
- 总测试数
- 18
- 错误测试数
- 8
- 尝试通过率
- 56.1%
- 输入令牌
- 29,134
- 输出令牌
- 1,984
- 推理令牌
- 1,355,583
- 响应时间(平均)
- 61.96s
- 响应时间(总计)
- 1115.31s
- 响应时间(最大)
- 149.23s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)37.16s
响应时间(最大)140.53s
响应时间(总计)148.65s
-
编程
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)137.63s
响应时间(最大)137.63s
响应时间(总计)137.63s
-
综合
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)149.23s
响应时间(最大)149.23s
响应时间(总计)149.23s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.49s
响应时间(最大)4.96s
响应时间(总计)8.98s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)139.90s
响应时间(最大)141.40s
响应时间(总计)419.69s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)45.69s
响应时间(最大)45.69s
响应时间(总计)45.69s
-
指令遵循
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)23.26s
响应时间(最大)43.87s
响应时间(总计)46.51s
-
谜题求解
: 5.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2
响应时间(平均)50.83s
响应时间(最大)144.85s
响应时间(总计)152.49s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.44s
响应时间(最大)6.44s
响应时间(总计)6.44s
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #153#153 |
GLM 5V Turbonone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.6… |
Z.ai |
$0.052
…
|
2.99s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 2
响应时间(平均)2.99s
响应时间(最大)6.51s
响应时间(总计)62.74s
…
|
- 总测试数
- 21
- 错误测试数
- 13
- 尝试通过率
- 36.4%
- 输入令牌
- 37,100
- 输出令牌
- 1,766
- 推理令牌
- 0
- 响应时间(平均)
- 2.99s
- 响应时间(总计)
- 62.74s
- 响应时间(最大)
- 6.51s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)3.13s
响应时间(最大)5.90s
响应时间(总计)12.50s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.13s
响应时间(最大)5.30s
响应时间(总计)9.40s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.51s
响应时间(最大)6.51s
响应时间(总计)6.51s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.81s
响应时间(最大)5.69s
响应时间(总计)7.62s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.09s
响应时间(最大)2.39s
响应时间(总计)6.26s
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.22s
响应时间(最大)2.22s
响应时间(总计)2.22s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.97s
响应时间(最大)2.43s
响应时间(总计)3.93s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.40s
响应时间(最大)3.81s
响应时间(总计)7.21s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.86s
响应时间(最大)4.86s
响应时间(总计)4.86s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.23s
响应时间(最大)2.23s
响应时间(总计)2.23s
|
| #154#154 |
Owl Alphamedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.6… |
Openrouter |
$0.000
…
|
11.95s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 2 API 错误: 1
响应时间(平均)11.95s
响应时间(最大)58.63s
响应时间(总计)250.88s
…
|
- 总测试数
- 21
- 错误测试数
- 13
- 尝试通过率
- 37.9%
- 输入令牌
- 43,478
- 输出令牌
- 2,974
- 推理令牌
- 0
- 响应时间(平均)
- 11.95s
- 响应时间(总计)
- 250.88s
- 响应时间(最大)
- 58.63s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)3.97s
响应时间(最大)7.48s
响应时间(总计)15.89s
-
编程
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)18.74s
响应时间(最大)30.81s
响应时间(总计)56.21s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.01s
响应时间(最大)10.01s
响应时间(总计)10.01s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.64s
响应时间(最大)29.16s
响应时间(总计)43.28s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)8.58s
响应时间(最大)9.48s
响应时间(总计)25.74s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)58.63s
响应时间(最大)58.63s
响应时间(总计)58.63s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.15s
响应时间(最大)15.94s
响应时间(总计)20.30s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)3.40s
响应时间(最大)4.60s
响应时间(总计)10.19s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.26s
响应时间(最大)8.26s
响应时间(总计)8.26s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.38s
响应时间(最大)2.38s
响应时间(总计)2.38s
|
| #155#155 |
Mimo V2 PROnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.6… |
Xiaomi |
$0.045
↓
…
|
2.27s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 2 API 错误: 1
响应时间(平均)2.27s
响应时间(最大)6.58s
响应时间(总计)45.50s
…
|
- 总测试数
- 21
- 错误测试数
- 14
- 尝试通过率
- 39.4%
- 输入令牌
- 39,344
- 输出令牌
- 2,352
- 推理令牌
- 0
- 响应时间(平均)
- 2.27s
- 响应时间(总计)
- 45.50s
- 响应时间(最大)
- 6.58s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.80s
响应时间(最大)2.62s
响应时间(总计)7.19s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)2.65s
响应时间(最大)3.82s
响应时间(总计)5.30s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.58s
响应时间(最大)6.58s
响应时间(总计)6.58s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.39s
响应时间(最大)1.42s
响应时间(总计)2.78s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.78s
响应时间(最大)2.49s
响应时间(总计)5.34s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.44s
响应时间(最大)2.44s
响应时间(总计)2.44s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.51s
响应时间(最大)2.95s
响应时间(总计)5.02s
-
谜题求解
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.61s
响应时间(最大)2.15s
响应时间(总计)4.83s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.39s
响应时间(最大)4.39s
响应时间(总计)4.39s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.63s
响应时间(最大)1.63s
响应时间(总计)1.63s
|
| #156#156 |
Owl Alphanone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.6… |
Openrouter |
$0.000
…
|
9.88s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 3 额外格式: 1
响应时间(平均)9.88s
响应时间(最大)47.10s
响应时间(总计)207.38s
…
|
- 总测试数
- 21
- 错误测试数
- 14
- 尝试通过率
- 34.9%
- 输入令牌
- 42,283
- 输出令牌
- 5,913
- 推理令牌
- 0
- 响应时间(平均)
- 9.88s
- 响应时间(总计)
- 207.38s
- 响应时间(最大)
- 47.10s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)2.78s
响应时间(最大)3.09s
响应时间(总计)11.10s
-
编程
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)36.89s
响应时间(最大)47.10s
响应时间(总计)110.66s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)21.74s
响应时间(最大)21.74s
响应时间(总计)21.74s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.60s
响应时间(最大)3.92s
响应时间(总计)7.19s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.00s
响应时间(最大)4.69s
响应时间(总计)8.99s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.61s
响应时间(最大)4.61s
响应时间(总计)4.61s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.63s
响应时间(最大)2.77s
响应时间(总计)5.27s
-
谜题求解
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)4.18s
响应时间(最大)8.27s
响应时间(总计)12.54s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)22.78s
响应时间(最大)22.78s
响应时间(总计)22.78s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.50s
响应时间(最大)2.50s
响应时间(总计)2.50s
|
| #158#158 |
DeepSeek V4 Flashnone
|
5.6… |
DeepSeek |
$0.044
↓
…
|
36.78s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 额外格式: 2 无效工具调用: 2 未遵循指令: 1
响应时间(平均)36.78s
响应时间(最大)247.27s
响应时间(总计)809.09s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 31.8%
- 输入令牌
- 240,221
- 输出令牌
- 100,727
- 推理令牌
- 0
- 响应时间(平均)
- 36.78s
- 响应时间(总计)
- 809.09s
- 响应时间(最大)
- 247.27s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)20.18s
响应时间(最大)26.54s
响应时间(总计)80.73s
-
编程
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)17.13s
响应时间(最大)24.90s
响应时间(总计)51.40s
-
综合
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)179.61s
响应时间(最大)247.27s
响应时间(总计)359.23s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.79s
响应时间(最大)23.85s
响应时间(总计)47.57s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)19.73s
响应时间(最大)27.66s
响应时间(总计)59.18s
-
通用智能
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)23.74s
响应时间(最大)23.74s
响应时间(总计)23.74s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)17.54s
响应时间(最大)18.51s
响应时间(总计)35.08s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 未遵循指令: 1 答案错误: 1
响应时间(平均)23.72s
响应时间(最大)29.24s
响应时间(总计)71.16s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)77.93s
响应时间(最大)77.93s
响应时间(总计)77.93s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.07s
响应时间(最大)3.07s
响应时间(总计)3.07s
|
| #159#159 |
GLM 5.1none
|
5.5… |
Z.ai |
$0.164
↓
…
|
6.70s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 无效工具调用: 1 无答案: 1
响应时间(平均)6.70s
响应时间(最大)61.20s
响应时间(总计)147.38s
…
|
- 总测试数
- 22
- 错误测试数
- 15
- 尝试通过率
- 40.9%
- 输入令牌
- 124,209
- 输出令牌
- 14,393
- 推理令牌
- 0
- 响应时间(平均)
- 6.70s
- 响应时间(总计)
- 147.38s
- 响应时间(最大)
- 61.20s
-
反AI技巧
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.11s
响应时间(最大)3.94s
响应时间(总计)8.46s
-
编程
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)4.96s
响应时间(最大)9.79s
响应时间(总计)14.89s
-
综合
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 无答案: 1
响应时间(平均)46.88s
响应时间(最大)61.20s
响应时间(总计)93.77s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.08s
响应时间(最大)1.62s
响应时间(总计)2.15s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.99s
响应时间(最大)3.99s
响应时间(总计)5.98s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)790ms
响应时间(最大)790ms
响应时间(总计)790ms
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.98s
响应时间(最大)2.28s
响应时间(总计)3.97s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.45s
响应时间(最大)2.09s
响应时间(总计)4.36s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.68s
响应时间(最大)10.68s
响应时间(总计)10.68s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.34s
响应时间(最大)2.34s
响应时间(总计)2.34s
|
| #160#160 |
Qwen3.6 27Bnone
|
5.5… |
Qwen |
$0.116
↑
…
|
10.65s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 2 无效工具调用: 2
响应时间(平均)10.65s
响应时间(最大)156.31s
响应时间(总计)234.39s
…
|
- 总测试数
- 22
- 错误测试数
- 15
- 尝试通过率
- 45.5%
- 输入令牌
- 95,796
- 输出令牌
- 16,155
- 推理令牌
- 0
- 响应时间(平均)
- 10.65s
- 响应时间(总计)
- 234.39s
- 响应时间(最大)
- 156.31s
-
反AI技巧
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.83s
响应时间(最大)7.62s
响应时间(总计)11.33s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.16s
响应时间(最大)10.18s
响应时间(总计)12.49s
-
综合
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)83.13s
响应时间(最大)156.31s
响应时间(总计)166.26s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.06s
响应时间(最大)2.39s
响应时间(总计)4.11s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.03s
响应时间(最大)4.83s
响应时间(总计)9.08s
-
通用智能
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.07s
响应时间(最大)1.07s
响应时间(总计)1.07s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.92s
响应时间(最大)1.94s
响应时间(总计)3.83s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)5.15s
响应时间(最大)11.82s
响应时间(总计)15.45s
-
工具调用
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.74s
响应时间(最大)6.74s
响应时间(总计)6.74s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.03s
响应时间(最大)4.03s
响应时间(总计)4.03s
|
| #161#161 |
Hy3 previewlow已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.5… |
Tencent |
$0.015
↕
…
|
24.56s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 7 答案错误: 4
响应时间(平均)24.56s
响应时间(最大)78.74s
响应时间(总计)368.35s
…
|
- 总测试数
- 21
- 错误测试数
- 11
- 尝试通过率
- 50.0%
- 输入令牌
- 21,045
- 输出令牌
- 63,460
- 推理令牌
- 0
- 响应时间(平均)
- 24.56s
- 响应时间(总计)
- 368.35s
- 响应时间(最大)
- 78.74s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)9.32s
响应时间(最大)12.36s
响应时间(总计)27.96s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)27.94s
响应时间(最大)27.94s
响应时间(总计)27.94s
-
综合
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)78.74s
响应时间(最大)78.74s
响应时间(总计)78.74s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)5.85s
响应时间(最大)5.85s
响应时间(总计)5.85s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)40.44s
响应时间(最大)46.32s
响应时间(总计)121.31s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.98s
响应时间(最大)22.24s
响应时间(总计)31.97s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)7.51s
响应时间(最大)7.86s
响应时间(总计)15.02s
-
工具调用
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)17.84s
响应时间(最大)17.84s
响应时间(总计)17.84s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)41.74s
响应时间(最大)41.74s
响应时间(总计)41.74s
|
| #162#162 |
MiMo-V2.5-Pronone
|
5.5… |
Xiaomi |
$0.068
↓
…
|
4.12s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 4 无答案: 1
响应时间(平均)4.12s
响应时间(最大)53.13s
响应时间(总计)90.55s
…
|
- 总测试数
- 22
- 错误测试数
- 16
- 尝试通过率
- 37.9%
- 输入令牌
- 124,799
- 输出令牌
- 15,362
- 推理令牌
- 0
- 响应时间(平均)
- 4.12s
- 响应时间(总计)
- 90.55s
- 响应时间(最大)
- 53.13s
-
反AI技巧
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)2.67s
响应时间(最大)8.32s
响应时间(总计)10.67s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.41s
响应时间(最大)2.39s
响应时间(总计)4.23s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 无答案: 1
响应时间(平均)28.33s
响应时间(最大)53.13s
响应时间(总计)56.67s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.32s
响应时间(最大)1.42s
响应时间(总计)2.64s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)877ms
响应时间(最大)904ms
响应时间(总计)2.63s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.58s
响应时间(最大)2.58s
响应时间(总计)2.58s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.03s
响应时间(最大)1.10s
响应时间(总计)2.06s
-
谜题求解
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.30s
响应时间(最大)1.61s
响应时间(总计)3.90s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.30s
响应时间(最大)3.30s
响应时间(总计)3.30s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.89s
响应时间(最大)1.89s
响应时间(总计)1.89s
|
| #163#163 |
Kimi K2.5none
|
5.5… |
Moonshot AI |
$0.127
↑
…
|
19.15s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 15 无答案: 1
响应时间(平均)19.15s
响应时间(最大)102.83s
响应时间(总计)287.30s
…
|
- 总测试数
- 22
- 错误测试数
- 16
- 尝试通过率
- 34.9%
- 输入令牌
- 89,322
- 输出令牌
- 26,638
- 推理令牌
- 0
- 响应时间(平均)
- 19.15s
- 响应时间(总计)
- 287.30s
- 响应时间(最大)
- 102.83s
-
反AI技巧
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)6.24s
响应时间(最大)11.38s
响应时间(总计)12.48s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)24.56s
响应时间(最大)38.78s
响应时间(总计)73.69s
-
综合
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)61.00s
响应时间(最大)102.83s
响应时间(总计)121.99s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)42.13s
响应时间(最大)42.13s
响应时间(总计)42.13s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.38s
响应时间(最大)4.38s
响应时间(总计)4.38s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.00s
响应时间(最大)4.00s
响应时间(总计)4.00s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.67s
响应时间(最大)2.67s
响应时间(总计)2.67s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)4.04s
响应时间(最大)7.81s
响应时间(总计)8.08s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.99s
响应时间(最大)13.99s
响应时间(总计)13.99s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.90s
响应时间(最大)3.90s
响应时间(总计)3.90s
|
| #164#164 |
Gemma 4 26B A4Bnone
|
5.5… |
Google |
$0.022
↑
…
|
7.64s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 2 无效工具调用: 1 超时: 1
响应时间(平均)7.64s
响应时间(最大)57.10s
响应时间(总计)167.98s
…
|
- 总测试数
- 22
- 错误测试数
- 14
- 尝试通过率
- 42.4%
- 输入令牌
- 131,282
- 输出令牌
- 15,781
- 推理令牌
- 0
- 响应时间(平均)
- 7.64s
- 响应时间(总计)
- 167.98s
- 响应时间(最大)
- 57.10s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.28s
响应时间(最大)2.09s
响应时间(总计)5.13s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)4.16s
响应时间(最大)7.07s
响应时间(总计)12.48s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)37.23s
响应时间(最大)43.93s
响应时间(总计)74.46s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.70s
响应时间(最大)2.21s
响应时间(总计)3.41s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.49s
响应时间(最大)4.23s
响应时间(总计)7.48s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.54s
响应时间(最大)3.54s
响应时间(总计)3.54s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)690ms
响应时间(最大)878ms
响应时间(总计)1.38s
-
谜题求解
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)744ms
响应时间(最大)972ms
响应时间(总计)2.23s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)57.10s
响应时间(最大)57.10s
响应时间(总计)57.10s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)778ms
响应时间(最大)778ms
响应时间(总计)778ms
|
| #165#165 |
Mimo V2 Omninone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.5… |
Xiaomi |
$0.021
↓
…
|
2.44s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 API 错误: 1 额外格式: 1 未遵循指令: 1
响应时间(平均)2.44s
响应时间(最大)6.81s
响应时间(总计)48.81s
…
|
- 总测试数
- 21
- 错误测试数
- 13
- 尝试通过率
- 37.9%
- 输入令牌
- 40,852
- 输出令牌
- 3,314
- 推理令牌
- 0
- 响应时间(平均)
- 2.44s
- 响应时间(总计)
- 48.81s
- 响应时间(最大)
- 6.81s
-
反AI技巧
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)1.63s
响应时间(最大)3.29s
响应时间(总计)6.52s
-
编程
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 额外格式: 1 答案错误: 1
响应时间(平均)2.75s
响应时间(最大)3.79s
响应时间(总计)5.50s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.96s
响应时间(最大)5.96s
响应时间(总计)5.96s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.76s
响应时间(最大)2.60s
响应时间(总计)3.51s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.10s
响应时间(最大)3.58s
响应时间(总计)6.30s
-
通用智能
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.33s
响应时间(最大)2.33s
响应时间(总计)2.33s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.26s
响应时间(最大)6.81s
响应时间(总计)8.51s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.16s
响应时间(最大)1.55s
响应时间(总计)3.48s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.40s
响应时间(最大)5.40s
响应时间(总计)5.40s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.30s
响应时间(最大)1.30s
响应时间(总计)1.30s
|
| #168#168 |
GPT-5.6 Lunanone
|
5.4… |
OpenAI |
$0.142
…
|
1.50s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 额外格式: 1 无效工具调用: 1
响应时间(平均)1.50s
响应时间(最大)10.57s
响应时间(总计)32.91s
…
|
- 总测试数
- 22
- 错误测试数
- 16
- 尝试通过率
- 34.9%
- 输入令牌
- 101,323
- 输出令牌
- 6,709
- 推理令牌
- 0
- 响应时间(平均)
- 1.50s
- 响应时间(总计)
- 32.91s
- 响应时间(最大)
- 10.57s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)901ms
响应时间(最大)1.45s
响应时间(总计)3.60s
-
编程
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)980ms
响应时间(最大)1.57s
响应时间(总计)2.94s
-
综合
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)6.68s
响应时间(最大)10.57s
响应时间(总计)13.35s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)758ms
响应时间(最大)803ms
响应时间(总计)1.52s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)737ms
响应时间(最大)785ms
响应时间(总计)2.21s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.00s
响应时间(最大)1.00s
响应时间(总计)1.00s
-
指令遵循
: 7.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.23s
响应时间(最大)1.66s
响应时间(总计)2.47s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)790ms
响应时间(最大)865ms
响应时间(总计)2.37s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.80s
响应时间(最大)2.80s
响应时间(总计)2.80s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)651ms
响应时间(最大)651ms
响应时间(总计)651ms
|
| #170#170 |
Laguna XS 2.1none
|
5.3… |
Poolside |
$0.008
…
|
1.55s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 未遵循指令: 1 无效工具调用: 1 超时: 1
响应时间(平均)1.55s
响应时间(最大)19.02s
响应时间(总计)34.19s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 30.3%
- 输入令牌
- 91,598
- 输出令牌
- 13,377
- 推理令牌
- 0
- 响应时间(平均)
- 1.55s
- 响应时间(总计)
- 34.19s
- 响应时间(最大)
- 19.02s
-
反AI技巧
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)755ms
响应时间(最大)2.30s
响应时间(总计)3.02s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)623ms
响应时间(最大)1.34s
响应时间(总计)1.87s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)10.39s
响应时间(最大)19.02s
响应时间(总计)20.78s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)768ms
响应时间(最大)824ms
响应时间(总计)1.54s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)364ms
响应时间(最大)382ms
响应时间(总计)1.09s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)529ms
响应时间(最大)529ms
响应时间(总计)529ms
-
指令遵循
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)364ms
响应时间(最大)373ms
响应时间(总计)728ms
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.01s
响应时间(最大)1.92s
响应时间(总计)3.02s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.36s
响应时间(最大)1.36s
响应时间(总计)1.36s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)254ms
响应时间(最大)254ms
响应时间(总计)254ms
|
| #171#171 |
Qwen3.6 35B A3Bnone
|
5.3… |
Qwen |
$0.061
↑
…
|
5.52s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 API 错误: 2 未遵循指令: 2 无答案: 1
响应时间(平均)5.52s
响应时间(最大)39.54s
响应时间(总计)110.40s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 31.8%
- 输入令牌
- 93,979
- 输出令牌
- 46,957
- 推理令牌
- 0
- 响应时间(平均)
- 5.52s
- 响应时间(总计)
- 110.40s
- 响应时间(最大)
- 39.54s
-
反AI技巧
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.10s
响应时间(最大)6.15s
响应时间(总计)8.41s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)8.77s
响应时间(最大)22.52s
响应时间(总计)26.32s
-
综合
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 无答案: 1
响应时间(平均)39.54s
响应时间(最大)39.54s
响应时间(总计)39.54s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.46s
响应时间(最大)2.03s
响应时间(总计)2.93s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)7.45s
响应时间(最大)12.46s
响应时间(总计)22.35s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.51s
响应时间(最大)3.51s
响应时间(总计)3.51s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.86s
响应时间(最大)2.83s
响应时间(总计)3.73s
-
谜题求解
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2 答案错误: 1
响应时间(平均)1.07s
响应时间(最大)1.24s
响应时间(总计)3.20s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)414ms
响应时间(最大)414ms
响应时间(总计)414ms
|
| #172#172 |
Ling-2.6-1Tnone
|
5.3… |
Inclusionai |
$0.016
↑
…
|
8.58s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 API 错误: 3 未遵循指令: 2 无效工具调用: 1
响应时间(平均)8.58s
响应时间(最大)25.72s
响应时间(总计)163.06s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 18.2%
- 输入令牌
- 106,414
- 输出令牌
- 11,555
- 推理令牌
- 0
- 响应时间(平均)
- 8.58s
- 响应时间(总计)
- 163.06s
- 响应时间(最大)
- 25.72s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)6.55s
响应时间(最大)9.41s
响应时间(总计)26.19s
-
编程
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2 答案错误: 1
响应时间(平均)10.57s
响应时间(最大)10.57s
响应时间(总计)10.57s
-
综合
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)23.79s
响应时间(最大)24.05s
响应时间(总计)47.59s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.37s
响应时间(最大)1.37s
响应时间(总计)2.73s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.04s
响应时间(最大)1.08s
响应时间(总计)3.11s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)20.34s
响应时间(最大)20.34s
响应时间(总计)20.34s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.36s
响应时间(最大)9.81s
响应时间(总计)10.73s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)5.36s
响应时间(最大)13.26s
响应时间(总计)16.09s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)25.72s
响应时间(最大)25.72s
响应时间(总计)25.72s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #175#175 |
Mistral Small 4none
|
5.1… |
Mistral |
$0.022
…
|
1.20s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 16 未遵循指令: 1
响应时间(平均)1.20s
响应时间(最大)13.16s
响应时间(总计)26.38s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 25.8%
- 输入令牌
- 104,708
- 输出令牌
- 9,812
- 推理令牌
- 0
- 响应时间(平均)
- 1.20s
- 响应时间(总计)
- 26.38s
- 响应时间(最大)
- 13.16s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)395ms
响应时间(最大)769ms
响应时间(总计)1.58s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)901ms
响应时间(最大)1.28s
响应时间(总计)2.70s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)7.44s
响应时间(最大)13.16s
响应时间(总计)14.88s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)822ms
响应时间(最大)1.08s
响应时间(总计)1.64s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)367ms
响应时间(最大)388ms
响应时间(总计)1.10s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)729ms
响应时间(最大)729ms
响应时间(总计)729ms
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)380ms
响应时间(最大)380ms
响应时间(总计)759ms
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)399ms
响应时间(最大)570ms
响应时间(总计)1.20s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.40s
响应时间(最大)1.40s
响应时间(总计)1.40s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)397ms
响应时间(最大)397ms
响应时间(总计)397ms
|
| #176#176 |
Qwen3 Coder Nextnone
|
5.1… |
Qwen |
$0.025
↓
…
|
9.12s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 额外格式: 1 未遵循指令: 1 无答案: 1
响应时间(平均)9.12s
响应时间(最大)45.14s
响应时间(总计)145.94s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 25.8%
- 输入令牌
- 134,218
- 输出令牌
- 11,808
- 推理令牌
- 0
- 响应时间(平均)
- 9.12s
- 响应时间(总计)
- 145.94s
- 响应时间(最大)
- 45.14s
-
反AI技巧
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1 未遵循指令: 1
响应时间(平均)3.31s
响应时间(最大)4.39s
响应时间(总计)6.63s
-
编程
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.22s
响应时间(最大)3.14s
响应时间(总计)6.67s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)30.86s
响应时间(最大)45.14s
响应时间(总计)61.71s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.32s
响应时间(最大)1.32s
响应时间(总计)1.32s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)962ms
响应时间(最大)962ms
响应时间(总计)962ms
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.34s
响应时间(最大)1.34s
响应时间(总计)1.34s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.78s
响应时间(最大)14.65s
响应时间(总计)15.56s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)24.34s
响应时间(最大)42.58s
响应时间(总计)48.69s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.47s
响应时间(最大)2.47s
响应时间(总计)2.47s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)601ms
响应时间(最大)601ms
响应时间(总计)601ms
|
| #177#177 |
Mistral Small 4medium
|
5.1… |
Mistral |
$0.096
…
|
10.77s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 API 错误: 2 未遵循指令: 2 无答案: 1
响应时间(平均)10.77s
响应时间(最大)59.15s
响应时间(总计)236.94s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 42.4%
- 输入令牌
- 140,494
- 输出令牌
- 39,462
- 推理令牌
- 92,362
- 响应时间(平均)
- 10.77s
- 响应时间(总计)
- 236.94s
- 响应时间(最大)
- 59.15s
-
反AI技巧
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.67s
响应时间(最大)5.03s
响应时间(总计)10.66s
-
编程
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)39.98s
响应时间(最大)59.15s
响应时间(总计)119.95s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)32.40s
响应时间(最大)39.55s
响应时间(总计)64.80s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)1.23s
响应时间(最大)1.96s
响应时间(总计)2.46s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)6.11s
响应时间(最大)13.72s
响应时间(总计)18.34s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.05s
响应时间(最大)2.05s
响应时间(总计)2.05s
-
指令遵循
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.38s
响应时间(最大)1.61s
响应时间(总计)2.75s
-
谜题求解
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)2.17s
响应时间(最大)2.60s
响应时间(总计)6.50s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.50s
响应时间(最大)3.50s
响应时间(总计)3.50s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.92s
响应时间(最大)5.92s
响应时间(总计)5.92s
|
| #178#178 |
MiMo-V2.5none
|
5.1… |
Xiaomi |
$0.025
↓
…
|
4.62s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 额外格式: 1 未遵循指令: 1 无答案: 1
响应时间(平均)4.62s
响应时间(最大)55.36s
响应时间(总计)101.57s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 25.8%
- 输入令牌
- 141,043
- 输出令牌
- 16,464
- 推理令牌
- 0
- 响应时间(平均)
- 4.62s
- 响应时间(总计)
- 101.57s
- 响应时间(最大)
- 55.36s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.19s
响应时间(最大)6.85s
响应时间(总计)8.74s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.24s
响应时间(最大)5.52s
响应时间(总计)9.72s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)28.86s
响应时间(最大)55.36s
响应时间(总计)57.72s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)1.01s
响应时间(最大)1.18s
响应时间(总计)2.03s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)756ms
响应时间(最大)877ms
响应时间(总计)2.27s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.86s
响应时间(最大)6.86s
响应时间(总计)6.86s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)751ms
响应时间(最大)821ms
响应时间(总计)1.50s
-
谜题求解
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.13s
响应时间(最大)5.18s
响应时间(总计)6.40s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.43s
响应时间(最大)2.43s
响应时间(总计)2.43s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.89s
响应时间(最大)3.89s
响应时间(总计)3.89s
|
| #179#179 |
Qwen3.5-9Bnone
|
5.1… |
Qwen |
$0.021
↑
…
|
19.17s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 未遵循指令: 2 无效工具调用: 2
响应时间(平均)19.17s
响应时间(最大)382.06s
响应时间(总计)421.74s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 19.7%
- 输入令牌
- 144,407
- 输出令牌
- 37,484
- 推理令牌
- 0
- 响应时间(平均)
- 19.17s
- 响应时间(总计)
- 421.74s
- 响应时间(最大)
- 382.06s
-
反AI技巧
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.71s
响应时间(最大)3.79s
响应时间(总计)6.84s
-
编程
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)5.60s
响应时间(最大)6.03s
响应时间(总计)16.81s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)193.98s
响应时间(最大)382.06s
响应时间(总计)387.97s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)847ms
响应时间(最大)1.09s
响应时间(总计)1.69s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)464ms
响应时间(最大)622ms
响应时间(总计)1.39s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)552ms
响应时间(最大)552ms
响应时间(总计)552ms
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)514ms
响应时间(最大)582ms
响应时间(总计)1.03s
-
谜题求解
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)621ms
响应时间(最大)759ms
响应时间(总计)1.86s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.27s
响应时间(最大)1.27s
响应时间(总计)1.27s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.32s
响应时间(最大)2.32s
响应时间(总计)2.32s
|
| #180#180 |
GLM 5 Turbonone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.1… |
Z.ai |
$0.047
↑
…
|
2.82s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 2
响应时间(平均)2.82s
响应时间(最大)8.21s
响应时间(总计)59.29s
…
|
- 总测试数
- 21
- 错误测试数
- 15
- 尝试通过率
- 30.3%
- 输入令牌
- 32,525
- 输出令牌
- 1,815
- 推理令牌
- 0
- 响应时间(平均)
- 2.82s
- 响应时间(总计)
- 59.29s
- 响应时间(最大)
- 8.21s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.84s
响应时间(最大)4.15s
响应时间(总计)11.35s
-
编程
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.41s
响应时间(最大)3.93s
响应时间(总计)7.22s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.89s
响应时间(最大)4.89s
响应时间(总计)4.89s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.47s
响应时间(最大)2.48s
响应时间(总计)4.95s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.97s
响应时间(最大)2.65s
响应时间(总计)5.92s
-
通用智能
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.18s
响应时间(最大)2.18s
响应时间(总计)2.18s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.13s
响应时间(最大)2.53s
响应时间(总计)4.27s
-
谜题求解
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.65s
响应时间(最大)3.34s
响应时间(总计)7.94s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.21s
响应时间(最大)8.21s
响应时间(总计)8.21s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.37s
响应时间(最大)2.37s
响应时间(总计)2.37s
|
| #182#182 |
MiniMax M2.7medium
|
5.0… |
Minimax |
$0.163
↓
…
|
41.28s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 5 无答案: 2 超时: 2 API 错误: 1 无效工具调用: 1
响应时间(平均)41.28s
响应时间(最大)196.21s
响应时间(总计)866.81s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 45.5%
- 输入令牌
- 114,518
- 输出令牌
- 18,558
- 推理令牌
- 119,036
- 响应时间(平均)
- 41.28s
- 响应时间(总计)
- 866.81s
- 响应时间(最大)
- 196.21s
-
反AI技巧
: 7.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)40.32s
响应时间(最大)117.04s
响应时间(总计)161.28s
-
编程
: 5.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 无答案: 1
响应时间(平均)101.89s
响应时间(最大)196.21s
响应时间(总计)305.67s
-
综合
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 无答案: 1
响应时间(平均)72.12s
响应时间(最大)103.21s
响应时间(总计)144.25s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)21.95s
响应时间(最大)24.88s
响应时间(总计)43.89s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 答案错误: 1
响应时间(平均)19.00s
响应时间(最大)21.63s
响应时间(总计)38.01s
-
通用智能
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)38.70s
响应时间(最大)38.70s
响应时间(总计)38.70s
-
指令遵循
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)12.80s
响应时间(最大)15.23s
响应时间(总计)25.60s
-
谜题求解
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)24.87s
响应时间(最大)46.29s
响应时间(总计)74.61s
-
工具调用
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)12.05s
响应时间(最大)12.05s
响应时间(总计)12.05s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)22.77s
响应时间(最大)22.77s
响应时间(总计)22.77s
|
| #184#184 |
DeepSeek V3.2none
|
5.0… |
DeepSeek |
$0.054
↑
…
|
18.25s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 API 错误: 4 额外格式: 2 无效工具调用: 2 未遵循指令: 1
响应时间(平均)18.25s
响应时间(最大)115.89s
响应时间(总计)401.60s
…
|
- 总测试数
- 22
- 错误测试数
- 16
- 尝试通过率
- 37.9%
- 输入令牌
- 135,780
- 输出令牌
- 42,097
- 推理令牌
- 0
- 响应时间(平均)
- 18.25s
- 响应时间(总计)
- 401.60s
- 响应时间(最大)
- 115.89s
-
反AI技巧
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 API 错误: 1 答案错误: 1
响应时间(平均)9.35s
响应时间(最大)16.77s
响应时间(总计)37.40s
-
编程
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)14.54s
响应时间(最大)34.11s
响应时间(总计)43.62s
-
综合
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)113.53s
响应时间(最大)115.89s
响应时间(总计)227.06s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.42s
响应时间(最大)16.20s
响应时间(总计)18.84s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)4.17s
响应时间(最大)9.09s
响应时间(总计)12.51s
-
通用智能
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)9.32s
响应时间(最大)9.32s
响应时间(总计)9.32s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.52s
响应时间(最大)1.99s
响应时间(总计)3.04s
-
谜题求解
: 7.6
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)6.91s
响应时间(最大)10.09s
响应时间(总计)20.74s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.85s
响应时间(最大)11.85s
响应时间(总计)11.85s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.23s
响应时间(最大)17.23s
响应时间(总计)17.23s
|
| #185#185 |
GPT-4o-mininone
|
5.0… |
OpenAI |
$0.010
…
|
1.99s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 15 未遵循指令: 1 无答案: 1
响应时间(平均)1.99s
响应时间(最大)7.58s
响应时间(总计)29.86s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 22.7%
- 输入令牌
- 53,136
- 输出令牌
- 2,911
- 推理令牌
- 0
- 响应时间(平均)
- 1.99s
- 响应时间(总计)
- 29.86s
- 响应时间(最大)
- 7.58s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.34s
响应时间(最大)1.83s
响应时间(总计)2.67s
-
编程
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.63s
响应时间(最大)2.55s
响应时间(总计)4.90s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)6.32s
响应时间(最大)7.58s
响应时间(总计)12.64s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.27s
响应时间(最大)1.27s
响应时间(总计)1.27s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)637ms
响应时间(最大)637ms
响应时间(总计)637ms
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)909ms
响应时间(最大)909ms
响应时间(总计)909ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.11s
响应时间(最大)1.11s
响应时间(总计)1.11s
-
谜题求解
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.21s
响应时间(最大)1.37s
响应时间(总计)2.42s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.51s
响应时间(最大)2.51s
响应时间(总计)2.51s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)794ms
响应时间(最大)794ms
响应时间(总计)794ms
|
| #187#187 |
GLM 4.7 Flashnone
|
4.9… |
Z.ai |
$0.016
…
|
9.15s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 无效工具调用: 2 未遵循指令: 1
响应时间(平均)9.15s
响应时间(最大)97.15s
响应时间(总计)137.18s
…
|
- 总测试数
- 22
- 错误测试数
- 16
- 尝试通过率
- 34.9%
- 输入令牌
- 101,504
- 输出令牌
- 22,992
- 推理令牌
- 0
- 响应时间(平均)
- 9.15s
- 响应时间(总计)
- 137.18s
- 响应时间(最大)
- 97.15s
-
反AI技巧
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)5.51s
响应时间(最大)6.59s
响应时间(总计)11.02s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.54s
响应时间(最大)5.57s
响应时间(总计)7.62s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)50.18s
响应时间(最大)97.15s
响应时间(总计)100.36s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.82s
响应时间(最大)4.82s
响应时间(总计)4.82s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)744ms
响应时间(最大)744ms
响应时间(总计)744ms
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.59s
响应时间(最大)1.59s
响应时间(总计)1.59s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)888ms
响应时间(最大)888ms
响应时间(总计)888ms
-
谜题求解
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.20s
响应时间(最大)1.27s
响应时间(总计)2.39s
-
工具调用
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.05s
响应时间(最大)7.05s
响应时间(总计)7.05s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)692ms
响应时间(最大)692ms
响应时间(总计)692ms
|