| #152#152 |
Gemma 4 26B A4Bnone
|
5.5… |
Google |
$0.018
↓
…
|
7.64s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 2 无效工具调用: 1 超时: 1
响应时间(平均)7.64s
响应时间(最大)57.10s
响应时间(总计)167.98s
…
|
- 总测试数
- 22
- 错误测试数
- 14
- 尝试通过率
- 42.4%
- 输入令牌
- 131,282
- 输出令牌
- 15,781
- 推理令牌
- 0
- 响应时间(平均)
- 7.64s
- 响应时间(总计)
- 167.98s
- 响应时间(最大)
- 57.10s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.28s
响应时间(最大)2.09s
响应时间(总计)5.13s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)4.16s
响应时间(最大)7.07s
响应时间(总计)12.48s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)37.23s
响应时间(最大)43.93s
响应时间(总计)74.46s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.70s
响应时间(最大)2.21s
响应时间(总计)3.41s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.49s
响应时间(最大)4.23s
响应时间(总计)7.48s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.54s
响应时间(最大)3.54s
响应时间(总计)3.54s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)690ms
响应时间(最大)878ms
响应时间(总计)1.38s
-
谜题求解
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)744ms
响应时间(最大)972ms
响应时间(总计)2.23s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)57.10s
响应时间(最大)57.10s
响应时间(总计)57.10s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)778ms
响应时间(最大)778ms
响应时间(总计)778ms
|
| #117#117 |
gpt-oss-120bmedium
|
6.1… |
OpenAI |
$0.019
↓
…
|
21.91s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 3 无效工具调用: 1
响应时间(平均)21.91s
响应时间(最大)68.16s
响应时间(总计)328.70s
…
|
- 总测试数
- 22
- 错误测试数
- 13
- 尝试通过率
- 50.0%
- 输入令牌
- 108,747
- 输出令牌
- 29,772
- 推理令牌
- 68,044
- 响应时间(平均)
- 21.91s
- 响应时间(总计)
- 328.70s
- 响应时间(最大)
- 68.16s
-
反AI技巧
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)10.21s
响应时间(最大)19.76s
响应时间(总计)20.43s
-
编程
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)38.37s
响应时间(最大)68.16s
响应时间(总计)115.10s
-
综合
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)23.96s
响应时间(最大)31.18s
响应时间(总计)47.91s
-
数据解析与提取
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.98s
响应时间(最大)1.98s
响应时间(总计)1.98s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)50.92s
响应时间(最大)50.92s
响应时间(总计)50.92s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)7.90s
响应时间(最大)7.90s
响应时间(总计)7.90s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.63s
响应时间(最大)7.63s
响应时间(总计)7.63s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)21.71s
响应时间(最大)32.40s
响应时间(总计)43.41s
-
工具调用
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.91s
响应时间(最大)6.91s
响应时间(总计)6.91s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)26.51s
响应时间(最大)26.51s
响应时间(总计)26.51s
|
| #205#205 |
Step 3.5 Flashnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
2.3… |
Stepfun |
$0.020
…
|
39.03s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 4 未遵循指令: 1 答案错误: 1
响应时间(平均)39.03s
响应时间(最大)114.12s
响应时间(总计)312.26s
…
|
- 总测试数
- 12
- 错误测试数
- 6
- 尝试通过率
- 27.3%
- 输入令牌
- 1,971
- 输出令牌
- 64,795
- 推理令牌
- 0
- 响应时间(平均)
- 39.03s
- 响应时间(总计)
- 312.26s
- 响应时间(最大)
- 114.12s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)34.99s
响应时间(最大)109.60s
响应时间(总计)139.95s
-
编程
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
领域专项
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)34.54s
响应时间(最大)34.54s
响应时间(总计)34.54s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)14.37s
响应时间(最大)14.37s
响应时间(总计)14.37s
-
指令遵循
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.30s
响应时间(最大)9.30s
响应时间(总计)9.30s
-
谜题求解
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)114.12s
响应时间(最大)114.12s
响应时间(总计)114.12s
|
| #111#111 |
Gemma 4 31Bnone
|
6.2… |
Google |
$0.021
↓
…
|
5.34s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 API 错误: 2 未遵循指令: 1
响应时间(平均)5.34s
响应时间(最大)29.95s
响应时间(总计)106.82s
…
|
- 总测试数
- 22
- 错误测试数
- 12
- 尝试通过率
- 48.5%
- 输入令牌
- 125,728
- 输出令牌
- 13,317
- 推理令牌
- 0
- 响应时间(平均)
- 5.34s
- 响应时间(总计)
- 106.82s
- 响应时间(最大)
- 29.95s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.85s
响应时间(最大)4.45s
响应时间(总计)7.40s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)11.19s
响应时间(最大)26.13s
响应时间(总计)33.58s
-
综合
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)29.95s
响应时间(最大)29.95s
响应时间(总计)29.95s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.25s
响应时间(最大)3.02s
响应时间(总计)4.51s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.22s
响应时间(最大)4.68s
响应时间(总计)9.67s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.09s
响应时间(最大)2.09s
响应时间(总计)2.09s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.84s
响应时间(最大)4.45s
响应时间(总计)5.68s
-
谜题求解
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)4.23s
响应时间(最大)7.63s
响应时间(总计)12.69s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.25s
响应时间(最大)1.25s
响应时间(总计)1.25s
|
| #165#165 |
Qwen3.5-9Bnone
|
5.1… |
Qwen |
$0.021
↑
…
|
19.17s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 未遵循指令: 2 无效工具调用: 2
响应时间(平均)19.17s
响应时间(最大)382.06s
响应时间(总计)421.74s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 19.7%
- 输入令牌
- 144,407
- 输出令牌
- 37,484
- 推理令牌
- 0
- 响应时间(平均)
- 19.17s
- 响应时间(总计)
- 421.74s
- 响应时间(最大)
- 382.06s
-
反AI技巧
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.71s
响应时间(最大)3.79s
响应时间(总计)6.84s
-
编程
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)5.60s
响应时间(最大)6.03s
响应时间(总计)16.81s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)193.98s
响应时间(最大)382.06s
响应时间(总计)387.97s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)847ms
响应时间(最大)1.09s
响应时间(总计)1.69s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)464ms
响应时间(最大)622ms
响应时间(总计)1.39s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)552ms
响应时间(最大)552ms
响应时间(总计)552ms
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)514ms
响应时间(最大)582ms
响应时间(总计)1.03s
-
谜题求解
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)621ms
响应时间(最大)759ms
响应时间(总计)1.86s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.27s
响应时间(最大)1.27s
响应时间(总计)1.27s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.32s
响应时间(最大)2.32s
响应时间(总计)2.32s
|
| #153#153 |
Mimo V2 Omninone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.5… |
Xiaomi |
$0.021
↓
…
|
2.44s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 API 错误: 1 额外格式: 1 未遵循指令: 1
响应时间(平均)2.44s
响应时间(最大)6.81s
响应时间(总计)48.81s
…
|
- 总测试数
- 21
- 错误测试数
- 13
- 尝试通过率
- 37.9%
- 输入令牌
- 40,852
- 输出令牌
- 3,314
- 推理令牌
- 0
- 响应时间(平均)
- 2.44s
- 响应时间(总计)
- 48.81s
- 响应时间(最大)
- 6.81s
-
反AI技巧
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)1.63s
响应时间(最大)3.29s
响应时间(总计)6.52s
-
编程
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 额外格式: 1 答案错误: 1
响应时间(平均)2.75s
响应时间(最大)3.79s
响应时间(总计)5.50s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.96s
响应时间(最大)5.96s
响应时间(总计)5.96s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.76s
响应时间(最大)2.60s
响应时间(总计)3.51s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.10s
响应时间(最大)3.58s
响应时间(总计)6.30s
-
通用智能
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.33s
响应时间(最大)2.33s
响应时间(总计)2.33s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.26s
响应时间(最大)6.81s
响应时间(总计)8.51s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.16s
响应时间(最大)1.55s
响应时间(总计)3.48s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.40s
响应时间(最大)5.40s
响应时间(总计)5.40s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.30s
响应时间(最大)1.30s
响应时间(总计)1.30s
|
| #161#161 |
Mistral Small 4none
|
5.1… |
Mistral |
$0.022
…
|
1.20s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 16 未遵循指令: 1
响应时间(平均)1.20s
响应时间(最大)13.16s
响应时间(总计)26.38s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 25.8%
- 输入令牌
- 104,708
- 输出令牌
- 9,812
- 推理令牌
- 0
- 响应时间(平均)
- 1.20s
- 响应时间(总计)
- 26.38s
- 响应时间(最大)
- 13.16s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)395ms
响应时间(最大)769ms
响应时间(总计)1.58s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)901ms
响应时间(最大)1.28s
响应时间(总计)2.70s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)7.44s
响应时间(最大)13.16s
响应时间(总计)14.88s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)822ms
响应时间(最大)1.08s
响应时间(总计)1.64s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)367ms
响应时间(最大)388ms
响应时间(总计)1.10s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)729ms
响应时间(最大)729ms
响应时间(总计)729ms
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)380ms
响应时间(最大)380ms
响应时间(总计)759ms
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)399ms
响应时间(最大)570ms
响应时间(总计)1.20s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.40s
响应时间(最大)1.40s
响应时间(总计)1.40s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)397ms
响应时间(最大)397ms
响应时间(总计)397ms
|
| #162#162 |
Qwen3 Coder Nextnone
|
5.1… |
Qwen |
$0.025
↓
…
|
9.12s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 额外格式: 1 未遵循指令: 1 无答案: 1
响应时间(平均)9.12s
响应时间(最大)45.14s
响应时间(总计)145.94s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 25.8%
- 输入令牌
- 134,218
- 输出令牌
- 11,808
- 推理令牌
- 0
- 响应时间(平均)
- 9.12s
- 响应时间(总计)
- 145.94s
- 响应时间(最大)
- 45.14s
-
反AI技巧
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1 未遵循指令: 1
响应时间(平均)3.31s
响应时间(最大)4.39s
响应时间(总计)6.63s
-
编程
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.22s
响应时间(最大)3.14s
响应时间(总计)6.67s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)30.86s
响应时间(最大)45.14s
响应时间(总计)61.71s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.32s
响应时间(最大)1.32s
响应时间(总计)1.32s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)962ms
响应时间(最大)962ms
响应时间(总计)962ms
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.34s
响应时间(最大)1.34s
响应时间(总计)1.34s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.78s
响应时间(最大)14.65s
响应时间(总计)15.56s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)24.34s
响应时间(最大)42.58s
响应时间(总计)48.69s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.47s
响应时间(最大)2.47s
响应时间(总计)2.47s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)601ms
响应时间(最大)601ms
响应时间(总计)601ms
|
| #196#196 |
MiMo-V2-Flashnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.0… |
Xiaomi |
$0.025
↑
…
|
2.76s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 2 API 错误: 1 额外格式: 1
响应时间(平均)2.76s
响应时间(最大)19.68s
响应时间(总计)46.99s
…
|
- 总测试数
- 21
- 错误测试数
- 17
- 尝试通过率
- 24.2%
- 输入令牌
- 36,851
- 输出令牌
- 68,882
- 推理令牌
- 0
- 响应时间(平均)
- 2.76s
- 响应时间(总计)
- 46.99s
- 响应时间(最大)
- 19.68s
-
反AI技巧
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.19s
响应时间(最大)2.73s
响应时间(总计)4.76s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)2.64s
响应时间(最大)3.84s
响应时间(总计)7.92s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.87s
响应时间(最大)2.87s
响应时间(总计)2.87s
-
数据解析与提取
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 额外格式: 1
响应时间(平均)19.68s
响应时间(最大)19.68s
响应时间(总计)19.68s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)564ms
响应时间(最大)564ms
响应时间(总计)564ms
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.67s
响应时间(最大)1.67s
响应时间(总计)1.67s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)857ms
响应时间(最大)955ms
响应时间(总计)1.71s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.86s
响应时间(最大)2.70s
响应时间(总计)3.71s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.28s
响应时间(最大)2.28s
响应时间(总计)2.28s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.82s
响应时间(最大)1.82s
响应时间(总计)1.82s
|
| #164#164 |
MiMo-V2.5none
|
5.1… |
Xiaomi |
$0.025
↓
…
|
4.62s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 额外格式: 1 未遵循指令: 1 无答案: 1
响应时间(平均)4.62s
响应时间(最大)55.36s
响应时间(总计)101.57s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 25.8%
- 输入令牌
- 141,043
- 输出令牌
- 16,464
- 推理令牌
- 0
- 响应时间(平均)
- 4.62s
- 响应时间(总计)
- 101.57s
- 响应时间(最大)
- 55.36s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.19s
响应时间(最大)6.85s
响应时间(总计)8.74s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.24s
响应时间(最大)5.52s
响应时间(总计)9.72s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)28.86s
响应时间(最大)55.36s
响应时间(总计)57.72s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)1.01s
响应时间(最大)1.18s
响应时间(总计)2.03s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)756ms
响应时间(最大)877ms
响应时间(总计)2.27s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.86s
响应时间(最大)6.86s
响应时间(总计)6.86s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)751ms
响应时间(最大)821ms
响应时间(总计)1.50s
-
谜题求解
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.13s
响应时间(最大)5.18s
响应时间(总计)6.40s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.43s
响应时间(最大)2.43s
响应时间(总计)2.43s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.89s
响应时间(最大)3.89s
响应时间(总计)3.89s
|
| #175#175 |
Ring-2.6-1Tnone
|
4.8… |
Inclusionai |
$0.026
↕
…
|
55.10s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 6 答案错误: 5 未遵循指令: 2
响应时间(平均)55.10s
响应时间(最大)143.82s
响应时间(总计)881.55s
…
|
- 总测试数
- 22
- 错误测试数
- 13
- 尝试通过率
- 45.5%
- 输入令牌
- 7,599
- 输出令牌
- 39,954
- 推理令牌
- 0
- 响应时间(平均)
- 55.10s
- 响应时间(总计)
- 881.55s
- 响应时间(最大)
- 143.82s
-
反AI技巧
: 9.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)43.33s
响应时间(最大)71.76s
响应时间(总计)173.31s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)143.82s
响应时间(最大)143.82s
响应时间(总计)143.82s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)45.87s
响应时间(最大)45.87s
响应时间(总计)45.87s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)73.40s
响应时间(最大)90.09s
响应时间(总计)220.20s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)15.63s
响应时间(最大)15.63s
响应时间(总计)15.63s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)27.36s
响应时间(最大)40.24s
响应时间(总计)54.72s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)31.47s
响应时间(最大)46.84s
响应时间(总计)94.41s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)133.60s
响应时间(最大)133.60s
响应时间(总计)133.60s
|
| #185#185 |
Mercury 2none
|
4.6… |
Inception |
$0.030
…
|
829ms… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 17 未遵循指令: 1
响应时间(平均)829ms
响应时间(最大)4.52s
响应时间(总计)18.24s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 22.7%
- 输入令牌
- 88,704
- 输出令牌
- 9,564
- 推理令牌
- 0
- 响应时间(平均)
- 829ms
- 响应时间(总计)
- 18.24s
- 响应时间(最大)
- 4.52s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)483ms
响应时间(最大)716ms
响应时间(总计)1.93s
-
编程
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.03s
响应时间(最大)1.43s
响应时间(总计)3.10s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.56s
响应时间(最大)4.52s
响应时间(总计)5.13s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)667ms
响应时间(最大)819ms
响应时间(总计)1.33s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)534ms
响应时间(最大)733ms
响应时间(总计)1.60s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)628ms
响应时间(最大)628ms
响应时间(总计)628ms
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)551ms
响应时间(最大)622ms
响应时间(总计)1.10s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)535ms
响应时间(最大)642ms
响应时间(总计)1.60s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.27s
响应时间(最大)1.27s
响应时间(总计)1.27s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)548ms
响应时间(最大)548ms
响应时间(总计)548ms
|
| #183#183 |
Qwen3 Coder Nextmedium
|
4.7… |
Qwen |
$0.032
↓
…
|
9.61s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 3 无答案: 1 超时: 1
响应时间(平均)9.61s
响应时间(最大)81.80s
响应时间(总计)153.69s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 27.3%
- 输入令牌
- 148,194
- 输出令牌
- 19,069
- 推理令牌
- 0
- 响应时间(平均)
- 9.61s
- 响应时间(总计)
- 153.69s
- 响应时间(最大)
- 81.80s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)8.64s
响应时间(最大)15.28s
响应时间(总计)17.29s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)924ms
响应时间(最大)1.69s
响应时间(总计)2.77s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)14.65s
响应时间(最大)25.01s
响应时间(总计)29.29s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)81.80s
响应时间(最大)81.80s
响应时间(总计)81.80s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)638ms
响应时间(最大)638ms
响应时间(总计)638ms
-
通用智能
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.39s
响应时间(最大)1.39s
响应时间(总计)1.39s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.49s
响应时间(最大)13.67s
响应时间(总计)14.99s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.25s
响应时间(最大)1.68s
响应时间(总计)2.49s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.64s
响应时间(最大)2.64s
响应时间(总计)2.64s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)399ms
响应时间(最大)399ms
响应时间(总计)399ms
|
| #182#182 |
Laguna M.1medium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.7… |
Poolside |
$0.033
↕
…
|
14.73s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 4 答案错误: 4 未遵循指令: 1 无答案: 1
响应时间(平均)14.73s
响应时间(最大)53.14s
响应时间(总计)220.93s
…
|
- 总测试数
- 19
- 错误测试数
- 10
- 尝试通过率
- 45.5%
- 输入令牌
- 44,969
- 输出令牌
- 58,087
- 推理令牌
- 0
- 响应时间(平均)
- 14.73s
- 响应时间(总计)
- 220.93s
- 响应时间(最大)
- 53.14s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)4.87s
响应时间(最大)6.30s
响应时间(总计)14.62s
-
编程
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)35.61s
响应时间(最大)35.61s
响应时间(总计)35.61s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)53.14s
响应时间(最大)53.14s
响应时间(总计)53.14s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.93s
响应时间(最大)5.03s
响应时间(总计)9.86s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)24.14s
响应时间(最大)45.83s
响应时间(总计)72.43s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.30s
响应时间(最大)6.00s
响应时间(总计)8.59s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)10.19s
响应时间(最大)14.92s
响应时间(总计)20.37s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.31s
响应时间(最大)6.31s
响应时间(总计)6.31s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #200#200 |
Qwen3.5-9Bmedium
|
3.8… |
Qwen |
$0.036
↑
…
|
82.24s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 12 无答案: 2 答案错误: 2 API 错误: 1 额外格式: 1 未遵循指令: 1
响应时间(平均)82.24s
响应时间(最大)226.38s
响应时间(总计)1315.88s
…
|
- 总测试数
- 22
- 错误测试数
- 19
- 尝试通过率
- 25.8%
- 输入令牌
- 17,070
- 输出令牌
- 29,045
- 推理令牌
- 209,516
- 响应时间(平均)
- 82.24s
- 响应时间(总计)
- 1315.88s
- 响应时间(最大)
- 226.38s
-
反AI技巧
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 答案错误: 1
响应时间(平均)34.44s
响应时间(最大)57.86s
响应时间(总计)103.31s
-
编程
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 无答案: 1 超时: 1
响应时间(平均)100.88s
响应时间(最大)135.61s
响应时间(总计)201.75s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 超时: 1
响应时间(平均)87.31s
响应时间(最大)87.31s
响应时间(总计)87.31s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 3
响应时间(平均)137.75s
响应时间(最大)202.61s
响应时间(总计)413.24s
-
通用智能
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)226.38s
响应时间(最大)226.38s
响应时间(总计)226.38s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)5.75s
响应时间(最大)5.75s
响应时间(总计)5.75s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 答案错误: 1
响应时间(平均)32.27s
响应时间(最大)47.31s
响应时间(总计)96.80s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.31s
响应时间(最大)4.31s
响应时间(总计)4.31s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)177.02s
响应时间(最大)177.02s
响应时间(总计)177.02s
|
| #176#176 |
GPT-5.4 Nanonone
|
4.8… |
OpenAI |
$0.041
…
|
2.57s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 15 未遵循指令: 2 无答案: 1
响应时间(平均)2.57s
响应时间(最大)25.50s
响应时间(总计)56.51s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 28.8%
- 输入令牌
- 115,924
- 输出令牌
- 13,794
- 推理令牌
- 0
- 响应时间(平均)
- 2.57s
- 响应时间(总计)
- 56.51s
- 响应时间(最大)
- 25.50s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.18s
响应时间(最大)1.81s
响应时间(总计)4.70s
-
编程
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.22s
响应时间(最大)4.47s
响应时间(总计)6.65s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)14.67s
响应时间(最大)25.50s
响应时间(总计)29.34s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.11s
响应时间(最大)1.25s
响应时间(总计)2.23s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)926ms
响应时间(最大)959ms
响应时间(总计)2.78s
-
通用智能
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.31s
响应时间(最大)1.31s
响应时间(总计)1.31s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)784ms
响应时间(最大)859ms
响应时间(总计)1.57s
-
谜题求解
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.25s
响应时间(最大)1.53s
响应时间(总计)3.76s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.40s
响应时间(最大)3.40s
响应时间(总计)3.40s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)773ms
响应时间(最大)773ms
响应时间(总计)773ms
|
| #154#154 |
KAT-Coder-Air V2.5low
|
5.4… |
Kwaipilot |
$0.041
…
|
10.09s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 额外格式: 4 API 错误: 2 未遵循指令: 2
响应时间(平均)10.09s
响应时间(最大)86.23s
响应时间(总计)222.03s
…
|
- 总测试数
- 22
- 错误测试数
- 15
- 尝试通过率
- 45.5%
- 输入令牌
- 61,085
- 输出令牌
- 5,905
- 推理令牌
- 46,990
- 响应时间(平均)
- 10.09s
- 响应时间(总计)
- 222.03s
- 响应时间(最大)
- 86.23s
-
反AI技巧
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.50s
响应时间(最大)5.89s
响应时间(总计)13.99s
-
编程
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 答案错误: 1
响应时间(平均)11.06s
响应时间(最大)14.01s
响应时间(总计)33.18s
-
综合
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)55.86s
响应时间(最大)86.23s
响应时间(总计)111.72s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.82s
响应时间(最大)3.26s
响应时间(总计)5.64s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 API 错误: 1
响应时间(平均)4.99s
响应时间(最大)8.65s
响应时间(总计)14.97s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)10.11s
响应时间(最大)10.11s
响应时间(总计)10.11s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.64s
响应时间(最大)2.19s
响应时间(总计)3.28s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.57s
响应时间(最大)1.86s
响应时间(总计)4.71s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.47s
响应时间(最大)4.47s
响应时间(总计)4.47s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)19.98s
响应时间(最大)19.98s
响应时间(总计)19.98s
|
| #137#137 |
GLM 5none
|
5.7… |
Z.ai |
$0.042
↑
…
|
4.03s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12
响应时间(平均)4.03s
响应时间(最大)11.07s
响应时间(总计)56.37s
…
|
- 总测试数
- 21
- 错误测试数
- 12
- 尝试通过率
- 42.4%
- 输入令牌
- 37,135
- 输出令牌
- 1,989
- 推理令牌
- 0
- 响应时间(平均)
- 4.03s
- 响应时间(总计)
- 56.37s
- 响应时间(最大)
- 11.07s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.37s
响应时间(最大)3.39s
响应时间(总计)4.75s
-
编程
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)5.12s
响应时间(最大)8.84s
响应时间(总计)15.36s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.98s
响应时间(最大)4.98s
响应时间(总计)4.98s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.78s
响应时间(最大)5.78s
响应时间(总计)5.78s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.24s
响应时间(最大)2.24s
响应时间(总计)2.24s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.27s
响应时间(最大)3.27s
响应时间(总计)3.27s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.48s
响应时间(最大)1.48s
响应时间(总计)1.48s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.91s
响应时间(最大)2.08s
响应时间(总计)3.82s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.07s
响应时间(最大)11.07s
响应时间(总计)11.07s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.62s
响应时间(最大)3.62s
响应时间(总计)3.62s
|
| #45#45 |
DeepSeek V4 Flashhigh
|
7.7… |
DeepSeek |
$0.042
↓
…
|
49.75s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 2 无效工具调用: 1
响应时间(平均)49.75s
响应时间(最大)218.13s
响应时间(总计)1094.41s
…
|
- 总测试数
- 22
- 错误测试数
- 9
- 尝试通过率
- 72.7%
- 输入令牌
- 108,392
- 输出令牌
- 14,478
- 推理令牌
- 153,687
- 响应时间(平均)
- 49.75s
- 响应时间(总计)
- 1094.41s
- 响应时间(最大)
- 218.13s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)28.51s
响应时间(最大)39.73s
响应时间(总计)114.05s
-
编程
: 7.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)50.60s
响应时间(最大)62.48s
响应时间(总计)151.79s
-
综合
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)104.10s
响应时间(最大)131.63s
响应时间(总计)208.20s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)28.03s
响应时间(最大)30.49s
响应时间(总计)56.07s
-
领域专项
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)100.31s
响应时间(最大)218.13s
响应时间(总计)300.92s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)25.15s
响应时间(最大)25.15s
响应时间(总计)25.15s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.36s
响应时间(最大)19.53s
响应时间(总计)30.73s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)26.11s
响应时间(最大)32.37s
响应时间(总计)78.32s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)74.73s
响应时间(最大)74.73s
响应时间(总计)74.73s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)54.46s
响应时间(最大)54.46s
响应时间(总计)54.46s
|
| #109#109 |
MiMo-V2-Flashmedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.3… |
Xiaomi |
$0.043
↑
…
|
20.11s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 API 错误: 1 额外格式: 1 未遵循指令: 1 超时: 1
响应时间(平均)20.11s
响应时间(最大)96.01s
响应时间(总计)301.59s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 62.1%
- 输入令牌
- 40,111
- 输出令牌
- 12,476
- 推理令牌
- 125,039
- 响应时间(平均)
- 20.11s
- 响应时间(总计)
- 301.59s
- 响应时间(最大)
- 96.01s
-
反AI技巧
: 8.1
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)15.85s
响应时间(最大)20.83s
响应时间(总计)47.55s
-
编程
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)10.71s
响应时间(最大)17.72s
响应时间(总计)32.13s
-
综合
: 4.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)75.68s
响应时间(最大)75.68s
响应时间(总计)75.68s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)96.01s
响应时间(最大)96.01s
响应时间(总计)96.01s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.20s
响应时间(最大)4.20s
响应时间(总计)4.20s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.28s
响应时间(最大)7.37s
响应时间(总计)8.55s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.87s
响应时间(最大)5.26s
响应时间(总计)7.74s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)27.78s
响应时间(最大)27.78s
响应时间(总计)27.78s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.96s
响应时间(最大)1.96s
响应时间(总计)1.96s
|
| #146#146 |
DeepSeek V4 Flashnone
|
5.6… |
DeepSeek |
$0.044
↓
…
|
36.78s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 额外格式: 2 无效工具调用: 2 未遵循指令: 1
响应时间(平均)36.78s
响应时间(最大)247.27s
响应时间(总计)809.09s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 31.8%
- 输入令牌
- 240,221
- 输出令牌
- 100,727
- 推理令牌
- 0
- 响应时间(平均)
- 36.78s
- 响应时间(总计)
- 809.09s
- 响应时间(最大)
- 247.27s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)20.18s
响应时间(最大)26.54s
响应时间(总计)80.73s
-
编程
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)17.13s
响应时间(最大)24.90s
响应时间(总计)51.40s
-
综合
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)179.61s
响应时间(最大)247.27s
响应时间(总计)359.23s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.79s
响应时间(最大)23.85s
响应时间(总计)47.57s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)19.73s
响应时间(最大)27.66s
响应时间(总计)59.18s
-
通用智能
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)23.74s
响应时间(最大)23.74s
响应时间(总计)23.74s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)17.54s
响应时间(最大)18.51s
响应时间(总计)35.08s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 未遵循指令: 1 答案错误: 1
响应时间(平均)23.72s
响应时间(最大)29.24s
响应时间(总计)71.16s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)77.93s
响应时间(最大)77.93s
响应时间(总计)77.93s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.07s
响应时间(最大)3.07s
响应时间(总计)3.07s
|
| #143#143 |
Mimo V2 PROnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.6… |
Xiaomi |
$0.045
↓
…
|
2.27s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 2 API 错误: 1
响应时间(平均)2.27s
响应时间(最大)6.58s
响应时间(总计)45.50s
…
|
- 总测试数
- 21
- 错误测试数
- 14
- 尝试通过率
- 39.4%
- 输入令牌
- 39,344
- 输出令牌
- 2,352
- 推理令牌
- 0
- 响应时间(平均)
- 2.27s
- 响应时间(总计)
- 45.50s
- 响应时间(最大)
- 6.58s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.80s
响应时间(最大)2.62s
响应时间(总计)7.19s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)2.65s
响应时间(最大)3.82s
响应时间(总计)5.30s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.58s
响应时间(最大)6.58s
响应时间(总计)6.58s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.39s
响应时间(最大)1.42s
响应时间(总计)2.78s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.78s
响应时间(最大)2.49s
响应时间(总计)5.34s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.44s
响应时间(最大)2.44s
响应时间(总计)2.44s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.51s
响应时间(最大)2.95s
响应时间(总计)5.02s
-
谜题求解
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.61s
响应时间(最大)2.15s
响应时间(总计)4.83s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.39s
响应时间(最大)4.39s
响应时间(总计)4.39s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.63s
响应时间(最大)1.63s
响应时间(总计)1.63s
|
| #118#118 |
Gemini 3.1 Flash Litenone
|
6.1… |
Google |
$0.046
…
|
1.75s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 1 无答案: 1
响应时间(平均)1.75s
响应时间(最大)16.25s
响应时间(总计)38.60s
…
|
- 总测试数
- 22
- 错误测试数
- 13
- 尝试通过率
- 50.0%
- 输入令牌
- 118,050
- 输出令牌
- 10,723
- 推理令牌
- 0
- 响应时间(平均)
- 1.75s
- 响应时间(总计)
- 38.60s
- 响应时间(最大)
- 16.25s
-
反AI技巧
: 7.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.07s
响应时间(最大)1.91s
响应时间(总计)4.27s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)938ms
响应时间(最大)1.59s
响应时间(总计)2.81s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)9.49s
响应时间(最大)16.25s
响应时间(总计)18.98s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)843ms
响应时间(最大)907ms
响应时间(总计)1.69s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)762ms
响应时间(最大)814ms
响应时间(总计)2.29s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)992ms
响应时间(最大)992ms
响应时间(总计)992ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)859ms
响应时间(最大)975ms
响应时间(总计)1.72s
-
谜题求解
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)720ms
响应时间(最大)826ms
响应时间(总计)2.16s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.97s
响应时间(最大)2.97s
响应时间(总计)2.97s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)733ms
响应时间(最大)733ms
响应时间(总计)733ms
|
| #94#94 |
GLM 5.2none
|
6.6… |
Z.ai |
$0.047
↓
…
|
9.34s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 未遵循指令: 1 无效工具调用: 1
响应时间(平均)9.34s
响应时间(最大)79.65s
响应时间(总计)205.46s
…
|
- 总测试数
- 22
- 错误测试数
- 10
- 尝试通过率
- 59.1%
- 输入令牌
- 112,359
- 输出令牌
- 14,340
- 推理令牌
- 0
- 响应时间(平均)
- 9.34s
- 响应时间(总计)
- 205.46s
- 响应时间(最大)
- 79.65s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.70s
响应时间(最大)5.66s
响应时间(总计)14.80s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)7.55s
响应时间(最大)12.77s
响应时间(总计)22.66s
-
综合
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)50.17s
响应时间(最大)79.65s
响应时间(总计)100.33s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.17s
响应时间(最大)11.71s
响应时间(总计)14.35s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.04s
响应时间(最大)6.76s
响应时间(总计)12.12s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.42s
响应时间(最大)4.42s
响应时间(总计)4.42s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.84s
响应时间(最大)4.88s
响应时间(总计)7.68s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.31s
响应时间(最大)3.63s
响应时间(总计)9.92s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.76s
响应时间(最大)15.76s
响应时间(总计)15.76s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.41s
响应时间(最大)3.41s
响应时间(总计)3.41s
|
| #166#166 |
GLM 5 Turbonone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.1… |
Z.ai |
$0.047
↑
…
|
2.82s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 2
响应时间(平均)2.82s
响应时间(最大)8.21s
响应时间(总计)59.29s
…
|
- 总测试数
- 21
- 错误测试数
- 15
- 尝试通过率
- 30.3%
- 输入令牌
- 32,525
- 输出令牌
- 1,815
- 推理令牌
- 0
- 响应时间(平均)
- 2.82s
- 响应时间(总计)
- 59.29s
- 响应时间(最大)
- 8.21s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.84s
响应时间(最大)4.15s
响应时间(总计)11.35s
-
编程
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.41s
响应时间(最大)3.93s
响应时间(总计)7.22s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.89s
响应时间(最大)4.89s
响应时间(总计)4.89s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.47s
响应时间(最大)2.48s
响应时间(总计)4.95s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.97s
响应时间(最大)2.65s
响应时间(总计)5.92s
-
通用智能
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.18s
响应时间(最大)2.18s
响应时间(总计)2.18s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.13s
响应时间(最大)2.53s
响应时间(总计)4.27s
-
谜题求解
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.65s
响应时间(最大)3.34s
响应时间(总计)7.94s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.21s
响应时间(最大)8.21s
响应时间(总计)8.21s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.37s
响应时间(最大)2.37s
响应时间(总计)2.37s
|
| #116#116 |
Gemini 3.1 Flash Liteminimal
|
6.1… |
Google |
$0.047
…
|
1.86s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 未遵循指令: 3 无答案: 1
响应时间(平均)1.86s
响应时间(最大)12.97s
响应时间(总计)40.88s
…
|
- 总测试数
- 22
- 错误测试数
- 12
- 尝试通过率
- 51.5%
- 输入令牌
- 119,065
- 输出令牌
- 11,118
- 推理令牌
- 0
- 响应时间(平均)
- 1.86s
- 响应时间(总计)
- 40.88s
- 响应时间(最大)
- 12.97s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.10s
响应时间(最大)1.65s
响应时间(总计)4.42s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)831ms
响应时间(最大)1.31s
响应时间(总计)2.49s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)7.75s
响应时间(最大)12.97s
响应时间(总计)15.50s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.04s
响应时间(最大)1.32s
响应时间(总计)2.07s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.02s
响应时间(最大)1.16s
响应时间(总计)3.06s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)791ms
响应时间(最大)791ms
响应时间(总计)791ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)932ms
响应时间(最大)1.00s
响应时间(总计)1.86s
-
谜题求解
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2
响应时间(平均)2.15s
响应时间(最大)4.49s
响应时间(总计)6.45s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.51s
响应时间(最大)3.51s
响应时间(总计)3.51s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)724ms
响应时间(最大)724ms
响应时间(总计)724ms
|
| #131#131 |
Hy3 previewhigh已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.9… |
Tencent |
$0.048
↕
…
|
56.57s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 7 答案错误: 3
响应时间(平均)56.57s
响应时间(最大)149.94s
响应时间(总计)848.59s
…
|
- 总测试数
- 21
- 错误测试数
- 10
- 尝试通过率
- 53.0%
- 输入令牌
- 25,987
- 输出令牌
- 216,719
- 推理令牌
- 0
- 响应时间(平均)
- 56.57s
- 响应时间(总计)
- 848.59s
- 响应时间(最大)
- 149.94s
-
反AI技巧
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)15.12s
响应时间(最大)19.99s
响应时间(总计)45.37s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)99.76s
响应时间(最大)99.76s
响应时间(总计)99.76s
-
综合
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)113.09s
响应时间(最大)113.09s
响应时间(总计)113.09s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)12.11s
响应时间(最大)12.11s
响应时间(总计)12.11s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)109.04s
响应时间(最大)149.94s
响应时间(总计)327.11s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)34.36s
响应时间(最大)41.83s
响应时间(总计)68.73s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)27.94s
响应时间(最大)45.06s
响应时间(总计)55.89s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)78.83s
响应时间(最大)78.83s
响应时间(总计)78.83s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)47.71s
响应时间(最大)47.71s
响应时间(总计)47.71s
|
| #145#145 |
KAT-Coder-Air V2.5medium
|
5.6… |
Kwaipilot |
$0.048
…
|
8.42s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 API 错误: 1 额外格式: 1 未遵循指令: 1
响应时间(平均)8.42s
响应时间(最大)48.19s
响应时间(总计)185.24s
…
|
- 总测试数
- 22
- 错误测试数
- 14
- 尝试通过率
- 45.5%
- 输入令牌
- 51,472
- 输出令牌
- 7,822
- 推理令牌
- 58,352
- 响应时间(平均)
- 8.42s
- 响应时间(总计)
- 185.24s
- 响应时间(最大)
- 48.19s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.79s
响应时间(最大)9.97s
响应时间(总计)15.17s
-
编程
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1
响应时间(平均)23.37s
响应时间(最大)48.19s
响应时间(总计)70.10s
-
综合
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)19.56s
响应时间(最大)27.68s
响应时间(总计)39.11s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.65s
响应时间(最大)4.88s
响应时间(总计)7.31s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)4.87s
响应时间(最大)6.73s
响应时间(总计)14.62s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)9.81s
响应时间(最大)9.81s
响应时间(总计)9.81s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.50s
响应时间(最大)1.88s
响应时间(总计)3.00s
-
谜题求解
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.87s
响应时间(最大)2.41s
响应时间(总计)5.61s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.77s
响应时间(最大)4.77s
响应时间(总计)4.77s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)15.74s
响应时间(最大)15.74s
响应时间(总计)15.74s
|
| #141#141 |
GLM 5V Turbonone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.6… |
Z.ai |
$0.052
…
|
2.99s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 2
响应时间(平均)2.99s
响应时间(最大)6.51s
响应时间(总计)62.74s
…
|
- 总测试数
- 21
- 错误测试数
- 13
- 尝试通过率
- 36.4%
- 输入令牌
- 37,100
- 输出令牌
- 1,766
- 推理令牌
- 0
- 响应时间(平均)
- 2.99s
- 响应时间(总计)
- 62.74s
- 响应时间(最大)
- 6.51s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)3.13s
响应时间(最大)5.90s
响应时间(总计)12.50s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.13s
响应时间(最大)5.30s
响应时间(总计)9.40s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.51s
响应时间(最大)6.51s
响应时间(总计)6.51s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.81s
响应时间(最大)5.69s
响应时间(总计)7.62s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.09s
响应时间(最大)2.39s
响应时间(总计)6.26s
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.22s
响应时间(最大)2.22s
响应时间(总计)2.22s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.97s
响应时间(最大)2.43s
响应时间(总计)3.93s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.40s
响应时间(最大)3.81s
响应时间(总计)7.21s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.86s
响应时间(最大)4.86s
响应时间(总计)4.86s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.23s
响应时间(最大)2.23s
响应时间(总计)2.23s
|
| #103#103 |
Gemini 3.1 Flash Lite Previewnone
|
6.4… |
Google |
$0.052
…
|
1.58s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 未遵循指令: 2 无答案: 1
响应时间(平均)1.58s
响应时间(最大)9.27s
响应时间(总计)34.72s
…
|
- 总测试数
- 22
- 错误测试数
- 10
- 尝试通过率
- 57.6%
- 输入令牌
- 120,942
- 输出令牌
- 14,292
- 推理令牌
- 0
- 响应时间(平均)
- 1.58s
- 响应时间(总计)
- 34.72s
- 响应时间(最大)
- 9.27s
-
反AI技巧
: 7.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.04s
响应时间(最大)1.47s
响应时间(总计)4.17s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)967ms
响应时间(最大)1.47s
响应时间(总计)2.90s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)6.23s
响应时间(最大)9.27s
响应时间(总计)12.46s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.22s
响应时间(最大)1.33s
响应时间(总计)2.44s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)942ms
响应时间(最大)1.12s
响应时间(总计)2.83s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)741ms
响应时间(最大)741ms
响应时间(总计)741ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.13s
响应时间(最大)1.14s
响应时间(总计)2.27s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)900ms
响应时间(最大)962ms
响应时间(总计)2.70s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.39s
响应时间(最大)3.39s
响应时间(总计)3.39s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)814ms
响应时间(最大)814ms
响应时间(总计)814ms
|