| #162#162 |
Qwen3 Coder Nextnone
|
5.1… |
Qwen |
$0.025
↓
…
|
9.12s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 额外格式: 1 未遵循指令: 1 无答案: 1
响应时间(平均)9.12s
响应时间(最大)45.14s
响应时间(总计)145.94s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 25.8%
- 输入令牌
- 134,218
- 输出令牌
- 11,808
- 推理令牌
- 0
- 响应时间(平均)
- 9.12s
- 响应时间(总计)
- 145.94s
- 响应时间(最大)
- 45.14s
-
反AI技巧
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1 未遵循指令: 1
响应时间(平均)3.31s
响应时间(最大)4.39s
响应时间(总计)6.63s
-
编程
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.22s
响应时间(最大)3.14s
响应时间(总计)6.67s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)30.86s
响应时间(最大)45.14s
响应时间(总计)61.71s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.32s
响应时间(最大)1.32s
响应时间(总计)1.32s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)962ms
响应时间(最大)962ms
响应时间(总计)962ms
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.34s
响应时间(最大)1.34s
响应时间(总计)1.34s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.78s
响应时间(最大)14.65s
响应时间(总计)15.56s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)24.34s
响应时间(最大)42.58s
响应时间(总计)48.69s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.47s
响应时间(最大)2.47s
响应时间(总计)2.47s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)601ms
响应时间(最大)601ms
响应时间(总计)601ms
|
| #163#163 |
Mistral Small 4medium
|
5.1… |
Mistral |
$0.096
…
|
10.77s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 API 错误: 2 未遵循指令: 2 无答案: 1
响应时间(平均)10.77s
响应时间(最大)59.15s
响应时间(总计)236.94s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 42.4%
- 输入令牌
- 140,494
- 输出令牌
- 39,462
- 推理令牌
- 92,362
- 响应时间(平均)
- 10.77s
- 响应时间(总计)
- 236.94s
- 响应时间(最大)
- 59.15s
-
反AI技巧
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.67s
响应时间(最大)5.03s
响应时间(总计)10.66s
-
编程
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)39.98s
响应时间(最大)59.15s
响应时间(总计)119.95s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)32.40s
响应时间(最大)39.55s
响应时间(总计)64.80s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)1.23s
响应时间(最大)1.96s
响应时间(总计)2.46s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)6.11s
响应时间(最大)13.72s
响应时间(总计)18.34s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.05s
响应时间(最大)2.05s
响应时间(总计)2.05s
-
指令遵循
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.38s
响应时间(最大)1.61s
响应时间(总计)2.75s
-
谜题求解
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)2.17s
响应时间(最大)2.60s
响应时间(总计)6.50s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.50s
响应时间(最大)3.50s
响应时间(总计)3.50s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.92s
响应时间(最大)5.92s
响应时间(总计)5.92s
|
| #164#164 |
MiMo-V2.5none
|
5.1… |
Xiaomi |
$0.025
↓
…
|
4.62s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 额外格式: 1 未遵循指令: 1 无答案: 1
响应时间(平均)4.62s
响应时间(最大)55.36s
响应时间(总计)101.57s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 25.8%
- 输入令牌
- 141,043
- 输出令牌
- 16,464
- 推理令牌
- 0
- 响应时间(平均)
- 4.62s
- 响应时间(总计)
- 101.57s
- 响应时间(最大)
- 55.36s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.19s
响应时间(最大)6.85s
响应时间(总计)8.74s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.24s
响应时间(最大)5.52s
响应时间(总计)9.72s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)28.86s
响应时间(最大)55.36s
响应时间(总计)57.72s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)1.01s
响应时间(最大)1.18s
响应时间(总计)2.03s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)756ms
响应时间(最大)877ms
响应时间(总计)2.27s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.86s
响应时间(最大)6.86s
响应时间(总计)6.86s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)751ms
响应时间(最大)821ms
响应时间(总计)1.50s
-
谜题求解
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.13s
响应时间(最大)5.18s
响应时间(总计)6.40s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.43s
响应时间(最大)2.43s
响应时间(总计)2.43s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.89s
响应时间(最大)3.89s
响应时间(总计)3.89s
|
| #168#168 |
MiniMax M2.7medium
|
5.0… |
Minimax |
$0.163
↓
…
|
41.28s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 5 无答案: 2 超时: 2 API 错误: 1 无效工具调用: 1
响应时间(平均)41.28s
响应时间(最大)196.21s
响应时间(总计)866.81s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 45.5%
- 输入令牌
- 114,518
- 输出令牌
- 18,558
- 推理令牌
- 119,036
- 响应时间(平均)
- 41.28s
- 响应时间(总计)
- 866.81s
- 响应时间(最大)
- 196.21s
-
反AI技巧
: 7.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)40.32s
响应时间(最大)117.04s
响应时间(总计)161.28s
-
编程
: 5.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 无答案: 1
响应时间(平均)101.89s
响应时间(最大)196.21s
响应时间(总计)305.67s
-
综合
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 无答案: 1
响应时间(平均)72.12s
响应时间(最大)103.21s
响应时间(总计)144.25s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)21.95s
响应时间(最大)24.88s
响应时间(总计)43.89s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 答案错误: 1
响应时间(平均)19.00s
响应时间(最大)21.63s
响应时间(总计)38.01s
-
通用智能
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)38.70s
响应时间(最大)38.70s
响应时间(总计)38.70s
-
指令遵循
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)12.80s
响应时间(最大)15.23s
响应时间(总计)25.60s
-
谜题求解
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)24.87s
响应时间(最大)46.29s
响应时间(总计)74.61s
-
工具调用
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)12.05s
响应时间(最大)12.05s
响应时间(总计)12.05s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)22.77s
响应时间(最大)22.77s
响应时间(总计)22.77s
|
| #170#170 |
GPT-4o-mininone
|
5.0… |
OpenAI |
$0.010
…
|
1.99s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 15 未遵循指令: 1 无答案: 1
响应时间(平均)1.99s
响应时间(最大)7.58s
响应时间(总计)29.86s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 22.7%
- 输入令牌
- 53,136
- 输出令牌
- 2,911
- 推理令牌
- 0
- 响应时间(平均)
- 1.99s
- 响应时间(总计)
- 29.86s
- 响应时间(最大)
- 7.58s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.34s
响应时间(最大)1.83s
响应时间(总计)2.67s
-
编程
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.63s
响应时间(最大)2.55s
响应时间(总计)4.90s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)6.32s
响应时间(最大)7.58s
响应时间(总计)12.64s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.27s
响应时间(最大)1.27s
响应时间(总计)1.27s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)637ms
响应时间(最大)637ms
响应时间(总计)637ms
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)909ms
响应时间(最大)909ms
响应时间(总计)909ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.11s
响应时间(最大)1.11s
响应时间(总计)1.11s
-
谜题求解
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.21s
响应时间(最大)1.37s
响应时间(总计)2.42s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.51s
响应时间(最大)2.51s
响应时间(总计)2.51s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)794ms
响应时间(最大)794ms
响应时间(总计)794ms
|
| #173#173 |
Nemotron 3 Supernone
|
4.9… |
NVIDIA |
$0.017
↑
…
|
5.97s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 15 未遵循指令: 2
响应时间(平均)5.97s
响应时间(最大)20.00s
响应时间(总计)131.31s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 30.3%
- 输入令牌
- 63,519
- 输出令牌
- 6,434
- 推理令牌
- 0
- 响应时间(平均)
- 5.97s
- 响应时间(总计)
- 131.31s
- 响应时间(最大)
- 20.00s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)4.46s
响应时间(最大)9.94s
响应时间(总计)17.83s
-
编程
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.64s
响应时间(最大)3.05s
响应时间(总计)7.92s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)18.22s
响应时间(最大)20.00s
响应时间(总计)36.45s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.92s
响应时间(最大)13.23s
响应时间(总计)15.84s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)6.23s
响应时间(最大)14.38s
响应时间(总计)18.70s
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)950ms
响应时间(最大)950ms
响应时间(总计)950ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)804ms
响应时间(最大)921ms
响应时间(总计)1.61s
-
谜题求解
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.36s
响应时间(最大)3.27s
响应时间(总计)7.07s
-
工具调用
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)16.00s
响应时间(最大)16.00s
响应时间(总计)16.00s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)8.94s
响应时间(最大)8.94s
响应时间(总计)8.94s
|
| #178#178 |
KAT-Coder-Air V2.5none
|
4.8… |
Kwaipilot |
$0.067
…
|
12.17s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 额外格式: 3 API 错误: 1
响应时间(平均)12.17s
响应时间(最大)121.05s
响应时间(总计)267.83s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 37.9%
- 输入令牌
- 69,367
- 输出令牌
- 93,913
- 推理令牌
- 0
- 响应时间(平均)
- 12.17s
- 响应时间(总计)
- 267.83s
- 响应时间(最大)
- 121.05s
-
反AI技巧
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.68s
响应时间(最大)5.78s
响应时间(总计)10.73s
-
编程
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 答案错误: 1
响应时间(平均)14.31s
响应时间(最大)21.40s
响应时间(总计)42.94s
-
综合
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)73.00s
响应时间(最大)121.05s
响应时间(总计)146.00s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)2.66s
响应时间(最大)2.69s
响应时间(总计)5.33s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)6.24s
响应时间(最大)8.97s
响应时间(总计)18.72s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)12.02s
响应时间(最大)12.02s
响应时间(总计)12.02s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.75s
响应时间(最大)2.06s
响应时间(总计)3.50s
-
谜题求解
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.84s
响应时间(最大)2.06s
响应时间(总计)5.52s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.13s
响应时间(最大)5.13s
响应时间(总计)5.13s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.96s
响应时间(最大)17.96s
响应时间(总计)17.96s
|
| #186#186 |
MiniMax M2.5medium
|
4.6… |
Minimax |
$0.340
↓
…
|
68.27s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 超时: 4 未遵循指令: 3 无答案: 2 无效工具调用: 1
响应时间(平均)68.27s
响应时间(最大)251.36s
响应时间(总计)955.75s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 45.5%
- 输入令牌
- 142,561
- 输出令牌
- 125,442
- 推理令牌
- 339,935
- 响应时间(平均)
- 68.27s
- 响应时间(总计)
- 955.75s
- 响应时间(最大)
- 251.36s
-
反AI技巧
: 7.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 超时: 1
响应时间(平均)20.82s
响应时间(最大)32.42s
响应时间(总计)41.63s
-
编程
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 超时: 1 答案错误: 1
响应时间(平均)188.58s
响应时间(最大)251.36s
响应时间(总计)377.16s
-
综合
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 无答案: 1
响应时间(平均)83.19s
响应时间(最大)105.99s
响应时间(总计)166.38s
-
数据解析与提取
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)7.48s
响应时间(最大)7.48s
响应时间(总计)7.48s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)237.27s
响应时间(最大)237.27s
响应时间(总计)237.27s
-
通用智能
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)6.63s
响应时间(最大)6.63s
响应时间(总计)6.63s
-
指令遵循
: 7.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)621ms
响应时间(最大)621ms
响应时间(总计)621ms
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)11.21s
响应时间(最大)17.37s
响应时间(总计)22.43s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.35s
响应时间(最大)15.35s
响应时间(总计)15.35s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)80.79s
响应时间(最大)80.79s
响应时间(总计)80.79s
|
| #188#188 |
Laguna M.1none已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.4… |
Poolside |
$0.009
↕
…
|
2.89s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 API 错误: 4 无效工具调用: 1
响应时间(平均)2.89s
响应时间(最大)15.42s
响应时间(总计)43.28s
…
|
- 总测试数
- 19
- 错误测试数
- 15
- 尝试通过率
- 27.3%
- 输入令牌
- 38,147
- 输出令牌
- 2,054
- 推理令牌
- 0
- 响应时间(平均)
- 2.89s
- 响应时间(总计)
- 43.28s
- 响应时间(最大)
- 15.42s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 API 错误: 1
响应时间(平均)705ms
响应时间(最大)975ms
响应时间(总计)2.12s
-
编程
: 2.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.93s
响应时间(最大)2.93s
响应时间(总计)2.93s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)4.32s
响应时间(最大)4.32s
响应时间(总计)4.32s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.37s
响应时间(最大)5.76s
响应时间(总计)6.73s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)5.50s
响应时间(最大)15.42s
响应时间(总计)16.50s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)683ms
响应时间(最大)691ms
响应时间(总计)1.37s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)891ms
响应时间(最大)1.21s
响应时间(总计)1.78s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.54s
响应时间(最大)7.54s
响应时间(总计)7.54s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #203#203 |
Nemotron 3 Nano Omni 30b A3b Reasoningmedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
3.4… |
NVIDIA |
$0.000
…
|
17.13s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 API 错误: 6 未遵循指令: 1 无答案: 1
响应时间(平均)17.13s
响应时间(最大)147.45s
响应时间(总计)222.66s
…
|
- 总测试数
- 19
- 错误测试数
- 15
- 尝试通过率
- 27.3%
- 输入令牌
- 11,661
- 输出令牌
- 48,491
- 推理令牌
- 180,695
- 响应时间(平均)
- 17.13s
- 响应时间(总计)
- 222.66s
- 响应时间(最大)
- 147.45s
-
反AI技巧
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)1.20s
响应时间(最大)1.48s
响应时间(总计)3.59s
-
编程
: 1.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)38.09s
响应时间(最大)38.09s
响应时间(总计)38.09s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.72s
响应时间(最大)3.88s
响应时间(总计)5.43s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)56.67s
响应时间(最大)147.45s
响应时间(总计)170.02s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.37s
响应时间(最大)1.56s
响应时间(总计)2.74s
-
谜题求解
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)1.40s
响应时间(最大)1.57s
响应时间(总计)2.79s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #179#179 |
Trinity Large Previewnone
|
4.8… |
Arcee AI |
$0.008
↑
…
|
2.98s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 未遵循指令: 3 API 错误: 2
响应时间(平均)2.98s
响应时间(最大)14.34s
响应时间(总计)56.57s
…
|
- 总测试数
- 21
- 错误测试数
- 17
- 尝试通过率
- 21.2%
- 输入令牌
- 29,828
- 输出令牌
- 2,169
- 推理令牌
- 0
- 响应时间(平均)
- 2.98s
- 响应时间(总计)
- 56.57s
- 响应时间(最大)
- 14.34s
-
反AI技巧
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.07s
响应时间(最大)4.40s
响应时间(总计)8.30s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2 答案错误: 1
响应时间(平均)14.34s
响应时间(最大)14.34s
响应时间(总计)14.34s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)8.91s
响应时间(最大)8.91s
响应时间(总计)8.91s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.26s
响应时间(最大)4.66s
响应时间(总计)6.52s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)877ms
响应时间(最大)894ms
响应时间(总计)2.63s
-
通用智能
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)873ms
响应时间(最大)873ms
响应时间(总计)873ms
-
指令遵循
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)822ms
响应时间(最大)960ms
响应时间(总计)1.64s
-
谜题求解
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.97s
响应时间(最大)2.87s
响应时间(总计)5.91s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.67s
响应时间(最大)6.67s
响应时间(总计)6.67s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)777ms
响应时间(最大)777ms
响应时间(总计)777ms
|
| #195#195 |
Hy3 previewnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.0… |
Tencent |
$0.003
↕
…
|
12.92s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 API 错误: 4 未遵循指令: 4 额外格式: 1
响应时间(平均)12.92s
响应时间(最大)35.84s
响应时间(总计)232.64s
…
|
- 总测试数
- 21
- 错误测试数
- 17
- 尝试通过率
- 22.7%
- 输入令牌
- 27,172
- 输出令牌
- 2,661
- 推理令牌
- 0
- 响应时间(平均)
- 12.92s
- 响应时间(总计)
- 232.64s
- 响应时间(最大)
- 35.84s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2 答案错误: 1
响应时间(平均)11.10s
响应时间(最大)26.88s
响应时间(总计)44.41s
-
编程
: 2.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2 答案错误: 1
响应时间(平均)4.56s
响应时间(最大)4.56s
响应时间(总计)4.56s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)35.84s
响应时间(最大)35.84s
响应时间(总计)35.84s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)2.85s
响应时间(最大)2.85s
响应时间(总计)2.85s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)17.61s
响应时间(最大)25.68s
响应时间(总计)52.82s
-
通用智能
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)16.07s
响应时间(最大)16.07s
响应时间(总计)16.07s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)12.98s
响应时间(最大)23.51s
响应时间(总计)25.95s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)4.56s
响应时间(最大)7.35s
响应时间(总计)13.67s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)33.76s
响应时间(最大)33.76s
响应时间(总计)33.76s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.71s
响应时间(最大)2.71s
响应时间(总计)2.71s
|
| #196#196 |
MiMo-V2-Flashnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.0… |
Xiaomi |
$0.025
↑
…
|
2.76s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 2 API 错误: 1 额外格式: 1
响应时间(平均)2.76s
响应时间(最大)19.68s
响应时间(总计)46.99s
…
|
- 总测试数
- 21
- 错误测试数
- 17
- 尝试通过率
- 24.2%
- 输入令牌
- 36,851
- 输出令牌
- 68,882
- 推理令牌
- 0
- 响应时间(平均)
- 2.76s
- 响应时间(总计)
- 46.99s
- 响应时间(最大)
- 19.68s
-
反AI技巧
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.19s
响应时间(最大)2.73s
响应时间(总计)4.76s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)2.64s
响应时间(最大)3.84s
响应时间(总计)7.92s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.87s
响应时间(最大)2.87s
响应时间(总计)2.87s
-
数据解析与提取
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 额外格式: 1
响应时间(平均)19.68s
响应时间(最大)19.68s
响应时间(总计)19.68s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)564ms
响应时间(最大)564ms
响应时间(总计)564ms
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.67s
响应时间(最大)1.67s
响应时间(总计)1.67s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)857ms
响应时间(最大)955ms
响应时间(总计)1.71s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.86s
响应时间(最大)2.70s
响应时间(总计)3.71s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.28s
响应时间(最大)2.28s
响应时间(总计)2.28s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.82s
响应时间(最大)1.82s
响应时间(总计)1.82s
|
| #157#157 |
Qwen3.6 35B A3Bnone
|
5.3… |
Qwen |
$0.061
↑
…
|
5.52s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 API 错误: 2 未遵循指令: 2 无答案: 1
响应时间(平均)5.52s
响应时间(最大)39.54s
响应时间(总计)110.40s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 31.8%
- 输入令牌
- 93,979
- 输出令牌
- 46,957
- 推理令牌
- 0
- 响应时间(平均)
- 5.52s
- 响应时间(总计)
- 110.40s
- 响应时间(最大)
- 39.54s
-
反AI技巧
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.10s
响应时间(最大)6.15s
响应时间(总计)8.41s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)8.77s
响应时间(最大)22.52s
响应时间(总计)26.32s
-
综合
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 无答案: 1
响应时间(平均)39.54s
响应时间(最大)39.54s
响应时间(总计)39.54s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.46s
响应时间(最大)2.03s
响应时间(总计)2.93s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)7.45s
响应时间(最大)12.46s
响应时间(总计)22.35s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.51s
响应时间(最大)3.51s
响应时间(总计)3.51s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.86s
响应时间(最大)2.83s
响应时间(总计)3.73s
-
谜题求解
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2 答案错误: 1
响应时间(平均)1.07s
响应时间(最大)1.24s
响应时间(总计)3.20s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)414ms
响应时间(最大)414ms
响应时间(总计)414ms
|
| #158#158 |
Ling-2.6-1Tnone
|
5.3… |
Inclusionai |
$0.016
↑
…
|
8.58s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 API 错误: 3 未遵循指令: 2 无效工具调用: 1
响应时间(平均)8.58s
响应时间(最大)25.72s
响应时间(总计)163.06s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 18.2%
- 输入令牌
- 106,414
- 输出令牌
- 11,555
- 推理令牌
- 0
- 响应时间(平均)
- 8.58s
- 响应时间(总计)
- 163.06s
- 响应时间(最大)
- 25.72s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)6.55s
响应时间(最大)9.41s
响应时间(总计)26.19s
-
编程
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2 答案错误: 1
响应时间(平均)10.57s
响应时间(最大)10.57s
响应时间(总计)10.57s
-
综合
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)23.79s
响应时间(最大)24.05s
响应时间(总计)47.59s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.37s
响应时间(最大)1.37s
响应时间(总计)2.73s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.04s
响应时间(最大)1.08s
响应时间(总计)3.11s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)20.34s
响应时间(最大)20.34s
响应时间(总计)20.34s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.36s
响应时间(最大)9.81s
响应时间(总计)10.73s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)5.36s
响应时间(最大)13.26s
响应时间(总计)16.09s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)25.72s
响应时间(最大)25.72s
响应时间(总计)25.72s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #165#165 |
Qwen3.5-9Bnone
|
5.1… |
Qwen |
$0.021
↑
…
|
19.17s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 未遵循指令: 2 无效工具调用: 2
响应时间(平均)19.17s
响应时间(最大)382.06s
响应时间(总计)421.74s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 19.7%
- 输入令牌
- 144,407
- 输出令牌
- 37,484
- 推理令牌
- 0
- 响应时间(平均)
- 19.17s
- 响应时间(总计)
- 421.74s
- 响应时间(最大)
- 382.06s
-
反AI技巧
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.71s
响应时间(最大)3.79s
响应时间(总计)6.84s
-
编程
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)5.60s
响应时间(最大)6.03s
响应时间(总计)16.81s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)193.98s
响应时间(最大)382.06s
响应时间(总计)387.97s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)847ms
响应时间(最大)1.09s
响应时间(总计)1.69s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)464ms
响应时间(最大)622ms
响应时间(总计)1.39s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)552ms
响应时间(最大)552ms
响应时间(总计)552ms
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)514ms
响应时间(最大)582ms
响应时间(总计)1.03s
-
谜题求解
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)621ms
响应时间(最大)759ms
响应时间(总计)1.86s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.27s
响应时间(最大)1.27s
响应时间(总计)1.27s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.32s
响应时间(最大)2.32s
响应时间(总计)2.32s
|
| #167#167 |
North Mini Codenone
|
5.1… |
Cohere |
$0.000
…
|
29.95s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 额外格式: 2 未遵循指令: 2 无效工具调用: 2
响应时间(平均)29.95s
响应时间(最大)159.85s
响应时间(总计)658.82s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 18.2%
- 输入令牌
- 130,492
- 输出令牌
- 26,786
- 推理令牌
- 0
- 响应时间(平均)
- 29.95s
- 响应时间(总计)
- 658.82s
- 响应时间(最大)
- 159.85s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 答案错误: 2
响应时间(平均)22.48s
响应时间(最大)51.34s
响应时间(总计)89.90s
-
编程
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)21.96s
响应时间(最大)44.81s
响应时间(总计)65.89s
-
综合
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)96.20s
响应时间(最大)159.85s
响应时间(总计)192.40s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)28.00s
响应时间(最大)42.87s
响应时间(总计)55.99s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)14.73s
响应时间(最大)32.97s
响应时间(总计)44.19s
-
通用智能
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)34.77s
响应时间(最大)34.77s
响应时间(总计)34.77s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)30.68s
响应时间(最大)37.37s
响应时间(总计)61.35s
-
谜题求解
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2 答案错误: 1
响应时间(平均)24.43s
响应时间(最大)48.56s
响应时间(总计)73.30s
-
工具调用
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.64s
响应时间(最大)3.64s
响应时间(总计)3.64s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)37.37s
响应时间(最大)37.37s
响应时间(总计)37.37s
|
| #176#176 |
GPT-5.4 Nanonone
|
4.8… |
OpenAI |
$0.041
…
|
2.57s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 15 未遵循指令: 2 无答案: 1
响应时间(平均)2.57s
响应时间(最大)25.50s
响应时间(总计)56.51s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 28.8%
- 输入令牌
- 115,924
- 输出令牌
- 13,794
- 推理令牌
- 0
- 响应时间(平均)
- 2.57s
- 响应时间(总计)
- 56.51s
- 响应时间(最大)
- 25.50s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.18s
响应时间(最大)1.81s
响应时间(总计)4.70s
-
编程
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.22s
响应时间(最大)4.47s
响应时间(总计)6.65s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)14.67s
响应时间(最大)25.50s
响应时间(总计)29.34s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.11s
响应时间(最大)1.25s
响应时间(总计)2.23s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)926ms
响应时间(最大)959ms
响应时间(总计)2.78s
-
通用智能
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.31s
响应时间(最大)1.31s
响应时间(总计)1.31s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)784ms
响应时间(最大)859ms
响应时间(总计)1.57s
-
谜题求解
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.25s
响应时间(最大)1.53s
响应时间(总计)3.76s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.40s
响应时间(最大)3.40s
响应时间(总计)3.40s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)773ms
响应时间(最大)773ms
响应时间(总计)773ms
|
| #183#183 |
Qwen3 Coder Nextmedium
|
4.7… |
Qwen |
$0.032
↓
…
|
9.61s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 3 无答案: 1 超时: 1
响应时间(平均)9.61s
响应时间(最大)81.80s
响应时间(总计)153.69s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 27.3%
- 输入令牌
- 148,194
- 输出令牌
- 19,069
- 推理令牌
- 0
- 响应时间(平均)
- 9.61s
- 响应时间(总计)
- 153.69s
- 响应时间(最大)
- 81.80s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)8.64s
响应时间(最大)15.28s
响应时间(总计)17.29s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)924ms
响应时间(最大)1.69s
响应时间(总计)2.77s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)14.65s
响应时间(最大)25.01s
响应时间(总计)29.29s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)81.80s
响应时间(最大)81.80s
响应时间(总计)81.80s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)638ms
响应时间(最大)638ms
响应时间(总计)638ms
-
通用智能
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.39s
响应时间(最大)1.39s
响应时间(总计)1.39s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.49s
响应时间(最大)13.67s
响应时间(总计)14.99s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.25s
响应时间(最大)1.68s
响应时间(总计)2.49s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.64s
响应时间(最大)2.64s
响应时间(总计)2.64s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)399ms
响应时间(最大)399ms
响应时间(总计)399ms
|
| #185#185 |
Mercury 2none
|
4.6… |
Inception |
$0.030
…
|
829ms… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 17 未遵循指令: 1
响应时间(平均)829ms
响应时间(最大)4.52s
响应时间(总计)18.24s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 22.7%
- 输入令牌
- 88,704
- 输出令牌
- 9,564
- 推理令牌
- 0
- 响应时间(平均)
- 829ms
- 响应时间(总计)
- 18.24s
- 响应时间(最大)
- 4.52s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)483ms
响应时间(最大)716ms
响应时间(总计)1.93s
-
编程
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.03s
响应时间(最大)1.43s
响应时间(总计)3.10s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.56s
响应时间(最大)4.52s
响应时间(总计)5.13s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)667ms
响应时间(最大)819ms
响应时间(总计)1.33s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)534ms
响应时间(最大)733ms
响应时间(总计)1.60s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)628ms
响应时间(最大)628ms
响应时间(总计)628ms
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)551ms
响应时间(最大)622ms
响应时间(总计)1.10s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)535ms
响应时间(最大)642ms
响应时间(总计)1.60s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.27s
响应时间(最大)1.27s
响应时间(总计)1.27s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)548ms
响应时间(最大)548ms
响应时间(总计)548ms
|
| #190#190 |
GLM 4.7 Flashmedium
|
4.3… |
Z.ai |
$0.166
…
|
142.59s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 无答案: 3 未遵循指令: 2 无效工具调用: 2 超时: 2
响应时间(平均)142.59s
响应时间(最大)1539.97s
响应时间(总计)1996.21s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 31.8%
- 输入令牌
- 79,051
- 输出令牌
- 43,754
- 推理令牌
- 374,109
- 响应时间(平均)
- 142.59s
- 响应时间(总计)
- 1996.21s
- 响应时间(最大)
- 1539.97s
-
反AI技巧
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)14.95s
响应时间(最大)27.09s
响应时间(总计)29.90s
-
编程
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 无答案: 1
响应时间(平均)55.33s
响应时间(最大)89.40s
响应时间(总计)110.66s
-
综合
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)802.77s
响应时间(最大)1539.97s
响应时间(总计)1605.54s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)1.51s
响应时间(最大)1.51s
响应时间(总计)1.51s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)174.55s
响应时间(最大)174.55s
响应时间(总计)174.55s
-
通用智能
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)18.14s
响应时间(最大)18.14s
响应时间(总计)18.14s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.97s
响应时间(最大)2.97s
响应时间(总计)2.97s
-
谜题求解
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)12.93s
响应时间(最大)22.33s
响应时间(总计)25.85s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.95s
响应时间(最大)15.95s
响应时间(总计)15.95s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)11.13s
响应时间(最大)11.13s
响应时间(总计)11.13s
|
| #199#199 |
Grok 4.1 Fastnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
3.8… |
X AI |
$0.008
↓
…
|
1.62s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 3
响应时间(平均)1.62s
响应时间(最大)5.51s
响应时间(总计)19.48s
…
|
- 总测试数
- 19
- 错误测试数
- 16
- 尝试通过率
- 19.7%
- 输入令牌
- 36,608
- 输出令牌
- 1,723
- 推理令牌
- 0
- 响应时间(平均)
- 1.62s
- 响应时间(总计)
- 19.48s
- 响应时间(最大)
- 5.51s
-
反AI技巧
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)1.07s
响应时间(最大)1.73s
响应时间(总计)2.15s
-
编程
: 1.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.79s
响应时间(最大)1.79s
响应时间(总计)1.79s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.33s
响应时间(最大)3.33s
响应时间(总计)3.33s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)943ms
响应时间(最大)943ms
响应时间(总计)943ms
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.06s
响应时间(最大)1.06s
响应时间(总计)1.06s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.08s
响应时间(最大)1.08s
响应时间(总计)1.08s
-
指令遵循
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)685ms
响应时间(最大)685ms
响应时间(总计)685ms
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.10s
响应时间(最大)1.36s
响应时间(总计)2.21s
-
工具调用
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.51s
响应时间(最大)5.51s
响应时间(总计)5.51s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)731ms
响应时间(最大)731ms
响应时间(总计)731ms
|
| #200#200 |
Qwen3.5-9Bmedium
|
3.8… |
Qwen |
$0.036
↑
…
|
82.24s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 12 无答案: 2 答案错误: 2 API 错误: 1 额外格式: 1 未遵循指令: 1
响应时间(平均)82.24s
响应时间(最大)226.38s
响应时间(总计)1315.88s
…
|
- 总测试数
- 22
- 错误测试数
- 19
- 尝试通过率
- 25.8%
- 输入令牌
- 17,070
- 输出令牌
- 29,045
- 推理令牌
- 209,516
- 响应时间(平均)
- 82.24s
- 响应时间(总计)
- 1315.88s
- 响应时间(最大)
- 226.38s
-
反AI技巧
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 答案错误: 1
响应时间(平均)34.44s
响应时间(最大)57.86s
响应时间(总计)103.31s
-
编程
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 无答案: 1 超时: 1
响应时间(平均)100.88s
响应时间(最大)135.61s
响应时间(总计)201.75s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 超时: 1
响应时间(平均)87.31s
响应时间(最大)87.31s
响应时间(总计)87.31s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 3
响应时间(平均)137.75s
响应时间(最大)202.61s
响应时间(总计)413.24s
-
通用智能
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)226.38s
响应时间(最大)226.38s
响应时间(总计)226.38s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)5.75s
响应时间(最大)5.75s
响应时间(总计)5.75s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 答案错误: 1
响应时间(平均)32.27s
响应时间(最大)47.31s
响应时间(总计)96.80s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.31s
响应时间(最大)4.31s
响应时间(总计)4.31s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)177.02s
响应时间(最大)177.02s
响应时间(总计)177.02s
|
| #206#206 |
LFM2-24B-A2Bnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
2.2… |
Liquid |
$0.001
…
|
782ms… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 API 错误: 4 未遵循指令: 1
响应时间(平均)782ms
响应时间(最大)3.15s
响应时间(总计)10.94s
…
|
- 总测试数
- 16
- 错误测试数
- 14
- 尝试通过率
- 12.1%
- 输入令牌
- 10,771
- 输出令牌
- 1,173
- 推理令牌
- 0
- 响应时间(平均)
- 782ms
- 响应时间(总计)
- 10.94s
- 响应时间(最大)
- 3.15s
-
反AI技巧
: 2.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)471ms
响应时间(最大)872ms
响应时间(总计)1.41s
-
编程
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)714ms
响应时间(最大)987ms
响应时间(总计)1.43s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)287ms
响应时间(最大)334ms
响应时间(总计)860ms
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)395ms
响应时间(最大)395ms
响应时间(总计)395ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)752ms
响应时间(最大)1.22s
响应时间(总计)1.50s
-
谜题求解
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)1.78s
响应时间(最大)3.15s
响应时间(总计)5.34s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #204#204 |
Nemotron 3 Nano Omni 30b A3b Reasoningnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
3.2… |
NVIDIA |
$0.000
…
|
728ms… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 API 错误: 6 未遵循指令: 2
响应时间(平均)728ms
响应时间(最大)2.21s
响应时间(总计)9.47s
…
|
- 总测试数
- 19
- 错误测试数
- 17
- 尝试通过率
- 15.2%
- 输入令牌
- 11,661
- 输出令牌
- 1,302
- 推理令牌
- 0
- 响应时间(平均)
- 728ms
- 响应时间(总计)
- 9.47s
- 响应时间(最大)
- 2.21s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)584ms
响应时间(最大)772ms
响应时间(总计)1.75s
-
编程
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.27s
响应时间(最大)1.27s
响应时间(总计)1.27s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.42s
响应时间(最大)2.21s
响应时间(总计)2.84s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)489ms
响应时间(最大)513ms
响应时间(总计)1.47s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)541ms
响应时间(最大)542ms
响应时间(总计)1.08s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 未遵循指令: 1 答案错误: 1
响应时间(平均)532ms
响应时间(最大)580ms
响应时间(总计)1.06s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #197#197 |
Granite 4.1 8Bnone
|
4.0… |
IBM Granite |
$0.007
…
|
1.45s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 4 无效工具调用: 2 额外格式: 1
响应时间(平均)1.45s
响应时间(最大)16.67s
响应时间(总计)31.96s
…
|
- 总测试数
- 22
- 错误测试数
- 20
- 尝试通过率
- 9.1%
- 输入令牌
- 113,827
- 输出令牌
- 5,996
- 推理令牌
- 0
- 响应时间(平均)
- 1.45s
- 响应时间(总计)
- 31.96s
- 响应时间(最大)
- 16.67s
-
反AI技巧
: 4.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)844ms
响应时间(最大)1.91s
响应时间(总计)3.38s
-
编程
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 未遵循指令: 1 答案错误: 1
响应时间(平均)775ms
响应时间(最大)1.07s
响应时间(总计)2.33s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)9.28s
响应时间(最大)16.67s
响应时间(总计)18.55s
-
数据解析与提取
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)575ms
响应时间(最大)583ms
响应时间(总计)1.15s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)357ms
响应时间(最大)463ms
响应时间(总计)1.07s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)499ms
响应时间(最大)499ms
响应时间(总计)499ms
-
指令遵循
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)344ms
响应时间(最大)358ms
响应时间(总计)687ms
-
谜题求解
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)608ms
响应时间(最大)960ms
响应时间(总计)1.82s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.17s
响应时间(最大)2.17s
响应时间(总计)2.17s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)306ms
响应时间(最大)306ms
响应时间(总计)306ms
|