| #66#66 |
Step 3.7 Flashhigh
|
7.2… |
Stepfun |
$0.960
…
|
49.43s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 无答案: 3
响应时间(平均)49.43s
响应时间(最大)192.75s
响应时间(总计)988.58s
…
|
- 总测试数
- 20
- 错误测试数
- 9
- 尝试通过率
- 63.3%
- 输入令牌
- 35,763
- 输出令牌
- 828,084
- 推理令牌
- 0
- 响应时间(平均)
- 49.43s
- 响应时间(总计)
- 988.58s
- 响应时间(最大)
- 192.75s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.40s
响应时间(最大)45.73s
响应时间(总计)53.58s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)126.82s
响应时间(最大)192.75s
响应时间(总计)253.65s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.01s
响应时间(最大)13.01s
响应时间(总计)13.01s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.72s
响应时间(最大)24.97s
响应时间(总计)29.43s
-
领域专项
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)149.64s
响应时间(最大)163.21s
响应时间(总计)448.91s
-
通用智能
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.17s
响应时间(最大)4.17s
响应时间(总计)4.17s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.52s
响应时间(最大)1.89s
响应时间(总计)3.03s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)10.22s
响应时间(最大)23.65s
响应时间(总计)30.66s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.79s
响应时间(最大)2.79s
响应时间(总计)2.79s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)149.34s
响应时间(最大)149.34s
响应时间(总计)149.34s
|
| #67#67 |
MiniMax M3medium
|
7.2… |
Minimax |
$0.120
…
|
68.44s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 3 答案错误: 3 未遵循指令: 2 无答案: 1
响应时间(平均)68.44s
响应时间(最大)431.03s
响应时间(总计)1300.32s
…
|
- 总测试数
- 20
- 错误测试数
- 9
- 尝试通过率
- 65.0%
- 输入令牌
- 43,447
- 输出令牌
- 46,884
- 推理令牌
- 85,935
- 响应时间(平均)
- 68.44s
- 响应时间(总计)
- 1300.32s
- 响应时间(最大)
- 431.03s
-
反AI技巧
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)14.95s
响应时间(最大)44.99s
响应时间(总计)59.78s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)185.58s
响应时间(最大)218.40s
响应时间(总计)371.16s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)65.30s
响应时间(最大)65.30s
响应时间(总计)65.30s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.92s
响应时间(最大)16.89s
响应时间(总计)29.85s
-
领域专项
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2
响应时间(平均)233.13s
响应时间(最大)431.03s
响应时间(总计)466.26s
-
通用智能
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)33.25s
响应时间(最大)33.25s
响应时间(总计)33.25s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.14s
响应时间(最大)6.80s
响应时间(总计)12.27s
-
谜题求解
: 7.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)49.91s
响应时间(最大)128.09s
响应时间(总计)149.74s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.91s
响应时间(最大)11.91s
响应时间(总计)11.91s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)100.80s
响应时间(最大)100.80s
响应时间(总计)100.80s
|
| #68#68 |
GPT-5 Minimedium
|
7.2… |
OpenAI |
$0.149
…
|
23.75s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 3 超时: 1
响应时间(平均)23.75s
响应时间(最大)88.15s
响应时间(总计)475.03s
…
|
- 总测试数
- 20
- 错误测试数
- 9
- 尝试通过率
- 61.7%
- 输入令牌
- 34,481
- 输出令牌
- 6,723
- 推理令牌
- 63,082
- 响应时间(平均)
- 23.75s
- 响应时间(总计)
- 475.03s
- 响应时间(最大)
- 88.15s
-
反AI技巧
: 7.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)13.86s
响应时间(最大)26.00s
响应时间(总计)55.45s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)30.74s
响应时间(最大)38.31s
响应时间(总计)61.49s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)88.15s
响应时间(最大)88.15s
响应时间(总计)88.15s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.58s
响应时间(最大)13.87s
响应时间(总计)25.16s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)44.63s
响应时间(最大)82.55s
响应时间(总计)133.89s
-
通用智能
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)13.50s
响应时间(最大)13.50s
响应时间(总计)13.50s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.59s
响应时间(最大)13.66s
响应时间(总计)23.18s
-
谜题求解
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)15.20s
响应时间(最大)18.90s
响应时间(总计)45.59s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)18.64s
响应时间(最大)18.64s
响应时间(总计)18.64s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.99s
响应时间(最大)9.99s
响应时间(总计)9.99s
|
| #69#69 |
Qwen3.6 Max Previewnone
|
7.1… |
Qwen |
$0.072
↓
…
|
3.31s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9
响应时间(平均)3.31s
响应时间(最大)20.51s
响应时间(总计)66.17s
…
|
- 总测试数
- 20
- 错误测试数
- 9
- 尝试通过率
- 61.7%
- 输入令牌
- 39,668
- 输出令牌
- 4,773
- 推理令牌
- 0
- 响应时间(平均)
- 3.31s
- 响应时间(总计)
- 66.17s
- 响应时间(最大)
- 20.51s
-
反AI技巧
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.63s
响应时间(最大)5.57s
响应时间(总计)10.53s
-
编程
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.06s
响应时间(最大)3.45s
响应时间(总计)6.12s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)20.51s
响应时间(最大)20.51s
响应时间(总计)20.51s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.87s
响应时间(最大)3.54s
响应时间(总计)5.74s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.22s
响应时间(最大)1.25s
响应时间(总计)3.67s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.62s
响应时间(最大)1.62s
响应时间(总计)1.62s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.40s
响应时间(最大)1.46s
响应时间(总计)2.79s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.65s
响应时间(最大)3.59s
响应时间(总计)7.94s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.27s
响应时间(最大)5.27s
响应时间(总计)5.27s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.97s
响应时间(最大)1.97s
响应时间(总计)1.97s
|
| #70#70 |
MiMo-V2-Flashmedium
|
7.1… |
Xiaomi |
$0.040
↑
…
|
20.28s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 API 错误: 1 额外格式: 1 未遵循指令: 1 超时: 1
响应时间(平均)20.28s
响应时间(最大)96.01s
响应时间(总计)283.87s
…
|
- 总测试数
- 20
- 错误测试数
- 9
- 尝试通过率
- 63.3%
- 输入令牌
- 37,474
- 输出令牌
- 12,458
- 推理令牌
- 115,182
- 响应时间(平均)
- 20.28s
- 响应时间(总计)
- 283.87s
- 响应时间(最大)
- 96.01s
-
反AI技巧
: 8.1
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)15.85s
响应时间(最大)20.83s
响应时间(总计)47.55s
-
编程
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)7.20s
响应时间(最大)13.03s
响应时间(总计)14.41s
-
综合
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)75.68s
响应时间(最大)75.68s
响应时间(总计)75.68s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)96.01s
响应时间(最大)96.01s
响应时间(总计)96.01s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.20s
响应时间(最大)4.20s
响应时间(总计)4.20s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.28s
响应时间(最大)7.37s
响应时间(总计)8.55s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.87s
响应时间(最大)5.26s
响应时间(总计)7.74s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)27.78s
响应时间(最大)27.78s
响应时间(总计)27.78s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.96s
响应时间(最大)1.96s
响应时间(总计)1.96s
|
| #71#71 |
Seed-2.0-Minimedium
|
7.1… |
Bytedance Seed |
$0.044
…
|
80.22s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 4 答案错误: 4 未遵循指令: 1
响应时间(平均)80.22s
响应时间(最大)262.83s
响应时间(总计)1363.72s
…
|
- 总测试数
- 20
- 错误测试数
- 9
- 尝试通过率
- 60.0%
- 输入令牌
- 41,904
- 输出令牌
- 2,555
- 推理令牌
- 95,974
- 响应时间(平均)
- 80.22s
- 响应时间(总计)
- 1363.72s
- 响应时间(最大)
- 262.83s
-
反AI技巧
: 6.6
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)74.75s
响应时间(最大)182.10s
响应时间(总计)298.98s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)220.48s
响应时间(最大)243.66s
响应时间(总计)440.97s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)262.83s
响应时间(最大)262.83s
响应时间(总计)262.83s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)24.27s
响应时间(最大)27.52s
响应时间(总计)48.54s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 3
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
通用智能
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)36.65s
响应时间(最大)36.65s
响应时间(总计)36.65s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.47s
响应时间(最大)19.46s
响应时间(总计)34.93s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)31.79s
响应时间(最大)50.78s
响应时间(总计)95.38s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)88.68s
响应时间(最大)88.68s
响应时间(总计)88.68s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)56.76s
响应时间(最大)56.76s
响应时间(总计)56.76s
|
| #72#72 |
Claude Sonnet 4.6none
|
7.0… |
Anthropic |
$0.306
…
|
5.27s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 4 答案错误: 4 未遵循指令: 1
响应时间(平均)5.27s
响应时间(最大)23.84s
响应时间(总计)68.50s
…
|
- 总测试数
- 20
- 错误测试数
- 9
- 尝试通过率
- 58.3%
- 输入令牌
- 54,721
- 输出令牌
- 9,450
- 推理令牌
- 0
- 响应时间(平均)
- 5.27s
- 响应时间(总计)
- 68.50s
- 响应时间(最大)
- 23.84s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 答案错误: 1
响应时间(平均)2.94s
响应时间(最大)4.83s
响应时间(总计)5.88s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)6.73s
响应时间(最大)9.79s
响应时间(总计)13.46s
-
综合
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.84s
响应时间(最大)23.84s
响应时间(总计)23.84s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.43s
响应时间(最大)3.43s
响应时间(总计)3.43s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.54s
响应时间(最大)3.54s
响应时间(总计)3.54s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.56s
响应时间(最大)2.56s
响应时间(总计)2.56s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.96s
响应时间(最大)1.96s
响应时间(总计)1.96s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)2.53s
响应时间(最大)2.54s
响应时间(总计)5.06s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.11s
响应时间(最大)4.11s
响应时间(总计)4.11s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.67s
响应时间(最大)4.67s
响应时间(总计)4.67s
|
| #73#73 |
Grok 4.20medium
|
7.0… |
X AI |
$0.450
↓
…
|
19.08s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 2 额外格式: 1
响应时间(平均)19.08s
响应时间(最大)105.80s
响应时间(总计)381.60s
…
|
- 总测试数
- 20
- 错误测试数
- 9
- 尝试通过率
- 61.7%
- 输入令牌
- 41,511
- 输出令牌
- 1,816
- 推理令牌
- 157,251
- 响应时间(平均)
- 19.08s
- 响应时间(总计)
- 381.60s
- 响应时间(最大)
- 105.80s
-
反AI技巧
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.95s
响应时间(最大)5.68s
响应时间(总计)15.80s
-
编程
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)65.07s
响应时间(最大)105.80s
响应时间(总计)130.13s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.40s
响应时间(最大)17.40s
响应时间(总计)17.40s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.17s
响应时间(最大)5.02s
响应时间(总计)8.34s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)27.03s
响应时间(最大)29.87s
响应时间(总计)81.10s
-
通用智能
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)24.48s
响应时间(最大)24.48s
响应时间(总计)24.48s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.26s
响应时间(最大)4.46s
响应时间(总计)8.52s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.22s
响应时间(最大)11.63s
响应时间(总计)18.66s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)13.68s
响应时间(最大)13.68s
响应时间(总计)13.68s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)63.48s
响应时间(最大)63.48s
响应时间(总计)63.48s
|
| #74#74 |
Ring-2.6-1Tmedium
|
7.0… |
Inclusionai |
$0.033
…
|
61.29s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 2 API 错误: 1
响应时间(平均)61.29s
响应时间(最大)304.19s
响应时间(总计)1164.50s
…
|
- 总测试数
- 20
- 错误测试数
- 9
- 尝试通过率
- 63.3%
- 输入令牌
- 35,892
- 输出令牌
- 21,752
- 推理令牌
- 42,754
- 响应时间(平均)
- 61.29s
- 响应时间(总计)
- 1164.50s
- 响应时间(最大)
- 304.19s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)42.21s
响应时间(最大)89.34s
响应时间(总计)168.84s
-
编程
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)59.65s
响应时间(最大)59.65s
响应时间(总计)59.65s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)304.19s
响应时间(最大)304.19s
响应时间(总计)304.19s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)37.36s
响应时间(最大)54.24s
响应时间(总计)74.71s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)64.92s
响应时间(最大)150.55s
响应时间(总计)194.76s
-
通用智能
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)58.26s
响应时间(最大)58.26s
响应时间(总计)58.26s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.78s
响应时间(最大)17.75s
响应时间(总计)23.55s
-
谜题求解
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)20.73s
响应时间(最大)42.39s
响应时间(总计)62.19s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)104.44s
响应时间(最大)104.44s
响应时间(总计)104.44s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)113.91s
响应时间(最大)113.91s
响应时间(总计)113.91s
|
| #76#76 |
Hy3 previewhigh已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.9… |
Tencent |
$0.048
…
|
56.57s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 6 答案错误: 3
响应时间(平均)56.57s
响应时间(最大)149.94s
响应时间(总计)848.59s
…
|
- 总测试数
- 20
- 错误测试数
- 9
- 尝试通过率
- 58.3%
- 输入令牌
- 25,987
- 输出令牌
- 216,719
- 推理令牌
- 0
- 响应时间(平均)
- 56.57s
- 响应时间(总计)
- 848.59s
- 响应时间(最大)
- 149.94s
-
反AI技巧
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)15.12s
响应时间(最大)19.99s
响应时间(总计)45.37s
-
编程
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)99.76s
响应时间(最大)99.76s
响应时间(总计)99.76s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)113.09s
响应时间(最大)113.09s
响应时间(总计)113.09s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)12.11s
响应时间(最大)12.11s
响应时间(总计)12.11s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)109.04s
响应时间(最大)149.94s
响应时间(总计)327.11s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)34.36s
响应时间(最大)41.83s
响应时间(总计)68.73s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)27.94s
响应时间(最大)45.06s
响应时间(总计)55.89s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)78.83s
响应时间(最大)78.83s
响应时间(总计)78.83s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)47.71s
响应时间(最大)47.71s
响应时间(总计)47.71s
|
| #61#61 |
Gemini 3.1 Flash Litehigh已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
7.3… |
Google |
$2.044
…
|
61.96s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 3 无答案: 1
响应时间(平均)61.96s
响应时间(最大)149.23s
响应时间(总计)1115.31s
…
|
- 总测试数
- 18
- 错误测试数
- 8
- 尝试通过率
- 68.5%
- 输入令牌
- 29,134
- 输出令牌
- 1,984
- 推理令牌
- 1,355,583
- 响应时间(平均)
- 61.96s
- 响应时间(总计)
- 1115.31s
- 响应时间(最大)
- 149.23s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)37.16s
响应时间(最大)140.53s
响应时间(总计)148.65s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)137.63s
响应时间(最大)137.63s
响应时间(总计)137.63s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)149.23s
响应时间(最大)149.23s
响应时间(总计)149.23s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.49s
响应时间(最大)4.96s
响应时间(总计)8.98s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)139.90s
响应时间(最大)141.40s
响应时间(总计)419.69s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)45.69s
响应时间(最大)45.69s
响应时间(总计)45.69s
-
指令遵循
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)23.26s
响应时间(最大)43.87s
响应时间(总计)46.51s
-
谜题求解
: 5.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2
响应时间(平均)50.83s
响应时间(最大)144.85s
响应时间(总计)152.49s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.44s
响应时间(最大)6.44s
响应时间(总计)6.44s
|
| #55#55 |
Step 3.5 Flashmedium
|
7.4… |
Stepfun |
$0.062
↑
…
|
43.20s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 3 无答案: 1
响应时间(平均)43.20s
响应时间(最大)170.45s
响应时间(总计)561.54s
…
|
- 总测试数
- 19
- 错误测试数
- 8
- 尝试通过率
- 59.7%
- 输入令牌
- 33,555
- 输出令牌
- 90,478
- 推理令牌
- 173,544
- 响应时间(平均)
- 43.20s
- 响应时间(总计)
- 561.54s
- 响应时间(最大)
- 170.45s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)40.57s
响应时间(最大)110.43s
响应时间(总计)121.72s
-
编程
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)62.83s
响应时间(最大)62.83s
响应时间(总计)62.83s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)29.57s
响应时间(最大)29.57s
响应时间(总计)29.57s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.01s
响应时间(最大)15.01s
响应时间(总计)15.01s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)170.45s
响应时间(最大)170.45s
响应时间(总计)170.45s
-
通用智能
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)22.39s
响应时间(最大)22.39s
响应时间(总计)22.39s
-
指令遵循
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.78s
响应时间(最大)4.78s
响应时间(总计)4.78s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)7.22s
响应时间(最大)10.60s
响应时间(总计)14.44s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.91s
响应时间(最大)11.91s
响应时间(总计)11.91s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)108.45s
响应时间(最大)108.45s
响应时间(总计)108.45s
|
| #41#41 |
Qwen3.6 Flashmedium
|
7.6… |
Qwen |
$0.272
↓
…
|
18.97s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 未遵循指令: 1
响应时间(平均)18.97s
响应时间(最大)122.87s
响应时间(总计)379.49s
…
|
- 总测试数
- 20
- 错误测试数
- 8
- 尝试通过率
- 71.7%
- 输入令牌
- 39,527
- 输出令牌
- 2,974
- 推理令牌
- 231,797
- 响应时间(平均)
- 18.97s
- 响应时间(总计)
- 379.49s
- 响应时间(最大)
- 122.87s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.10s
响应时间(最大)9.60s
响应时间(总计)24.39s
-
编程
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)51.92s
响应时间(最大)78.01s
响应时间(总计)103.85s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)20.28s
响应时间(最大)20.28s
响应时间(总计)20.28s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.65s
响应时间(最大)10.35s
响应时间(总计)19.31s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)14.65s
响应时间(最大)26.85s
响应时间(总计)43.95s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.88s
响应时间(最大)9.88s
响应时间(总计)9.88s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.05s
响应时间(最大)6.94s
响应时间(总计)12.10s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)6.29s
响应时间(最大)8.18s
响应时间(总计)18.87s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.00s
响应时间(最大)4.00s
响应时间(总计)4.00s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)122.87s
响应时间(最大)122.87s
响应时间(总计)122.87s
|
| #42#42 |
DeepSeek V4 Flashhigh
|
7.6… |
DeepSeek |
$0.027
↓
…
|
46.36s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 2
响应时间(平均)46.36s
响应时间(最大)218.13s
响应时间(总计)927.27s
…
|
- 总测试数
- 20
- 错误测试数
- 8
- 尝试通过率
- 73.3%
- 输入令牌
- 37,156
- 输出令牌
- 10,302
- 推理令牌
- 115,740
- 响应时间(平均)
- 46.36s
- 响应时间(总计)
- 927.27s
- 响应时间(最大)
- 218.13s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)28.51s
响应时间(最大)39.73s
响应时间(总计)114.05s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)58.13s
响应时间(最大)62.48s
响应时间(总计)116.27s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)76.57s
响应时间(最大)76.57s
响应时间(总计)76.57s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)28.03s
响应时间(最大)30.49s
响应时间(总计)56.07s
-
领域专项
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)100.31s
响应时间(最大)218.13s
响应时间(总计)300.92s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)25.15s
响应时间(最大)25.15s
响应时间(总计)25.15s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.36s
响应时间(最大)19.53s
响应时间(总计)30.73s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)26.11s
响应时间(最大)32.37s
响应时间(总计)78.32s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)74.73s
响应时间(最大)74.73s
响应时间(总计)74.73s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)54.46s
响应时间(最大)54.46s
响应时间(总计)54.46s
|
| #43#43 |
MiMo-V2.5-Promedium
|
7.6… |
Xiaomi |
$0.090
↓
…
|
21.79s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 3 答案错误: 3 未遵循指令: 2
响应时间(平均)21.79s
响应时间(最大)130.77s
响应时间(总计)435.79s
…
|
- 总测试数
- 20
- 错误测试数
- 8
- 尝试通过率
- 68.3%
- 输入令牌
- 39,096
- 输出令牌
- 5,004
- 推理令牌
- 80,295
- 响应时间(平均)
- 21.79s
- 响应时间(总计)
- 435.79s
- 响应时间(最大)
- 130.77s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.26s
响应时间(最大)6.38s
响应时间(总计)13.06s
-
编程
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)81.67s
响应时间(最大)130.77s
响应时间(总计)163.34s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)53.36s
响应时间(最大)53.36s
响应时间(总计)53.36s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)18.81s
响应时间(最大)20.29s
响应时间(总计)37.61s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2
响应时间(平均)37.87s
响应时间(最大)84.22s
响应时间(总计)113.60s
-
通用智能
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.02s
响应时间(最大)4.02s
响应时间(总计)4.02s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.77s
响应时间(最大)3.21s
响应时间(总计)5.54s
-
谜题求解
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)5.31s
响应时间(最大)9.12s
响应时间(总计)15.94s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)16.87s
响应时间(最大)16.87s
响应时间(总计)16.87s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)12.46s
响应时间(最大)12.46s
响应时间(总计)12.46s
|
| #45#45 |
Qwen3.5-Flashmedium
|
7.6… |
Qwen |
$0.074
↓
…
|
63.04s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 3 答案错误: 3 API 错误: 1 未遵循指令: 1
响应时间(平均)63.04s
响应时间(最大)234.29s
响应时间(总计)1197.71s
…
|
- 总测试数
- 20
- 错误测试数
- 8
- 尝试通过率
- 75.0%
- 输入令牌
- 37,036
- 输出令牌
- 2,074
- 推理令牌
- 272,063
- 响应时间(平均)
- 63.04s
- 响应时间(总计)
- 1197.71s
- 响应时间(最大)
- 234.29s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)59.11s
响应时间(最大)168.31s
响应时间(总计)236.44s
-
编程
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)54.23s
响应时间(最大)62.72s
响应时间(总计)108.47s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.78s
响应时间(最大)17.78s
响应时间(总计)17.78s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)56.99s
响应时间(最大)80.14s
响应时间(总计)113.98s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)146.50s
响应时间(最大)234.29s
响应时间(总计)439.49s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)40.05s
响应时间(最大)40.05s
响应时间(总计)40.05s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)63.49s
响应时间(最大)111.61s
响应时间(总计)126.98s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)27.61s
响应时间(最大)31.84s
响应时间(总计)55.21s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.33s
响应时间(最大)10.33s
响应时间(总计)10.33s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)48.98s
响应时间(最大)48.98s
响应时间(总计)48.98s
|
| #46#46 |
Mimo V2 PROmedium
|
7.6… |
Xiaomi |
$0.333
↑
…
|
22.16s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 额外格式: 1 未遵循指令: 1 超时: 1
响应时间(平均)22.16s
响应时间(最大)136.29s
响应时间(总计)443.22s
…
|
- 总测试数
- 20
- 错误测试数
- 8
- 尝试通过率
- 76.7%
- 输入令牌
- 40,961
- 输出令牌
- 2,518
- 推理令牌
- 81,801
- 响应时间(平均)
- 22.16s
- 响应时间(总计)
- 443.22s
- 响应时间(最大)
- 136.29s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.86s
响应时间(最大)3.92s
响应时间(总计)11.45s
-
编程
: 7.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)94.21s
响应时间(最大)136.29s
响应时间(总计)188.41s
-
综合
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)64.71s
响应时间(最大)64.71s
响应时间(总计)64.71s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.20s
响应时间(最大)17.44s
响应时间(总计)34.40s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)8.82s
响应时间(最大)14.48s
响应时间(总计)26.47s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.92s
响应时间(最大)4.92s
响应时间(总计)4.92s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.36s
响应时间(最大)4.35s
响应时间(总计)6.72s
-
谜题求解
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 未遵循指令: 1
响应时间(平均)5.08s
响应时间(最大)6.41s
响应时间(总计)15.23s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.19s
响应时间(最大)8.19s
响应时间(总计)8.19s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)82.71s
响应时间(最大)82.71s
响应时间(总计)82.71s
|
| #48#48 |
Qwen3.5 Plus 2026-04-20medium
|
7.5… |
Qwen |
$0.287
↓
…
|
43.65s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8
响应时间(平均)43.65s
响应时间(最大)189.38s
响应时间(总计)872.90s
…
|
- 总测试数
- 20
- 错误测试数
- 8
- 尝试通过率
- 65.0%
- 输入令牌
- 39,262
- 输出令牌
- 2,259
- 推理令牌
- 150,249
- 响应时间(平均)
- 43.65s
- 响应时间(总计)
- 872.90s
- 响应时间(最大)
- 189.38s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.84s
响应时间(最大)15.11s
响应时间(总计)43.36s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)137.55s
响应时间(最大)189.38s
响应时间(总计)275.10s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)92.41s
响应时间(最大)92.41s
响应时间(总计)92.41s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)38.32s
响应时间(最大)41.70s
响应时间(总计)76.63s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)53.10s
响应时间(最大)90.70s
响应时间(总计)159.30s
-
通用智能
: 4.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)25.30s
响应时间(最大)25.30s
响应时间(总计)25.30s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)20.25s
响应时间(最大)21.65s
响应时间(总计)40.50s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.67s
响应时间(最大)24.83s
响应时间(总计)53.02s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.72s
响应时间(最大)14.72s
响应时间(总计)14.72s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)92.57s
响应时间(最大)92.57s
响应时间(总计)92.57s
|
| #49#49 |
Gemini 3.1 Flash Lite Previewnone
|
7.5… |
Google |
$0.017
…
|
1.23s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 2
响应时间(平均)1.23s
响应时间(最大)3.39s
响应时间(总计)24.68s
…
|
- 总测试数
- 20
- 错误测试数
- 8
- 尝试通过率
- 63.3%
- 输入令牌
- 34,579
- 输出令牌
- 5,541
- 推理令牌
- 0
- 响应时间(平均)
- 1.23s
- 响应时间(总计)
- 24.68s
- 响应时间(最大)
- 3.39s
-
反AI技巧
: 7.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.04s
响应时间(最大)1.47s
响应时间(总计)4.17s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.06s
响应时间(最大)1.47s
响应时间(总计)2.13s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.20s
响应时间(最大)3.20s
响应时间(总计)3.20s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.22s
响应时间(最大)1.33s
响应时间(总计)2.44s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)942ms
响应时间(最大)1.12s
响应时间(总计)2.83s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)741ms
响应时间(最大)741ms
响应时间(总计)741ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.13s
响应时间(最大)1.14s
响应时间(总计)2.27s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)900ms
响应时间(最大)962ms
响应时间(总计)2.70s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.39s
响应时间(最大)3.39s
响应时间(总计)3.39s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)814ms
响应时间(最大)814ms
响应时间(总计)814ms
|
| #50#50 |
Kimi K2.6medium
|
7.4… |
Moonshot AI |
$0.803
↓
…
|
54.03s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 2 超时: 2 无答案: 1
响应时间(平均)54.03s
响应时间(最大)215.85s
响应时间(总计)1026.57s
…
|
- 总测试数
- 20
- 错误测试数
- 8
- 尝试通过率
- 68.3%
- 输入令牌
- 28,584
- 输出令牌
- 102,208
- 推理令牌
- 229,120
- 响应时间(平均)
- 54.03s
- 响应时间(总计)
- 1026.57s
- 响应时间(最大)
- 215.85s
-
反AI技巧
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)11.59s
响应时间(最大)23.94s
响应时间(总计)46.37s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)118.23s
响应时间(最大)129.50s
响应时间(总计)236.47s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)40.96s
响应时间(最大)40.96s
响应时间(总计)40.96s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)20.38s
响应时间(最大)22.88s
响应时间(总计)40.76s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2
响应时间(平均)202.38s
响应时间(最大)215.85s
响应时间(总计)404.76s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.83s
响应时间(最大)17.83s
响应时间(总计)17.83s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.53s
响应时间(最大)19.15s
响应时间(总计)25.06s
-
谜题求解
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)25.06s
响应时间(最大)56.89s
响应时间(总计)75.19s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.92s
响应时间(最大)8.92s
响应时间(总计)8.92s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)130.27s
响应时间(最大)130.27s
响应时间(总计)130.27s
|
| #51#51 |
Gemini 3.1 Flash Litelow
|
7.4… |
Google |
$0.026
…
|
1.92s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8
响应时间(平均)1.92s
响应时间(最大)5.66s
响应时间(总计)38.45s
…
|
- 总测试数
- 20
- 错误测试数
- 8
- 尝试通过率
- 65.0%
- 输入令牌
- 33,889
- 输出令牌
- 2,726
- 推理令牌
- 8,951
- 响应时间(平均)
- 1.92s
- 响应时间(总计)
- 38.45s
- 响应时间(最大)
- 5.66s
-
反AI技巧
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.84s
响应时间(最大)3.08s
响应时间(总计)7.37s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.71s
响应时间(最大)1.97s
响应时间(总计)3.42s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.48s
响应时间(最大)4.48s
响应时间(总计)4.48s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.44s
响应时间(最大)1.51s
响应时间(总计)2.89s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.52s
响应时间(最大)1.63s
响应时间(总计)4.57s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.37s
响应时间(最大)1.37s
响应时间(总计)1.37s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.52s
响应时间(最大)1.68s
响应时间(总计)3.04s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.40s
响应时间(最大)1.41s
响应时间(总计)4.20s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.66s
响应时间(最大)5.66s
响应时间(总计)5.66s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.46s
响应时间(最大)1.46s
响应时间(总计)1.46s
|
| #52#52 |
GLM 5.1medium
|
7.4… |
Z.ai |
$0.279
↓
…
|
33.45s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 超时: 2 API 错误: 1 无答案: 1
响应时间(平均)33.45s
响应时间(最大)172.60s
响应时间(总计)635.63s
…
|
- 总测试数
- 20
- 错误测试数
- 8
- 尝试通过率
- 68.3%
- 输入令牌
- 30,397
- 输出令牌
- 11,511
- 推理令牌
- 71,979
- 响应时间(平均)
- 33.45s
- 响应时间(总计)
- 635.63s
- 响应时间(最大)
- 172.60s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.31s
响应时间(最大)14.20s
响应时间(总计)33.24s
-
编程
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 超时: 1
响应时间(平均)145.56s
响应时间(最大)172.60s
响应时间(总计)291.12s
-
综合
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)43.11s
响应时间(最大)43.11s
响应时间(总计)43.11s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.33s
响应时间(最大)9.40s
响应时间(总计)18.66s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)29.77s
响应时间(最大)32.22s
响应时间(总计)89.30s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)20.95s
响应时间(最大)20.95s
响应时间(总计)20.95s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.47s
响应时间(最大)10.16s
响应时间(总计)14.94s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)31.64s
响应时间(最大)46.04s
响应时间(总计)94.91s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)29.40s
响应时间(最大)29.40s
响应时间(总计)29.40s
|
| #53#53 |
GPT-5.3 Chatnone
|
7.4… |
OpenAI |
$0.402
…
|
6.13s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 2
响应时间(平均)6.13s
响应时间(最大)18.33s
响应时间(总计)122.61s
…
|
- 总测试数
- 20
- 错误测试数
- 8
- 尝试通过率
- 68.3%
- 输入令牌
- 31,590
- 输出令牌
- 24,757
- 推理令牌
- 0
- 响应时间(平均)
- 6.13s
- 响应时间(总计)
- 122.61s
- 响应时间(最大)
- 18.33s
-
反AI技巧
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)3.86s
响应时间(最大)7.35s
响应时间(总计)15.44s
-
编程
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.52s
响应时间(最大)11.72s
响应时间(总计)21.03s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.96s
响应时间(最大)11.96s
响应时间(总计)11.96s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.21s
响应时间(最大)2.52s
响应时间(总计)4.42s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)13.01s
响应时间(最大)18.33s
响应时间(总计)39.04s
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.99s
响应时间(最大)1.99s
响应时间(总计)1.99s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.51s
响应时间(最大)4.60s
响应时间(总计)7.01s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.99s
响应时间(最大)3.16s
响应时间(总计)8.97s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.36s
响应时间(最大)8.36s
响应时间(总计)8.36s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.38s
响应时间(最大)4.38s
响应时间(总计)4.38s
|
| #54#54 |
MiMo-V2.5medium
|
7.4… |
Xiaomi |
$0.052
↓
…
|
20.35s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 额外格式: 2 未遵循指令: 1 无答案: 1
响应时间(平均)20.35s
响应时间(最大)97.49s
响应时间(总计)406.94s
…
|
- 总测试数
- 20
- 错误测试数
- 8
- 尝试通过率
- 70.0%
- 输入令牌
- 39,201
- 输出令牌
- 2,806
- 推理令牌
- 161,888
- 响应时间(平均)
- 20.35s
- 响应时间(总计)
- 406.94s
- 响应时间(最大)
- 97.49s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.14s
响应时间(最大)12.41s
响应时间(总计)16.57s
-
编程
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)64.48s
响应时间(最大)97.49s
响应时间(总计)128.97s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)16.86s
响应时间(最大)16.86s
响应时间(总计)16.86s
-
数据解析与提取
: 2.7
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)6.33s
响应时间(最大)7.45s
响应时间(总计)12.67s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)34.53s
响应时间(最大)86.93s
响应时间(总计)103.59s
-
通用智能
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)5.37s
响应时间(最大)5.37s
响应时间(总计)5.37s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.80s
响应时间(最大)1.81s
响应时间(总计)3.60s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)20.25s
响应时间(最大)57.93s
响应时间(总计)60.76s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.29s
响应时间(最大)7.29s
响应时间(总计)7.29s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)51.29s
响应时间(最大)51.29s
响应时间(总计)51.29s
|
| #56#56 |
Step 3.7 Flashlow
|
7.4… |
Stepfun |
$0.336
…
|
16.06s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 无答案: 1
响应时间(平均)16.06s
响应时间(最大)124.75s
响应时间(总计)321.11s
…
|
- 总测试数
- 20
- 错误测试数
- 8
- 尝试通过率
- 68.3%
- 输入令牌
- 37,458
- 输出令牌
- 285,209
- 推理令牌
- 0
- 响应时间(平均)
- 16.06s
- 响应时间(总计)
- 321.11s
- 响应时间(最大)
- 124.75s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.02s
响应时间(最大)12.52s
响应时间(总计)16.10s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.43s
响应时间(最大)12.69s
响应时间(总计)18.86s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.98s
响应时间(最大)7.98s
响应时间(总计)7.98s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.29s
响应时间(最大)3.15s
响应时间(总计)4.58s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)43.31s
响应时间(最大)72.27s
响应时间(总计)129.92s
-
通用智能
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.00s
响应时间(最大)7.00s
响应时间(总计)7.00s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.58s
响应时间(最大)1.80s
响应时间(总计)3.16s
-
谜题求解
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.84s
响应时间(最大)3.42s
响应时间(总计)5.52s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.25s
响应时间(最大)3.25s
响应时间(总计)3.25s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)124.75s
响应时间(最大)124.75s
响应时间(总计)124.75s
|
| #58#58 |
Qwen3.6 35B A3Bmedium
|
7.3… |
Qwen |
$0.130
↑
…
|
17.26s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 API 错误: 2 未遵循指令: 1 无答案: 1
响应时间(平均)17.26s
响应时间(最大)86.11s
响应时间(总计)310.65s
…
|
- 总测试数
- 20
- 错误测试数
- 8
- 尝试通过率
- 61.7%
- 输入令牌
- 13,550
- 输出令牌
- 18,304
- 推理令牌
- 115,531
- 响应时间(平均)
- 17.26s
- 响应时间(总计)
- 310.65s
- 响应时间(最大)
- 86.11s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.02s
响应时间(最大)8.79s
响应时间(总计)24.07s
-
编程
: 6.6
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)59.35s
响应时间(最大)86.11s
响应时间(总计)118.69s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.99s
响应时间(最大)13.75s
响应时间(总计)25.99s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)22.50s
响应时间(最大)45.02s
响应时间(总计)67.51s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)8.66s
响应时间(最大)8.66s
响应时间(总计)8.66s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.50s
响应时间(最大)10.22s
响应时间(总计)15.00s
-
谜题求解
: 8.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.95s
响应时间(最大)8.42s
响应时间(总计)17.84s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)32.90s
响应时间(最大)32.90s
响应时间(总计)32.90s
|
| #59#59 |
GPT-5.2medium
|
7.3… |
OpenAI |
$0.492
…
|
16.50s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 3 答案错误: 3 无答案: 1 超时: 1
响应时间(平均)16.50s
响应时间(最大)77.80s
响应时间(总计)214.45s
…
|
- 总测试数
- 20
- 错误测试数
- 8
- 尝试通过率
- 70.0%
- 输入令牌
- 31,348
- 输出令牌
- 2,880
- 推理令牌
- 28,289
- 响应时间(平均)
- 16.50s
- 响应时间(总计)
- 214.45s
- 响应时间(最大)
- 77.80s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)7.81s
响应时间(最大)14.34s
响应时间(总计)15.62s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.15s
响应时间(最大)31.19s
响应时间(总计)46.30s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.06s
响应时间(最大)14.06s
响应时间(总计)14.06s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.15s
响应时间(最大)3.15s
响应时间(总计)3.15s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)77.80s
响应时间(最大)77.80s
响应时间(总计)77.80s
-
通用智能
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.32s
响应时间(最大)4.32s
响应时间(总计)4.32s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.12s
响应时间(最大)3.12s
响应时间(总计)3.12s
-
谜题求解
: 7.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)5.80s
响应时间(最大)6.45s
响应时间(总计)11.61s
-
工具调用
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)10.30s
响应时间(最大)10.30s
响应时间(总计)10.30s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)28.18s
响应时间(最大)28.18s
响应时间(总计)28.18s
|
| #62#62 |
Claude Opus 4.8none
|
7.3… |
Anthropic |
$0.519
…
|
3.51s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 3 答案错误: 3 未遵循指令: 1 无答案: 1
响应时间(平均)3.51s
响应时间(最大)17.73s
响应时间(总计)70.19s
…
|
- 总测试数
- 20
- 错误测试数
- 8
- 尝试通过率
- 65.0%
- 输入令牌
- 63,282
- 输出令牌
- 8,098
- 推理令牌
- 0
- 响应时间(平均)
- 3.51s
- 响应时间(总计)
- 70.19s
- 响应时间(最大)
- 17.73s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2
响应时间(平均)3.40s
响应时间(最大)6.36s
响应时间(总计)13.58s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.59s
响应时间(最大)4.34s
响应时间(总计)7.17s
-
综合
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.73s
响应时间(最大)17.73s
响应时间(总计)17.73s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.77s
响应时间(最大)1.93s
响应时间(总计)3.53s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.66s
响应时间(最大)2.16s
响应时间(总计)4.99s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.48s
响应时间(最大)3.48s
响应时间(总计)3.48s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.37s
响应时间(最大)1.40s
响应时间(总计)2.73s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)2.74s
响应时间(最大)3.46s
响应时间(总计)8.22s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.35s
响应时间(最大)5.35s
响应时间(总计)5.35s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)3.41s
响应时间(最大)3.41s
响应时间(总计)3.41s
|
| #64#64 |
Claude Opus 4.6medium
|
7.2… |
Anthropic |
$1.896
…
|
25.45s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 4 答案错误: 3 未遵循指令: 1
响应时间(平均)25.45s
响应时间(最大)83.40s
响应时间(总计)330.91s
…
|
- 总测试数
- 20
- 错误测试数
- 8
- 尝试通过率
- 63.3%
- 输入令牌
- 50,062
- 输出令牌
- 42,254
- 推理令牌
- 23,554
- 响应时间(平均)
- 25.45s
- 响应时间(总计)
- 330.91s
- 响应时间(最大)
- 83.40s
-
反AI技巧
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2
响应时间(平均)7.45s
响应时间(最大)11.88s
响应时间(总计)14.90s
-
编程
: 7.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)29.37s
响应时间(最大)35.63s
响应时间(总计)58.74s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)76.66s
响应时间(最大)76.66s
响应时间(总计)76.66s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.37s
响应时间(最大)7.37s
响应时间(总计)7.37s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 答案错误: 1
响应时间(平均)83.40s
响应时间(最大)83.40s
响应时间(总计)83.40s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.04s
响应时间(最大)5.04s
响应时间(总计)5.04s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.43s
响应时间(最大)2.43s
响应时间(总计)2.43s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.71s
响应时间(最大)4.75s
响应时间(总计)9.41s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.73s
响应时间(最大)9.73s
响应时间(总计)9.73s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)63.24s
响应时间(最大)63.24s
响应时间(总计)63.24s
|
| #20#20 |
Seed-2.0-Litemedium
|
8.1… |
Bytedance Seed |
$0.152
…
|
36.67s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 2
响应时间(平均)36.67s
响应时间(最大)168.71s
响应时间(总计)733.46s
…
|
- 总测试数
- 20
- 错误测试数
- 7
- 尝试通过率
- 75.0%
- 输入令牌
- 43,785
- 输出令牌
- 3,224
- 推理令牌
- 67,040
- 响应时间(平均)
- 36.67s
- 响应时间(总计)
- 733.46s
- 响应时间(最大)
- 168.71s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.99s
响应时间(最大)48.33s
响应时间(总计)71.98s
-
编程
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)107.65s
响应时间(最大)140.81s
响应时间(总计)215.30s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)37.67s
响应时间(最大)37.67s
响应时间(总计)37.67s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.07s
响应时间(最大)12.19s
响应时间(总计)18.14s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)88.74s
响应时间(最大)168.71s
响应时间(总计)266.21s
-
通用智能
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)18.25s
响应时间(最大)18.25s
响应时间(总计)18.25s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.26s
响应时间(最大)9.02s
响应时间(总计)14.52s
-
谜题求解
: 9.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)10.23s
响应时间(最大)11.54s
响应时间(总计)30.68s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.38s
响应时间(最大)12.38s
响应时间(总计)12.38s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)48.32s
响应时间(最大)48.32s
响应时间(总计)48.32s
|