| #28#28 |
Step 3.7 Flashmedium
|
7.9… |
Stepfun |
$0.347
…
|
18.32s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 1 无答案: 1
响应时间(平均)18.32s
响应时间(最大)113.98s
响应时间(总计)366.45s
…
|
- 总测试数
- 20
- 错误测试数
- 7
- 尝试通过率
- 71.7%
- 输入令牌
- 37,338
- 输出令牌
- 294,481
- 推理令牌
- 0
- 响应时间(平均)
- 18.32s
- 响应时间(总计)
- 366.45s
- 响应时间(最大)
- 113.98s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)9.65s
响应时间(最大)35.08s
响应时间(总计)38.62s
-
编程
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.64s
响应时间(最大)12.69s
响应时间(总计)21.28s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.06s
响应时间(最大)9.06s
响应时间(总计)9.06s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.75s
响应时间(最大)3.35s
响应时间(总计)5.49s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)48.27s
响应时间(最大)97.10s
响应时间(总计)144.81s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.85s
响应时间(最大)6.85s
响应时间(总计)6.85s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.83s
响应时间(最大)2.21s
响应时间(总计)3.65s
-
谜题求解
: 5.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)6.19s
响应时间(最大)12.51s
响应时间(总计)18.56s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.16s
响应时间(最大)4.16s
响应时间(总计)4.16s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)113.98s
响应时间(最大)113.98s
响应时间(总计)113.98s
|
| #58#58 |
Qwen3.6 35B A3Bmedium
|
7.3… |
Qwen |
$0.130
↑
…
|
17.26s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 API 错误: 2 未遵循指令: 1 无答案: 1
响应时间(平均)17.26s
响应时间(最大)86.11s
响应时间(总计)310.65s
…
|
- 总测试数
- 20
- 错误测试数
- 8
- 尝试通过率
- 61.7%
- 输入令牌
- 13,550
- 输出令牌
- 18,304
- 推理令牌
- 115,531
- 响应时间(平均)
- 17.26s
- 响应时间(总计)
- 310.65s
- 响应时间(最大)
- 86.11s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.02s
响应时间(最大)8.79s
响应时间(总计)24.07s
-
编程
: 6.6
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)59.35s
响应时间(最大)86.11s
响应时间(总计)118.69s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.99s
响应时间(最大)13.75s
响应时间(总计)25.99s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)22.50s
响应时间(最大)45.02s
响应时间(总计)67.51s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)8.66s
响应时间(最大)8.66s
响应时间(总计)8.66s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.50s
响应时间(最大)10.22s
响应时间(总计)15.00s
-
谜题求解
: 8.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.95s
响应时间(最大)8.42s
响应时间(总计)17.84s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)32.90s
响应时间(最大)32.90s
响应时间(总计)32.90s
|
| #152#152 |
Nemotron 3 Nano Omni 30b A3b Reasoningmedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.6… |
NVIDIA |
$0.000
…
|
17.13s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 API 错误: 6 未遵循指令: 1 无答案: 1
响应时间(平均)17.13s
响应时间(最大)147.45s
响应时间(总计)222.66s
…
|
- 总测试数
- 19
- 错误测试数
- 15
- 尝试通过率
- 31.6%
- 输入令牌
- 11,661
- 输出令牌
- 48,491
- 推理令牌
- 180,695
- 响应时间(平均)
- 17.13s
- 响应时间(总计)
- 222.66s
- 响应时间(最大)
- 147.45s
-
反AI技巧
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)1.20s
响应时间(最大)1.48s
响应时间(总计)3.59s
-
编程
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)38.09s
响应时间(最大)38.09s
响应时间(总计)38.09s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.72s
响应时间(最大)3.88s
响应时间(总计)5.43s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)56.67s
响应时间(最大)147.45s
响应时间(总计)170.02s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.37s
响应时间(最大)1.56s
响应时间(总计)2.74s
-
谜题求解
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)1.40s
响应时间(最大)1.57s
响应时间(总计)2.79s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #1🥇 #1 |
Gemini 3 Flash Previewmedium
|
9.8… |
Google |
$0.567
…
|
16.50s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)16.50s
响应时间(最大)117.26s
响应时间(总计)330.06s
…
|
- 总测试数
- 20
- 错误测试数
- 1
- 尝试通过率
- 98.3%
- 输入令牌
- 34,014
- 输出令牌
- 2,000
- 推理令牌
- 181,033
- 响应时间(平均)
- 16.50s
- 响应时间(总计)
- 330.06s
- 响应时间(最大)
- 117.26s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.88s
响应时间(最大)5.73s
响应时间(总计)15.53s
-
编程
: 7.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)95.96s
响应时间(最大)117.26s
响应时间(总计)191.92s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)22.42s
响应时间(最大)22.42s
响应时间(总计)22.42s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.43s
响应时间(最大)6.18s
响应时间(总计)10.86s
-
领域专项
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.27s
响应时间(最大)34.09s
响应时间(总计)45.80s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.19s
响应时间(最大)5.19s
响应时间(总计)5.19s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.04s
响应时间(最大)4.70s
响应时间(总计)8.08s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.05s
响应时间(最大)5.64s
响应时间(总计)12.15s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.60s
响应时间(最大)12.60s
响应时间(总计)12.60s
-
常识问答
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.50s
响应时间(最大)5.50s
响应时间(总计)5.50s
|
| #59#59 |
GPT-5.2medium
|
7.3… |
OpenAI |
$0.492
…
|
16.50s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 3 答案错误: 3 无答案: 1 超时: 1
响应时间(平均)16.50s
响应时间(最大)77.80s
响应时间(总计)214.45s
…
|
- 总测试数
- 20
- 错误测试数
- 8
- 尝试通过率
- 70.0%
- 输入令牌
- 31,348
- 输出令牌
- 2,880
- 推理令牌
- 28,289
- 响应时间(平均)
- 16.50s
- 响应时间(总计)
- 214.45s
- 响应时间(最大)
- 77.80s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)7.81s
响应时间(最大)14.34s
响应时间(总计)15.62s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.15s
响应时间(最大)31.19s
响应时间(总计)46.30s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.06s
响应时间(最大)14.06s
响应时间(总计)14.06s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.15s
响应时间(最大)3.15s
响应时间(总计)3.15s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)77.80s
响应时间(最大)77.80s
响应时间(总计)77.80s
-
通用智能
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.32s
响应时间(最大)4.32s
响应时间(总计)4.32s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.12s
响应时间(最大)3.12s
响应时间(总计)3.12s
-
谜题求解
: 7.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)5.80s
响应时间(最大)6.45s
响应时间(总计)11.61s
-
工具调用
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)10.30s
响应时间(最大)10.30s
响应时间(总计)10.30s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)28.18s
响应时间(最大)28.18s
响应时间(总计)28.18s
|
| #25#25 |
Hy3 previewmedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
7.9… |
Tencent |
$0.018
…
|
16.28s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 API 错误: 2 未遵循指令: 1
响应时间(平均)16.28s
响应时间(最大)46.04s
响应时间(总计)293.12s
…
|
- 总测试数
- 20
- 错误测试数
- 6
- 尝试通过率
- 70.0%
- 输入令牌
- 27,030
- 输出令牌
- 73,544
- 推理令牌
- 0
- 响应时间(平均)
- 16.28s
- 响应时间(总计)
- 293.12s
- 响应时间(最大)
- 46.04s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.59s
响应时间(最大)10.20s
响应时间(总计)26.37s
-
编程
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)31.37s
响应时间(最大)31.37s
响应时间(总计)31.37s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)46.04s
响应时间(最大)46.04s
响应时间(总计)46.04s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)5.25s
响应时间(最大)5.25s
响应时间(总计)5.25s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)22.30s
响应时间(最大)30.51s
响应时间(总计)66.90s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)16.84s
响应时间(最大)16.84s
响应时间(总计)16.84s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.16s
响应时间(最大)7.72s
响应时间(总计)12.31s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)11.06s
响应时间(最大)14.35s
响应时间(总计)33.17s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.02s
响应时间(最大)15.02s
响应时间(总计)15.02s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)39.86s
响应时间(最大)39.86s
响应时间(总计)39.86s
|
| #56#56 |
Step 3.7 Flashlow
|
7.4… |
Stepfun |
$0.336
…
|
16.06s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 无答案: 1
响应时间(平均)16.06s
响应时间(最大)124.75s
响应时间(总计)321.11s
…
|
- 总测试数
- 20
- 错误测试数
- 8
- 尝试通过率
- 68.3%
- 输入令牌
- 37,458
- 输出令牌
- 285,209
- 推理令牌
- 0
- 响应时间(平均)
- 16.06s
- 响应时间(总计)
- 321.11s
- 响应时间(最大)
- 124.75s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.02s
响应时间(最大)12.52s
响应时间(总计)16.10s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.43s
响应时间(最大)12.69s
响应时间(总计)18.86s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.98s
响应时间(最大)7.98s
响应时间(总计)7.98s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.29s
响应时间(最大)3.15s
响应时间(总计)4.58s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)43.31s
响应时间(最大)72.27s
响应时间(总计)129.92s
-
通用智能
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.00s
响应时间(最大)7.00s
响应时间(总计)7.00s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.58s
响应时间(最大)1.80s
响应时间(总计)3.16s
-
谜题求解
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.84s
响应时间(最大)3.42s
响应时间(总计)5.52s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.25s
响应时间(最大)3.25s
响应时间(总计)3.25s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)124.75s
响应时间(最大)124.75s
响应时间(总计)124.75s
|
| #17#17 |
GPT-5.3-Codexmedium
|
8.3… |
OpenAI |
$0.685
…
|
15.95s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 2
响应时间(平均)15.95s
响应时间(最大)100.93s
响应时间(总计)319.08s
…
|
- 总测试数
- 20
- 错误测试数
- 6
- 尝试通过率
- 81.7%
- 输入令牌
- 31,680
- 输出令牌
- 2,336
- 推理令牌
- 42,565
- 响应时间(平均)
- 15.95s
- 响应时间(总计)
- 319.08s
- 响应时间(最大)
- 100.93s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.16s
响应时间(最大)6.68s
响应时间(总计)16.63s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)18.45s
响应时间(最大)27.96s
响应时间(总计)36.91s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)19.56s
响应时间(最大)19.56s
响应时间(总计)19.56s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.07s
响应时间(最大)3.59s
响应时间(总计)6.15s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)64.31s
响应时间(最大)100.93s
响应时间(总计)192.94s
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.87s
响应时间(最大)4.87s
响应时间(总计)4.87s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.04s
响应时间(最大)3.44s
响应时间(总计)6.07s
-
谜题求解
: 9.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)5.05s
响应时间(最大)8.73s
响应时间(总计)15.15s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.37s
响应时间(最大)6.37s
响应时间(总计)6.37s
-
常识问答
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)14.43s
响应时间(最大)14.43s
响应时间(总计)14.43s
|
| #47#47 |
Claude Sonnet 4.6medium
|
7.6… |
Anthropic |
$1.330
…
|
15.81s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 3 答案错误: 3 超时: 1
响应时间(平均)15.81s
响应时间(最大)46.35s
响应时间(总计)189.71s
…
|
- 总测试数
- 20
- 错误测试数
- 7
- 尝试通过率
- 66.7%
- 输入令牌
- 45,947
- 输出令牌
- 49,891
- 推理令牌
- 29,565
- 响应时间(平均)
- 15.81s
- 响应时间(总计)
- 189.71s
- 响应时间(最大)
- 46.35s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)2.98s
响应时间(最大)4.95s
响应时间(总计)5.97s
-
编程
: 7.2
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)33.87s
响应时间(最大)35.76s
响应时间(总计)67.74s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)46.35s
响应时间(最大)46.35s
响应时间(总计)46.35s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.90s
响应时间(最大)13.90s
响应时间(总计)13.90s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 超时: 1 答案错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.94s
响应时间(最大)4.94s
响应时间(总计)4.94s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.61s
响应时间(最大)2.61s
响应时间(总计)2.61s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.31s
响应时间(最大)6.24s
响应时间(总计)10.62s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.48s
响应时间(最大)7.48s
响应时间(总计)7.48s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)30.09s
响应时间(最大)30.09s
响应时间(总计)30.09s
|
| #37#37 |
Gemini 2.5 Flashmedium
|
7.7… |
Google |
$0.358
…
|
15.57s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 1
响应时间(平均)15.57s
响应时间(最大)95.48s
响应时间(总计)311.47s
…
|
- 总测试数
- 20
- 错误测试数
- 7
- 尝试通过率
- 68.3%
- 输入令牌
- 31,473
- 输出令牌
- 1,924
- 推理令牌
- 137,255
- 响应时间(平均)
- 15.57s
- 响应时间(总计)
- 311.47s
- 响应时间(最大)
- 95.48s
-
反AI技巧
: 8.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.30s
响应时间(最大)15.56s
响应时间(总计)25.21s
-
编程
: 6.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)54.56s
响应时间(最大)92.88s
响应时间(总计)109.12s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)28.44s
响应时间(最大)28.44s
响应时间(总计)28.44s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.06s
响应时间(最大)5.06s
响应时间(总计)8.11s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)37.34s
响应时间(最大)95.48s
响应时间(总计)112.01s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.86s
响应时间(最大)4.86s
响应时间(总计)4.86s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.62s
响应时间(最大)2.78s
响应时间(总计)5.24s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.18s
响应时间(最大)4.05s
响应时间(总计)9.54s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.20s
响应时间(最大)6.20s
响应时间(总计)6.20s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.76s
响应时间(最大)2.76s
响应时间(总计)2.76s
|
| #95#95 |
Qwen3.6 Plus Previewmedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.3… |
Qwen |
$0.000
…
|
15.25s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 8 答案错误: 2
响应时间(平均)15.25s
响应时间(最大)43.55s
响应时间(总计)182.96s
…
|
- 总测试数
- 19
- 错误测试数
- 10
- 尝试通过率
- 47.4%
- 输入令牌
- 32,639
- 输出令牌
- 1,153
- 推理令牌
- 62,197
- 响应时间(平均)
- 15.25s
- 响应时间(总计)
- 182.96s
- 响应时间(最大)
- 43.55s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)11.69s
响应时间(最大)19.37s
响应时间(总计)35.08s
-
编程
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)34.95s
响应时间(最大)34.95s
响应时间(总计)34.95s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.95s
响应时间(最大)15.40s
响应时间(总计)29.90s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)22.08s
响应时间(最大)43.55s
响应时间(总计)66.23s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)3.40s
响应时间(最大)3.40s
响应时间(总计)3.40s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)7.52s
响应时间(最大)7.52s
响应时间(总计)7.52s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.87s
响应时间(最大)5.87s
响应时间(总计)5.87s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #91#91 |
Laguna M.1medium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.4… |
Poolside |
$0.000
…
|
14.73s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 4 答案错误: 4 未遵循指令: 1 无答案: 1
响应时间(平均)14.73s
响应时间(最大)53.14s
响应时间(总计)220.93s
…
|
- 总测试数
- 19
- 错误测试数
- 10
- 尝试通过率
- 52.6%
- 输入令牌
- 44,969
- 输出令牌
- 58,087
- 推理令牌
- 0
- 响应时间(平均)
- 14.73s
- 响应时间(总计)
- 220.93s
- 响应时间(最大)
- 53.14s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)4.87s
响应时间(最大)6.30s
响应时间(总计)14.62s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)35.61s
响应时间(最大)35.61s
响应时间(总计)35.61s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)53.14s
响应时间(最大)53.14s
响应时间(总计)53.14s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.93s
响应时间(最大)5.03s
响应时间(总计)9.86s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)24.14s
响应时间(最大)45.83s
响应时间(总计)72.43s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.30s
响应时间(最大)6.00s
响应时间(总计)8.59s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)10.19s
响应时间(最大)14.92s
响应时间(总计)20.37s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.31s
响应时间(最大)6.31s
响应时间(总计)6.31s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #130#130 |
DeepSeek V3.2none
|
5.4… |
DeepSeek |
$0.017
↓
…
|
14.43s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 API 错误: 4 额外格式: 2 未遵循指令: 1 无效工具调用: 1
响应时间(平均)14.43s
响应时间(最大)115.89s
响应时间(总计)288.55s
…
|
- 总测试数
- 20
- 错误测试数
- 14
- 尝试通过率
- 41.7%
- 输入令牌
- 53,408
- 输出令牌
- 11,159
- 推理令牌
- 0
- 响应时间(平均)
- 14.43s
- 响应时间(总计)
- 288.55s
- 响应时间(最大)
- 115.89s
-
反AI技巧
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 API 错误: 1 答案错误: 1
响应时间(平均)9.35s
响应时间(最大)16.77s
响应时间(总计)37.40s
-
编程
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)20.87s
响应时间(最大)34.11s
响应时间(总计)41.73s
-
综合
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)115.89s
响应时间(最大)115.89s
响应时间(总计)115.89s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.42s
响应时间(最大)16.20s
响应时间(总计)18.84s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)4.17s
响应时间(最大)9.09s
响应时间(总计)12.51s
-
通用智能
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)9.32s
响应时间(最大)9.32s
响应时间(总计)9.32s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.52s
响应时间(最大)1.99s
响应时间(总计)3.04s
-
谜题求解
: 7.6
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)6.91s
响应时间(最大)10.09s
响应时间(总计)20.74s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.85s
响应时间(最大)11.85s
响应时间(总计)11.85s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.23s
响应时间(最大)17.23s
响应时间(总计)17.23s
|
| #133#133 |
Kimi K2.5none
|
5.3… |
Moonshot AI |
$0.027
↑
…
|
14.06s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14
响应时间(平均)14.06s
响应时间(最大)42.13s
响应时间(总计)182.72s
…
|
- 总测试数
- 20
- 错误测试数
- 14
- 尝试通过率
- 36.7%
- 输入令牌
- 33,436
- 输出令牌
- 6,653
- 推理令牌
- 0
- 响应时间(平均)
- 14.06s
- 响应时间(总计)
- 182.72s
- 响应时间(最大)
- 42.13s
-
反AI技巧
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)6.24s
响应时间(最大)11.38s
响应时间(总计)12.48s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)35.97s
响应时间(最大)38.78s
响应时间(总计)71.93s
-
综合
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)19.16s
响应时间(最大)19.16s
响应时间(总计)19.16s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)42.13s
响应时间(最大)42.13s
响应时间(总计)42.13s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.38s
响应时间(最大)4.38s
响应时间(总计)4.38s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.00s
响应时间(最大)4.00s
响应时间(总计)4.00s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.67s
响应时间(最大)2.67s
响应时间(总计)2.67s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)4.04s
响应时间(最大)7.81s
响应时间(总计)8.08s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.99s
响应时间(最大)13.99s
响应时间(总计)13.99s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.90s
响应时间(最大)3.90s
响应时间(总计)3.90s
|
| #5#5 |
Qwen3.7 Maxmedium
|
9.0… |
Qwen |
$0.471
↓
…
|
13.83s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)13.83s
响应时间(最大)33.37s
响应时间(总计)276.53s
…
|
- 总测试数
- 20
- 错误测试数
- 3
- 尝试通过率
- 88.3%
- 输入令牌
- 39,525
- 输出令牌
- 2,109
- 推理令牌
- 110,285
- 响应时间(平均)
- 13.83s
- 响应时间(总计)
- 276.53s
- 响应时间(最大)
- 33.37s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.36s
响应时间(最大)8.75s
响应时间(总计)25.44s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)22.98s
响应时间(最大)32.31s
响应时间(总计)45.96s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)19.60s
响应时间(最大)19.60s
响应时间(总计)19.60s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.80s
响应时间(最大)10.25s
响应时间(总计)17.60s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)24.94s
响应时间(最大)29.00s
响应时间(总计)74.81s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.70s
响应时间(最大)11.70s
响应时间(总计)11.70s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.46s
响应时间(最大)10.17s
响应时间(总计)14.92s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.84s
响应时间(最大)11.71s
响应时间(总计)26.51s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.63s
响应时间(最大)6.63s
响应时间(总计)6.63s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)33.37s
响应时间(最大)33.37s
响应时间(总计)33.37s
|
| #123#123 |
Kimi K2.6none
|
5.6… |
Moonshot AI |
$0.077
↓
…
|
13.82s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 3
响应时间(平均)13.82s
响应时间(最大)238.89s
响应时间(总计)276.39s
…
|
- 总测试数
- 20
- 错误测试数
- 13
- 尝试通过率
- 38.3%
- 输入令牌
- 30,318
- 输出令牌
- 16,405
- 推理令牌
- 0
- 响应时间(平均)
- 13.82s
- 响应时间(总计)
- 276.39s
- 响应时间(最大)
- 238.89s
-
反AI技巧
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.39s
响应时间(最大)2.96s
响应时间(总计)5.56s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)122.77s
响应时间(最大)238.89s
响应时间(总计)245.54s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.38s
响应时间(最大)3.38s
响应时间(总计)3.38s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.32s
响应时间(最大)1.39s
响应时间(总计)2.64s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.48s
响应时间(最大)1.85s
响应时间(总计)4.45s
-
通用智能
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.55s
响应时间(最大)1.55s
响应时间(总计)1.55s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.64s
响应时间(最大)1.80s
响应时间(总计)3.28s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.40s
响应时间(最大)1.81s
响应时间(总计)4.19s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.46s
响应时间(最大)4.46s
响应时间(总计)4.46s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.36s
响应时间(最大)1.36s
响应时间(总计)1.36s
|
| #154#154 |
Hy3 previewnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.5… |
Tencent |
$0.003
…
|
12.92s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 未遵循指令: 4 API 错误: 3 额外格式: 1
响应时间(平均)12.92s
响应时间(最大)35.84s
响应时间(总计)232.64s
…
|
- 总测试数
- 20
- 错误测试数
- 16
- 尝试通过率
- 25.0%
- 输入令牌
- 27,172
- 输出令牌
- 2,661
- 推理令牌
- 0
- 响应时间(平均)
- 12.92s
- 响应时间(总计)
- 232.64s
- 响应时间(最大)
- 35.84s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2 答案错误: 1
响应时间(平均)11.10s
响应时间(最大)26.88s
响应时间(总计)44.41s
-
编程
: 2.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)4.56s
响应时间(最大)4.56s
响应时间(总计)4.56s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)35.84s
响应时间(最大)35.84s
响应时间(总计)35.84s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)2.85s
响应时间(最大)2.85s
响应时间(总计)2.85s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)17.61s
响应时间(最大)25.68s
响应时间(总计)52.82s
-
通用智能
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)16.07s
响应时间(最大)16.07s
响应时间(总计)16.07s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)12.98s
响应时间(最大)23.51s
响应时间(总计)25.95s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)4.56s
响应时间(最大)7.35s
响应时间(总计)13.67s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)33.76s
响应时间(最大)33.76s
响应时间(总计)33.76s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.71s
响应时间(最大)2.71s
响应时间(总计)2.71s
|
| #109#109 |
DeepSeek V4 Pronone
|
5.8… |
DeepSeek |
$0.024
↓
…
|
12.91s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 2 API 错误: 1 额外格式: 1
响应时间(平均)12.91s
响应时间(最大)58.65s
响应时间(总计)258.27s
…
|
- 总测试数
- 20
- 错误测试数
- 13
- 尝试通过率
- 45.0%
- 输入令牌
- 42,256
- 输出令牌
- 5,345
- 推理令牌
- 0
- 响应时间(平均)
- 12.91s
- 响应时间(总计)
- 258.27s
- 响应时间(最大)
- 58.65s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)14.02s
响应时间(最大)38.83s
响应时间(总计)56.07s
-
编程
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)8.27s
响应时间(最大)14.69s
响应时间(总计)16.54s
-
综合
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)25.49s
响应时间(最大)25.49s
响应时间(总计)25.49s
-
数据解析与提取
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)30.54s
响应时间(最大)58.65s
响应时间(总计)61.08s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.17s
响应时间(最大)6.59s
响应时间(总计)9.52s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.75s
响应时间(最大)3.75s
响应时间(总计)3.75s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)8.23s
响应时间(最大)13.43s
响应时间(总计)16.45s
-
谜题求解
: 7.6
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)15.95s
响应时间(最大)27.12s
响应时间(总计)47.86s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.92s
响应时间(最大)5.92s
响应时间(总计)5.92s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)15.59s
响应时间(最大)15.59s
响应时间(总计)15.59s
|
| #65#65 |
GPT-5.4 Nanomedium
|
7.2… |
OpenAI |
$0.099
…
|
11.79s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 未遵循指令: 2
响应时间(平均)11.79s
响应时间(最大)94.06s
响应时间(总计)235.81s
…
|
- 总测试数
- 20
- 错误测试数
- 9
- 尝试通过率
- 63.3%
- 输入令牌
- 32,815
- 输出令牌
- 2,993
- 推理令牌
- 70,928
- 响应时间(平均)
- 11.79s
- 响应时间(总计)
- 235.81s
- 响应时间(最大)
- 94.06s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.52s
响应时间(最大)7.74s
响应时间(总计)18.10s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)21.10s
响应时间(最大)28.80s
响应时间(总计)42.21s
-
综合
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)24.13s
响应时间(最大)24.13s
响应时间(总计)24.13s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.54s
响应时间(最大)3.33s
响应时间(总计)5.08s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)38.18s
响应时间(最大)94.06s
响应时间(总计)114.53s
-
通用智能
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.15s
响应时间(最大)4.15s
响应时间(总计)4.15s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.88s
响应时间(最大)2.61s
响应时间(总计)3.75s
-
谜题求解
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)3.79s
响应时间(最大)4.02s
响应时间(总计)11.36s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.71s
响应时间(最大)7.71s
响应时间(总计)7.71s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.81s
响应时间(最大)4.81s
响应时间(总计)4.81s
|
| #107#107 |
Owl Alphamedium
|
5.8… |
Openrouter |
$0.000
…
|
11.64s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 2 API 错误: 1
响应时间(平均)11.64s
响应时间(最大)58.63s
响应时间(总计)232.83s
…
|
- 总测试数
- 20
- 错误测试数
- 12
- 尝试通过率
- 41.7%
- 输入令牌
- 40,601
- 输出令牌
- 2,965
- 推理令牌
- 0
- 响应时间(平均)
- 11.64s
- 响应时间(总计)
- 232.83s
- 响应时间(最大)
- 58.63s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)3.97s
响应时间(最大)7.48s
响应时间(总计)15.89s
-
编程
: 6.6
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)19.08s
响应时间(最大)30.81s
响应时间(总计)38.16s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.01s
响应时间(最大)10.01s
响应时间(总计)10.01s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.64s
响应时间(最大)29.16s
响应时间(总计)43.28s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)8.58s
响应时间(最大)9.48s
响应时间(总计)25.74s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)58.63s
响应时间(最大)58.63s
响应时间(总计)58.63s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.15s
响应时间(最大)15.94s
响应时间(总计)20.30s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)3.40s
响应时间(最大)4.60s
响应时间(总计)10.19s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.26s
响应时间(最大)8.26s
响应时间(总计)8.26s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.38s
响应时间(最大)2.38s
响应时间(总计)2.38s
|
| #78#78 |
Hunter Alphamedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.7… |
OpenRouter |
$0.000
…
|
10.33s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 2 超时: 2 API 错误: 1 额外格式: 1
响应时间(平均)10.33s
响应时间(最大)30.53s
响应时间(总计)175.58s
…
|
- 总测试数
- 18
- 错误测试数
- 10
- 尝试通过率
- 64.8%
- 输入令牌
- 28,927
- 输出令牌
- 4,682
- 推理令牌
- 17,969
- 响应时间(平均)
- 10.33s
- 响应时间(总计)
- 175.58s
- 响应时间(最大)
- 30.53s
-
反AI技巧
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.75s
响应时间(最大)7.62s
响应时间(总计)19.00s
-
编程
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)30.53s
响应时间(最大)30.53s
响应时间(总计)30.53s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.16s
响应时间(最大)26.55s
响应时间(总计)46.33s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 超时: 1 答案错误: 1
响应时间(平均)10.52s
响应时间(最大)18.68s
响应时间(总计)31.56s
-
通用智能
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)6.44s
响应时间(最大)6.44s
响应时间(总计)6.44s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.18s
响应时间(最大)4.46s
响应时间(总计)8.36s
-
谜题求解
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)5.35s
响应时间(最大)6.20s
响应时间(总计)16.06s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.33s
响应时间(最大)17.33s
响应时间(总计)17.33s
|
| #14#14 |
Grok 4.20 Betamedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
8.5… |
X AI |
$0.750
↑
…
|
9.75s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)9.75s
响应时间(最大)31.36s
响应时间(总计)175.48s
…
|
- 总测试数
- 18
- 错误测试数
- 4
- 尝试通过率
- 81.5%
- 输入令牌
- 35,955
- 输出令牌
- 1,647
- 推理令牌
- 91,565
- 响应时间(平均)
- 9.75s
- 响应时间(总计)
- 175.48s
- 响应时间(最大)
- 31.36s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.16s
响应时间(最大)3.44s
响应时间(总计)12.65s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)31.36s
响应时间(最大)31.36s
响应时间(总计)31.36s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)20.93s
响应时间(最大)20.93s
响应时间(总计)20.93s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.01s
响应时间(最大)4.27s
响应时间(总计)8.02s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)21.33s
响应时间(最大)24.21s
响应时间(总计)64.00s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.78s
响应时间(最大)5.78s
响应时间(总计)5.78s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.89s
响应时间(最大)5.89s
响应时间(总计)9.78s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.52s
响应时间(最大)4.53s
响应时间(总计)10.57s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)12.39s
响应时间(最大)12.39s
响应时间(总计)12.39s
|
| #86#86 |
Grok 4.20 Multi Agent Betamedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.6… |
X AI |
$5.599
↑
…
|
9.69s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 API 错误: 2 额外格式: 2 未遵循指令: 2
响应时间(平均)9.69s
响应时间(最大)35.28s
响应时间(总计)155.07s
…
|
- 总测试数
- 18
- 错误测试数
- 10
- 尝试通过率
- 59.3%
- 输入令牌
- 721,952
- 输出令牌
- 294,668
- 推理令牌
- 305,374
- 响应时间(平均)
- 9.69s
- 响应时间(总计)
- 155.07s
- 响应时间(最大)
- 35.28s
-
反AI技巧
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)3.46s
响应时间(最大)4.38s
响应时间(总计)13.86s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)27.11s
响应时间(最大)27.11s
响应时间(总计)27.11s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.54s
响应时间(最大)7.51s
响应时间(总计)11.08s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1
响应时间(平均)24.67s
响应时间(最大)35.28s
响应时间(总计)74.02s
-
通用智能
: 5.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)6.40s
响应时间(最大)6.40s
响应时间(总计)6.40s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.52s
响应时间(最大)3.80s
响应时间(总计)7.04s
-
谜题求解
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)5.19s
响应时间(最大)5.49s
响应时间(总计)15.57s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #8#8 |
GPT-5.5low
|
8.9… |
OpenAI |
$0.822
…
|
9.43s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)9.43s
响应时间(最大)56.19s
响应时间(总计)188.66s
…
|
- 总测试数
- 20
- 错误测试数
- 3
- 尝试通过率
- 85.0%
- 输入令牌
- 31,590
- 输出令牌
- 2,025
- 推理令牌
- 20,092
- 响应时间(平均)
- 9.43s
- 响应时间(总计)
- 188.66s
- 响应时间(最大)
- 56.19s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.41s
响应时间(最大)6.32s
响应时间(总计)17.64s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.42s
响应时间(最大)21.06s
响应时间(总计)28.85s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.56s
响应时间(最大)9.56s
响应时间(总计)9.56s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.28s
响应时间(最大)5.13s
响应时间(总计)6.56s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)28.05s
响应时间(最大)56.19s
响应时间(总计)84.16s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.17s
响应时间(最大)5.17s
响应时间(总计)5.17s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.74s
响应时间(最大)3.99s
响应时间(总计)7.48s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.74s
响应时间(最大)5.61s
响应时间(总计)14.21s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.96s
响应时间(最大)4.96s
响应时间(总计)4.96s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.06s
响应时间(最大)10.06s
响应时间(总计)10.06s
|
| #11#11 |
Claude Opus 4.8medium
|
8.7… |
Anthropic |
$1.006
…
|
9.34s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 无答案: 1
响应时间(平均)9.34s
响应时间(最大)38.03s
响应时间(总计)186.84s
…
|
- 总测试数
- 20
- 错误测试数
- 4
- 尝试通过率
- 83.3%
- 输入令牌
- 57,185
- 输出令牌
- 23,201
- 推理令牌
- 5,901
- 响应时间(平均)
- 9.34s
- 响应时间(总计)
- 186.84s
- 响应时间(最大)
- 38.03s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.95s
响应时间(最大)5.76s
响应时间(总计)15.79s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.97s
响应时间(最大)22.27s
响应时间(总计)29.93s
-
综合
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)38.03s
响应时间(最大)38.03s
响应时间(总计)38.03s
-
数据解析与提取
: 7.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)12.29s
响应时间(最大)19.64s
响应时间(总计)24.59s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)14.15s
响应时间(最大)28.41s
响应时间(总计)42.46s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.46s
响应时间(最大)2.46s
响应时间(总计)2.46s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.32s
响应时间(最大)5.07s
响应时间(总计)6.63s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.95s
响应时间(最大)4.33s
响应时间(总计)11.85s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.96s
响应时间(最大)8.96s
响应时间(总计)8.96s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)6.14s
响应时间(最大)6.14s
响应时间(总计)6.14s
|
| #135#135 |
Ling-2.6-flashnone
|
5.2… |
Inclusionai |
$0.001
↑
…
|
9.34s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 2 无效工具调用: 2 API 错误: 1
响应时间(平均)9.34s
响应时间(最大)35.34s
响应时间(总计)177.48s
…
|
- 总测试数
- 20
- 错误测试数
- 14
- 尝试通过率
- 33.3%
- 输入令牌
- 40,718
- 输出令牌
- 2,878
- 推理令牌
- 0
- 响应时间(平均)
- 9.34s
- 响应时间(总计)
- 177.48s
- 响应时间(最大)
- 35.34s
-
反AI技巧
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)11.81s
响应时间(最大)16.60s
响应时间(总计)47.23s
-
编程
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)11.21s
响应时间(最大)11.21s
响应时间(总计)11.21s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)35.34s
响应时间(最大)35.34s
响应时间(总计)35.34s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)8.48s
响应时间(最大)12.71s
响应时间(总计)16.96s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)4.95s
响应时间(最大)7.65s
响应时间(总计)14.84s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.45s
响应时间(最大)1.45s
响应时间(总计)1.45s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.52s
响应时间(最大)8.19s
响应时间(总计)11.04s
-
谜题求解
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)6.51s
响应时间(最大)17.06s
响应时间(总计)19.54s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)18.80s
响应时间(最大)18.80s
响应时间(总计)18.80s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.06s
响应时间(最大)1.06s
响应时间(总计)1.06s
|
| #147#147 |
Qwen3 Coder Nextmedium
|
4.7… |
Qwen |
$0.008
↓
…
|
9.16s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 未遵循指令: 3 超时: 1
响应时间(平均)9.16s
响应时间(最大)81.80s
响应时间(总计)128.25s
…
|
- 总测试数
- 20
- 错误测试数
- 16
- 尝试通过率
- 30.0%
- 输入令牌
- 44,607
- 输出令牌
- 3,310
- 推理令牌
- 0
- 响应时间(平均)
- 9.16s
- 响应时间(总计)
- 128.25s
- 响应时间(最大)
- 81.80s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)8.64s
响应时间(最大)15.28s
响应时间(总计)17.29s
-
编程
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)1.17s
响应时间(最大)1.69s
响应时间(总计)2.34s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.28s
响应时间(最大)4.28s
响应时间(总计)4.28s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)81.80s
响应时间(最大)81.80s
响应时间(总计)81.80s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)638ms
响应时间(最大)638ms
响应时间(总计)638ms
-
通用智能
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.39s
响应时间(最大)1.39s
响应时间(总计)1.39s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.49s
响应时间(最大)13.67s
响应时间(总计)14.99s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.25s
响应时间(最大)1.68s
响应时间(总计)2.49s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.64s
响应时间(最大)2.64s
响应时间(总计)2.64s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)399ms
响应时间(最大)399ms
响应时间(总计)399ms
|
| #31#31 |
Gemini 3 PRO Previewmedium
|
7.9… |
Google |
$0.385
↑
…
|
9.05s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 3 答案错误: 3
响应时间(平均)9.05s
响应时间(最大)26.24s
响应时间(总计)90.53s
…
|
- 总测试数
- 20
- 错误测试数
- 6
- 尝试通过率
- 70.0%
- 输入令牌
- 28,848
- 输出令牌
- 1,490
- 推理令牌
- 10,102
- 响应时间(平均)
- 9.05s
- 响应时间(总计)
- 90.53s
- 响应时间(最大)
- 26.24s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.99s
响应时间(最大)26.24s
响应时间(总计)29.99s
-
编程
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.37s
响应时间(最大)10.37s
响应时间(总计)10.37s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.84s
响应时间(最大)10.84s
响应时间(总计)10.84s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)7.01s
响应时间(最大)7.01s
响应时间(总计)7.01s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.34s
响应时间(最大)9.34s
响应时间(总计)9.34s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.26s
响应时间(最大)3.26s
响应时间(总计)3.26s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.88s
响应时间(最大)4.23s
响应时间(总计)7.77s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.96s
响应时间(最大)11.96s
响应时间(总计)11.96s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #138#138 |
Qwen3 Coder Nextnone
|
5.1… |
Qwen |
$0.008
↓
…
|
9.05s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 额外格式: 1 未遵循指令: 1
响应时间(平均)9.05s
响应时间(最大)45.14s
响应时间(总计)126.72s
…
|
- 总测试数
- 20
- 错误测试数
- 15
- 尝试通过率
- 28.3%
- 输入令牌
- 44,864
- 输出令牌
- 3,575
- 推理令牌
- 0
- 响应时间(平均)
- 9.05s
- 响应时间(总计)
- 126.72s
- 响应时间(最大)
- 45.14s
-
反AI技巧
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1 未遵循指令: 1
响应时间(平均)3.31s
响应时间(最大)4.39s
响应时间(总计)6.63s
-
编程
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.01s
响应时间(最大)3.14s
响应时间(总计)4.03s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)45.14s
响应时间(最大)45.14s
响应时间(总计)45.14s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.32s
响应时间(最大)1.32s
响应时间(总计)1.32s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)962ms
响应时间(最大)962ms
响应时间(总计)962ms
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.34s
响应时间(最大)1.34s
响应时间(总计)1.34s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.78s
响应时间(最大)14.65s
响应时间(总计)15.56s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)24.34s
响应时间(最大)42.58s
响应时间(总计)48.69s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.47s
响应时间(最大)2.47s
响应时间(总计)2.47s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)601ms
响应时间(最大)601ms
响应时间(总计)601ms
|
| #21#21 |
Gemini 3.5 Flashnone
|
8.0… |
Google |
$0.924
…
|
9.05s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 3 答案错误: 3
响应时间(平均)9.05s
响应时间(最大)64.36s
响应时间(总计)153.86s
…
|
- 总测试数
- 20
- 错误测试数
- 6
- 尝试通过率
- 76.7%
- 输入令牌
- 10,840
- 输出令牌
- 100,760
- 推理令牌
- 0
- 响应时间(平均)
- 9.05s
- 响应时间(总计)
- 153.86s
- 响应时间(最大)
- 64.36s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.53s
响应时间(最大)3.43s
响应时间(总计)10.12s
-
编程
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)39.62s
响应时间(最大)64.36s
响应时间(总计)79.24s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)8.10s
响应时间(最大)8.10s
响应时间(总计)8.10s
-
领域专项
: 7.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.64s
响应时间(最大)14.00s
响应时间(总计)31.92s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.46s
响应时间(最大)3.46s
响应时间(总计)3.46s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.38s
响应时间(最大)3.40s
响应时间(总计)6.76s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.13s
响应时间(最大)3.33s
响应时间(总计)9.39s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.87s
响应时间(最大)4.87s
响应时间(总计)4.87s
|