| #31#31 |
Grok 4.20 Betamedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
8.0… |
X AI |
$0.633… |
9.81s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 3 答案错误: 3
响应时间(平均)9.81s
响应时间(最大)31.36s
响应时间(总计)176.62s
…
|
总测试数: 18
错误测试数: 6
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 74.1%
不稳定测试: 2…
输出令牌: 1,568
推理令牌: 91,909
响应时间:平均 9.81s · 总计 176.62s · 最大 31.36s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.16s
响应时间(最大)3.44s
响应时间(总计)12.65s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)31.36s
响应时间(最大)31.36s
响应时间(总计)31.36s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)20.93s
响应时间(最大)20.93s
响应时间(总计)20.93s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.01s
响应时间(最大)4.27s
响应时间(总计)8.02s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)21.33s
响应时间(最大)24.21s
响应时间(总计)64.00s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.78s
响应时间(最大)5.78s
响应时间(总计)5.78s
-
指令遵循
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.97s
响应时间(最大)6.05s
响应时间(总计)9.94s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.85s
响应时间(最大)4.53s
响应时间(总计)11.55s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)12.39s
响应时间(最大)12.39s
响应时间(总计)12.39s
|
| #32#32 |
Claude Sonnet 4.6medium
|
8.0… |
Anthropic |
$1.161… |
12.66s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 答案错误: 2 超时: 1
响应时间(平均)12.66s
响应时间(最大)46.35s
响应时间(总计)126.62s
…
|
总测试数: 18
错误测试数: 5
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 74.1%
不稳定测试: 1…
输出令牌: 42,068
推理令牌: 26,784
响应时间:平均 12.66s · 总计 126.62s · 最大 46.35s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)2.98s
响应时间(最大)4.95s
响应时间(总计)5.97s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)35.76s
响应时间(最大)35.76s
响应时间(总计)35.76s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)46.35s
响应时间(最大)46.35s
响应时间(总计)46.35s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.90s
响应时间(最大)13.90s
响应时间(总计)13.90s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 超时: 1 答案错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.94s
响应时间(最大)4.94s
响应时间(总计)4.94s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.61s
响应时间(最大)2.61s
响应时间(总计)2.61s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.80s
响应时间(最大)5.22s
响应时间(总计)9.60s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.48s
响应时间(最大)7.48s
响应时间(总计)7.48s
|
| #33#33 |
DeepSeek V3.2medium
|
8.0… |
DeepSeek |
$0.028… |
43.49s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 超时: 2 未遵循指令: 1
响应时间(平均)43.49s
响应时间(最大)180.92s
响应时间(总计)782.73s
…
|
总测试数: 18
错误测试数: 6
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 79.6%
不稳定测试: 4…
输出令牌: 7,554
推理令牌: 45,588
响应时间:平均 43.49s · 总计 782.73s · 最大 180.92s
-
反AI技巧
: 8.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)30.72s
响应时间(最大)44.23s
响应时间(总计)122.88s
-
编程
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)180.92s
响应时间(最大)180.92s
响应时间(总计)180.92s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)93.11s
响应时间(最大)93.11s
响应时间(总计)93.11s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)36.09s
响应时间(最大)39.12s
响应时间(总计)72.18s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)21.78s
响应时间(最大)30.66s
响应时间(总计)65.35s
-
通用智能
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)31.30s
响应时间(最大)31.30s
响应时间(总计)31.30s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)35.78s
响应时间(最大)47.30s
响应时间(总计)71.56s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)36.87s
响应时间(最大)59.22s
响应时间(总计)110.62s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)34.81s
响应时间(最大)34.81s
响应时间(总计)34.81s
|
| #34#34 |
GPT-5.2 Chatnone
|
7.9… |
OpenAI |
$0.291… |
6.84s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 1
响应时间(平均)6.84s
响应时间(最大)38.52s
响应时间(总计)123.17s
…
|
总测试数: 18
错误测试数: 6
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 75.9%
不稳定测试: 3…
输出令牌: 17,346
推理令牌: 0
响应时间:平均 6.84s · 总计 123.17s · 最大 38.52s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.40s
响应时间(最大)4.78s
响应时间(总计)13.59s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.97s
响应时间(最大)8.97s
响应时间(总计)8.97s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.12s
响应时间(最大)9.12s
响应时间(总计)9.12s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.05s
响应时间(最大)3.33s
响应时间(总计)6.10s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)17.78s
响应时间(最大)38.52s
响应时间(总计)53.33s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.20s
响应时间(最大)3.20s
响应时间(总计)3.20s
-
指令遵循
: 7.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.46s
响应时间(最大)6.45s
响应时间(总计)10.92s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.42s
响应时间(最大)5.04s
响应时间(总计)13.27s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.68s
响应时间(最大)4.68s
响应时间(总计)4.68s
|
| #35#35 |
Gemini 3.1 Flash Lite Previewnone
|
7.9… |
Google |
$0.016… |
1.30s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 2
响应时间(平均)1.30s
响应时间(最大)3.39s
响应时间(总计)23.42s
…
|
总测试数: 18
错误测试数: 6
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 70.4%
不稳定测试: 1…
输出令牌: 5,361
推理令牌: 0
响应时间:平均 1.30s · 总计 23.42s · 最大 3.39s
-
反AI技巧
: 7.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.04s
响应时间(最大)1.47s
响应时间(总计)4.17s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.47s
响应时间(最大)1.47s
响应时间(总计)1.47s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.20s
响应时间(最大)3.20s
响应时间(总计)3.20s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.22s
响应时间(最大)1.33s
响应时间(总计)2.44s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)942ms
响应时间(最大)1.12s
响应时间(总计)2.83s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)741ms
响应时间(最大)741ms
响应时间(总计)741ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.13s
响应时间(最大)1.14s
响应时间(总计)2.27s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)972ms
响应时间(最大)1.13s
响应时间(总计)2.92s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.39s
响应时间(最大)3.39s
响应时间(总计)3.39s
|
| #36#36 |
Step 3.5 Flashmedium
|
7.9… |
Stepfun |
$0.000… |
26.78s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 3 答案错误: 3
响应时间(平均)26.78s
响应时间(最大)170.45s
响应时间(总计)294.58s
…
|
总测试数: 17
错误测试数: 6
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 70.6%
不稳定测试: 2…
输出令牌: 71,904
推理令牌: 155,607
响应时间:平均 26.78s · 总计 294.58s · 最大 170.45s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.56s
响应时间(最大)32.30s
响应时间(总计)40.68s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)29.57s
响应时间(最大)29.57s
响应时间(总计)29.57s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.01s
响应时间(最大)15.01s
响应时间(总计)15.01s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)170.45s
响应时间(最大)170.45s
响应时间(总计)170.45s
-
通用智能
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)6.54s
响应时间(最大)6.54s
响应时间(总计)6.54s
-
指令遵循
: 8.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.98s
响应时间(最大)4.98s
响应时间(总计)4.98s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)7.72s
响应时间(最大)10.60s
响应时间(总计)15.44s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.91s
响应时间(最大)11.91s
响应时间(总计)11.91s
|
| #37#37 |
DeepSeek V4 Flashhigh
|
7.8… |
DeepSeek |
$0.021… |
47.47s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 3
响应时间(平均)47.47s
响应时间(最大)255.28s
响应时间(总计)854.45s
…
|
总测试数: 18
错误测试数: 7
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 79.6%
不稳定测试: 5…
输出令牌: 1,757
推理令牌: 55,907
响应时间:平均 47.47s · 总计 854.45s · 最大 255.28s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)28.51s
响应时间(最大)39.73s
响应时间(总计)114.05s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)62.48s
响应时间(最大)62.48s
响应时间(总计)62.48s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)76.57s
响应时间(最大)76.57s
响应时间(总计)76.57s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)28.03s
响应时间(最大)30.49s
响应时间(总计)56.07s
-
领域专项
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)112.69s
响应时间(最大)255.28s
响应时间(总计)338.07s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)25.15s
响应时间(最大)25.15s
响应时间(总计)25.15s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.36s
响应时间(最大)19.53s
响应时间(总计)30.73s
-
谜题求解
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2
响应时间(平均)25.53s
响应时间(最大)32.37s
响应时间(总计)76.60s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)74.73s
响应时间(最大)74.73s
响应时间(总计)74.73s
|
| #38#38 |
GLM 5V Turbomedium
|
7.8… |
Z.ai |
$0.291… |
14.96s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 2 无效工具调用: 2
响应时间(平均)14.96s
响应时间(最大)67.08s
响应时间(总计)269.32s
…
|
总测试数: 18
错误测试数: 7
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 77.8%
不稳定测试: 6…
输出令牌: 2,351
推理令牌: 58,941
响应时间:平均 14.96s · 总计 269.32s · 最大 67.08s
-
反AI技巧
: 7.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)10.76s
响应时间(最大)14.40s
响应时间(总计)43.02s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.78s
响应时间(最大)13.78s
响应时间(总计)13.78s
-
综合
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)15.06s
响应时间(最大)15.06s
响应时间(总计)15.06s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.60s
响应时间(最大)9.92s
响应时间(总计)19.19s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)38.15s
响应时间(最大)67.08s
响应时间(总计)114.45s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.09s
响应时间(最大)11.09s
响应时间(总计)11.09s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.74s
响应时间(最大)5.23s
响应时间(总计)7.47s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)10.91s
响应时间(最大)18.97s
响应时间(总计)32.74s
-
工具调用
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)12.53s
响应时间(最大)12.53s
响应时间(总计)12.53s
|
| #39#39 |
Qwen3.5-Flashmedium
|
7.8… |
Qwen |
$0.080… |
66.72s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 4 API 错误: 1 未遵循指令: 1 答案错误: 1
响应时间(平均)66.72s
响应时间(最大)234.29s
响应时间(总计)1201.03s
…
|
总测试数: 18
错误测试数: 7
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 81.5%
不稳定测试: 6…
输出令牌: 2,073
推理令牌: 191,899
响应时间:平均 66.72s · 总计 1201.03s · 最大 234.29s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)59.11s
响应时间(最大)168.31s
响应时间(总计)236.44s
-
编程
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)45.75s
响应时间(最大)45.75s
响应时间(总计)45.75s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.78s
响应时间(最大)17.78s
响应时间(总计)17.78s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)56.99s
响应时间(最大)80.14s
响应时间(总计)113.98s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)146.50s
响应时间(最大)234.29s
响应时间(总计)439.49s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)40.05s
响应时间(最大)40.05s
响应时间(总计)40.05s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)63.49s
响应时间(最大)111.61s
响应时间(总计)126.98s
-
谜题求解
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2
响应时间(平均)56.74s
响应时间(最大)115.01s
响应时间(总计)170.23s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.33s
响应时间(最大)10.33s
响应时间(总计)10.33s
|
| #40#40 |
GLM 5.1medium
|
7.8… |
Z.ai |
$0.201… |
24.13s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 超时: 2 API 错误: 1
响应时间(平均)24.13s
响应时间(最大)118.52s
响应时间(总计)410.25s
…
|
总测试数: 18
错误测试数: 6
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 75.9%
不稳定测试: 3…
输出令牌: 8,005
推理令牌: 49,090
响应时间:平均 24.13s · 总计 410.25s · 最大 118.52s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.31s
响应时间(最大)14.20s
响应时间(总计)33.24s
-
编程
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)118.52s
响应时间(最大)118.52s
响应时间(总计)118.52s
-
综合
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)43.11s
响应时间(最大)43.11s
响应时间(总计)43.11s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.33s
响应时间(最大)9.40s
响应时间(总计)18.66s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)29.77s
响应时间(最大)32.22s
响应时间(总计)89.30s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)20.95s
响应时间(最大)20.95s
响应时间(总计)20.95s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.47s
响应时间(最大)10.16s
响应时间(总计)14.94s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)23.85s
响应时间(最大)33.09s
响应时间(总计)71.54s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #41#41 |
MiMo-V2.5medium
|
7.8… |
Xiaomi |
$0.253… |
13.71s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 答案错误: 2 未遵循指令: 1 无答案: 1
响应时间(平均)13.71s
响应时间(最大)86.93s
响应时间(总计)246.73s
…
|
总测试数: 18
错误测试数: 6
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 74.1%
不稳定测试: 3…
输出令牌: 2,840
推理令牌: 116,242
响应时间:平均 13.71s · 总计 246.73s · 最大 86.93s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.98s
响应时间(最大)3.76s
响应时间(总计)7.92s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)31.48s
响应时间(最大)31.48s
响应时间(总计)31.48s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)16.86s
响应时间(最大)16.86s
响应时间(总计)16.86s
-
数据解析与提取
: 2.7
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)6.33s
响应时间(最大)7.45s
响应时间(总计)12.67s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)34.53s
响应时间(最大)86.93s
响应时间(总计)103.59s
-
通用智能
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.55s
响应时间(最大)1.55s
响应时间(总计)1.55s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.80s
响应时间(最大)1.81s
响应时间(总计)3.60s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)20.60s
响应时间(最大)57.93s
响应时间(总计)61.79s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.29s
响应时间(最大)7.29s
响应时间(总计)7.29s
|
| #42#42 |
Kimi K2.6medium
|
7.7… |
Moonshot AI |
$0.722… |
45.20s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 3 超时: 2 答案错误: 2
响应时间(平均)45.20s
响应时间(最大)215.85s
响应时间(总计)768.37s
…
|
总测试数: 18
错误测试数: 7
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 74.1%
不稳定测试: 4…
输出令牌: 80,759
推理令牌: 179,814
响应时间:平均 45.20s · 总计 768.37s · 最大 215.85s
-
反AI技巧
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)11.59s
响应时间(最大)23.94s
响应时间(总计)46.37s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)106.96s
响应时间(最大)106.96s
响应时间(总计)106.96s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)40.96s
响应时间(最大)40.96s
响应时间(总计)40.96s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)20.38s
响应时间(最大)22.88s
响应时间(总计)40.76s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2
响应时间(平均)202.38s
响应时间(最大)215.85s
响应时间(总计)404.76s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.83s
响应时间(最大)17.83s
响应时间(总计)17.83s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.53s
响应时间(最大)19.15s
响应时间(总计)25.06s
-
谜题求解
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2 答案错误: 1
响应时间(平均)25.59s
响应时间(最大)56.89s
响应时间(总计)76.76s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.92s
响应时间(最大)8.92s
响应时间(总计)8.92s
|
| #43#43 |
MiMo-V2-Omnimedium
|
7.7… |
Xiaomi |
$0.153… |
16.76s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 2 额外格式: 1 无答案: 1
响应时间(平均)16.76s
响应时间(最大)158.78s
响应时间(总计)301.61s
…
|
总测试数: 18
错误测试数: 7
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 61.1%
不稳定测试: 0…
输出令牌: 928
推理令牌: 72,661
响应时间:平均 16.76s · 总计 301.61s · 最大 158.78s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.11s
响应时间(最大)3.43s
响应时间(总计)8.43s
-
编程
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)68.55s
响应时间(最大)68.55s
响应时间(总计)68.55s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)19.29s
响应时间(最大)19.29s
响应时间(总计)19.29s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.29s
响应时间(最大)2.62s
响应时间(总计)4.58s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 无答案: 1 答案错误: 1
响应时间(平均)55.12s
响应时间(最大)158.78s
响应时间(总计)165.36s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.86s
响应时间(最大)2.86s
响应时间(总计)2.86s
-
指令遵循
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.92s
响应时间(最大)7.14s
响应时间(总计)9.83s
-
谜题求解
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)3.88s
响应时间(最大)8.21s
响应时间(总计)11.65s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.07s
响应时间(最大)11.07s
响应时间(总计)11.07s
|
| #44#44 |
GPT-5.3 Chatnone
|
7.7… |
OpenAI |
$0.340… |
5.88s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 2
响应时间(平均)5.88s
响应时间(最大)18.33s
响应时间(总计)105.90s
…
|
总测试数: 18
错误测试数: 7
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 68.5%
不稳定测试: 3…
输出令牌: 20,784
推理令牌: 0
响应时间:平均 5.88s · 总计 105.90s · 最大 18.33s
-
反AI技巧
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)3.86s
响应时间(最大)7.35s
响应时间(总计)15.44s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.32s
响应时间(最大)9.32s
响应时间(总计)9.32s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.96s
响应时间(最大)11.96s
响应时间(总计)11.96s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.21s
响应时间(最大)2.52s
响应时间(总计)4.42s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)13.01s
响应时间(最大)18.33s
响应时间(总计)39.04s
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.99s
响应时间(最大)1.99s
响应时间(总计)1.99s
-
指令遵循
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.29s
响应时间(最大)4.18s
响应时间(总计)6.59s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.93s
响应时间(最大)3.05s
响应时间(总计)8.78s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.36s
响应时间(最大)8.36s
响应时间(总计)8.36s
|
| #45#45 |
Claude Opus 4.6medium
|
7.6… |
Anthropic |
$1.446… |
21.08s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 4 答案错误: 2
响应时间(平均)21.08s
响应时间(最大)83.40s
响应时间(总计)231.84s
…
|
总测试数: 18
错误测试数: 6
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 70.4%
不稳定测试: 2…
输出令牌: 29,829
推理令牌: 18,938
响应时间:平均 21.08s · 总计 231.84s · 最大 83.40s
-
反AI技巧
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2
响应时间(平均)7.45s
响应时间(最大)11.88s
响应时间(总计)14.90s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.11s
响应时间(最大)23.11s
响应时间(总计)23.11s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)76.66s
响应时间(最大)76.66s
响应时间(总计)76.66s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.37s
响应时间(最大)7.37s
响应时间(总计)7.37s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 答案错误: 1
响应时间(平均)83.40s
响应时间(最大)83.40s
响应时间(总计)83.40s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.04s
响应时间(最大)5.04s
响应时间(总计)5.04s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.43s
响应时间(最大)2.43s
响应时间(总计)2.43s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.60s
响应时间(最大)4.66s
响应时间(总计)9.20s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.73s
响应时间(最大)9.73s
响应时间(总计)9.73s
|
| #46#46 |
GPT-5.4 Nanomedium
|
7.6… |
OpenAI |
$0.083… |
11.21s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 3
响应时间(平均)11.21s
响应时间(最大)94.06s
响应时间(总计)201.80s
…
|
总测试数: 18
错误测试数: 7
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 68.5%
不稳定测试: 2…
输出令牌: 2,946
推理令牌: 58,132
响应时间:平均 11.21s · 总计 201.80s · 最大 94.06s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.52s
响应时间(最大)7.74s
响应时间(总计)18.10s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.41s
响应时间(最大)13.41s
响应时间(总计)13.41s
-
综合
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)24.13s
响应时间(最大)24.13s
响应时间(总计)24.13s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.54s
响应时间(最大)3.33s
响应时间(总计)5.08s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)38.18s
响应时间(最大)94.06s
响应时间(总计)114.53s
-
通用智能
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.15s
响应时间(最大)4.15s
响应时间(总计)4.15s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.88s
响应时间(最大)2.61s
响应时间(总计)3.75s
-
谜题求解
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2 答案错误: 1
响应时间(平均)3.65s
响应时间(最大)4.02s
响应时间(总计)10.95s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.71s
响应时间(最大)7.71s
响应时间(总计)7.71s
|
| #47#47 |
Seed-2.0-Minimedium
|
7.5… |
Bytedance Seed |
$0.037… |
69.70s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 4 答案错误: 2 未遵循指令: 1
响应时间(平均)69.70s
响应时间(最大)262.83s
响应时间(总计)1045.47s
…
|
总测试数: 18
错误测试数: 7
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 66.7%
不稳定测试: 2…
输出令牌: 2,419
推理令牌: 79,238
响应时间:平均 69.70s · 总计 1045.47s · 最大 262.83s
-
反AI技巧
: 6.6
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)74.75s
响应时间(最大)182.10s
响应时间(总计)298.98s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)197.31s
响应时间(最大)197.31s
响应时间(总计)197.31s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)262.83s
响应时间(最大)262.83s
响应时间(总计)262.83s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)24.27s
响应时间(最大)27.52s
响应时间(总计)48.54s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 3
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
通用智能
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)36.65s
响应时间(最大)36.65s
响应时间(总计)36.65s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.47s
响应时间(最大)19.46s
响应时间(总计)34.93s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)25.85s
响应时间(最大)32.95s
响应时间(总计)77.55s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)88.68s
响应时间(最大)88.68s
响应时间(总计)88.68s
|
| #48#48 |
GPT-5.2medium
|
7.5… |
OpenAI |
$0.352… |
14.04s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 3 答案错误: 2 无答案: 1 超时: 1
响应时间(平均)14.04s
响应时间(最大)77.80s
响应时间(总计)154.41s
…
|
总测试数: 18
错误测试数: 7
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 72.2%
不稳定测试: 4…
输出令牌: 2,705
推理令牌: 18,977
响应时间:平均 14.04s · 总计 154.41s · 最大 77.80s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)7.81s
响应时间(最大)14.34s
响应时间(总计)15.62s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.12s
响应时间(最大)15.12s
响应时间(总计)15.12s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.06s
响应时间(最大)14.06s
响应时间(总计)14.06s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.15s
响应时间(最大)3.15s
响应时间(总计)3.15s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)77.80s
响应时间(最大)77.80s
响应时间(总计)77.80s
-
通用智能
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.32s
响应时间(最大)4.32s
响应时间(总计)4.32s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.12s
响应时间(最大)3.12s
响应时间(总计)3.12s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)5.47s
响应时间(最大)6.45s
响应时间(总计)10.94s
-
工具调用
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)10.30s
响应时间(最大)10.30s
响应时间(总计)10.30s
|
| #49#49 |
MiMo-V2-Flashmedium
|
7.5… |
Xiaomi |
$0.038… |
23.36s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 API 错误: 1 额外格式: 1 未遵循指令: 1 超时: 1
响应时间(平均)23.36s
响应时间(最大)96.01s
响应时间(总计)280.34s
…
|
总测试数: 18
错误测试数: 7
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 70.4%
不稳定测试: 3…
输出令牌: 12,387
推理令牌: 115,182
响应时间:平均 23.36s · 总计 280.34s · 最大 96.01s
-
反AI技巧
: 8.1
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)15.85s
响应时间(最大)20.83s
响应时间(总计)47.55s
-
编程
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)13.03s
响应时间(最大)13.03s
响应时间(总计)13.03s
-
综合
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)75.68s
响应时间(最大)75.68s
响应时间(总计)75.68s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)96.01s
响应时间(最大)96.01s
响应时间(总计)96.01s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.20s
响应时间(最大)4.20s
响应时间(总计)4.20s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.28s
响应时间(最大)7.37s
响应时间(总计)8.55s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.77s
响应时间(最大)5.26s
响应时间(总计)7.55s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)27.78s
响应时间(最大)27.78s
响应时间(总计)27.78s
|
| #50#50 |
Claude Sonnet 4.6none
|
7.4… |
Anthropic |
$0.262… |
4.98s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 3 答案错误: 3 未遵循指令: 1
响应时间(平均)4.98s
响应时间(最大)23.84s
响应时间(总计)54.83s
…
|
总测试数: 18
错误测试数: 7
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 64.8%
不稳定测试: 1…
输出令牌: 7,433
推理令牌: 0
响应时间:平均 4.98s · 总计 54.83s · 最大 23.84s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 答案错误: 1
响应时间(平均)2.94s
响应时间(最大)4.83s
响应时间(总计)5.88s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.67s
响应时间(最大)3.67s
响应时间(总计)3.67s
-
综合
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.84s
响应时间(最大)23.84s
响应时间(总计)23.84s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.43s
响应时间(最大)3.43s
响应时间(总计)3.43s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.54s
响应时间(最大)3.54s
响应时间(总计)3.54s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.56s
响应时间(最大)2.56s
响应时间(总计)2.56s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.96s
响应时间(最大)1.96s
响应时间(总计)1.96s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)2.92s
响应时间(最大)3.33s
响应时间(总计)5.84s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.11s
响应时间(最大)4.11s
响应时间(总计)4.11s
|
| #51#51 |
Qwen3.5-35B-A3Bmedium
|
7.4… |
Qwen |
$0.398… |
44.51s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 4 答案错误: 2 API 错误: 1 无答案: 1
响应时间(平均)44.51s
响应时间(最大)106.00s
响应时间(总计)801.21s
…
|
总测试数: 18
错误测试数: 8
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 79.6%
不稳定测试: 7…
输出令牌: 10,137
推理令牌: 208,761
响应时间:平均 44.51s · 总计 801.21s · 最大 106.00s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.13s
响应时间(最大)34.96s
响应时间(总计)84.53s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)79.09s
响应时间(最大)79.09s
响应时间(总计)79.09s
-
综合
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)75.34s
响应时间(最大)75.34s
响应时间(总计)75.34s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)59.33s
响应时间(最大)97.12s
响应时间(总计)118.65s
-
领域专项
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 答案错误: 1
响应时间(平均)88.34s
响应时间(最大)106.00s
响应时间(总计)265.01s
-
通用智能
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)30.30s
响应时间(最大)30.30s
响应时间(总计)30.30s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)24.45s
响应时间(最大)43.36s
响应时间(总计)48.89s
-
谜题求解
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)31.58s
响应时间(最大)60.18s
响应时间(总计)94.75s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.65s
响应时间(最大)4.65s
响应时间(总计)4.65s
|
| #52#52 |
GPT-5.4 Minimedium
|
7.3… |
OpenAI |
$0.299… |
15.22s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 5 答案错误: 4
响应时间(平均)15.22s
响应时间(最大)102.91s
响应时间(总计)273.90s
…
|
总测试数: 18
错误测试数: 9
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 70.4%
不稳定测试: 6…
输出令牌: 2,131
推理令牌: 59,567
响应时间:平均 15.22s · 总计 273.90s · 最大 102.91s
-
反AI技巧
: 8.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.05s
响应时间(最大)6.69s
响应时间(总计)16.20s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.76s
响应时间(最大)7.76s
响应时间(总计)7.76s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.81s
响应时间(最大)17.81s
响应时间(总计)17.81s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.43s
响应时间(最大)3.39s
响应时间(总计)4.87s
-
领域专项
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)65.31s
响应时间(最大)102.91s
响应时间(总计)195.92s
-
通用智能
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.72s
响应时间(最大)3.72s
响应时间(总计)3.72s
-
指令遵循
: 7.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.50s
响应时间(最大)2.55s
响应时间(总计)5.00s
-
谜题求解
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2
响应时间(平均)4.33s
响应时间(最大)7.27s
响应时间(总计)13.00s
-
工具调用
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)9.62s
响应时间(最大)9.62s
响应时间(总计)9.62s
|
| #53#53 |
GPT-5 Minimedium
|
7.0… |
OpenAI |
$0.128… |
23.98s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 4 答案错误: 4 超时: 1
响应时间(平均)23.98s
响应时间(最大)88.15s
响应时间(总计)431.56s
…
|
总测试数: 18
错误测试数: 9
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 61.1%
不稳定测试: 3…
输出令牌: 6,379
推理令牌: 53,482
响应时间:平均 23.98s · 总计 431.56s · 最大 88.15s
-
反AI技巧
: 7.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)13.86s
响应时间(最大)26.00s
响应时间(总计)55.45s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.18s
响应时间(最大)23.18s
响应时间(总计)23.18s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)88.15s
响应时间(最大)88.15s
响应时间(总计)88.15s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.58s
响应时间(最大)13.87s
响应时间(总计)25.16s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)44.63s
响应时间(最大)82.55s
响应时间(总计)133.89s
-
通用智能
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)13.50s
响应时间(最大)13.50s
响应时间(总计)13.50s
-
指令遵循
: 8.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)15.66s
响应时间(最大)21.80s
响应时间(总计)31.32s
-
谜题求解
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)14.09s
响应时间(最大)16.81s
响应时间(总计)42.28s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)18.64s
响应时间(最大)18.64s
响应时间(总计)18.64s
|
| #54#54 |
Kimi K2.5medium
|
7.0… |
Moonshot AI |
$0.220… |
72.43s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 2 超时: 2 无答案: 1
响应时间(平均)72.43s
响应时间(最大)150.77s
响应时间(总计)796.70s
…
|
总测试数: 18
错误测试数: 9
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 72.2%
不稳定测试: 7…
输出令牌: 42,176
推理令牌: 84,870
响应时间:平均 72.43s · 总计 796.70s · 最大 150.77s
-
反AI技巧
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)51.38s
响应时间(最大)85.28s
响应时间(总计)102.75s
-
编程
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)150.77s
响应时间(最大)150.77s
响应时间(总计)150.77s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)71.37s
响应时间(最大)71.37s
响应时间(总计)71.37s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)49.78s
响应时间(最大)49.78s
响应时间(总计)49.78s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)137.29s
响应时间(最大)137.29s
响应时间(总计)137.29s
-
通用智能
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)69.73s
响应时间(最大)69.73s
响应时间(总计)69.73s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)92.47s
响应时间(最大)92.47s
响应时间(总计)92.47s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)45.40s
响应时间(最大)82.75s
响应时间(总计)90.79s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)31.74s
响应时间(最大)31.74s
响应时间(总计)31.74s
|
| #55#55 |
Grok 4.20medium
|
7.0… |
X AI |
$0.743… |
10.33s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 4 答案错误: 3 API 错误: 1 额外格式: 1
响应时间(平均)10.33s
响应时间(最大)29.87s
响应时间(总计)185.87s
…
|
总测试数: 18
错误测试数: 9
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 66.7%
不稳定测试: 5…
输出令牌: 1,744
推理令牌: 109,882
响应时间:平均 10.33s · 总计 185.87s · 最大 29.87s
-
反AI技巧
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.36s
响应时间(最大)4.08s
响应时间(总计)13.42s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)24.33s
响应时间(最大)24.33s
响应时间(总计)24.33s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.40s
响应时间(最大)17.40s
响应时间(总计)17.40s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.17s
响应时间(最大)5.02s
响应时间(总计)8.34s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)27.03s
响应时间(最大)29.87s
响应时间(总计)81.10s
-
通用智能
: 5.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)7.09s
响应时间(最大)7.09s
响应时间(总计)7.09s
-
指令遵循
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)4.42s
响应时间(最大)4.46s
响应时间(总计)8.84s
-
谜题求解
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2
响应时间(平均)3.89s
响应时间(最大)4.90s
响应时间(总计)11.67s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)13.68s
响应时间(最大)13.68s
响应时间(总计)13.68s
|
| #56#56 |
Gemma 4 31Bnone
|
6.9… |
Google |
$0.003… |
4.02s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 API 错误: 2 未遵循指令: 1
响应时间(平均)4.02s
响应时间(最大)26.13s
响应时间(总计)64.33s
…
|
总测试数: 18
错误测试数: 8
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 55.6%
不稳定测试: 0…
输出令牌: 1,359
推理令牌: 0
响应时间:平均 4.02s · 总计 64.33s · 最大 26.13s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.85s
响应时间(最大)4.45s
响应时间(总计)7.40s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)26.13s
响应时间(最大)26.13s
响应时间(总计)26.13s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.25s
响应时间(最大)3.02s
响应时间(总计)4.51s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.22s
响应时间(最大)4.68s
响应时间(总计)9.67s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.09s
响应时间(最大)2.09s
响应时间(总计)2.09s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.84s
响应时间(最大)4.45s
响应时间(总计)5.68s
-
谜题求解
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.95s
响应时间(最大)4.05s
响应时间(总计)8.85s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #57#57 |
Qwen3.5 Plus 2026-02-15none
|
6.8… |
Qwen |
$0.017… |
2.60s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9
响应时间(平均)2.60s
响应时间(最大)6.65s
响应时间(总计)31.23s
…
|
总测试数: 18
错误测试数: 9
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 53.7%
不稳定测试: 2…
输出令牌: 2,461
推理令牌: 0
响应时间:平均 2.60s · 总计 31.23s · 最大 6.65s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.91s
响应时间(最大)2.74s
响应时间(总计)3.82s
-
编程
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.63s
响应时间(最大)3.63s
响应时间(总计)3.63s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.65s
响应时间(最大)6.65s
响应时间(总计)6.65s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.89s
响应时间(最大)1.89s
响应时间(总计)1.89s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.17s
响应时间(最大)1.44s
响应时间(总计)2.33s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.26s
响应时间(最大)2.26s
响应时间(总计)2.26s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.67s
响应时间(最大)1.67s
响应时间(总计)1.67s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.82s
响应时间(最大)3.52s
响应时间(总计)5.65s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.33s
响应时间(最大)3.33s
响应时间(总计)3.33s
|
| #58#58 |
GPT-5.5none
|
6.8… |
OpenAI |
$0.195… |
1.83s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 未遵循指令: 1
响应时间(平均)1.83s
响应时间(最大)5.56s
响应时间(总计)32.86s
…
|
总测试数: 18
错误测试数: 9
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 61.1%
不稳定测试: 4…
输出令牌: 1,910
推理令牌: 0
响应时间:平均 1.83s · 总计 32.86s · 最大 5.56s
-
反AI技巧
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.31s
响应时间(最大)2.08s
响应时间(总计)5.25s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.05s
响应时间(最大)2.05s
响应时间(总计)2.05s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.56s
响应时间(最大)5.56s
响应时间(总计)5.56s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.18s
响应时间(最大)1.24s
响应时间(总计)2.37s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.31s
响应时间(最大)1.39s
响应时间(总计)3.92s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.41s
响应时间(最大)3.41s
响应时间(总计)3.41s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.15s
响应时间(最大)1.19s
响应时间(总计)2.31s
-
谜题求解
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.36s
响应时间(最大)1.56s
响应时间(总计)4.09s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.90s
响应时间(最大)3.90s
响应时间(总计)3.90s
|
| #59#59 |
Hunter Alphamedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.7… |
OpenRouter |
$0.000… |
10.33s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 2 超时: 2 API 错误: 1 额外格式: 1
响应时间(平均)10.33s
响应时间(最大)30.53s
响应时间(总计)175.60s
…
|
总测试数: 18
错误测试数: 10
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 64.8%
不稳定测试: 6…
输出令牌: 4,724
推理令牌: 17,921
响应时间:平均 10.33s · 总计 175.60s · 最大 30.53s
-
反AI技巧
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.75s
响应时间(最大)7.62s
响应时间(总计)19.00s
-
编程
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)30.53s
响应时间(最大)30.53s
响应时间(总计)30.53s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.16s
响应时间(最大)26.55s
响应时间(总计)46.33s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 超时: 1 答案错误: 1
响应时间(平均)10.52s
响应时间(最大)18.68s
响应时间(总计)31.56s
-
通用智能
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)6.44s
响应时间(最大)6.44s
响应时间(总计)6.44s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.18s
响应时间(最大)4.46s
响应时间(总计)8.36s
-
谜题求解
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)5.36s
响应时间(最大)6.20s
响应时间(总计)16.07s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.33s
响应时间(最大)17.33s
响应时间(总计)17.33s
|
| #60#60 |
Nemotron 3 Supermedium
|
6.7… |
NVIDIA |
$0.000… |
19.06s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 4 答案错误: 3 API 错误: 1 超时: 1
响应时间(平均)19.06s
响应时间(最大)87.80s
响应时间(总计)305.04s
…
|
总测试数: 18
错误测试数: 9
可靠性: 不适用该模型的可靠性遥测不可用或不完整。
尝试通过率: 55.6%
不稳定测试: 3…
输出令牌: 11,947
推理令牌: 29,768
响应时间:平均 19.06s · 总计 305.04s · 最大 87.80s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.08s
响应时间(最大)22.30s
响应时间(总计)40.30s
-
编程
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)87.80s
响应时间(最大)87.80s
响应时间(总计)87.80s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)18.16s
响应时间(最大)20.65s
响应时间(总计)36.33s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)16.19s
响应时间(最大)21.56s
响应时间(总计)32.39s
-
通用智能
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)27.86s
响应时间(最大)27.86s
响应时间(总计)27.86s
-
指令遵循
: 7.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)7.72s
响应时间(最大)11.23s
响应时间(总计)15.45s
-
谜题求解
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2 答案错误: 1
响应时间(平均)8.39s
响应时间(最大)16.73s
响应时间(总计)25.18s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)39.75s
响应时间(最大)39.75s
响应时间(总计)39.75s
|