| #92#92 |
Qwen3.5 Plus 2026-02-15none
|
6.4… |
Qwen |
$0.016
↓
…
|
2.40s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11
响应时间(平均)2.40s
响应时间(最大)6.65s
响应时间(总计)33.56s
…
|
- 总测试数
- 20
- 错误测试数
- 11
- 尝试通过率
- 48.3%
- 输入令牌
- 43,023
- 输出令牌
- 2,474
- 推理令牌
- 0
- 响应时间(平均)
- 2.40s
- 响应时间(总计)
- 33.56s
- 响应时间(最大)
- 6.65s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.91s
响应时间(最大)2.74s
响应时间(总计)3.82s
-
编程
: 4.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.54s
响应时间(最大)3.63s
响应时间(总计)5.09s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.65s
响应时间(最大)6.65s
响应时间(总计)6.65s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.89s
响应时间(最大)1.89s
响应时间(总计)1.89s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.17s
响应时间(最大)1.44s
响应时间(总计)2.33s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.26s
响应时间(最大)2.26s
响应时间(总计)2.26s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.67s
响应时间(最大)1.67s
响应时间(总计)1.67s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.71s
响应时间(最大)3.29s
响应时间(总计)5.41s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.33s
响应时间(最大)3.33s
响应时间(总计)3.33s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.11s
响应时间(最大)1.11s
响应时间(总计)1.11s
|
| #93#93 |
Ring-2.6-1Tnone
|
6.4… |
Inclusionai |
$0.026
…
|
55.10s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 API 错误: 4 未遵循指令: 2
响应时间(平均)55.10s
响应时间(最大)143.82s
响应时间(总计)881.55s
…
|
- 总测试数
- 20
- 错误测试数
- 11
- 尝试通过率
- 50.0%
- 输入令牌
- 7,599
- 输出令牌
- 39,954
- 推理令牌
- 0
- 响应时间(平均)
- 55.10s
- 响应时间(总计)
- 881.55s
- 响应时间(最大)
- 143.82s
-
反AI技巧
: 9.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)43.33s
响应时间(最大)71.76s
响应时间(总计)173.31s
-
编程
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)143.82s
响应时间(最大)143.82s
响应时间(总计)143.82s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)45.87s
响应时间(最大)45.87s
响应时间(总计)45.87s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)73.40s
响应时间(最大)90.09s
响应时间(总计)220.20s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)15.63s
响应时间(最大)15.63s
响应时间(总计)15.63s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)27.36s
响应时间(最大)40.24s
响应时间(总计)54.72s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)31.47s
响应时间(最大)46.84s
响应时间(总计)94.41s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)133.60s
响应时间(最大)133.60s
响应时间(总计)133.60s
|
| #94#94 |
Gemini 2.5 Flashnone
|
6.4… |
Google |
$0.015
…
|
889ms… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11
响应时间(平均)889ms
响应时间(最大)4.39s
响应时间(总计)17.79s
…
|
- 总测试数
- 20
- 错误测试数
- 11
- 尝试通过率
- 48.3%
- 输入令牌
- 32,923
- 输出令牌
- 1,764
- 推理令牌
- 0
- 响应时间(平均)
- 889ms
- 响应时间(总计)
- 17.79s
- 响应时间(最大)
- 4.39s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)582ms
响应时间(最大)844ms
响应时间(总计)2.33s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)810ms
响应时间(最大)1.16s
响应时间(总计)1.62s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.39s
响应时间(最大)4.39s
响应时间(总计)4.39s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)652ms
响应时间(最大)660ms
响应时间(总计)1.30s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)495ms
响应时间(最大)642ms
响应时间(总计)1.49s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)615ms
响应时间(最大)615ms
响应时间(总计)615ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)590ms
响应时间(最大)622ms
响应时间(总计)1.18s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)604ms
响应时间(最大)700ms
响应时间(总计)1.81s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.91s
响应时间(最大)1.91s
响应时间(总计)1.91s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.15s
响应时间(最大)1.15s
响应时间(总计)1.15s
|
| #96#96 |
GLM 5none
|
6.3… |
Z.ai |
$0.025
↑
…
|
3.95s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11
响应时间(平均)3.95s
响应时间(最大)11.07s
响应时间(总计)51.38s
…
|
- 总测试数
- 20
- 错误测试数
- 11
- 尝试通过率
- 46.7%
- 输入令牌
- 34,537
- 输出令牌
- 1,985
- 推理令牌
- 0
- 响应时间(平均)
- 3.95s
- 响应时间(总计)
- 51.38s
- 响应时间(最大)
- 11.07s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.37s
响应时间(最大)3.39s
响应时间(总计)4.75s
-
编程
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)5.18s
响应时间(最大)8.84s
响应时间(总计)10.37s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.98s
响应时间(最大)4.98s
响应时间(总计)4.98s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.78s
响应时间(最大)5.78s
响应时间(总计)5.78s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.24s
响应时间(最大)2.24s
响应时间(总计)2.24s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.27s
响应时间(最大)3.27s
响应时间(总计)3.27s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.48s
响应时间(最大)1.48s
响应时间(总计)1.48s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.91s
响应时间(最大)2.08s
响应时间(总计)3.82s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.07s
响应时间(最大)11.07s
响应时间(总计)11.07s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.62s
响应时间(最大)3.62s
响应时间(总计)3.62s
|
| #78#78 |
Hunter Alphamedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.7… |
OpenRouter |
$0.000
…
|
10.33s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 2 超时: 2 API 错误: 1 额外格式: 1
响应时间(平均)10.33s
响应时间(最大)30.53s
响应时间(总计)175.58s
…
|
- 总测试数
- 18
- 错误测试数
- 10
- 尝试通过率
- 64.8%
- 输入令牌
- 28,927
- 输出令牌
- 4,682
- 推理令牌
- 17,969
- 响应时间(平均)
- 10.33s
- 响应时间(总计)
- 175.58s
- 响应时间(最大)
- 30.53s
-
反AI技巧
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.75s
响应时间(最大)7.62s
响应时间(总计)19.00s
-
编程
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)30.53s
响应时间(最大)30.53s
响应时间(总计)30.53s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.16s
响应时间(最大)26.55s
响应时间(总计)46.33s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 超时: 1 答案错误: 1
响应时间(平均)10.52s
响应时间(最大)18.68s
响应时间(总计)31.56s
-
通用智能
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)6.44s
响应时间(最大)6.44s
响应时间(总计)6.44s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.18s
响应时间(最大)4.46s
响应时间(总计)8.36s
-
谜题求解
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)5.35s
响应时间(最大)6.20s
响应时间(总计)16.06s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.33s
响应时间(最大)17.33s
响应时间(总计)17.33s
|
| #86#86 |
Grok 4.20 Multi Agent Betamedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.6… |
X AI |
$5.599
↑
…
|
9.69s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 API 错误: 2 额外格式: 2 未遵循指令: 2
响应时间(平均)9.69s
响应时间(最大)35.28s
响应时间(总计)155.07s
…
|
- 总测试数
- 18
- 错误测试数
- 10
- 尝试通过率
- 59.3%
- 输入令牌
- 721,952
- 输出令牌
- 294,668
- 推理令牌
- 305,374
- 响应时间(平均)
- 9.69s
- 响应时间(总计)
- 155.07s
- 响应时间(最大)
- 35.28s
-
反AI技巧
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)3.46s
响应时间(最大)4.38s
响应时间(总计)13.86s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)27.11s
响应时间(最大)27.11s
响应时间(总计)27.11s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.54s
响应时间(最大)7.51s
响应时间(总计)11.08s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1
响应时间(平均)24.67s
响应时间(最大)35.28s
响应时间(总计)74.02s
-
通用智能
: 5.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)6.40s
响应时间(最大)6.40s
响应时间(总计)6.40s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.52s
响应时间(最大)3.80s
响应时间(总计)7.04s
-
谜题求解
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)5.19s
响应时间(最大)5.49s
响应时间(总计)15.57s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #97#97 |
Gemma 4 26B A4Bnone
|
6.2… |
Google |
$0.003
↓
…
|
5.96s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 2 超时: 1
响应时间(平均)5.96s
响应时间(最大)57.10s
响应时间(总计)119.22s
…
|
- 总测试数
- 20
- 错误测试数
- 12
- 尝试通过率
- 46.7%
- 输入令牌
- 36,978
- 输出令牌
- 1,815
- 推理令牌
- 0
- 响应时间(平均)
- 5.96s
- 响应时间(总计)
- 119.22s
- 响应时间(最大)
- 57.10s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.28s
响应时间(最大)2.09s
响应时间(总计)5.13s
-
编程
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)3.83s
响应时间(最大)7.07s
响应时间(总计)7.66s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)30.53s
响应时间(最大)30.53s
响应时间(总计)30.53s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.70s
响应时间(最大)2.21s
响应时间(总计)3.41s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.49s
响应时间(最大)4.23s
响应时间(总计)7.48s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.54s
响应时间(最大)3.54s
响应时间(总计)3.54s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)690ms
响应时间(最大)878ms
响应时间(总计)1.38s
-
谜题求解
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)744ms
响应时间(最大)972ms
响应时间(总计)2.23s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)57.10s
响应时间(最大)57.10s
响应时间(总计)57.10s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)778ms
响应时间(最大)778ms
响应时间(总计)778ms
|
| #98#98 |
Mimo V2 Omninone
|
6.2… |
Xiaomi |
$0.021
↓
…
|
2.44s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 额外格式: 1 未遵循指令: 1
响应时间(平均)2.44s
响应时间(最大)6.81s
响应时间(总计)48.81s
…
|
- 总测试数
- 20
- 错误测试数
- 12
- 尝试通过率
- 41.7%
- 输入令牌
- 40,852
- 输出令牌
- 3,314
- 推理令牌
- 0
- 响应时间(平均)
- 2.44s
- 响应时间(总计)
- 48.81s
- 响应时间(最大)
- 6.81s
-
反AI技巧
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)1.63s
响应时间(最大)3.29s
响应时间(总计)6.52s
-
编程
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)2.75s
响应时间(最大)3.79s
响应时间(总计)5.50s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.96s
响应时间(最大)5.96s
响应时间(总计)5.96s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.76s
响应时间(最大)2.60s
响应时间(总计)3.51s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.10s
响应时间(最大)3.58s
响应时间(总计)6.30s
-
通用智能
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.33s
响应时间(最大)2.33s
响应时间(总计)2.33s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.26s
响应时间(最大)6.81s
响应时间(总计)8.51s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.16s
响应时间(最大)1.55s
响应时间(总计)3.48s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.40s
响应时间(最大)5.40s
响应时间(总计)5.40s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.30s
响应时间(最大)1.30s
响应时间(总计)1.30s
|
| #99#99 |
GPT-5 Nanomedium
|
6.1… |
OpenAI |
$0.077
…
|
43.52s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 2 超时: 1
响应时间(平均)43.52s
响应时间(最大)204.02s
响应时间(总计)565.82s
…
|
- 总测试数
- 20
- 错误测试数
- 12
- 尝试通过率
- 55.0%
- 输入令牌
- 31,489
- 输出令牌
- 5,328
- 推理令牌
- 181,056
- 响应时间(平均)
- 43.52s
- 响应时间(总计)
- 565.82s
- 响应时间(最大)
- 204.02s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)25.50s
响应时间(最大)37.73s
响应时间(总计)51.00s
-
编程
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)47.80s
响应时间(最大)54.86s
响应时间(总计)95.59s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)65.96s
响应时间(最大)65.96s
响应时间(总计)65.96s
-
数据解析与提取
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)21.42s
响应时间(最大)21.42s
响应时间(总计)21.42s
-
领域专项
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)204.02s
响应时间(最大)204.02s
响应时间(总计)204.02s
-
通用智能
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)17.51s
响应时间(最大)17.51s
响应时间(总计)17.51s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.64s
响应时间(最大)15.64s
响应时间(总计)15.64s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)20.63s
响应时间(最大)22.94s
响应时间(总计)41.26s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)33.30s
响应时间(最大)33.30s
响应时间(总计)33.30s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)20.13s
响应时间(最大)20.13s
响应时间(总计)20.13s
|
| #100#100 |
DeepSeek V4 Prohigh
|
6.1… |
DeepSeek |
$0.062
↓
…
|
58.92s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 5 答案错误: 4 超时: 2 未遵循指令: 1
响应时间(平均)58.92s
响应时间(最大)358.35s
响应时间(总计)1119.51s
…
|
- 总测试数
- 20
- 错误测试数
- 12
- 尝试通过率
- 55.0%
- 输入令牌
- 30,514
- 输出令牌
- 12,244
- 推理令牌
- 53,958
- 响应时间(平均)
- 58.92s
- 响应时间(总计)
- 1119.51s
- 响应时间(最大)
- 358.35s
-
反AI技巧
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)16.53s
响应时间(最大)39.91s
响应时间(总计)66.11s
-
编程
: 2.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 超时: 1
响应时间(平均)51.77s
响应时间(最大)51.77s
响应时间(总计)51.77s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)65.02s
响应时间(最大)65.02s
响应时间(总计)65.02s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)23.62s
响应时间(最大)36.44s
响应时间(总计)47.24s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 超时: 1 答案错误: 1
响应时间(平均)205.66s
响应时间(最大)358.35s
响应时间(总计)616.97s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)25.09s
响应时间(最大)25.09s
响应时间(总计)25.09s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)41.16s
响应时间(最大)43.56s
响应时间(总计)82.32s
-
谜题求解
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)34.84s
响应时间(最大)76.46s
响应时间(总计)104.52s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.33s
响应时间(最大)21.33s
响应时间(总计)21.33s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)39.14s
响应时间(最大)39.14s
响应时间(总计)39.14s
|
| #102#102 |
Nemotron 3 Supermedium
|
5.9… |
NVIDIA |
$0.019
↑
…
|
20.87s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 3 API 错误: 2 无答案: 1 超时: 1
响应时间(平均)20.87s
响应时间(最大)87.80s
响应时间(总计)375.66s
…
|
- 总测试数
- 20
- 错误测试数
- 12
- 尝试通过率
- 43.3%
- 输入令牌
- 36,614
- 输出令牌
- 14,505
- 推理令牌
- 30,178
- 响应时间(平均)
- 20.87s
- 响应时间(总计)
- 375.66s
- 响应时间(最大)
- 87.80s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)7.85s
响应时间(最大)22.30s
响应时间(总计)31.40s
-
编程
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)62.38s
响应时间(最大)62.38s
响应时间(总计)62.38s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)87.80s
响应时间(最大)87.80s
响应时间(总计)87.80s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)18.16s
响应时间(最大)20.65s
响应时间(总计)36.33s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)16.19s
响应时间(最大)21.56s
响应时间(总计)32.39s
-
通用智能
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)6.91s
响应时间(最大)6.91s
响应时间(总计)6.91s
-
指令遵循
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)6.97s
响应时间(最大)11.23s
响应时间(总计)13.95s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)3.15s
响应时间(最大)4.52s
响应时间(总计)9.45s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)39.75s
响应时间(最大)39.75s
响应时间(总计)39.75s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)55.32s
响应时间(最大)55.32s
响应时间(总计)55.32s
|
| #103#103 |
gpt-oss-120bmedium
|
5.9… |
OpenAI |
$0.012
↓
…
|
22.41s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 3
响应时间(平均)22.41s
响应时间(最大)68.16s
响应时间(总计)291.35s
…
|
- 总测试数
- 20
- 错误测试数
- 12
- 尝试通过率
- 50.0%
- 输入令牌
- 36,355
- 输出令牌
- 17,495
- 推理令牌
- 46,878
- 响应时间(平均)
- 22.41s
- 响应时间(总计)
- 291.35s
- 响应时间(最大)
- 68.16s
-
反AI技巧
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)10.21s
响应时间(最大)19.76s
响应时间(总计)20.43s
-
编程
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)47.24s
响应时间(最大)68.16s
响应时间(总计)94.49s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)31.18s
响应时间(最大)31.18s
响应时间(总计)31.18s
-
数据解析与提取
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.98s
响应时间(最大)1.98s
响应时间(总计)1.98s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)50.92s
响应时间(最大)50.92s
响应时间(总计)50.92s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)7.90s
响应时间(最大)7.90s
响应时间(总计)7.90s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.63s
响应时间(最大)7.63s
响应时间(总计)7.63s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)21.71s
响应时间(最大)32.40s
响应时间(总计)43.41s
-
工具调用
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.91s
响应时间(最大)6.91s
响应时间(总计)6.91s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)26.51s
响应时间(最大)26.51s
响应时间(总计)26.51s
|
| #104#104 |
Qwen3.5-Flashnone
|
5.9… |
Qwen |
$0.004
↓
…
|
3.74s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12
响应时间(平均)3.74s
响应时间(最大)27.18s
响应时间(总计)74.71s
…
|
- 总测试数
- 20
- 错误测试数
- 12
- 尝试通过率
- 41.7%
- 输入令牌
- 43,598
- 输出令牌
- 4,270
- 推理令牌
- 0
- 响应时间(平均)
- 3.74s
- 响应时间(总计)
- 74.71s
- 响应时间(最大)
- 27.18s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.32s
响应时间(最大)3.89s
响应时间(总计)5.30s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)993ms
响应时间(最大)1.29s
响应时间(总计)1.99s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.22s
响应时间(最大)6.22s
响应时间(总计)6.22s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.57s
响应时间(最大)1.83s
响应时间(总计)3.14s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)905ms
响应时间(最大)1.10s
响应时间(总计)2.71s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)803ms
响应时间(最大)803ms
响应时间(总计)803ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)8.81s
响应时间(最大)13.73s
响应时间(总计)17.61s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)10.89s
响应时间(最大)27.18s
响应时间(总计)32.68s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.67s
响应时间(最大)3.67s
响应时间(总计)3.67s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)588ms
响应时间(最大)588ms
响应时间(总计)588ms
|
| #105#105 |
GLM 5V Turbonone
|
5.9… |
Z.ai |
$0.049
…
|
3.04s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 2
响应时间(平均)3.04s
响应时间(最大)6.51s
响应时间(总计)60.88s
…
|
- 总测试数
- 20
- 错误测试数
- 12
- 尝试通过率
- 40.0%
- 输入令牌
- 34,502
- 输出令牌
- 1,760
- 推理令牌
- 0
- 响应时间(平均)
- 3.04s
- 响应时间(总计)
- 60.88s
- 响应时间(最大)
- 6.51s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)3.13s
响应时间(最大)5.90s
响应时间(总计)12.50s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.77s
响应时间(最大)5.30s
响应时间(总计)7.54s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.51s
响应时间(最大)6.51s
响应时间(总计)6.51s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.81s
响应时间(最大)5.69s
响应时间(总计)7.62s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.09s
响应时间(最大)2.39s
响应时间(总计)6.26s
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.22s
响应时间(最大)2.22s
响应时间(总计)2.22s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.97s
响应时间(最大)2.43s
响应时间(总计)3.93s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.40s
响应时间(最大)3.81s
响应时间(总计)7.21s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.86s
响应时间(最大)4.86s
响应时间(总计)4.86s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.23s
响应时间(最大)2.23s
响应时间(总计)2.23s
|
| #106#106 |
Seed-2.0-Litenone
|
5.9… |
Bytedance Seed |
$0.018
…
|
2.48s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12
响应时间(平均)2.48s
响应时间(最大)6.70s
响应时间(总计)49.67s
…
|
- 总测试数
- 20
- 错误测试数
- 12
- 尝试通过率
- 48.3%
- 输入令牌
- 43,630
- 输出令牌
- 3,253
- 推理令牌
- 0
- 响应时间(平均)
- 2.48s
- 响应时间(总计)
- 49.67s
- 响应时间(最大)
- 6.70s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.43s
响应时间(最大)6.70s
响应时间(总计)9.73s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.95s
响应时间(最大)4.61s
响应时间(总计)5.89s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.59s
响应时间(最大)6.59s
响应时间(总计)6.59s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.82s
响应时间(最大)1.97s
响应时间(总计)3.63s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.33s
响应时间(最大)1.53s
响应时间(总计)4.00s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.45s
响应时间(最大)3.45s
响应时间(总计)3.45s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.06s
响应时间(最大)1.09s
响应时间(总计)2.12s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.78s
响应时间(最大)5.20s
响应时间(总计)8.34s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.94s
响应时间(最大)3.94s
响应时间(总计)3.94s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.96s
响应时间(最大)1.96s
响应时间(总计)1.96s
|
| #107#107 |
Owl Alphamedium
|
5.8… |
Openrouter |
$0.000
…
|
11.64s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 2 API 错误: 1
响应时间(平均)11.64s
响应时间(最大)58.63s
响应时间(总计)232.83s
…
|
- 总测试数
- 20
- 错误测试数
- 12
- 尝试通过率
- 41.7%
- 输入令牌
- 40,601
- 输出令牌
- 2,965
- 推理令牌
- 0
- 响应时间(平均)
- 11.64s
- 响应时间(总计)
- 232.83s
- 响应时间(最大)
- 58.63s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)3.97s
响应时间(最大)7.48s
响应时间(总计)15.89s
-
编程
: 6.6
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)19.08s
响应时间(最大)30.81s
响应时间(总计)38.16s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.01s
响应时间(最大)10.01s
响应时间(总计)10.01s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.64s
响应时间(最大)29.16s
响应时间(总计)43.28s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)8.58s
响应时间(最大)9.48s
响应时间(总计)25.74s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)58.63s
响应时间(最大)58.63s
响应时间(总计)58.63s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.15s
响应时间(最大)15.94s
响应时间(总计)20.30s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)3.40s
响应时间(最大)4.60s
响应时间(总计)10.19s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.26s
响应时间(最大)8.26s
响应时间(总计)8.26s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.38s
响应时间(最大)2.38s
响应时间(总计)2.38s
|
| #101#101 |
Grok Build 0.1none已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.0… |
X AI |
$0.547
…
|
28.69s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 API 错误: 3 未遵循指令: 2
响应时间(平均)28.69s
响应时间(最大)138.35s
响应时间(总计)459.00s
…
|
- 总测试数
- 19
- 错误测试数
- 12
- 尝试通过率
- 50.9%
- 输入令牌
- 11,793
- 输出令牌
- 267,275
- 推理令牌
- 0
- 响应时间(平均)
- 28.69s
- 响应时间(总计)
- 459.00s
- 响应时间(最大)
- 138.35s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.30s
响应时间(最大)9.80s
响应时间(总计)25.20s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.41s
响应时间(最大)21.41s
响应时间(总计)21.41s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)9.33s
响应时间(最大)9.33s
响应时间(总计)9.33s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)103.71s
响应时间(最大)138.35s
响应时间(总计)311.13s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)12.47s
响应时间(最大)12.47s
响应时间(总计)12.47s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.36s
响应时间(最大)11.05s
响应时间(总计)14.73s
-
谜题求解
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)9.55s
响应时间(最大)18.18s
响应时间(总计)28.65s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)36.09s
响应时间(最大)36.09s
响应时间(总计)36.09s
|
| #108#108 |
GLM 5.1none
|
5.8… |
Z.ai |
$0.056
↓
…
|
4.20s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 无效工具调用: 1
响应时间(平均)4.20s
响应时间(最大)32.57s
响应时间(总计)83.95s
…
|
- 总测试数
- 20
- 错误测试数
- 13
- 尝试通过率
- 43.3%
- 输入令牌
- 44,535
- 输出令牌
- 3,748
- 推理令牌
- 0
- 响应时间(平均)
- 4.20s
- 响应时间(总计)
- 83.95s
- 响应时间(最大)
- 32.57s
-
反AI技巧
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.11s
响应时间(最大)3.94s
响应时间(总计)8.46s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)6.33s
响应时间(最大)9.79s
响应时间(总计)12.65s
-
综合
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)32.57s
响应时间(最大)32.57s
响应时间(总计)32.57s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.08s
响应时间(最大)1.62s
响应时间(总计)2.15s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.99s
响应时间(最大)3.99s
响应时间(总计)5.98s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)790ms
响应时间(最大)790ms
响应时间(总计)790ms
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.98s
响应时间(最大)2.28s
响应时间(总计)3.97s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.45s
响应时间(最大)2.09s
响应时间(总计)4.36s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.68s
响应时间(最大)10.68s
响应时间(总计)10.68s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.34s
响应时间(最大)2.34s
响应时间(总计)2.34s
|
| #109#109 |
DeepSeek V4 Pronone
|
5.8… |
DeepSeek |
$0.024
↓
…
|
12.91s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 2 API 错误: 1 额外格式: 1
响应时间(平均)12.91s
响应时间(最大)58.65s
响应时间(总计)258.27s
…
|
- 总测试数
- 20
- 错误测试数
- 13
- 尝试通过率
- 45.0%
- 输入令牌
- 42,256
- 输出令牌
- 5,345
- 推理令牌
- 0
- 响应时间(平均)
- 12.91s
- 响应时间(总计)
- 258.27s
- 响应时间(最大)
- 58.65s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)14.02s
响应时间(最大)38.83s
响应时间(总计)56.07s
-
编程
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)8.27s
响应时间(最大)14.69s
响应时间(总计)16.54s
-
综合
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)25.49s
响应时间(最大)25.49s
响应时间(总计)25.49s
-
数据解析与提取
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)30.54s
响应时间(最大)58.65s
响应时间(总计)61.08s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.17s
响应时间(最大)6.59s
响应时间(总计)9.52s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.75s
响应时间(最大)3.75s
响应时间(总计)3.75s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)8.23s
响应时间(最大)13.43s
响应时间(总计)16.45s
-
谜题求解
: 7.6
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)15.95s
响应时间(最大)27.12s
响应时间(总计)47.86s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.92s
响应时间(最大)5.92s
响应时间(总计)5.92s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)15.59s
响应时间(最大)15.59s
响应时间(总计)15.59s
|
| #110#110 |
Qwen3.5 Plus 2026-04-20none
|
5.8… |
Qwen |
$0.031
↓
…
|
4.57s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 2
响应时间(平均)4.57s
响应时间(最大)33.34s
响应时间(总计)91.37s
…
|
- 总测试数
- 20
- 错误测试数
- 13
- 尝试通过率
- 43.3%
- 输入令牌
- 36,069
- 输出令牌
- 11,139
- 推理令牌
- 0
- 响应时间(平均)
- 4.57s
- 响应时间(总计)
- 91.37s
- 响应时间(最大)
- 33.34s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.88s
响应时间(最大)4.81s
响应时间(总计)7.53s
-
编程
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.08s
响应时间(最大)3.20s
响应时间(总计)4.17s
-
综合
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)13.32s
响应时间(最大)13.32s
响应时间(总计)13.32s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.82s
响应时间(最大)3.86s
响应时间(总计)5.65s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.43s
响应时间(最大)10.83s
响应时间(总计)13.28s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.41s
响应时间(最大)1.41s
响应时间(总计)1.41s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.17s
响应时间(最大)1.33s
响应时间(总计)2.35s
-
谜题求解
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.97s
响应时间(最大)3.43s
响应时间(总计)5.91s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.42s
响应时间(最大)4.42s
响应时间(总计)4.42s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)33.34s
响应时间(最大)33.34s
响应时间(总计)33.34s
|
| #111#111 |
Qwen3.5-35B-A3Bnone
|
5.8… |
Qwen |
$0.011
↓
…
|
3.50s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 2
响应时间(平均)3.50s
响应时间(最大)47.43s
响应时间(总计)70.00s
…
|
- 总测试数
- 20
- 错误测试数
- 13
- 尝试通过率
- 45.0%
- 输入令牌
- 45,353
- 输出令牌
- 4,334
- 推理令牌
- 0
- 响应时间(平均)
- 3.50s
- 响应时间(总计)
- 70.00s
- 响应时间(最大)
- 47.43s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.43s
响应时间(最大)4.39s
响应时间(总计)5.71s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.72s
响应时间(最大)2.67s
响应时间(总计)3.43s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)47.43s
响应时间(最大)47.43s
响应时间(总计)47.43s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.16s
响应时间(最大)1.42s
响应时间(总计)2.33s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)485ms
响应时间(最大)549ms
响应时间(总计)1.45s
-
通用智能
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.19s
响应时间(最大)1.19s
响应时间(总计)1.19s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)809ms
响应时间(最大)983ms
响应时间(总计)1.62s
-
谜题求解
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.35s
响应时间(最大)2.26s
响应时间(总计)4.05s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.30s
响应时间(最大)2.30s
响应时间(总计)2.30s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)493ms
响应时间(最大)493ms
响应时间(总计)493ms
|
| #113#113 |
Qwen3.5-27Bnone
|
5.8… |
Qwen |
$0.014
↓
…
|
1.69s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 2
响应时间(平均)1.69s
响应时间(最大)9.39s
响应时间(总计)33.82s
…
|
- 总测试数
- 20
- 错误测试数
- 13
- 尝试通过率
- 40.0%
- 输入令牌
- 41,637
- 输出令牌
- 3,585
- 推理令牌
- 0
- 响应时间(平均)
- 1.69s
- 响应时间(总计)
- 33.82s
- 响应时间(最大)
- 9.39s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)788ms
响应时间(最大)1.34s
响应时间(总计)3.15s
-
编程
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.98s
响应时间(最大)2.51s
响应时间(总计)3.97s
-
综合
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.39s
响应时间(最大)9.39s
响应时间(总计)9.39s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.43s
响应时间(最大)1.45s
响应时间(总计)2.86s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)540ms
响应时间(最大)649ms
响应时间(总计)1.62s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.51s
响应时间(最大)2.51s
响应时间(总计)2.51s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.03s
响应时间(最大)1.40s
响应时间(总计)2.06s
-
谜题求解
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.38s
响应时间(最大)2.24s
响应时间(总计)4.13s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.54s
响应时间(最大)3.54s
响应时间(总计)3.54s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)599ms
响应时间(最大)599ms
响应时间(总计)599ms
|
| #114#114 |
Qwen3.6 27Bnone
|
5.8… |
Qwen |
$0.027
↓
…
|
3.85s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 2 无效工具调用: 1
响应时间(平均)3.85s
响应时间(最大)11.82s
响应时间(总计)77.09s
…
|
- 总测试数
- 20
- 错误测试数
- 13
- 尝试通过率
- 50.0%
- 输入令牌
- 49,880
- 输出令牌
- 3,804
- 推理令牌
- 0
- 响应时间(平均)
- 3.85s
- 响应时间(总计)
- 77.09s
- 响应时间(最大)
- 11.82s
-
反AI技巧
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.83s
响应时间(最大)7.62s
响应时间(总计)11.33s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.75s
响应时间(最大)10.18s
响应时间(总计)11.51s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)9.95s
响应时间(最大)9.95s
响应时间(总计)9.95s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.06s
响应时间(最大)2.39s
响应时间(总计)4.11s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.03s
响应时间(最大)4.83s
响应时间(总计)9.08s
-
通用智能
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.07s
响应时间(最大)1.07s
响应时间(总计)1.07s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.92s
响应时间(最大)1.94s
响应时间(总计)3.83s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)5.15s
响应时间(最大)11.82s
响应时间(总计)15.45s
-
工具调用
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.74s
响应时间(最大)6.74s
响应时间(总计)6.74s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.03s
响应时间(最大)4.03s
响应时间(总计)4.03s
|
| #116#116 |
Cobuddymedium
|
5.8… |
Baidu |
$0.000
…
|
39.90s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 3 无效工具调用: 1
响应时间(平均)39.90s
响应时间(最大)309.02s
响应时间(总计)797.98s
…
|
- 总测试数
- 20
- 错误测试数
- 13
- 尝试通过率
- 50.0%
- 输入令牌
- 37,449
- 输出令牌
- 1,677
- 推理令牌
- 116,703
- 响应时间(平均)
- 39.90s
- 响应时间(总计)
- 797.98s
- 响应时间(最大)
- 309.02s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.00s
响应时间(最大)11.53s
响应时间(总计)39.99s
-
编程
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)79.17s
响应时间(最大)104.76s
响应时间(总计)158.35s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)47.38s
响应时间(最大)47.38s
响应时间(总计)47.38s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.36s
响应时间(最大)26.57s
响应时间(总计)34.71s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)128.15s
响应时间(最大)309.02s
响应时间(总计)384.46s
-
通用智能
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)23.23s
响应时间(最大)23.23s
响应时间(总计)23.23s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.60s
响应时间(最大)14.49s
响应时间(总计)23.20s
-
谜题求解
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)12.83s
响应时间(最大)24.40s
响应时间(总计)38.49s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.19s
响应时间(最大)11.19s
响应时间(总计)11.19s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)36.98s
响应时间(最大)36.98s
响应时间(总计)36.98s
|
| #117#117 |
Mimo V2 PROnone
|
5.7… |
Xiaomi |
$0.045
↓
…
|
2.27s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 2
响应时间(平均)2.27s
响应时间(最大)6.58s
响应时间(总计)45.50s
…
|
- 总测试数
- 20
- 错误测试数
- 13
- 尝试通过率
- 43.3%
- 输入令牌
- 39,344
- 输出令牌
- 2,352
- 推理令牌
- 0
- 响应时间(平均)
- 2.27s
- 响应时间(总计)
- 45.50s
- 响应时间(最大)
- 6.58s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.80s
响应时间(最大)2.62s
响应时间(总计)7.19s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.65s
响应时间(最大)3.82s
响应时间(总计)5.30s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.58s
响应时间(最大)6.58s
响应时间(总计)6.58s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.39s
响应时间(最大)1.42s
响应时间(总计)2.78s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.78s
响应时间(最大)2.49s
响应时间(总计)5.34s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.44s
响应时间(最大)2.44s
响应时间(总计)2.44s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.51s
响应时间(最大)2.95s
响应时间(总计)5.02s
-
谜题求解
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.61s
响应时间(最大)2.15s
响应时间(总计)4.83s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.39s
响应时间(最大)4.39s
响应时间(总计)4.39s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.63s
响应时间(最大)1.63s
响应时间(总计)1.63s
|
| #118#118 |
Owl Alphanone
|
5.7… |
Openrouter |
$0.000
…
|
8.80s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 3 额外格式: 1
响应时间(平均)8.80s
响应时间(最大)47.10s
响应时间(总计)176.09s
…
|
- 总测试数
- 20
- 错误测试数
- 13
- 尝试通过率
- 38.3%
- 输入令牌
- 39,406
- 输出令牌
- 4,802
- 推理令牌
- 0
- 响应时间(平均)
- 8.80s
- 响应时间(总计)
- 176.09s
- 响应时间(最大)
- 47.10s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)2.78s
响应时间(最大)3.09s
响应时间(总计)11.10s
-
编程
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)39.68s
响应时间(最大)47.10s
响应时间(总计)79.37s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)21.74s
响应时间(最大)21.74s
响应时间(总计)21.74s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.60s
响应时间(最大)3.92s
响应时间(总计)7.19s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.00s
响应时间(最大)4.69s
响应时间(总计)8.99s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.61s
响应时间(最大)4.61s
响应时间(总计)4.61s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.63s
响应时间(最大)2.77s
响应时间(总计)5.27s
-
谜题求解
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)4.18s
响应时间(最大)8.27s
响应时间(总计)12.54s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)22.78s
响应时间(最大)22.78s
响应时间(总计)22.78s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.50s
响应时间(最大)2.50s
响应时间(总计)2.50s
|
| #121#121 |
GPT-5.4none
|
5.6… |
OpenAI |
$0.116
…
|
1.45s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 未遵循指令: 1
响应时间(平均)1.45s
响应时间(最大)2.95s
响应时间(总计)29.00s
…
|
- 总测试数
- 20
- 错误测试数
- 13
- 尝试通过率
- 38.3%
- 输入令牌
- 31,593
- 输出令牌
- 2,402
- 推理令牌
- 0
- 响应时间(平均)
- 1.45s
- 响应时间(总计)
- 29.00s
- 响应时间(最大)
- 2.95s
-
反AI技巧
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.21s
响应时间(最大)2.58s
响应时间(总计)4.85s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.99s
响应时间(最大)2.95s
响应时间(总计)3.97s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.89s
响应时间(最大)2.89s
响应时间(总计)2.89s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.04s
响应时间(最大)1.06s
响应时间(总计)2.08s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.07s
响应时间(最大)1.54s
响应时间(总计)3.22s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.78s
响应时间(最大)1.78s
响应时间(总计)1.78s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.07s
响应时间(最大)1.17s
响应时间(总计)2.15s
-
谜题求解
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.44s
响应时间(最大)1.82s
响应时间(总计)4.33s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.75s
响应时间(最大)2.75s
响应时间(总计)2.75s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)990ms
响应时间(最大)990ms
响应时间(总计)990ms
|
| #123#123 |
Kimi K2.6none
|
5.6… |
Moonshot AI |
$0.077
↓
…
|
13.82s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 3
响应时间(平均)13.82s
响应时间(最大)238.89s
响应时间(总计)276.39s
…
|
- 总测试数
- 20
- 错误测试数
- 13
- 尝试通过率
- 38.3%
- 输入令牌
- 30,318
- 输出令牌
- 16,405
- 推理令牌
- 0
- 响应时间(平均)
- 13.82s
- 响应时间(总计)
- 276.39s
- 响应时间(最大)
- 238.89s
-
反AI技巧
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.39s
响应时间(最大)2.96s
响应时间(总计)5.56s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)122.77s
响应时间(最大)238.89s
响应时间(总计)245.54s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.38s
响应时间(最大)3.38s
响应时间(总计)3.38s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.32s
响应时间(最大)1.39s
响应时间(总计)2.64s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.48s
响应时间(最大)1.85s
响应时间(总计)4.45s
-
通用智能
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.55s
响应时间(最大)1.55s
响应时间(总计)1.55s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.64s
响应时间(最大)1.80s
响应时间(总计)3.28s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.40s
响应时间(最大)1.81s
响应时间(总计)4.19s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.46s
响应时间(最大)4.46s
响应时间(总计)4.46s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.36s
响应时间(最大)1.36s
响应时间(总计)1.36s
|
| #124#124 |
Qwen3.6 Flashnone
|
5.5… |
Qwen |
$0.014
↓
…
|
1.65s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 1 无效工具调用: 1
响应时间(平均)1.65s
响应时间(最大)4.60s
响应时间(总计)32.91s
…
|
- 总测试数
- 20
- 错误测试数
- 13
- 尝试通过率
- 35.0%
- 输入令牌
- 47,969
- 输出令牌
- 4,158
- 推理令牌
- 0
- 响应时间(平均)
- 1.65s
- 响应时间(总计)
- 32.91s
- 响应时间(最大)
- 4.60s
-
反AI技巧
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.63s
响应时间(最大)4.60s
响应时间(总计)6.51s
-
编程
: 6.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.34s
响应时间(最大)2.46s
响应时间(总计)4.68s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)4.22s
响应时间(最大)4.22s
响应时间(总计)4.22s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.13s
响应时间(最大)3.35s
响应时间(总计)4.26s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.11s
响应时间(最大)1.89s
响应时间(总计)3.32s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)947ms
响应时间(最大)947ms
响应时间(总计)947ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.10s
响应时间(最大)1.36s
响应时间(总计)2.19s
-
谜题求解
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.21s
响应时间(最大)1.80s
响应时间(总计)3.64s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.49s
响应时间(最大)2.49s
响应时间(总计)2.49s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)649ms
响应时间(最大)649ms
响应时间(总计)649ms
|
| #112#112 |
Grok 4.20 Betanone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.8… |
X AI |
$0.087
↓
…
|
1.19s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 1 无效工具调用: 1
响应时间(平均)1.19s
响应时间(最大)6.48s
响应时间(总计)21.43s
…
|
- 总测试数
- 18
- 错误测试数
- 12
- 尝试通过率
- 37.0%
- 输入令牌
- 40,597
- 输出令牌
- 1,657
- 推理令牌
- 0
- 响应时间(平均)
- 1.19s
- 响应时间(总计)
- 21.43s
- 响应时间(最大)
- 6.48s
-
反AI技巧
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)597ms
响应时间(最大)866ms
响应时间(总计)2.39s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.14s
响应时间(最大)1.14s
响应时间(总计)1.14s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)6.48s
响应时间(最大)6.48s
响应时间(总计)6.48s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)601ms
响应时间(最大)634ms
响应时间(总计)1.20s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)611ms
响应时间(最大)616ms
响应时间(总计)1.83s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)541ms
响应时间(最大)541ms
响应时间(总计)541ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)649ms
响应时间(最大)952ms
响应时间(总计)1.30s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)586ms
响应时间(最大)813ms
响应时间(总计)1.76s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.79s
响应时间(最大)4.79s
响应时间(总计)4.79s
|