| #96#96 |
Ring-2.6-1Tnone
|
6.2… |
Inclusionai |
$0.026
…
|
55.10s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 5 答案错误: 5 未遵循指令: 2
响应时间(平均)55.10s
响应时间(最大)143.82s
响应时间(总计)881.55s
…
|
- 总测试数
- 21
- 错误测试数
- 12
- 尝试通过率
- 47.6%
- 输入令牌
- 7,599
- 输出令牌
- 39,954
- 推理令牌
- 0
- 响应时间(平均)
- 55.10s
- 响应时间(总计)
- 881.55s
- 响应时间(最大)
- 143.82s
-
反AI技巧
: 9.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)43.33s
响应时间(最大)71.76s
响应时间(总计)173.31s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)143.82s
响应时间(最大)143.82s
响应时间(总计)143.82s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)45.87s
响应时间(最大)45.87s
响应时间(总计)45.87s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)73.40s
响应时间(最大)90.09s
响应时间(总计)220.20s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)15.63s
响应时间(最大)15.63s
响应时间(总计)15.63s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)27.36s
响应时间(最大)40.24s
响应时间(总计)54.72s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)31.47s
响应时间(最大)46.84s
响应时间(总计)94.41s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)133.60s
响应时间(最大)133.60s
响应时间(总计)133.60s
|
| #98#98 |
GLM 5none
|
6.1… |
Z.ai |
$0.027
↑
…
|
4.03s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12
响应时间(平均)4.03s
响应时间(最大)11.07s
响应时间(总计)56.37s
…
|
- 总测试数
- 21
- 错误测试数
- 12
- 尝试通过率
- 44.4%
- 输入令牌
- 37,135
- 输出令牌
- 1,989
- 推理令牌
- 0
- 响应时间(平均)
- 4.03s
- 响应时间(总计)
- 56.37s
- 响应时间(最大)
- 11.07s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.37s
响应时间(最大)3.39s
响应时间(总计)4.75s
-
编程
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)5.12s
响应时间(最大)8.84s
响应时间(总计)15.36s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.98s
响应时间(最大)4.98s
响应时间(总计)4.98s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.78s
响应时间(最大)5.78s
响应时间(总计)5.78s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.24s
响应时间(最大)2.24s
响应时间(总计)2.24s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.27s
响应时间(最大)3.27s
响应时间(总计)3.27s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.48s
响应时间(最大)1.48s
响应时间(总计)1.48s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.91s
响应时间(最大)2.08s
响应时间(总计)3.82s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.07s
响应时间(最大)11.07s
响应时间(总计)11.07s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.62s
响应时间(最大)3.62s
响应时间(总计)3.62s
|
| #135#135 |
Kimi K2.5none
|
5.2… |
Moonshot AI |
$0.028
↑
…
|
13.18s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 15
响应时间(平均)13.18s
响应时间(最大)42.13s
响应时间(总计)184.47s
…
|
- 总测试数
- 21
- 错误测试数
- 15
- 尝试通过率
- 34.9%
- 输入令牌
- 36,034
- 输出令牌
- 6,657
- 推理令牌
- 0
- 响应时间(平均)
- 13.18s
- 响应时间(总计)
- 184.47s
- 响应时间(最大)
- 42.13s
-
反AI技巧
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)6.24s
响应时间(最大)11.38s
响应时间(总计)12.48s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)24.56s
响应时间(最大)38.78s
响应时间(总计)73.69s
-
综合
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)19.16s
响应时间(最大)19.16s
响应时间(总计)19.16s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)42.13s
响应时间(最大)42.13s
响应时间(总计)42.13s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.38s
响应时间(最大)4.38s
响应时间(总计)4.38s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.00s
响应时间(最大)4.00s
响应时间(总计)4.00s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.67s
响应时间(最大)2.67s
响应时间(总计)2.67s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)4.04s
响应时间(最大)7.81s
响应时间(总计)8.08s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.99s
响应时间(最大)13.99s
响应时间(总计)13.99s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.90s
响应时间(最大)3.90s
响应时间(总计)3.90s
|
| #61#61 |
Gemini 3.1 Flash Litelow
|
7.2… |
Google |
$0.028
…
|
1.89s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9
响应时间(平均)1.89s
响应时间(最大)5.66s
响应时间(总计)39.62s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 61.9%
- 输入令牌
- 36,892
- 输出令牌
- 2,732
- 推理令牌
- 9,260
- 响应时间(平均)
- 1.89s
- 响应时间(总计)
- 39.62s
- 响应时间(最大)
- 5.66s
-
反AI技巧
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.84s
响应时间(最大)3.08s
响应时间(总计)7.37s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.53s
响应时间(最大)1.97s
响应时间(总计)4.58s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.48s
响应时间(最大)4.48s
响应时间(总计)4.48s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.44s
响应时间(最大)1.51s
响应时间(总计)2.89s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.52s
响应时间(最大)1.63s
响应时间(总计)4.57s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.37s
响应时间(最大)1.37s
响应时间(总计)1.37s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.52s
响应时间(最大)1.68s
响应时间(总计)3.04s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.40s
响应时间(最大)1.41s
响应时间(总计)4.20s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.66s
响应时间(最大)5.66s
响应时间(总计)5.66s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.46s
响应时间(最大)1.46s
响应时间(总计)1.46s
|
| #118#118 |
Qwen3.6 27Bnone
|
5.6… |
Qwen |
$0.028
↓
…
|
3.72s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 2 无效工具调用: 1
响应时间(平均)3.72s
响应时间(最大)11.82s
响应时间(总计)78.08s
…
|
- 总测试数
- 21
- 错误测试数
- 14
- 尝试通过率
- 47.6%
- 输入令牌
- 52,721
- 输出令牌
- 3,812
- 推理令牌
- 0
- 响应时间(平均)
- 3.72s
- 响应时间(总计)
- 78.08s
- 响应时间(最大)
- 11.82s
-
反AI技巧
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.83s
响应时间(最大)7.62s
响应时间(总计)11.33s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.16s
响应时间(最大)10.18s
响应时间(总计)12.49s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)9.95s
响应时间(最大)9.95s
响应时间(总计)9.95s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.06s
响应时间(最大)2.39s
响应时间(总计)4.11s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.03s
响应时间(最大)4.83s
响应时间(总计)9.08s
-
通用智能
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.07s
响应时间(最大)1.07s
响应时间(总计)1.07s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.92s
响应时间(最大)1.94s
响应时间(总计)3.83s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)5.15s
响应时间(最大)11.82s
响应时间(总计)15.45s
-
工具调用
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.74s
响应时间(最大)6.74s
响应时间(总计)6.74s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.03s
响应时间(最大)4.03s
响应时间(总计)4.03s
|
| #88#88 |
Qwen3.7 Plusnone
|
6.4… |
Qwen |
$0.028
…
|
2.85s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 1
响应时间(平均)2.85s
响应时间(最大)29.38s
响应时间(总计)59.86s
…
|
- 总测试数
- 21
- 错误测试数
- 11
- 尝试通过率
- 47.6%
- 输入令牌
- 42,510
- 输出令牌
- 6,578
- 推理令牌
- 0
- 响应时间(平均)
- 2.85s
- 响应时间(总计)
- 59.86s
- 响应时间(最大)
- 29.38s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.38s
响应时间(最大)2.69s
响应时间(总计)5.51s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.15s
响应时间(最大)4.39s
响应时间(总计)6.44s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)29.38s
响应时间(最大)29.38s
响应时间(总计)29.38s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.43s
响应时间(最大)1.57s
响应时间(总计)2.86s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)868ms
响应时间(最大)1.02s
响应时间(总计)2.60s
-
通用智能
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.33s
响应时间(最大)1.33s
响应时间(总计)1.33s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)929ms
响应时间(最大)1.05s
响应时间(总计)1.86s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.71s
响应时间(最大)2.65s
响应时间(总计)5.13s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.54s
响应时间(最大)3.54s
响应时间(总计)3.54s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.21s
响应时间(最大)1.21s
响应时间(总计)1.21s
|
| #31#31 |
DeepSeek V4 Flashhigh
|
7.7… |
DeepSeek |
$0.029
↓
…
|
45.85s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 2
响应时间(平均)45.85s
响应时间(最大)218.13s
响应时间(总计)962.79s
…
|
- 总测试数
- 21
- 错误测试数
- 8
- 尝试通过率
- 74.6%
- 输入令牌
- 39,745
- 输出令牌
- 10,310
- 推理令牌
- 123,501
- 响应时间(平均)
- 45.85s
- 响应时间(总计)
- 962.79s
- 响应时间(最大)
- 218.13s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)28.51s
响应时间(最大)39.73s
响应时间(总计)114.05s
-
编程
: 7.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)50.60s
响应时间(最大)62.48s
响应时间(总计)151.79s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)76.57s
响应时间(最大)76.57s
响应时间(总计)76.57s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)28.03s
响应时间(最大)30.49s
响应时间(总计)56.07s
-
领域专项
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)100.31s
响应时间(最大)218.13s
响应时间(总计)300.92s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)25.15s
响应时间(最大)25.15s
响应时间(总计)25.15s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.36s
响应时间(最大)19.53s
响应时间(总计)30.73s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)26.11s
响应时间(最大)32.37s
响应时间(总计)78.32s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)74.73s
响应时间(最大)74.73s
响应时间(总计)74.73s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)54.46s
响应时间(最大)54.46s
响应时间(总计)54.46s
|
| #153#153 |
Qwen3.6 35B A3Bnone
|
4.6… |
Qwen |
$0.031
↑
…
|
3.73s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 API 错误: 2 未遵循指令: 2
响应时间(平均)3.73s
响应时间(最大)22.52s
响应时间(总计)70.86s
…
|
- 总测试数
- 21
- 错误测试数
- 17
- 尝试通过率
- 30.2%
- 输入令牌
- 19,329
- 输出令牌
- 27,755
- 推理令牌
- 0
- 响应时间(平均)
- 3.73s
- 响应时间(总计)
- 70.86s
- 响应时间(最大)
- 22.52s
-
反AI技巧
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.10s
响应时间(最大)6.15s
响应时间(总计)8.41s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)8.77s
响应时间(最大)22.52s
响应时间(总计)26.32s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.46s
响应时间(最大)2.03s
响应时间(总计)2.93s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)7.45s
响应时间(最大)12.46s
响应时间(总计)22.35s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.51s
响应时间(最大)3.51s
响应时间(总计)3.51s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.86s
响应时间(最大)2.83s
响应时间(总计)3.73s
-
谜题求解
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2 答案错误: 1
响应时间(平均)1.07s
响应时间(最大)1.24s
响应时间(总计)3.20s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)414ms
响应时间(最大)414ms
响应时间(总计)414ms
|
| #114#114 |
Qwen3.5 Plus 2026-04-20none
|
5.7… |
Qwen |
$0.032
↓
…
|
4.39s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 未遵循指令: 2
响应时间(平均)4.39s
响应时间(最大)33.34s
响应时间(总计)92.26s
…
|
- 总测试数
- 21
- 错误测试数
- 14
- 尝试通过率
- 41.3%
- 输入令牌
- 38,910
- 输出令牌
- 11,145
- 推理令牌
- 0
- 响应时间(平均)
- 4.39s
- 响应时间(总计)
- 92.26s
- 响应时间(最大)
- 33.34s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.88s
响应时间(最大)4.81s
响应时间(总计)7.53s
-
编程
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.69s
响应时间(最大)3.20s
响应时间(总计)5.06s
-
综合
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)13.32s
响应时间(最大)13.32s
响应时间(总计)13.32s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.82s
响应时间(最大)3.86s
响应时间(总计)5.65s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.43s
响应时间(最大)10.83s
响应时间(总计)13.28s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.41s
响应时间(最大)1.41s
响应时间(总计)1.41s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.17s
响应时间(最大)1.33s
响应时间(总计)2.35s
-
谜题求解
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.97s
响应时间(最大)3.43s
响应时间(总计)5.91s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.42s
响应时间(最大)4.42s
响应时间(总计)4.42s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)33.34s
响应时间(最大)33.34s
响应时间(总计)33.34s
|
| #75#75 |
Ring-2.6-1Tmedium
|
6.9… |
Inclusionai |
$0.033
…
|
61.29s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 API 错误: 2 未遵循指令: 2
响应时间(平均)61.29s
响应时间(最大)304.19s
响应时间(总计)1164.50s
…
|
- 总测试数
- 21
- 错误测试数
- 10
- 尝试通过率
- 60.3%
- 输入令牌
- 35,892
- 输出令牌
- 21,752
- 推理令牌
- 42,754
- 响应时间(平均)
- 61.29s
- 响应时间(总计)
- 1164.50s
- 响应时间(最大)
- 304.19s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)42.21s
响应时间(最大)89.34s
响应时间(总计)168.84s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)59.65s
响应时间(最大)59.65s
响应时间(总计)59.65s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)304.19s
响应时间(最大)304.19s
响应时间(总计)304.19s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)37.36s
响应时间(最大)54.24s
响应时间(总计)74.71s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)64.92s
响应时间(最大)150.55s
响应时间(总计)194.76s
-
通用智能
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)58.26s
响应时间(最大)58.26s
响应时间(总计)58.26s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.78s
响应时间(最大)17.75s
响应时间(总计)23.55s
-
谜题求解
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)20.73s
响应时间(最大)42.39s
响应时间(总计)62.19s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)104.44s
响应时间(最大)104.44s
响应时间(总计)104.44s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)113.91s
响应时间(最大)113.91s
响应时间(总计)113.91s
|
| #27#27 |
Gemma 4 31Bmedium
|
7.8… |
Google |
$0.035
↓
…
|
56.55s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2 超时: 2 答案错误: 2 无答案: 1
响应时间(平均)56.55s
响应时间(最大)437.40s
响应时间(总计)1074.41s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 69.8%
- 输入令牌
- 17,957
- 输出令牌
- 22,356
- 推理令牌
- 65,726
- 响应时间(平均)
- 56.55s
- 响应时间(总计)
- 1074.41s
- 响应时间(最大)
- 437.40s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.89s
响应时间(最大)26.66s
响应时间(总计)51.55s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 无答案: 1
响应时间(平均)219.76s
响应时间(最大)437.40s
响应时间(总计)659.27s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.11s
响应时间(最大)21.94s
响应时间(总计)42.21s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)38.48s
响应时间(最大)68.92s
响应时间(总计)115.43s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.57s
响应时间(最大)9.57s
响应时间(总计)9.57s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.76s
响应时间(最大)17.53s
响应时间(总计)25.52s
-
谜题求解
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)26.91s
响应时间(最大)61.08s
响应时间(总计)80.72s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)90.14s
响应时间(最大)90.14s
响应时间(总计)90.14s
|
| #161#161 |
Qwen3.5-9Bmedium
|
4.2… |
Qwen |
$0.035
↓
…
|
82.24s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 11 无答案: 2 答案错误: 2 API 错误: 1 额外格式: 1 未遵循指令: 1
响应时间(平均)82.24s
响应时间(最大)226.38s
响应时间(总计)1315.88s
…
|
- 总测试数
- 21
- 错误测试数
- 18
- 尝试通过率
- 27.0%
- 输入令牌
- 17,070
- 输出令牌
- 29,045
- 推理令牌
- 209,516
- 响应时间(平均)
- 82.24s
- 响应时间(总计)
- 1315.88s
- 响应时间(最大)
- 226.38s
-
反AI技巧
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 答案错误: 1
响应时间(平均)34.44s
响应时间(最大)57.86s
响应时间(总计)103.31s
-
编程
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 无答案: 1 超时: 1
响应时间(平均)100.88s
响应时间(最大)135.61s
响应时间(总计)201.75s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 超时: 1
响应时间(平均)87.31s
响应时间(最大)87.31s
响应时间(总计)87.31s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 3
响应时间(平均)137.75s
响应时间(最大)202.61s
响应时间(总计)413.24s
-
通用智能
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)226.38s
响应时间(最大)226.38s
响应时间(总计)226.38s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)5.75s
响应时间(最大)5.75s
响应时间(总计)5.75s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 答案错误: 1
响应时间(平均)32.27s
响应时间(最大)47.31s
响应时间(总计)96.80s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.31s
响应时间(最大)4.31s
响应时间(总计)4.31s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)177.02s
响应时间(最大)177.02s
响应时间(总计)177.02s
|
| #144#144 |
GPT-5.4 Mininone
|
4.9… |
OpenAI |
$0.038
…
|
1.13s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 3
响应时间(平均)1.13s
响应时间(最大)2.52s
响应时间(总计)23.82s
…
|
- 总测试数
- 21
- 错误测试数
- 16
- 尝试通过率
- 30.2%
- 输入令牌
- 34,244
- 输出令牌
- 2,541
- 推理令牌
- 0
- 响应时间(平均)
- 1.13s
- 响应时间(总计)
- 23.82s
- 响应时间(最大)
- 2.52s
-
反AI技巧
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)929ms
响应时间(最大)1.55s
响应时间(总计)3.72s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)913ms
响应时间(最大)1.19s
响应时间(总计)2.74s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.52s
响应时间(最大)2.52s
响应时间(总计)2.52s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.30s
响应时间(最大)1.58s
响应时间(总计)2.61s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)937ms
响应时间(最大)1.25s
响应时间(总计)2.81s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.82s
响应时间(最大)1.82s
响应时间(总计)1.82s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)728ms
响应时间(最大)731ms
响应时间(总计)1.46s
-
谜题求解
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)836ms
响应时间(最大)958ms
响应时间(总计)2.51s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.32s
响应时间(最大)2.32s
响应时间(总计)2.32s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.33s
响应时间(最大)1.33s
响应时间(总计)1.33s
|
| #64#64 |
MiMo-V2-Flashmedium
|
7.2… |
Xiaomi |
$0.043
↑
…
|
20.11s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 API 错误: 1 额外格式: 1 未遵循指令: 1 超时: 1
响应时间(平均)20.11s
响应时间(最大)96.01s
响应时间(总计)301.59s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 65.1%
- 输入令牌
- 40,111
- 输出令牌
- 12,476
- 推理令牌
- 125,039
- 响应时间(平均)
- 20.11s
- 响应时间(总计)
- 301.59s
- 响应时间(最大)
- 96.01s
-
反AI技巧
: 8.1
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)15.85s
响应时间(最大)20.83s
响应时间(总计)47.55s
-
编程
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)10.71s
响应时间(最大)17.72s
响应时间(总计)32.13s
-
综合
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)75.68s
响应时间(最大)75.68s
响应时间(总计)75.68s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)96.01s
响应时间(最大)96.01s
响应时间(总计)96.01s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.20s
响应时间(最大)4.20s
响应时间(总计)4.20s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.28s
响应时间(最大)7.37s
响应时间(总计)8.55s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.87s
响应时间(最大)5.26s
响应时间(总计)7.74s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)27.78s
响应时间(最大)27.78s
响应时间(总计)27.78s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.96s
响应时间(最大)1.96s
响应时间(总计)1.96s
|
| #73#73 |
Seed-2.0-Minimedium
|
6.9… |
Bytedance Seed |
$0.044
…
|
80.22s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 5 答案错误: 4 未遵循指令: 1
响应时间(平均)80.22s
响应时间(最大)262.83s
响应时间(总计)1363.72s
…
|
- 总测试数
- 21
- 错误测试数
- 10
- 尝试通过率
- 57.1%
- 输入令牌
- 41,904
- 输出令牌
- 2,555
- 推理令牌
- 95,974
- 响应时间(平均)
- 80.22s
- 响应时间(总计)
- 1363.72s
- 响应时间(最大)
- 262.83s
-
反AI技巧
: 6.6
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)74.75s
响应时间(最大)182.10s
响应时间(总计)298.98s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)220.48s
响应时间(最大)243.66s
响应时间(总计)440.97s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)262.83s
响应时间(最大)262.83s
响应时间(总计)262.83s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)24.27s
响应时间(最大)27.52s
响应时间(总计)48.54s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 3
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
通用智能
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)36.65s
响应时间(最大)36.65s
响应时间(总计)36.65s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.47s
响应时间(最大)19.46s
响应时间(总计)34.93s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)31.79s
响应时间(最大)50.78s
响应时间(总计)95.38s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)88.68s
响应时间(最大)88.68s
响应时间(总计)88.68s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)56.76s
响应时间(最大)56.76s
响应时间(总计)56.76s
|
| #72#72 |
DeepSeek V3.2medium
|
7.0… |
DeepSeek |
$0.044
↓
…
|
68.71s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 API 错误: 2 超时: 2 未遵循指令: 1
响应时间(平均)68.71s
响应时间(最大)376.10s
响应时间(总计)1442.81s
…
|
- 总测试数
- 21
- 错误测试数
- 10
- 尝试通过率
- 65.1%
- 输入令牌
- 38,333
- 输出令牌
- 7,186
- 推理令牌
- 99,081
- 响应时间(平均)
- 68.71s
- 响应时间(总计)
- 1442.81s
- 响应时间(最大)
- 376.10s
-
反AI技巧
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)24.23s
响应时间(最大)29.86s
响应时间(总计)96.93s
-
编程
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)248.68s
响应时间(最大)376.10s
响应时间(总计)746.04s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)93.11s
响应时间(最大)93.11s
响应时间(总计)93.11s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)36.09s
响应时间(最大)39.12s
响应时间(总计)72.18s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)24.27s
响应时间(最大)33.91s
响应时间(总计)72.82s
-
通用智能
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)58.29s
响应时间(最大)58.29s
响应时间(总计)58.29s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)35.78s
响应时间(最大)47.30s
响应时间(总计)71.56s
-
谜题求解
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)37.69s
响应时间(最大)59.22s
响应时间(总计)113.08s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)34.81s
响应时间(最大)34.81s
响应时间(总计)34.81s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)83.99s
响应时间(最大)83.99s
响应时间(总计)83.99s
|
| #37#37 |
Gemma 4 26B A4Bmedium
|
7.6… |
Google |
$0.045
↓
…
|
63.41s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 无答案: 2 超时: 2
响应时间(平均)63.41s
响应时间(最大)369.32s
响应时间(总计)1268.28s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 69.8%
- 输入令牌
- 40,252
- 输出令牌
- 28,000
- 推理令牌
- 100,490
- 响应时间(平均)
- 63.41s
- 响应时间(总计)
- 1268.28s
- 响应时间(最大)
- 369.32s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.20s
响应时间(最大)9.64s
响应时间(总计)24.78s
-
编程
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 2 超时: 1
响应时间(平均)272.54s
响应时间(最大)369.32s
响应时间(总计)817.61s
-
综合
: 9.6
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)73.55s
响应时间(最大)73.55s
响应时间(总计)73.55s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)16.51s
响应时间(最大)20.57s
响应时间(总计)33.02s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)23.62s
响应时间(最大)27.00s
响应时间(总计)47.23s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)29.76s
响应时间(最大)29.76s
响应时间(总计)29.76s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.54s
响应时间(最大)21.25s
响应时间(总计)35.08s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.79s
响应时间(最大)6.85s
响应时间(总计)17.36s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.01s
响应时间(最大)9.01s
响应时间(总计)9.01s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)180.87s
响应时间(最大)180.87s
响应时间(总计)180.87s
|
| #120#120 |
Mimo V2 PROnone
|
5.6… |
Xiaomi |
$0.045
↓
…
|
2.27s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 2 API 错误: 1
响应时间(平均)2.27s
响应时间(最大)6.58s
响应时间(总计)45.50s
…
|
- 总测试数
- 21
- 错误测试数
- 14
- 尝试通过率
- 41.3%
- 输入令牌
- 39,344
- 输出令牌
- 2,352
- 推理令牌
- 0
- 响应时间(平均)
- 2.27s
- 响应时间(总计)
- 45.50s
- 响应时间(最大)
- 6.58s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.80s
响应时间(最大)2.62s
响应时间(总计)7.19s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)2.65s
响应时间(最大)3.82s
响应时间(总计)5.30s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.58s
响应时间(最大)6.58s
响应时间(总计)6.58s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.39s
响应时间(最大)1.42s
响应时间(总计)2.78s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.78s
响应时间(最大)2.49s
响应时间(总计)5.34s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.44s
响应时间(最大)2.44s
响应时间(总计)2.44s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.51s
响应时间(最大)2.95s
响应时间(总计)5.02s
-
谜题求解
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.61s
响应时间(最大)2.15s
响应时间(总计)4.83s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.39s
响应时间(最大)4.39s
响应时间(总计)4.39s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.63s
响应时间(最大)1.63s
响应时间(总计)1.63s
|
| #134#134 |
GLM 5 Turbonone
|
5.2… |
Z.ai |
$0.047
↑
…
|
2.82s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 2
响应时间(平均)2.82s
响应时间(最大)8.21s
响应时间(总计)59.29s
…
|
- 总测试数
- 21
- 错误测试数
- 15
- 尝试通过率
- 31.8%
- 输入令牌
- 32,525
- 输出令牌
- 1,815
- 推理令牌
- 0
- 响应时间(平均)
- 2.82s
- 响应时间(总计)
- 59.29s
- 响应时间(最大)
- 8.21s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.84s
响应时间(最大)4.15s
响应时间(总计)11.35s
-
编程
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.41s
响应时间(最大)3.93s
响应时间(总计)7.22s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.89s
响应时间(最大)4.89s
响应时间(总计)4.89s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.47s
响应时间(最大)2.48s
响应时间(总计)4.95s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.97s
响应时间(最大)2.65s
响应时间(总计)5.92s
-
通用智能
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.18s
响应时间(最大)2.18s
响应时间(总计)2.18s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.13s
响应时间(最大)2.53s
响应时间(总计)4.27s
-
谜题求解
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.65s
响应时间(最大)3.34s
响应时间(总计)7.94s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.21s
响应时间(最大)8.21s
响应时间(总计)8.21s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.37s
响应时间(最大)2.37s
响应时间(总计)2.37s
|
| #82#82 |
Hy3 previewhigh已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.6… |
Tencent |
$0.048
…
|
56.57s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 7 答案错误: 3
响应时间(平均)56.57s
响应时间(最大)149.94s
响应时间(总计)848.59s
…
|
- 总测试数
- 21
- 错误测试数
- 10
- 尝试通过率
- 55.6%
- 输入令牌
- 25,987
- 输出令牌
- 216,719
- 推理令牌
- 0
- 响应时间(平均)
- 56.57s
- 响应时间(总计)
- 848.59s
- 响应时间(最大)
- 149.94s
-
反AI技巧
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)15.12s
响应时间(最大)19.99s
响应时间(总计)45.37s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)99.76s
响应时间(最大)99.76s
响应时间(总计)99.76s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)113.09s
响应时间(最大)113.09s
响应时间(总计)113.09s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)12.11s
响应时间(最大)12.11s
响应时间(总计)12.11s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)109.04s
响应时间(最大)149.94s
响应时间(总计)327.11s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)34.36s
响应时间(最大)41.83s
响应时间(总计)68.73s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)27.94s
响应时间(最大)45.06s
响应时间(总计)55.89s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)78.83s
响应时间(最大)78.83s
响应时间(总计)78.83s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)47.71s
响应时间(最大)47.71s
响应时间(总计)47.71s
|
| #109#109 |
GLM 5V Turbonone
|
5.8… |
Z.ai |
$0.052
…
|
2.99s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 2
响应时间(平均)2.99s
响应时间(最大)6.51s
响应时间(总计)62.74s
…
|
- 总测试数
- 21
- 错误测试数
- 13
- 尝试通过率
- 38.1%
- 输入令牌
- 37,100
- 输出令牌
- 1,766
- 推理令牌
- 0
- 响应时间(平均)
- 2.99s
- 响应时间(总计)
- 62.74s
- 响应时间(最大)
- 6.51s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)3.13s
响应时间(最大)5.90s
响应时间(总计)12.50s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.13s
响应时间(最大)5.30s
响应时间(总计)9.40s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.51s
响应时间(最大)6.51s
响应时间(总计)6.51s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.81s
响应时间(最大)5.69s
响应时间(总计)7.62s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.09s
响应时间(最大)2.39s
响应时间(总计)6.26s
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.22s
响应时间(最大)2.22s
响应时间(总计)2.22s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.97s
响应时间(最大)2.43s
响应时间(总计)3.93s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.40s
响应时间(最大)3.81s
响应时间(总计)7.21s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.86s
响应时间(最大)4.86s
响应时间(总计)4.86s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.23s
响应时间(最大)2.23s
响应时间(总计)2.23s
|
| #158#158 |
GLM 4.7 Flashmedium
|
4.4… |
Z.ai |
$0.054
…
|
35.10s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 无答案: 3 未遵循指令: 2 超时: 2 无效工具调用: 1
响应时间(平均)35.10s
响应时间(最大)174.55s
响应时间(总计)456.24s
…
|
- 总测试数
- 21
- 错误测试数
- 17
- 尝试通过率
- 33.3%
- 输入令牌
- 37,206
- 输出令牌
- 43,754
- 推理令牌
- 89,079
- 响应时间(平均)
- 35.10s
- 响应时间(总计)
- 456.24s
- 响应时间(最大)
- 174.55s
-
反AI技巧
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)14.95s
响应时间(最大)27.09s
响应时间(总计)29.90s
-
编程
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 无答案: 1
响应时间(平均)55.33s
响应时间(最大)89.40s
响应时间(总计)110.66s
-
综合
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)65.57s
响应时间(最大)65.57s
响应时间(总计)65.57s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)1.51s
响应时间(最大)1.51s
响应时间(总计)1.51s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)174.55s
响应时间(最大)174.55s
响应时间(总计)174.55s
-
通用智能
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)18.14s
响应时间(最大)18.14s
响应时间(总计)18.14s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.97s
响应时间(最大)2.97s
响应时间(总计)2.97s
-
谜题求解
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)12.93s
响应时间(最大)22.33s
响应时间(总计)25.85s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.95s
响应时间(最大)15.95s
响应时间(总计)15.95s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)11.13s
响应时间(最大)11.13s
响应时间(总计)11.13s
|
| #34#34 |
Qwen3.7 Maxnone
|
7.7… |
Qwen |
$0.054
↓
…
|
1.30s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7
响应时间(平均)1.30s
响应时间(最大)3.92s
响应时间(总计)27.21s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 66.7%
- 输入令牌
- 37,107
- 输出令牌
- 1,994
- 推理令牌
- 0
- 响应时间(平均)
- 1.30s
- 响应时间(总计)
- 27.21s
- 响应时间(最大)
- 3.92s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.08s
响应时间(最大)1.39s
响应时间(总计)4.30s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.35s
响应时间(最大)1.63s
响应时间(总计)4.04s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.17s
响应时间(最大)2.17s
响应时间(总计)2.17s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.35s
响应时间(最大)1.43s
响应时间(总计)2.69s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)975ms
响应时间(最大)1.08s
响应时间(总计)2.92s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.04s
响应时间(最大)1.04s
响应时间(总计)1.04s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)943ms
响应时间(最大)974ms
响应时间(总计)1.89s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.13s
响应时间(最大)1.29s
响应时间(总计)3.40s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.92s
响应时间(最大)3.92s
响应时间(总计)3.92s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)856ms
响应时间(最大)856ms
响应时间(总计)856ms
|
| #127#127 |
Grok 4.20none
|
5.4… |
X AI |
$0.057
↓
…
|
1.11s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 额外格式: 1 无效工具调用: 1
响应时间(平均)1.11s
响应时间(最大)6.04s
响应时间(总计)19.96s
…
|
- 总测试数
- 18
- 错误测试数
- 12
- 尝试通过率
- 33.3%
- 输入令牌
- 41,313
- 输出令牌
- 1,923
- 推理令牌
- 0
- 响应时间(平均)
- 1.11s
- 响应时间(总计)
- 19.96s
- 响应时间(最大)
- 6.04s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)501ms
响应时间(最大)839ms
响应时间(总计)2.01s
-
编程
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.22s
响应时间(最大)1.22s
响应时间(总计)1.22s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)6.04s
响应时间(最大)6.04s
响应时间(总计)6.04s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)522ms
响应时间(最大)537ms
响应时间(总计)1.04s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1
响应时间(平均)687ms
响应时间(最大)821ms
响应时间(总计)2.06s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)659ms
响应时间(最大)659ms
响应时间(总计)659ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)445ms
响应时间(最大)505ms
响应时间(总计)889ms
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)473ms
响应时间(最大)502ms
响应时间(总计)1.42s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.63s
响应时间(最大)4.63s
响应时间(总计)4.63s
|
| #81#81 |
Mercury 2medium
|
6.6… |
Inception |
$0.058
…
|
2.24s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 未遵循指令: 3
响应时间(平均)2.24s
响应时间(最大)14.63s
响应时间(总计)44.72s
…
|
- 总测试数
- 21
- 错误测试数
- 11
- 尝试通过率
- 54.0%
- 输入令牌
- 35,116
- 输出令牌
- 4,048
- 推理令牌
- 61,219
- 响应时间(平均)
- 2.24s
- 响应时间(总计)
- 44.72s
- 响应时间(最大)
- 14.63s
-
反AI技巧
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.12s
响应时间(最大)2.46s
响应时间(总计)4.49s
-
编程
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.04s
响应时间(最大)3.06s
响应时间(总计)6.11s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.28s
响应时间(最大)3.28s
响应时间(总计)3.28s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.11s
响应时间(最大)1.47s
响应时间(总计)2.21s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)6.48s
响应时间(最大)14.63s
响应时间(总计)19.43s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)821ms
响应时间(最大)821ms
响应时间(总计)821ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.07s
响应时间(最大)1.07s
响应时间(总计)1.07s
-
谜题求解
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)949ms
响应时间(最大)1.18s
响应时间(总计)2.85s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.89s
响应时间(最大)1.89s
响应时间(总计)1.89s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.58s
响应时间(最大)2.58s
响应时间(总计)2.58s
|
| #112#112 |
GLM 5.1none
|
5.7… |
Z.ai |
$0.058
↓
…
|
4.10s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 无效工具调用: 1
响应时间(平均)4.10s
响应时间(最大)32.57s
响应时间(总计)86.18s
…
|
- 总测试数
- 21
- 错误测试数
- 14
- 尝试通过率
- 41.3%
- 输入令牌
- 47,133
- 输出令牌
- 3,754
- 推理令牌
- 0
- 响应时间(平均)
- 4.10s
- 响应时间(总计)
- 86.18s
- 响应时间(最大)
- 32.57s
-
反AI技巧
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.11s
响应时间(最大)3.94s
响应时间(总计)8.46s
-
编程
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)4.96s
响应时间(最大)9.79s
响应时间(总计)14.89s
-
综合
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)32.57s
响应时间(最大)32.57s
响应时间(总计)32.57s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.08s
响应时间(最大)1.62s
响应时间(总计)2.15s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.99s
响应时间(最大)3.99s
响应时间(总计)5.98s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)790ms
响应时间(最大)790ms
响应时间(总计)790ms
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.98s
响应时间(最大)2.28s
响应时间(总计)3.97s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.45s
响应时间(最大)2.09s
响应时间(总计)4.36s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.68s
响应时间(最大)10.68s
响应时间(总计)10.68s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.34s
响应时间(最大)2.34s
响应时间(总计)2.34s
|
| #56#56 |
MiMo-V2.5medium
|
7.3… |
Xiaomi |
$0.063
↓
…
|
27.11s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 额外格式: 2 未遵循指令: 1 无答案: 1
响应时间(平均)27.11s
响应时间(最大)162.44s
响应时间(总计)569.38s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 69.8%
- 输入令牌
- 41,838
- 输出令牌
- 2,827
- 推理令牌
- 198,898
- 响应时间(平均)
- 27.11s
- 响应时间(总计)
- 569.38s
- 响应时间(最大)
- 162.44s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.14s
响应时间(最大)12.41s
响应时间(总计)16.57s
-
编程
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)97.14s
响应时间(最大)162.44s
响应时间(总计)291.41s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)16.86s
响应时间(最大)16.86s
响应时间(总计)16.86s
-
数据解析与提取
: 2.7
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)6.33s
响应时间(最大)7.45s
响应时间(总计)12.67s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)34.53s
响应时间(最大)86.93s
响应时间(总计)103.59s
-
通用智能
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)5.37s
响应时间(最大)5.37s
响应时间(总计)5.37s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.80s
响应时间(最大)1.81s
响应时间(总计)3.60s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)20.25s
响应时间(最大)57.93s
响应时间(总计)60.76s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.29s
响应时间(最大)7.29s
响应时间(总计)7.29s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)51.29s
响应时间(最大)51.29s
响应时间(总计)51.29s
|
| #132#132 |
Mistral Small 4medium
|
5.3… |
Mistral |
$0.068
…
|
9.40s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 API 错误: 2 未遵循指令: 2
响应时间(平均)9.40s
响应时间(最大)59.15s
响应时间(总计)197.39s
…
|
- 总测试数
- 21
- 错误测试数
- 16
- 尝试通过率
- 44.4%
- 输入令牌
- 42,576
- 输出令牌
- 24,184
- 推理令牌
- 84,678
- 响应时间(平均)
- 9.40s
- 响应时间(总计)
- 197.39s
- 响应时间(最大)
- 59.15s
-
反AI技巧
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.67s
响应时间(最大)5.03s
响应时间(总计)10.66s
-
编程
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)39.98s
响应时间(最大)59.15s
响应时间(总计)119.95s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)25.25s
响应时间(最大)25.25s
响应时间(总计)25.25s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)1.23s
响应时间(最大)1.96s
响应时间(总计)2.46s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)6.11s
响应时间(最大)13.72s
响应时间(总计)18.34s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.05s
响应时间(最大)2.05s
响应时间(总计)2.05s
-
指令遵循
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.38s
响应时间(最大)1.61s
响应时间(总计)2.75s
-
谜题求解
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)2.17s
响应时间(最大)2.60s
响应时间(总计)6.50s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.50s
响应时间(最大)3.50s
响应时间(总计)3.50s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.92s
响应时间(最大)5.92s
响应时间(总计)5.92s
|
| #40#40 |
Gemini 3.1 Flash Lite Previewmedium
|
7.5… |
Google |
$0.068
…
|
3.96s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 未遵循指令: 1
响应时间(平均)3.96s
响应时间(最大)14.93s
响应时间(总计)83.06s
…
|
- 总测试数
- 21
- 错误测试数
- 8
- 尝试通过率
- 61.9%
- 输入令牌
- 37,786
- 输出令牌
- 2,210
- 推理令牌
- 36,744
- 响应时间(平均)
- 3.96s
- 响应时间(总计)
- 83.06s
- 响应时间(最大)
- 14.93s
-
反AI技巧
: 9.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.33s
响应时间(最大)3.89s
响应时间(总计)9.30s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.09s
响应时间(最大)4.34s
响应时间(总计)12.27s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.93s
响应时间(最大)14.93s
响应时间(总计)14.93s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.29s
响应时间(最大)2.31s
响应时间(总计)4.59s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)4.21s
响应时间(最大)5.86s
响应时间(总计)12.62s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.16s
响应时间(最大)3.16s
响应时间(总计)3.16s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.91s
响应时间(最大)1.93s
响应时间(总计)3.82s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.30s
响应时间(最大)9.55s
响应时间(总计)15.89s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.80s
响应时间(最大)3.80s
响应时间(总计)3.80s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.68s
响应时间(最大)2.68s
响应时间(总计)2.68s
|
| #86#86 |
Grok 4.1 Fastmedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.5… |
X AI |
$0.069
↑
…
|
23.85s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 4 答案错误: 4 无答案: 1 超时: 1
响应时间(平均)23.85s
响应时间(最大)121.79s
响应时间(总计)286.16s
…
|
- 总测试数
- 19
- 错误测试数
- 10
- 尝试通过率
- 61.4%
- 输入令牌
- 42,845
- 输出令牌
- 2,006
- 推理令牌
- 96,334
- 响应时间(平均)
- 23.85s
- 响应时间(总计)
- 286.16s
- 响应时间(最大)
- 121.79s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.81s
响应时间(最大)5.65s
响应时间(总计)7.62s
-
编程
: 2.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)23.58s
响应时间(最大)23.58s
响应时间(总计)23.58s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)37.64s
响应时间(最大)37.64s
响应时间(总计)37.64s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.63s
响应时间(最大)6.63s
响应时间(总计)6.63s
-
领域专项
: 5.8
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)121.79s
响应时间(最大)121.79s
响应时间(总计)121.79s
-
通用智能
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)16.25s
响应时间(最大)16.25s
响应时间(总计)16.25s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.63s
响应时间(最大)4.63s
响应时间(总计)4.63s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)7.40s
响应时间(最大)7.79s
响应时间(总计)14.81s
-
工具调用
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)27.71s
响应时间(最大)27.71s
响应时间(总计)27.71s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)25.52s
响应时间(最大)25.52s
响应时间(总计)25.52s
|