| #332#332 |
Mimo V2 Omninone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.5… |
Xiaomi |
$0.021
↓
…
|
2.44s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 API 错误: 1 额外格式: 1 未遵循指令: 1
响应时间(平均)2.44s
响应时间(最大)6.81s
响应时间(总计)48.81s
…
|
- 总测试数
- 21
- 错误测试数
- 13
- 尝试通过率
- 36.2%
- 输入令牌
- 40,852
- 输出令牌
- 3,314
- 推理令牌
- 0
- 响应时间(平均)
- 2.44s
- 响应时间(总计)
- 48.81s
- 响应时间(最大)
- 6.81s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)1.63s
响应时间(最大)3.29s
响应时间(总计)6.52s
-
编程
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 额外格式: 1 答案错误: 1
响应时间(平均)2.75s
响应时间(最大)3.79s
响应时间(总计)5.50s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.96s
响应时间(最大)5.96s
响应时间(总计)5.96s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.76s
响应时间(最大)2.60s
响应时间(总计)3.51s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.10s
响应时间(最大)3.58s
响应时间(总计)6.30s
-
通用智能
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.33s
响应时间(最大)2.33s
响应时间(总计)2.33s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.26s
响应时间(最大)6.81s
响应时间(总计)8.51s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.16s
响应时间(最大)1.55s
响应时间(总计)3.48s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.40s
响应时间(最大)5.40s
响应时间(总计)5.40s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.30s
响应时间(最大)1.30s
响应时间(总计)1.30s
|
| #331#331 |
Ring 2.6 1tnone
|
4.5… |
Inclusionai |
$0.026
↑
…
|
48.94s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 7 答案错误: 5 未遵循指令: 2
响应时间(平均)48.94s
响应时间(最大)143.82s
响应时间(总计)831.92s
…
|
- 总测试数
- 23
- 错误测试数
- 14
- 尝试通过率
- 43.5%
- 输入令牌
- 7,608
- 输出令牌
- 40,277
- 推理令牌
- 0
- 响应时间(平均)
- 48.94s
- 响应时间(总计)
- 831.92s
- 响应时间(最大)
- 143.82s
-
智能体任务
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)19ms
响应时间(最大)19ms
响应时间(总计)19ms
-
反AI技巧
: 9.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)43.33s
响应时间(最大)71.76s
响应时间(总计)173.31s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)143.82s
响应时间(最大)143.82s
响应时间(总计)143.82s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)45.87s
响应时间(最大)45.87s
响应时间(总计)45.87s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)56.85s
响应时间(最大)90.09s
响应时间(总计)170.54s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)15.63s
响应时间(最大)15.63s
响应时间(总计)15.63s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)27.36s
响应时间(最大)40.24s
响应时间(总计)54.72s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)31.47s
响应时间(最大)46.84s
响应时间(总计)94.41s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)133.60s
响应时间(最大)133.60s
响应时间(总计)133.60s
|
| #330#330 |
Hy3 previewlow已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.5… |
Tencent |
$0.042
↕
…
|
24.56s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 7 答案错误: 4
响应时间(平均)24.56s
响应时间(最大)78.74s
响应时间(总计)368.35s
…
|
- 总测试数
- 21
- 错误测试数
- 11
- 尝试通过率
- 47.8%
- 输入令牌
- 21,045
- 输出令牌
- 63,460
- 推理令牌
- 0
- 响应时间(平均)
- 24.56s
- 响应时间(总计)
- 368.35s
- 响应时间(最大)
- 78.74s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)9.32s
响应时间(最大)12.36s
响应时间(总计)27.96s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)27.94s
响应时间(最大)27.94s
响应时间(总计)27.94s
-
综合
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)78.74s
响应时间(最大)78.74s
响应时间(总计)78.74s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)5.85s
响应时间(最大)5.85s
响应时间(总计)5.85s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)40.44s
响应时间(最大)46.32s
响应时间(总计)121.31s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.98s
响应时间(最大)22.24s
响应时间(总计)31.97s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)7.51s
响应时间(最大)7.86s
响应时间(总计)15.02s
-
工具调用
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)17.84s
响应时间(最大)17.84s
响应时间(总计)17.84s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)41.74s
响应时间(最大)41.74s
响应时间(总计)41.74s
|
| #329#329 |
Ling 2.6 Flashnone
|
4.5… |
Inclusionai |
$0.002
↑
…
|
10.21s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 API 错误: 3 无效工具调用: 3 未遵循指令: 2
响应时间(平均)10.21s
响应时间(最大)36.03s
响应时间(总计)214.31s
…
|
- 总测试数
- 23
- 错误测试数
- 17
- 尝试通过率
- 29.0%
- 输入令牌
- 114,384
- 输出令牌
- 14,903
- 推理令牌
- 0
- 响应时间(平均)
- 10.21s
- 响应时间(总计)
- 214.31s
- 响应时间(最大)
- 36.03s
-
智能体任务
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)32ms
响应时间(最大)32ms
响应时间(总计)32ms
-
反AI技巧
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)11.81s
响应时间(最大)16.60s
响应时间(总计)47.23s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)11.21s
响应时间(最大)11.21s
响应时间(总计)11.21s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)35.69s
响应时间(最大)36.03s
响应时间(总计)71.38s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)8.48s
响应时间(最大)12.71s
响应时间(总计)16.96s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)5.20s
响应时间(最大)7.65s
响应时间(总计)15.60s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.45s
响应时间(最大)1.45s
响应时间(总计)1.45s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.52s
响应时间(最大)8.19s
响应时间(总计)11.04s
-
谜题求解
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)6.51s
响应时间(最大)17.06s
响应时间(总计)19.54s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)18.80s
响应时间(最大)18.80s
响应时间(总计)18.80s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.06s
响应时间(最大)1.06s
响应时间(总计)1.06s
|
| #328#328 |
Owl Alphanone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.6… |
Openrouter |
$0.000
…
|
9.88s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 3 额外格式: 1
响应时间(平均)9.88s
响应时间(最大)47.10s
响应时间(总计)207.38s
…
|
- 总测试数
- 21
- 错误测试数
- 14
- 尝试通过率
- 33.3%
- 输入令牌
- 42,283
- 输出令牌
- 5,913
- 推理令牌
- 0
- 响应时间(平均)
- 9.88s
- 响应时间(总计)
- 207.38s
- 响应时间(最大)
- 47.10s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)2.78s
响应时间(最大)3.09s
响应时间(总计)11.10s
-
编程
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)36.89s
响应时间(最大)47.10s
响应时间(总计)110.66s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)21.74s
响应时间(最大)21.74s
响应时间(总计)21.74s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.60s
响应时间(最大)3.92s
响应时间(总计)7.19s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.00s
响应时间(最大)4.69s
响应时间(总计)8.99s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.61s
响应时间(最大)4.61s
响应时间(总计)4.61s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.63s
响应时间(最大)2.77s
响应时间(总计)5.27s
-
谜题求解
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)4.18s
响应时间(最大)8.27s
响应时间(总计)12.54s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)22.78s
响应时间(最大)22.78s
响应时间(总计)22.78s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.50s
响应时间(最大)2.50s
响应时间(总计)2.50s
|
| #327#327 |
Mimo V2 PROnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.6… |
Xiaomi |
$0.045
↓
…
|
2.27s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 2 API 错误: 1
响应时间(平均)2.27s
响应时间(最大)6.58s
响应时间(总计)45.50s
…
|
- 总测试数
- 21
- 错误测试数
- 14
- 尝试通过率
- 37.7%
- 输入令牌
- 39,344
- 输出令牌
- 2,352
- 推理令牌
- 0
- 响应时间(平均)
- 2.27s
- 响应时间(总计)
- 45.50s
- 响应时间(最大)
- 6.58s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.80s
响应时间(最大)2.62s
响应时间(总计)7.19s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)2.65s
响应时间(最大)3.82s
响应时间(总计)5.30s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.58s
响应时间(最大)6.58s
响应时间(总计)6.58s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.39s
响应时间(最大)1.42s
响应时间(总计)2.78s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.78s
响应时间(最大)2.49s
响应时间(总计)5.34s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.44s
响应时间(最大)2.44s
响应时间(总计)2.44s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.51s
响应时间(最大)2.95s
响应时间(总计)5.02s
-
谜题求解
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.61s
响应时间(最大)2.15s
响应时间(总计)4.83s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.39s
响应时间(最大)4.39s
响应时间(总计)4.39s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.63s
响应时间(最大)1.63s
响应时间(总计)1.63s
|
| #326#326 |
Owl Alphamedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.6… |
Openrouter |
$0.000
…
|
11.95s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 2 API 错误: 1
响应时间(平均)11.95s
响应时间(最大)58.63s
响应时间(总计)250.88s
…
|
- 总测试数
- 21
- 错误测试数
- 13
- 尝试通过率
- 36.2%
- 输入令牌
- 43,478
- 输出令牌
- 2,974
- 推理令牌
- 0
- 响应时间(平均)
- 11.95s
- 响应时间(总计)
- 250.88s
- 响应时间(最大)
- 58.63s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)3.97s
响应时间(最大)7.48s
响应时间(总计)15.89s
-
编程
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)18.74s
响应时间(最大)30.81s
响应时间(总计)56.21s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.01s
响应时间(最大)10.01s
响应时间(总计)10.01s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.64s
响应时间(最大)29.16s
响应时间(总计)43.28s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)8.58s
响应时间(最大)9.48s
响应时间(总计)25.74s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)58.63s
响应时间(最大)58.63s
响应时间(总计)58.63s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.15s
响应时间(最大)15.94s
响应时间(总计)20.30s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)3.40s
响应时间(最大)4.60s
响应时间(总计)10.19s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.26s
响应时间(最大)8.26s
响应时间(总计)8.26s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.38s
响应时间(最大)2.38s
响应时间(总计)2.38s
|
| #325#325 |
Nemotron 3.5 Lightninglow
|
4.6… |
NVIDIA |
$0.123
↕
…
|
83.19s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 未遵循指令: 2 无效工具调用: 1 超时: 1
响应时间(平均)83.19s
响应时间(最大)597.61s
响应时间(总计)1913.41s
…
|
- 总测试数
- 23
- 错误测试数
- 18
- 尝试通过率
- 40.6%
- 输入令牌
- 207,883
- 输出令牌
- 144,718
- 推理令牌
- 525,897
- 响应时间(平均)
- 83.19s
- 响应时间(总计)
- 1913.41s
- 响应时间(最大)
- 597.61s
-
智能体任务
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)597.61s
响应时间(最大)597.61s
响应时间(总计)597.61s
-
反AI技巧
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)14.82s
响应时间(最大)27.06s
响应时间(总计)59.28s
-
编程
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)224.42s
响应时间(最大)312.21s
响应时间(总计)673.27s
-
综合
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)142.36s
响应时间(最大)259.10s
响应时间(总计)284.72s
-
数据解析与提取
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)31.32s
响应时间(最大)39.86s
响应时间(总计)62.64s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)52.66s
响应时间(最大)123.93s
响应时间(总计)157.97s
-
通用智能
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.61s
响应时间(最大)4.61s
响应时间(总计)4.61s
-
指令遵循
: 8.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)5.46s
响应时间(最大)7.47s
响应时间(总计)10.92s
-
谜题求解
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)6.21s
响应时间(最大)11.28s
响应时间(总计)18.64s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.08s
响应时间(最大)5.08s
响应时间(总计)5.08s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)38.68s
响应时间(最大)38.68s
响应时间(总计)38.68s
|
| #324#324 |
Laguna S 2.1low
|
4.6… |
Poolside |
$0.108
↓
…
|
88.24s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 16 未遵循指令: 2 额外格式: 1 无效工具调用: 1
响应时间(平均)88.24s
响应时间(最大)814.73s
响应时间(总计)2029.57s
…
|
- 总测试数
- 23
- 错误测试数
- 20
- 尝试通过率
- 23.2%
- 输入令牌
- 232,641
- 输出令牌
- 69,335
- 推理令牌
- 426,182
- 响应时间(平均)
- 88.24s
- 响应时间(总计)
- 2029.57s
- 响应时间(最大)
- 814.73s
-
智能体任务
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)152.08s
响应时间(最大)152.08s
响应时间(总计)152.08s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)80.66s
响应时间(最大)321.43s
响应时间(总计)322.64s
-
编程
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)167.51s
响应时间(最大)270.36s
响应时间(总计)502.52s
-
综合
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)412.50s
响应时间(最大)814.73s
响应时间(总计)824.99s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.76s
响应时间(最大)4.89s
响应时间(总计)5.51s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.46s
响应时间(最大)6.68s
响应时间(总计)7.39s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)650ms
响应时间(最大)650ms
响应时间(总计)650ms
-
指令遵循
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)423ms
响应时间(最大)435ms
响应时间(总计)845ms
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1
响应时间(平均)2.70s
响应时间(最大)6.77s
响应时间(总计)8.10s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.36s
响应时间(最大)2.36s
响应时间(总计)2.36s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)202.49s
响应时间(最大)202.49s
响应时间(总计)202.49s
|
| #323#323 |
GLM 5V Turbonone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.6… |
Z.ai |
$0.052
…
|
2.99s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 2
响应时间(平均)2.99s
响应时间(最大)6.51s
响应时间(总计)62.74s
…
|
- 总测试数
- 21
- 错误测试数
- 13
- 尝试通过率
- 34.8%
- 输入令牌
- 37,100
- 输出令牌
- 1,766
- 推理令牌
- 0
- 响应时间(平均)
- 2.99s
- 响应时间(总计)
- 62.74s
- 响应时间(最大)
- 6.51s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)3.13s
响应时间(最大)5.90s
响应时间(总计)12.50s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.13s
响应时间(最大)5.30s
响应时间(总计)9.40s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.51s
响应时间(最大)6.51s
响应时间(总计)6.51s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.81s
响应时间(最大)5.69s
响应时间(总计)7.62s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.09s
响应时间(最大)2.39s
响应时间(总计)6.26s
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.22s
响应时间(最大)2.22s
响应时间(总计)2.22s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.97s
响应时间(最大)2.43s
响应时间(总计)3.93s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.40s
响应时间(最大)3.81s
响应时间(总计)7.21s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.86s
响应时间(最大)4.86s
响应时间(总计)4.86s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.23s
响应时间(最大)2.23s
响应时间(总计)2.23s
|
| #322#322 |
Gemini 3.1 Flash Litehigh已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.6… |
Google |
$2.044
…
|
61.96s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 3 无答案: 1
响应时间(平均)61.96s
响应时间(最大)149.23s
响应时间(总计)1115.31s
…
|
- 总测试数
- 18
- 错误测试数
- 8
- 尝试通过率
- 53.6%
- 输入令牌
- 29,134
- 输出令牌
- 1,984
- 推理令牌
- 1,355,583
- 响应时间(平均)
- 61.96s
- 响应时间(总计)
- 1115.31s
- 响应时间(最大)
- 149.23s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)37.16s
响应时间(最大)140.53s
响应时间(总计)148.65s
-
编程
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)137.63s
响应时间(最大)137.63s
响应时间(总计)137.63s
-
综合
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)149.23s
响应时间(最大)149.23s
响应时间(总计)149.23s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.49s
响应时间(最大)4.96s
响应时间(总计)8.98s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)139.90s
响应时间(最大)141.40s
响应时间(总计)419.69s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)45.69s
响应时间(最大)45.69s
响应时间(总计)45.69s
-
指令遵循
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)23.26s
响应时间(最大)43.87s
响应时间(总计)46.51s
-
谜题求解
: 5.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2
响应时间(平均)50.83s
响应时间(最大)144.85s
响应时间(总计)152.49s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.44s
响应时间(最大)6.44s
响应时间(总计)6.44s
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #321#321 |
GPT-5.4 Nanonone
|
4.6… |
OpenAI |
$0.068
…
|
4.42s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 16 未遵循指令: 2 无答案: 1
响应时间(平均)4.42s
响应时间(最大)45.38s
响应时间(总计)101.75s
…
|
- 总测试数
- 23
- 错误测试数
- 19
- 尝试通过率
- 26.1%
- 输入令牌
- 246,687
- 输出令牌
- 14,894
- 推理令牌
- 0
- 响应时间(平均)
- 4.42s
- 响应时间(总计)
- 101.75s
- 响应时间(最大)
- 45.38s
-
智能体任务
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)45.38s
响应时间(最大)45.38s
响应时间(总计)45.38s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.18s
响应时间(最大)1.81s
响应时间(总计)4.70s
-
编程
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.22s
响应时间(最大)4.47s
响应时间(总计)6.65s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)14.67s
响应时间(最大)25.50s
响应时间(总计)29.34s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.11s
响应时间(最大)1.25s
响应时间(总计)2.23s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)880ms
响应时间(最大)959ms
响应时间(总计)2.64s
-
通用智能
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.31s
响应时间(最大)1.31s
响应时间(总计)1.31s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)784ms
响应时间(最大)859ms
响应时间(总计)1.57s
-
谜题求解
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.25s
响应时间(最大)1.53s
响应时间(总计)3.76s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.40s
响应时间(最大)3.40s
响应时间(总计)3.40s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)773ms
响应时间(最大)773ms
响应时间(总计)773ms
|
| #320#320 |
DeepSeek V3.2none
|
4.6… |
DeepSeek |
$0.119
↑
…
|
22.44s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 API 错误: 3 额外格式: 2 无效工具调用: 2 未遵循指令: 1
响应时间(平均)22.44s
响应时间(最大)122.50s
响应时间(总计)516.03s
…
|
- 总测试数
- 23
- 错误测试数
- 17
- 尝试通过率
- 34.8%
- 输入令牌
- 342,158
- 输出令牌
- 57,866
- 推理令牌
- 0
- 响应时间(平均)
- 22.44s
- 响应时间(总计)
- 516.03s
- 响应时间(最大)
- 122.50s
-
智能体任务
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)122.50s
响应时间(最大)122.50s
响应时间(总计)122.50s
-
反AI技巧
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 API 错误: 1 答案错误: 1
响应时间(平均)9.35s
响应时间(最大)16.77s
响应时间(总计)37.40s
-
编程
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)14.54s
响应时间(最大)34.11s
响应时间(总计)43.62s
-
综合
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)113.53s
响应时间(最大)115.89s
响应时间(总计)227.06s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.42s
响应时间(最大)16.20s
响应时间(总计)18.84s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.48s
响应时间(最大)1.77s
响应时间(总计)4.44s
-
通用智能
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)9.32s
响应时间(最大)9.32s
响应时间(总计)9.32s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.52s
响应时间(最大)1.99s
响应时间(总计)3.04s
-
谜题求解
: 7.6
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)6.91s
响应时间(最大)10.09s
响应时间(总计)20.74s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.85s
响应时间(最大)11.85s
响应时间(总计)11.85s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.23s
响应时间(最大)17.23s
响应时间(总计)17.23s
|
| #319#319 |
Qwen3 Coder Nextmedium
|
4.7… |
Qwen |
$0.071
↑
…
|
16.97s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 15 未遵循指令: 3 无答案: 1 超时: 1
响应时间(平均)16.97s
响应时间(最大)151.35s
响应时间(总计)305.55s
…
|
- 总测试数
- 23
- 错误测试数
- 20
- 尝试通过率
- 24.6%
- 输入令牌
- 311,647
- 输出令牌
- 40,395
- 推理令牌
- 0
- 响应时间(平均)
- 16.97s
- 响应时间(总计)
- 305.55s
- 响应时间(最大)
- 151.35s
-
智能体任务
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)151.35s
响应时间(最大)151.35s
响应时间(总计)151.35s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)8.64s
响应时间(最大)15.28s
响应时间(总计)17.29s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)924ms
响应时间(最大)1.69s
响应时间(总计)2.77s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)14.65s
响应时间(最大)25.01s
响应时间(总计)29.29s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)81.80s
响应时间(最大)81.80s
响应时间(总计)81.80s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)570ms
响应时间(最大)638ms
响应时间(总计)1.14s
-
通用智能
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.39s
响应时间(最大)1.39s
响应时间(总计)1.39s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.49s
响应时间(最大)13.67s
响应时间(总计)14.99s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.25s
响应时间(最大)1.68s
响应时间(总计)2.49s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.64s
响应时间(最大)2.64s
响应时间(总计)2.64s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)399ms
响应时间(最大)399ms
响应时间(总计)399ms
|
| #318#318 |
Granite 4.2 8Bhigh
|
4.7… |
IBM Granite |
$0.111
…
|
235.35s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 10 答案错误: 7 无效工具调用: 1 无答案: 1
响应时间(平均)235.35s
响应时间(最大)685.87s
响应时间(总计)5413.09s
…
|
- 总测试数
- 23
- 错误测试数
- 19
- 尝试通过率
- 37.7%
- 输入令牌
- 282,658
- 输出令牌
- 198,563
- 推理令牌
- 462,804
- 响应时间(平均)
- 235.35s
- 响应时间(总计)
- 5413.09s
- 响应时间(最大)
- 685.87s
-
智能体任务
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)223.46s
响应时间(最大)223.46s
响应时间(总计)223.46s
-
反AI技巧
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2
响应时间(平均)205.31s
响应时间(最大)413.57s
响应时间(总计)821.25s
-
编程
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 答案错误: 1
响应时间(平均)515.34s
响应时间(最大)567.74s
响应时间(总计)1546.02s
-
综合
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 超时: 1
响应时间(平均)570.43s
响应时间(最大)685.87s
响应时间(总计)1140.86s
-
数据解析与提取
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)56.55s
响应时间(最大)112.47s
响应时间(总计)113.10s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)167.15s
响应时间(最大)183.96s
响应时间(总计)501.46s
-
通用智能
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)16.37s
响应时间(最大)16.37s
响应时间(总计)16.37s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)87.47s
响应时间(最大)150.79s
响应时间(总计)174.94s
-
谜题求解
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 无答案: 1
响应时间(平均)202.69s
响应时间(最大)252.93s
响应时间(总计)608.07s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.08s
响应时间(最大)15.08s
响应时间(总计)15.08s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)252.49s
响应时间(最大)252.49s
响应时间(总计)252.49s
|
| #317#317 |
Laguna S 2.1none
|
4.7… |
Poolside |
$0.044
↓
…
|
17.65s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 18 未遵循指令: 2 无答案: 1
响应时间(平均)17.65s
响应时间(最大)200.52s
响应时间(总计)406.05s
…
|
- 总测试数
- 23
- 错误测试数
- 21
- 尝试通过率
- 14.5%
- 输入令牌
- 287,445
- 输出令牌
- 99,097
- 推理令牌
- 0
- 响应时间(平均)
- 17.65s
- 响应时间(总计)
- 406.05s
- 响应时间(最大)
- 200.52s
-
智能体任务
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)149.34s
响应时间(最大)149.34s
响应时间(总计)149.34s
-
反AI技巧
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)835ms
响应时间(最大)2.42s
响应时间(总计)3.34s
-
编程
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)550ms
响应时间(最大)903ms
响应时间(总计)1.65s
-
综合
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)21.62s
响应时间(最大)41.14s
响应时间(总计)43.24s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)537ms
响应时间(最大)579ms
响应时间(总计)1.07s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)337ms
响应时间(最大)386ms
响应时间(总计)1.01s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)815ms
响应时间(最大)815ms
响应时间(总计)815ms
-
指令遵循
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)566ms
响应时间(最大)653ms
响应时间(总计)1.13s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)828ms
响应时间(最大)945ms
响应时间(总计)2.48s
-
工具调用
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.45s
响应时间(最大)1.45s
响应时间(总计)1.45s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)200.52s
响应时间(最大)200.52s
响应时间(总计)200.52s
|
| #316#316 |
North Mini Codenone63/69 次尝试 (目标:每项测试重复 3 次)
|
4.7… |
Cohere |
$0.000
…
|
29.47s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 额外格式: 2 未遵循指令: 2 无效工具调用: 2
响应时间(平均)29.47s
响应时间(最大)159.85s
响应时间(总计)677.70s
…
|
- 总测试数
- 23
- 错误测试数
- 19
- 尝试通过率
- 17.4%
- 输入令牌
- 177,989
- 输出令牌
- 26,954
- 推理令牌
- 0
- 响应时间(平均)
- 29.47s
- 响应时间(总计)
- 677.70s
- 响应时间(最大)
- 159.85s
-
智能体任务
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)18.87s
响应时间(最大)18.87s
响应时间(总计)18.87s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 答案错误: 2
响应时间(平均)22.48s
响应时间(最大)51.34s
响应时间(总计)89.90s
-
编程
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)21.96s
响应时间(最大)44.81s
响应时间(总计)65.89s
-
综合
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)96.20s
响应时间(最大)159.85s
响应时间(总计)192.40s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)28.00s
响应时间(最大)42.87s
响应时间(总计)55.99s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)14.73s
响应时间(最大)32.97s
响应时间(总计)44.20s
-
通用智能
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)34.77s
响应时间(最大)34.77s
响应时间(总计)34.77s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)30.68s
响应时间(最大)37.37s
响应时间(总计)61.35s
-
谜题求解
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2 答案错误: 1
响应时间(平均)24.43s
响应时间(最大)48.56s
响应时间(总计)73.30s
-
工具调用
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.64s
响应时间(最大)3.64s
响应时间(总计)3.64s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)37.37s
响应时间(最大)37.37s
响应时间(总计)37.37s
|
| #315#315 |
Nemotron 3.5 Lightningmedium
|
4.7… |
NVIDIA |
$0.137
↕
…
|
81.93s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 3 无效工具调用: 1 超时: 1
响应时间(平均)81.93s
响应时间(最大)437.11s
响应时间(总计)1884.31s
…
|
- 总测试数
- 23
- 错误测试数
- 18
- 尝试通过率
- 47.8%
- 输入令牌
- 195,780
- 输出令牌
- 167,746
- 推理令牌
- 598,384
- 响应时间(平均)
- 81.93s
- 响应时间(总计)
- 1884.31s
- 响应时间(最大)
- 437.11s
-
智能体任务
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)341.79s
响应时间(最大)341.79s
响应时间(总计)341.79s
-
反AI技巧
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)12.34s
响应时间(最大)41.00s
响应时间(总计)49.37s
-
编程
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)285.47s
响应时间(最大)437.11s
响应时间(总计)856.41s
-
综合
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)136.91s
响应时间(最大)250.92s
响应时间(总计)273.82s
-
数据解析与提取
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)23.24s
响应时间(最大)25.46s
响应时间(总计)46.48s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)74.73s
响应时间(最大)179.37s
响应时间(总计)224.19s
-
通用智能
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.36s
响应时间(最大)4.36s
响应时间(总计)4.36s
-
指令遵循
: 8.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.75s
响应时间(最大)4.33s
响应时间(总计)7.50s
-
谜题求解
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)10.49s
响应时间(最大)22.61s
响应时间(总计)31.46s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.92s
响应时间(最大)4.92s
响应时间(总计)4.92s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)44.02s
响应时间(最大)44.02s
响应时间(总计)44.02s
|
| #314#314 |
Mercury 2.5 Previewnone
|
4.7… |
Inception |
$0.023
↑
…
|
7.05s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 16 无效工具调用: 2 未遵循指令: 1
响应时间(平均)7.05s
响应时间(最大)84.96s
响应时间(总计)162.25s
…
|
- 总测试数
- 23
- 错误测试数
- 19
- 尝试通过率
- 29.0%
- 输入令牌
- 250,541
- 输出令牌
- 86,367
- 推理令牌
- 0
- 响应时间(平均)
- 7.05s
- 响应时间(总计)
- 162.25s
- 响应时间(最大)
- 84.96s
-
智能体任务
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)84.96s
响应时间(最大)84.96s
响应时间(总计)84.96s
-
反AI技巧
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)655ms
响应时间(最大)995ms
响应时间(总计)2.62s
-
编程
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)459ms
响应时间(最大)654ms
响应时间(总计)1.38s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)31.28s
响应时间(最大)60.70s
响应时间(总计)62.55s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.04s
响应时间(最大)1.29s
响应时间(总计)2.08s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)631ms
响应时间(最大)744ms
响应时间(总计)1.89s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)482ms
响应时间(最大)482ms
响应时间(总计)482ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.26s
响应时间(最大)1.83s
响应时间(总计)2.52s
-
谜题求解
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)684ms
响应时间(最大)803ms
响应时间(总计)2.05s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.29s
响应时间(最大)1.29s
响应时间(总计)1.29s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)419ms
响应时间(最大)419ms
响应时间(总计)419ms
|
| #313#313 |
GLM 4.7 Flashnone
|
4.8… |
Z.ai |
$0.027
…
|
13.04s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 15 无效工具调用: 2 未遵循指令: 1
响应时间(平均)13.04s
响应时间(最大)97.15s
响应时间(总计)221.61s
…
|
- 总测试数
- 23
- 错误测试数
- 18
- 尝试通过率
- 29.0%
- 输入令牌
- 255,363
- 输出令牌
- 27,395
- 推理令牌
- 0
- 响应时间(平均)
- 13.04s
- 响应时间(总计)
- 221.61s
- 响应时间(最大)
- 97.15s
-
智能体任务
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)80.73s
响应时间(最大)80.73s
响应时间(总计)80.73s
-
反AI技巧
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)5.51s
响应时间(最大)6.59s
响应时间(总计)11.02s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.54s
响应时间(最大)5.57s
响应时间(总计)7.62s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)50.18s
响应时间(最大)97.15s
响应时间(总计)100.36s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.82s
响应时间(最大)4.82s
响应时间(总计)4.82s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.22s
响应时间(最大)3.70s
响应时间(总计)4.44s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.59s
响应时间(最大)1.59s
响应时间(总计)1.59s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)888ms
响应时间(最大)888ms
响应时间(总计)888ms
-
谜题求解
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.20s
响应时间(最大)1.27s
响应时间(总计)2.39s
-
工具调用
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.05s
响应时间(最大)7.05s
响应时间(总计)7.05s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)692ms
响应时间(最大)692ms
响应时间(总计)692ms
|
| #312#312 |
Hy3 previewhigh已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.8… |
Tencent |
$0.135
↕
…
|
56.57s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 7 答案错误: 3
响应时间(平均)56.57s
响应时间(最大)149.94s
响应时间(总计)848.59s
…
|
- 总测试数
- 21
- 错误测试数
- 10
- 尝试通过率
- 50.7%
- 输入令牌
- 25,987
- 输出令牌
- 216,719
- 推理令牌
- 0
- 响应时间(平均)
- 56.57s
- 响应时间(总计)
- 848.59s
- 响应时间(最大)
- 149.94s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)15.12s
响应时间(最大)19.99s
响应时间(总计)45.37s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)99.76s
响应时间(最大)99.76s
响应时间(总计)99.76s
-
综合
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)113.09s
响应时间(最大)113.09s
响应时间(总计)113.09s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)12.11s
响应时间(最大)12.11s
响应时间(总计)12.11s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)109.04s
响应时间(最大)149.94s
响应时间(总计)327.11s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)34.36s
响应时间(最大)41.83s
响应时间(总计)68.73s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)27.94s
响应时间(最大)45.06s
响应时间(总计)55.89s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)78.83s
响应时间(最大)78.83s
响应时间(总计)78.83s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)47.71s
响应时间(最大)47.71s
响应时间(总计)47.71s
|
| #311#311 |
Mimo V2 Omnimedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.9… |
Xiaomi |
$0.683
↓
…
|
41.16s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 2 无答案: 2 API 错误: 1 额外格式: 1
响应时间(平均)41.16s
响应时间(最大)299.23s
响应时间(总计)823.26s
…
|
- 总测试数
- 21
- 错误测试数
- 11
- 尝试通过率
- 50.7%
- 输入令牌
- 37,007
- 输出令牌
- 1,952
- 推理令牌
- 357,306
- 响应时间(平均)
- 41.16s
- 响应时间(总计)
- 823.26s
- 响应时间(最大)
- 299.23s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.75s
响应时间(最大)4.59s
响应时间(总计)10.98s
-
编程
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 无答案: 1 答案错误: 1
响应时间(平均)183.89s
响应时间(最大)299.23s
响应时间(总计)367.78s
-
综合
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)25.87s
响应时间(最大)25.87s
响应时间(总计)25.87s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.04s
响应时间(最大)4.12s
响应时间(总计)6.07s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 无答案: 1 答案错误: 1
响应时间(平均)47.89s
响应时间(最大)134.52s
响应时间(总计)143.67s
-
通用智能
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.61s
响应时间(最大)3.61s
响应时间(总计)3.61s
-
指令遵循
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.99s
响应时间(最大)7.14s
响应时间(总计)9.99s
-
谜题求解
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.38s
响应时间(最大)3.69s
响应时间(总计)7.13s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.98s
响应时间(最大)13.98s
响应时间(总计)13.98s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)234.19s
响应时间(最大)234.19s
响应时间(总计)234.19s
|
| #310#310 |
Hy4 previewnone
|
4.9… |
Tencent |
$0.165
…
|
40.38s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 API 错误: 2 未遵循指令: 2 额外格式: 1 无效工具调用: 1
响应时间(平均)40.38s
响应时间(最大)95.32s
响应时间(总计)928.76s
…
|
- 总测试数
- 23
- 错误测试数
- 20
- 尝试通过率
- 15.9%
- 输入令牌
- 185,167
- 输出令牌
- 9,430
- 推理令牌
- 0
- 响应时间(平均)
- 40.38s
- 响应时间(总计)
- 928.76s
- 响应时间(最大)
- 95.32s
-
智能体任务
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)65.46s
响应时间(最大)65.46s
响应时间(总计)65.46s
-
反AI技巧
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 额外格式: 1
响应时间(平均)31.54s
响应时间(最大)41.19s
响应时间(总计)126.18s
-
编程
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)45.53s
响应时间(最大)73.98s
响应时间(总计)136.60s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)75.12s
响应时间(最大)95.32s
响应时间(总计)150.23s
-
数据解析与提取
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)22.81s
响应时间(最大)29.63s
响应时间(总计)45.63s
-
领域专项
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)25.61s
响应时间(最大)45.05s
响应时间(总计)76.83s
-
通用智能
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)58.28s
响应时间(最大)58.28s
响应时间(总计)58.28s
-
指令遵循
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)47.90s
响应时间(最大)50.25s
响应时间(总计)95.81s
-
谜题求解
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)24.12s
响应时间(最大)30.85s
响应时间(总计)72.36s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)81.53s
响应时间(最大)81.53s
响应时间(总计)81.53s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)19.87s
响应时间(最大)19.87s
响应时间(总计)19.87s
|
| #309#309 |
Qwen3.5-9Bnone
|
4.9… |
Qwen |
$0.041
…
|
37.19s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 15 未遵循指令: 2 无效工具调用: 2
响应时间(平均)37.19s
响应时间(最大)433.02s
响应时间(总计)855.27s
…
|
- 总测试数
- 23
- 错误测试数
- 19
- 尝试通过率
- 18.8%
- 输入令牌
- 307,670
- 输出令牌
- 70,427
- 推理令牌
- 0
- 响应时间(平均)
- 37.19s
- 响应时间(总计)
- 855.27s
- 响应时间(最大)
- 433.02s
-
智能体任务
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)433.02s
响应时间(最大)433.02s
响应时间(总计)433.02s
-
反AI技巧
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.71s
响应时间(最大)3.79s
响应时间(总计)6.84s
-
编程
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)5.60s
响应时间(最大)6.03s
响应时间(总计)16.81s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)193.98s
响应时间(最大)382.06s
响应时间(总计)387.97s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)847ms
响应时间(最大)1.09s
响应时间(总计)1.69s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)636ms
响应时间(最大)1.14s
响应时间(总计)1.91s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)552ms
响应时间(最大)552ms
响应时间(总计)552ms
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)514ms
响应时间(最大)582ms
响应时间(总计)1.03s
-
谜题求解
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)621ms
响应时间(最大)759ms
响应时间(总计)1.86s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.27s
响应时间(最大)1.27s
响应时间(总计)1.27s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.32s
响应时间(最大)2.32s
响应时间(总计)2.32s
|
| #308#308 |
MiMo-V2.5none
|
4.9… |
Xiaomi |
$0.049
↓
…
|
9.88s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 额外格式: 1 未遵循指令: 1 无效工具调用: 1 无答案: 1
响应时间(平均)9.88s
响应时间(最大)124.23s
响应时间(总计)227.24s
…
|
- 总测试数
- 23
- 错误测试数
- 18
- 尝试通过率
- 26.1%
- 输入令牌
- 276,608
- 输出令牌
- 33,960
- 推理令牌
- 0
- 响应时间(平均)
- 9.88s
- 响应时间(总计)
- 227.24s
- 响应时间(最大)
- 124.23s
-
智能体任务
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)124.23s
响应时间(最大)124.23s
响应时间(总计)124.23s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.19s
响应时间(最大)6.85s
响应时间(总计)8.74s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.24s
响应时间(最大)5.52s
响应时间(总计)9.72s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)28.86s
响应时间(最大)55.36s
响应时间(总计)57.72s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)1.01s
响应时间(最大)1.18s
响应时间(总计)2.03s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.24s
响应时间(最大)2.23s
响应时间(总计)3.71s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.86s
响应时间(最大)6.86s
响应时间(总计)6.86s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)751ms
响应时间(最大)821ms
响应时间(总计)1.50s
-
谜题求解
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.13s
响应时间(最大)5.18s
响应时间(总计)6.40s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.43s
响应时间(最大)2.43s
响应时间(总计)2.43s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.89s
响应时间(最大)3.89s
响应时间(总计)3.89s
|