| #227#227 |
DeepSeek V4 Flash 0423none
|
5.4… |
DeepSeek |
$0.040
↓
…
|
36.17s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 额外格式: 2 无效工具调用: 2 未遵循指令: 1
响应时间(平均)36.17s
响应时间(最大)247.27s
响应时间(总计)795.83s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 27.3%
- 输入令牌
- 240,230
- 输出令牌
- 100,726
- 推理令牌
- 0
- 响应时间(平均)
- 36.17s
- 响应时间(总计)
- 795.83s
- 响应时间(最大)
- 247.27s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)20.18s
响应时间(最大)26.54s
响应时间(总计)80.73s
-
编程
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)17.13s
响应时间(最大)24.90s
响应时间(总计)51.40s
-
综合
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)179.61s
响应时间(最大)247.27s
响应时间(总计)359.23s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.79s
响应时间(最大)23.85s
响应时间(总计)47.57s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)15.31s
响应时间(最大)27.66s
响应时间(总计)45.92s
-
通用智能
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)23.74s
响应时间(最大)23.74s
响应时间(总计)23.74s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)17.54s
响应时间(最大)18.51s
响应时间(总计)35.08s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 未遵循指令: 1 答案错误: 1
响应时间(平均)23.72s
响应时间(最大)29.24s
响应时间(总计)71.16s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)77.93s
响应时间(最大)77.93s
响应时间(总计)77.93s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.07s
响应时间(最大)3.07s
响应时间(总计)3.07s
|
| #228#228 |
Laguna S 2.1medium
|
5.4… |
Poolside |
$0.053
↓
…
|
58.42s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 无效工具调用: 2 无答案: 2 未遵循指令: 1
响应时间(平均)58.42s
响应时间(最大)560.31s
响应时间(总计)1285.26s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 24.2%
- 输入令牌
- 86,647
- 输出令牌
- 97,298
- 推理令牌
- 242,297
- 响应时间(平均)
- 58.42s
- 响应时间(总计)
- 1285.26s
- 响应时间(最大)
- 560.31s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 无答案: 1
响应时间(平均)51.82s
响应时间(最大)205.67s
响应时间(总计)207.27s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)158.98s
响应时间(最大)441.13s
响应时间(总计)476.95s
-
综合
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)284.71s
响应时间(最大)560.31s
响应时间(总计)569.43s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.42s
响应时间(最大)4.25s
响应时间(总计)4.84s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.68s
响应时间(最大)7.28s
响应时间(总计)8.03s
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)739ms
响应时间(最大)739ms
响应时间(总计)739ms
-
指令遵循
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)400ms
响应时间(最大)411ms
响应时间(总计)799ms
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.62s
响应时间(最大)6.83s
响应时间(总计)7.86s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.24s
响应时间(最大)2.24s
响应时间(总计)2.24s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.11s
响应时间(最大)7.11s
响应时间(总计)7.11s
|
| #233#233 |
DeepSeek V4 Flash 0731none
|
5.4… |
DeepSeek |
$0.011
↓
…
|
20.72s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 2 无效工具调用: 2 额外格式: 1
响应时间(平均)20.72s
响应时间(最大)387.15s
响应时间(总计)455.81s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 27.3%
- 输入令牌
- 94,566
- 输出令牌
- 25,426
- 推理令牌
- 0
- 响应时间(平均)
- 20.72s
- 响应时间(总计)
- 455.81s
- 响应时间(最大)
- 387.15s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)4.19s
响应时间(最大)6.04s
响应时间(总计)16.76s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.72s
响应时间(最大)3.55s
响应时间(总计)5.16s
-
综合
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)202.44s
响应时间(最大)387.15s
响应时间(总计)404.87s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.37s
响应时间(最大)2.66s
响应时间(总计)4.75s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.17s
响应时间(最大)1.66s
响应时间(总计)3.50s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.22s
响应时间(最大)3.22s
响应时间(总计)3.22s
-
指令遵循
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.42s
响应时间(最大)1.62s
响应时间(总计)2.84s
-
谜题求解
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1
响应时间(平均)2.74s
响应时间(最大)3.54s
响应时间(总计)8.23s
-
工具调用
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.61s
响应时间(最大)4.61s
响应时间(总计)4.61s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.85s
响应时间(最大)1.85s
响应时间(总计)1.85s
|
| #234#234 |
Laguna S 2.1high
|
5.4… |
Poolside |
$0.114
↓
…
|
111.60s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 无效工具调用: 2 无答案: 2 API 错误: 1 额外格式: 1 未遵循指令: 1
响应时间(平均)111.60s
响应时间(最大)1190.11s
响应时间(总计)2455.24s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 27.3%
- 输入令牌
- 208,937
- 输出令牌
- 175,588
- 推理令牌
- 409,276
- 响应时间(平均)
- 111.60s
- 响应时间(总计)
- 2455.24s
- 响应时间(最大)
- 1190.11s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 无答案: 1
响应时间(平均)52.20s
响应时间(最大)207.32s
响应时间(总计)208.79s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 无答案: 1
响应时间(平均)271.42s
响应时间(最大)423.72s
响应时间(总计)814.25s
-
综合
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)702.26s
响应时间(最大)1190.11s
响应时间(总计)1404.52s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.96s
响应时间(最大)3.41s
响应时间(总计)3.91s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.51s
响应时间(最大)6.82s
响应时间(总计)7.52s
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)855ms
响应时间(最大)855ms
响应时间(总计)855ms
-
指令遵循
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)453ms
响应时间(最大)492ms
响应时间(总计)905ms
-
谜题求解
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1
响应时间(平均)1.62s
响应时间(最大)3.81s
响应时间(总计)4.87s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.69s
响应时间(最大)2.69s
响应时间(总计)2.69s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.94s
响应时间(最大)6.94s
响应时间(总计)6.94s
|
| #238#238 |
Ling-2.6-1Tnone
|
5.3… |
Inclusionai |
$0.016
↑
…
|
8.59s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 API 错误: 3 未遵循指令: 2 无效工具调用: 1
响应时间(平均)8.59s
响应时间(最大)25.72s
响应时间(总计)163.20s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 18.2%
- 输入令牌
- 106,423
- 输出令牌
- 11,555
- 推理令牌
- 0
- 响应时间(平均)
- 8.59s
- 响应时间(总计)
- 163.20s
- 响应时间(最大)
- 25.72s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)6.55s
响应时间(最大)9.41s
响应时间(总计)26.19s
-
编程
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2 答案错误: 1
响应时间(平均)10.57s
响应时间(最大)10.57s
响应时间(总计)10.57s
-
综合
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)23.79s
响应时间(最大)24.05s
响应时间(总计)47.59s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.37s
响应时间(最大)1.37s
响应时间(总计)2.73s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.08s
响应时间(最大)1.22s
响应时间(总计)3.25s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)20.34s
响应时间(最大)20.34s
响应时间(总计)20.34s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.36s
响应时间(最大)9.81s
响应时间(总计)10.73s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)5.36s
响应时间(最大)13.26s
响应时间(总计)16.09s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)25.72s
响应时间(最大)25.72s
响应时间(总计)25.72s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #240#240 |
Qwen3.6 35B A3Bnone
|
5.3… |
Qwen |
$0.051
↓
…
|
5.57s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 API 错误: 2 未遵循指令: 2 无答案: 1
响应时间(平均)5.57s
响应时间(最大)39.54s
响应时间(总计)111.32s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 28.8%
- 输入令牌
- 93,990
- 输出令牌
- 45,905
- 推理令牌
- 0
- 响应时间(平均)
- 5.57s
- 响应时间(总计)
- 111.32s
- 响应时间(最大)
- 39.54s
-
反AI技巧
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.10s
响应时间(最大)6.15s
响应时间(总计)8.41s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)8.77s
响应时间(最大)22.52s
响应时间(总计)26.32s
-
综合
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 无答案: 1
响应时间(平均)39.54s
响应时间(最大)39.54s
响应时间(总计)39.54s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.46s
响应时间(最大)2.03s
响应时间(总计)2.93s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)7.76s
响应时间(最大)12.46s
响应时间(总计)23.27s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.51s
响应时间(最大)3.51s
响应时间(总计)3.51s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.86s
响应时间(最大)2.83s
响应时间(总计)3.73s
-
谜题求解
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2 答案错误: 1
响应时间(平均)1.07s
响应时间(最大)1.24s
响应时间(总计)3.20s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)414ms
响应时间(最大)414ms
响应时间(总计)414ms
|
| #250#250 |
Qwen3.5-9Bnone
|
5.1… |
Qwen |
$0.021
↑
…
|
19.19s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 未遵循指令: 2 无效工具调用: 2
响应时间(平均)19.19s
响应时间(最大)382.06s
响应时间(总计)422.25s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 19.7%
- 输入令牌
- 144,416
- 输出令牌
- 37,484
- 推理令牌
- 0
- 响应时间(平均)
- 19.19s
- 响应时间(总计)
- 422.25s
- 响应时间(最大)
- 382.06s
-
反AI技巧
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.71s
响应时间(最大)3.79s
响应时间(总计)6.84s
-
编程
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)5.60s
响应时间(最大)6.03s
响应时间(总计)16.81s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)193.98s
响应时间(最大)382.06s
响应时间(总计)387.97s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)847ms
响应时间(最大)1.09s
响应时间(总计)1.69s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)636ms
响应时间(最大)1.14s
响应时间(总计)1.91s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)552ms
响应时间(最大)552ms
响应时间(总计)552ms
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)514ms
响应时间(最大)582ms
响应时间(总计)1.03s
-
谜题求解
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)621ms
响应时间(最大)759ms
响应时间(总计)1.86s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.27s
响应时间(最大)1.27s
响应时间(总计)1.27s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.32s
响应时间(最大)2.32s
响应时间(总计)2.32s
|
| #252#252 |
North Mini Codenone60/66 次尝试 (目标:每项测试重复 3 次)
|
5.1… |
Cohere |
$0.000
…
|
29.95s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 额外格式: 2 未遵循指令: 2 无效工具调用: 2
响应时间(平均)29.95s
响应时间(最大)159.85s
响应时间(总计)658.83s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 18.2%
- 输入令牌
- 130,501
- 输出令牌
- 26,786
- 推理令牌
- 0
- 响应时间(平均)
- 29.95s
- 响应时间(总计)
- 658.83s
- 响应时间(最大)
- 159.85s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 答案错误: 2
响应时间(平均)22.48s
响应时间(最大)51.34s
响应时间(总计)89.90s
-
编程
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)21.96s
响应时间(最大)44.81s
响应时间(总计)65.89s
-
综合
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)96.20s
响应时间(最大)159.85s
响应时间(总计)192.40s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)28.00s
响应时间(最大)42.87s
响应时间(总计)55.99s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)14.73s
响应时间(最大)32.97s
响应时间(总计)44.20s
-
通用智能
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)34.77s
响应时间(最大)34.77s
响应时间(总计)34.77s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)30.68s
响应时间(最大)37.37s
响应时间(总计)61.35s
-
谜题求解
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2 答案错误: 1
响应时间(平均)24.43s
响应时间(最大)48.56s
响应时间(总计)73.30s
-
工具调用
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.64s
响应时间(最大)3.64s
响应时间(总计)3.64s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)37.37s
响应时间(最大)37.37s
响应时间(总计)37.37s
|
| #259#259 |
Mercury 2.5 Previewnone
|
4.9… |
Inception |
$0.018
…
|
3.51s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 16 未遵循指令: 1 无效工具调用: 1
响应时间(平均)3.51s
响应时间(最大)60.70s
响应时间(总计)77.28s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 30.3%
- 输入令牌
- 130,296
- 输出令牌
- 82,585
- 推理令牌
- 0
- 响应时间(平均)
- 3.51s
- 响应时间(总计)
- 77.28s
- 响应时间(最大)
- 60.70s
-
反AI技巧
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)655ms
响应时间(最大)995ms
响应时间(总计)2.62s
-
编程
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)459ms
响应时间(最大)654ms
响应时间(总计)1.38s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)31.28s
响应时间(最大)60.70s
响应时间(总计)62.55s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.04s
响应时间(最大)1.29s
响应时间(总计)2.08s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)631ms
响应时间(最大)744ms
响应时间(总计)1.89s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)482ms
响应时间(最大)482ms
响应时间(总计)482ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.26s
响应时间(最大)1.83s
响应时间(总计)2.52s
-
谜题求解
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)684ms
响应时间(最大)803ms
响应时间(总计)2.05s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.29s
响应时间(最大)1.29s
响应时间(总计)1.29s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)419ms
响应时间(最大)419ms
响应时间(总计)419ms
|
| #265#265 |
GPT-5.4 Nanonone
|
4.8… |
OpenAI |
$0.041
…
|
2.56s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 15 未遵循指令: 2 无答案: 1
响应时间(平均)2.56s
响应时间(最大)25.50s
响应时间(总计)56.37s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 27.3%
- 输入令牌
- 115,933
- 输出令牌
- 13,794
- 推理令牌
- 0
- 响应时间(平均)
- 2.56s
- 响应时间(总计)
- 56.37s
- 响应时间(最大)
- 25.50s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.18s
响应时间(最大)1.81s
响应时间(总计)4.70s
-
编程
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.22s
响应时间(最大)4.47s
响应时间(总计)6.65s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)14.67s
响应时间(最大)25.50s
响应时间(总计)29.34s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.11s
响应时间(最大)1.25s
响应时间(总计)2.23s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)880ms
响应时间(最大)959ms
响应时间(总计)2.64s
-
通用智能
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.31s
响应时间(最大)1.31s
响应时间(总计)1.31s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)784ms
响应时间(最大)859ms
响应时间(总计)1.57s
-
谜题求解
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.25s
响应时间(最大)1.53s
响应时间(总计)3.76s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.40s
响应时间(最大)3.40s
响应时间(总计)3.40s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)773ms
响应时间(最大)773ms
响应时间(总计)773ms
|
| #275#275 |
Mercury 2none
|
4.7… |
Inception |
$0.030
…
|
825ms… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 17 未遵循指令: 1
响应时间(平均)825ms
响应时间(最大)4.52s
响应时间(总计)18.14s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 24.2%
- 输入令牌
- 89,637
- 输出令牌
- 9,584
- 推理令牌
- 0
- 响应时间(平均)
- 825ms
- 响应时间(总计)
- 18.14s
- 响应时间(最大)
- 4.52s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)483ms
响应时间(最大)716ms
响应时间(总计)1.93s
-
编程
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.03s
响应时间(最大)1.43s
响应时间(总计)3.10s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.56s
响应时间(最大)4.52s
响应时间(总计)5.13s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)667ms
响应时间(最大)819ms
响应时间(总计)1.33s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)500ms
响应时间(最大)733ms
响应时间(总计)1.50s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)628ms
响应时间(最大)628ms
响应时间(总计)628ms
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)551ms
响应时间(最大)622ms
响应时间(总计)1.10s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)535ms
响应时间(最大)642ms
响应时间(总计)1.60s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.27s
响应时间(最大)1.27s
响应时间(总计)1.27s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)548ms
响应时间(最大)548ms
响应时间(总计)548ms
|
| #276#276 |
Granite 4.2 8Bhigh
|
4.6… |
IBM Granite |
$0.084
…
|
235.89s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 10 答案错误: 6 无效工具调用: 1 无答案: 1
响应时间(平均)235.89s
响应时间(最大)685.87s
响应时间(总计)5189.64s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 39.4%
- 输入令牌
- 43,278
- 输出令牌
- 181,083
- 推理令牌
- 431,132
- 响应时间(平均)
- 235.89s
- 响应时间(总计)
- 5189.64s
- 响应时间(最大)
- 685.87s
-
反AI技巧
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2
响应时间(平均)205.31s
响应时间(最大)413.57s
响应时间(总计)821.25s
-
编程
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 答案错误: 1
响应时间(平均)515.34s
响应时间(最大)567.74s
响应时间(总计)1546.02s
-
综合
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 超时: 1
响应时间(平均)570.43s
响应时间(最大)685.87s
响应时间(总计)1140.86s
-
数据解析与提取
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)56.55s
响应时间(最大)112.47s
响应时间(总计)113.10s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)167.15s
响应时间(最大)183.96s
响应时间(总计)501.46s
-
通用智能
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)16.37s
响应时间(最大)16.37s
响应时间(总计)16.37s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)87.47s
响应时间(最大)150.79s
响应时间(总计)174.94s
-
谜题求解
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 无答案: 1
响应时间(平均)202.69s
响应时间(最大)252.93s
响应时间(总计)608.07s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.08s
响应时间(最大)15.08s
响应时间(总计)15.08s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)252.49s
响应时间(最大)252.49s
响应时间(总计)252.49s
|
| #283#283 |
GLM 4.7 Flashmedium
|
4.3… |
Z.ai |
$0.168
…
|
134.34s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 无答案: 3 未遵循指令: 2 无效工具调用: 2 超时: 2
响应时间(平均)134.34s
响应时间(最大)1539.97s
响应时间(总计)2015.13s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 31.8%
- 输入令牌
- 79,104
- 输出令牌
- 42,254
- 推理令牌
- 377,280
- 响应时间(平均)
- 134.34s
- 响应时间(总计)
- 2015.13s
- 响应时间(最大)
- 1539.97s
-
反AI技巧
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)14.95s
响应时间(最大)27.09s
响应时间(总计)29.90s
-
编程
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 无答案: 1
响应时间(平均)55.33s
响应时间(最大)89.40s
响应时间(总计)110.66s
-
综合
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)802.77s
响应时间(最大)1539.97s
响应时间(总计)1605.54s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)1.51s
响应时间(最大)1.51s
响应时间(总计)1.51s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)96.74s
响应时间(最大)174.55s
响应时间(总计)193.47s
-
通用智能
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)18.14s
响应时间(最大)18.14s
响应时间(总计)18.14s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.97s
响应时间(最大)2.97s
响应时间(总计)2.97s
-
谜题求解
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)12.93s
响应时间(最大)22.33s
响应时间(总计)25.85s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.95s
响应时间(最大)15.95s
响应时间(总计)15.95s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)11.13s
响应时间(最大)11.13s
响应时间(总计)11.13s
|
| #295#295 |
Ling 3.0 Tinyhigh
|
3.8… |
Inclusionai |
$0.000
…
|
75.68s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 7 答案错误: 6 未遵循指令: 3 API 错误: 1 无效工具调用: 1
响应时间(平均)75.68s
响应时间(最大)345.15s
响应时间(总计)1589.20s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 24.2%
- 输入令牌
- 115,314
- 输出令牌
- 133,965
- 推理令牌
- 816,718
- 响应时间(平均)
- 75.68s
- 响应时间(总计)
- 1589.20s
- 响应时间(最大)
- 345.15s
-
反AI技巧
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)24.93s
响应时间(最大)83.87s
响应时间(总计)99.73s
-
编程
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 2 未遵循指令: 1
响应时间(平均)177.65s
响应时间(最大)213.57s
响应时间(总计)532.96s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)179.85s
响应时间(最大)345.15s
响应时间(总计)359.71s
-
数据解析与提取
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.16s
响应时间(最大)5.89s
响应时间(总计)8.31s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 2 API 错误: 1
响应时间(平均)70.12s
响应时间(最大)81.88s
响应时间(总计)140.23s
-
通用智能
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)60.50s
响应时间(最大)60.50s
响应时间(总计)60.50s
-
指令遵循
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.10s
响应时间(最大)3.97s
响应时间(总计)6.21s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)54.15s
响应时间(最大)148.72s
响应时间(总计)162.46s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.76s
响应时间(最大)5.76s
响应时间(总计)5.76s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)213.35s
响应时间(最大)213.35s
响应时间(总计)213.35s
|
| #296#296 |
Ling 3.0 Tinylow
|
3.8… |
Inclusionai |
$0.000
…
|
66.16s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 7 答案错误: 5 未遵循指令: 4 API 错误: 1 无效工具调用: 1
响应时间(平均)66.16s
响应时间(最大)252.08s
响应时间(总计)1389.33s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 19.7%
- 输入令牌
- 99,662
- 输出令牌
- 146,555
- 推理令牌
- 732,977
- 响应时间(平均)
- 66.16s
- 响应时间(总计)
- 1389.33s
- 响应时间(最大)
- 252.08s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)25.30s
响应时间(最大)84.32s
响应时间(总计)101.18s
-
编程
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 2 未遵循指令: 1
响应时间(平均)170.73s
响应时间(最大)214.91s
响应时间(总计)512.19s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)134.79s
响应时间(最大)252.08s
响应时间(总计)269.57s
-
数据解析与提取
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)4.82s
响应时间(最大)6.83s
响应时间(总计)9.64s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 2 API 错误: 1
响应时间(平均)72.15s
响应时间(最大)81.30s
响应时间(总计)144.29s
-
通用智能
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)29.35s
响应时间(最大)29.35s
响应时间(总计)29.35s
-
指令遵循
: 6.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.09s
响应时间(最大)4.03s
响应时间(总计)6.19s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)32.49s
响应时间(最大)91.44s
响应时间(总计)97.46s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.94s
响应时间(最大)5.94s
响应时间(总计)5.94s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)213.54s
响应时间(最大)213.54s
响应时间(总计)213.54s
|
| #299#299 |
Ling 3.0 Tinymedium
|
3.8… |
Inclusionai |
$0.000
…
|
68.08s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 7 答案错误: 5 未遵循指令: 4 API 错误: 1 无效工具调用: 1
响应时间(平均)68.08s
响应时间(最大)262.20s
响应时间(总计)1429.66s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 24.2%
- 输入令牌
- 103,898
- 输出令牌
- 148,304
- 推理令牌
- 774,972
- 响应时间(平均)
- 68.08s
- 响应时间(总计)
- 1429.66s
- 响应时间(最大)
- 262.20s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)23.73s
响应时间(最大)81.06s
响应时间(总计)94.91s
-
编程
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 2 未遵循指令: 1
响应时间(平均)211.99s
响应时间(最大)219.75s
响应时间(总计)635.97s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)139.78s
响应时间(最大)262.20s
响应时间(总计)279.57s
-
数据解析与提取
: 2.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)4.41s
响应时间(最大)6.08s
响应时间(总计)8.82s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 2 API 错误: 1
响应时间(平均)81.40s
响应时间(最大)82.11s
响应时间(总计)162.80s
-
通用智能
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)31.77s
响应时间(最大)31.77s
响应时间(总计)31.77s
-
指令遵循
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.00s
响应时间(最大)3.81s
响应时间(总计)5.99s
-
谜题求解
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)34.65s
响应时间(最大)88.47s
响应时间(总计)103.95s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.91s
响应时间(最大)4.91s
响应时间(总计)4.91s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)100.96s
响应时间(最大)100.96s
响应时间(总计)100.96s
|
| #297#297 |
Grok 4.1 Fastnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
3.8… |
X AI |
$0.008
↓
…
|
1.62s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 3
响应时间(平均)1.62s
响应时间(最大)5.51s
响应时间(总计)19.48s
…
|
- 总测试数
- 19
- 错误测试数
- 16
- 尝试通过率
- 19.7%
- 输入令牌
- 36,608
- 输出令牌
- 1,723
- 推理令牌
- 0
- 响应时间(平均)
- 1.62s
- 响应时间(总计)
- 19.48s
- 响应时间(最大)
- 5.51s
-
反AI技巧
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)1.07s
响应时间(最大)1.73s
响应时间(总计)2.15s
-
编程
: 1.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.79s
响应时间(最大)1.79s
响应时间(总计)1.79s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.33s
响应时间(最大)3.33s
响应时间(总计)3.33s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)943ms
响应时间(最大)943ms
响应时间(总计)943ms
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.06s
响应时间(最大)1.06s
响应时间(总计)1.06s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.08s
响应时间(最大)1.08s
响应时间(总计)1.08s
-
指令遵循
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)685ms
响应时间(最大)685ms
响应时间(总计)685ms
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.10s
响应时间(最大)1.36s
响应时间(总计)2.21s
-
工具调用
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.51s
响应时间(最大)5.51s
响应时间(总计)5.51s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)731ms
响应时间(最大)731ms
响应时间(总计)731ms
|
| #222#222 |
Hy4 previewlow
|
5.6… |
Tencent |
$1.745
…
|
214.25s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 14 答案错误: 3 未遵循指令: 1 无答案: 1
响应时间(平均)214.25s
响应时间(最大)597.45s
响应时间(总计)4713.56s
…
|
- 总测试数
- 22
- 错误测试数
- 19
- 尝试通过率
- 19.7%
- 输入令牌
- 45,154
- 输出令牌
- 4,022
- 推理令牌
- 678,516
- 响应时间(平均)
- 214.25s
- 响应时间(总计)
- 4713.56s
- 响应时间(最大)
- 597.45s
-
反AI技巧
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 4
响应时间(平均)129.60s
响应时间(最大)237.97s
响应时间(总计)518.41s
-
编程
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 3
响应时间(平均)219.15s
响应时间(最大)259.22s
响应时间(总计)657.45s
-
综合
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)139.43s
响应时间(最大)171.85s
响应时间(总计)278.85s
-
数据解析与提取
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)88.53s
响应时间(最大)120.56s
响应时间(总计)177.06s
-
领域专项
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)470.24s
响应时间(最大)547.52s
响应时间(总计)1410.71s
-
通用智能
: 7.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)110.43s
响应时间(最大)110.43s
响应时间(总计)110.43s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)77.72s
响应时间(最大)91.04s
响应时间(总计)155.43s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 未遵循指令: 1 答案错误: 1
响应时间(平均)238.03s
响应时间(最大)373.63s
响应时间(总计)714.10s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)93.67s
响应时间(最大)93.67s
响应时间(总计)93.67s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)597.45s
响应时间(最大)597.45s
响应时间(总计)597.45s
|
| #241#241 |
Dots 3 Note Previewnone
|
5.2… |
Dots Studio |
$0.000
…
|
3.53s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 15 未遵循指令: 2 额外格式: 1 无效工具调用: 1
响应时间(平均)3.53s
响应时间(最大)24.48s
响应时间(总计)77.68s
…
|
- 总测试数
- 22
- 错误测试数
- 19
- 尝试通过率
- 16.7%
- 输入令牌
- 116,155
- 输出令牌
- 19,679
- 推理令牌
- 0
- 响应时间(平均)
- 3.53s
- 响应时间(总计)
- 77.68s
- 响应时间(最大)
- 24.48s
-
反AI技巧
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)1.92s
响应时间(最大)4.80s
响应时间(总计)7.69s
-
编程
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1
响应时间(平均)6.12s
响应时间(最大)13.52s
响应时间(总计)18.37s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)14.81s
响应时间(最大)24.48s
响应时间(总计)29.63s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.72s
响应时间(最大)3.22s
响应时间(总计)5.45s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.10s
响应时间(最大)1.44s
响应时间(总计)3.30s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.63s
响应时间(最大)1.63s
响应时间(总计)1.63s
-
指令遵循
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.06s
响应时间(最大)1.17s
响应时间(总计)2.12s
-
谜题求解
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.50s
响应时间(最大)2.39s
响应时间(总计)4.49s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.04s
响应时间(最大)4.04s
响应时间(总计)4.04s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)961ms
响应时间(最大)961ms
响应时间(总计)961ms
|
| #255#255 |
Laguna S 2.1low
|
5.0… |
Poolside |
$0.082
↓
…
|
85.34s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 15 API 错误: 1 额外格式: 1 未遵循指令: 1 无效工具调用: 1
响应时间(平均)85.34s
响应时间(最大)814.73s
响应时间(总计)1877.49s
…
|
- 总测试数
- 22
- 错误测试数
- 19
- 尝试通过率
- 22.7%
- 输入令牌
- 118,752
- 输出令牌
- 67,823
- 推理令牌
- 383,885
- 响应时间(平均)
- 85.34s
- 响应时间(总计)
- 1877.49s
- 响应时间(最大)
- 814.73s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 API 错误: 1
响应时间(平均)80.66s
响应时间(最大)321.43s
响应时间(总计)322.64s
-
编程
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)167.51s
响应时间(最大)270.36s
响应时间(总计)502.52s
-
综合
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)412.50s
响应时间(最大)814.73s
响应时间(总计)824.99s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.76s
响应时间(最大)4.89s
响应时间(总计)5.51s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.46s
响应时间(最大)6.68s
响应时间(总计)7.39s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)650ms
响应时间(最大)650ms
响应时间(总计)650ms
-
指令遵循
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)423ms
响应时间(最大)435ms
响应时间(总计)845ms
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1
响应时间(平均)2.70s
响应时间(最大)6.77s
响应时间(总计)8.10s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.36s
响应时间(最大)2.36s
响应时间(总计)2.36s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)202.49s
响应时间(最大)202.49s
响应时间(总计)202.49s
|
| #262#262 |
Hy4 previewnone
|
4.8… |
Tencent |
$0.041
…
|
39.24s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 API 错误: 7 未遵循指令: 2 额外格式: 1
响应时间(平均)39.24s
响应时间(最大)95.32s
响应时间(总计)863.30s
…
|
- 总测试数
- 22
- 错误测试数
- 19
- 尝试通过率
- 16.7%
- 输入令牌
- 26,376
- 输出令牌
- 7,306
- 推理令牌
- 0
- 响应时间(平均)
- 39.24s
- 响应时间(总计)
- 863.30s
- 响应时间(最大)
- 95.32s
-
反AI技巧
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 额外格式: 1
响应时间(平均)31.54s
响应时间(最大)41.19s
响应时间(总计)126.18s
-
编程
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 未遵循指令: 1 答案错误: 1
响应时间(平均)45.53s
响应时间(最大)73.98s
响应时间(总计)136.60s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)75.12s
响应时间(最大)95.32s
响应时间(总计)150.23s
-
数据解析与提取
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)22.81s
响应时间(最大)29.63s
响应时间(总计)45.63s
-
领域专项
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)25.61s
响应时间(最大)45.05s
响应时间(总计)76.83s
-
通用智能
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)58.28s
响应时间(最大)58.28s
响应时间(总计)58.28s
-
指令遵循
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)47.90s
响应时间(最大)50.25s
响应时间(总计)95.81s
-
谜题求解
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 未遵循指令: 1 答案错误: 1
响应时间(平均)24.12s
响应时间(最大)30.85s
响应时间(总计)72.36s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)81.53s
响应时间(最大)81.53s
响应时间(总计)81.53s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)19.87s
响应时间(最大)19.87s
响应时间(总计)19.87s
|
| #277#277 |
Qwen3 Coder Nextmedium
|
4.6… |
Qwen |
$0.034
↑
…
|
9.07s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 未遵循指令: 3 无答案: 1 超时: 1
响应时间(平均)9.07s
响应时间(最大)81.80s
响应时间(总计)154.19s
…
|
- 总测试数
- 22
- 错误测试数
- 19
- 尝试通过率
- 25.8%
- 输入令牌
- 148,203
- 输出令牌
- 19,069
- 推理令牌
- 0
- 响应时间(平均)
- 9.07s
- 响应时间(总计)
- 154.19s
- 响应时间(最大)
- 81.80s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)8.64s
响应时间(最大)15.28s
响应时间(总计)17.29s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)924ms
响应时间(最大)1.69s
响应时间(总计)2.77s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)14.65s
响应时间(最大)25.01s
响应时间(总计)29.29s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)81.80s
响应时间(最大)81.80s
响应时间(总计)81.80s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)570ms
响应时间(最大)638ms
响应时间(总计)1.14s
-
通用智能
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.39s
响应时间(最大)1.39s
响应时间(总计)1.39s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.49s
响应时间(最大)13.67s
响应时间(总计)14.99s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.25s
响应时间(最大)1.68s
响应时间(总计)2.49s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.64s
响应时间(最大)2.64s
响应时间(总计)2.64s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)399ms
响应时间(最大)399ms
响应时间(总计)399ms
|
| #285#285 |
Granite 4.2 8Bnone
|
4.3… |
IBM Granite |
$0.026
…
|
86.27s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 额外格式: 4 超时: 3 未遵循指令: 1
响应时间(平均)86.27s
响应时间(最大)747.17s
响应时间(总计)1897.96s
…
|
- 总测试数
- 22
- 错误测试数
- 19
- 尝试通过率
- 16.7%
- 输入令牌
- 57,786
- 输出令牌
- 130,805
- 推理令牌
- 0
- 响应时间(平均)
- 86.27s
- 响应时间(总计)
- 1897.96s
- 响应时间(最大)
- 747.17s
-
反AI技巧
: 4.9
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 未遵循指令: 1
响应时间(平均)17.77s
响应时间(最大)48.74s
响应时间(总计)71.07s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)105.60s
响应时间(最大)314.09s
响应时间(总计)316.81s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)424.28s
响应时间(最大)747.17s
响应时间(总计)848.56s
-
数据解析与提取
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.05s
响应时间(最大)1.58s
响应时间(总计)2.09s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)53.62s
响应时间(最大)102.40s
响应时间(总计)160.87s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)770ms
响应时间(最大)770ms
响应时间(总计)770ms
-
指令遵循
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 超时: 1
响应时间(平均)79.50s
响应时间(最大)155.70s
响应时间(总计)159.00s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 超时: 1 答案错误: 1
响应时间(平均)107.60s
响应时间(最大)173.14s
响应时间(总计)322.80s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.39s
响应时间(最大)1.39s
响应时间(总计)1.39s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)14.60s
响应时间(最大)14.60s
响应时间(总计)14.60s
|
| #293#293 |
Nemotron 3.5 Lightningnone
|
4.0… |
NVIDIA |
$0.007
↕
…
|
1.21s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 16 无效工具调用: 2 未遵循指令: 1
响应时间(平均)1.21s
响应时间(最大)6.30s
响应时间(总计)26.62s
…
|
- 总测试数
- 22
- 错误测试数
- 19
- 尝试通过率
- 16.7%
- 输入令牌
- 74,074
- 输出令牌
- 2,731
- 推理令牌
- 0
- 响应时间(平均)
- 1.21s
- 响应时间(总计)
- 26.62s
- 响应时间(最大)
- 6.30s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.12s
响应时间(最大)6.30s
响应时间(总计)8.49s
-
编程
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.55s
响应时间(最大)1.76s
响应时间(总计)4.64s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)2.02s
响应时间(最大)2.27s
响应时间(总计)4.05s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)633ms
响应时间(最大)712ms
响应时间(总计)1.27s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)683ms
响应时间(最大)1.30s
响应时间(总计)2.05s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)586ms
响应时间(最大)586ms
响应时间(总计)586ms
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)511ms
响应时间(最大)524ms
响应时间(总计)1.02s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)750ms
响应时间(最大)1.07s
响应时间(总计)2.25s
-
工具调用
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)1.70s
响应时间(最大)1.70s
响应时间(总计)1.70s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)575ms
响应时间(最大)575ms
响应时间(总计)575ms
|
| #298#298 |
Qwen3.5-9Bmedium
|
3.8… |
Qwen |
$0.062
↑
…
|
107.51s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 11 无答案: 3 答案错误: 2 API 错误: 1 额外格式: 1 未遵循指令: 1
响应时间(平均)107.51s
响应时间(最大)569.97s
响应时间(总计)1720.15s
…
|
- 总测试数
- 22
- 错误测试数
- 19
- 尝试通过率
- 25.8%
- 输入令牌
- 17,195
- 输出令牌
- 46,735
- 推理令牌
- 366,707
- 响应时间(平均)
- 107.51s
- 响应时间(总计)
- 1720.15s
- 响应时间(最大)
- 569.97s
-
反AI技巧
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 答案错误: 1
响应时间(平均)34.44s
响应时间(最大)57.86s
响应时间(总计)103.31s
-
编程
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 无答案: 1 超时: 1
响应时间(平均)100.88s
响应时间(最大)135.61s
响应时间(总计)201.75s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 超时: 1
响应时间(平均)87.31s
响应时间(最大)87.31s
响应时间(总计)87.31s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 无答案: 1
响应时间(平均)272.50s
响应时间(最大)569.97s
响应时间(总计)817.51s
-
通用智能
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)226.38s
响应时间(最大)226.38s
响应时间(总计)226.38s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)5.75s
响应时间(最大)5.75s
响应时间(总计)5.75s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 答案错误: 1
响应时间(平均)32.27s
响应时间(最大)47.31s
响应时间(总计)96.80s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.31s
响应时间(最大)4.31s
响应时间(总计)4.31s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)177.02s
响应时间(最大)177.02s
响应时间(总计)177.02s
|