| #307#307 |
Ling 2.6 1tnone
|
4.9… |
Inclusionai |
$0.016
↑
…
|
8.16s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 API 错误: 4 未遵循指令: 2 无效工具调用: 1
响应时间(平均)8.16s
响应时间(最大)25.72s
响应时间(总计)163.24s
…
|
- 总测试数
- 23
- 错误测试数
- 19
- 尝试通过率
- 17.4%
- 输入令牌
- 106,423
- 输出令牌
- 11,555
- 推理令牌
- 0
- 响应时间(平均)
- 8.16s
- 响应时间(总计)
- 163.24s
- 响应时间(最大)
- 25.72s
-
智能体任务
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)38ms
响应时间(最大)38ms
响应时间(总计)38ms
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)6.55s
响应时间(最大)9.41s
响应时间(总计)26.19s
-
编程
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2 答案错误: 1
响应时间(平均)10.57s
响应时间(最大)10.57s
响应时间(总计)10.57s
-
综合
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)23.79s
响应时间(最大)24.05s
响应时间(总计)47.59s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.37s
响应时间(最大)1.37s
响应时间(总计)2.73s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.08s
响应时间(最大)1.22s
响应时间(总计)3.25s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)20.34s
响应时间(最大)20.34s
响应时间(总计)20.34s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.36s
响应时间(最大)9.81s
响应时间(总计)10.73s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)5.36s
响应时间(最大)13.26s
响应时间(总计)16.09s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)25.72s
响应时间(最大)25.72s
响应时间(总计)25.72s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #306#306 |
Gemini 3 PRO Previewmedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.9… |
Google |
$0.385
↑
…
|
9.05s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 4 答案错误: 3
响应时间(平均)9.05s
响应时间(最大)26.24s
响应时间(总计)90.53s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 60.9%
- 输入令牌
- 28,848
- 输出令牌
- 1,490
- 推理令牌
- 10,102
- 响应时间(平均)
- 9.05s
- 响应时间(总计)
- 90.53s
- 响应时间(最大)
- 26.24s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.99s
响应时间(最大)26.24s
响应时间(总计)29.99s
-
编程
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 3
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.37s
响应时间(最大)10.37s
响应时间(总计)10.37s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.84s
响应时间(最大)10.84s
响应时间(总计)10.84s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)7.01s
响应时间(最大)7.01s
响应时间(总计)7.01s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.34s
响应时间(最大)9.34s
响应时间(总计)9.34s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.26s
响应时间(最大)3.26s
响应时间(总计)3.26s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.88s
响应时间(最大)4.23s
响应时间(总计)7.77s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.96s
响应时间(最大)11.96s
响应时间(总计)11.96s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #305#305 |
Laguna S 2.1high
|
4.9… |
Poolside |
$0.145
↓
…
|
113.63s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 无效工具调用: 2 无答案: 2 API 错误: 1 额外格式: 1 未遵循指令: 1
响应时间(平均)113.63s
响应时间(最大)1190.11s
响应时间(总计)2613.48s
…
|
- 总测试数
- 23
- 错误测试数
- 19
- 尝试通过率
- 27.5%
- 输入令牌
- 344,806
- 输出令牌
- 177,330
- 推理令牌
- 453,213
- 响应时间(平均)
- 113.63s
- 响应时间(总计)
- 2613.48s
- 响应时间(最大)
- 1190.11s
-
智能体任务
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)158.25s
响应时间(最大)158.25s
响应时间(总计)158.25s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 无答案: 1
响应时间(平均)52.20s
响应时间(最大)207.32s
响应时间(总计)208.79s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 无答案: 1
响应时间(平均)271.42s
响应时间(最大)423.72s
响应时间(总计)814.25s
-
综合
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)702.26s
响应时间(最大)1190.11s
响应时间(总计)1404.52s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.96s
响应时间(最大)3.41s
响应时间(总计)3.91s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.51s
响应时间(最大)6.82s
响应时间(总计)7.52s
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)855ms
响应时间(最大)855ms
响应时间(总计)855ms
-
指令遵循
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)453ms
响应时间(最大)492ms
响应时间(总计)905ms
-
谜题求解
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1
响应时间(平均)1.62s
响应时间(最大)3.81s
响应时间(总计)4.87s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.69s
响应时间(最大)2.69s
响应时间(总计)2.69s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.94s
响应时间(最大)6.94s
响应时间(总计)6.94s
|
| #304#304 |
Qwen3 Coder Nextnone
|
4.9… |
Qwen |
$0.067
↑
…
|
19.73s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 15 额外格式: 1 未遵循指令: 1 无答案: 1
响应时间(平均)19.73s
响应时间(最大)208.38s
响应时间(总计)355.09s
…
|
- 总测试数
- 23
- 错误测试数
- 18
- 尝试通过率
- 24.6%
- 输入令牌
- 250,329
- 输出令牌
- 45,168
- 推理令牌
- 0
- 响应时间(平均)
- 19.73s
- 响应时间(总计)
- 355.09s
- 响应时间(最大)
- 208.38s
-
智能体任务
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)208.38s
响应时间(最大)208.38s
响应时间(总计)208.38s
-
反AI技巧
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1 未遵循指令: 1
响应时间(平均)3.31s
响应时间(最大)4.39s
响应时间(总计)6.63s
-
编程
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.22s
响应时间(最大)3.14s
响应时间(总计)6.67s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)30.86s
响应时间(最大)45.14s
响应时间(总计)61.71s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.32s
响应时间(最大)1.32s
响应时间(总计)1.32s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)871ms
响应时间(最大)962ms
响应时间(总计)1.74s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.34s
响应时间(最大)1.34s
响应时间(总计)1.34s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.78s
响应时间(最大)14.65s
响应时间(总计)15.56s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)24.34s
响应时间(最大)42.58s
响应时间(总计)48.69s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.47s
响应时间(最大)2.47s
响应时间(总计)2.47s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)601ms
响应时间(最大)601ms
响应时间(总计)601ms
|
| #303#303 |
Inkling Smallnone
|
4.9… |
Thinkingmachines |
$0.054
↓
…
|
1.45s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 15 API 错误: 1 未遵循指令: 1 无效工具调用: 1
响应时间(平均)1.45s
响应时间(最大)12.35s
响应时间(总计)33.24s
…
|
- 总测试数
- 23
- 错误测试数
- 18
- 尝试通过率
- 23.2%
- 输入令牌
- 94,733
- 输出令牌
- 8,770
- 推理令牌
- 0
- 响应时间(平均)
- 1.45s
- 响应时间(总计)
- 33.24s
- 响应时间(最大)
- 12.35s
-
智能体任务
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)31ms
响应时间(最大)31ms
响应时间(总计)31ms
-
反AI技巧
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)526ms
响应时间(最大)1.03s
响应时间(总计)2.10s
-
编程
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)759ms
响应时间(最大)1.52s
响应时间(总计)2.28s
-
综合
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)9.33s
响应时间(最大)12.35s
响应时间(总计)18.66s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)782ms
响应时间(最大)961ms
响应时间(总计)1.56s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)442ms
响应时间(最大)517ms
响应时间(总计)1.33s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)964ms
响应时间(最大)964ms
响应时间(总计)964ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)767ms
响应时间(最大)1.02s
响应时间(总计)1.53s
-
谜题求解
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)665ms
响应时间(最大)734ms
响应时间(总计)2.00s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.31s
响应时间(最大)2.31s
响应时间(总计)2.31s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)481ms
响应时间(最大)481ms
响应时间(总计)481ms
|
| #302#302 |
Grok 4.20 Betamedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.9… |
X AI |
$0.750
↑
…
|
9.75s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)9.75s
响应时间(最大)31.36s
响应时间(总计)175.48s
…
|
- 总测试数
- 18
- 错误测试数
- 4
- 尝试通过率
- 63.8%
- 输入令牌
- 35,955
- 输出令牌
- 1,647
- 推理令牌
- 91,565
- 响应时间(平均)
- 9.75s
- 响应时间(总计)
- 175.48s
- 响应时间(最大)
- 31.36s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.16s
响应时间(最大)3.44s
响应时间(总计)12.65s
-
编程
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)31.36s
响应时间(最大)31.36s
响应时间(总计)31.36s
-
综合
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)20.93s
响应时间(最大)20.93s
响应时间(总计)20.93s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.01s
响应时间(最大)4.27s
响应时间(总计)8.02s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)21.33s
响应时间(最大)24.21s
响应时间(总计)64.00s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.78s
响应时间(最大)5.78s
响应时间(总计)5.78s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.89s
响应时间(最大)5.89s
响应时间(总计)9.78s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.52s
响应时间(最大)4.53s
响应时间(总计)10.57s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)12.39s
响应时间(最大)12.39s
响应时间(总计)12.39s
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #301#301 |
KAT Coder AIR V2.5low
|
5.0… |
Kwaipilot |
$0.046
…
|
10.21s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 额外格式: 4 API 错误: 3 未遵循指令: 2
响应时间(平均)10.21s
响应时间(最大)86.23s
响应时间(总计)234.86s
…
|
- 总测试数
- 23
- 错误测试数
- 16
- 尝试通过率
- 42.0%
- 输入令牌
- 61,094
- 输出令牌
- 6,532
- 推理令牌
- 53,882
- 响应时间(平均)
- 10.21s
- 响应时间(总计)
- 234.86s
- 响应时间(最大)
- 86.23s
-
智能体任务
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)1.08s
响应时间(最大)1.08s
响应时间(总计)1.08s
-
反AI技巧
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.50s
响应时间(最大)5.89s
响应时间(总计)13.99s
-
编程
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 答案错误: 1
响应时间(平均)11.06s
响应时间(最大)14.01s
响应时间(总计)33.18s
-
综合
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)55.86s
响应时间(最大)86.23s
响应时间(总计)111.72s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.82s
响应时间(最大)3.26s
响应时间(总计)5.64s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 API 错误: 1
响应时间(平均)8.91s
响应时间(最大)13.68s
响应时间(总计)26.72s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)10.11s
响应时间(最大)10.11s
响应时间(总计)10.11s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.64s
响应时间(最大)2.19s
响应时间(总计)3.28s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.57s
响应时间(最大)1.86s
响应时间(总计)4.71s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.47s
响应时间(最大)4.47s
响应时间(总计)4.47s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)19.98s
响应时间(最大)19.98s
响应时间(总计)19.98s
|
| #300#300 |
GPT-4o-mininone
|
5.0… |
OpenAI |
$0.024
…
|
4.16s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 16 未遵循指令: 1 无答案: 1
响应时间(平均)4.16s
响应时间(最大)39.99s
响应时间(总计)70.70s
…
|
- 总测试数
- 23
- 错误测试数
- 18
- 尝试通过率
- 21.7%
- 输入令牌
- 145,180
- 输出令牌
- 3,627
- 推理令牌
- 0
- 响应时间(平均)
- 4.16s
- 响应时间(总计)
- 70.70s
- 响应时间(最大)
- 39.99s
-
智能体任务
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)39.99s
响应时间(最大)39.99s
响应时间(总计)39.99s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.34s
响应时间(最大)1.83s
响应时间(总计)2.67s
-
编程
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.63s
响应时间(最大)2.55s
响应时间(总计)4.90s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)6.32s
响应时间(最大)7.58s
响应时间(总计)12.64s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.27s
响应时间(最大)1.27s
响应时间(总计)1.27s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)743ms
响应时间(最大)848ms
响应时间(总计)1.49s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)909ms
响应时间(最大)909ms
响应时间(总计)909ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.11s
响应时间(最大)1.11s
响应时间(总计)1.11s
-
谜题求解
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.21s
响应时间(最大)1.37s
响应时间(总计)2.42s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.51s
响应时间(最大)2.51s
响应时间(总计)2.51s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)794ms
响应时间(最大)794ms
响应时间(总计)794ms
|
| #299#299 |
Dots 3 Note Previewnone
|
5.0… |
Dots Studio |
$0.000
…
|
5.36s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 16 未遵循指令: 2 额外格式: 1 无效工具调用: 1
响应时间(平均)5.36s
响应时间(最大)45.71s
响应时间(总计)123.38s
…
|
- 总测试数
- 23
- 错误测试数
- 20
- 尝试通过率
- 15.9%
- 输入令牌
- 225,907
- 输出令牌
- 22,507
- 推理令牌
- 0
- 响应时间(平均)
- 5.36s
- 响应时间(总计)
- 123.38s
- 响应时间(最大)
- 45.71s
-
智能体任务
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)45.71s
响应时间(最大)45.71s
响应时间(总计)45.71s
-
反AI技巧
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)1.92s
响应时间(最大)4.80s
响应时间(总计)7.69s
-
编程
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1
响应时间(平均)6.12s
响应时间(最大)13.52s
响应时间(总计)18.37s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)14.81s
响应时间(最大)24.48s
响应时间(总计)29.63s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.72s
响应时间(最大)3.22s
响应时间(总计)5.45s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.10s
响应时间(最大)1.44s
响应时间(总计)3.30s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.63s
响应时间(最大)1.63s
响应时间(总计)1.63s
-
指令遵循
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.06s
响应时间(最大)1.17s
响应时间(总计)2.12s
-
谜题求解
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.50s
响应时间(最大)2.39s
响应时间(总计)4.49s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.04s
响应时间(最大)4.04s
响应时间(总计)4.04s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)961ms
响应时间(最大)961ms
响应时间(总计)961ms
|
| #298#298 |
MiniMax M2.7medium
|
5.0… |
Minimax |
$0.326
↑
…
|
50.32s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 5 无效工具调用: 2 无答案: 2 超时: 2 API 错误: 1
响应时间(平均)50.32s
响应时间(最大)198.82s
响应时间(总计)1107.03s
…
|
- 总测试数
- 23
- 错误测试数
- 18
- 尝试通过率
- 44.9%
- 输入令牌
- 277,130
- 输出令牌
- 45,188
- 推理令牌
- 129,163
- 响应时间(平均)
- 50.32s
- 响应时间(总计)
- 1107.03s
- 响应时间(最大)
- 198.82s
-
智能体任务
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)198.82s
响应时间(最大)198.82s
响应时间(总计)198.82s
-
反AI技巧
: 7.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)40.32s
响应时间(最大)117.04s
响应时间(总计)161.28s
-
编程
: 5.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 无答案: 1
响应时间(平均)101.89s
响应时间(最大)196.21s
响应时间(总计)305.67s
-
综合
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 无答案: 1
响应时间(平均)72.12s
响应时间(最大)103.21s
响应时间(总计)144.25s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)21.95s
响应时间(最大)24.88s
响应时间(总计)43.89s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 答案错误: 1
响应时间(平均)39.70s
响应时间(最大)63.03s
响应时间(总计)79.41s
-
通用智能
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)38.70s
响应时间(最大)38.70s
响应时间(总计)38.70s
-
指令遵循
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)12.80s
响应时间(最大)15.23s
响应时间(总计)25.60s
-
谜题求解
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)24.87s
响应时间(最大)46.29s
响应时间(总计)74.61s
-
工具调用
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)12.05s
响应时间(最大)12.05s
响应时间(总计)12.05s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)22.77s
响应时间(最大)22.77s
响应时间(总计)22.77s
|
| #297#297 |
Mercury 2.5 Previewlow
|
5.0… |
Inception |
$0.015
↑
…
|
4.92s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 2 API 错误: 1 无答案: 1
响应时间(平均)4.92s
响应时间(最大)84.47s
响应时间(总计)113.24s
…
|
- 总测试数
- 23
- 错误测试数
- 17
- 尝试通过率
- 44.9%
- 输入令牌
- 235,438
- 输出令牌
- 8,136
- 推理令牌
- 28,734
- 响应时间(平均)
- 4.92s
- 响应时间(总计)
- 113.24s
- 响应时间(最大)
- 84.47s
-
智能体任务
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)84.47s
响应时间(最大)84.47s
响应时间(总计)84.47s
-
反AI技巧
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)759ms
响应时间(最大)1.10s
响应时间(总计)3.04s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)972ms
响应时间(最大)1.02s
响应时间(总计)2.92s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)4.77s
响应时间(最大)7.29s
响应时间(总计)9.54s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.12s
响应时间(最大)1.54s
响应时间(总计)2.24s
-
领域专项
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)836ms
响应时间(最大)1.06s
响应时间(总计)2.51s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.05s
响应时间(最大)1.05s
响应时间(总计)1.05s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.60s
响应时间(最大)2.42s
响应时间(总计)3.20s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)710ms
响应时间(最大)792ms
响应时间(总计)2.13s
-
工具调用
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)1.57s
响应时间(最大)1.57s
响应时间(总计)1.57s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)591ms
响应时间(最大)591ms
响应时间(总计)591ms
|
| #296#296 |
Laguna S 2.1medium
|
5.0… |
Poolside |
$0.092
↑
…
|
63.06s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 无效工具调用: 2 无答案: 2 未遵循指令: 1
响应时间(平均)63.06s
响应时间(最大)560.31s
响应时间(总计)1450.31s
…
|
- 总测试数
- 23
- 错误测试数
- 19
- 尝试通过率
- 24.6%
- 输入令牌
- 230,291
- 输出令牌
- 99,030
- 推理令牌
- 287,794
- 响应时间(平均)
- 63.06s
- 响应时间(总计)
- 1450.31s
- 响应时间(最大)
- 560.31s
-
智能体任务
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)165.05s
响应时间(最大)165.05s
响应时间(总计)165.05s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 无答案: 1
响应时间(平均)51.82s
响应时间(最大)205.67s
响应时间(总计)207.27s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)158.98s
响应时间(最大)441.13s
响应时间(总计)476.95s
-
综合
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)284.71s
响应时间(最大)560.31s
响应时间(总计)569.43s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.42s
响应时间(最大)4.25s
响应时间(总计)4.84s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.68s
响应时间(最大)7.28s
响应时间(总计)8.03s
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)739ms
响应时间(最大)739ms
响应时间(总计)739ms
-
指令遵循
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)400ms
响应时间(最大)411ms
响应时间(总计)799ms
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.62s
响应时间(最大)6.83s
响应时间(总计)7.86s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.24s
响应时间(最大)2.24s
响应时间(总计)2.24s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.11s
响应时间(最大)7.11s
响应时间(总计)7.11s
|
| #295#295 |
MiMo-V2.5-Pronone
|
5.1… |
Xiaomi |
$0.135
↓
…
|
6.21s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 未遵循指令: 4 无效工具调用: 1 无答案: 1
响应时间(平均)6.21s
响应时间(最大)53.13s
响应时间(总计)142.89s
…
|
- 总测试数
- 23
- 错误测试数
- 18
- 尝试通过率
- 31.9%
- 输入令牌
- 273,075
- 输出令牌
- 17,069
- 推理令牌
- 0
- 响应时间(平均)
- 6.21s
- 响应时间(总计)
- 142.89s
- 响应时间(最大)
- 53.13s
-
智能体任务
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)49.61s
响应时间(最大)49.61s
响应时间(总计)49.61s
-
反AI技巧
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)2.67s
响应时间(最大)8.32s
响应时间(总计)10.67s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.41s
响应时间(最大)2.39s
响应时间(总计)4.23s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 无答案: 1
响应时间(平均)28.33s
响应时间(最大)53.13s
响应时间(总计)56.67s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.32s
响应时间(最大)1.42s
响应时间(总计)2.64s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.79s
响应时间(最大)3.59s
响应时间(总计)5.36s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.58s
响应时间(最大)2.58s
响应时间(总计)2.58s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.03s
响应时间(最大)1.10s
响应时间(总计)2.06s
-
谜题求解
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.30s
响应时间(最大)1.61s
响应时间(总计)3.90s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.30s
响应时间(最大)3.30s
响应时间(总计)3.30s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.89s
响应时间(最大)1.89s
响应时间(总计)1.89s
|
| #294#294 |
KAT Coder AIR V2.5medium
|
5.1… |
Kwaipilot |
$0.048
…
|
8.32s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 API 错误: 2 额外格式: 1 未遵循指令: 1 超时: 1
响应时间(平均)8.32s
响应时间(最大)48.19s
响应时间(总计)191.40s
…
|
- 总测试数
- 23
- 错误测试数
- 15
- 尝试通过率
- 43.5%
- 输入令牌
- 51,369
- 输出令牌
- 8,008
- 推理令牌
- 58,568
- 响应时间(平均)
- 8.32s
- 响应时间(总计)
- 191.40s
- 响应时间(最大)
- 48.19s
-
智能体任务
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)1.05s
响应时间(最大)1.05s
响应时间(总计)1.05s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.79s
响应时间(最大)9.97s
响应时间(总计)15.17s
-
编程
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1
响应时间(平均)23.37s
响应时间(最大)48.19s
响应时间(总计)70.10s
-
综合
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)19.56s
响应时间(最大)27.68s
响应时间(总计)39.11s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.65s
响应时间(最大)4.88s
响应时间(总计)7.31s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)6.58s
响应时间(最大)7.90s
响应时间(总计)19.73s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)9.81s
响应时间(最大)9.81s
响应时间(总计)9.81s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.50s
响应时间(最大)1.88s
响应时间(总计)3.00s
-
谜题求解
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.87s
响应时间(最大)2.41s
响应时间(总计)5.61s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.77s
响应时间(最大)4.77s
响应时间(总计)4.77s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)15.74s
响应时间(最大)15.74s
响应时间(总计)15.74s
|
| #293#293 |
Mercury 2.5low
|
5.1… |
Inception |
$0.020
…
|
3.34s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 API 错误: 1 无效工具调用: 1 无答案: 1
响应时间(平均)3.34s
响应时间(最大)47.06s
响应时间(总计)76.80s
…
|
- 总测试数
- 23
- 错误测试数
- 17
- 尝试通过率
- 37.7%
- 输入令牌
- 326,083
- 输出令牌
- 7,224
- 推理令牌
- 33,078
- 响应时间(平均)
- 3.34s
- 响应时间(总计)
- 76.80s
- 响应时间(最大)
- 47.06s
-
智能体任务
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)47.06s
响应时间(最大)47.06s
响应时间(总计)47.06s
-
反AI技巧
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)799ms
响应时间(最大)1.05s
响应时间(总计)3.20s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)972ms
响应时间(最大)1.03s
响应时间(总计)2.92s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)5.16s
响应时间(最大)7.48s
响应时间(总计)10.32s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.06s
响应时间(最大)1.10s
响应时间(总计)2.13s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)846ms
响应时间(最大)1.03s
响应时间(总计)2.54s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)819ms
响应时间(最大)819ms
响应时间(总计)819ms
-
指令遵循
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)972ms
响应时间(最大)1.26s
响应时间(总计)1.94s
-
谜题求解
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)792ms
响应时间(最大)829ms
响应时间(总计)2.38s
-
工具调用
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.72s
响应时间(最大)2.72s
响应时间(总计)2.72s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)782ms
响应时间(最大)782ms
响应时间(总计)782ms
|
| #292#292 |
Mistral Small 4none
|
5.1… |
Mistral |
$0.047
…
|
3.12s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 17 未遵循指令: 1
响应时间(平均)3.12s
响应时间(最大)45.46s
响应时间(总计)71.87s
…
|
- 总测试数
- 23
- 错误测试数
- 18
- 尝试通过率
- 24.6%
- 输入令牌
- 265,602
- 输出令牌
- 10,913
- 推理令牌
- 0
- 响应时间(平均)
- 3.12s
- 响应时间(总计)
- 71.87s
- 响应时间(最大)
- 45.46s
-
智能体任务
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)45.46s
响应时间(最大)45.46s
响应时间(总计)45.46s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)395ms
响应时间(最大)769ms
响应时间(总计)1.58s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)901ms
响应时间(最大)1.28s
响应时间(总计)2.70s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)7.44s
响应时间(最大)13.16s
响应时间(总计)14.88s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)822ms
响应时间(最大)1.08s
响应时间(总计)1.64s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)377ms
响应时间(最大)418ms
响应时间(总计)1.13s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)729ms
响应时间(最大)729ms
响应时间(总计)729ms
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)380ms
响应时间(最大)380ms
响应时间(总计)759ms
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)399ms
响应时间(最大)570ms
响应时间(总计)1.20s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.40s
响应时间(最大)1.40s
响应时间(总计)1.40s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)397ms
响应时间(最大)397ms
响应时间(总计)397ms
|
| #291#291 |
Mistral Small 4medium
|
5.1… |
Mistral |
$0.126
↑
…
|
12.68s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 未遵循指令: 2 API 错误: 1 无答案: 1
响应时间(平均)12.68s
响应时间(最大)59.15s
响应时间(总计)291.66s
…
|
- 总测试数
- 23
- 错误测试数
- 18
- 尝试通过率
- 42.0%
- 输入令牌
- 321,955
- 输出令牌
- 41,555
- 推理令牌
- 94,946
- 响应时间(平均)
- 12.68s
- 响应时间(总计)
- 291.66s
- 响应时间(最大)
- 59.15s
-
智能体任务
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)54.05s
响应时间(最大)54.05s
响应时间(总计)54.05s
-
反AI技巧
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.67s
响应时间(最大)5.03s
响应时间(总计)10.66s
-
编程
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)39.98s
响应时间(最大)59.15s
响应时间(总计)119.95s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)32.40s
响应时间(最大)39.55s
响应时间(总计)64.80s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)1.23s
响应时间(最大)1.96s
响应时间(总计)2.46s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)6.33s
响应时间(最大)13.72s
响应时间(总计)19.00s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.05s
响应时间(最大)2.05s
响应时间(总计)2.05s
-
指令遵循
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.38s
响应时间(最大)1.61s
响应时间(总计)2.75s
-
谜题求解
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)2.17s
响应时间(最大)2.60s
响应时间(总计)6.50s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.50s
响应时间(最大)3.50s
响应时间(总计)3.50s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.92s
响应时间(最大)5.92s
响应时间(总计)5.92s
|
| #290#290 |
MiMo-V2-Flashmedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.1… |
Xiaomi |
$0.043
↑
…
|
20.11s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 API 错误: 1 额外格式: 1 未遵循指令: 1 超时: 1
响应时间(平均)20.11s
响应时间(最大)96.01s
响应时间(总计)301.59s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 59.4%
- 输入令牌
- 40,111
- 输出令牌
- 12,476
- 推理令牌
- 125,039
- 响应时间(平均)
- 20.11s
- 响应时间(总计)
- 301.59s
- 响应时间(最大)
- 96.01s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 8.1
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)15.85s
响应时间(最大)20.83s
响应时间(总计)47.55s
-
编程
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)10.71s
响应时间(最大)17.72s
响应时间(总计)32.13s
-
综合
: 4.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)75.68s
响应时间(最大)75.68s
响应时间(总计)75.68s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)96.01s
响应时间(最大)96.01s
响应时间(总计)96.01s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.20s
响应时间(最大)4.20s
响应时间(总计)4.20s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.28s
响应时间(最大)7.37s
响应时间(总计)8.55s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.87s
响应时间(最大)5.26s
响应时间(总计)7.74s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)27.78s
响应时间(最大)27.78s
响应时间(总计)27.78s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.96s
响应时间(最大)1.96s
响应时间(总计)1.96s
|
| #288#288 |
KAT Coder AIR V2.5high
|
5.2… |
Kwaipilot |
$0.077
…
|
15.23s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 API 错误: 4 额外格式: 3
响应时间(平均)15.23s
响应时间(最大)118.35s
响应时间(总计)350.26s
…
|
- 总测试数
- 23
- 错误测试数
- 16
- 尝试通过率
- 40.6%
- 输入令牌
- 50,423
- 输出令牌
- 4,144
- 推理令牌
- 110,510
- 响应时间(平均)
- 15.23s
- 响应时间(总计)
- 350.26s
- 响应时间(最大)
- 118.35s
-
智能体任务
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)1.10s
响应时间(最大)1.10s
响应时间(总计)1.10s
-
反AI技巧
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)2.49s
响应时间(最大)3.97s
响应时间(总计)9.97s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 额外格式: 1 答案错误: 1
响应时间(平均)39.07s
响应时间(最大)104.98s
响应时间(总计)117.21s
-
综合
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)74.48s
响应时间(最大)118.35s
响应时间(总计)148.95s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.59s
响应时间(最大)4.92s
响应时间(总计)7.18s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 答案错误: 1
响应时间(平均)7.28s
响应时间(最大)8.71s
响应时间(总计)21.85s
-
通用智能
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.10s
响应时间(最大)7.10s
响应时间(总计)7.10s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.51s
响应时间(最大)1.91s
响应时间(总计)3.01s
-
谜题求解
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.47s
响应时间(最大)2.86s
响应时间(总计)7.40s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.77s
响应时间(最大)4.77s
响应时间(总计)4.77s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)21.72s
响应时间(最大)21.72s
响应时间(总计)21.72s
|
| #289#289 |
Mimo V2 PROmedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.2… |
Xiaomi |
$0.333
↑
…
|
22.16s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 API 错误: 1 额外格式: 1 未遵循指令: 1 超时: 1
响应时间(平均)22.16s
响应时间(最大)136.29s
响应时间(总计)443.22s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 66.7%
- 输入令牌
- 40,961
- 输出令牌
- 2,518
- 推理令牌
- 81,801
- 响应时间(平均)
- 22.16s
- 响应时间(总计)
- 443.22s
- 响应时间(最大)
- 136.29s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.86s
响应时间(最大)3.92s
响应时间(总计)11.45s
-
编程
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)94.21s
响应时间(最大)136.29s
响应时间(总计)188.41s
-
综合
: 2.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)64.71s
响应时间(最大)64.71s
响应时间(总计)64.71s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.20s
响应时间(最大)17.44s
响应时间(总计)34.40s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)8.82s
响应时间(最大)14.48s
响应时间(总计)26.47s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.92s
响应时间(最大)4.92s
响应时间(总计)4.92s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.36s
响应时间(最大)4.35s
响应时间(总计)6.72s
-
谜题求解
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 未遵循指令: 1
响应时间(平均)5.08s
响应时间(最大)6.41s
响应时间(总计)15.23s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.19s
响应时间(最大)8.19s
响应时间(总计)8.19s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)82.71s
响应时间(最大)82.71s
响应时间(总计)82.71s
|
| #287#287 |
Nemotron 3.5 Lightninghigh
|
5.2… |
NVIDIA |
$0.117
↕
…
|
77.08s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 4 额外格式: 1 无效工具调用: 1 超时: 1
响应时间(平均)77.08s
响应时间(最大)490.99s
响应时间(总计)1772.78s
…
|
- 总测试数
- 23
- 错误测试数
- 18
- 尝试通过率
- 47.8%
- 输入令牌
- 170,517
- 输出令牌
- 149,968
- 推理令牌
- 509,725
- 响应时间(平均)
- 77.08s
- 响应时间(总计)
- 1772.78s
- 响应时间(最大)
- 490.99s
-
智能体任务
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)490.99s
响应时间(最大)490.99s
响应时间(总计)490.99s
-
反AI技巧
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)10.29s
响应时间(最大)17.68s
响应时间(总计)41.16s
-
编程
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1
响应时间(平均)168.41s
响应时间(最大)280.94s
响应时间(总计)505.22s
-
综合
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)160.45s
响应时间(最大)285.26s
响应时间(总计)320.90s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)13.99s
响应时间(最大)18.67s
响应时间(总计)27.97s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)88.61s
响应时间(最大)226.92s
响应时间(总计)265.83s
-
通用智能
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.58s
响应时间(最大)7.58s
响应时间(总计)7.58s
-
指令遵循
: 8.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.98s
响应时间(最大)5.05s
响应时间(总计)9.97s
-
谜题求解
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2 答案错误: 1
响应时间(平均)6.09s
响应时间(最大)10.09s
响应时间(总计)18.26s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.92s
响应时间(最大)6.92s
响应时间(总计)6.92s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)77.98s
响应时间(最大)77.98s
响应时间(总计)77.98s
|
| #286#286 |
Ling 3.0 Flashnone
|
5.2… |
Inclusionai |
$0.004
↕
…
|
3.40s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 API 错误: 2 未遵循指令: 1 无效工具调用: 1
响应时间(平均)3.40s
响应时间(最大)17.51s
响应时间(总计)74.77s
…
|
- 总测试数
- 23
- 错误测试数
- 17
- 尝试通过率
- 26.1%
- 输入令牌
- 123,993
- 输出令牌
- 12,777
- 推理令牌
- 0
- 响应时间(平均)
- 3.40s
- 响应时间(总计)
- 74.77s
- 响应时间(最大)
- 17.51s
-
智能体任务
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)26ms
响应时间(最大)26ms
响应时间(总计)26ms
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)3.34s
响应时间(最大)9.88s
响应时间(总计)13.36s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)6.39s
响应时间(最大)17.51s
响应时间(总计)19.16s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)8.58s
响应时间(最大)11.54s
响应时间(总计)17.17s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.10s
响应时间(最大)1.23s
响应时间(总计)2.21s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)840ms
响应时间(最大)892ms
响应时间(总计)1.68s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.58s
响应时间(最大)1.58s
响应时间(总计)1.58s
-
指令遵循
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)836ms
响应时间(最大)860ms
响应时间(总计)1.67s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.49s
响应时间(最大)2.55s
响应时间(总计)4.46s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.85s
响应时间(最大)2.85s
响应时间(总计)2.85s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.61s
响应时间(最大)10.61s
响应时间(总计)10.61s
|
| #285#285 |
Inkling Smalllow
|
5.2… |
Thinkingmachines |
$0.055
↓
…
|
1.99s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 2 无效工具调用: 2 API 错误: 1
响应时间(平均)1.99s
响应时间(最大)5.82s
响应时间(总计)45.67s
…
|
- 总测试数
- 23
- 错误测试数
- 14
- 尝试通过率
- 47.8%
- 输入令牌
- 81,447
- 输出令牌
- 2,715
- 推理令牌
- 11,971
- 响应时间(平均)
- 1.99s
- 响应时间(总计)
- 45.67s
- 响应时间(最大)
- 5.82s
-
智能体任务
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)24ms
响应时间(最大)24ms
响应时间(总计)24ms
-
反AI技巧
: 9.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.81s
响应时间(最大)3.73s
响应时间(总计)7.25s
-
编程
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)3.70s
响应时间(最大)5.82s
响应时间(总计)11.10s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)4.08s
响应时间(最大)4.59s
响应时间(总计)8.15s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.25s
响应时间(最大)1.32s
响应时间(总计)2.50s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)852ms
响应时间(最大)918ms
响应时间(总计)2.56s
-
通用智能
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.42s
响应时间(最大)1.42s
响应时间(总计)1.42s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.89s
响应时间(最大)2.18s
响应时间(总计)3.78s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.56s
响应时间(最大)2.38s
响应时间(总计)4.68s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)2.21s
响应时间(最大)2.21s
响应时间(总计)2.21s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.00s
响应时间(最大)2.00s
响应时间(总计)2.00s
|
| #284#284 |
Qwen3.6 35B A3Bnone
|
5.3… |
Qwen |
$0.105
↑
…
|
8.43s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 API 错误: 2 未遵循指令: 2 无效工具调用: 1 无答案: 1
响应时间(平均)8.43s
响应时间(最大)65.61s
响应时间(总计)176.93s
…
|
- 总测试数
- 23
- 错误测试数
- 19
- 尝试通过率
- 29.0%
- 输入令牌
- 272,479
- 输出令牌
- 63,781
- 推理令牌
- 0
- 响应时间(平均)
- 8.43s
- 响应时间(总计)
- 176.93s
- 响应时间(最大)
- 65.61s
-
智能体任务
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)65.61s
响应时间(最大)65.61s
响应时间(总计)65.61s
-
反AI技巧
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.10s
响应时间(最大)6.15s
响应时间(总计)8.41s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)8.77s
响应时间(最大)22.52s
响应时间(总计)26.32s
-
综合
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 无答案: 1
响应时间(平均)39.54s
响应时间(最大)39.54s
响应时间(总计)39.54s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.46s
响应时间(最大)2.03s
响应时间(总计)2.93s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)7.76s
响应时间(最大)12.46s
响应时间(总计)23.27s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.51s
响应时间(最大)3.51s
响应时间(总计)3.51s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.86s
响应时间(最大)2.83s
响应时间(总计)3.73s
-
谜题求解
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2 答案错误: 1
响应时间(平均)1.07s
响应时间(最大)1.24s
响应时间(总计)3.20s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)414ms
响应时间(最大)414ms
响应时间(总计)414ms
|
| #283#283 |
Laguna XS 2.1none
|
5.3… |
Poolside |
$0.020
…
|
4.56s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 无效工具调用: 2 未遵循指令: 1 超时: 1
响应时间(平均)4.56s
响应时间(最大)70.79s
响应时间(总计)104.80s
…
|
- 总测试数
- 23
- 错误测试数
- 18
- 尝试通过率
- 29.0%
- 输入令牌
- 270,072
- 输出令牌
- 23,173
- 推理令牌
- 0
- 响应时间(平均)
- 4.56s
- 响应时间(总计)
- 104.80s
- 响应时间(最大)
- 70.79s
-
智能体任务
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)70.79s
响应时间(最大)70.79s
响应时间(总计)70.79s
-
反AI技巧
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)755ms
响应时间(最大)2.30s
响应时间(总计)3.02s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)623ms
响应时间(最大)1.34s
响应时间(总计)1.87s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)10.39s
响应时间(最大)19.02s
响应时间(总计)20.78s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)768ms
响应时间(最大)824ms
响应时间(总计)1.54s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)303ms
响应时间(最大)379ms
响应时间(总计)910ms
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)529ms
响应时间(最大)529ms
响应时间(总计)529ms
-
指令遵循
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)364ms
响应时间(最大)373ms
响应时间(总计)728ms
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.01s
响应时间(最大)1.92s
响应时间(总计)3.02s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.36s
响应时间(最大)1.36s
响应时间(总计)1.36s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)254ms
响应时间(最大)254ms
响应时间(总计)254ms
|