| #351#351 |
Ling 3.0 Tinynone
|
3.8… |
Inclusionai |
$0.000
…
|
13.39s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 4 API 错误: 2 额外格式: 1 无效工具调用: 1
响应时间(平均)13.39s
响应时间(最大)240.61s
响应时间(总计)294.48s
…
|
- 总测试数
- 23
- 错误测试数
- 21
- 尝试通过率
- 8.7%
- 输入令牌
- 184,579
- 输出令牌
- 110,071
- 推理令牌
- 0
- 响应时间(平均)
- 13.39s
- 响应时间(总计)
- 294.48s
- 响应时间(最大)
- 240.61s
-
智能体任务
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)23ms
响应时间(最大)23ms
响应时间(总计)23ms
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1
响应时间(平均)5.14s
响应时间(最大)14.88s
响应时间(总计)20.55s
-
编程
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.19s
响应时间(最大)1.84s
响应时间(总计)3.56s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)124.21s
响应时间(最大)240.61s
响应时间(总计)248.43s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.14s
响应时间(最大)1.34s
响应时间(总计)2.27s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)880ms
响应时间(最大)917ms
响应时间(总计)1.76s
-
通用智能
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.07s
响应时间(最大)1.07s
响应时间(总计)1.07s
-
指令遵循
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.44s
响应时间(最大)3.84s
响应时间(总计)4.87s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.64s
响应时间(最大)5.23s
响应时间(总计)7.91s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.05s
响应时间(最大)3.05s
响应时间(总计)3.05s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)988ms
响应时间(最大)988ms
响应时间(总计)988ms
|
| #352#352 |
Granite 4.1 8bnone
|
3.8… |
IBM Granite |
$0.007
…
|
1.38s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 4 无效工具调用: 2 API 错误: 1 额外格式: 1
响应时间(平均)1.38s
响应时间(最大)16.67s
响应时间(总计)31.81s
…
|
- 总测试数
- 23
- 错误测试数
- 21
- 尝试通过率
- 8.7%
- 输入令牌
- 113,836
- 输出令牌
- 5,996
- 推理令牌
- 0
- 响应时间(平均)
- 1.38s
- 响应时间(总计)
- 31.81s
- 响应时间(最大)
- 16.67s
-
智能体任务
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)60ms
响应时间(最大)60ms
响应时间(总计)60ms
-
反AI技巧
: 4.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)844ms
响应时间(最大)1.91s
响应时间(总计)3.38s
-
编程
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 未遵循指令: 1 答案错误: 1
响应时间(平均)775ms
响应时间(最大)1.07s
响应时间(总计)2.33s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)9.28s
响应时间(最大)16.67s
响应时间(总计)18.55s
-
数据解析与提取
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)575ms
响应时间(最大)583ms
响应时间(总计)1.15s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)287ms
响应时间(最大)348ms
响应时间(总计)860ms
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)499ms
响应时间(最大)499ms
响应时间(总计)499ms
-
指令遵循
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)344ms
响应时间(最大)358ms
响应时间(总计)687ms
-
谜题求解
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)608ms
响应时间(最大)960ms
响应时间(总计)1.82s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.17s
响应时间(最大)2.17s
响应时间(总计)2.17s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)306ms
响应时间(最大)306ms
响应时间(总计)306ms
|
| #353#353 |
Nemotron 3.5 Lightningnone
|
3.8… |
NVIDIA |
$0.007
↕
…
|
15.92s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 16 无效工具调用: 2 未遵循指令: 1 超时: 1
响应时间(平均)15.92s
响应时间(最大)339.57s
响应时间(总计)366.20s
…
|
- 总测试数
- 23
- 错误测试数
- 20
- 尝试通过率
- 15.9%
- 输入令牌
- 97,418
- 输出令牌
- 4,779
- 推理令牌
- 0
- 响应时间(平均)
- 15.92s
- 响应时间(总计)
- 366.20s
- 响应时间(最大)
- 339.57s
-
智能体任务
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)339.57s
响应时间(最大)339.57s
响应时间(总计)339.57s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.12s
响应时间(最大)6.30s
响应时间(总计)8.49s
-
编程
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.55s
响应时间(最大)1.76s
响应时间(总计)4.64s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)2.02s
响应时间(最大)2.27s
响应时间(总计)4.05s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)633ms
响应时间(最大)712ms
响应时间(总计)1.27s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)683ms
响应时间(最大)1.30s
响应时间(总计)2.05s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)586ms
响应时间(最大)586ms
响应时间(总计)586ms
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)511ms
响应时间(最大)524ms
响应时间(总计)1.02s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)750ms
响应时间(最大)1.07s
响应时间(总计)2.25s
-
工具调用
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)1.70s
响应时间(最大)1.70s
响应时间(总计)1.70s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)575ms
响应时间(最大)575ms
响应时间(总计)575ms
|
| #354#354 |
Ling 3.0 Tinyhigh
|
3.7… |
Inclusionai |
$0.000
…
|
72.24s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 7 答案错误: 6 未遵循指令: 3 API 错误: 2 无效工具调用: 1
响应时间(平均)72.24s
响应时间(最大)345.15s
响应时间(总计)1589.23s
…
|
- 总测试数
- 23
- 错误测试数
- 19
- 尝试通过率
- 23.2%
- 输入令牌
- 115,314
- 输出令牌
- 133,965
- 推理令牌
- 816,718
- 响应时间(平均)
- 72.24s
- 响应时间(总计)
- 1589.23s
- 响应时间(最大)
- 345.15s
-
智能体任务
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)28ms
响应时间(最大)28ms
响应时间(总计)28ms
-
反AI技巧
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)24.93s
响应时间(最大)83.87s
响应时间(总计)99.73s
-
编程
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 2 未遵循指令: 1
响应时间(平均)177.65s
响应时间(最大)213.57s
响应时间(总计)532.96s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)179.85s
响应时间(最大)345.15s
响应时间(总计)359.71s
-
数据解析与提取
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.16s
响应时间(最大)5.89s
响应时间(总计)8.31s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 2 API 错误: 1
响应时间(平均)70.12s
响应时间(最大)81.88s
响应时间(总计)140.23s
-
通用智能
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)60.50s
响应时间(最大)60.50s
响应时间(总计)60.50s
-
指令遵循
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.10s
响应时间(最大)3.97s
响应时间(总计)6.21s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)54.15s
响应时间(最大)148.72s
响应时间(总计)162.46s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.76s
响应时间(最大)5.76s
响应时间(总计)5.76s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)213.35s
响应时间(最大)213.35s
响应时间(总计)213.35s
|
| #355#355 |
Ling 3.0 Tinylow
|
3.7… |
Inclusionai |
$0.000
…
|
63.15s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 7 答案错误: 5 未遵循指令: 4 API 错误: 2 无效工具调用: 1
响应时间(平均)63.15s
响应时间(最大)252.08s
响应时间(总计)1389.35s
…
|
- 总测试数
- 23
- 错误测试数
- 19
- 尝试通过率
- 18.8%
- 输入令牌
- 99,662
- 输出令牌
- 146,555
- 推理令牌
- 732,977
- 响应时间(平均)
- 63.15s
- 响应时间(总计)
- 1389.35s
- 响应时间(最大)
- 252.08s
-
智能体任务
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)21ms
响应时间(最大)21ms
响应时间(总计)21ms
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)25.30s
响应时间(最大)84.32s
响应时间(总计)101.18s
-
编程
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 2 未遵循指令: 1
响应时间(平均)170.73s
响应时间(最大)214.91s
响应时间(总计)512.19s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)134.79s
响应时间(最大)252.08s
响应时间(总计)269.57s
-
数据解析与提取
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)4.82s
响应时间(最大)6.83s
响应时间(总计)9.64s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 2 API 错误: 1
响应时间(平均)72.15s
响应时间(最大)81.30s
响应时间(总计)144.29s
-
通用智能
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)29.35s
响应时间(最大)29.35s
响应时间(总计)29.35s
-
指令遵循
: 6.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.09s
响应时间(最大)4.03s
响应时间(总计)6.19s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)32.49s
响应时间(最大)91.44s
响应时间(总计)97.46s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.94s
响应时间(最大)5.94s
响应时间(总计)5.94s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)213.54s
响应时间(最大)213.54s
响应时间(总计)213.54s
|
| #356#356 |
Ling 3.0 Tinymedium
|
3.6… |
Inclusionai |
$0.000
…
|
64.99s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 7 答案错误: 5 未遵循指令: 4 API 错误: 2 无效工具调用: 1
响应时间(平均)64.99s
响应时间(最大)262.20s
响应时间(总计)1429.68s
…
|
- 总测试数
- 23
- 错误测试数
- 19
- 尝试通过率
- 23.2%
- 输入令牌
- 103,898
- 输出令牌
- 148,304
- 推理令牌
- 774,972
- 响应时间(平均)
- 64.99s
- 响应时间(总计)
- 1429.68s
- 响应时间(最大)
- 262.20s
-
智能体任务
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)24ms
响应时间(最大)24ms
响应时间(总计)24ms
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)23.73s
响应时间(最大)81.06s
响应时间(总计)94.91s
-
编程
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 2 未遵循指令: 1
响应时间(平均)211.99s
响应时间(最大)219.75s
响应时间(总计)635.97s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)139.78s
响应时间(最大)262.20s
响应时间(总计)279.57s
-
数据解析与提取
: 2.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)4.41s
响应时间(最大)6.08s
响应时间(总计)8.82s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 2 API 错误: 1
响应时间(平均)81.40s
响应时间(最大)82.11s
响应时间(总计)162.80s
-
通用智能
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)31.77s
响应时间(最大)31.77s
响应时间(总计)31.77s
-
指令遵循
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.00s
响应时间(最大)3.81s
响应时间(总计)5.99s
-
谜题求解
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)34.65s
响应时间(最大)88.47s
响应时间(总计)103.95s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.91s
响应时间(最大)4.91s
响应时间(总计)4.91s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)100.96s
响应时间(最大)100.96s
响应时间(总计)100.96s
|
| #357#357 |
Grok 4.20 Betanone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
3.6… |
X AI |
$0.087
↓
…
|
1.19s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 1 无效工具调用: 1
响应时间(平均)1.19s
响应时间(最大)6.48s
响应时间(总计)21.43s
…
|
- 总测试数
- 18
- 错误测试数
- 12
- 尝试通过率
- 29.0%
- 输入令牌
- 40,597
- 输出令牌
- 1,657
- 推理令牌
- 0
- 响应时间(平均)
- 1.19s
- 响应时间(总计)
- 21.43s
- 响应时间(最大)
- 6.48s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)597ms
响应时间(最大)866ms
响应时间(总计)2.39s
-
编程
: 1.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.14s
响应时间(最大)1.14s
响应时间(总计)1.14s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)6.48s
响应时间(最大)6.48s
响应时间(总计)6.48s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)601ms
响应时间(最大)634ms
响应时间(总计)1.20s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)611ms
响应时间(最大)616ms
响应时间(总计)1.83s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)541ms
响应时间(最大)541ms
响应时间(总计)541ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)649ms
响应时间(最大)952ms
响应时间(总计)1.30s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)586ms
响应时间(最大)813ms
响应时间(总计)1.76s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.79s
响应时间(最大)4.79s
响应时间(总计)4.79s
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #358#358 |
Laguna M.1none已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
3.6… |
Poolside |
$0.009
↕
…
|
2.89s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 API 错误: 4 无效工具调用: 1
响应时间(平均)2.89s
响应时间(最大)15.42s
响应时间(总计)43.28s
…
|
- 总测试数
- 19
- 错误测试数
- 15
- 尝试通过率
- 26.1%
- 输入令牌
- 38,147
- 输出令牌
- 2,054
- 推理令牌
- 0
- 响应时间(平均)
- 2.89s
- 响应时间(总计)
- 43.28s
- 响应时间(最大)
- 15.42s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 API 错误: 1
响应时间(平均)705ms
响应时间(最大)975ms
响应时间(总计)2.12s
-
编程
: 2.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.93s
响应时间(最大)2.93s
响应时间(总计)2.93s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)4.32s
响应时间(最大)4.32s
响应时间(总计)4.32s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.37s
响应时间(最大)5.76s
响应时间(总计)6.73s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)5.50s
响应时间(最大)15.42s
响应时间(总计)16.50s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)683ms
响应时间(最大)691ms
响应时间(总计)1.37s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)891ms
响应时间(最大)1.21s
响应时间(总计)1.78s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.54s
响应时间(最大)7.54s
响应时间(总计)7.54s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #359#359 |
Elephant Alphanone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
3.6… |
Openrouter |
$0.000
…
|
1.22s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 API 错误: 3 未遵循指令: 3 无效工具调用: 1
响应时间(平均)1.22s
响应时间(最大)3.81s
响应时间(总计)22.03s
…
|
- 总测试数
- 21
- 错误测试数
- 16
- 尝试通过率
- 24.6%
- 输入令牌
- 33,743
- 输出令牌
- 2,573
- 推理令牌
- 0
- 响应时间(平均)
- 1.22s
- 响应时间(总计)
- 22.03s
- 响应时间(最大)
- 3.81s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 6.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)963ms
响应时间(最大)1.68s
响应时间(总计)3.85s
-
编程
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2 答案错误: 1
响应时间(平均)1.39s
响应时间(最大)1.39s
响应时间(总计)1.39s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.81s
响应时间(最大)3.81s
响应时间(总计)3.81s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.04s
响应时间(最大)1.05s
响应时间(总计)2.08s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)927ms
响应时间(最大)1.17s
响应时间(总计)2.78s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)854ms
响应时间(最大)854ms
响应时间(总计)854ms
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.03s
响应时间(最大)1.17s
响应时间(总计)2.07s
-
谜题求解
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)807ms
响应时间(最大)925ms
响应时间(总计)2.42s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)2.79s
响应时间(最大)2.79s
响应时间(总计)2.79s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #360#360 |
Elephant Alphamedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
3.5… |
Openrouter |
$0.000
…
|
1.27s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 API 错误: 3 未遵循指令: 2 无效工具调用: 1
响应时间(平均)1.27s
响应时间(最大)3.70s
响应时间(总计)22.82s
…
|
- 总测试数
- 21
- 错误测试数
- 15
- 尝试通过率
- 27.5%
- 输入令牌
- 33,744
- 输出令牌
- 2,596
- 推理令牌
- 0
- 响应时间(平均)
- 1.27s
- 响应时间(总计)
- 22.82s
- 响应时间(最大)
- 3.70s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 6.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.19s
响应时间(最大)2.04s
响应时间(总计)4.75s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2 答案错误: 1
响应时间(平均)1.30s
响应时间(最大)1.30s
响应时间(总计)1.30s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.70s
响应时间(最大)3.70s
响应时间(总计)3.70s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)979ms
响应时间(最大)1.02s
响应时间(总计)1.96s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)925ms
响应时间(最大)1.16s
响应时间(总计)2.77s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)920ms
响应时间(最大)920ms
响应时间(总计)920ms
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)987ms
响应时间(最大)1.13s
响应时间(总计)1.97s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)868ms
响应时间(最大)972ms
响应时间(总计)2.60s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)2.83s
响应时间(最大)2.83s
响应时间(总计)2.83s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #361#361 |
Hunter Alphanone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
3.5… |
OpenRouter |
$0.000
…
|
4.70s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 2 API 错误: 1
响应时间(平均)4.70s
响应时间(最大)15.17s
响应时间(总计)79.86s
…
|
- 总测试数
- 18
- 错误测试数
- 12
- 尝试通过率
- 36.2%
- 输入令牌
- 34,329
- 输出令牌
- 2,264
- 推理令牌
- 0
- 响应时间(平均)
- 4.70s
- 响应时间(总计)
- 79.86s
- 响应时间(最大)
- 15.17s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)3.81s
响应时间(最大)6.85s
响应时间(总计)15.23s
-
编程
: 1.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)15.17s
响应时间(最大)15.17s
响应时间(总计)15.17s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.49s
响应时间(最大)14.02s
响应时间(总计)16.98s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.33s
响应时间(最大)2.94s
响应时间(总计)6.99s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.71s
响应时间(最大)2.71s
响应时间(总计)2.71s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.82s
响应时间(最大)2.92s
响应时间(总计)5.65s
-
谜题求解
: 5.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)3.71s
响应时间(最大)5.43s
响应时间(总计)11.13s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.02s
响应时间(最大)6.02s
响应时间(总计)6.02s
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #362#362 |
Grok 4.20none54/69 次尝试 (目标:每项测试重复 3 次)
|
3.4… |
X AI |
$0.057
↓
…
|
1.11s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 额外格式: 1 无效工具调用: 1
响应时间(平均)1.11s
响应时间(最大)6.04s
响应时间(总计)19.96s
…
|
- 总测试数
- 18
- 错误测试数
- 12
- 尝试通过率
- 26.1%
- 输入令牌
- 41,313
- 输出令牌
- 1,923
- 推理令牌
- 0
- 响应时间(平均)
- 1.11s
- 响应时间(总计)
- 19.96s
- 响应时间(最大)
- 6.04s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)501ms
响应时间(最大)839ms
响应时间(总计)2.01s
-
编程
: 1.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.22s
响应时间(最大)1.22s
响应时间(总计)1.22s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)6.04s
响应时间(最大)6.04s
响应时间(总计)6.04s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)522ms
响应时间(最大)537ms
响应时间(总计)1.04s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1
响应时间(平均)687ms
响应时间(最大)821ms
响应时间(总计)2.06s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)659ms
响应时间(最大)659ms
响应时间(总计)659ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)445ms
响应时间(最大)505ms
响应时间(总计)889ms
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)473ms
响应时间(最大)502ms
响应时间(总计)1.42s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.63s
响应时间(最大)4.63s
响应时间(总计)4.63s
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #363#363 |
Command A+medium
|
3.4… |
Cohere |
$0.064
…
|
91.72s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 22 答案错误: 1
响应时间(平均)91.72s
响应时间(最大)112.76s
响应时间(总计)2109.54s
…
|
- 总测试数
- 23
- 错误测试数
- 23
- 尝试通过率
- 0.0%
- 输入令牌
- 118,771
- 输出令牌
- 4,127
- 推理令牌
- 14,668
- 响应时间(平均)
- 91.72s
- 响应时间(总计)
- 2109.54s
- 响应时间(最大)
- 112.76s
-
智能体任务
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)112.76s
响应时间(最大)112.76s
响应时间(总计)112.76s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 4
响应时间(平均)94.10s
响应时间(最大)102.33s
响应时间(总计)376.41s
-
编程
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 3
响应时间(平均)93.13s
响应时间(最大)94.47s
响应时间(总计)279.38s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)89.35s
响应时间(最大)95.40s
响应时间(总计)178.70s
-
数据解析与提取
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)92.87s
响应时间(最大)97.01s
响应时间(总计)185.73s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 3
响应时间(平均)77.87s
响应时间(最大)91.53s
响应时间(总计)233.61s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)80.14s
响应时间(最大)80.14s
响应时间(总计)80.14s
-
指令遵循
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)103.03s
响应时间(最大)105.69s
响应时间(总计)206.06s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 3
响应时间(平均)92.07s
响应时间(最大)99.99s
响应时间(总计)276.20s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)78.42s
响应时间(最大)78.42s
响应时间(总计)78.42s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)102.12s
响应时间(最大)102.12s
响应时间(总计)102.12s
|
| #364#364 |
Laguna Xs.2medium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
3.3… |
Poolside |
$0.015
↕
…
|
6.73s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 API 错误: 4 无答案: 2 无效工具调用: 1
响应时间(平均)6.73s
响应时间(最大)29.11s
响应时间(总计)100.98s
…
|
- 总测试数
- 19
- 错误测试数
- 13
- 尝试通过率
- 42.0%
- 输入令牌
- 39,481
- 输出令牌
- 54,218
- 推理令牌
- 0
- 响应时间(平均)
- 6.73s
- 响应时间(总计)
- 100.98s
- 响应时间(最大)
- 29.11s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)2.68s
响应时间(最大)3.09s
响应时间(总计)8.04s
-
编程
: 2.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)14.36s
响应时间(最大)14.36s
响应时间(总计)14.36s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)15.92s
响应时间(最大)15.92s
响应时间(总计)15.92s
-
数据解析与提取
: 7.1
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)9.34s
响应时间(最大)16.71s
响应时间(总计)18.68s
-
领域专项
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)11.12s
响应时间(最大)29.11s
响应时间(总计)33.35s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.68s
响应时间(最大)2.03s
响应时间(总计)3.36s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)1.93s
响应时间(最大)1.97s
响应时间(总计)3.87s
-
工具调用
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)3.39s
响应时间(最大)3.39s
响应时间(总计)3.39s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #365#365 |
Hy3 previewnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
3.3… |
Tencent |
$0.007
↕
…
|
12.92s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 API 错误: 4 未遵循指令: 4 额外格式: 1
响应时间(平均)12.92s
响应时间(最大)35.84s
响应时间(总计)232.64s
…
|
- 总测试数
- 21
- 错误测试数
- 17
- 尝试通过率
- 21.7%
- 输入令牌
- 27,172
- 输出令牌
- 2,661
- 推理令牌
- 0
- 响应时间(平均)
- 12.92s
- 响应时间(总计)
- 232.64s
- 响应时间(最大)
- 35.84s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2 答案错误: 1
响应时间(平均)11.10s
响应时间(最大)26.88s
响应时间(总计)44.41s
-
编程
: 2.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2 答案错误: 1
响应时间(平均)4.56s
响应时间(最大)4.56s
响应时间(总计)4.56s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)35.84s
响应时间(最大)35.84s
响应时间(总计)35.84s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)2.85s
响应时间(最大)2.85s
响应时间(总计)2.85s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)17.61s
响应时间(最大)25.68s
响应时间(总计)52.82s
-
通用智能
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)16.07s
响应时间(最大)16.07s
响应时间(总计)16.07s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)12.98s
响应时间(最大)23.51s
响应时间(总计)25.95s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)4.56s
响应时间(最大)7.35s
响应时间(总计)13.67s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)33.76s
响应时间(最大)33.76s
响应时间(总计)33.76s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.71s
响应时间(最大)2.71s
响应时间(总计)2.71s
|
| #366#366 |
MiMo-V2-Flashnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
3.3… |
Xiaomi |
$0.025
↑
…
|
2.76s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 2 API 错误: 1 额外格式: 1
响应时间(平均)2.76s
响应时间(最大)19.68s
响应时间(总计)46.99s
…
|
- 总测试数
- 21
- 错误测试数
- 17
- 尝试通过率
- 23.2%
- 输入令牌
- 36,851
- 输出令牌
- 68,882
- 推理令牌
- 0
- 响应时间(平均)
- 2.76s
- 响应时间(总计)
- 46.99s
- 响应时间(最大)
- 19.68s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.19s
响应时间(最大)2.73s
响应时间(总计)4.76s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)2.64s
响应时间(最大)3.84s
响应时间(总计)7.92s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.87s
响应时间(最大)2.87s
响应时间(总计)2.87s
-
数据解析与提取
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 额外格式: 1
响应时间(平均)19.68s
响应时间(最大)19.68s
响应时间(总计)19.68s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)564ms
响应时间(最大)564ms
响应时间(总计)564ms
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.67s
响应时间(最大)1.67s
响应时间(总计)1.67s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)857ms
响应时间(最大)955ms
响应时间(总计)1.71s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.86s
响应时间(最大)2.70s
响应时间(总计)3.71s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.28s
响应时间(最大)2.28s
响应时间(总计)2.28s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.82s
响应时间(最大)1.82s
响应时间(总计)1.82s
|
| #367#367 |
Grok Build 0.1none已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
3.2… |
X AI |
$0.547
…
|
28.69s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 API 错误: 3 未遵循指令: 2
响应时间(平均)28.69s
响应时间(最大)138.35s
响应时间(总计)459.00s
…
|
- 总测试数
- 19
- 错误测试数
- 12
- 尝试通过率
- 42.0%
- 输入令牌
- 11,793
- 输出令牌
- 267,275
- 推理令牌
- 0
- 响应时间(平均)
- 28.69s
- 响应时间(总计)
- 459.00s
- 响应时间(最大)
- 138.35s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.30s
响应时间(最大)9.80s
响应时间(总计)25.20s
-
编程
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.41s
响应时间(最大)21.41s
响应时间(总计)21.41s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)9.33s
响应时间(最大)9.33s
响应时间(总计)9.33s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)103.71s
响应时间(最大)138.35s
响应时间(总计)311.13s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)12.47s
响应时间(最大)12.47s
响应时间(总计)12.47s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.36s
响应时间(最大)11.05s
响应时间(总计)14.73s
-
谜题求解
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)9.55s
响应时间(最大)18.18s
响应时间(总计)28.65s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)36.09s
响应时间(最大)36.09s
响应时间(总计)36.09s
|
| #368#368 |
Command A+high
|
3.2… |
Cohere |
$0.079
…
|
89.96s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 22 答案错误: 1
响应时间(平均)89.96s
响应时间(最大)156.00s
响应时间(总计)2069.01s
…
|
- 总测试数
- 23
- 错误测试数
- 23
- 尝试通过率
- 0.0%
- 输入令牌
- 117,966
- 输出令牌
- 5,149
- 推理令牌
- 23,514
- 响应时间(平均)
- 89.96s
- 响应时间(总计)
- 2069.01s
- 响应时间(最大)
- 156.00s
-
智能体任务
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)156.00s
响应时间(最大)156.00s
响应时间(总计)156.00s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 4
响应时间(平均)85.94s
响应时间(最大)91.77s
响应时间(总计)343.74s
-
编程
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 3
响应时间(平均)92.74s
响应时间(最大)101.39s
响应时间(总计)278.22s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)80.65s
响应时间(最大)82.20s
响应时间(总计)161.31s
-
数据解析与提取
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)86.20s
响应时间(最大)89.21s
响应时间(总计)172.39s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 3
响应时间(平均)67.89s
响应时间(最大)70.95s
响应时间(总计)203.68s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)99.30s
响应时间(最大)99.30s
响应时间(总计)99.30s
-
指令遵循
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)110.33s
响应时间(最大)114.87s
响应时间(总计)220.65s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 3
响应时间(平均)86.20s
响应时间(最大)92.42s
响应时间(总计)258.61s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)84.61s
响应时间(最大)84.61s
响应时间(总计)84.61s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)90.50s
响应时间(最大)90.50s
响应时间(总计)90.50s
|
| #369#369 |
Grok 4.1 Fastnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
3.1… |
X AI |
$0.008
↓
…
|
1.62s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 3
响应时间(平均)1.62s
响应时间(最大)5.51s
响应时间(总计)19.48s
…
|
- 总测试数
- 19
- 错误测试数
- 16
- 尝试通过率
- 18.8%
- 输入令牌
- 36,608
- 输出令牌
- 1,723
- 推理令牌
- 0
- 响应时间(平均)
- 1.62s
- 响应时间(总计)
- 19.48s
- 响应时间(最大)
- 5.51s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)1.07s
响应时间(最大)1.73s
响应时间(总计)2.15s
-
编程
: 1.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.79s
响应时间(最大)1.79s
响应时间(总计)1.79s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.33s
响应时间(最大)3.33s
响应时间(总计)3.33s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)943ms
响应时间(最大)943ms
响应时间(总计)943ms
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.06s
响应时间(最大)1.06s
响应时间(总计)1.06s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.08s
响应时间(最大)1.08s
响应时间(总计)1.08s
-
指令遵循
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)685ms
响应时间(最大)685ms
响应时间(总计)685ms
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.10s
响应时间(最大)1.36s
响应时间(总计)2.21s
-
工具调用
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.51s
响应时间(最大)5.51s
响应时间(总计)5.51s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)731ms
响应时间(最大)731ms
响应时间(总计)731ms
|
| #370#370 |
Laguna Xs.2none已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
3.1… |
Poolside |
$0.004
↕
…
|
806ms… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 API 错误: 4 未遵循指令: 1 无效工具调用: 1
响应时间(平均)806ms
响应时间(最大)2.01s
响应时间(总计)12.09s
…
|
- 总测试数
- 19
- 错误测试数
- 14
- 尝试通过率
- 21.7%
- 输入令牌
- 33,675
- 输出令牌
- 2,826
- 推理令牌
- 0
- 响应时间(平均)
- 806ms
- 响应时间(总计)
- 12.09s
- 响应时间(最大)
- 2.01s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1 未遵循指令: 1
响应时间(平均)534ms
响应时间(最大)906ms
响应时间(总计)1.60s
-
编程
: 0.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.96s
响应时间(最大)1.96s
响应时间(总计)1.96s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.01s
响应时间(最大)2.01s
响应时间(总计)2.01s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)646ms
响应时间(最大)658ms
响应时间(总计)1.29s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)371ms
响应时间(最大)419ms
响应时间(总计)1.11s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)439ms
响应时间(最大)448ms
响应时间(总计)878ms
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)650ms
响应时间(最大)843ms
响应时间(总计)1.30s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)1.93s
响应时间(最大)1.93s
响应时间(总计)1.93s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #371#371 |
Command A+none
|
3.0… |
Cohere |
$0.000
…
|
77.87s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 23
响应时间(平均)77.87s
响应时间(最大)106.37s
响应时间(总计)1791.03s
…
|
- 总测试数
- 23
- 错误测试数
- 23
- 尝试通过率
- 0.0%
- 输入令牌
- 0
- 输出令牌
- 0
- 推理令牌
- 0
- 响应时间(平均)
- 77.87s
- 响应时间(总计)
- 1791.03s
- 响应时间(最大)
- 106.37s
-
智能体任务
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)1.05s
响应时间(最大)1.05s
响应时间(总计)1.05s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 4
响应时间(平均)90.54s
响应时间(最大)106.21s
响应时间(总计)362.18s
-
编程
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 3
响应时间(平均)80.82s
响应时间(最大)92.50s
响应时间(总计)242.45s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)46.61s
响应时间(最大)51.89s
响应时间(总计)93.22s
-
数据解析与提取
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)62.59s
响应时间(最大)88.50s
响应时间(总计)125.18s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 3
响应时间(平均)90.26s
响应时间(最大)106.37s
响应时间(总计)270.78s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)84.05s
响应时间(最大)84.05s
响应时间(总计)84.05s
-
指令遵循
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)95.73s
响应时间(最大)97.43s
响应时间(总计)191.46s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 3
响应时间(平均)88.10s
响应时间(最大)94.19s
响应时间(总计)264.30s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)81.86s
响应时间(最大)81.86s
响应时间(总计)81.86s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)74.52s
响应时间(最大)74.52s
响应时间(总计)74.52s
|
| #372#372 |
Command A+low
|
3.0… |
Cohere |
$0.073
…
|
92.50s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 22 答案错误: 1
响应时间(平均)92.50s
响应时间(最大)128.54s
响应时间(总计)2127.40s
…
|
- 总测试数
- 23
- 错误测试数
- 23
- 尝试通过率
- 1.5%
- 输入令牌
- 114,874
- 输出令牌
- 1,992
- 推理令牌
- 23,529
- 响应时间(平均)
- 92.50s
- 响应时间(总计)
- 2127.40s
- 响应时间(最大)
- 128.54s
-
智能体任务
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)128.54s
响应时间(最大)128.54s
响应时间(总计)128.54s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 4
响应时间(平均)87.46s
响应时间(最大)103.34s
响应时间(总计)349.85s
-
编程
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 3
响应时间(平均)86.43s
响应时间(最大)92.24s
响应时间(总计)259.28s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)83.53s
响应时间(最大)90.11s
响应时间(总计)167.05s
-
数据解析与提取
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)85.39s
响应时间(最大)99.05s
响应时间(总计)170.77s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 3
响应时间(平均)82.74s
响应时间(最大)103.01s
响应时间(总计)248.23s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)101.81s
响应时间(最大)101.81s
响应时间(总计)101.81s
-
指令遵循
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)105.69s
响应时间(最大)116.28s
响应时间(总计)211.38s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 3
响应时间(平均)95.76s
响应时间(最大)102.09s
响应时间(总计)287.28s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)99.68s
响应时间(最大)99.68s
响应时间(总计)99.68s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)103.52s
响应时间(最大)103.52s
响应时间(总计)103.52s
|
| #373#373 |
Nemotron 3 Nano Omni 30b A3b Reasoningmedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
2.7… |
NVIDIA |
$0.000
…
|
17.13s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 API 错误: 6 未遵循指令: 1 无答案: 1
响应时间(平均)17.13s
响应时间(最大)147.45s
响应时间(总计)222.66s
…
|
- 总测试数
- 19
- 错误测试数
- 15
- 尝试通过率
- 26.1%
- 输入令牌
- 11,661
- 输出令牌
- 48,491
- 推理令牌
- 180,695
- 响应时间(平均)
- 17.13s
- 响应时间(总计)
- 222.66s
- 响应时间(最大)
- 147.45s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)1.20s
响应时间(最大)1.48s
响应时间(总计)3.59s
-
编程
: 1.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)38.09s
响应时间(最大)38.09s
响应时间(总计)38.09s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.72s
响应时间(最大)3.88s
响应时间(总计)5.43s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)56.67s
响应时间(最大)147.45s
响应时间(总计)170.02s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.37s
响应时间(最大)1.56s
响应时间(总计)2.74s
-
谜题求解
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)1.40s
响应时间(最大)1.57s
响应时间(总计)2.79s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #374#374 |
Nemotron 3 Nano Omni 30b A3b Reasoningnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
2.6… |
NVIDIA |
$0.000
…
|
728ms… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 API 错误: 6 未遵循指令: 2
响应时间(平均)728ms
响应时间(最大)2.21s
响应时间(总计)9.47s
…
|
- 总测试数
- 19
- 错误测试数
- 17
- 尝试通过率
- 14.5%
- 输入令牌
- 11,661
- 输出令牌
- 1,302
- 推理令牌
- 0
- 响应时间(平均)
- 728ms
- 响应时间(总计)
- 9.47s
- 响应时间(最大)
- 2.21s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)584ms
响应时间(最大)772ms
响应时间(总计)1.75s
-
编程
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.27s
响应时间(最大)1.27s
响应时间(总计)1.27s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.42s
响应时间(最大)2.21s
响应时间(总计)2.84s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)489ms
响应时间(最大)513ms
响应时间(总计)1.47s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)541ms
响应时间(最大)542ms
响应时间(总计)1.08s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 未遵循指令: 1 答案错误: 1
响应时间(平均)532ms
响应时间(最大)580ms
响应时间(总计)1.06s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #375#375 |
Jev 1.13none36/69 次尝试. 选项由适配器提供。支持 12/23 项测试。其他测试不受支持,并非失败。分数按完整测试集计算。
|
2.6… |
Typesafe |
$0.003
…
|
698ms… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6
响应时间(平均)698ms
响应时间(最大)1.08s
响应时间(总计)8.38s
…
|
- 总测试数
- 12
- 错误测试数
- 6
- 尝试通过率
- 26.1%
- 输入令牌
- 67,092
- 输出令牌
- 18,927
- 推理令牌
- 0
- 响应时间(平均)
- 698ms
- 响应时间(总计)
- 8.38s
- 响应时间(最大)
- 1.08s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)853ms
响应时间(最大)1.08s
响应时间(总计)2.56s
-
编程
: 2.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)598ms
响应时间(最大)658ms
响应时间(总计)1.20s
-
综合
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)799ms
响应时间(最大)844ms
响应时间(总计)1.60s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)632ms
响应时间(最大)681ms
响应时间(总计)1.90s
-
通用智能
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)557ms
响应时间(最大)557ms
响应时间(总计)557ms
-
谜题求解
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)573ms
响应时间(最大)573ms
响应时间(总计)573ms
-
工具调用
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|