| #271#271 |
Hy3 previewnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.0… |
Tencent |
$0.007
↕
…
|
12.92s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 API 错误: 4 未遵循指令: 4 额外格式: 1
响应时间(平均)12.92s
响应时间(最大)35.84s
响应时间(总计)232.64s
…
|
- 总测试数
- 21
- 错误测试数
- 17
- 尝试通过率
- 22.7%
- 输入令牌
- 27,172
- 输出令牌
- 2,661
- 推理令牌
- 0
- 响应时间(平均)
- 12.92s
- 响应时间(总计)
- 232.64s
- 响应时间(最大)
- 35.84s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2 答案错误: 1
响应时间(平均)11.10s
响应时间(最大)26.88s
响应时间(总计)44.41s
-
编程
: 2.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2 答案错误: 1
响应时间(平均)4.56s
响应时间(最大)4.56s
响应时间(总计)4.56s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)35.84s
响应时间(最大)35.84s
响应时间(总计)35.84s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)2.85s
响应时间(最大)2.85s
响应时间(总计)2.85s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)17.61s
响应时间(最大)25.68s
响应时间(总计)52.82s
-
通用智能
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)16.07s
响应时间(最大)16.07s
响应时间(总计)16.07s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)12.98s
响应时间(最大)23.51s
响应时间(总计)25.95s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)4.56s
响应时间(最大)7.35s
响应时间(总计)13.67s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)33.76s
响应时间(最大)33.76s
响应时间(总计)33.76s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.71s
响应时间(最大)2.71s
响应时间(总计)2.71s
|
| #272#272 |
MiMo-V2-Flashnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.0… |
Xiaomi |
$0.025
↑
…
|
2.76s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 2 API 错误: 1 额外格式: 1
响应时间(平均)2.76s
响应时间(最大)19.68s
响应时间(总计)46.99s
…
|
- 总测试数
- 21
- 错误测试数
- 17
- 尝试通过率
- 24.2%
- 输入令牌
- 36,851
- 输出令牌
- 68,882
- 推理令牌
- 0
- 响应时间(平均)
- 2.76s
- 响应时间(总计)
- 46.99s
- 响应时间(最大)
- 19.68s
-
反AI技巧
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.19s
响应时间(最大)2.73s
响应时间(总计)4.76s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)2.64s
响应时间(最大)3.84s
响应时间(总计)7.92s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.87s
响应时间(最大)2.87s
响应时间(总计)2.87s
-
数据解析与提取
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 额外格式: 1
响应时间(平均)19.68s
响应时间(最大)19.68s
响应时间(总计)19.68s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)564ms
响应时间(最大)564ms
响应时间(总计)564ms
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.67s
响应时间(最大)1.67s
响应时间(总计)1.67s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)857ms
响应时间(最大)955ms
响应时间(总计)1.71s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.86s
响应时间(最大)2.70s
响应时间(总计)3.71s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.28s
响应时间(最大)2.28s
响应时间(总计)2.28s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.82s
响应时间(最大)1.82s
响应时间(总计)1.82s
|
| #273#273 |
Ling 3.0 Tinynone
|
4.0… |
Inclusionai |
$0.000
…
|
14.02s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 4 API 错误: 1 额外格式: 1 无效工具调用: 1
响应时间(平均)14.02s
响应时间(最大)240.61s
响应时间(总计)294.46s
…
|
- 总测试数
- 22
- 错误测试数
- 20
- 尝试通过率
- 9.1%
- 输入令牌
- 184,579
- 输出令牌
- 110,071
- 推理令牌
- 0
- 响应时间(平均)
- 14.02s
- 响应时间(总计)
- 294.46s
- 响应时间(最大)
- 240.61s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1
响应时间(平均)5.14s
响应时间(最大)14.88s
响应时间(总计)20.55s
-
编程
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.19s
响应时间(最大)1.84s
响应时间(总计)3.56s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)124.21s
响应时间(最大)240.61s
响应时间(总计)248.43s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.14s
响应时间(最大)1.34s
响应时间(总计)2.27s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)880ms
响应时间(最大)917ms
响应时间(总计)1.76s
-
通用智能
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.07s
响应时间(最大)1.07s
响应时间(总计)1.07s
-
指令遵循
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.44s
响应时间(最大)3.84s
响应时间(总计)4.87s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.64s
响应时间(最大)5.23s
响应时间(总计)7.91s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.05s
响应时间(最大)3.05s
响应时间(总计)3.05s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)988ms
响应时间(最大)988ms
响应时间(总计)988ms
|
| #274#274 |
Granite 4.1 8Bnone
|
4.0… |
IBM Granite |
$0.007
…
|
1.44s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 4 无效工具调用: 2 额外格式: 1
响应时间(平均)1.44s
响应时间(最大)16.67s
响应时间(总计)31.75s
…
|
- 总测试数
- 22
- 错误测试数
- 20
- 尝试通过率
- 9.1%
- 输入令牌
- 113,836
- 输出令牌
- 5,996
- 推理令牌
- 0
- 响应时间(平均)
- 1.44s
- 响应时间(总计)
- 31.75s
- 响应时间(最大)
- 16.67s
-
反AI技巧
: 4.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)844ms
响应时间(最大)1.91s
响应时间(总计)3.38s
-
编程
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 未遵循指令: 1 答案错误: 1
响应时间(平均)775ms
响应时间(最大)1.07s
响应时间(总计)2.33s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)9.28s
响应时间(最大)16.67s
响应时间(总计)18.55s
-
数据解析与提取
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)575ms
响应时间(最大)583ms
响应时间(总计)1.15s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)287ms
响应时间(最大)348ms
响应时间(总计)860ms
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)499ms
响应时间(最大)499ms
响应时间(总计)499ms
-
指令遵循
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)344ms
响应时间(最大)358ms
响应时间(总计)687ms
-
谜题求解
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)608ms
响应时间(最大)960ms
响应时间(总计)1.82s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.17s
响应时间(最大)2.17s
响应时间(总计)2.17s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)306ms
响应时间(最大)306ms
响应时间(总计)306ms
|
| #275#275 |
Nemotron 3.5 Lightningnone
|
4.0… |
NVIDIA |
$0.009
↕
…
|
1.21s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 16 无效工具调用: 2 未遵循指令: 1
响应时间(平均)1.21s
响应时间(最大)6.30s
响应时间(总计)26.62s
…
|
- 总测试数
- 22
- 错误测试数
- 19
- 尝试通过率
- 16.7%
- 输入令牌
- 74,074
- 输出令牌
- 2,731
- 推理令牌
- 0
- 响应时间(平均)
- 1.21s
- 响应时间(总计)
- 26.62s
- 响应时间(最大)
- 6.30s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.12s
响应时间(最大)6.30s
响应时间(总计)8.49s
-
编程
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.55s
响应时间(最大)1.76s
响应时间(总计)4.64s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)2.02s
响应时间(最大)2.27s
响应时间(总计)4.05s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)633ms
响应时间(最大)712ms
响应时间(总计)1.27s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)683ms
响应时间(最大)1.30s
响应时间(总计)2.05s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)586ms
响应时间(最大)586ms
响应时间(总计)586ms
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)511ms
响应时间(最大)524ms
响应时间(总计)1.02s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)750ms
响应时间(最大)1.07s
响应时间(总计)2.25s
-
工具调用
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)1.70s
响应时间(最大)1.70s
响应时间(总计)1.70s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)575ms
响应时间(最大)575ms
响应时间(总计)575ms
|
| #276#276 |
Grok Build 0.1none已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.0… |
X AI |
$0.547
…
|
28.69s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 API 错误: 3 未遵循指令: 2
响应时间(平均)28.69s
响应时间(最大)138.35s
响应时间(总计)459.00s
…
|
- 总测试数
- 19
- 错误测试数
- 12
- 尝试通过率
- 43.9%
- 输入令牌
- 11,793
- 输出令牌
- 267,275
- 推理令牌
- 0
- 响应时间(平均)
- 28.69s
- 响应时间(总计)
- 459.00s
- 响应时间(最大)
- 138.35s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.30s
响应时间(最大)9.80s
响应时间(总计)25.20s
-
编程
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.41s
响应时间(最大)21.41s
响应时间(总计)21.41s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)9.33s
响应时间(最大)9.33s
响应时间(总计)9.33s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)103.71s
响应时间(最大)138.35s
响应时间(总计)311.13s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)12.47s
响应时间(最大)12.47s
响应时间(总计)12.47s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.36s
响应时间(最大)11.05s
响应时间(总计)14.73s
-
谜题求解
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)9.55s
响应时间(最大)18.18s
响应时间(总计)28.65s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)36.09s
响应时间(最大)36.09s
响应时间(总计)36.09s
|
| #277#277 |
Ling 3.0 Tinyhigh
|
3.8… |
Inclusionai |
$0.000
…
|
75.68s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 7 答案错误: 6 未遵循指令: 3 API 错误: 1 无效工具调用: 1
响应时间(平均)75.68s
响应时间(最大)345.15s
响应时间(总计)1589.20s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 24.2%
- 输入令牌
- 115,314
- 输出令牌
- 133,965
- 推理令牌
- 816,718
- 响应时间(平均)
- 75.68s
- 响应时间(总计)
- 1589.20s
- 响应时间(最大)
- 345.15s
-
反AI技巧
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)24.93s
响应时间(最大)83.87s
响应时间(总计)99.73s
-
编程
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 2 未遵循指令: 1
响应时间(平均)177.65s
响应时间(最大)213.57s
响应时间(总计)532.96s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)179.85s
响应时间(最大)345.15s
响应时间(总计)359.71s
-
数据解析与提取
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.16s
响应时间(最大)5.89s
响应时间(总计)8.31s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 2 API 错误: 1
响应时间(平均)70.12s
响应时间(最大)81.88s
响应时间(总计)140.23s
-
通用智能
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)60.50s
响应时间(最大)60.50s
响应时间(总计)60.50s
-
指令遵循
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.10s
响应时间(最大)3.97s
响应时间(总计)6.21s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)54.15s
响应时间(最大)148.72s
响应时间(总计)162.46s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.76s
响应时间(最大)5.76s
响应时间(总计)5.76s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)213.35s
响应时间(最大)213.35s
响应时间(总计)213.35s
|
| #278#278 |
Ling 3.0 Tinylow
|
3.8… |
Inclusionai |
$0.000
…
|
66.16s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 7 答案错误: 5 未遵循指令: 4 API 错误: 1 无效工具调用: 1
响应时间(平均)66.16s
响应时间(最大)252.08s
响应时间(总计)1389.33s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 19.7%
- 输入令牌
- 99,662
- 输出令牌
- 146,555
- 推理令牌
- 732,977
- 响应时间(平均)
- 66.16s
- 响应时间(总计)
- 1389.33s
- 响应时间(最大)
- 252.08s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)25.30s
响应时间(最大)84.32s
响应时间(总计)101.18s
-
编程
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 2 未遵循指令: 1
响应时间(平均)170.73s
响应时间(最大)214.91s
响应时间(总计)512.19s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)134.79s
响应时间(最大)252.08s
响应时间(总计)269.57s
-
数据解析与提取
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)4.82s
响应时间(最大)6.83s
响应时间(总计)9.64s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 2 API 错误: 1
响应时间(平均)72.15s
响应时间(最大)81.30s
响应时间(总计)144.29s
-
通用智能
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)29.35s
响应时间(最大)29.35s
响应时间(总计)29.35s
-
指令遵循
: 6.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.09s
响应时间(最大)4.03s
响应时间(总计)6.19s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)32.49s
响应时间(最大)91.44s
响应时间(总计)97.46s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.94s
响应时间(最大)5.94s
响应时间(总计)5.94s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)213.54s
响应时间(最大)213.54s
响应时间(总计)213.54s
|
| #279#279 |
Grok 4.1 Fastnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
3.8… |
X AI |
$0.008
↓
…
|
1.62s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 3
响应时间(平均)1.62s
响应时间(最大)5.51s
响应时间(总计)19.48s
…
|
- 总测试数
- 19
- 错误测试数
- 16
- 尝试通过率
- 19.7%
- 输入令牌
- 36,608
- 输出令牌
- 1,723
- 推理令牌
- 0
- 响应时间(平均)
- 1.62s
- 响应时间(总计)
- 19.48s
- 响应时间(最大)
- 5.51s
-
反AI技巧
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)1.07s
响应时间(最大)1.73s
响应时间(总计)2.15s
-
编程
: 1.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.79s
响应时间(最大)1.79s
响应时间(总计)1.79s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.33s
响应时间(最大)3.33s
响应时间(总计)3.33s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)943ms
响应时间(最大)943ms
响应时间(总计)943ms
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.06s
响应时间(最大)1.06s
响应时间(总计)1.06s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.08s
响应时间(最大)1.08s
响应时间(总计)1.08s
-
指令遵循
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)685ms
响应时间(最大)685ms
响应时间(总计)685ms
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.10s
响应时间(最大)1.36s
响应时间(总计)2.21s
-
工具调用
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.51s
响应时间(最大)5.51s
响应时间(总计)5.51s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)731ms
响应时间(最大)731ms
响应时间(总计)731ms
|
| #280#280 |
Qwen3.5-9Bmedium
|
3.8… |
Qwen |
$0.062
↑
…
|
107.51s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 11 无答案: 3 答案错误: 2 API 错误: 1 额外格式: 1 未遵循指令: 1
响应时间(平均)107.51s
响应时间(最大)569.97s
响应时间(总计)1720.15s
…
|
- 总测试数
- 22
- 错误测试数
- 19
- 尝试通过率
- 25.8%
- 输入令牌
- 17,195
- 输出令牌
- 46,735
- 推理令牌
- 366,707
- 响应时间(平均)
- 107.51s
- 响应时间(总计)
- 1720.15s
- 响应时间(最大)
- 569.97s
-
反AI技巧
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 答案错误: 1
响应时间(平均)34.44s
响应时间(最大)57.86s
响应时间(总计)103.31s
-
编程
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 无答案: 1 超时: 1
响应时间(平均)100.88s
响应时间(最大)135.61s
响应时间(总计)201.75s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 超时: 1
响应时间(平均)87.31s
响应时间(最大)87.31s
响应时间(总计)87.31s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 无答案: 1
响应时间(平均)272.50s
响应时间(最大)569.97s
响应时间(总计)817.51s
-
通用智能
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)226.38s
响应时间(最大)226.38s
响应时间(总计)226.38s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)5.75s
响应时间(最大)5.75s
响应时间(总计)5.75s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 答案错误: 1
响应时间(平均)32.27s
响应时间(最大)47.31s
响应时间(总计)96.80s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.31s
响应时间(最大)4.31s
响应时间(总计)4.31s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)177.02s
响应时间(最大)177.02s
响应时间(总计)177.02s
|
| #281#281 |
Ling 3.0 Tinymedium
|
3.8… |
Inclusionai |
$0.000
…
|
68.08s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 7 答案错误: 5 未遵循指令: 4 API 错误: 1 无效工具调用: 1
响应时间(平均)68.08s
响应时间(最大)262.20s
响应时间(总计)1429.66s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 24.2%
- 输入令牌
- 103,898
- 输出令牌
- 148,304
- 推理令牌
- 774,972
- 响应时间(平均)
- 68.08s
- 响应时间(总计)
- 1429.66s
- 响应时间(最大)
- 262.20s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)23.73s
响应时间(最大)81.06s
响应时间(总计)94.91s
-
编程
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 2 未遵循指令: 1
响应时间(平均)211.99s
响应时间(最大)219.75s
响应时间(总计)635.97s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)139.78s
响应时间(最大)262.20s
响应时间(总计)279.57s
-
数据解析与提取
: 2.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)4.41s
响应时间(最大)6.08s
响应时间(总计)8.82s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 2 API 错误: 1
响应时间(平均)81.40s
响应时间(最大)82.11s
响应时间(总计)162.80s
-
通用智能
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)31.77s
响应时间(最大)31.77s
响应时间(总计)31.77s
-
指令遵循
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.00s
响应时间(最大)3.81s
响应时间(总计)5.99s
-
谜题求解
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)34.65s
响应时间(最大)88.47s
响应时间(总计)103.95s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.91s
响应时间(最大)4.91s
响应时间(总计)4.91s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)100.96s
响应时间(最大)100.96s
响应时间(总计)100.96s
|
| #282#282 |
Laguna Xs.2none已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
3.8… |
Poolside |
$0.004
↕
…
|
806ms… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 API 错误: 4 未遵循指令: 1 无效工具调用: 1
响应时间(平均)806ms
响应时间(最大)2.01s
响应时间(总计)12.09s
…
|
- 总测试数
- 19
- 错误测试数
- 14
- 尝试通过率
- 22.7%
- 输入令牌
- 33,675
- 输出令牌
- 2,826
- 推理令牌
- 0
- 响应时间(平均)
- 806ms
- 响应时间(总计)
- 12.09s
- 响应时间(最大)
- 2.01s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1 未遵循指令: 1
响应时间(平均)534ms
响应时间(最大)906ms
响应时间(总计)1.60s
-
编程
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.96s
响应时间(最大)1.96s
响应时间(总计)1.96s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.01s
响应时间(最大)2.01s
响应时间(总计)2.01s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)646ms
响应时间(最大)658ms
响应时间(总计)1.29s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)371ms
响应时间(最大)419ms
响应时间(总计)1.11s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)439ms
响应时间(最大)448ms
响应时间(总计)878ms
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)650ms
响应时间(最大)843ms
响应时间(总计)1.30s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)1.93s
响应时间(最大)1.93s
响应时间(总计)1.93s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #283#283 |
gpt-oss-120bnone57/66 次尝试 (目标:每项测试重复 3 次)
|
3.7… |
OpenAI |
$0.010
↓
…
|
21.61s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 API 错误: 3 未遵循指令: 2
响应时间(平均)21.61s
响应时间(最大)113.71s
响应时间(总计)345.79s
…
|
- 总测试数
- 19
- 错误测试数
- 13
- 尝试通过率
- 33.3%
- 输入令牌
- 9,081
- 输出令牌
- 51,664
- 推理令牌
- 0
- 响应时间(平均)
- 21.61s
- 响应时间(总计)
- 345.79s
- 响应时间(最大)
- 113.71s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)32.84s
响应时间(最大)113.71s
响应时间(总计)131.35s
-
编程
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.57s
响应时间(最大)9.57s
响应时间(总计)9.57s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)7.12s
响应时间(最大)7.12s
响应时间(总计)7.12s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)34.98s
响应时间(最大)68.97s
响应时间(总计)104.94s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.79s
响应时间(最大)10.79s
响应时间(总计)10.79s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.06s
响应时间(最大)5.85s
响应时间(总计)10.12s
-
谜题求解
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)8.21s
响应时间(最大)11.82s
响应时间(总计)24.62s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)47.29s
响应时间(最大)47.29s
响应时间(总计)47.29s
|
| #284#284 |
Nemotron 3 Nano Omni 30b A3b Reasoningmedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
3.4… |
NVIDIA |
$0.000
…
|
17.13s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 API 错误: 6 未遵循指令: 1 无答案: 1
响应时间(平均)17.13s
响应时间(最大)147.45s
响应时间(总计)222.66s
…
|
- 总测试数
- 19
- 错误测试数
- 15
- 尝试通过率
- 27.3%
- 输入令牌
- 11,661
- 输出令牌
- 48,491
- 推理令牌
- 180,695
- 响应时间(平均)
- 17.13s
- 响应时间(总计)
- 222.66s
- 响应时间(最大)
- 147.45s
-
反AI技巧
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)1.20s
响应时间(最大)1.48s
响应时间(总计)3.59s
-
编程
: 1.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)38.09s
响应时间(最大)38.09s
响应时间(总计)38.09s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.72s
响应时间(最大)3.88s
响应时间(总计)5.43s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)56.67s
响应时间(最大)147.45s
响应时间(总计)170.02s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.37s
响应时间(最大)1.56s
响应时间(总计)2.74s
-
谜题求解
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)1.40s
响应时间(最大)1.57s
响应时间(总计)2.79s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #285#285 |
Nemotron 3 Nano Omni 30b A3b Reasoningnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
3.2… |
NVIDIA |
$0.000
…
|
728ms… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 API 错误: 6 未遵循指令: 2
响应时间(平均)728ms
响应时间(最大)2.21s
响应时间(总计)9.47s
…
|
- 总测试数
- 19
- 错误测试数
- 17
- 尝试通过率
- 15.2%
- 输入令牌
- 11,661
- 输出令牌
- 1,302
- 推理令牌
- 0
- 响应时间(平均)
- 728ms
- 响应时间(总计)
- 9.47s
- 响应时间(最大)
- 2.21s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)584ms
响应时间(最大)772ms
响应时间(总计)1.75s
-
编程
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.27s
响应时间(最大)1.27s
响应时间(总计)1.27s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.42s
响应时间(最大)2.21s
响应时间(总计)2.84s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)489ms
响应时间(最大)513ms
响应时间(总计)1.47s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)541ms
响应时间(最大)542ms
响应时间(总计)1.08s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 未遵循指令: 1 答案错误: 1
响应时间(平均)532ms
响应时间(最大)580ms
响应时间(总计)1.06s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #286#286 |
Step 3.5 Flashnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
2.3… |
Stepfun |
$0.020
…
|
39.03s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 4 未遵循指令: 1 答案错误: 1
响应时间(平均)39.03s
响应时间(最大)114.12s
响应时间(总计)312.26s
…
|
- 总测试数
- 12
- 错误测试数
- 6
- 尝试通过率
- 27.3%
- 输入令牌
- 1,971
- 输出令牌
- 64,795
- 推理令牌
- 0
- 响应时间(平均)
- 39.03s
- 响应时间(总计)
- 312.26s
- 响应时间(最大)
- 114.12s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)34.99s
响应时间(最大)109.60s
响应时间(总计)139.95s
-
编程
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
领域专项
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)34.54s
响应时间(最大)34.54s
响应时间(总计)34.54s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)14.37s
响应时间(最大)14.37s
响应时间(总计)14.37s
-
指令遵循
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.30s
响应时间(最大)9.30s
响应时间(总计)9.30s
-
谜题求解
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)114.12s
响应时间(最大)114.12s
响应时间(总计)114.12s
|
| #287#287 |
LFM2-24B-A2Bnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
2.2… |
Liquid |
$0.001
…
|
782ms… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 API 错误: 4 未遵循指令: 1
响应时间(平均)782ms
响应时间(最大)3.15s
响应时间(总计)10.94s
…
|
- 总测试数
- 16
- 错误测试数
- 14
- 尝试通过率
- 12.1%
- 输入令牌
- 10,771
- 输出令牌
- 1,173
- 推理令牌
- 0
- 响应时间(平均)
- 782ms
- 响应时间(总计)
- 10.94s
- 响应时间(最大)
- 3.15s
-
反AI技巧
: 2.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)471ms
响应时间(最大)872ms
响应时间(总计)1.41s
-
编程
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)714ms
响应时间(最大)987ms
响应时间(总计)1.43s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)287ms
响应时间(最大)334ms
响应时间(总计)860ms
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)395ms
响应时间(最大)395ms
响应时间(总计)395ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)752ms
响应时间(最大)1.22s
响应时间(总计)1.50s
-
谜题求解
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)1.78s
响应时间(最大)3.15s
响应时间(总计)5.34s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|