| #150#150 |
MiMo-V2-Flashnone
|
4.7… |
Xiaomi |
$0.025
↑
…
|
2.70s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 未遵循指令: 2 API 错误: 1 额外格式: 1
响应时间(平均)2.70s
响应时间(最大)19.68s
响应时间(总计)43.15s
…
|
- 总测试数
- 20
- 错误测试数
- 16
- 尝试通过率
- 26.7%
- 输入令牌
- 34,208
- 输出令牌
- 68,873
- 推理令牌
- 0
- 响应时间(平均)
- 2.70s
- 响应时间(总计)
- 43.15s
- 响应时间(最大)
- 19.68s
-
反AI技巧
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.19s
响应时间(最大)2.73s
响应时间(总计)4.76s
-
编程
: 4.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.04s
响应时间(最大)2.79s
响应时间(总计)4.08s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.87s
响应时间(最大)2.87s
响应时间(总计)2.87s
-
数据解析与提取
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 额外格式: 1
响应时间(平均)19.68s
响应时间(最大)19.68s
响应时间(总计)19.68s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)564ms
响应时间(最大)564ms
响应时间(总计)564ms
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.67s
响应时间(最大)1.67s
响应时间(总计)1.67s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)857ms
响应时间(最大)955ms
响应时间(总计)1.71s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.86s
响应时间(最大)2.70s
响应时间(总计)3.71s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.28s
响应时间(最大)2.28s
响应时间(总计)2.28s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.82s
响应时间(最大)1.82s
响应时间(总计)1.82s
|
| #151#151 |
Qwen3.6 35B A3Bnone
|
4.7… |
Qwen |
$0.031
↑
…
|
3.84s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 API 错误: 2 未遵循指令: 2
响应时间(平均)3.84s
响应时间(最大)22.52s
响应时间(总计)69.12s
…
|
- 总测试数
- 20
- 错误测试数
- 16
- 尝试通过率
- 31.7%
- 输入令牌
- 16,488
- 输出令牌
- 27,747
- 推理令牌
- 0
- 响应时间(平均)
- 3.84s
- 响应时间(总计)
- 69.12s
- 响应时间(最大)
- 22.52s
-
反AI技巧
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.10s
响应时间(最大)6.15s
响应时间(总计)8.41s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)12.29s
响应时间(最大)22.52s
响应时间(总计)24.58s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.46s
响应时间(最大)2.03s
响应时间(总计)2.93s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)7.45s
响应时间(最大)12.46s
响应时间(总计)22.35s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.51s
响应时间(最大)3.51s
响应时间(总计)3.51s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.86s
响应时间(最大)2.83s
响应时间(总计)3.73s
-
谜题求解
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2 答案错误: 1
响应时间(平均)1.07s
响应时间(最大)1.24s
响应时间(总计)3.20s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)414ms
响应时间(最大)414ms
响应时间(总计)414ms
|
| #153#153 |
Mercury 2none
|
4.6… |
Inception |
$0.009
…
|
614ms… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 15 未遵循指令: 1
响应时间(平均)614ms
响应时间(最大)1.27s
响应时间(总计)12.28s
…
|
- 总测试数
- 20
- 错误测试数
- 16
- 尝试通过率
- 25.0%
- 输入令牌
- 25,515
- 输出令牌
- 3,001
- 推理令牌
- 0
- 响应时间(平均)
- 614ms
- 响应时间(总计)
- 12.28s
- 响应时间(最大)
- 1.27s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)483ms
响应时间(最大)716ms
响应时间(总计)1.93s
-
编程
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)831ms
响应时间(最大)969ms
响应时间(总计)1.66s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)606ms
响应时间(最大)606ms
响应时间(总计)606ms
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)667ms
响应时间(最大)819ms
响应时间(总计)1.33s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)534ms
响应时间(最大)733ms
响应时间(总计)1.60s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)628ms
响应时间(最大)628ms
响应时间(总计)628ms
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)551ms
响应时间(最大)622ms
响应时间(总计)1.10s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)535ms
响应时间(最大)642ms
响应时间(总计)1.60s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.27s
响应时间(最大)1.27s
响应时间(总计)1.27s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)548ms
响应时间(最大)548ms
响应时间(总计)548ms
|
| #154#154 |
Hy3 previewnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.5… |
Tencent |
$0.003
…
|
12.92s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 未遵循指令: 4 API 错误: 3 额外格式: 1
响应时间(平均)12.92s
响应时间(最大)35.84s
响应时间(总计)232.64s
…
|
- 总测试数
- 20
- 错误测试数
- 16
- 尝试通过率
- 25.0%
- 输入令牌
- 27,172
- 输出令牌
- 2,661
- 推理令牌
- 0
- 响应时间(平均)
- 12.92s
- 响应时间(总计)
- 232.64s
- 响应时间(最大)
- 35.84s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2 答案错误: 1
响应时间(平均)11.10s
响应时间(最大)26.88s
响应时间(总计)44.41s
-
编程
: 2.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)4.56s
响应时间(最大)4.56s
响应时间(总计)4.56s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)35.84s
响应时间(最大)35.84s
响应时间(总计)35.84s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)2.85s
响应时间(最大)2.85s
响应时间(总计)2.85s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)17.61s
响应时间(最大)25.68s
响应时间(总计)52.82s
-
通用智能
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)16.07s
响应时间(最大)16.07s
响应时间(总计)16.07s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)12.98s
响应时间(最大)23.51s
响应时间(总计)25.95s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)4.56s
响应时间(最大)7.35s
响应时间(总计)13.67s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)33.76s
响应时间(最大)33.76s
响应时间(总计)33.76s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.71s
响应时间(最大)2.71s
响应时间(总计)2.71s
|
| #155#155 |
GLM 4.7 Flashmedium
|
4.5… |
Z.ai |
$0.054
…
|
35.10s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 无答案: 3 未遵循指令: 2 无效工具调用: 1 超时: 1
响应时间(平均)35.10s
响应时间(最大)174.55s
响应时间(总计)456.24s
…
|
- 总测试数
- 20
- 错误测试数
- 16
- 尝试通过率
- 35.0%
- 输入令牌
- 37,206
- 输出令牌
- 43,754
- 推理令牌
- 89,079
- 响应时间(平均)
- 35.10s
- 响应时间(总计)
- 456.24s
- 响应时间(最大)
- 174.55s
-
反AI技巧
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)14.95s
响应时间(最大)27.09s
响应时间(总计)29.90s
-
编程
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 超时: 1
响应时间(平均)55.33s
响应时间(最大)89.40s
响应时间(总计)110.66s
-
综合
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)65.57s
响应时间(最大)65.57s
响应时间(总计)65.57s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)1.51s
响应时间(最大)1.51s
响应时间(总计)1.51s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)174.55s
响应时间(最大)174.55s
响应时间(总计)174.55s
-
通用智能
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)18.14s
响应时间(最大)18.14s
响应时间(总计)18.14s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.97s
响应时间(最大)2.97s
响应时间(总计)2.97s
-
谜题求解
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)12.93s
响应时间(最大)22.33s
响应时间(总计)25.85s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.95s
响应时间(最大)15.95s
响应时间(总计)15.95s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)11.13s
响应时间(最大)11.13s
响应时间(总计)11.13s
|
| #156#156 |
Grok 4.1 Fastnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.4… |
X AI |
$0.008
↓
…
|
1.62s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 3
响应时间(平均)1.62s
响应时间(最大)5.51s
响应时间(总计)19.48s
…
|
- 总测试数
- 19
- 错误测试数
- 16
- 尝试通过率
- 22.8%
- 输入令牌
- 36,608
- 输出令牌
- 1,723
- 推理令牌
- 0
- 响应时间(平均)
- 1.62s
- 响应时间(总计)
- 19.48s
- 响应时间(最大)
- 5.51s
-
反AI技巧
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)1.07s
响应时间(最大)1.73s
响应时间(总计)2.15s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.79s
响应时间(最大)1.79s
响应时间(总计)1.79s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.33s
响应时间(最大)3.33s
响应时间(总计)3.33s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)943ms
响应时间(最大)943ms
响应时间(总计)943ms
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.06s
响应时间(最大)1.06s
响应时间(总计)1.06s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.08s
响应时间(最大)1.08s
响应时间(总计)1.08s
-
指令遵循
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)685ms
响应时间(最大)685ms
响应时间(总计)685ms
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.10s
响应时间(最大)1.36s
响应时间(总计)2.21s
-
工具调用
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.51s
响应时间(最大)5.51s
响应时间(总计)5.51s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)731ms
响应时间(最大)731ms
响应时间(总计)731ms
|
| #157#157 |
Ling-2.6-1Tnone
|
4.3… |
Inclusionai |
$0.005
…
|
7.72s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 API 错误: 2 未遵循指令: 2 无效工具调用: 1
响应时间(平均)7.72s
响应时间(最大)25.72s
响应时间(总计)139.00s
…
|
- 总测试数
- 20
- 错误测试数
- 17
- 尝试通过率
- 15.0%
- 输入令牌
- 34,905
- 输出令牌
- 2,434
- 推理令牌
- 0
- 响应时间(平均)
- 7.72s
- 响应时间(总计)
- 139.00s
- 响应时间(最大)
- 25.72s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)6.55s
响应时间(最大)9.41s
响应时间(总计)26.19s
-
编程
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)10.57s
响应时间(最大)10.57s
响应时间(总计)10.57s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)23.53s
响应时间(最大)23.53s
响应时间(总计)23.53s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.37s
响应时间(最大)1.37s
响应时间(总计)2.73s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.04s
响应时间(最大)1.08s
响应时间(总计)3.11s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)20.34s
响应时间(最大)20.34s
响应时间(总计)20.34s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.36s
响应时间(最大)9.81s
响应时间(总计)10.73s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)5.36s
响应时间(最大)13.26s
响应时间(总计)16.09s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)25.72s
响应时间(最大)25.72s
响应时间(总计)25.72s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #158#158 |
Qwen3.5-9Bmedium
|
4.2… |
Qwen |
$0.033
↓
…
|
83.32s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 11 答案错误: 2 API 错误: 1 额外格式: 1 未遵循指令: 1 无答案: 1
响应时间(平均)83.32s
响应时间(最大)226.38s
响应时间(总计)1249.74s
…
|
- 总测试数
- 20
- 错误测试数
- 17
- 尝试通过率
- 28.3%
- 输入令牌
- 15,204
- 输出令牌
- 27,305
- 推理令牌
- 199,780
- 响应时间(平均)
- 83.32s
- 响应时间(总计)
- 1249.74s
- 响应时间(最大)
- 226.38s
-
反AI技巧
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 答案错误: 1
响应时间(平均)34.44s
响应时间(最大)57.86s
响应时间(总计)103.31s
-
编程
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 超时: 1
响应时间(平均)135.61s
响应时间(最大)135.61s
响应时间(总计)135.61s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 超时: 1
响应时间(平均)87.31s
响应时间(最大)87.31s
响应时间(总计)87.31s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 3
响应时间(平均)137.75s
响应时间(最大)202.61s
响应时间(总计)413.24s
-
通用智能
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)226.38s
响应时间(最大)226.38s
响应时间(总计)226.38s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)5.75s
响应时间(最大)5.75s
响应时间(总计)5.75s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 答案错误: 1
响应时间(平均)32.27s
响应时间(最大)47.31s
响应时间(总计)96.80s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.31s
响应时间(最大)4.31s
响应时间(总计)4.31s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)177.02s
响应时间(最大)177.02s
响应时间(总计)177.02s
|
| #159#159 |
LFM2-24B-A2Bnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.2… |
Liquid |
$0.001
…
|
782ms… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 API 错误: 4 未遵循指令: 1
响应时间(平均)782ms
响应时间(最大)3.15s
响应时间(总计)10.94s
…
|
- 总测试数
- 16
- 错误测试数
- 14
- 尝试通过率
- 16.7%
- 输入令牌
- 10,771
- 输出令牌
- 1,173
- 推理令牌
- 0
- 响应时间(平均)
- 782ms
- 响应时间(总计)
- 10.94s
- 响应时间(最大)
- 3.15s
-
反AI技巧
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)471ms
响应时间(最大)872ms
响应时间(总计)1.41s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)714ms
响应时间(最大)987ms
响应时间(总计)1.43s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)287ms
响应时间(最大)334ms
响应时间(总计)860ms
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)395ms
响应时间(最大)395ms
响应时间(总计)395ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)752ms
响应时间(最大)1.22s
响应时间(总计)1.50s
-
谜题求解
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)1.78s
响应时间(最大)3.15s
响应时间(总计)5.34s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #160#160 |
Nemotron 3 Nano Omni 30b A3b Reasoningnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.1… |
NVIDIA |
$0.000
…
|
728ms… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 API 错误: 6 未遵循指令: 2
响应时间(平均)728ms
响应时间(最大)2.21s
响应时间(总计)9.47s
…
|
- 总测试数
- 19
- 错误测试数
- 17
- 尝试通过率
- 17.5%
- 输入令牌
- 11,661
- 输出令牌
- 1,302
- 推理令牌
- 0
- 响应时间(平均)
- 728ms
- 响应时间(总计)
- 9.47s
- 响应时间(最大)
- 2.21s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)584ms
响应时间(最大)772ms
响应时间(总计)1.75s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.27s
响应时间(最大)1.27s
响应时间(总计)1.27s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.42s
响应时间(最大)2.21s
响应时间(总计)2.84s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)489ms
响应时间(最大)513ms
响应时间(总计)1.47s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)541ms
响应时间(最大)542ms
响应时间(总计)1.08s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 未遵循指令: 1 答案错误: 1
响应时间(平均)532ms
响应时间(最大)580ms
响应时间(总计)1.06s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #161#161 |
Granite 4.1 8Bnone
|
4.1… |
IBM Granite |
$0.003
…
|
719ms… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 4 无效工具调用: 1
响应时间(平均)719ms
响应时间(最大)2.17s
响应时间(总计)14.37s
…
|
- 总测试数
- 20
- 错误测试数
- 18
- 尝试通过率
- 10.0%
- 输入令牌
- 43,135
- 输出令牌
- 2,743
- 推理令牌
- 0
- 响应时间(平均)
- 719ms
- 响应时间(总计)
- 14.37s
- 响应时间(最大)
- 2.17s
-
反AI技巧
: 4.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)844ms
响应时间(最大)1.91s
响应时间(总计)3.38s
-
编程
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)706ms
响应时间(最大)1.07s
响应时间(总计)1.41s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)1.88s
响应时间(最大)1.88s
响应时间(总计)1.88s
-
数据解析与提取
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)575ms
响应时间(最大)583ms
响应时间(总计)1.15s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)357ms
响应时间(最大)463ms
响应时间(总计)1.07s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)499ms
响应时间(最大)499ms
响应时间(总计)499ms
-
指令遵循
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)344ms
响应时间(最大)358ms
响应时间(总计)687ms
-
谜题求解
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)608ms
响应时间(最大)960ms
响应时间(总计)1.82s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.17s
响应时间(最大)2.17s
响应时间(总计)2.17s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)306ms
响应时间(最大)306ms
响应时间(总计)306ms
|