| #220#220 |
Gemma 4 26B A4Bnone
|
5.6… |
Google |
$0.015
↓
…
|
7.58s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 2 无效工具调用: 1 超时: 1
响应时间(平均)7.58s
响应时间(最大)57.10s
响应时间(总计)166.82s
…
|
- 总测试数
- 22
- 错误测试数
- 13
- 尝试通过率
- 43.9%
- 输入令牌
- 131,257
- 输出令牌
- 15,781
- 推理令牌
- 0
- 响应时间(平均)
- 7.58s
- 响应时间(总计)
- 166.82s
- 响应时间(最大)
- 57.10s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.28s
响应时间(最大)2.09s
响应时间(总计)5.13s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)4.16s
响应时间(最大)7.07s
响应时间(总计)12.48s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)37.23s
响应时间(最大)43.93s
响应时间(总计)74.46s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.70s
响应时间(最大)2.21s
响应时间(总计)3.41s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.10s
响应时间(最大)4.23s
响应时间(总计)6.31s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.54s
响应时间(最大)3.54s
响应时间(总计)3.54s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)690ms
响应时间(最大)878ms
响应时间(总计)1.38s
-
谜题求解
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)744ms
响应时间(最大)972ms
响应时间(总计)2.23s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)57.10s
响应时间(最大)57.10s
响应时间(总计)57.10s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)778ms
响应时间(最大)778ms
响应时间(总计)778ms
|
| #228#228 |
Qwen3.8 27Bnone候选模型的回答由本地硬件生成。OpenRouter 仅用于评测。
|
5.5… |
Qwen |
~$0.006
仅估算 GPU 的电费,不包括计算机其他部件及硬件购置成本。 NVIDIA GeForce RTX 3090: 0.0572 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.005659.
|
3.12s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 1 无效工具调用: 1
响应时间(平均)3.12s
响应时间(最大)44.76s
响应时间(总计)68.69s
…
|
- 总测试数
- 22
- 错误测试数
- 13
- 尝试通过率
- 40.9%
- 输入令牌
- 122,463
- 输出令牌
- 11,445
- 推理令牌
- 0
- 响应时间(平均)
- 3.12s
- 响应时间(总计)
- 68.69s
- 响应时间(最大)
- 44.76s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)828ms
响应时间(最大)1.95s
响应时间(总计)3.31s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.19s
响应时间(最大)1.97s
响应时间(总计)3.56s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)24.10s
响应时间(最大)44.76s
响应时间(总计)48.21s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.14s
响应时间(最大)1.18s
响应时间(总计)2.27s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)552ms
响应时间(最大)675ms
响应时间(总计)1.66s
-
通用智能
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.31s
响应时间(最大)1.31s
响应时间(总计)1.31s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)582ms
响应时间(最大)633ms
响应时间(总计)1.16s
-
谜题求解
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.25s
响应时间(最大)1.84s
响应时间(总计)3.76s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.75s
响应时间(最大)2.75s
响应时间(总计)2.75s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)703ms
响应时间(最大)703ms
响应时间(总计)703ms
|
| #266#266 |
Ring-2.6-1Tnone
|
4.8… |
Inclusionai |
$0.026
↑
…
|
51.99s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 6 答案错误: 5 未遵循指令: 2
响应时间(平均)51.99s
响应时间(最大)143.82s
响应时间(总计)831.90s
…
|
- 总测试数
- 22
- 错误测试数
- 13
- 尝试通过率
- 45.5%
- 输入令牌
- 7,608
- 输出令牌
- 40,277
- 推理令牌
- 0
- 响应时间(平均)
- 51.99s
- 响应时间(总计)
- 831.90s
- 响应时间(最大)
- 143.82s
-
反AI技巧
: 9.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)43.33s
响应时间(最大)71.76s
响应时间(总计)173.31s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)143.82s
响应时间(最大)143.82s
响应时间(总计)143.82s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)45.87s
响应时间(最大)45.87s
响应时间(总计)45.87s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)56.85s
响应时间(最大)90.09s
响应时间(总计)170.54s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)15.63s
响应时间(最大)15.63s
响应时间(总计)15.63s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)27.36s
响应时间(最大)40.24s
响应时间(总计)54.72s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)31.47s
响应时间(最大)46.84s
响应时间(总计)94.41s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)133.60s
响应时间(最大)133.60s
响应时间(总计)133.60s
|
| #218#218 |
GLM 5V Turbonone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.6… |
Z.ai |
$0.052
…
|
2.99s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 2
响应时间(平均)2.99s
响应时间(最大)6.51s
响应时间(总计)62.74s
…
|
- 总测试数
- 21
- 错误测试数
- 13
- 尝试通过率
- 36.4%
- 输入令牌
- 37,100
- 输出令牌
- 1,766
- 推理令牌
- 0
- 响应时间(平均)
- 2.99s
- 响应时间(总计)
- 62.74s
- 响应时间(最大)
- 6.51s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)3.13s
响应时间(最大)5.90s
响应时间(总计)12.50s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.13s
响应时间(最大)5.30s
响应时间(总计)9.40s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.51s
响应时间(最大)6.51s
响应时间(总计)6.51s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.81s
响应时间(最大)5.69s
响应时间(总计)7.62s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.09s
响应时间(最大)2.39s
响应时间(总计)6.26s
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.22s
响应时间(最大)2.22s
响应时间(总计)2.22s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.97s
响应时间(最大)2.43s
响应时间(总计)3.93s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.40s
响应时间(最大)3.81s
响应时间(总计)7.21s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.86s
响应时间(最大)4.86s
响应时间(总计)4.86s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.23s
响应时间(最大)2.23s
响应时间(总计)2.23s
|
| #219#219 |
Owl Alphamedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.6… |
Openrouter |
$0.000
…
|
11.95s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 2 API 错误: 1
响应时间(平均)11.95s
响应时间(最大)58.63s
响应时间(总计)250.88s
…
|
- 总测试数
- 21
- 错误测试数
- 13
- 尝试通过率
- 37.9%
- 输入令牌
- 43,478
- 输出令牌
- 2,974
- 推理令牌
- 0
- 响应时间(平均)
- 11.95s
- 响应时间(总计)
- 250.88s
- 响应时间(最大)
- 58.63s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)3.97s
响应时间(最大)7.48s
响应时间(总计)15.89s
-
编程
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)18.74s
响应时间(最大)30.81s
响应时间(总计)56.21s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.01s
响应时间(最大)10.01s
响应时间(总计)10.01s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.64s
响应时间(最大)29.16s
响应时间(总计)43.28s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)8.58s
响应时间(最大)9.48s
响应时间(总计)25.74s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)58.63s
响应时间(最大)58.63s
响应时间(总计)58.63s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.15s
响应时间(最大)15.94s
响应时间(总计)20.30s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)3.40s
响应时间(最大)4.60s
响应时间(总计)10.19s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.26s
响应时间(最大)8.26s
响应时间(总计)8.26s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.38s
响应时间(最大)2.38s
响应时间(总计)2.38s
|
| #229#229 |
Mimo V2 Omninone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.5… |
Xiaomi |
$0.021
↓
…
|
2.44s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 API 错误: 1 额外格式: 1 未遵循指令: 1
响应时间(平均)2.44s
响应时间(最大)6.81s
响应时间(总计)48.81s
…
|
- 总测试数
- 21
- 错误测试数
- 13
- 尝试通过率
- 37.9%
- 输入令牌
- 40,852
- 输出令牌
- 3,314
- 推理令牌
- 0
- 响应时间(平均)
- 2.44s
- 响应时间(总计)
- 48.81s
- 响应时间(最大)
- 6.81s
-
反AI技巧
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)1.63s
响应时间(最大)3.29s
响应时间(总计)6.52s
-
编程
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 额外格式: 1 答案错误: 1
响应时间(平均)2.75s
响应时间(最大)3.79s
响应时间(总计)5.50s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.96s
响应时间(最大)5.96s
响应时间(总计)5.96s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.76s
响应时间(最大)2.60s
响应时间(总计)3.51s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.10s
响应时间(最大)3.58s
响应时间(总计)6.30s
-
通用智能
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.33s
响应时间(最大)2.33s
响应时间(总计)2.33s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.26s
响应时间(最大)6.81s
响应时间(总计)8.51s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.16s
响应时间(最大)1.55s
响应时间(总计)3.48s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.40s
响应时间(最大)5.40s
响应时间(总计)5.40s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.30s
响应时间(最大)1.30s
响应时间(总计)1.30s
|
| #297#297 |
Grok Build 0.1none已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.0… |
X AI |
$0.547
…
|
28.69s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 API 错误: 3 未遵循指令: 2
响应时间(平均)28.69s
响应时间(最大)138.35s
响应时间(总计)459.00s
…
|
- 总测试数
- 19
- 错误测试数
- 12
- 尝试通过率
- 43.9%
- 输入令牌
- 11,793
- 输出令牌
- 267,275
- 推理令牌
- 0
- 响应时间(平均)
- 28.69s
- 响应时间(总计)
- 459.00s
- 响应时间(最大)
- 138.35s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.30s
响应时间(最大)9.80s
响应时间(总计)25.20s
-
编程
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.41s
响应时间(最大)21.41s
响应时间(总计)21.41s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)9.33s
响应时间(最大)9.33s
响应时间(总计)9.33s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)103.71s
响应时间(最大)138.35s
响应时间(总计)311.13s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)12.47s
响应时间(最大)12.47s
响应时间(总计)12.47s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.36s
响应时间(最大)11.05s
响应时间(总计)14.73s
-
谜题求解
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)9.55s
响应时间(最大)18.18s
响应时间(总计)28.65s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)36.09s
响应时间(最大)36.09s
响应时间(总计)36.09s
|
| #169#169 |
LongCat 2.0none
|
6.4… |
Meituan |
$0.044
…
|
5.17s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 额外格式: 1
响应时间(平均)5.17s
响应时间(最大)48.38s
响应时间(总计)113.83s
…
|
- 总测试数
- 22
- 错误测试数
- 14
- 尝试通过率
- 40.9%
- 输入令牌
- 108,752
- 输出令牌
- 9,375
- 推理令牌
- 0
- 响应时间(平均)
- 5.17s
- 响应时间(总计)
- 113.83s
- 响应时间(最大)
- 48.38s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.87s
响应时间(最大)5.35s
响应时间(总计)11.47s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.85s
响应时间(最大)4.99s
响应时间(总计)8.54s
-
综合
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)28.45s
响应时间(最大)48.38s
响应时间(总计)56.89s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.36s
响应时间(最大)2.56s
响应时间(总计)4.72s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.68s
响应时间(最大)1.79s
响应时间(总计)5.04s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.76s
响应时间(最大)2.76s
响应时间(总计)2.76s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.82s
响应时间(最大)3.85s
响应时间(总计)5.64s
-
谜题求解
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1
响应时间(平均)2.74s
响应时间(最大)2.89s
响应时间(总计)8.21s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.64s
响应时间(最大)6.64s
响应时间(总计)6.64s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.92s
响应时间(最大)3.92s
响应时间(总计)3.92s
|
| #175#175 |
Seed-2.0-Litenone
|
6.2… |
Bytedance Seed |
$0.066
…
|
4.37s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 无答案: 1
响应时间(平均)4.37s
响应时间(最大)44.58s
响应时间(总计)96.20s
…
|
- 总测试数
- 22
- 错误测试数
- 14
- 尝试通过率
- 40.9%
- 输入令牌
- 142,206
- 输出令牌
- 14,744
- 推理令牌
- 0
- 响应时间(平均)
- 4.37s
- 响应时间(总计)
- 96.20s
- 响应时间(最大)
- 44.58s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.43s
响应时间(最大)6.70s
响应时间(总计)9.73s
-
编程
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.83s
响应时间(最大)4.61s
响应时间(总计)8.49s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)25.58s
响应时间(最大)44.58s
响应时间(总计)51.17s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.82s
响应时间(最大)1.97s
响应时间(总计)3.63s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.12s
响应时间(最大)1.53s
响应时间(总计)3.36s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.45s
响应时间(最大)3.45s
响应时间(总计)3.45s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.06s
响应时间(最大)1.09s
响应时间(总计)2.12s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.78s
响应时间(最大)5.20s
响应时间(总计)8.34s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.94s
响应时间(最大)3.94s
响应时间(总计)3.94s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.96s
响应时间(最大)1.96s
响应时间(总计)1.96s
|
| #186#186 |
Trinity Large Thinkingmedium
|
6.1… |
Arcee AI |
$0.756
↓
…
|
85.44s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 未遵循指令: 4 无效工具调用: 2
响应时间(平均)85.44s
响应时间(最大)525.14s
响应时间(总计)1879.75s
…
|
- 总测试数
- 22
- 错误测试数
- 14
- 尝试通过率
- 48.5%
- 输入令牌
- 118,486
- 输出令牌
- 156,166
- 推理令牌
- 860,619
- 响应时间(平均)
- 85.44s
- 响应时间(总计)
- 1879.75s
- 响应时间(最大)
- 525.14s
-
反AI技巧
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)5.11s
响应时间(最大)7.44s
响应时间(总计)20.43s
-
编程
: 7.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)179.02s
响应时间(最大)204.02s
响应时间(总计)537.06s
-
综合
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)382.70s
响应时间(最大)525.14s
响应时间(总计)765.39s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)16.38s
响应时间(最大)25.39s
响应时间(总计)32.75s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)124.17s
响应时间(最大)185.24s
响应时间(总计)372.50s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)32.22s
响应时间(最大)32.22s
响应时间(总计)32.22s
-
指令遵循
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)3.99s
响应时间(最大)4.44s
响应时间(总计)7.98s
-
谜题求解
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2 答案错误: 1
响应时间(平均)2.90s
响应时间(最大)4.88s
响应时间(总计)8.71s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.26s
响应时间(最大)5.26s
响应时间(总计)5.26s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)97.44s
响应时间(最大)97.44s
响应时间(总计)97.44s
|
| #189#189 |
Qwen3.5 Plus 2026-04-20none
|
6.1… |
Qwen |
$0.122
↓
…
|
13.10s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 未遵循指令: 2
响应时间(平均)13.10s
响应时间(最大)206.05s
响应时间(总计)288.23s
…
|
- 总测试数
- 22
- 错误测试数
- 14
- 尝试通过率
- 43.9%
- 输入令牌
- 94,477
- 输出令牌
- 51,487
- 推理令牌
- 0
- 响应时间(平均)
- 13.10s
- 响应时间(总计)
- 288.23s
- 响应时间(最大)
- 206.05s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.88s
响应时间(最大)4.81s
响应时间(总计)7.53s
-
编程
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.69s
响应时间(最大)3.20s
响应时间(总计)5.06s
-
综合
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)109.69s
响应时间(最大)206.05s
响应时间(总计)219.37s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.82s
响应时间(最大)3.86s
响应时间(总计)5.65s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.06s
响应时间(最大)1.71s
响应时间(总计)3.19s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.41s
响应时间(最大)1.41s
响应时间(总计)1.41s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.17s
响应时间(最大)1.33s
响应时间(总计)2.35s
-
谜题求解
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.97s
响应时间(最大)3.43s
响应时间(总计)5.91s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.42s
响应时间(最大)4.42s
响应时间(总计)4.42s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)33.34s
响应时间(最大)33.34s
响应时间(总计)33.34s
|
| #190#190 |
Nemotron 3 Ultranone
|
6.1… |
NVIDIA |
$0.093
↕
…
|
3.88s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 API 错误: 2 未遵循指令: 1
响应时间(平均)3.88s
响应时间(最大)37.50s
响应时间(总计)85.33s
…
|
- 总测试数
- 22
- 错误测试数
- 14
- 尝试通过率
- 42.4%
- 输入令牌
- 101,168
- 输出令牌
- 9,470
- 推理令牌
- 0
- 响应时间(平均)
- 3.88s
- 响应时间(总计)
- 85.33s
- 响应时间(最大)
- 37.50s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.35s
响应时间(最大)6.55s
响应时间(总计)9.42s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.02s
响应时间(最大)1.83s
响应时间(总计)3.07s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)21.14s
响应时间(最大)37.50s
响应时间(总计)42.28s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.94s
响应时间(最大)2.86s
响应时间(总计)3.89s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)758ms
响应时间(最大)1.00s
响应时间(总计)2.28s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)13.49s
响应时间(最大)13.49s
响应时间(总计)13.49s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.46s
响应时间(最大)1.72s
响应时间(总计)2.92s
-
谜题求解
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.06s
响应时间(最大)1.53s
响应时间(总计)3.17s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.99s
响应时间(最大)2.99s
响应时间(总计)2.99s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.83s
响应时间(最大)1.83s
响应时间(总计)1.83s
|
| #191#191 |
Trinity Large Thinkinglow
|
6.0… |
Arcee AI |
$0.625
↓
…
|
96.61s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 API 错误: 2 未遵循指令: 2 无效工具调用: 2 无答案: 1
响应时间(平均)96.61s
响应时间(最大)540.96s
响应时间(总计)2125.51s
…
|
- 总测试数
- 22
- 错误测试数
- 14
- 尝试通过率
- 47.0%
- 输入令牌
- 122,854
- 输出令牌
- 119,810
- 推理令牌
- 698,549
- 响应时间(平均)
- 96.61s
- 响应时间(总计)
- 2125.51s
- 响应时间(最大)
- 540.96s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.70s
响应时间(最大)10.16s
响应时间(总计)22.82s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)344.45s
响应时间(最大)531.83s
响应时间(总计)1033.35s
-
综合
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)291.02s
响应时间(最大)540.96s
响应时间(总计)582.05s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)14.30s
响应时间(最大)21.07s
响应时间(总计)28.60s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)140.26s
响应时间(最大)307.46s
响应时间(总计)420.77s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.65s
响应时间(最大)12.65s
响应时间(总计)12.65s
-
指令遵循
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)4.07s
响应时间(最大)4.47s
响应时间(总计)8.14s
-
谜题求解
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)3.28s
响应时间(最大)6.54s
响应时间(总计)9.85s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.19s
响应时间(最大)5.19s
响应时间(总计)5.19s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.10s
响应时间(最大)2.10s
响应时间(总计)2.10s
|
| #192#192 |
Gemini 2.5 Flashnone
|
6.0… |
Google |
$0.017
…
|
6.19s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 无效工具调用: 1
响应时间(平均)6.19s
响应时间(最大)118.00s
响应时间(总计)136.23s
…
|
- 总测试数
- 22
- 错误测试数
- 14
- 尝试通过率
- 39.4%
- 输入令牌
- 39,886
- 输出令牌
- 1,890
- 推理令牌
- 0
- 响应时间(平均)
- 6.19s
- 响应时间(总计)
- 136.23s
- 响应时间(最大)
- 118.00s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)582ms
响应时间(最大)844ms
响应时间(总计)2.33s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)736ms
响应时间(最大)1.16s
响应时间(总计)2.21s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)61.19s
响应时间(最大)118.00s
响应时间(总计)122.38s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)652ms
响应时间(最大)660ms
响应时间(总计)1.30s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)449ms
响应时间(最大)642ms
响应时间(总计)1.35s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)615ms
响应时间(最大)615ms
响应时间(总计)615ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)590ms
响应时间(最大)622ms
响应时间(总计)1.18s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)604ms
响应时间(最大)700ms
响应时间(总计)1.81s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.91s
响应时间(最大)1.91s
响应时间(总计)1.91s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.15s
响应时间(最大)1.15s
响应时间(总计)1.15s
|
| #194#194 |
GPT-5.6 Terranone
|
6.0… |
OpenAI |
$0.280
↓
…
|
1.66s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 1 无效工具调用: 1 无答案: 1
响应时间(平均)1.66s
响应时间(最大)10.07s
响应时间(总计)36.54s
…
|
- 总测试数
- 22
- 错误测试数
- 14
- 尝试通过率
- 42.4%
- 输入令牌
- 102,268
- 输出令牌
- 6,221
- 推理令牌
- 0
- 响应时间(平均)
- 1.66s
- 响应时间(总计)
- 36.54s
- 响应时间(最大)
- 10.07s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)942ms
响应时间(最大)1.09s
响应时间(总计)3.77s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.00s
响应时间(最大)1.14s
响应时间(总计)3.01s
-
综合
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 无答案: 1
响应时间(平均)7.02s
响应时间(最大)10.07s
响应时间(总计)14.05s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.13s
响应时间(最大)1.27s
响应时间(总计)2.26s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)843ms
响应时间(最大)923ms
响应时间(总计)2.53s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.03s
响应时间(最大)1.03s
响应时间(总计)1.03s
-
指令遵循
: 8.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.15s
响应时间(最大)1.48s
响应时间(总计)2.30s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.23s
响应时间(最大)2.02s
响应时间(总计)3.70s
-
工具调用
: 9.6
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.10s
响应时间(最大)3.10s
响应时间(总计)3.10s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)787ms
响应时间(最大)787ms
响应时间(总计)787ms
|
| #196#196 |
GPT-5 Nanomedium
|
6.0… |
OpenAI |
$0.118
…
|
54.20s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 2 无答案: 1 超时: 1
响应时间(平均)54.20s
响应时间(最大)227.89s
响应时间(总计)867.23s
…
|
- 总测试数
- 22
- 错误测试数
- 14
- 尝试通过率
- 54.5%
- 输入令牌
- 94,944
- 输出令牌
- 12,037
- 推理令牌
- 270,400
- 响应时间(平均)
- 54.20s
- 响应时间(总计)
- 867.23s
- 响应时间(最大)
- 227.89s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)25.50s
响应时间(最大)37.73s
响应时间(总计)51.00s
-
编程
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)41.62s
响应时间(最大)54.86s
响应时间(总计)124.86s
-
综合
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)146.93s
响应时间(最大)227.89s
响应时间(总计)293.85s
-
数据解析与提取
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)21.42s
响应时间(最大)21.42s
响应时间(总计)21.42s
-
领域专项
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)124.13s
响应时间(最大)204.02s
响应时间(总计)248.27s
-
通用智能
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)17.51s
响应时间(最大)17.51s
响应时间(总计)17.51s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.64s
响应时间(最大)15.64s
响应时间(总计)15.64s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)20.63s
响应时间(最大)22.94s
响应时间(总计)41.26s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)33.30s
响应时间(最大)33.30s
响应时间(总计)33.30s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)20.13s
响应时间(最大)20.13s
响应时间(总计)20.13s
|
| #200#200 |
Dots 3 Note Previewmedium
|
5.9… |
Dots Studio |
$0.000
…
|
67.13s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 2 无答案: 2 额外格式: 1
响应时间(平均)67.13s
响应时间(最大)459.19s
响应时间(总计)1476.95s
…
|
- 总测试数
- 22
- 错误测试数
- 14
- 尝试通过率
- 57.6%
- 输入令牌
- 94,639
- 输出令牌
- 108,013
- 推理令牌
- 571,526
- 响应时间(平均)
- 67.13s
- 响应时间(总计)
- 1476.95s
- 响应时间(最大)
- 459.19s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.76s
响应时间(最大)12.44s
响应时间(总计)31.04s
-
编程
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 无答案: 1 答案错误: 1
响应时间(平均)309.15s
响应时间(最大)459.19s
响应时间(总计)927.45s
-
综合
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)60.81s
响应时间(最大)73.47s
响应时间(总计)121.61s
-
数据解析与提取
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)78.47s
响应时间(最大)136.10s
响应时间(总计)156.95s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)47.54s
响应时间(最大)69.87s
响应时间(总计)142.62s
-
通用智能
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)26.20s
响应时间(最大)26.20s
响应时间(总计)26.20s
-
指令遵循
: 8.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)7.77s
响应时间(最大)13.01s
响应时间(总计)15.55s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)8.71s
响应时间(最大)10.74s
响应时间(总计)26.13s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.97s
响应时间(最大)13.97s
响应时间(总计)13.97s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)15.46s
响应时间(最大)15.46s
响应时间(总计)15.46s
|
| #208#208 |
North Mini Codemedium58/66 次尝试 (目标:每项测试重复 3 次)
|
5.7… |
Cohere |
$0.000
…
|
141.99s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 额外格式: 2 API 错误: 1 无效工具调用: 1 超时: 1
响应时间(平均)141.99s
响应时间(最大)786.72s
响应时间(总计)3123.87s
…
|
- 总测试数
- 22
- 错误测试数
- 14
- 尝试通过率
- 43.9%
- 输入令牌
- 81,742
- 输出令牌
- 423,884
- 推理令牌
- 1,340,907
- 响应时间(平均)
- 141.99s
- 响应时间(总计)
- 3123.87s
- 响应时间(最大)
- 786.72s
-
反AI技巧
: 8.4
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)64.79s
响应时间(最大)230.24s
响应时间(总计)259.15s
-
编程
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)320.43s
响应时间(最大)357.05s
响应时间(总计)961.28s
-
综合
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 无效工具调用: 1
响应时间(平均)554.89s
响应时间(最大)786.72s
响应时间(总计)1109.78s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)24.06s
响应时间(最大)26.90s
响应时间(总计)48.13s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)107.19s
响应时间(最大)195.94s
响应时间(总计)321.57s
-
通用智能
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)25.08s
响应时间(最大)25.08s
响应时间(总计)25.08s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.43s
响应时间(最大)28.25s
响应时间(总计)30.85s
-
谜题求解
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)19.70s
响应时间(最大)36.03s
响应时间(总计)59.10s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.93s
响应时间(最大)3.93s
响应时间(总计)3.93s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)305.02s
响应时间(最大)305.02s
响应时间(总计)305.02s
|
| #209#209 |
Nemotron 3 Supermedium
|
5.7… |
NVIDIA |
$0.050
↑
…
|
52.31s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 API 错误: 4 未遵循指令: 3 无答案: 1 超时: 1
响应时间(平均)52.31s
响应时间(最大)431.98s
响应时间(总计)1046.21s
…
|
- 总测试数
- 22
- 错误测试数
- 14
- 尝试通过率
- 40.9%
- 输入令牌
- 81,438
- 输出令牌
- 17,674
- 推理令牌
- 97,900
- 响应时间(平均)
- 52.31s
- 响应时间(总计)
- 1046.21s
- 响应时间(最大)
- 431.98s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)7.85s
响应时间(最大)22.30s
响应时间(总计)31.40s
-
编程
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 3
响应时间(平均)147.32s
响应时间(最大)232.25s
响应时间(总计)294.64s
-
综合
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)259.89s
响应时间(最大)431.98s
响应时间(总计)519.77s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)18.16s
响应时间(最大)20.65s
响应时间(总计)36.33s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)19.35s
响应时间(最大)21.56s
响应时间(总计)38.71s
-
通用智能
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)6.91s
响应时间(最大)6.91s
响应时间(总计)6.91s
-
指令遵循
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)6.97s
响应时间(最大)11.23s
响应时间(总计)13.95s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)3.15s
响应时间(最大)4.52s
响应时间(总计)9.45s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)39.75s
响应时间(最大)39.75s
响应时间(总计)39.75s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)55.32s
响应时间(最大)55.32s
响应时间(总计)55.32s
|
| #213#213 |
GLM 5.1none
|
5.7… |
Z.ai |
$0.164
↓
…
|
6.74s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 无效工具调用: 1 无答案: 1
响应时间(平均)6.74s
响应时间(最大)61.20s
响应时间(总计)148.20s
…
|
- 总测试数
- 22
- 错误测试数
- 14
- 尝试通过率
- 45.5%
- 输入令牌
- 124,219
- 输出令牌
- 14,393
- 推理令牌
- 0
- 响应时间(平均)
- 6.74s
- 响应时间(总计)
- 148.20s
- 响应时间(最大)
- 61.20s
-
反AI技巧
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.11s
响应时间(最大)3.94s
响应时间(总计)8.46s
-
编程
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)4.96s
响应时间(最大)9.79s
响应时间(总计)14.89s
-
综合
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 无答案: 1
响应时间(平均)46.88s
响应时间(最大)61.20s
响应时间(总计)93.77s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.08s
响应时间(最大)1.62s
响应时间(总计)2.15s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.27s
响应时间(最大)3.99s
响应时间(总计)6.80s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)790ms
响应时间(最大)790ms
响应时间(总计)790ms
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.98s
响应时间(最大)2.28s
响应时间(总计)3.97s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.45s
响应时间(最大)2.09s
响应时间(总计)4.36s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.68s
响应时间(最大)10.68s
响应时间(总计)10.68s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.34s
响应时间(最大)2.34s
响应时间(总计)2.34s
|
| #223#223 |
KAT-Coder-Air V2.5medium
|
5.6… |
Kwaipilot |
$0.048
…
|
8.65s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 API 错误: 1 额外格式: 1 未遵循指令: 1 超时: 1
响应时间(平均)8.65s
响应时间(最大)48.19s
响应时间(总计)190.35s
…
|
- 总测试数
- 22
- 错误测试数
- 14
- 尝试通过率
- 45.5%
- 输入令牌
- 51,369
- 输出令牌
- 8,008
- 推理令牌
- 58,568
- 响应时间(平均)
- 8.65s
- 响应时间(总计)
- 190.35s
- 响应时间(最大)
- 48.19s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.79s
响应时间(最大)9.97s
响应时间(总计)15.17s
-
编程
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1
响应时间(平均)23.37s
响应时间(最大)48.19s
响应时间(总计)70.10s
-
综合
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)19.56s
响应时间(最大)27.68s
响应时间(总计)39.11s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.65s
响应时间(最大)4.88s
响应时间(总计)7.31s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)6.58s
响应时间(最大)7.90s
响应时间(总计)19.73s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)9.81s
响应时间(最大)9.81s
响应时间(总计)9.81s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.50s
响应时间(最大)1.88s
响应时间(总计)3.00s
-
谜题求解
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.87s
响应时间(最大)2.41s
响应时间(总计)5.61s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.77s
响应时间(最大)4.77s
响应时间(总计)4.77s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)15.74s
响应时间(最大)15.74s
响应时间(总计)15.74s
|
| #221#221 |
Mimo V2 PROnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.6… |
Xiaomi |
$0.045
↓
…
|
2.27s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 2 API 错误: 1
响应时间(平均)2.27s
响应时间(最大)6.58s
响应时间(总计)45.50s
…
|
- 总测试数
- 21
- 错误测试数
- 14
- 尝试通过率
- 39.4%
- 输入令牌
- 39,344
- 输出令牌
- 2,352
- 推理令牌
- 0
- 响应时间(平均)
- 2.27s
- 响应时间(总计)
- 45.50s
- 响应时间(最大)
- 6.58s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.80s
响应时间(最大)2.62s
响应时间(总计)7.19s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)2.65s
响应时间(最大)3.82s
响应时间(总计)5.30s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.58s
响应时间(最大)6.58s
响应时间(总计)6.58s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.39s
响应时间(最大)1.42s
响应时间(总计)2.78s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.78s
响应时间(最大)2.49s
响应时间(总计)5.34s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.44s
响应时间(最大)2.44s
响应时间(总计)2.44s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.51s
响应时间(最大)2.95s
响应时间(总计)5.02s
-
谜题求解
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.61s
响应时间(最大)2.15s
响应时间(总计)4.83s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.39s
响应时间(最大)4.39s
响应时间(总计)4.39s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.63s
响应时间(最大)1.63s
响应时间(总计)1.63s
|
| #222#222 |
Owl Alphanone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.6… |
Openrouter |
$0.000
…
|
9.88s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 3 额外格式: 1
响应时间(平均)9.88s
响应时间(最大)47.10s
响应时间(总计)207.38s
…
|
- 总测试数
- 21
- 错误测试数
- 14
- 尝试通过率
- 34.9%
- 输入令牌
- 42,283
- 输出令牌
- 5,913
- 推理令牌
- 0
- 响应时间(平均)
- 9.88s
- 响应时间(总计)
- 207.38s
- 响应时间(最大)
- 47.10s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)2.78s
响应时间(最大)3.09s
响应时间(总计)11.10s
-
编程
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)36.89s
响应时间(最大)47.10s
响应时间(总计)110.66s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)21.74s
响应时间(最大)21.74s
响应时间(总计)21.74s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.60s
响应时间(最大)3.92s
响应时间(总计)7.19s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.00s
响应时间(最大)4.69s
响应时间(总计)8.99s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.61s
响应时间(最大)4.61s
响应时间(总计)4.61s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.63s
响应时间(最大)2.77s
响应时间(总计)5.27s
-
谜题求解
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)4.18s
响应时间(最大)8.27s
响应时间(总计)12.54s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)22.78s
响应时间(最大)22.78s
响应时间(总计)22.78s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.50s
响应时间(最大)2.50s
响应时间(总计)2.50s
|
| #277#277 |
Cobuddymedium63/66 次尝试 (目标:每项测试重复 3 次)
|
4.7… |
Baidu |
$0.000
…
|
39.90s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 3 API 错误: 1 无效工具调用: 1
响应时间(平均)39.90s
响应时间(最大)309.02s
响应时间(总计)797.98s
…
|
- 总测试数
- 21
- 错误测试数
- 14
- 尝试通过率
- 45.5%
- 输入令牌
- 37,449
- 输出令牌
- 1,677
- 推理令牌
- 116,703
- 响应时间(平均)
- 39.90s
- 响应时间(总计)
- 797.98s
- 响应时间(最大)
- 309.02s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.00s
响应时间(最大)11.53s
响应时间(总计)39.99s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 未遵循指令: 1 答案错误: 1
响应时间(平均)79.17s
响应时间(最大)104.76s
响应时间(总计)158.35s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)47.38s
响应时间(最大)47.38s
响应时间(总计)47.38s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.36s
响应时间(最大)26.57s
响应时间(总计)34.71s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)128.15s
响应时间(最大)309.02s
响应时间(总计)384.46s
-
通用智能
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)23.23s
响应时间(最大)23.23s
响应时间(总计)23.23s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.60s
响应时间(最大)14.49s
响应时间(总计)23.20s
-
谜题求解
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)12.83s
响应时间(最大)24.40s
响应时间(总计)38.49s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.19s
响应时间(最大)11.19s
响应时间(总计)11.19s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)36.98s
响应时间(最大)36.98s
响应时间(总计)36.98s
|
| #283#283 |
Grok 4.20 Betanone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.4… |
X AI |
$0.087
↓
…
|
1.19s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 1 无效工具调用: 1
响应时间(平均)1.19s
响应时间(最大)6.48s
响应时间(总计)21.43s
…
|
- 总测试数
- 18
- 错误测试数
- 12
- 尝试通过率
- 30.3%
- 输入令牌
- 40,597
- 输出令牌
- 1,657
- 推理令牌
- 0
- 响应时间(平均)
- 1.19s
- 响应时间(总计)
- 21.43s
- 响应时间(最大)
- 6.48s
-
反AI技巧
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)597ms
响应时间(最大)866ms
响应时间(总计)2.39s
-
编程
: 1.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.14s
响应时间(最大)1.14s
响应时间(总计)1.14s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)6.48s
响应时间(最大)6.48s
响应时间(总计)6.48s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)601ms
响应时间(最大)634ms
响应时间(总计)1.20s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)611ms
响应时间(最大)616ms
响应时间(总计)1.83s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)541ms
响应时间(最大)541ms
响应时间(总计)541ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)649ms
响应时间(最大)952ms
响应时间(总计)1.30s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)586ms
响应时间(最大)813ms
响应时间(总计)1.76s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.79s
响应时间(最大)4.79s
响应时间(总计)4.79s
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|