| #205#205 |
Laguna Xs.2none已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
3.8… |
Poolside |
$0.004
↕
…
|
806ms… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 API 错误: 4 未遵循指令: 1 无效工具调用: 1
响应时间(平均)806ms
响应时间(最大)2.01s
响应时间(总计)12.09s
…
|
- 总测试数
- 19
- 错误测试数
- 14
- 尝试通过率
- 22.7%
- 输入令牌
- 33,675
- 输出令牌
- 2,826
- 推理令牌
- 0
- 响应时间(平均)
- 806ms
- 响应时间(总计)
- 12.09s
- 响应时间(最大)
- 2.01s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1 未遵循指令: 1
响应时间(平均)534ms
响应时间(最大)906ms
响应时间(总计)1.60s
-
编程
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.96s
响应时间(最大)1.96s
响应时间(总计)1.96s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.01s
响应时间(最大)2.01s
响应时间(总计)2.01s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)646ms
响应时间(最大)658ms
响应时间(总计)1.29s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)371ms
响应时间(最大)419ms
响应时间(总计)1.11s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)439ms
响应时间(最大)448ms
响应时间(总计)878ms
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)650ms
响应时间(最大)843ms
响应时间(总计)1.30s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)1.93s
响应时间(最大)1.93s
响应时间(总计)1.93s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #136#136 |
GPT-5.4 Mininone
|
5.9… |
OpenAI |
$0.095
…
|
1.53s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 3
响应时间(平均)1.53s
响应时间(最大)9.92s
响应时间(总计)33.74s
…
|
- 总测试数
- 22
- 错误测试数
- 16
- 尝试通过率
- 33.3%
- 输入令牌
- 79,067
- 输出令牌
- 7,880
- 推理令牌
- 0
- 响应时间(平均)
- 1.53s
- 响应时间(总计)
- 33.74s
- 响应时间(最大)
- 9.92s
-
反AI技巧
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)929ms
响应时间(最大)1.55s
响应时间(总计)3.72s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)913ms
响应时间(最大)1.19s
响应时间(总计)2.74s
-
综合
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.22s
响应时间(最大)9.92s
响应时间(总计)12.43s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.30s
响应时间(最大)1.58s
响应时间(总计)2.61s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)937ms
响应时间(最大)1.25s
响应时间(总计)2.81s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.82s
响应时间(最大)1.82s
响应时间(总计)1.82s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)728ms
响应时间(最大)731ms
响应时间(总计)1.46s
-
谜题求解
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)836ms
响应时间(最大)958ms
响应时间(总计)2.51s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.32s
响应时间(最大)2.32s
响应时间(总计)2.32s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.33s
响应时间(最大)1.33s
响应时间(总计)1.33s
|
| #142#142 |
Qwen3.5-122B-A10Bnone
|
5.7… |
Qwen |
$0.247
↓
…
|
12.92s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 2 无效工具调用: 1
响应时间(平均)12.92s
响应时间(最大)212.63s
响应时间(总计)284.21s
…
|
- 总测试数
- 22
- 错误测试数
- 16
- 尝试通过率
- 33.3%
- 输入令牌
- 241,566
- 输出令牌
- 88,458
- 推理令牌
- 0
- 响应时间(平均)
- 12.92s
- 响应时间(总计)
- 284.21s
- 响应时间(最大)
- 212.63s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.59s
响应时间(最大)3.60s
响应时间(总计)6.38s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.77s
响应时间(最大)4.03s
响应时间(总计)8.32s
-
综合
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)129.31s
响应时间(最大)212.63s
响应时间(总计)258.63s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.01s
响应时间(最大)1.06s
响应时间(总计)2.02s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)465ms
响应时间(最大)492ms
响应时间(总计)1.39s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.12s
响应时间(最大)1.12s
响应时间(总计)1.12s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)513ms
响应时间(最大)570ms
响应时间(总计)1.03s
-
谜题求解
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.00s
响应时间(最大)1.41s
响应时间(总计)3.00s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.04s
响应时间(最大)2.04s
响应时间(总计)2.04s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)295ms
响应时间(最大)295ms
响应时间(总计)295ms
|
| #154#154 |
MiMo-V2.5-Pronone
|
5.5… |
Xiaomi |
$0.068
↓
…
|
4.12s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 4 无答案: 1
响应时间(平均)4.12s
响应时间(最大)53.13s
响应时间(总计)90.55s
…
|
- 总测试数
- 22
- 错误测试数
- 16
- 尝试通过率
- 37.9%
- 输入令牌
- 124,799
- 输出令牌
- 15,362
- 推理令牌
- 0
- 响应时间(平均)
- 4.12s
- 响应时间(总计)
- 90.55s
- 响应时间(最大)
- 53.13s
-
反AI技巧
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)2.67s
响应时间(最大)8.32s
响应时间(总计)10.67s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.41s
响应时间(最大)2.39s
响应时间(总计)4.23s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 无答案: 1
响应时间(平均)28.33s
响应时间(最大)53.13s
响应时间(总计)56.67s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.32s
响应时间(最大)1.42s
响应时间(总计)2.64s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)877ms
响应时间(最大)904ms
响应时间(总计)2.63s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.58s
响应时间(最大)2.58s
响应时间(总计)2.58s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.03s
响应时间(最大)1.10s
响应时间(总计)2.06s
-
谜题求解
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.30s
响应时间(最大)1.61s
响应时间(总计)3.90s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.30s
响应时间(最大)3.30s
响应时间(总计)3.30s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.89s
响应时间(最大)1.89s
响应时间(总计)1.89s
|
| #155#155 |
Kimi K2.5none
|
5.5… |
Moonshot AI |
$0.127
↑
…
|
19.15s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 15 无答案: 1
响应时间(平均)19.15s
响应时间(最大)102.83s
响应时间(总计)287.30s
…
|
- 总测试数
- 22
- 错误测试数
- 16
- 尝试通过率
- 34.9%
- 输入令牌
- 89,322
- 输出令牌
- 26,638
- 推理令牌
- 0
- 响应时间(平均)
- 19.15s
- 响应时间(总计)
- 287.30s
- 响应时间(最大)
- 102.83s
-
反AI技巧
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)6.24s
响应时间(最大)11.38s
响应时间(总计)12.48s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)24.56s
响应时间(最大)38.78s
响应时间(总计)73.69s
-
综合
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)61.00s
响应时间(最大)102.83s
响应时间(总计)121.99s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)42.13s
响应时间(最大)42.13s
响应时间(总计)42.13s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.38s
响应时间(最大)4.38s
响应时间(总计)4.38s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.00s
响应时间(最大)4.00s
响应时间(总计)4.00s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.67s
响应时间(最大)2.67s
响应时间(总计)2.67s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)4.04s
响应时间(最大)7.81s
响应时间(总计)8.08s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.99s
响应时间(最大)13.99s
响应时间(总计)13.99s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.90s
响应时间(最大)3.90s
响应时间(总计)3.90s
|
| #159#159 |
GPT-5.6 Lunanone
|
5.4… |
OpenAI |
$0.142
…
|
1.50s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 额外格式: 1 无效工具调用: 1
响应时间(平均)1.50s
响应时间(最大)10.57s
响应时间(总计)32.91s
…
|
- 总测试数
- 22
- 错误测试数
- 16
- 尝试通过率
- 34.9%
- 输入令牌
- 101,323
- 输出令牌
- 6,709
- 推理令牌
- 0
- 响应时间(平均)
- 1.50s
- 响应时间(总计)
- 32.91s
- 响应时间(最大)
- 10.57s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)901ms
响应时间(最大)1.45s
响应时间(总计)3.60s
-
编程
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)980ms
响应时间(最大)1.57s
响应时间(总计)2.94s
-
综合
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)6.68s
响应时间(最大)10.57s
响应时间(总计)13.35s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)758ms
响应时间(最大)803ms
响应时间(总计)1.52s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)737ms
响应时间(最大)785ms
响应时间(总计)2.21s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.00s
响应时间(最大)1.00s
响应时间(总计)1.00s
-
指令遵循
: 7.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.23s
响应时间(最大)1.66s
响应时间(总计)2.47s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)790ms
响应时间(最大)865ms
响应时间(总计)2.37s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.80s
响应时间(最大)2.80s
响应时间(总计)2.80s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)651ms
响应时间(最大)651ms
响应时间(总计)651ms
|
| #164#164 |
Inklingnone
|
5.2… |
Thinkingmachines |
$0.147
…
|
3.50s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 额外格式: 1 未遵循指令: 1 无效工具调用: 1
响应时间(平均)3.50s
响应时间(最大)48.02s
响应时间(总计)77.09s
…
|
- 总测试数
- 22
- 错误测试数
- 16
- 尝试通过率
- 28.8%
- 输入令牌
- 104,111
- 输出令牌
- 10,551
- 推理令牌
- 0
- 响应时间(平均)
- 3.50s
- 响应时间(总计)
- 77.09s
- 响应时间(最大)
- 48.02s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.43s
响应时间(最大)2.89s
响应时间(总计)5.72s
-
编程
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.01s
响应时间(最大)2.25s
响应时间(总计)3.02s
-
综合
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)25.74s
响应时间(最大)48.02s
响应时间(总计)51.48s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.14s
响应时间(最大)1.33s
响应时间(总计)2.27s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.45s
响应时间(最大)2.66s
响应时间(总计)4.35s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)859ms
响应时间(最大)859ms
响应时间(总计)859ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.72s
响应时间(最大)2.59s
响应时间(总计)3.43s
-
谜题求解
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)931ms
响应时间(最大)1.40s
响应时间(总计)2.79s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.50s
响应时间(最大)2.50s
响应时间(总计)2.50s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)670ms
响应时间(最大)670ms
响应时间(总计)670ms
|
| #173#173 |
DeepSeek V3.2none
|
5.0… |
DeepSeek |
$0.054
↑
…
|
18.25s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 API 错误: 4 额外格式: 2 无效工具调用: 2 未遵循指令: 1
响应时间(平均)18.25s
响应时间(最大)115.89s
响应时间(总计)401.60s
…
|
- 总测试数
- 22
- 错误测试数
- 16
- 尝试通过率
- 37.9%
- 输入令牌
- 135,780
- 输出令牌
- 42,097
- 推理令牌
- 0
- 响应时间(平均)
- 18.25s
- 响应时间(总计)
- 401.60s
- 响应时间(最大)
- 115.89s
-
反AI技巧
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 API 错误: 1 答案错误: 1
响应时间(平均)9.35s
响应时间(最大)16.77s
响应时间(总计)37.40s
-
编程
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)14.54s
响应时间(最大)34.11s
响应时间(总计)43.62s
-
综合
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)113.53s
响应时间(最大)115.89s
响应时间(总计)227.06s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.42s
响应时间(最大)16.20s
响应时间(总计)18.84s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)4.17s
响应时间(最大)9.09s
响应时间(总计)12.51s
-
通用智能
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)9.32s
响应时间(最大)9.32s
响应时间(总计)9.32s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.52s
响应时间(最大)1.99s
响应时间(总计)3.04s
-
谜题求解
: 7.6
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)6.91s
响应时间(最大)10.09s
响应时间(总计)20.74s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.85s
响应时间(最大)11.85s
响应时间(总计)11.85s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.23s
响应时间(最大)17.23s
响应时间(总计)17.23s
|
| #176#176 |
GLM 4.7 Flashnone
|
4.9… |
Z.ai |
$0.016
…
|
9.15s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 无效工具调用: 2 未遵循指令: 1
响应时间(平均)9.15s
响应时间(最大)97.15s
响应时间(总计)137.18s
…
|
- 总测试数
- 22
- 错误测试数
- 16
- 尝试通过率
- 34.9%
- 输入令牌
- 101,504
- 输出令牌
- 22,992
- 推理令牌
- 0
- 响应时间(平均)
- 9.15s
- 响应时间(总计)
- 137.18s
- 响应时间(最大)
- 97.15s
-
反AI技巧
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)5.51s
响应时间(最大)6.59s
响应时间(总计)11.02s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.54s
响应时间(最大)5.57s
响应时间(总计)7.62s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)50.18s
响应时间(最大)97.15s
响应时间(总计)100.36s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.82s
响应时间(最大)4.82s
响应时间(总计)4.82s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)744ms
响应时间(最大)744ms
响应时间(总计)744ms
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.59s
响应时间(最大)1.59s
响应时间(总计)1.59s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)888ms
响应时间(最大)888ms
响应时间(总计)888ms
-
谜题求解
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.20s
响应时间(最大)1.27s
响应时间(总计)2.39s
-
工具调用
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.05s
响应时间(最大)7.05s
响应时间(总计)7.05s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)692ms
响应时间(最大)692ms
响应时间(总计)692ms
|
| #178#178 |
Ling-2.6-flashnone
|
4.9… |
Inclusionai |
$0.002
↑
…
|
10.68s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 无效工具调用: 3 API 错误: 2 未遵循指令: 2
响应时间(平均)10.68s
响应时间(最大)36.03s
响应时间(总计)213.51s
…
|
- 总测试数
- 22
- 错误测试数
- 16
- 尝试通过率
- 30.3%
- 输入令牌
- 114,375
- 输出令牌
- 14,903
- 推理令牌
- 0
- 响应时间(平均)
- 10.68s
- 响应时间(总计)
- 213.51s
- 响应时间(最大)
- 36.03s
-
反AI技巧
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)11.81s
响应时间(最大)16.60s
响应时间(总计)47.23s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)11.21s
响应时间(最大)11.21s
响应时间(总计)11.21s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)35.69s
响应时间(最大)36.03s
响应时间(总计)71.38s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)8.48s
响应时间(最大)12.71s
响应时间(总计)16.96s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)4.95s
响应时间(最大)7.65s
响应时间(总计)14.84s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.45s
响应时间(最大)1.45s
响应时间(总计)1.45s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.52s
响应时间(最大)8.19s
响应时间(总计)11.04s
-
谜题求解
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)6.51s
响应时间(最大)17.06s
响应时间(总计)19.54s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)18.80s
响应时间(最大)18.80s
响应时间(总计)18.80s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.06s
响应时间(最大)1.06s
响应时间(总计)1.06s
|
| #170#170 |
GLM 5 Turbonone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.1… |
Z.ai |
$0.047
↑
…
|
2.82s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 2
响应时间(平均)2.82s
响应时间(最大)8.21s
响应时间(总计)59.29s
…
|
- 总测试数
- 21
- 错误测试数
- 15
- 尝试通过率
- 30.3%
- 输入令牌
- 32,525
- 输出令牌
- 1,815
- 推理令牌
- 0
- 响应时间(平均)
- 2.82s
- 响应时间(总计)
- 59.29s
- 响应时间(最大)
- 8.21s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.84s
响应时间(最大)4.15s
响应时间(总计)11.35s
-
编程
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.41s
响应时间(最大)3.93s
响应时间(总计)7.22s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.89s
响应时间(最大)4.89s
响应时间(总计)4.89s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.47s
响应时间(最大)2.48s
响应时间(总计)4.95s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.97s
响应时间(最大)2.65s
响应时间(总计)5.92s
-
通用智能
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.18s
响应时间(最大)2.18s
响应时间(总计)2.18s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.13s
响应时间(最大)2.53s
响应时间(总计)4.27s
-
谜题求解
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.65s
响应时间(最大)3.34s
响应时间(总计)7.94s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.21s
响应时间(最大)8.21s
响应时间(总计)8.21s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.37s
响应时间(最大)2.37s
响应时间(总计)2.37s
|
| #195#195 |
Elephant Alphamedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.3… |
Openrouter |
$0.000
…
|
1.27s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 API 错误: 3 未遵循指令: 2 无效工具调用: 1
响应时间(平均)1.27s
响应时间(最大)3.70s
响应时间(总计)22.82s
…
|
- 总测试数
- 21
- 错误测试数
- 15
- 尝试通过率
- 28.8%
- 输入令牌
- 33,744
- 输出令牌
- 2,596
- 推理令牌
- 0
- 响应时间(平均)
- 1.27s
- 响应时间(总计)
- 22.82s
- 响应时间(最大)
- 3.70s
-
反AI技巧
: 6.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.19s
响应时间(最大)2.04s
响应时间(总计)4.75s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2 答案错误: 1
响应时间(平均)1.30s
响应时间(最大)1.30s
响应时间(总计)1.30s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.70s
响应时间(最大)3.70s
响应时间(总计)3.70s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)979ms
响应时间(最大)1.02s
响应时间(总计)1.96s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)925ms
响应时间(最大)1.16s
响应时间(总计)2.77s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)920ms
响应时间(最大)920ms
响应时间(总计)920ms
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)987ms
响应时间(最大)1.13s
响应时间(总计)1.97s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)868ms
响应时间(最大)972ms
响应时间(总计)2.60s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)2.83s
响应时间(最大)2.83s
响应时间(总计)2.83s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #198#198 |
Laguna Xs.2medium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.1… |
Poolside |
$0.015
↕
…
|
6.73s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 API 错误: 4 无答案: 2 无效工具调用: 1
响应时间(平均)6.73s
响应时间(最大)29.11s
响应时间(总计)100.98s
…
|
- 总测试数
- 19
- 错误测试数
- 13
- 尝试通过率
- 43.9%
- 输入令牌
- 39,481
- 输出令牌
- 54,218
- 推理令牌
- 0
- 响应时间(平均)
- 6.73s
- 响应时间(总计)
- 100.98s
- 响应时间(最大)
- 29.11s
-
反AI技巧
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)2.68s
响应时间(最大)3.09s
响应时间(总计)8.04s
-
编程
: 2.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)14.36s
响应时间(最大)14.36s
响应时间(总计)14.36s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)15.92s
响应时间(最大)15.92s
响应时间(总计)15.92s
-
数据解析与提取
: 7.1
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)9.34s
响应时间(最大)16.71s
响应时间(总计)18.68s
-
领域专项
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)11.12s
响应时间(最大)29.11s
响应时间(总计)33.35s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.68s
响应时间(最大)2.03s
响应时间(总计)3.36s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)1.93s
响应时间(最大)1.97s
响应时间(总计)3.87s
-
工具调用
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)3.39s
响应时间(最大)3.39s
响应时间(总计)3.39s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #206#206 |
gpt-oss-120bnone
|
3.7… |
OpenAI |
$0.010
↓
…
|
21.61s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 API 错误: 3 未遵循指令: 2
响应时间(平均)21.61s
响应时间(最大)113.71s
响应时间(总计)345.79s
…
|
- 总测试数
- 19
- 错误测试数
- 13
- 尝试通过率
- 33.3%
- 输入令牌
- 9,081
- 输出令牌
- 51,664
- 推理令牌
- 0
- 响应时间(平均)
- 21.61s
- 响应时间(总计)
- 345.79s
- 响应时间(最大)
- 113.71s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)32.84s
响应时间(最大)113.71s
响应时间(总计)131.35s
-
编程
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.57s
响应时间(最大)9.57s
响应时间(总计)9.57s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)7.12s
响应时间(最大)7.12s
响应时间(总计)7.12s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)34.98s
响应时间(最大)68.97s
响应时间(总计)104.94s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.79s
响应时间(最大)10.79s
响应时间(总计)10.79s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.06s
响应时间(最大)5.85s
响应时间(总计)10.12s
-
谜题求解
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)8.21s
响应时间(最大)11.82s
响应时间(总计)24.62s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)47.29s
响应时间(最大)47.29s
响应时间(总计)47.29s
|
| #111#111 |
LongCat 2.0none
|
6.3… |
Meituan |
$0.044
…
|
5.18s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 额外格式: 1
响应时间(平均)5.18s
响应时间(最大)48.38s
响应时间(总计)113.95s
…
|
- 总测试数
- 22
- 错误测试数
- 15
- 尝试通过率
- 36.4%
- 输入令牌
- 108,743
- 输出令牌
- 9,372
- 推理令牌
- 0
- 响应时间(平均)
- 5.18s
- 响应时间(总计)
- 113.95s
- 响应时间(最大)
- 48.38s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.87s
响应时间(最大)5.35s
响应时间(总计)11.47s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.85s
响应时间(最大)4.99s
响应时间(总计)8.54s
-
综合
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)28.45s
响应时间(最大)48.38s
响应时间(总计)56.89s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.36s
响应时间(最大)2.56s
响应时间(总计)4.72s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.72s
响应时间(最大)1.79s
响应时间(总计)5.16s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.76s
响应时间(最大)2.76s
响应时间(总计)2.76s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.82s
响应时间(最大)3.85s
响应时间(总计)5.64s
-
谜题求解
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1
响应时间(平均)2.74s
响应时间(最大)2.89s
响应时间(总计)8.21s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.64s
响应时间(最大)6.64s
响应时间(总计)6.64s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.92s
响应时间(最大)3.92s
响应时间(总计)3.92s
|
| #124#124 |
Qwen3.6 Flashnone
|
6.1… |
Qwen |
$0.062
↓
…
|
3.74s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 无效工具调用: 2 未遵循指令: 1
响应时间(平均)3.74s
响应时间(最大)48.79s
响应时间(总计)82.38s
…
|
- 总测试数
- 22
- 错误测试数
- 15
- 尝试通过率
- 34.9%
- 输入令牌
- 139,788
- 输出令牌
- 30,947
- 推理令牌
- 0
- 响应时间(平均)
- 3.74s
- 响应时间(总计)
- 82.38s
- 响应时间(最大)
- 48.79s
-
反AI技巧
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.63s
响应时间(最大)4.60s
响应时间(总计)6.51s
-
编程
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.79s
响应时间(最大)2.46s
响应时间(总计)5.36s
-
综合
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)26.50s
响应时间(最大)48.79s
响应时间(总计)53.01s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.13s
响应时间(最大)3.35s
响应时间(总计)4.26s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.11s
响应时间(最大)1.89s
响应时间(总计)3.32s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)947ms
响应时间(最大)947ms
响应时间(总计)947ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.10s
响应时间(最大)1.36s
响应时间(总计)2.19s
-
谜题求解
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.21s
响应时间(最大)1.80s
响应时间(总计)3.64s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.49s
响应时间(最大)2.49s
响应时间(总计)2.49s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)649ms
响应时间(最大)649ms
响应时间(总计)649ms
|
| #127#127 |
Qwen3.5-35B-A3Bnone
|
6.1… |
Qwen |
$0.106
↓
…
|
12.72s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 未遵循指令: 2 无效工具调用: 1
响应时间(平均)12.72s
响应时间(最大)209.15s
响应时间(总计)279.90s
…
|
- 总测试数
- 22
- 错误测试数
- 15
- 尝试通过率
- 43.9%
- 输入令牌
- 134,521
- 输出令牌
- 86,614
- 推理令牌
- 0
- 响应时间(平均)
- 12.72s
- 响应时间(总计)
- 279.90s
- 响应时间(最大)
- 209.15s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.43s
响应时间(最大)4.39s
响应时间(总计)5.71s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.39s
响应时间(最大)2.67s
响应时间(总计)4.18s
-
综合
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)128.29s
响应时间(最大)209.15s
响应时间(总计)256.58s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.16s
响应时间(最大)1.42s
响应时间(总计)2.33s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)485ms
响应时间(最大)549ms
响应时间(总计)1.45s
-
通用智能
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.19s
响应时间(最大)1.19s
响应时间(总计)1.19s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)809ms
响应时间(最大)983ms
响应时间(总计)1.62s
-
谜题求解
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.35s
响应时间(最大)2.26s
响应时间(总计)4.05s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.30s
响应时间(最大)2.30s
响应时间(总计)2.30s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)493ms
响应时间(最大)493ms
响应时间(总计)493ms
|
| #138#138 |
Kimi K2.6none
|
5.8… |
Moonshot AI |
$0.184
↓
…
|
19.58s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 3 无答案: 1
响应时间(平均)19.58s
响应时间(最大)238.89s
响应时间(总计)430.85s
…
|
- 总测试数
- 22
- 错误测试数
- 15
- 尝试通过率
- 34.9%
- 输入令牌
- 116,970
- 输出令牌
- 30,253
- 推理令牌
- 0
- 响应时间(平均)
- 19.58s
- 响应时间(总计)
- 430.85s
- 响应时间(最大)
- 238.89s
-
反AI技巧
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.39s
响应时间(最大)2.96s
响应时间(总计)5.56s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)82.57s
响应时间(最大)238.89s
响应时间(总计)247.72s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)77.83s
响应时间(最大)152.28s
响应时间(总计)155.66s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.32s
响应时间(最大)1.39s
响应时间(总计)2.64s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.48s
响应时间(最大)1.85s
响应时间(总计)4.45s
-
通用智能
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.55s
响应时间(最大)1.55s
响应时间(总计)1.55s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.64s
响应时间(最大)1.80s
响应时间(总计)3.28s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.40s
响应时间(最大)1.81s
响应时间(总计)4.19s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.46s
响应时间(最大)4.46s
响应时间(总计)4.46s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.36s
响应时间(最大)1.36s
响应时间(总计)1.36s
|
| #139#139 |
GPT-5.4none
|
5.8… |
OpenAI |
$0.397
…
|
2.07s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 未遵循指令: 1
响应时间(平均)2.07s
响应时间(最大)15.63s
响应时间(总计)45.51s
…
|
- 总测试数
- 22
- 错误测试数
- 15
- 尝试通过率
- 34.9%
- 输入令牌
- 108,632
- 输出令牌
- 8,321
- 推理令牌
- 0
- 响应时间(平均)
- 2.07s
- 响应时间(总计)
- 45.51s
- 响应时间(最大)
- 15.63s
-
反AI技巧
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.21s
响应时间(最大)2.58s
响应时间(总计)4.85s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.62s
响应时间(最大)2.95s
响应时间(总计)4.85s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)9.26s
响应时间(最大)15.63s
响应时间(总计)18.52s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.04s
响应时间(最大)1.06s
响应时间(总计)2.08s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.07s
响应时间(最大)1.54s
响应时间(总计)3.22s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.78s
响应时间(最大)1.78s
响应时间(总计)1.78s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.07s
响应时间(最大)1.17s
响应时间(总计)2.15s
-
谜题求解
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.44s
响应时间(最大)1.82s
响应时间(总计)4.33s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.75s
响应时间(最大)2.75s
响应时间(总计)2.75s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)990ms
响应时间(最大)990ms
响应时间(总计)990ms
|
| #144#144 |
KAT-Coder-Air V2.5high
|
5.6… |
Kwaipilot |
$0.077
…
|
15.90s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 API 错误: 3 额外格式: 3
响应时间(平均)15.90s
响应时间(最大)118.35s
响应时间(总计)349.71s
…
|
- 总测试数
- 22
- 错误测试数
- 15
- 尝试通过率
- 43.9%
- 输入令牌
- 50,470
- 输出令牌
- 3,957
- 推理令牌
- 111,374
- 响应时间(平均)
- 15.90s
- 响应时间(总计)
- 349.71s
- 响应时间(最大)
- 118.35s
-
反AI技巧
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)2.49s
响应时间(最大)3.97s
响应时间(总计)9.97s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 额外格式: 1 答案错误: 1
响应时间(平均)39.07s
响应时间(最大)104.98s
响应时间(总计)117.21s
-
综合
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)74.48s
响应时间(最大)118.35s
响应时间(总计)148.95s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.59s
响应时间(最大)4.92s
响应时间(总计)7.18s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 答案错误: 1
响应时间(平均)7.47s
响应时间(最大)8.71s
响应时间(总计)22.40s
-
通用智能
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.10s
响应时间(最大)7.10s
响应时间(总计)7.10s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.51s
响应时间(最大)1.91s
响应时间(总计)3.01s
-
谜题求解
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.47s
响应时间(最大)2.86s
响应时间(总计)7.40s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.77s
响应时间(最大)4.77s
响应时间(总计)4.77s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)21.72s
响应时间(最大)21.72s
响应时间(总计)21.72s
|
| #151#151 |
GLM 5.1none
|
5.5… |
Z.ai |
$0.164
↓
…
|
6.70s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 无效工具调用: 1 无答案: 1
响应时间(平均)6.70s
响应时间(最大)61.20s
响应时间(总计)147.38s
…
|
- 总测试数
- 22
- 错误测试数
- 15
- 尝试通过率
- 40.9%
- 输入令牌
- 124,209
- 输出令牌
- 14,393
- 推理令牌
- 0
- 响应时间(平均)
- 6.70s
- 响应时间(总计)
- 147.38s
- 响应时间(最大)
- 61.20s
-
反AI技巧
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.11s
响应时间(最大)3.94s
响应时间(总计)8.46s
-
编程
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)4.96s
响应时间(最大)9.79s
响应时间(总计)14.89s
-
综合
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 无答案: 1
响应时间(平均)46.88s
响应时间(最大)61.20s
响应时间(总计)93.77s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.08s
响应时间(最大)1.62s
响应时间(总计)2.15s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.99s
响应时间(最大)3.99s
响应时间(总计)5.98s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)790ms
响应时间(最大)790ms
响应时间(总计)790ms
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.98s
响应时间(最大)2.28s
响应时间(总计)3.97s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.45s
响应时间(最大)2.09s
响应时间(总计)4.36s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.68s
响应时间(最大)10.68s
响应时间(总计)10.68s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.34s
响应时间(最大)2.34s
响应时间(总计)2.34s
|
| #152#152 |
Qwen3.6 27Bnone
|
5.5… |
Qwen |
$0.087
↑
…
|
10.65s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 2 无效工具调用: 2
响应时间(平均)10.65s
响应时间(最大)156.31s
响应时间(总计)234.39s
…
|
- 总测试数
- 22
- 错误测试数
- 15
- 尝试通过率
- 45.5%
- 输入令牌
- 95,796
- 输出令牌
- 16,155
- 推理令牌
- 0
- 响应时间(平均)
- 10.65s
- 响应时间(总计)
- 234.39s
- 响应时间(最大)
- 156.31s
-
反AI技巧
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.83s
响应时间(最大)7.62s
响应时间(总计)11.33s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.16s
响应时间(最大)10.18s
响应时间(总计)12.49s
-
综合
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)83.13s
响应时间(最大)156.31s
响应时间(总计)166.26s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.06s
响应时间(最大)2.39s
响应时间(总计)4.11s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.03s
响应时间(最大)4.83s
响应时间(总计)9.08s
-
通用智能
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.07s
响应时间(最大)1.07s
响应时间(总计)1.07s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.92s
响应时间(最大)1.94s
响应时间(总计)3.83s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)5.15s
响应时间(最大)11.82s
响应时间(总计)15.45s
-
工具调用
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.74s
响应时间(最大)6.74s
响应时间(总计)6.74s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.03s
响应时间(最大)4.03s
响应时间(总计)4.03s
|
| #158#158 |
KAT-Coder-Air V2.5low
|
5.4… |
Kwaipilot |
$0.041
…
|
10.09s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 额外格式: 4 API 错误: 2 未遵循指令: 2
响应时间(平均)10.09s
响应时间(最大)86.23s
响应时间(总计)222.03s
…
|
- 总测试数
- 22
- 错误测试数
- 15
- 尝试通过率
- 45.5%
- 输入令牌
- 61,085
- 输出令牌
- 5,905
- 推理令牌
- 46,990
- 响应时间(平均)
- 10.09s
- 响应时间(总计)
- 222.03s
- 响应时间(最大)
- 86.23s
-
反AI技巧
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.50s
响应时间(最大)5.89s
响应时间(总计)13.99s
-
编程
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 答案错误: 1
响应时间(平均)11.06s
响应时间(最大)14.01s
响应时间(总计)33.18s
-
综合
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)55.86s
响应时间(最大)86.23s
响应时间(总计)111.72s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.82s
响应时间(最大)3.26s
响应时间(总计)5.64s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 API 错误: 1
响应时间(平均)4.99s
响应时间(最大)8.65s
响应时间(总计)14.97s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)10.11s
响应时间(最大)10.11s
响应时间(总计)10.11s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.64s
响应时间(最大)2.19s
响应时间(总计)3.28s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.57s
响应时间(最大)1.86s
响应时间(总计)4.71s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.47s
响应时间(最大)4.47s
响应时间(总计)4.47s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)19.98s
响应时间(最大)19.98s
响应时间(总计)19.98s
|
| #147#147 |
Mimo V2 PROnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.6… |
Xiaomi |
$0.045
↓
…
|
2.27s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 2 API 错误: 1
响应时间(平均)2.27s
响应时间(最大)6.58s
响应时间(总计)45.50s
…
|
- 总测试数
- 21
- 错误测试数
- 14
- 尝试通过率
- 39.4%
- 输入令牌
- 39,344
- 输出令牌
- 2,352
- 推理令牌
- 0
- 响应时间(平均)
- 2.27s
- 响应时间(总计)
- 45.50s
- 响应时间(最大)
- 6.58s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.80s
响应时间(最大)2.62s
响应时间(总计)7.19s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)2.65s
响应时间(最大)3.82s
响应时间(总计)5.30s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.58s
响应时间(最大)6.58s
响应时间(总计)6.58s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.39s
响应时间(最大)1.42s
响应时间(总计)2.78s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.78s
响应时间(最大)2.49s
响应时间(总计)5.34s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.44s
响应时间(最大)2.44s
响应时间(总计)2.44s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.51s
响应时间(最大)2.95s
响应时间(总计)5.02s
-
谜题求解
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.61s
响应时间(最大)2.15s
响应时间(总计)4.83s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.39s
响应时间(最大)4.39s
响应时间(总计)4.39s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.63s
响应时间(最大)1.63s
响应时间(总计)1.63s
|
| #148#148 |
Owl Alphanone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.6… |
Openrouter |
$0.000
…
|
9.88s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 3 额外格式: 1
响应时间(平均)9.88s
响应时间(最大)47.10s
响应时间(总计)207.38s
…
|
- 总测试数
- 21
- 错误测试数
- 14
- 尝试通过率
- 34.9%
- 输入令牌
- 42,283
- 输出令牌
- 5,913
- 推理令牌
- 0
- 响应时间(平均)
- 9.88s
- 响应时间(总计)
- 207.38s
- 响应时间(最大)
- 47.10s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)2.78s
响应时间(最大)3.09s
响应时间(总计)11.10s
-
编程
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)36.89s
响应时间(最大)47.10s
响应时间(总计)110.66s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)21.74s
响应时间(最大)21.74s
响应时间(总计)21.74s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.60s
响应时间(最大)3.92s
响应时间(总计)7.19s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.00s
响应时间(最大)4.69s
响应时间(总计)8.99s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.61s
响应时间(最大)4.61s
响应时间(总计)4.61s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.63s
响应时间(最大)2.77s
响应时间(总计)5.27s
-
谜题求解
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)4.18s
响应时间(最大)8.27s
响应时间(总计)12.54s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)22.78s
响应时间(最大)22.78s
响应时间(总计)22.78s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.50s
响应时间(最大)2.50s
响应时间(总计)2.50s
|
| #188#188 |
Cobuddymedium
|
4.7… |
Baidu |
$0.000
…
|
39.90s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 3 API 错误: 1 无效工具调用: 1
响应时间(平均)39.90s
响应时间(最大)309.02s
响应时间(总计)797.98s
…
|
- 总测试数
- 21
- 错误测试数
- 14
- 尝试通过率
- 45.5%
- 输入令牌
- 37,449
- 输出令牌
- 1,677
- 推理令牌
- 116,703
- 响应时间(平均)
- 39.90s
- 响应时间(总计)
- 797.98s
- 响应时间(最大)
- 309.02s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.00s
响应时间(最大)11.53s
响应时间(总计)39.99s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 未遵循指令: 1 答案错误: 1
响应时间(平均)79.17s
响应时间(最大)104.76s
响应时间(总计)158.35s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)47.38s
响应时间(最大)47.38s
响应时间(总计)47.38s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.36s
响应时间(最大)26.57s
响应时间(总计)34.71s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)128.15s
响应时间(最大)309.02s
响应时间(总计)384.46s
-
通用智能
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)23.23s
响应时间(最大)23.23s
响应时间(总计)23.23s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.60s
响应时间(最大)14.49s
响应时间(总计)23.20s
-
谜题求解
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)12.83s
响应时间(最大)24.40s
响应时间(总计)38.49s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.19s
响应时间(最大)11.19s
响应时间(总计)11.19s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)36.98s
响应时间(最大)36.98s
响应时间(总计)36.98s
|
| #191#191 |
Grok 4.20 Betanone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.4… |
X AI |
$0.087
↓
…
|
1.19s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 1 无效工具调用: 1
响应时间(平均)1.19s
响应时间(最大)6.48s
响应时间(总计)21.43s
…
|
- 总测试数
- 18
- 错误测试数
- 12
- 尝试通过率
- 30.3%
- 输入令牌
- 40,597
- 输出令牌
- 1,657
- 推理令牌
- 0
- 响应时间(平均)
- 1.19s
- 响应时间(总计)
- 21.43s
- 响应时间(最大)
- 6.48s
-
反AI技巧
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)597ms
响应时间(最大)866ms
响应时间(总计)2.39s
-
编程
: 1.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.14s
响应时间(最大)1.14s
响应时间(总计)1.14s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)6.48s
响应时间(最大)6.48s
响应时间(总计)6.48s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)601ms
响应时间(最大)634ms
响应时间(总计)1.20s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)611ms
响应时间(最大)616ms
响应时间(总计)1.83s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)541ms
响应时间(最大)541ms
响应时间(总计)541ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)649ms
响应时间(最大)952ms
响应时间(总计)1.30s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)586ms
响应时间(最大)813ms
响应时间(总计)1.76s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.79s
响应时间(最大)4.79s
响应时间(总计)4.79s
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #196#196 |
Hunter Alphanone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.2… |
OpenRouter |
$0.000
…
|
4.70s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 2 API 错误: 1
响应时间(平均)4.70s
响应时间(最大)15.17s
响应时间(总计)79.86s
…
|
- 总测试数
- 18
- 错误测试数
- 12
- 尝试通过率
- 37.9%
- 输入令牌
- 34,329
- 输出令牌
- 2,264
- 推理令牌
- 0
- 响应时间(平均)
- 4.70s
- 响应时间(总计)
- 79.86s
- 响应时间(最大)
- 15.17s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)3.81s
响应时间(最大)6.85s
响应时间(总计)15.23s
-
编程
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)15.17s
响应时间(最大)15.17s
响应时间(总计)15.17s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.49s
响应时间(最大)14.02s
响应时间(总计)16.98s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.33s
响应时间(最大)2.94s
响应时间(总计)6.99s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.71s
响应时间(最大)2.71s
响应时间(总计)2.71s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.82s
响应时间(最大)2.92s
响应时间(总计)5.65s
-
谜题求解
: 5.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)3.71s
响应时间(最大)5.43s
响应时间(总计)11.13s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.02s
响应时间(最大)6.02s
响应时间(总计)6.02s
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #197#197 |
Grok 4.20none
|
4.1… |
X AI |
$0.057
↓
…
|
1.11s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 额外格式: 1 无效工具调用: 1
响应时间(平均)1.11s
响应时间(最大)6.04s
响应时间(总计)19.96s
…
|
- 总测试数
- 18
- 错误测试数
- 12
- 尝试通过率
- 27.3%
- 输入令牌
- 41,313
- 输出令牌
- 1,923
- 推理令牌
- 0
- 响应时间(平均)
- 1.11s
- 响应时间(总计)
- 19.96s
- 响应时间(最大)
- 6.04s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)501ms
响应时间(最大)839ms
响应时间(总计)2.01s
-
编程
: 1.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.22s
响应时间(最大)1.22s
响应时间(总计)1.22s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)6.04s
响应时间(最大)6.04s
响应时间(总计)6.04s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)522ms
响应时间(最大)537ms
响应时间(总计)1.04s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1
响应时间(平均)687ms
响应时间(最大)821ms
响应时间(总计)2.06s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)659ms
响应时间(最大)659ms
响应时间(总计)659ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)445ms
响应时间(最大)505ms
响应时间(总计)889ms
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)473ms
响应时间(最大)502ms
响应时间(总计)1.42s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.63s
响应时间(最大)4.63s
响应时间(总计)4.63s
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #103#103 |
Qwen3.5-27Bnone
|
6.5… |
Qwen |
$0.090
↑
…
|
4.76s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 未遵循指令: 2
响应时间(平均)4.76s
响应时间(最大)69.46s
响应时间(总计)104.71s
…
|
- 总测试数
- 22
- 错误测试数
- 14
- 尝试通过率
- 40.9%
- 输入令牌
- 102,316
- 输出令牌
- 24,321
- 推理令牌
- 0
- 响应时间(平均)
- 4.76s
- 响应时间(总计)
- 104.71s
- 响应时间(最大)
- 69.46s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)788ms
响应时间(最大)1.34s
响应时间(总计)3.15s
-
编程
: 5.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.80s
响应时间(最大)2.51s
响应时间(总计)5.40s
-
综合
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)39.43s
响应时间(最大)69.46s
响应时间(总计)78.86s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.43s
响应时间(最大)1.45s
响应时间(总计)2.86s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)540ms
响应时间(最大)649ms
响应时间(总计)1.62s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.51s
响应时间(最大)2.51s
响应时间(总计)2.51s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.03s
响应时间(最大)1.40s
响应时间(总计)2.06s
-
谜题求解
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.38s
响应时间(最大)2.24s
响应时间(总计)4.13s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.54s
响应时间(最大)3.54s
响应时间(总计)3.54s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)599ms
响应时间(最大)599ms
响应时间(总计)599ms
|