| #196#196 |
Grok 4.20 Betamedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.0… |
X AI |
$0.750
↑
…
|
9.75s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)9.75s
响应时间(最大)31.36s
响应时间(总计)175.48s
…
|
- 总测试数
- 18
- 错误测试数
- 4
- 尝试通过率
- 66.7%
- 输入令牌
- 35,955
- 输出令牌
- 1,647
- 推理令牌
- 91,565
- 响应时间(平均)
- 9.75s
- 响应时间(总计)
- 175.48s
- 响应时间(最大)
- 31.36s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.16s
响应时间(最大)3.44s
响应时间(总计)12.65s
-
编程
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)31.36s
响应时间(最大)31.36s
响应时间(总计)31.36s
-
综合
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)20.93s
响应时间(最大)20.93s
响应时间(总计)20.93s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.01s
响应时间(最大)4.27s
响应时间(总计)8.02s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)21.33s
响应时间(最大)24.21s
响应时间(总计)64.00s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.78s
响应时间(最大)5.78s
响应时间(总计)5.78s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.89s
响应时间(最大)5.89s
响应时间(总计)9.78s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.52s
响应时间(最大)4.53s
响应时间(总计)10.57s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)12.39s
响应时间(最大)12.39s
响应时间(总计)12.39s
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #45#45 |
Muse Spark 1.2low
|
8.4… |
Meta |
$0.655
…
|
9.77s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 3
响应时间(平均)9.77s
响应时间(最大)47.80s
响应时间(总计)214.83s
…
|
- 总测试数
- 22
- 错误测试数
- 7
- 尝试通过率
- 77.3%
- 输入令牌
- 101,811
- 输出令牌
- 8,025
- 推理令牌
- 115,938
- 响应时间(平均)
- 9.77s
- 响应时间(总计)
- 214.83s
- 响应时间(最大)
- 47.80s
-
反AI技巧
: 9.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.26s
响应时间(最大)4.96s
响应时间(总计)13.03s
-
编程
: 8.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.09s
响应时间(最大)13.60s
响应时间(总计)30.28s
-
综合
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.03s
响应时间(最大)19.52s
响应时间(总计)34.06s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.22s
响应时间(最大)5.57s
响应时间(总计)8.44s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)28.53s
响应时间(最大)47.80s
响应时间(总计)85.59s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)8.46s
响应时间(最大)8.46s
响应时间(总计)8.46s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.95s
响应时间(最大)3.69s
响应时间(总计)5.89s
-
谜题求解
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)5.17s
响应时间(最大)7.82s
响应时间(总计)15.52s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.58s
响应时间(最大)3.58s
响应时间(总计)3.58s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.00s
响应时间(最大)10.00s
响应时间(总计)10.00s
|
| #164#164 |
Qwen3.5 Plus 2026-02-15none
|
6.6… |
Qwen |
$0.073
↓
…
|
9.86s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11
响应时间(平均)9.86s
响应时间(最大)123.00s
响应时间(总计)157.77s
…
|
- 总测试数
- 22
- 错误测试数
- 11
- 尝试通过率
- 53.0%
- 输入令牌
- 102,655
- 输出令牌
- 29,370
- 推理令牌
- 0
- 响应时间(平均)
- 9.86s
- 响应时间(总计)
- 157.77s
- 响应时间(最大)
- 123.00s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.91s
响应时间(最大)2.74s
响应时间(总计)3.82s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.05s
响应时间(最大)3.63s
响应时间(总计)6.15s
-
综合
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)64.83s
响应时间(最大)123.00s
响应时间(总计)129.66s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.89s
响应时间(最大)1.89s
响应时间(总计)1.89s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.24s
响应时间(最大)1.44s
响应时间(总计)2.48s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.26s
响应时间(最大)2.26s
响应时间(总计)2.26s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.67s
响应时间(最大)1.67s
响应时间(总计)1.67s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.71s
响应时间(最大)3.29s
响应时间(总计)5.41s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.33s
响应时间(最大)3.33s
响应时间(总计)3.33s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.11s
响应时间(最大)1.11s
响应时间(总计)1.11s
|
| #225#225 |
Owl Alphanone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.6… |
Openrouter |
$0.000
…
|
9.88s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 3 额外格式: 1
响应时间(平均)9.88s
响应时间(最大)47.10s
响应时间(总计)207.38s
…
|
- 总测试数
- 21
- 错误测试数
- 14
- 尝试通过率
- 34.9%
- 输入令牌
- 42,283
- 输出令牌
- 5,913
- 推理令牌
- 0
- 响应时间(平均)
- 9.88s
- 响应时间(总计)
- 207.38s
- 响应时间(最大)
- 47.10s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)2.78s
响应时间(最大)3.09s
响应时间(总计)11.10s
-
编程
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)36.89s
响应时间(最大)47.10s
响应时间(总计)110.66s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)21.74s
响应时间(最大)21.74s
响应时间(总计)21.74s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.60s
响应时间(最大)3.92s
响应时间(总计)7.19s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.00s
响应时间(最大)4.69s
响应时间(总计)8.99s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.61s
响应时间(最大)4.61s
响应时间(总计)4.61s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.63s
响应时间(最大)2.77s
响应时间(总计)5.27s
-
谜题求解
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)4.18s
响应时间(最大)8.27s
响应时间(总计)12.54s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)22.78s
响应时间(最大)22.78s
响应时间(总计)22.78s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.50s
响应时间(最大)2.50s
响应时间(总计)2.50s
|
| #31#31 |
Gemini 3.5 Flash Litehigh
|
8.8… |
Google |
$0.540
…
|
10.05s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5
响应时间(平均)10.05s
响应时间(最大)36.22s
响应时间(总计)221.06s
…
|
- 总测试数
- 22
- 错误测试数
- 5
- 尝试通过率
- 83.3%
- 输入令牌
- 93,046
- 输出令牌
- 5,884
- 推理令牌
- 198,741
- 响应时间(平均)
- 10.05s
- 响应时间(总计)
- 221.06s
- 响应时间(最大)
- 36.22s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.96s
响应时间(最大)5.00s
响应时间(总计)11.83s
-
编程
: 8.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)16.58s
响应时间(最大)28.69s
响应时间(总计)49.74s
-
综合
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)27.90s
响应时间(最大)34.63s
响应时间(总计)55.80s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.17s
响应时间(最大)3.27s
响应时间(总计)6.35s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)23.14s
响应时间(最大)36.22s
响应时间(总计)69.43s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.10s
响应时间(最大)3.10s
响应时间(总计)3.10s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.16s
响应时间(最大)2.17s
响应时间(总计)4.31s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.09s
响应时间(最大)2.91s
响应时间(总计)6.26s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.55s
响应时间(最大)4.55s
响应时间(总计)4.55s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.68s
响应时间(最大)9.68s
响应时间(总计)9.68s
|
| #185#185 |
Qwen3.7 Flashnone
|
6.1… |
Qwen |
$0.019
…
|
10.05s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 1 无效工具调用: 1
响应时间(平均)10.05s
响应时间(最大)186.24s
响应时间(总计)221.13s
…
|
- 总测试数
- 22
- 错误测试数
- 15
- 尝试通过率
- 36.4%
- 输入令牌
- 218,740
- 输出令牌
- 90,507
- 推理令牌
- 0
- 响应时间(平均)
- 10.05s
- 响应时间(总计)
- 221.13s
- 响应时间(最大)
- 186.24s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.55s
响应时间(最大)6.80s
响应时间(总计)10.19s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.55s
响应时间(最大)2.70s
响应时间(总计)4.65s
-
综合
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)94.59s
响应时间(最大)186.24s
响应时间(总计)189.18s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.09s
响应时间(最大)3.22s
响应时间(总计)4.18s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)814ms
响应时间(最大)979ms
响应时间(总计)2.44s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)963ms
响应时间(最大)963ms
响应时间(总计)963ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)892ms
响应时间(最大)990ms
响应时间(总计)1.78s
-
谜题求解
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.39s
响应时间(最大)2.29s
响应时间(总计)4.18s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.80s
响应时间(最大)2.80s
响应时间(总计)2.80s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)766ms
响应时间(最大)766ms
响应时间(总计)766ms
|
| #11#11 |
GPT-5.5low
|
9.3… |
OpenAI |
$1.257
…
|
10.15s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)10.15s
响应时间(最大)56.19s
响应时间(总计)223.24s
…
|
- 总测试数
- 22
- 错误测试数
- 3
- 尝试通过率
- 86.4%
- 输入令牌
- 80,067
- 输出令牌
- 5,378
- 推理令牌
- 23,162
- 响应时间(平均)
- 10.15s
- 响应时间(总计)
- 223.24s
- 响应时间(最大)
- 56.19s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.41s
响应时间(最大)6.32s
响应时间(总计)17.64s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.04s
响应时间(最大)21.06s
响应时间(总计)45.11s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.73s
响应时间(最大)17.90s
响应时间(总计)27.46s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.28s
响应时间(最大)5.13s
响应时间(总计)6.56s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)28.19s
响应时间(最大)56.19s
响应时间(总计)84.58s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.17s
响应时间(最大)5.17s
响应时间(总计)5.17s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.74s
响应时间(最大)3.99s
响应时间(总计)7.48s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.74s
响应时间(最大)5.61s
响应时间(总计)14.21s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.96s
响应时间(最大)4.96s
响应时间(总计)4.96s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.06s
响应时间(最大)10.06s
响应时间(总计)10.06s
|
| #139#139 |
Gemini 3.5 Flashnone
|
6.9… |
Google |
$1.093
…
|
10.18s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 4 答案错误: 4
响应时间(平均)10.18s
响应时间(最大)64.36s
响应时间(总计)183.29s
…
|
- 总测试数
- 22
- 错误测试数
- 8
- 尝试通过率
- 69.7%
- 输入令牌
- 13,852
- 输出令牌
- 119,100
- 推理令牌
- 0
- 响应时间(平均)
- 10.18s
- 响应时间(总计)
- 183.29s
- 响应时间(最大)
- 64.36s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.53s
响应时间(最大)3.43s
响应时间(总计)10.12s
-
编程
: 8.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)34.69s
响应时间(最大)64.36s
响应时间(总计)104.06s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)8.10s
响应时间(最大)8.10s
响应时间(总计)8.10s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)12.18s
响应时间(最大)14.00s
响应时间(总计)36.54s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.46s
响应时间(最大)3.46s
响应时间(总计)3.46s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.38s
响应时间(最大)3.40s
响应时间(总计)6.76s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.13s
响应时间(最大)3.33s
响应时间(总计)9.39s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.87s
响应时间(最大)4.87s
响应时间(总计)4.87s
|
| #16#16 |
Claude Opus 5medium
|
9.2… |
Anthropic |
$1.586
…
|
10.26s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 无答案: 1
响应时间(平均)10.26s
响应时间(最大)35.43s
响应时间(总计)225.66s
…
|
- 总测试数
- 22
- 错误测试数
- 4
- 尝试通过率
- 83.3%
- 输入令牌
- 135,604
- 输出令牌
- 23,814
- 推理令牌
- 12,804
- 响应时间(平均)
- 10.26s
- 响应时间(总计)
- 225.66s
- 响应时间(最大)
- 35.43s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.46s
响应时间(最大)9.44s
响应时间(总计)21.82s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.56s
响应时间(最大)13.54s
响应时间(总计)28.69s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.89s
响应时间(最大)35.05s
响应时间(总计)47.78s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.92s
响应时间(最大)4.28s
响应时间(总计)7.83s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)26.35s
响应时间(最大)35.43s
响应时间(总计)79.04s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.56s
响应时间(最大)3.56s
响应时间(总计)3.56s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.16s
响应时间(最大)4.89s
响应时间(总计)8.32s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.27s
响应时间(最大)5.00s
响应时间(总计)12.82s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.76s
响应时间(最大)8.76s
响应时间(总计)8.76s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)7.03s
响应时间(最大)7.03s
响应时间(总计)7.03s
|
| #277#277 |
Hunter Alphamedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.7… |
OpenRouter |
$0.000
…
|
10.33s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 2 超时: 2 API 错误: 1 额外格式: 1
响应时间(平均)10.33s
响应时间(最大)30.53s
响应时间(总计)175.58s
…
|
- 总测试数
- 18
- 错误测试数
- 10
- 尝试通过率
- 53.0%
- 输入令牌
- 28,927
- 输出令牌
- 4,682
- 推理令牌
- 17,969
- 响应时间(平均)
- 10.33s
- 响应时间(总计)
- 175.58s
- 响应时间(最大)
- 30.53s
-
反AI技巧
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.75s
响应时间(最大)7.62s
响应时间(总计)19.00s
-
编程
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 2.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)30.53s
响应时间(最大)30.53s
响应时间(总计)30.53s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.16s
响应时间(最大)26.55s
响应时间(总计)46.33s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 超时: 1 答案错误: 1
响应时间(平均)10.52s
响应时间(最大)18.68s
响应时间(总计)31.56s
-
通用智能
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)6.44s
响应时间(最大)6.44s
响应时间(总计)6.44s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.18s
响应时间(最大)4.46s
响应时间(总计)8.36s
-
谜题求解
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)5.35s
响应时间(最大)6.20s
响应时间(总计)16.06s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.33s
响应时间(最大)17.33s
响应时间(总计)17.33s
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #136#136 |
Claude Fable 5.1low
|
6.9… |
Anthropic |
$2.565
…
|
10.33s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 4 答案错误: 4 未遵循指令: 3
响应时间(平均)10.33s
响应时间(最大)33.10s
响应时间(总计)227.37s
…
|
- 总测试数
- 22
- 错误测试数
- 11
- 尝试通过率
- 56.1%
- 输入令牌
- 134,582
- 输出令牌
- 8,955
- 推理令牌
- 15,420
- 响应时间(平均)
- 10.33s
- 响应时间(总计)
- 227.37s
- 响应时间(最大)
- 33.10s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2
响应时间(平均)4.54s
响应时间(最大)4.91s
响应时间(总计)18.16s
-
编程
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2 额外格式: 1
响应时间(平均)6.75s
响应时间(最大)7.70s
响应时间(总计)20.24s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)29.40s
响应时间(最大)33.10s
响应时间(总计)58.80s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.71s
响应时间(最大)4.86s
响应时间(总计)9.43s
-
领域专项
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)19.30s
响应时间(最大)19.72s
响应时间(总计)57.90s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.62s
响应时间(最大)5.62s
响应时间(总计)5.62s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)5.24s
响应时间(最大)5.70s
响应时间(总计)10.49s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.78s
响应时间(最大)5.07s
响应时间(总计)14.33s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.22s
响应时间(最大)13.22s
响应时间(总计)13.22s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)19.18s
响应时间(最大)19.18s
响应时间(总计)19.18s
|
| #229#229 |
Qwen3.6 27Bnone
|
5.5… |
Qwen |
$0.116
↑
…
|
10.62s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 2 无效工具调用: 2
响应时间(平均)10.62s
响应时间(最大)156.31s
响应时间(总计)233.68s
…
|
- 总测试数
- 22
- 错误测试数
- 15
- 尝试通过率
- 45.5%
- 输入令牌
- 95,805
- 输出令牌
- 16,156
- 推理令牌
- 0
- 响应时间(平均)
- 10.62s
- 响应时间(总计)
- 233.68s
- 响应时间(最大)
- 156.31s
-
反AI技巧
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.83s
响应时间(最大)7.62s
响应时间(总计)11.33s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.16s
响应时间(最大)10.18s
响应时间(总计)12.49s
-
综合
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)83.13s
响应时间(最大)156.31s
响应时间(总计)166.26s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.06s
响应时间(最大)2.39s
响应时间(总计)4.11s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.79s
响应时间(最大)4.83s
响应时间(总计)8.37s
-
通用智能
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.07s
响应时间(最大)1.07s
响应时间(总计)1.07s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.92s
响应时间(最大)1.94s
响应时间(总计)3.83s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)5.15s
响应时间(最大)11.82s
响应时间(总计)15.45s
-
工具调用
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.74s
响应时间(最大)6.74s
响应时间(总计)6.74s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.03s
响应时间(最大)4.03s
响应时间(总计)4.03s
|
| #235#235 |
KAT-Coder-Air V2.5low
|
5.4… |
Kwaipilot |
$0.046
…
|
10.63s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 额外格式: 4 API 错误: 2 未遵循指令: 2
响应时间(平均)10.63s
响应时间(最大)86.23s
响应时间(总计)233.77s
…
|
- 总测试数
- 22
- 错误测试数
- 15
- 尝试通过率
- 43.9%
- 输入令牌
- 61,094
- 输出令牌
- 6,532
- 推理令牌
- 53,882
- 响应时间(平均)
- 10.63s
- 响应时间(总计)
- 233.77s
- 响应时间(最大)
- 86.23s
-
反AI技巧
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.50s
响应时间(最大)5.89s
响应时间(总计)13.99s
-
编程
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 答案错误: 1
响应时间(平均)11.06s
响应时间(最大)14.01s
响应时间(总计)33.18s
-
综合
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)55.86s
响应时间(最大)86.23s
响应时间(总计)111.72s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.82s
响应时间(最大)3.26s
响应时间(总计)5.64s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 API 错误: 1
响应时间(平均)8.91s
响应时间(最大)13.68s
响应时间(总计)26.72s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)10.11s
响应时间(最大)10.11s
响应时间(总计)10.11s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.64s
响应时间(最大)2.19s
响应时间(总计)3.28s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.57s
响应时间(最大)1.86s
响应时间(总计)4.71s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.47s
响应时间(最大)4.47s
响应时间(总计)4.47s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)19.98s
响应时间(最大)19.98s
响应时间(总计)19.98s
|
| #266#266 |
Ling-2.6-flashnone
|
4.9… |
Inclusionai |
$0.002
↑
…
|
10.71s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 无效工具调用: 3 API 错误: 2 未遵循指令: 2
响应时间(平均)10.71s
响应时间(最大)36.03s
响应时间(总计)214.28s
…
|
- 总测试数
- 22
- 错误测试数
- 16
- 尝试通过率
- 30.3%
- 输入令牌
- 114,384
- 输出令牌
- 14,903
- 推理令牌
- 0
- 响应时间(平均)
- 10.71s
- 响应时间(总计)
- 214.28s
- 响应时间(最大)
- 36.03s
-
反AI技巧
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)11.81s
响应时间(最大)16.60s
响应时间(总计)47.23s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)11.21s
响应时间(最大)11.21s
响应时间(总计)11.21s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)35.69s
响应时间(最大)36.03s
响应时间(总计)71.38s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)8.48s
响应时间(最大)12.71s
响应时间(总计)16.96s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)5.20s
响应时间(最大)7.65s
响应时间(总计)15.60s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.45s
响应时间(最大)1.45s
响应时间(总计)1.45s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.52s
响应时间(最大)8.19s
响应时间(总计)11.04s
-
谜题求解
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)6.51s
响应时间(最大)17.06s
响应时间(总计)19.54s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)18.80s
响应时间(最大)18.80s
响应时间(总计)18.80s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.06s
响应时间(最大)1.06s
响应时间(总计)1.06s
|
| #252#252 |
Mistral Small 4medium
|
5.1… |
Mistral |
$0.097
…
|
10.80s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 2 API 错误: 1 无答案: 1
响应时间(平均)10.80s
响应时间(最大)59.15s
响应时间(总计)237.60s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 43.9%
- 输入令牌
- 140,559
- 输出令牌
- 40,268
- 推理令牌
- 93,329
- 响应时间(平均)
- 10.80s
- 响应时间(总计)
- 237.60s
- 响应时间(最大)
- 59.15s
-
反AI技巧
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.67s
响应时间(最大)5.03s
响应时间(总计)10.66s
-
编程
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)39.98s
响应时间(最大)59.15s
响应时间(总计)119.95s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)32.40s
响应时间(最大)39.55s
响应时间(总计)64.80s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)1.23s
响应时间(最大)1.96s
响应时间(总计)2.46s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)6.33s
响应时间(最大)13.72s
响应时间(总计)19.00s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.05s
响应时间(最大)2.05s
响应时间(总计)2.05s
-
指令遵循
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.38s
响应时间(最大)1.61s
响应时间(总计)2.75s
-
谜题求解
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)2.17s
响应时间(最大)2.60s
响应时间(总计)6.50s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.50s
响应时间(最大)3.50s
响应时间(总计)3.50s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.92s
响应时间(最大)5.92s
响应时间(总计)5.92s
|
| #65#65 |
GPT-5.6 Terrahigh
|
8.0… |
OpenAI |
$0.836
↓
…
|
11.22s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 无效工具调用: 1
响应时间(平均)11.22s
响应时间(最大)91.49s
响应时间(总计)246.77s
…
|
- 总测试数
- 22
- 错误测试数
- 8
- 尝试通过率
- 68.2%
- 输入令牌
- 81,056
- 输出令牌
- 5,055
- 推理令牌
- 51,033
- 响应时间(平均)
- 11.22s
- 响应时间(总计)
- 246.77s
- 响应时间(最大)
- 91.49s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.54s
响应时间(最大)3.19s
响应时间(总计)10.15s
-
编程
: 7.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.14s
响应时间(最大)15.19s
响应时间(总计)27.43s
-
综合
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)13.72s
响应时间(最大)20.49s
响应时间(总计)27.43s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)938ms
响应时间(最大)1.01s
响应时间(总计)1.88s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)42.65s
响应时间(最大)91.49s
响应时间(总计)127.94s
-
通用智能
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.03s
响应时间(最大)3.03s
响应时间(总计)3.03s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.14s
响应时间(最大)2.48s
响应时间(总计)4.28s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.45s
响应时间(最大)10.40s
响应时间(总计)16.36s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.97s
响应时间(最大)4.97s
响应时间(总计)4.97s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)23.30s
响应时间(最大)23.30s
响应时间(总计)23.30s
|
| #10#10 |
GPT-5.6 Solhigh
|
9.4… |
OpenAI |
$0.446
↓
…
|
11.48s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)11.48s
响应时间(最大)54.79s
响应时间(总计)252.62s
…
|
- 总测试数
- 22
- 错误测试数
- 4
- 尝试通过率
- 89.4%
- 输入令牌
- 79,258
- 输出令牌
- 4,855
- 推理令牌
- 23,853
- 响应时间(平均)
- 11.48s
- 响应时间(总计)
- 252.62s
- 响应时间(最大)
- 54.79s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.39s
响应时间(最大)4.12s
响应时间(总计)13.56s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.52s
响应时间(最大)21.67s
响应时间(总计)37.56s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)24.99s
响应时间(最大)36.30s
响应时间(总计)49.98s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.16s
响应时间(最大)1.21s
响应时间(总计)2.32s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)37.67s
响应时间(最大)54.79s
响应时间(总计)113.00s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.40s
响应时间(最大)4.40s
响应时间(总计)4.40s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.73s
响应时间(最大)3.42s
响应时间(总计)5.46s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.10s
响应时间(最大)4.40s
响应时间(总计)12.30s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.08s
响应时间(最大)7.08s
响应时间(总计)7.08s
-
常识问答
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.97s
响应时间(最大)6.97s
响应时间(总计)6.97s
|
| #285#285 |
Laguna S 2.1none
|
4.5… |
Poolside |
$0.022
↓
…
|
11.67s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 18 未遵循指令: 1 无答案: 1
响应时间(平均)11.67s
响应时间(最大)200.52s
响应时间(总计)256.71s
…
|
- 总测试数
- 22
- 错误测试数
- 20
- 尝试通过率
- 15.2%
- 输入令牌
- 125,604
- 输出令牌
- 57,634
- 推理令牌
- 0
- 响应时间(平均)
- 11.67s
- 响应时间(总计)
- 256.71s
- 响应时间(最大)
- 200.52s
-
反AI技巧
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)835ms
响应时间(最大)2.42s
响应时间(总计)3.34s
-
编程
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)550ms
响应时间(最大)903ms
响应时间(总计)1.65s
-
综合
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)21.62s
响应时间(最大)41.14s
响应时间(总计)43.24s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)537ms
响应时间(最大)579ms
响应时间(总计)1.07s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)337ms
响应时间(最大)386ms
响应时间(总计)1.01s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)815ms
响应时间(最大)815ms
响应时间(总计)815ms
-
指令遵循
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)566ms
响应时间(最大)653ms
响应时间(总计)1.13s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)828ms
响应时间(最大)945ms
响应时间(总计)2.48s
-
工具调用
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.45s
响应时间(最大)1.45s
响应时间(总计)1.45s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)200.52s
响应时间(最大)200.52s
响应时间(总计)200.52s
|
| #53#53 |
Claude Fable 5.1medium
|
8.3… |
Anthropic |
$2.909
…
|
11.67s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 无答案: 2 额外格式: 1 未遵循指令: 1
响应时间(平均)11.67s
响应时间(最大)36.59s
响应时间(总计)256.73s
…
|
- 总测试数
- 22
- 错误测试数
- 7
- 尝试通过率
- 81.8%
- 输入令牌
- 135,112
- 输出令牌
- 7,594
- 推理令牌
- 23,558
- 响应时间(平均)
- 11.67s
- 响应时间(总计)
- 256.73s
- 响应时间(最大)
- 36.59s
-
反AI技巧
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)5.18s
响应时间(最大)6.20s
响应时间(总计)20.72s
-
编程
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)10.99s
响应时间(最大)13.14s
响应时间(总计)32.96s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)32.59s
响应时间(最大)36.59s
响应时间(总计)65.17s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.47s
响应时间(最大)4.60s
响应时间(总计)8.93s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)19.29s
响应时间(最大)23.88s
响应时间(总计)57.86s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.14s
响应时间(最大)5.14s
响应时间(总计)5.14s
-
指令遵循
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)5.77s
响应时间(最大)6.15s
响应时间(总计)11.53s
-
谜题求解
: 7.6
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)5.70s
响应时间(最大)6.78s
响应时间(总计)17.10s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.99s
响应时间(最大)12.99s
响应时间(总计)12.99s
-
常识问答
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)24.32s
响应时间(最大)24.32s
响应时间(总计)24.32s
|
| #145#145 |
DeepSeek V4 Pronone
|
6.8… |
DeepSeek |
$0.226
↑
…
|
11.71s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 2 额外格式: 1 无效工具调用: 1
响应时间(平均)11.71s
响应时间(最大)119.44s
响应时间(总计)257.67s
…
|
- 总测试数
- 22
- 错误测试数
- 13
- 尝试通过率
- 47.0%
- 输入令牌
- 148,078
- 输出令牌
- 35,547
- 推理令牌
- 0
- 响应时间(平均)
- 11.71s
- 响应时间(总计)
- 257.67s
- 响应时间(最大)
- 119.44s
-
反AI技巧
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1 未遵循指令: 1
响应时间(平均)4.02s
响应时间(最大)5.11s
响应时间(总计)16.10s
-
编程
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)13.38s
响应时间(最大)30.09s
响应时间(总计)40.15s
-
综合
: 7.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)71.59s
响应时间(最大)119.44s
响应时间(总计)143.18s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.61s
响应时间(最大)6.06s
响应时间(总计)9.23s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)4.91s
响应时间(最大)7.90s
响应时间(总计)14.73s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.05s
响应时间(最大)2.05s
响应时间(总计)2.05s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.12s
响应时间(最大)4.37s
响应时间(总计)8.24s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.61s
响应时间(最大)5.19s
响应时间(总计)10.83s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.40s
响应时间(最大)7.40s
响应时间(总计)7.40s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.76s
响应时间(最大)5.76s
响应时间(总计)5.76s
|
| #4#4 |
Gemini 3.6 Flashmedium
|
9.8… |
Google |
$0.427
↓
…
|
11.86s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)11.86s
响应时间(最大)77.15s
响应时间(总计)260.96s
…
|
- 总测试数
- 22
- 错误测试数
- 2
- 尝试通过率
- 95.5%
- 输入令牌
- 64,446
- 输出令牌
- 1,974
- 推理令牌
- 98,902
- 响应时间(平均)
- 11.86s
- 响应时间(总计)
- 260.96s
- 响应时间(最大)
- 77.15s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.54s
响应时间(最大)3.32s
响应时间(总计)10.14s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.81s
响应时间(最大)19.62s
响应时间(总计)44.42s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)49.01s
响应时间(最大)77.15s
响应时间(总计)98.03s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.92s
响应时间(最大)5.91s
响应时间(总计)9.84s
-
领域专项
: 5.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)21.99s
响应时间(最大)32.33s
响应时间(总计)65.96s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.40s
响应时间(最大)3.40s
响应时间(总计)3.40s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.82s
响应时间(最大)4.41s
响应时间(总计)7.63s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.43s
响应时间(最大)3.69s
响应时间(总计)10.29s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.78s
响应时间(最大)5.78s
响应时间(总计)5.78s
-
常识问答
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.48s
响应时间(最大)5.48s
响应时间(总计)5.48s
|
| #52#52 |
Muse Spark 1.1low
|
8.3… |
Meta |
$0.673
…
|
11.89s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 3 无效工具调用: 1
响应时间(平均)11.89s
响应时间(最大)54.15s
响应时间(总计)261.69s
…
|
- 总测试数
- 22
- 错误测试数
- 9
- 尝试通过率
- 71.2%
- 输入令牌
- 141,878
- 输出令牌
- 11,033
- 推理令牌
- 105,456
- 响应时间(平均)
- 11.89s
- 响应时间(总计)
- 261.69s
- 响应时间(最大)
- 54.15s
-
反AI技巧
: 7.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.36s
响应时间(最大)8.92s
响应时间(总计)17.45s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.34s
响应时间(最大)12.60s
响应时间(总计)31.02s
-
综合
: 6.6
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)29.45s
响应时间(最大)39.63s
响应时间(总计)58.89s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.22s
响应时间(最大)3.93s
响应时间(总计)6.45s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)32.99s
响应时间(最大)54.15s
响应时间(总计)98.96s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.12s
响应时间(最大)4.12s
响应时间(总计)4.12s
-
指令遵循
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)5.42s
响应时间(最大)6.23s
响应时间(总计)10.85s
-
谜题求解
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)6.60s
响应时间(最大)11.77s
响应时间(总计)19.81s
-
工具调用
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.98s
响应时间(最大)5.98s
响应时间(总计)5.98s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)8.17s
响应时间(最大)8.17s
响应时间(总计)8.17s
|
| #222#222 |
Owl Alphamedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
5.6… |
Openrouter |
$0.000
…
|
11.95s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 2 API 错误: 1
响应时间(平均)11.95s
响应时间(最大)58.63s
响应时间(总计)250.88s
…
|
- 总测试数
- 21
- 错误测试数
- 13
- 尝试通过率
- 37.9%
- 输入令牌
- 43,478
- 输出令牌
- 2,974
- 推理令牌
- 0
- 响应时间(平均)
- 11.95s
- 响应时间(总计)
- 250.88s
- 响应时间(最大)
- 58.63s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)3.97s
响应时间(最大)7.48s
响应时间(总计)15.89s
-
编程
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)18.74s
响应时间(最大)30.81s
响应时间(总计)56.21s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.01s
响应时间(最大)10.01s
响应时间(总计)10.01s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.64s
响应时间(最大)29.16s
响应时间(总计)43.28s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)8.58s
响应时间(最大)9.48s
响应时间(总计)25.74s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)58.63s
响应时间(最大)58.63s
响应时间(总计)58.63s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.15s
响应时间(最大)15.94s
响应时间(总计)20.30s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)3.40s
响应时间(最大)4.60s
响应时间(总计)10.19s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.26s
响应时间(最大)8.26s
响应时间(总计)8.26s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.38s
响应时间(最大)2.38s
响应时间(总计)2.38s
|
| #113#113 |
Qwen3.7 Plusnone
|
7.3… |
Qwen |
$0.106
↓
…
|
12.11s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 1
响应时间(平均)12.11s
响应时间(最大)206.03s
响应时间(总计)266.40s
…
|
- 总测试数
- 22
- 错误测试数
- 10
- 尝试通过率
- 54.6%
- 输入令牌
- 98,833
- 输出令牌
- 58,097
- 推理令牌
- 0
- 响应时间(平均)
- 12.11s
- 响应时间(总计)
- 266.40s
- 响应时间(最大)
- 206.03s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.38s
响应时间(最大)2.69s
响应时间(总计)5.51s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.15s
响应时间(最大)4.39s
响应时间(总计)6.44s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)117.70s
响应时间(最大)206.03s
响应时间(总计)235.40s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.43s
响应时间(最大)1.57s
响应时间(总计)2.86s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.04s
响应时间(最大)1.33s
响应时间(总计)3.12s
-
通用智能
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.33s
响应时间(最大)1.33s
响应时间(总计)1.33s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)929ms
响应时间(最大)1.05s
响应时间(总计)1.86s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.71s
响应时间(最大)2.65s
响应时间(总计)5.13s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.54s
响应时间(最大)3.54s
响应时间(总计)3.54s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.21s
响应时间(最大)1.21s
响应时间(总计)1.21s
|
| #3🥉 #3 |
Gemini 3.7 Flashhigh
|
9.8… |
Google |
$0.646
↑
…
|
12.22s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)12.22s
响应时间(最大)91.63s
响应时间(总计)268.78s
…
|
- 总测试数
- 22
- 错误测试数
- 2
- 尝试通过率
- 95.5%
- 输入令牌
- 86,712
- 输出令牌
- 6,017
- 推理令牌
- 148,829
- 响应时间(平均)
- 12.22s
- 响应时间(总计)
- 268.78s
- 响应时间(最大)
- 91.63s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.60s
响应时间(最大)3.06s
响应时间(总计)10.38s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.55s
响应时间(最大)19.76s
响应时间(总计)40.66s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)57.19s
响应时间(最大)91.63s
响应时间(总计)114.37s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.94s
响应时间(最大)6.31s
响应时间(总计)11.87s
-
领域专项
: 5.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)16.77s
响应时间(最大)23.97s
响应时间(总计)50.31s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.48s
响应时间(最大)3.48s
响应时间(总计)3.48s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.77s
响应时间(最大)4.34s
响应时间(总计)7.54s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.76s
响应时间(最大)3.02s
响应时间(总计)8.29s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)16.27s
响应时间(最大)16.27s
响应时间(总计)16.27s
-
常识问答
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.60s
响应时间(最大)5.60s
响应时间(总计)5.60s
|