| #241#241 |
Laguna S 2.1low
|
5.0… |
Poolside |
$0.082
↓
…
|
85.34s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 15 API 错误: 1 额外格式: 1 未遵循指令: 1 无效工具调用: 1
响应时间(平均)85.34s
响应时间(最大)814.73s
响应时间(总计)1877.49s
…
|
- 总测试数
- 22
- 错误测试数
- 19
- 尝试通过率
- 22.7%
- 输入令牌
- 118,752
- 输出令牌
- 67,823
- 推理令牌
- 383,885
- 响应时间(平均)
- 85.34s
- 响应时间(总计)
- 1877.49s
- 响应时间(最大)
- 814.73s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 API 错误: 1
响应时间(平均)80.66s
响应时间(最大)321.43s
响应时间(总计)322.64s
-
编程
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)167.51s
响应时间(最大)270.36s
响应时间(总计)502.52s
-
综合
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)412.50s
响应时间(最大)814.73s
响应时间(总计)824.99s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.76s
响应时间(最大)4.89s
响应时间(总计)5.51s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.46s
响应时间(最大)6.68s
响应时间(总计)7.39s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)650ms
响应时间(最大)650ms
响应时间(总计)650ms
-
指令遵循
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)423ms
响应时间(最大)435ms
响应时间(总计)845ms
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1
响应时间(平均)2.70s
响应时间(最大)6.77s
响应时间(总计)8.10s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.36s
响应时间(最大)2.36s
响应时间(总计)2.36s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)202.49s
响应时间(最大)202.49s
响应时间(总计)202.49s
|
| #242#242 |
DeepSeek V3.2none
|
5.0… |
DeepSeek |
$0.054
↑
…
|
17.89s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 API 错误: 3 额外格式: 2 无效工具调用: 2 未遵循指令: 1
响应时间(平均)17.89s
响应时间(最大)115.89s
响应时间(总计)393.53s
…
|
- 总测试数
- 22
- 错误测试数
- 16
- 尝试通过率
- 36.4%
- 输入令牌
- 135,831
- 输出令牌
- 42,099
- 推理令牌
- 0
- 响应时间(平均)
- 17.89s
- 响应时间(总计)
- 393.53s
- 响应时间(最大)
- 115.89s
-
反AI技巧
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 API 错误: 1 答案错误: 1
响应时间(平均)9.35s
响应时间(最大)16.77s
响应时间(总计)37.40s
-
编程
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)14.54s
响应时间(最大)34.11s
响应时间(总计)43.62s
-
综合
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)113.53s
响应时间(最大)115.89s
响应时间(总计)227.06s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.42s
响应时间(最大)16.20s
响应时间(总计)18.84s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.48s
响应时间(最大)1.77s
响应时间(总计)4.44s
-
通用智能
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)9.32s
响应时间(最大)9.32s
响应时间(总计)9.32s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.52s
响应时间(最大)1.99s
响应时间(总计)3.04s
-
谜题求解
: 7.6
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)6.91s
响应时间(最大)10.09s
响应时间(总计)20.74s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.85s
响应时间(最大)11.85s
响应时间(总计)11.85s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.23s
响应时间(最大)17.23s
响应时间(总计)17.23s
|
| #243#243 |
GPT-4o-mininone
|
5.0… |
OpenAI |
$0.010
…
|
1.92s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 15 未遵循指令: 1 无答案: 1
响应时间(平均)1.92s
响应时间(最大)7.58s
响应时间(总计)30.71s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 22.7%
- 输入令牌
- 53,145
- 输出令牌
- 2,913
- 推理令牌
- 0
- 响应时间(平均)
- 1.92s
- 响应时间(总计)
- 30.71s
- 响应时间(最大)
- 7.58s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.34s
响应时间(最大)1.83s
响应时间(总计)2.67s
-
编程
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.63s
响应时间(最大)2.55s
响应时间(总计)4.90s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)6.32s
响应时间(最大)7.58s
响应时间(总计)12.64s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.27s
响应时间(最大)1.27s
响应时间(总计)1.27s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)743ms
响应时间(最大)848ms
响应时间(总计)1.49s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)909ms
响应时间(最大)909ms
响应时间(总计)909ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.11s
响应时间(最大)1.11s
响应时间(总计)1.11s
-
谜题求解
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.21s
响应时间(最大)1.37s
响应时间(总计)2.42s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.51s
响应时间(最大)2.51s
响应时间(总计)2.51s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)794ms
响应时间(最大)794ms
响应时间(总计)794ms
|
| #244#244 |
Qwen3.6 Plus Previewmedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.9… |
Qwen |
$0.000
…
|
15.25s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 8 答案错误: 2
响应时间(平均)15.25s
响应时间(最大)43.55s
响应时间(总计)182.96s
…
|
- 总测试数
- 19
- 错误测试数
- 10
- 尝试通过率
- 40.9%
- 输入令牌
- 32,639
- 输出令牌
- 1,153
- 推理令牌
- 62,197
- 响应时间(平均)
- 15.25s
- 响应时间(总计)
- 182.96s
- 响应时间(最大)
- 43.55s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)11.69s
响应时间(最大)19.37s
响应时间(总计)35.08s
-
编程
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)34.95s
响应时间(最大)34.95s
响应时间(总计)34.95s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.95s
响应时间(最大)15.40s
响应时间(总计)29.90s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)22.08s
响应时间(最大)43.55s
响应时间(总计)66.23s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)3.40s
响应时间(最大)3.40s
响应时间(总计)3.40s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)7.52s
响应时间(最大)7.52s
响应时间(总计)7.52s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.87s
响应时间(最大)5.87s
响应时间(总计)5.87s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #245#245 |
Ling-2.6-flashnone
|
4.9… |
Inclusionai |
$0.002
↑
…
|
10.71s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 无效工具调用: 3 API 错误: 2 未遵循指令: 2
响应时间(平均)10.71s
响应时间(最大)36.03s
响应时间(总计)214.28s
…
|
- 总测试数
- 22
- 错误测试数
- 16
- 尝试通过率
- 30.3%
- 输入令牌
- 114,384
- 输出令牌
- 14,903
- 推理令牌
- 0
- 响应时间(平均)
- 10.71s
- 响应时间(总计)
- 214.28s
- 响应时间(最大)
- 36.03s
-
反AI技巧
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)11.81s
响应时间(最大)16.60s
响应时间(总计)47.23s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)11.21s
响应时间(最大)11.21s
响应时间(总计)11.21s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)35.69s
响应时间(最大)36.03s
响应时间(总计)71.38s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)8.48s
响应时间(最大)12.71s
响应时间(总计)16.96s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)5.20s
响应时间(最大)7.65s
响应时间(总计)15.60s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.45s
响应时间(最大)1.45s
响应时间(总计)1.45s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.52s
响应时间(最大)8.19s
响应时间(总计)11.04s
-
谜题求解
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)6.51s
响应时间(最大)17.06s
响应时间(总计)19.54s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)18.80s
响应时间(最大)18.80s
响应时间(总计)18.80s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.06s
响应时间(最大)1.06s
响应时间(总计)1.06s
|
| #246#246 |
Nemotron 3 Supernone
|
4.8… |
NVIDIA |
$0.008
↑
…
|
6.04s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 15 未遵循指令: 2
响应时间(平均)6.04s
响应时间(最大)20.00s
响应时间(总计)132.96s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 27.3%
- 输入令牌
- 63,528
- 输出令牌
- 6,432
- 推理令牌
- 0
- 响应时间(平均)
- 6.04s
- 响应时间(总计)
- 132.96s
- 响应时间(最大)
- 20.00s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)4.46s
响应时间(最大)9.94s
响应时间(总计)17.83s
-
编程
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.64s
响应时间(最大)3.05s
响应时间(总计)7.92s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)18.22s
响应时间(最大)20.00s
响应时间(总计)36.45s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.92s
响应时间(最大)13.23s
响应时间(总计)15.84s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)6.78s
响应时间(最大)14.38s
响应时间(总计)20.34s
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)950ms
响应时间(最大)950ms
响应时间(总计)950ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)804ms
响应时间(最大)921ms
响应时间(总计)1.61s
-
谜题求解
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.36s
响应时间(最大)3.27s
响应时间(总计)7.07s
-
工具调用
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)16.00s
响应时间(最大)16.00s
响应时间(总计)16.00s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)8.94s
响应时间(最大)8.94s
响应时间(总计)8.94s
|
| #247#247 |
Ring-2.6-1Tnone
|
4.8… |
Inclusionai |
$0.026
↑
…
|
51.99s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 6 答案错误: 5 未遵循指令: 2
响应时间(平均)51.99s
响应时间(最大)143.82s
响应时间(总计)831.90s
…
|
- 总测试数
- 22
- 错误测试数
- 13
- 尝试通过率
- 45.5%
- 输入令牌
- 7,608
- 输出令牌
- 40,277
- 推理令牌
- 0
- 响应时间(平均)
- 51.99s
- 响应时间(总计)
- 831.90s
- 响应时间(最大)
- 143.82s
-
反AI技巧
: 9.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)43.33s
响应时间(最大)71.76s
响应时间(总计)173.31s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)143.82s
响应时间(最大)143.82s
响应时间(总计)143.82s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)45.87s
响应时间(最大)45.87s
响应时间(总计)45.87s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)56.85s
响应时间(最大)90.09s
响应时间(总计)170.54s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)15.63s
响应时间(最大)15.63s
响应时间(总计)15.63s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)27.36s
响应时间(最大)40.24s
响应时间(总计)54.72s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)31.47s
响应时间(最大)46.84s
响应时间(总计)94.41s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)133.60s
响应时间(最大)133.60s
响应时间(总计)133.60s
|
| #248#248 |
Nemotron 3.5 Lightninglow
|
4.8… |
NVIDIA |
$0.175
↕
…
|
59.81s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 未遵循指令: 2 无效工具调用: 1
响应时间(平均)59.81s
响应时间(最大)312.21s
响应时间(总计)1315.80s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 42.4%
- 输入令牌
- 138,792
- 输出令牌
- 142,972
- 推理令牌
- 522,202
- 响应时间(平均)
- 59.81s
- 响应时间(总计)
- 1315.80s
- 响应时间(最大)
- 312.21s
-
反AI技巧
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)14.82s
响应时间(最大)27.06s
响应时间(总计)59.28s
-
编程
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)224.42s
响应时间(最大)312.21s
响应时间(总计)673.27s
-
综合
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)142.36s
响应时间(最大)259.10s
响应时间(总计)284.72s
-
数据解析与提取
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)31.32s
响应时间(最大)39.86s
响应时间(总计)62.64s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)52.66s
响应时间(最大)123.93s
响应时间(总计)157.97s
-
通用智能
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.61s
响应时间(最大)4.61s
响应时间(总计)4.61s
-
指令遵循
: 8.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)5.46s
响应时间(最大)7.47s
响应时间(总计)10.92s
-
谜题求解
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)6.21s
响应时间(最大)11.28s
响应时间(总计)18.64s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.08s
响应时间(最大)5.08s
响应时间(总计)5.08s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)38.68s
响应时间(最大)38.68s
响应时间(总计)38.68s
|
| #249#249 |
GPT-5.4 Nanonone
|
4.8… |
OpenAI |
$0.041
…
|
2.56s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 15 未遵循指令: 2 无答案: 1
响应时间(平均)2.56s
响应时间(最大)25.50s
响应时间(总计)56.37s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 27.3%
- 输入令牌
- 115,933
- 输出令牌
- 13,794
- 推理令牌
- 0
- 响应时间(平均)
- 2.56s
- 响应时间(总计)
- 56.37s
- 响应时间(最大)
- 25.50s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.18s
响应时间(最大)1.81s
响应时间(总计)4.70s
-
编程
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.22s
响应时间(最大)4.47s
响应时间(总计)6.65s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)14.67s
响应时间(最大)25.50s
响应时间(总计)29.34s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.11s
响应时间(最大)1.25s
响应时间(总计)2.23s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)880ms
响应时间(最大)959ms
响应时间(总计)2.64s
-
通用智能
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.31s
响应时间(最大)1.31s
响应时间(总计)1.31s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)784ms
响应时间(最大)859ms
响应时间(总计)1.57s
-
谜题求解
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.25s
响应时间(最大)1.53s
响应时间(总计)3.76s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.40s
响应时间(最大)3.40s
响应时间(总计)3.40s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)773ms
响应时间(最大)773ms
响应时间(总计)773ms
|
| #250#250 |
Trinity Large Thinkinghigh
|
4.8… |
Arcee AI |
$0.624
…
|
75.86s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 4 无效工具调用: 2 无答案: 1
响应时间(平均)75.86s
响应时间(最大)510.21s
响应时间(总计)1668.93s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 39.4%
- 输入令牌
- 101,776
- 输出令牌
- 276,367
- 推理令牌
- 656,252
- 响应时间(平均)
- 75.86s
- 响应时间(总计)
- 1668.93s
- 响应时间(最大)
- 510.21s
-
反AI技巧
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.13s
响应时间(最大)8.33s
响应时间(总计)16.53s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 无答案: 1 答案错误: 1
响应时间(平均)245.04s
响应时间(最大)510.21s
响应时间(总计)735.13s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)262.39s
响应时间(最大)419.41s
响应时间(总计)524.77s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)13.98s
响应时间(最大)20.06s
响应时间(总计)27.96s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)66.94s
响应时间(最大)118.63s
响应时间(总计)200.81s
-
通用智能
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)12.90s
响应时间(最大)12.90s
响应时间(总计)12.90s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.12s
响应时间(最大)4.57s
响应时间(总计)8.24s
-
谜题求解
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2 答案错误: 1
响应时间(平均)3.84s
响应时间(最大)6.38s
响应时间(总计)11.51s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.96s
响应时间(最大)5.96s
响应时间(总计)5.96s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)125.13s
响应时间(最大)125.13s
响应时间(总计)125.13s
|
| #251#251 |
Grok 4.20 Multi Agent Betamedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.8… |
X AI |
$5.599
↑
…
|
9.69s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 API 错误: 2 额外格式: 2 未遵循指令: 2
响应时间(平均)9.69s
响应时间(最大)35.28s
响应时间(总计)155.07s
…
|
- 总测试数
- 18
- 错误测试数
- 10
- 尝试通过率
- 48.5%
- 输入令牌
- 721,952
- 输出令牌
- 294,668
- 推理令牌
- 305,374
- 响应时间(平均)
- 9.69s
- 响应时间(总计)
- 155.07s
- 响应时间(最大)
- 35.28s
-
反AI技巧
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)3.46s
响应时间(最大)4.38s
响应时间(总计)13.86s
-
编程
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)27.11s
响应时间(最大)27.11s
响应时间(总计)27.11s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.54s
响应时间(最大)7.51s
响应时间(总计)11.08s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1
响应时间(平均)24.67s
响应时间(最大)35.28s
响应时间(总计)74.02s
-
通用智能
: 5.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)6.40s
响应时间(最大)6.40s
响应时间(总计)6.40s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.52s
响应时间(最大)3.80s
响应时间(总计)7.04s
-
谜题求解
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)5.19s
响应时间(最大)5.49s
响应时间(总计)15.57s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #252#252 |
KAT-Coder-Air V2.5none
|
4.8… |
Kwaipilot |
$0.070
…
|
12.46s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 额外格式: 3 API 错误: 1
响应时间(平均)12.46s
响应时间(最大)121.05s
响应时间(总计)274.11s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 36.4%
- 输入令牌
- 69,376
- 输出令牌
- 97,752
- 推理令牌
- 0
- 响应时间(平均)
- 12.46s
- 响应时间(总计)
- 274.11s
- 响应时间(最大)
- 121.05s
-
反AI技巧
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.68s
响应时间(最大)5.78s
响应时间(总计)10.73s
-
编程
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 答案错误: 1
响应时间(平均)14.31s
响应时间(最大)21.40s
响应时间(总计)42.94s
-
综合
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)73.00s
响应时间(最大)121.05s
响应时间(总计)146.00s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)2.66s
响应时间(最大)2.69s
响应时间(总计)5.33s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)8.33s
响应时间(最大)8.97s
响应时间(总计)25.00s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)12.02s
响应时间(最大)12.02s
响应时间(总计)12.02s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.75s
响应时间(最大)2.06s
响应时间(总计)3.50s
-
谜题求解
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.84s
响应时间(最大)2.06s
响应时间(总计)5.52s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.13s
响应时间(最大)5.13s
响应时间(总计)5.13s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.96s
响应时间(最大)17.96s
响应时间(总计)17.96s
|
| #253#253 |
GLM 4.7 Flashnone
|
4.8… |
Z.ai |
$0.016
…
|
8.81s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 无效工具调用: 2 未遵循指令: 1
响应时间(平均)8.81s
响应时间(最大)97.15s
响应时间(总计)140.88s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 30.3%
- 输入令牌
- 101,513
- 输出令牌
- 22,992
- 推理令牌
- 0
- 响应时间(平均)
- 8.81s
- 响应时间(总计)
- 140.88s
- 响应时间(最大)
- 97.15s
-
反AI技巧
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)5.51s
响应时间(最大)6.59s
响应时间(总计)11.02s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.54s
响应时间(最大)5.57s
响应时间(总计)7.62s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)50.18s
响应时间(最大)97.15s
响应时间(总计)100.36s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.82s
响应时间(最大)4.82s
响应时间(总计)4.82s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.22s
响应时间(最大)3.70s
响应时间(总计)4.44s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.59s
响应时间(最大)1.59s
响应时间(总计)1.59s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)888ms
响应时间(最大)888ms
响应时间(总计)888ms
-
谜题求解
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.20s
响应时间(最大)1.27s
响应时间(总计)2.39s
-
工具调用
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.05s
响应时间(最大)7.05s
响应时间(总计)7.05s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)692ms
响应时间(最大)692ms
响应时间(总计)692ms
|
| #254#254 |
Trinity Large Previewnone63/66 次尝试 (目标:每项测试重复 3 次)
|
4.8… |
Arcee AI |
$0.008
↑
…
|
2.98s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 未遵循指令: 3 API 错误: 2
响应时间(平均)2.98s
响应时间(最大)14.34s
响应时间(总计)56.57s
…
|
- 总测试数
- 21
- 错误测试数
- 17
- 尝试通过率
- 21.2%
- 输入令牌
- 29,828
- 输出令牌
- 2,169
- 推理令牌
- 0
- 响应时间(平均)
- 2.98s
- 响应时间(总计)
- 56.57s
- 响应时间(最大)
- 14.34s
-
反AI技巧
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.07s
响应时间(最大)4.40s
响应时间(总计)8.30s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2 答案错误: 1
响应时间(平均)14.34s
响应时间(最大)14.34s
响应时间(总计)14.34s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)8.91s
响应时间(最大)8.91s
响应时间(总计)8.91s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.26s
响应时间(最大)4.66s
响应时间(总计)6.52s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)877ms
响应时间(最大)894ms
响应时间(总计)2.63s
-
通用智能
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)873ms
响应时间(最大)873ms
响应时间(总计)873ms
-
指令遵循
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)822ms
响应时间(最大)960ms
响应时间(总计)1.64s
-
谜题求解
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.97s
响应时间(最大)2.87s
响应时间(总计)5.91s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.67s
响应时间(最大)6.67s
响应时间(总计)6.67s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)777ms
响应时间(最大)777ms
响应时间(总计)777ms
|
| #255#255 |
Hunter Alphamedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.7… |
OpenRouter |
$0.000
…
|
10.33s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 2 超时: 2 API 错误: 1 额外格式: 1
响应时间(平均)10.33s
响应时间(最大)30.53s
响应时间(总计)175.58s
…
|
- 总测试数
- 18
- 错误测试数
- 10
- 尝试通过率
- 53.0%
- 输入令牌
- 28,927
- 输出令牌
- 4,682
- 推理令牌
- 17,969
- 响应时间(平均)
- 10.33s
- 响应时间(总计)
- 175.58s
- 响应时间(最大)
- 30.53s
-
反AI技巧
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.75s
响应时间(最大)7.62s
响应时间(总计)19.00s
-
编程
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 2.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)30.53s
响应时间(最大)30.53s
响应时间(总计)30.53s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.16s
响应时间(最大)26.55s
响应时间(总计)46.33s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 超时: 1 答案错误: 1
响应时间(平均)10.52s
响应时间(最大)18.68s
响应时间(总计)31.56s
-
通用智能
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)6.44s
响应时间(最大)6.44s
响应时间(总计)6.44s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.18s
响应时间(最大)4.46s
响应时间(总计)8.36s
-
谜题求解
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)5.35s
响应时间(最大)6.20s
响应时间(总计)16.06s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.33s
响应时间(最大)17.33s
响应时间(总计)17.33s
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #256#256 |
Grok 4.1 Fastmedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.7… |
X AI |
$0.069
↑
…
|
23.85s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 4 答案错误: 4 无答案: 1 超时: 1
响应时间(平均)23.85s
响应时间(最大)121.79s
响应时间(总计)286.16s
…
|
- 总测试数
- 19
- 错误测试数
- 10
- 尝试通过率
- 53.0%
- 输入令牌
- 42,845
- 输出令牌
- 2,006
- 推理令牌
- 96,334
- 响应时间(平均)
- 23.85s
- 响应时间(总计)
- 286.16s
- 响应时间(最大)
- 121.79s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.81s
响应时间(最大)5.65s
响应时间(总计)7.62s
-
编程
: 7.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)23.58s
响应时间(最大)23.58s
响应时间(总计)23.58s
-
综合
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)37.64s
响应时间(最大)37.64s
响应时间(总计)37.64s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.63s
响应时间(最大)6.63s
响应时间(总计)6.63s
-
领域专项
: 5.8
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)121.79s
响应时间(最大)121.79s
响应时间(总计)121.79s
-
通用智能
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)16.25s
响应时间(最大)16.25s
响应时间(总计)16.25s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.63s
响应时间(最大)4.63s
响应时间(总计)4.63s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)7.40s
响应时间(最大)7.79s
响应时间(总计)14.81s
-
工具调用
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)27.71s
响应时间(最大)27.71s
响应时间(总计)27.71s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)25.52s
响应时间(最大)25.52s
响应时间(总计)25.52s
|
| #257#257 |
Laguna M.1medium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.7… |
Poolside |
$0.033
↕
…
|
14.73s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 4 答案错误: 4 未遵循指令: 1 无答案: 1
响应时间(平均)14.73s
响应时间(最大)53.14s
响应时间(总计)220.93s
…
|
- 总测试数
- 19
- 错误测试数
- 10
- 尝试通过率
- 45.5%
- 输入令牌
- 44,969
- 输出令牌
- 58,087
- 推理令牌
- 0
- 响应时间(平均)
- 14.73s
- 响应时间(总计)
- 220.93s
- 响应时间(最大)
- 53.14s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)4.87s
响应时间(最大)6.30s
响应时间(总计)14.62s
-
编程
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)35.61s
响应时间(最大)35.61s
响应时间(总计)35.61s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)53.14s
响应时间(最大)53.14s
响应时间(总计)53.14s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.93s
响应时间(最大)5.03s
响应时间(总计)9.86s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)24.14s
响应时间(最大)45.83s
响应时间(总计)72.43s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.30s
响应时间(最大)6.00s
响应时间(总计)8.59s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)10.19s
响应时间(最大)14.92s
响应时间(总计)20.37s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.31s
响应时间(最大)6.31s
响应时间(总计)6.31s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #258#258 |
Cobuddymedium63/66 次尝试 (目标:每项测试重复 3 次)
|
4.7… |
Baidu |
$0.000
…
|
39.90s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 3 API 错误: 1 无效工具调用: 1
响应时间(平均)39.90s
响应时间(最大)309.02s
响应时间(总计)797.98s
…
|
- 总测试数
- 21
- 错误测试数
- 14
- 尝试通过率
- 45.5%
- 输入令牌
- 37,449
- 输出令牌
- 1,677
- 推理令牌
- 116,703
- 响应时间(平均)
- 39.90s
- 响应时间(总计)
- 797.98s
- 响应时间(最大)
- 309.02s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.00s
响应时间(最大)11.53s
响应时间(总计)39.99s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 未遵循指令: 1 答案错误: 1
响应时间(平均)79.17s
响应时间(最大)104.76s
响应时间(总计)158.35s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)47.38s
响应时间(最大)47.38s
响应时间(总计)47.38s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.36s
响应时间(最大)26.57s
响应时间(总计)34.71s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)128.15s
响应时间(最大)309.02s
响应时间(总计)384.46s
-
通用智能
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)23.23s
响应时间(最大)23.23s
响应时间(总计)23.23s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.60s
响应时间(最大)14.49s
响应时间(总计)23.20s
-
谜题求解
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)12.83s
响应时间(最大)24.40s
响应时间(总计)38.49s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.19s
响应时间(最大)11.19s
响应时间(总计)11.19s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)36.98s
响应时间(最大)36.98s
响应时间(总计)36.98s
|
| #259#259 |
Mercury 2none
|
4.7… |
Inception |
$0.030
…
|
825ms… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 17 未遵循指令: 1
响应时间(平均)825ms
响应时间(最大)4.52s
响应时间(总计)18.14s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 24.2%
- 输入令牌
- 89,637
- 输出令牌
- 9,584
- 推理令牌
- 0
- 响应时间(平均)
- 825ms
- 响应时间(总计)
- 18.14s
- 响应时间(最大)
- 4.52s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)483ms
响应时间(最大)716ms
响应时间(总计)1.93s
-
编程
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.03s
响应时间(最大)1.43s
响应时间(总计)3.10s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.56s
响应时间(最大)4.52s
响应时间(总计)5.13s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)667ms
响应时间(最大)819ms
响应时间(总计)1.33s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)500ms
响应时间(最大)733ms
响应时间(总计)1.50s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)628ms
响应时间(最大)628ms
响应时间(总计)628ms
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)551ms
响应时间(最大)622ms
响应时间(总计)1.10s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)535ms
响应时间(最大)642ms
响应时间(总计)1.60s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.27s
响应时间(最大)1.27s
响应时间(总计)1.27s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)548ms
响应时间(最大)548ms
响应时间(总计)548ms
|
| #260#260 |
Qwen3 Coder Nextmedium
|
4.6… |
Qwen |
$0.034
↑
…
|
9.07s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 未遵循指令: 3 无答案: 1 超时: 1
响应时间(平均)9.07s
响应时间(最大)81.80s
响应时间(总计)154.19s
…
|
- 总测试数
- 22
- 错误测试数
- 19
- 尝试通过率
- 25.8%
- 输入令牌
- 148,203
- 输出令牌
- 19,069
- 推理令牌
- 0
- 响应时间(平均)
- 9.07s
- 响应时间(总计)
- 154.19s
- 响应时间(最大)
- 81.80s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)8.64s
响应时间(最大)15.28s
响应时间(总计)17.29s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)924ms
响应时间(最大)1.69s
响应时间(总计)2.77s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)14.65s
响应时间(最大)25.01s
响应时间(总计)29.29s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)81.80s
响应时间(最大)81.80s
响应时间(总计)81.80s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)570ms
响应时间(最大)638ms
响应时间(总计)1.14s
-
通用智能
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.39s
响应时间(最大)1.39s
响应时间(总计)1.39s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.49s
响应时间(最大)13.67s
响应时间(总计)14.99s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.25s
响应时间(最大)1.68s
响应时间(总计)2.49s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.64s
响应时间(最大)2.64s
响应时间(总计)2.64s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)399ms
响应时间(最大)399ms
响应时间(总计)399ms
|
| #261#261 |
MiniMax M2.5medium
|
4.6… |
Minimax |
$0.272
↓
…
|
69.08s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 超时: 4 未遵循指令: 3 无答案: 2 无效工具调用: 1
响应时间(平均)69.08s
响应时间(最大)251.36s
响应时间(总计)1036.24s
…
|
- 总测试数
- 22
- 错误测试数
- 17
- 尝试通过率
- 43.9%
- 输入令牌
- 142,621
- 输出令牌
- 20,409
- 推理令牌
- 251,820
- 响应时间(平均)
- 69.08s
- 响应时间(总计)
- 1036.24s
- 响应时间(最大)
- 251.36s
-
反AI技巧
: 7.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 超时: 1
响应时间(平均)20.82s
响应时间(最大)32.42s
响应时间(总计)41.63s
-
编程
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 超时: 1 答案错误: 1
响应时间(平均)188.58s
响应时间(最大)251.36s
响应时间(总计)377.16s
-
综合
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 无答案: 1
响应时间(平均)83.19s
响应时间(最大)105.99s
响应时间(总计)166.38s
-
数据解析与提取
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)7.48s
响应时间(最大)7.48s
响应时间(总计)7.48s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)158.88s
响应时间(最大)237.27s
响应时间(总计)317.77s
-
通用智能
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)6.63s
响应时间(最大)6.63s
响应时间(总计)6.63s
-
指令遵循
: 7.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)621ms
响应时间(最大)621ms
响应时间(总计)621ms
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)11.21s
响应时间(最大)17.37s
响应时间(总计)22.43s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.35s
响应时间(最大)15.35s
响应时间(总计)15.35s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)80.79s
响应时间(最大)80.79s
响应时间(总计)80.79s
|
| #262#262 |
Laguna S 2.1none
|
4.5… |
Poolside |
$0.022
↓
…
|
11.67s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 18 未遵循指令: 1 无答案: 1
响应时间(平均)11.67s
响应时间(最大)200.52s
响应时间(总计)256.71s
…
|
- 总测试数
- 22
- 错误测试数
- 20
- 尝试通过率
- 15.2%
- 输入令牌
- 125,604
- 输出令牌
- 57,634
- 推理令牌
- 0
- 响应时间(平均)
- 11.67s
- 响应时间(总计)
- 256.71s
- 响应时间(最大)
- 200.52s
-
反AI技巧
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)835ms
响应时间(最大)2.42s
响应时间(总计)3.34s
-
编程
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)550ms
响应时间(最大)903ms
响应时间(总计)1.65s
-
综合
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)21.62s
响应时间(最大)41.14s
响应时间(总计)43.24s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)537ms
响应时间(最大)579ms
响应时间(总计)1.07s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)337ms
响应时间(最大)386ms
响应时间(总计)1.01s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)815ms
响应时间(最大)815ms
响应时间(总计)815ms
-
指令遵循
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)566ms
响应时间(最大)653ms
响应时间(总计)1.13s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)828ms
响应时间(最大)945ms
响应时间(总计)2.48s
-
工具调用
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.45s
响应时间(最大)1.45s
响应时间(总计)1.45s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)200.52s
响应时间(最大)200.52s
响应时间(总计)200.52s
|
| #263#263 |
Grok 4.20 Betanone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.4… |
X AI |
$0.087
↓
…
|
1.19s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 1 无效工具调用: 1
响应时间(平均)1.19s
响应时间(最大)6.48s
响应时间(总计)21.43s
…
|
- 总测试数
- 18
- 错误测试数
- 12
- 尝试通过率
- 30.3%
- 输入令牌
- 40,597
- 输出令牌
- 1,657
- 推理令牌
- 0
- 响应时间(平均)
- 1.19s
- 响应时间(总计)
- 21.43s
- 响应时间(最大)
- 6.48s
-
反AI技巧
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)597ms
响应时间(最大)866ms
响应时间(总计)2.39s
-
编程
: 1.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.14s
响应时间(最大)1.14s
响应时间(总计)1.14s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)6.48s
响应时间(最大)6.48s
响应时间(总计)6.48s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)601ms
响应时间(最大)634ms
响应时间(总计)1.20s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)611ms
响应时间(最大)616ms
响应时间(总计)1.83s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)541ms
响应时间(最大)541ms
响应时间(总计)541ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)649ms
响应时间(最大)952ms
响应时间(总计)1.30s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)586ms
响应时间(最大)813ms
响应时间(总计)1.76s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.79s
响应时间(最大)4.79s
响应时间(总计)4.79s
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #264#264 |
Laguna M.1none已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.4… |
Poolside |
$0.009
↕
…
|
2.89s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 API 错误: 4 无效工具调用: 1
响应时间(平均)2.89s
响应时间(最大)15.42s
响应时间(总计)43.28s
…
|
- 总测试数
- 19
- 错误测试数
- 15
- 尝试通过率
- 27.3%
- 输入令牌
- 38,147
- 输出令牌
- 2,054
- 推理令牌
- 0
- 响应时间(平均)
- 2.89s
- 响应时间(总计)
- 43.28s
- 响应时间(最大)
- 15.42s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 API 错误: 1
响应时间(平均)705ms
响应时间(最大)975ms
响应时间(总计)2.12s
-
编程
: 2.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.93s
响应时间(最大)2.93s
响应时间(总计)2.93s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)4.32s
响应时间(最大)4.32s
响应时间(总计)4.32s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.37s
响应时间(最大)5.76s
响应时间(总计)6.73s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)5.50s
响应时间(最大)15.42s
响应时间(总计)16.50s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)683ms
响应时间(最大)691ms
响应时间(总计)1.37s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)891ms
响应时间(最大)1.21s
响应时间(总计)1.78s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.54s
响应时间(最大)7.54s
响应时间(总计)7.54s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #265#265 |
Elephant Alphanone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.3… |
Openrouter |
$0.000
…
|
1.22s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 API 错误: 3 未遵循指令: 3 无效工具调用: 1
响应时间(平均)1.22s
响应时间(最大)3.81s
响应时间(总计)22.03s
…
|
- 总测试数
- 21
- 错误测试数
- 16
- 尝试通过率
- 25.8%
- 输入令牌
- 33,743
- 输出令牌
- 2,573
- 推理令牌
- 0
- 响应时间(平均)
- 1.22s
- 响应时间(总计)
- 22.03s
- 响应时间(最大)
- 3.81s
-
反AI技巧
: 6.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)963ms
响应时间(最大)1.68s
响应时间(总计)3.85s
-
编程
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2 答案错误: 1
响应时间(平均)1.39s
响应时间(最大)1.39s
响应时间(总计)1.39s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.81s
响应时间(最大)3.81s
响应时间(总计)3.81s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.04s
响应时间(最大)1.05s
响应时间(总计)2.08s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)927ms
响应时间(最大)1.17s
响应时间(总计)2.78s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)854ms
响应时间(最大)854ms
响应时间(总计)854ms
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.03s
响应时间(最大)1.17s
响应时间(总计)2.07s
-
谜题求解
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)807ms
响应时间(最大)925ms
响应时间(总计)2.42s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)2.79s
响应时间(最大)2.79s
响应时间(总计)2.79s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #266#266 |
GLM 4.7 Flashmedium
|
4.3… |
Z.ai |
$0.168
…
|
134.34s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 无答案: 3 未遵循指令: 2 无效工具调用: 2 超时: 2
响应时间(平均)134.34s
响应时间(最大)1539.97s
响应时间(总计)2015.13s
…
|
- 总测试数
- 22
- 错误测试数
- 18
- 尝试通过率
- 31.8%
- 输入令牌
- 79,104
- 输出令牌
- 42,254
- 推理令牌
- 377,280
- 响应时间(平均)
- 134.34s
- 响应时间(总计)
- 2015.13s
- 响应时间(最大)
- 1539.97s
-
反AI技巧
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)14.95s
响应时间(最大)27.09s
响应时间(总计)29.90s
-
编程
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 无答案: 1
响应时间(平均)55.33s
响应时间(最大)89.40s
响应时间(总计)110.66s
-
综合
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)802.77s
响应时间(最大)1539.97s
响应时间(总计)1605.54s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)1.51s
响应时间(最大)1.51s
响应时间(总计)1.51s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)96.74s
响应时间(最大)174.55s
响应时间(总计)193.47s
-
通用智能
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)18.14s
响应时间(最大)18.14s
响应时间(总计)18.14s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.97s
响应时间(最大)2.97s
响应时间(总计)2.97s
-
谜题求解
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)12.93s
响应时间(最大)22.33s
响应时间(总计)25.85s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.95s
响应时间(最大)15.95s
响应时间(总计)15.95s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)11.13s
响应时间(最大)11.13s
响应时间(总计)11.13s
|
| #267#267 |
Elephant Alphamedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.3… |
Openrouter |
$0.000
…
|
1.27s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 API 错误: 3 未遵循指令: 2 无效工具调用: 1
响应时间(平均)1.27s
响应时间(最大)3.70s
响应时间(总计)22.82s
…
|
- 总测试数
- 21
- 错误测试数
- 15
- 尝试通过率
- 28.8%
- 输入令牌
- 33,744
- 输出令牌
- 2,596
- 推理令牌
- 0
- 响应时间(平均)
- 1.27s
- 响应时间(总计)
- 22.82s
- 响应时间(最大)
- 3.70s
-
反AI技巧
: 6.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.19s
响应时间(最大)2.04s
响应时间(总计)4.75s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2 答案错误: 1
响应时间(平均)1.30s
响应时间(最大)1.30s
响应时间(总计)1.30s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.70s
响应时间(最大)3.70s
响应时间(总计)3.70s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)979ms
响应时间(最大)1.02s
响应时间(总计)1.96s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)925ms
响应时间(最大)1.16s
响应时间(总计)2.77s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)920ms
响应时间(最大)920ms
响应时间(总计)920ms
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)987ms
响应时间(最大)1.13s
响应时间(总计)1.97s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)868ms
响应时间(最大)972ms
响应时间(总计)2.60s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)2.83s
响应时间(最大)2.83s
响应时间(总计)2.83s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #268#268 |
Hunter Alphanone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.2… |
OpenRouter |
$0.000
…
|
4.70s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 2 API 错误: 1
响应时间(平均)4.70s
响应时间(最大)15.17s
响应时间(总计)79.86s
…
|
- 总测试数
- 18
- 错误测试数
- 12
- 尝试通过率
- 37.9%
- 输入令牌
- 34,329
- 输出令牌
- 2,264
- 推理令牌
- 0
- 响应时间(平均)
- 4.70s
- 响应时间(总计)
- 79.86s
- 响应时间(最大)
- 15.17s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)3.81s
响应时间(最大)6.85s
响应时间(总计)15.23s
-
编程
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)15.17s
响应时间(最大)15.17s
响应时间(总计)15.17s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.49s
响应时间(最大)14.02s
响应时间(总计)16.98s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.33s
响应时间(最大)2.94s
响应时间(总计)6.99s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.71s
响应时间(最大)2.71s
响应时间(总计)2.71s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.82s
响应时间(最大)2.92s
响应时间(总计)5.65s
-
谜题求解
: 5.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)3.71s
响应时间(最大)5.43s
响应时间(总计)11.13s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.02s
响应时间(最大)6.02s
响应时间(总计)6.02s
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #269#269 |
Grok 4.20none54/66 次尝试 (目标:每项测试重复 3 次)
|
4.1… |
X AI |
$0.057
↓
…
|
1.11s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 额外格式: 1 无效工具调用: 1
响应时间(平均)1.11s
响应时间(最大)6.04s
响应时间(总计)19.96s
…
|
- 总测试数
- 18
- 错误测试数
- 12
- 尝试通过率
- 27.3%
- 输入令牌
- 41,313
- 输出令牌
- 1,923
- 推理令牌
- 0
- 响应时间(平均)
- 1.11s
- 响应时间(总计)
- 19.96s
- 响应时间(最大)
- 6.04s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)501ms
响应时间(最大)839ms
响应时间(总计)2.01s
-
编程
: 1.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.22s
响应时间(最大)1.22s
响应时间(总计)1.22s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)6.04s
响应时间(最大)6.04s
响应时间(总计)6.04s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)522ms
响应时间(最大)537ms
响应时间(总计)1.04s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1
响应时间(平均)687ms
响应时间(最大)821ms
响应时间(总计)2.06s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)659ms
响应时间(最大)659ms
响应时间(总计)659ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)445ms
响应时间(最大)505ms
响应时间(总计)889ms
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)473ms
响应时间(最大)502ms
响应时间(总计)1.42s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.63s
响应时间(最大)4.63s
响应时间(总计)4.63s
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #270#270 |
Laguna Xs.2medium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.1… |
Poolside |
$0.015
↕
…
|
6.73s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 API 错误: 4 无答案: 2 无效工具调用: 1
响应时间(平均)6.73s
响应时间(最大)29.11s
响应时间(总计)100.98s
…
|
- 总测试数
- 19
- 错误测试数
- 13
- 尝试通过率
- 43.9%
- 输入令牌
- 39,481
- 输出令牌
- 54,218
- 推理令牌
- 0
- 响应时间(平均)
- 6.73s
- 响应时间(总计)
- 100.98s
- 响应时间(最大)
- 29.11s
-
反AI技巧
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)2.68s
响应时间(最大)3.09s
响应时间(总计)8.04s
-
编程
: 2.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)14.36s
响应时间(最大)14.36s
响应时间(总计)14.36s
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)15.92s
响应时间(最大)15.92s
响应时间(总计)15.92s
-
数据解析与提取
: 7.1
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)9.34s
响应时间(最大)16.71s
响应时间(总计)18.68s
-
领域专项
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)11.12s
响应时间(最大)29.11s
响应时间(总计)33.35s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.68s
响应时间(最大)2.03s
响应时间(总计)3.36s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)1.93s
响应时间(最大)1.97s
响应时间(总计)3.87s
-
工具调用
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)3.39s
响应时间(最大)3.39s
响应时间(总计)3.39s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|