| #128#128 |
Qwen3.6 Flashnone
|
5.4… |
Qwen |
$0.015
↓
…
|
1.60s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 未遵循指令: 1 无效工具调用: 1
响应时间(平均)1.60s
响应时间(最大)4.60s
响应时间(总计)33.59s
…
|
- 总测试数
- 21
- 错误测试数
- 14
- 尝试通过率
- 33.3%
- 输入令牌
- 50,810
- 输出令牌
- 4,164
- 推理令牌
- 0
- 响应时间(平均)
- 1.60s
- 响应时间(总计)
- 33.59s
- 响应时间(最大)
- 4.60s
-
反AI技巧
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.63s
响应时间(最大)4.60s
响应时间(总计)6.51s
-
编程
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.79s
响应时间(最大)2.46s
响应时间(总计)5.36s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)4.22s
响应时间(最大)4.22s
响应时间(总计)4.22s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.13s
响应时间(最大)3.35s
响应时间(总计)4.26s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.11s
响应时间(最大)1.89s
响应时间(总计)3.32s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)947ms
响应时间(最大)947ms
响应时间(总计)947ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.10s
响应时间(最大)1.36s
响应时间(总计)2.19s
-
谜题求解
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.21s
响应时间(最大)1.80s
响应时间(总计)3.64s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.49s
响应时间(最大)2.49s
响应时间(总计)2.49s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)649ms
响应时间(最大)649ms
响应时间(总计)649ms
|
| #87#87 |
Gemini 3.1 Flash Liteminimal
|
6.4… |
Google |
$0.013
…
|
1.33s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 未遵循指令: 3
响应时间(平均)1.33s
响应时间(最大)4.49s
响应时间(总计)27.91s
…
|
- 总测试数
- 21
- 错误测试数
- 11
- 尝试通过率
- 54.0%
- 输入令牌
- 36,973
- 输出令牌
- 2,487
- 推理令牌
- 0
- 响应时间(平均)
- 1.33s
- 响应时间(总计)
- 27.91s
- 响应时间(最大)
- 4.49s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.10s
响应时间(最大)1.65s
响应时间(总计)4.42s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)831ms
响应时间(最大)1.31s
响应时间(总计)2.49s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.53s
响应时间(最大)2.53s
响应时间(总计)2.53s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.04s
响应时间(最大)1.32s
响应时间(总计)2.07s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.02s
响应时间(最大)1.16s
响应时间(总计)3.06s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)791ms
响应时间(最大)791ms
响应时间(总计)791ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)932ms
响应时间(最大)1.00s
响应时间(总计)1.86s
-
谜题求解
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2
响应时间(平均)2.15s
响应时间(最大)4.49s
响应时间(总计)6.45s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.51s
响应时间(最大)3.51s
响应时间(总计)3.51s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)724ms
响应时间(最大)724ms
响应时间(总计)724ms
|
| #90#90 |
Gemini 3.1 Flash Litenone
|
6.4… |
Google |
$0.013
…
|
1.06s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 1
响应时间(平均)1.06s
响应时间(最大)2.97s
响应时间(总计)22.35s
…
|
- 总测试数
- 21
- 错误测试数
- 12
- 尝试通过率
- 52.4%
- 输入令牌
- 36,710
- 输出令牌
- 2,484
- 推理令牌
- 0
- 响应时间(平均)
- 1.06s
- 响应时间(总计)
- 22.35s
- 响应时间(最大)
- 2.97s
-
反AI技巧
: 7.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.07s
响应时间(最大)1.91s
响应时间(总计)4.27s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)938ms
响应时间(最大)1.59s
响应时间(总计)2.81s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.73s
响应时间(最大)2.73s
响应时间(总计)2.73s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)843ms
响应时间(最大)907ms
响应时间(总计)1.69s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)762ms
响应时间(最大)814ms
响应时间(总计)2.29s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)992ms
响应时间(最大)992ms
响应时间(总计)992ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)859ms
响应时间(最大)975ms
响应时间(总计)1.72s
-
谜题求解
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)720ms
响应时间(最大)826ms
响应时间(总计)2.16s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.97s
响应时间(最大)2.97s
响应时间(总计)2.97s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)733ms
响应时间(最大)733ms
响应时间(总计)733ms
|
| #99#99 |
gpt-oss-120bmedium
|
6.1… |
OpenAI |
$0.013
↓
…
|
22.28s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 3
响应时间(平均)22.28s
响应时间(最大)68.16s
响应时间(总计)311.96s
…
|
- 总测试数
- 21
- 错误测试数
- 12
- 尝试通过率
- 52.4%
- 输入令牌
- 39,084
- 输出令牌
- 20,013
- 推理令牌
- 50,233
- 响应时间(平均)
- 22.28s
- 响应时间(总计)
- 311.96s
- 响应时间(最大)
- 68.16s
-
反AI技巧
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)10.21s
响应时间(最大)19.76s
响应时间(总计)20.43s
-
编程
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)38.37s
响应时间(最大)68.16s
响应时间(总计)115.10s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)31.18s
响应时间(最大)31.18s
响应时间(总计)31.18s
-
数据解析与提取
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.98s
响应时间(最大)1.98s
响应时间(总计)1.98s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)50.92s
响应时间(最大)50.92s
响应时间(总计)50.92s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)7.90s
响应时间(最大)7.90s
响应时间(总计)7.90s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.63s
响应时间(最大)7.63s
响应时间(总计)7.63s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)21.71s
响应时间(最大)32.40s
响应时间(总计)43.41s
-
工具调用
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.91s
响应时间(最大)6.91s
响应时间(总计)6.91s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)26.51s
响应时间(最大)26.51s
响应时间(总计)26.51s
|
| #117#117 |
Qwen3.5-35B-A3Bnone
|
5.6… |
Qwen |
$0.012
↓
…
|
3.37s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 未遵循指令: 2
响应时间(平均)3.37s
响应时间(最大)47.43s
响应时间(总计)70.75s
…
|
- 总测试数
- 21
- 错误测试数
- 14
- 尝试通过率
- 42.9%
- 输入令牌
- 48,194
- 输出令牌
- 4,343
- 推理令牌
- 0
- 响应时间(平均)
- 3.37s
- 响应时间(总计)
- 70.75s
- 响应时间(最大)
- 47.43s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.43s
响应时间(最大)4.39s
响应时间(总计)5.71s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.39s
响应时间(最大)2.67s
响应时间(总计)4.18s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)47.43s
响应时间(最大)47.43s
响应时间(总计)47.43s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.16s
响应时间(最大)1.42s
响应时间(总计)2.33s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)485ms
响应时间(最大)549ms
响应时间(总计)1.45s
-
通用智能
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.19s
响应时间(最大)1.19s
响应时间(总计)1.19s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)809ms
响应时间(最大)983ms
响应时间(总计)1.62s
-
谜题求解
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.35s
响应时间(最大)2.26s
响应时间(总计)4.05s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.30s
响应时间(最大)2.30s
响应时间(总计)2.30s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)493ms
响应时间(最大)493ms
响应时间(总计)493ms
|
| #155#155 |
Mercury 2none
|
4.5… |
Inception |
$0.011
…
|
653ms… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 16 未遵循指令: 1
响应时间(平均)653ms
响应时间(最大)1.43s
响应时间(总计)13.72s
…
|
- 总测试数
- 21
- 错误测试数
- 17
- 尝试通过率
- 23.8%
- 输入令牌
- 28,113
- 输出令牌
- 4,439
- 推理令牌
- 0
- 响应时间(平均)
- 653ms
- 响应时间(总计)
- 13.72s
- 响应时间(最大)
- 1.43s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)483ms
响应时间(最大)716ms
响应时间(总计)1.93s
-
编程
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.03s
响应时间(最大)1.43s
响应时间(总计)3.10s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)606ms
响应时间(最大)606ms
响应时间(总计)606ms
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)667ms
响应时间(最大)819ms
响应时间(总计)1.33s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)534ms
响应时间(最大)733ms
响应时间(总计)1.60s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)628ms
响应时间(最大)628ms
响应时间(总计)628ms
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)551ms
响应时间(最大)622ms
响应时间(总计)1.10s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)535ms
响应时间(最大)642ms
响应时间(总计)1.60s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.27s
响应时间(最大)1.27s
响应时间(总计)1.27s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)548ms
响应时间(最大)548ms
响应时间(总计)548ms
|
| #148#148 |
GPT-5.4 Nanonone
|
4.7… |
OpenAI |
$0.011
…
|
1.48s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 15 未遵循指令: 2
响应时间(平均)1.48s
响应时间(最大)4.47s
响应时间(总计)31.01s
…
|
- 总测试数
- 21
- 错误测试数
- 17
- 尝试通过率
- 30.2%
- 输入令牌
- 34,212
- 输出令牌
- 2,784
- 推理令牌
- 0
- 响应时间(平均)
- 1.48s
- 响应时间(总计)
- 31.01s
- 响应时间(最大)
- 4.47s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.18s
响应时间(最大)1.81s
响应时间(总计)4.70s
-
编程
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.22s
响应时间(最大)4.47s
响应时间(总计)6.65s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.84s
响应时间(最大)3.84s
响应时间(总计)3.84s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.11s
响应时间(最大)1.25s
响应时间(总计)2.23s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)926ms
响应时间(最大)959ms
响应时间(总计)2.78s
-
通用智能
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.31s
响应时间(最大)1.31s
响应时间(总计)1.31s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)784ms
响应时间(最大)859ms
响应时间(总计)1.57s
-
谜题求解
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.25s
响应时间(最大)1.53s
响应时间(总计)3.76s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.40s
响应时间(最大)3.40s
响应时间(总计)3.40s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)773ms
响应时间(最大)773ms
响应时间(总计)773ms
|
| #126#126 |
gpt-oss-120bnone
|
5.4… |
OpenAI |
$0.010
↓
…
|
21.61s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 API 错误: 3 未遵循指令: 2
响应时间(平均)21.61s
响应时间(最大)113.71s
响应时间(总计)345.79s
…
|
- 总测试数
- 19
- 错误测试数
- 13
- 尝试通过率
- 38.6%
- 输入令牌
- 9,081
- 输出令牌
- 51,664
- 推理令牌
- 0
- 响应时间(平均)
- 21.61s
- 响应时间(总计)
- 345.79s
- 响应时间(最大)
- 113.71s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)32.84s
响应时间(最大)113.71s
响应时间(总计)131.35s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.57s
响应时间(最大)9.57s
响应时间(总计)9.57s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)7.12s
响应时间(最大)7.12s
响应时间(总计)7.12s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)34.98s
响应时间(最大)68.97s
响应时间(总计)104.94s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.79s
响应时间(最大)10.79s
响应时间(总计)10.79s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.06s
响应时间(最大)5.85s
响应时间(总计)10.12s
-
谜题求解
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)8.21s
响应时间(最大)11.82s
响应时间(总计)24.62s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)47.29s
响应时间(最大)47.29s
响应时间(总计)47.29s
|
| #140#140 |
Qwen3 Coder Nextnone
|
4.9… |
Qwen |
$0.009
↓
…
|
8.62s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 额外格式: 1 未遵循指令: 1
响应时间(平均)8.62s
响应时间(最大)45.14s
响应时间(总计)129.37s
…
|
- 总测试数
- 21
- 错误测试数
- 16
- 尝试通过率
- 27.0%
- 输入令牌
- 47,507
- 输出令牌
- 3,584
- 推理令牌
- 0
- 响应时间(平均)
- 8.62s
- 响应时间(总计)
- 129.37s
- 响应时间(最大)
- 45.14s
-
反AI技巧
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 额外格式: 1 未遵循指令: 1
响应时间(平均)3.31s
响应时间(最大)4.39s
响应时间(总计)6.63s
-
编程
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.22s
响应时间(最大)3.14s
响应时间(总计)6.67s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)45.14s
响应时间(最大)45.14s
响应时间(总计)45.14s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.32s
响应时间(最大)1.32s
响应时间(总计)1.32s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)962ms
响应时间(最大)962ms
响应时间(总计)962ms
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.34s
响应时间(最大)1.34s
响应时间(总计)1.34s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.78s
响应时间(最大)14.65s
响应时间(总计)15.56s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)24.34s
响应时间(最大)42.58s
响应时间(总计)48.69s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.47s
响应时间(最大)2.47s
响应时间(总计)2.47s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)601ms
响应时间(最大)601ms
响应时间(总计)601ms
|
| #150#150 |
Qwen3 Coder Nextmedium
|
4.6… |
Qwen |
$0.008
↓
…
|
8.58s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 3 超时: 1
响应时间(平均)8.58s
响应时间(最大)81.80s
响应时间(总计)128.68s
…
|
- 总测试数
- 21
- 错误测试数
- 17
- 尝试通过率
- 28.6%
- 输入令牌
- 47,250
- 输出令牌
- 3,319
- 推理令牌
- 0
- 响应时间(平均)
- 8.58s
- 响应时间(总计)
- 128.68s
- 响应时间(最大)
- 81.80s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)8.64s
响应时间(最大)15.28s
响应时间(总计)17.29s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)924ms
响应时间(最大)1.69s
响应时间(总计)2.77s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.28s
响应时间(最大)4.28s
响应时间(总计)4.28s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)81.80s
响应时间(最大)81.80s
响应时间(总计)81.80s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)638ms
响应时间(最大)638ms
响应时间(总计)638ms
-
通用智能
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.39s
响应时间(最大)1.39s
响应时间(总计)1.39s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.49s
响应时间(最大)13.67s
响应时间(总计)14.99s
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.25s
响应时间(最大)1.68s
响应时间(总计)2.49s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.64s
响应时间(最大)2.64s
响应时间(总计)2.64s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)399ms
响应时间(最大)399ms
响应时间(总计)399ms
|
| #151#151 |
Trinity Large Previewnone
|
4.6… |
Arcee AI |
$0.008
↑
…
|
2.98s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 未遵循指令: 3 API 错误: 2
响应时间(平均)2.98s
响应时间(最大)14.34s
响应时间(总计)56.57s
…
|
- 总测试数
- 21
- 错误测试数
- 17
- 尝试通过率
- 22.2%
- 输入令牌
- 29,828
- 输出令牌
- 2,169
- 推理令牌
- 0
- 响应时间(平均)
- 2.98s
- 响应时间(总计)
- 56.57s
- 响应时间(最大)
- 14.34s
-
反AI技巧
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.07s
响应时间(最大)4.40s
响应时间(总计)8.30s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2 答案错误: 1
响应时间(平均)14.34s
响应时间(最大)14.34s
响应时间(总计)14.34s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)8.91s
响应时间(最大)8.91s
响应时间(总计)8.91s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.26s
响应时间(最大)4.66s
响应时间(总计)6.52s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)877ms
响应时间(最大)894ms
响应时间(总计)2.63s
-
通用智能
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)873ms
响应时间(最大)873ms
响应时间(总计)873ms
-
指令遵循
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)822ms
响应时间(最大)960ms
响应时间(总计)1.64s
-
谜题求解
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.97s
响应时间(最大)2.87s
响应时间(总计)5.91s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.67s
响应时间(最大)6.67s
响应时间(总计)6.67s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)777ms
响应时间(最大)777ms
响应时间(总计)777ms
|
| #157#157 |
Grok 4.1 Fastnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.4… |
X AI |
$0.008
↓
…
|
1.62s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 3
响应时间(平均)1.62s
响应时间(最大)5.51s
响应时间(总计)19.48s
…
|
- 总测试数
- 19
- 错误测试数
- 16
- 尝试通过率
- 22.8%
- 输入令牌
- 36,608
- 输出令牌
- 1,723
- 推理令牌
- 0
- 响应时间(平均)
- 1.62s
- 响应时间(总计)
- 19.48s
- 响应时间(最大)
- 5.51s
-
反AI技巧
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)1.07s
响应时间(最大)1.73s
响应时间(总计)2.15s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.79s
响应时间(最大)1.79s
响应时间(总计)1.79s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.33s
响应时间(最大)3.33s
响应时间(总计)3.33s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)943ms
响应时间(最大)943ms
响应时间(总计)943ms
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.06s
响应时间(最大)1.06s
响应时间(总计)1.06s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.08s
响应时间(最大)1.08s
响应时间(总计)1.08s
-
指令遵循
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)685ms
响应时间(最大)685ms
响应时间(总计)685ms
-
谜题求解
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.10s
响应时间(最大)1.36s
响应时间(总计)2.21s
-
工具调用
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.51s
响应时间(最大)5.51s
响应时间(总计)5.51s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)731ms
响应时间(最大)731ms
响应时间(总计)731ms
|
| #139#139 |
DeepSeek V4 Flashnone
|
5.0… |
DeepSeek |
$0.008
↓
…
|
26.75s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 额外格式: 2 未遵循指令: 1 无效工具调用: 1
响应时间(平均)26.75s
响应时间(最大)111.96s
响应时间(总计)561.82s
…
|
- 总测试数
- 21
- 错误测试数
- 16
- 尝试通过率
- 30.2%
- 输入令牌
- 50,127
- 输出令牌
- 13,710
- 推理令牌
- 0
- 响应时间(平均)
- 26.75s
- 响应时间(总计)
- 561.82s
- 响应时间(最大)
- 111.96s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)20.18s
响应时间(最大)26.54s
响应时间(总计)80.73s
-
编程
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)17.13s
响应时间(最大)24.90s
响应时间(总计)51.40s
-
综合
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)111.96s
响应时间(最大)111.96s
响应时间(总计)111.96s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.79s
响应时间(最大)23.85s
响应时间(总计)47.57s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)19.73s
响应时间(最大)27.66s
响应时间(总计)59.18s
-
通用智能
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)23.74s
响应时间(最大)23.74s
响应时间(总计)23.74s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)17.54s
响应时间(最大)18.51s
响应时间(总计)35.08s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 未遵循指令: 1 答案错误: 1
响应时间(平均)23.72s
响应时间(最大)29.24s
响应时间(总计)71.16s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)77.93s
响应时间(最大)77.93s
响应时间(总计)77.93s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.07s
响应时间(最大)3.07s
响应时间(总计)3.07s
|
| #142#142 |
Mistral Small 4none
|
4.9… |
Mistral |
$0.007
…
|
630ms… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 15 未遵循指令: 1
响应时间(平均)630ms
响应时间(最大)1.72s
响应时间(总计)13.22s
…
|
- 总测试数
- 21
- 错误测试数
- 16
- 尝试通过率
- 27.0%
- 输入令牌
- 37,309
- 输出令牌
- 2,201
- 推理令牌
- 0
- 响应时间(平均)
- 630ms
- 响应时间(总计)
- 13.22s
- 响应时间(最大)
- 1.72s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)395ms
响应时间(最大)769ms
响应时间(总计)1.58s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)901ms
响应时间(最大)1.28s
响应时间(总计)2.70s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.72s
响应时间(最大)1.72s
响应时间(总计)1.72s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)822ms
响应时间(最大)1.08s
响应时间(总计)1.64s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)367ms
响应时间(最大)388ms
响应时间(总计)1.10s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)729ms
响应时间(最大)729ms
响应时间(总计)729ms
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)380ms
响应时间(最大)380ms
响应时间(总计)759ms
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)399ms
响应时间(最大)570ms
响应时间(总计)1.20s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.40s
响应时间(最大)1.40s
响应时间(总计)1.40s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)397ms
响应时间(最大)397ms
响应时间(总计)397ms
|
| #143#143 |
MiMo-V2.5none
|
4.9… |
Xiaomi |
$0.007
↓
…
|
2.20s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 额外格式: 1 未遵循指令: 1
响应时间(平均)2.20s
响应时间(最大)6.86s
响应时间(总计)46.21s
…
|
- 总测试数
- 21
- 错误测试数
- 16
- 尝试通过率
- 27.0%
- 输入令牌
- 41,985
- 输出令牌
- 2,267
- 推理令牌
- 0
- 响应时间(平均)
- 2.20s
- 响应时间(总计)
- 46.21s
- 响应时间(最大)
- 6.86s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)2.19s
响应时间(最大)6.85s
响应时间(总计)8.74s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.24s
响应时间(最大)5.52s
响应时间(总计)9.72s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.36s
响应时间(最大)2.36s
响应时间(总计)2.36s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)1.01s
响应时间(最大)1.18s
响应时间(总计)2.03s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)756ms
响应时间(最大)877ms
响应时间(总计)2.27s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.86s
响应时间(最大)6.86s
响应时间(总计)6.86s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)751ms
响应时间(最大)821ms
响应时间(总计)1.50s
-
谜题求解
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.13s
响应时间(最大)5.18s
响应时间(总计)6.40s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.43s
响应时间(最大)2.43s
响应时间(总计)2.43s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.89s
响应时间(最大)3.89s
响应时间(总计)3.89s
|
| #141#141 |
Nemotron 3 Supernone
|
4.9… |
NVIDIA |
$0.007
↑
…
|
5.30s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 未遵循指令: 2
响应时间(平均)5.30s
响应时间(最大)16.45s
响应时间(总计)111.31s
…
|
- 总测试数
- 21
- 错误测试数
- 16
- 尝试通过率
- 31.8%
- 输入令牌
- 36,456
- 输出令牌
- 6,195
- 推理令牌
- 0
- 响应时间(平均)
- 5.30s
- 响应时间(总计)
- 111.31s
- 响应时间(最大)
- 16.45s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)4.46s
响应时间(最大)9.94s
响应时间(总计)17.83s
-
编程
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.64s
响应时间(最大)3.05s
响应时间(总计)7.92s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)16.45s
响应时间(最大)16.45s
响应时间(总计)16.45s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.92s
响应时间(最大)13.23s
响应时间(总计)15.84s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)6.23s
响应时间(最大)14.38s
响应时间(总计)18.70s
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)950ms
响应时间(最大)950ms
响应时间(总计)950ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)804ms
响应时间(最大)921ms
响应时间(总计)1.61s
-
谜题求解
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.36s
响应时间(最大)3.27s
响应时间(总计)7.07s
-
工具调用
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)16.00s
响应时间(最大)16.00s
响应时间(总计)16.00s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)8.94s
响应时间(最大)8.94s
响应时间(总计)8.94s
|
| #147#147 |
GPT-4o-mininone
|
4.8… |
OpenAI |
$0.006
…
|
1.77s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 15 未遵循指令: 1
响应时间(平均)1.77s
响应时间(最大)7.58s
响应时间(总计)24.80s
…
|
- 总测试数
- 21
- 错误测试数
- 16
- 尝试通过率
- 23.8%
- 输入令牌
- 31,518
- 输出令牌
- 1,982
- 推理令牌
- 0
- 响应时间(平均)
- 1.77s
- 响应时间(总计)
- 24.80s
- 响应时间(最大)
- 7.58s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.34s
响应时间(最大)1.83s
响应时间(总计)2.67s
-
编程
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.63s
响应时间(最大)2.55s
响应时间(总计)4.90s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.58s
响应时间(最大)7.58s
响应时间(总计)7.58s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.27s
响应时间(最大)1.27s
响应时间(总计)1.27s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)637ms
响应时间(最大)637ms
响应时间(总计)637ms
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)909ms
响应时间(最大)909ms
响应时间(总计)909ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.11s
响应时间(最大)1.11s
响应时间(总计)1.11s
-
谜题求解
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)1.21s
响应时间(最大)1.37s
响应时间(总计)2.42s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.51s
响应时间(最大)2.51s
响应时间(总计)2.51s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)794ms
响应时间(最大)794ms
响应时间(总计)794ms
|
| #159#159 |
Ling-2.6-1Tnone
|
4.3… |
Inclusionai |
$0.005
…
|
7.72s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12 API 错误: 3 未遵循指令: 2 无效工具调用: 1
响应时间(平均)7.72s
响应时间(最大)25.72s
响应时间(总计)139.00s
…
|
- 总测试数
- 21
- 错误测试数
- 18
- 尝试通过率
- 14.3%
- 输入令牌
- 34,905
- 输出令牌
- 2,434
- 推理令牌
- 0
- 响应时间(平均)
- 7.72s
- 响应时间(总计)
- 139.00s
- 响应时间(最大)
- 25.72s
-
反AI技巧
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)6.55s
响应时间(最大)9.41s
响应时间(总计)26.19s
-
编程
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2 答案错误: 1
响应时间(平均)10.57s
响应时间(最大)10.57s
响应时间(总计)10.57s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)23.53s
响应时间(最大)23.53s
响应时间(总计)23.53s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.37s
响应时间(最大)1.37s
响应时间(总计)2.73s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.04s
响应时间(最大)1.08s
响应时间(总计)3.11s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)20.34s
响应时间(最大)20.34s
响应时间(总计)20.34s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.36s
响应时间(最大)9.81s
响应时间(总计)10.73s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)5.36s
响应时间(最大)13.26s
响应时间(总计)16.09s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)25.72s
响应时间(最大)25.72s
响应时间(总计)25.72s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #108#108 |
Qwen3.5-Flashnone
|
5.8… |
Qwen |
$0.005
↓
…
|
3.58s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13
响应时间(平均)3.58s
响应时间(最大)27.18s
响应时间(总计)75.28s
…
|
- 总测试数
- 21
- 错误测试数
- 13
- 尝试通过率
- 39.7%
- 输入令牌
- 46,439
- 输出令牌
- 4,276
- 推理令牌
- 0
- 响应时间(平均)
- 3.58s
- 响应时间(总计)
- 75.28s
- 响应时间(最大)
- 27.18s
-
反AI技巧
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.32s
响应时间(最大)3.89s
响应时间(总计)5.30s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)850ms
响应时间(最大)1.29s
响应时间(总计)2.55s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.22s
响应时间(最大)6.22s
响应时间(总计)6.22s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.57s
响应时间(最大)1.83s
响应时间(总计)3.14s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)905ms
响应时间(最大)1.10s
响应时间(总计)2.71s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)803ms
响应时间(最大)803ms
响应时间(总计)803ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)8.81s
响应时间(最大)13.73s
响应时间(总计)17.61s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)10.89s
响应时间(最大)27.18s
响应时间(总计)32.68s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.67s
响应时间(最大)3.67s
响应时间(总计)3.67s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)588ms
响应时间(最大)588ms
响应时间(总计)588ms
|
| #122#122 |
GLM 4.7 Flashnone
|
5.5… |
Z.ai |
$0.004
…
|
2.86s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 1 无效工具调用: 1
响应时间(平均)2.86s
响应时间(最大)7.05s
响应时间(总计)40.04s
…
|
- 总测试数
- 21
- 错误测试数
- 15
- 尝试通过率
- 36.5%
- 输入令牌
- 38,745
- 输出令牌
- 2,521
- 推理令牌
- 0
- 响应时间(平均)
- 2.86s
- 响应时间(总计)
- 40.04s
- 响应时间(最大)
- 7.05s
-
反AI技巧
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)5.51s
响应时间(最大)6.59s
响应时间(总计)11.02s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.54s
响应时间(最大)5.57s
响应时间(总计)7.62s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)3.22s
响应时间(最大)3.22s
响应时间(总计)3.22s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.82s
响应时间(最大)4.82s
响应时间(总计)4.82s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)744ms
响应时间(最大)744ms
响应时间(总计)744ms
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.59s
响应时间(最大)1.59s
响应时间(总计)1.59s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)888ms
响应时间(最大)888ms
响应时间(总计)888ms
-
谜题求解
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.20s
响应时间(最大)1.27s
响应时间(总计)2.39s
-
工具调用
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.05s
响应时间(最大)7.05s
响应时间(总计)7.05s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)692ms
响应时间(最大)692ms
响应时间(总计)692ms
|
| #85#85 |
Gemma 4 31Bnone
|
6.5… |
Google |
$0.004
↓
…
|
4.05s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 API 错误: 2 未遵循指令: 1
响应时间(平均)4.05s
响应时间(最大)26.13s
响应时间(总计)76.87s
…
|
- 总测试数
- 21
- 错误测试数
- 11
- 尝试通过率
- 47.6%
- 输入令牌
- 20,911
- 输出令牌
- 1,407
- 推理令牌
- 0
- 响应时间(平均)
- 4.05s
- 响应时间(总计)
- 76.87s
- 响应时间(最大)
- 26.13s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.85s
响应时间(最大)4.45s
响应时间(总计)7.40s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)11.19s
响应时间(最大)26.13s
响应时间(总计)33.58s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.25s
响应时间(最大)3.02s
响应时间(总计)4.51s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.22s
响应时间(最大)4.68s
响应时间(总计)9.67s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.09s
响应时间(最大)2.09s
响应时间(总计)2.09s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.84s
响应时间(最大)4.45s
响应时间(总计)5.68s
-
谜题求解
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)4.23s
响应时间(最大)7.63s
响应时间(总计)12.69s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.25s
响应时间(最大)1.25s
响应时间(总计)1.25s
|
| #102#102 |
Gemma 4 26B A4Bnone
|
6.0… |
Google |
$0.004
↓
…
|
5.91s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 2 超时: 1
响应时间(平均)5.91s
响应时间(最大)57.10s
响应时间(总计)124.05s
…
|
- 总测试数
- 21
- 错误测试数
- 13
- 尝试通过率
- 44.4%
- 输入令牌
- 40,038
- 输出令牌
- 1,824
- 推理令牌
- 0
- 响应时间(平均)
- 5.91s
- 响应时间(总计)
- 124.05s
- 响应时间(最大)
- 57.10s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.28s
响应时间(最大)2.09s
响应时间(总计)5.13s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)4.16s
响应时间(最大)7.07s
响应时间(总计)12.48s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)30.53s
响应时间(最大)30.53s
响应时间(总计)30.53s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.70s
响应时间(最大)2.21s
响应时间(总计)3.41s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.49s
响应时间(最大)4.23s
响应时间(总计)7.48s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.54s
响应时间(最大)3.54s
响应时间(总计)3.54s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)690ms
响应时间(最大)878ms
响应时间(总计)1.38s
-
谜题求解
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)744ms
响应时间(最大)972ms
响应时间(总计)2.23s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)57.10s
响应时间(最大)57.10s
响应时间(总计)57.10s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)778ms
响应时间(最大)778ms
响应时间(总计)778ms
|
| #163#163 |
Granite 4.1 8Bnone
|
4.0… |
IBM Granite |
$0.003
…
|
728ms… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 13 未遵循指令: 4 额外格式: 1 无效工具调用: 1
响应时间(平均)728ms
响应时间(最大)2.17s
响应时间(总计)15.29s
…
|
- 总测试数
- 21
- 错误测试数
- 19
- 尝试通过率
- 9.5%
- 输入令牌
- 46,285
- 输出令牌
- 2,911
- 推理令牌
- 0
- 响应时间(平均)
- 728ms
- 响应时间(总计)
- 15.29s
- 响应时间(最大)
- 2.17s
-
反AI技巧
: 4.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)844ms
响应时间(最大)1.91s
响应时间(总计)3.38s
-
编程
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 未遵循指令: 1 答案错误: 1
响应时间(平均)775ms
响应时间(最大)1.07s
响应时间(总计)2.33s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)1.88s
响应时间(最大)1.88s
响应时间(总计)1.88s
-
数据解析与提取
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)575ms
响应时间(最大)583ms
响应时间(总计)1.15s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)357ms
响应时间(最大)463ms
响应时间(总计)1.07s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)499ms
响应时间(最大)499ms
响应时间(总计)499ms
-
指令遵循
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)344ms
响应时间(最大)358ms
响应时间(总计)687ms
-
谜题求解
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)608ms
响应时间(最大)960ms
响应时间(总计)1.82s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.17s
响应时间(最大)2.17s
响应时间(总计)2.17s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)306ms
响应时间(最大)306ms
响应时间(总计)306ms
|
| #154#154 |
Qwen3.5-9Bnone
|
4.6… |
Qwen |
$0.003
↓
…
|
1.89s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 14 未遵循指令: 2 无效工具调用: 1
响应时间(平均)1.89s
响应时间(最大)6.03s
响应时间(总计)39.68s
…
|
- 总测试数
- 21
- 错误测试数
- 17
- 尝试通过率
- 20.6%
- 输入令牌
- 48,041
- 输出令牌
- 3,952
- 推理令牌
- 0
- 响应时间(平均)
- 1.89s
- 响应时间(总计)
- 39.68s
- 响应时间(最大)
- 6.03s
-
反AI技巧
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)1.71s
响应时间(最大)3.79s
响应时间(总计)6.84s
-
编程
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)5.60s
响应时间(最大)6.03s
响应时间(总计)16.81s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)5.91s
响应时间(最大)5.91s
响应时间(总计)5.91s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)847ms
响应时间(最大)1.09s
响应时间(总计)1.69s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)464ms
响应时间(最大)622ms
响应时间(总计)1.39s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)552ms
响应时间(最大)552ms
响应时间(总计)552ms
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)514ms
响应时间(最大)582ms
响应时间(总计)1.03s
-
谜题求解
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)621ms
响应时间(最大)759ms
响应时间(总计)1.86s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.27s
响应时间(最大)1.27s
响应时间(总计)1.27s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.32s
响应时间(最大)2.32s
响应时间(总计)2.32s
|
| #156#156 |
Hy3 previewnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.4… |
Tencent |
$0.003
…
|
12.92s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 API 错误: 4 未遵循指令: 4 额外格式: 1
响应时间(平均)12.92s
响应时间(最大)35.84s
响应时间(总计)232.64s
…
|
- 总测试数
- 21
- 错误测试数
- 17
- 尝试通过率
- 23.8%
- 输入令牌
- 27,172
- 输出令牌
- 2,661
- 推理令牌
- 0
- 响应时间(平均)
- 12.92s
- 响应时间(总计)
- 232.64s
- 响应时间(最大)
- 35.84s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2 答案错误: 1
响应时间(平均)11.10s
响应时间(最大)26.88s
响应时间(总计)44.41s
-
编程
: 2.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2 答案错误: 1
响应时间(平均)4.56s
响应时间(最大)4.56s
响应时间(总计)4.56s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)35.84s
响应时间(最大)35.84s
响应时间(总计)35.84s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)2.85s
响应时间(最大)2.85s
响应时间(总计)2.85s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)17.61s
响应时间(最大)25.68s
响应时间(总计)52.82s
-
通用智能
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)16.07s
响应时间(最大)16.07s
响应时间(总计)16.07s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)12.98s
响应时间(最大)23.51s
响应时间(总计)25.95s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)4.56s
响应时间(最大)7.35s
响应时间(总计)13.67s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)33.76s
响应时间(最大)33.76s
响应时间(总计)33.76s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.71s
响应时间(最大)2.71s
响应时间(总计)2.71s
|
| #138#138 |
Ling-2.6-flashnone
|
5.0… |
Inclusionai |
$0.001
↑
…
|
9.34s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 API 错误: 2 未遵循指令: 2 无效工具调用: 2
响应时间(平均)9.34s
响应时间(最大)35.34s
响应时间(总计)177.48s
…
|
- 总测试数
- 21
- 错误测试数
- 15
- 尝试通过率
- 31.8%
- 输入令牌
- 40,718
- 输出令牌
- 2,878
- 推理令牌
- 0
- 响应时间(平均)
- 9.34s
- 响应时间(总计)
- 177.48s
- 响应时间(最大)
- 35.34s
-
反AI技巧
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)11.81s
响应时间(最大)16.60s
响应时间(总计)47.23s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)11.21s
响应时间(最大)11.21s
响应时间(总计)11.21s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)35.34s
响应时间(最大)35.34s
响应时间(总计)35.34s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)8.48s
响应时间(最大)12.71s
响应时间(总计)16.96s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)4.95s
响应时间(最大)7.65s
响应时间(总计)14.84s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.45s
响应时间(最大)1.45s
响应时间(总计)1.45s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.52s
响应时间(最大)8.19s
响应时间(总计)11.04s
-
谜题求解
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)6.51s
响应时间(最大)17.06s
响应时间(总计)19.54s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)18.80s
响应时间(最大)18.80s
响应时间(总计)18.80s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.06s
响应时间(最大)1.06s
响应时间(总计)1.06s
|
| #160#160 |
LFM2-24B-A2Bnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
4.2… |
Liquid |
$0.001
…
|
782ms… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 API 错误: 4 未遵循指令: 1
响应时间(平均)782ms
响应时间(最大)3.15s
响应时间(总计)10.94s
…
|
- 总测试数
- 16
- 错误测试数
- 14
- 尝试通过率
- 16.7%
- 输入令牌
- 10,771
- 输出令牌
- 1,173
- 推理令牌
- 0
- 响应时间(平均)
- 782ms
- 响应时间(总计)
- 10.94s
- 响应时间(最大)
- 3.15s
-
反AI技巧
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)471ms
响应时间(最大)872ms
响应时间(总计)1.41s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)714ms
响应时间(最大)987ms
响应时间(总计)1.43s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)287ms
响应时间(最大)334ms
响应时间(总计)860ms
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)395ms
响应时间(最大)395ms
响应时间(总计)395ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)752ms
响应时间(最大)1.22s
响应时间(总计)1.50s
-
谜题求解
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)1.78s
响应时间(最大)3.15s
响应时间(总计)5.34s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #41#41 |
Nemotron 3 Ultra 550b A55bmedium
|
7.5… |
NVIDIA |
$0.000
…
|
15.05s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 API 错误: 1
响应时间(平均)15.05s
响应时间(最大)43.93s
响应时间(总计)316.09s
…
|
- 总测试数
- 21
- 错误测试数
- 8
- 尝试通过率
- 69.8%
- 输入令牌
- 46,813
- 输出令牌
- 18,002
- 推理令牌
- 53,091
- 响应时间(平均)
- 15.05s
- 响应时间(总计)
- 316.09s
- 响应时间(最大)
- 43.93s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.62s
响应时间(最大)16.86s
响应时间(总计)34.49s
-
编程
: 8.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)26.53s
响应时间(最大)31.91s
响应时间(总计)79.58s
-
综合
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)43.93s
响应时间(最大)43.93s
响应时间(总计)43.93s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.68s
响应时间(最大)7.94s
响应时间(总计)11.36s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)24.90s
响应时间(最大)34.96s
响应时间(总计)74.71s
-
通用智能
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)2.52s
响应时间(最大)2.52s
响应时间(总计)2.52s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.35s
响应时间(最大)9.38s
响应时间(总计)12.69s
-
谜题求解
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.54s
响应时间(最大)6.03s
响应时间(总计)10.62s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.72s
响应时间(最大)7.72s
响应时间(总计)7.72s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)38.47s
响应时间(最大)38.47s
响应时间(总计)38.47s
|
| #79#79 |
Hunter Alphamedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.7… |
OpenRouter |
$0.000
…
|
10.33s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 2 超时: 2 API 错误: 1 额外格式: 1
响应时间(平均)10.33s
响应时间(最大)30.53s
响应时间(总计)175.58s
…
|
- 总测试数
- 18
- 错误测试数
- 10
- 尝试通过率
- 64.8%
- 输入令牌
- 28,927
- 输出令牌
- 4,682
- 推理令牌
- 17,969
- 响应时间(平均)
- 10.33s
- 响应时间(总计)
- 175.58s
- 响应时间(最大)
- 30.53s
-
反AI技巧
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.75s
响应时间(最大)7.62s
响应时间(总计)19.00s
-
编程
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)30.53s
响应时间(最大)30.53s
响应时间(总计)30.53s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.16s
响应时间(最大)26.55s
响应时间(总计)46.33s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 超时: 1 答案错误: 1
响应时间(平均)10.52s
响应时间(最大)18.68s
响应时间(总计)31.56s
-
通用智能
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)6.44s
响应时间(最大)6.44s
响应时间(总计)6.44s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.18s
响应时间(最大)4.46s
响应时间(总计)8.36s
-
谜题求解
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)5.35s
响应时间(最大)6.20s
响应时间(总计)16.06s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.33s
响应时间(最大)17.33s
响应时间(总计)17.33s
|
| #92#92 |
Laguna M.1medium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.4… |
Poolside |
$0.000
…
|
14.73s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 4 答案错误: 4 未遵循指令: 1 无答案: 1
响应时间(平均)14.73s
响应时间(最大)53.14s
响应时间(总计)220.93s
…
|
- 总测试数
- 19
- 错误测试数
- 10
- 尝试通过率
- 52.6%
- 输入令牌
- 44,969
- 输出令牌
- 58,087
- 推理令牌
- 0
- 响应时间(平均)
- 14.73s
- 响应时间(总计)
- 220.93s
- 响应时间(最大)
- 53.14s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)4.87s
响应时间(最大)6.30s
响应时间(总计)14.62s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)35.61s
响应时间(最大)35.61s
响应时间(总计)35.61s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)53.14s
响应时间(最大)53.14s
响应时间(总计)53.14s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.93s
响应时间(最大)5.03s
响应时间(总计)9.86s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)24.14s
响应时间(最大)45.83s
响应时间(总计)72.43s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.30s
响应时间(最大)6.00s
响应时间(总计)8.59s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)10.19s
响应时间(最大)14.92s
响应时间(总计)20.37s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.31s
响应时间(最大)6.31s
响应时间(总计)6.31s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|