| #137#137 |
DeepSeek V4 Flashnone
|
5.1… |
DeepSeek |
$0.008
↓
…
|
27.97s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 额外格式: 2 未遵循指令: 1 无效工具调用: 1
响应时间(平均)27.97s
响应时间(最大)111.96s
响应时间(总计)559.36s
…
|
- 总测试数
- 20
- 错误测试数
- 15
- 尝试通过率
- 31.7%
- 输入令牌
- 47,538
- 输出令牌
- 13,700
- 推理令牌
- 0
- 响应时间(平均)
- 27.97s
- 响应时间(总计)
- 559.36s
- 响应时间(最大)
- 111.96s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)20.18s
响应时间(最大)26.54s
响应时间(总计)80.73s
-
编程
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)24.47s
响应时间(最大)24.90s
响应时间(总计)48.94s
-
综合
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)111.96s
响应时间(最大)111.96s
响应时间(总计)111.96s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.79s
响应时间(最大)23.85s
响应时间(总计)47.57s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)19.73s
响应时间(最大)27.66s
响应时间(总计)59.18s
-
通用智能
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)23.74s
响应时间(最大)23.74s
响应时间(总计)23.74s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)17.54s
响应时间(最大)18.51s
响应时间(总计)35.08s
-
谜题求解
: 3.1
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 未遵循指令: 1 答案错误: 1
响应时间(平均)23.72s
响应时间(最大)29.24s
响应时间(总计)71.16s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)77.93s
响应时间(最大)77.93s
响应时间(总计)77.93s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.07s
响应时间(最大)3.07s
响应时间(总计)3.07s
|
| #101#101 |
Grok Build 0.1none已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.0… |
X AI |
$0.547
…
|
28.69s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 API 错误: 3 未遵循指令: 2
响应时间(平均)28.69s
响应时间(最大)138.35s
响应时间(总计)459.00s
…
|
- 总测试数
- 19
- 错误测试数
- 12
- 尝试通过率
- 50.9%
- 输入令牌
- 11,793
- 输出令牌
- 267,275
- 推理令牌
- 0
- 响应时间(平均)
- 28.69s
- 响应时间(总计)
- 459.00s
- 响应时间(最大)
- 138.35s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.30s
响应时间(最大)9.80s
响应时间(总计)25.20s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.41s
响应时间(最大)21.41s
响应时间(总计)21.41s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)9.33s
响应时间(最大)9.33s
响应时间(总计)9.33s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)103.71s
响应时间(最大)138.35s
响应时间(总计)311.13s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)12.47s
响应时间(最大)12.47s
响应时间(总计)12.47s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.36s
响应时间(最大)11.05s
响应时间(总计)14.73s
-
谜题求解
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)9.55s
响应时间(最大)18.18s
响应时间(总计)28.65s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)36.09s
响应时间(最大)36.09s
响应时间(总计)36.09s
|
| #128#128 |
MiniMax M2.7medium
|
5.4… |
Minimax |
$0.104
↓
…
|
29.86s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 5 超时: 2 无效工具调用: 1 无答案: 1
响应时间(平均)29.86s
响应时间(最大)117.04s
响应时间(总计)567.39s
…
|
- 总测试数
- 20
- 错误测试数
- 15
- 尝试通过率
- 48.3%
- 输入令牌
- 33,493
- 输出令牌
- 8,224
- 推理令牌
- 73,373
- 响应时间(平均)
- 29.86s
- 响应时间(总计)
- 567.39s
- 响应时间(最大)
- 117.04s
-
反AI技巧
: 7.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)40.32s
响应时间(最大)117.04s
响应时间(总计)161.28s
-
编程
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)54.73s
响应时间(最大)91.27s
响应时间(总计)109.46s
-
综合
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)41.03s
响应时间(最大)41.03s
响应时间(总计)41.03s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)21.95s
响应时间(最大)24.88s
响应时间(总计)43.89s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 答案错误: 1
响应时间(平均)19.00s
响应时间(最大)21.63s
响应时间(总计)38.01s
-
通用智能
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)38.70s
响应时间(最大)38.70s
响应时间(总计)38.70s
-
指令遵循
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)12.80s
响应时间(最大)15.23s
响应时间(总计)25.60s
-
谜题求解
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)24.87s
响应时间(最大)46.29s
响应时间(总计)74.61s
-
工具调用
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)12.05s
响应时间(最大)12.05s
响应时间(总计)12.05s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)22.77s
响应时间(最大)22.77s
响应时间(总计)22.77s
|
| #18#18 |
GLM 5medium
|
8.2… |
Z.ai |
$0.212
↓
…
|
32.67s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1 无答案: 1 超时: 1
响应时间(平均)32.67s
响应时间(最大)99.85s
响应时间(总计)392.01s
…
|
- 总测试数
- 20
- 错误测试数
- 6
- 尝试通过率
- 81.7%
- 输入令牌
- 32,626
- 输出令牌
- 21,558
- 推理令牌
- 95,772
- 响应时间(平均)
- 32.67s
- 响应时间(总计)
- 392.01s
- 响应时间(最大)
- 99.85s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.66s
响应时间(最大)25.06s
响应时间(总计)47.32s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)89.47s
响应时间(最大)99.85s
响应时间(总计)178.93s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)28.96s
响应时间(最大)28.96s
响应时间(总计)28.96s
-
数据解析与提取
: 7.1
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)8.90s
响应时间(最大)8.90s
响应时间(总计)8.90s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)14.69s
响应时间(最大)14.69s
响应时间(总计)14.69s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.25s
响应时间(最大)7.25s
响应时间(总计)7.25s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.33s
响应时间(最大)16.34s
响应时间(总计)22.66s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.93s
响应时间(最大)15.93s
响应时间(总计)15.93s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)67.37s
响应时间(最大)67.37s
响应时间(总计)67.37s
|
| #52#52 |
GLM 5.1medium
|
7.4… |
Z.ai |
$0.279
↓
…
|
33.45s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 超时: 2 API 错误: 1 无答案: 1
响应时间(平均)33.45s
响应时间(最大)172.60s
响应时间(总计)635.63s
…
|
- 总测试数
- 20
- 错误测试数
- 8
- 尝试通过率
- 68.3%
- 输入令牌
- 30,397
- 输出令牌
- 11,511
- 推理令牌
- 71,979
- 响应时间(平均)
- 33.45s
- 响应时间(总计)
- 635.63s
- 响应时间(最大)
- 172.60s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.31s
响应时间(最大)14.20s
响应时间(总计)33.24s
-
编程
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 超时: 1
响应时间(平均)145.56s
响应时间(最大)172.60s
响应时间(总计)291.12s
-
综合
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)43.11s
响应时间(最大)43.11s
响应时间(总计)43.11s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.33s
响应时间(最大)9.40s
响应时间(总计)18.66s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)29.77s
响应时间(最大)32.22s
响应时间(总计)89.30s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)20.95s
响应时间(最大)20.95s
响应时间(总计)20.95s
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.47s
响应时间(最大)10.16s
响应时间(总计)14.94s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)31.64s
响应时间(最大)46.04s
响应时间(总计)94.91s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)29.40s
响应时间(最大)29.40s
响应时间(总计)29.40s
|
| #155#155 |
GLM 4.7 Flashmedium
|
4.5… |
Z.ai |
$0.054
…
|
35.10s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 无答案: 3 未遵循指令: 2 无效工具调用: 1 超时: 1
响应时间(平均)35.10s
响应时间(最大)174.55s
响应时间(总计)456.24s
…
|
- 总测试数
- 20
- 错误测试数
- 16
- 尝试通过率
- 35.0%
- 输入令牌
- 37,206
- 输出令牌
- 43,754
- 推理令牌
- 89,079
- 响应时间(平均)
- 35.10s
- 响应时间(总计)
- 456.24s
- 响应时间(最大)
- 174.55s
-
反AI技巧
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)14.95s
响应时间(最大)27.09s
响应时间(总计)29.90s
-
编程
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 超时: 1
响应时间(平均)55.33s
响应时间(最大)89.40s
响应时间(总计)110.66s
-
综合
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)65.57s
响应时间(最大)65.57s
响应时间(总计)65.57s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)1.51s
响应时间(最大)1.51s
响应时间(总计)1.51s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)174.55s
响应时间(最大)174.55s
响应时间(总计)174.55s
-
通用智能
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)18.14s
响应时间(最大)18.14s
响应时间(总计)18.14s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.97s
响应时间(最大)2.97s
响应时间(总计)2.97s
-
谜题求解
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)12.93s
响应时间(最大)22.33s
响应时间(总计)25.85s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.95s
响应时间(最大)15.95s
响应时间(总计)15.95s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)11.13s
响应时间(最大)11.13s
响应时间(总计)11.13s
|
| #22#22 |
Gemma 4 31Bmedium
|
8.0… |
Google |
$0.028
↓
…
|
35.39s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2 答案错误: 2 无答案: 1 超时: 1
响应时间(平均)35.39s
响应时间(最大)150.90s
响应时间(总计)637.01s
…
|
- 总测试数
- 20
- 错误测试数
- 6
- 尝试通过率
- 73.3%
- 输入令牌
- 15,899
- 输出令牌
- 19,602
- 推理令牌
- 49,686
- 响应时间(平均)
- 35.39s
- 响应时间(总计)
- 637.01s
- 响应时间(最大)
- 150.90s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.89s
响应时间(最大)26.66s
响应时间(总计)51.55s
-
编程
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 超时: 1
响应时间(平均)110.94s
响应时间(最大)150.90s
响应时间(总计)221.87s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.11s
响应时间(最大)21.94s
响应时间(总计)42.21s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)38.48s
响应时间(最大)68.92s
响应时间(总计)115.43s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.57s
响应时间(最大)9.57s
响应时间(总计)9.57s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.76s
响应时间(最大)17.53s
响应时间(总计)25.52s
-
谜题求解
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)26.91s
响应时间(最大)61.08s
响应时间(总计)80.72s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)90.14s
响应时间(最大)90.14s
响应时间(总计)90.14s
|
| #20#20 |
Seed-2.0-Litemedium
|
8.1… |
Bytedance Seed |
$0.152
…
|
36.67s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 2
响应时间(平均)36.67s
响应时间(最大)168.71s
响应时间(总计)733.46s
…
|
- 总测试数
- 20
- 错误测试数
- 7
- 尝试通过率
- 75.0%
- 输入令牌
- 43,785
- 输出令牌
- 3,224
- 推理令牌
- 67,040
- 响应时间(平均)
- 36.67s
- 响应时间(总计)
- 733.46s
- 响应时间(最大)
- 168.71s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.99s
响应时间(最大)48.33s
响应时间(总计)71.98s
-
编程
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)107.65s
响应时间(最大)140.81s
响应时间(总计)215.30s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)37.67s
响应时间(最大)37.67s
响应时间(总计)37.67s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.07s
响应时间(最大)12.19s
响应时间(总计)18.14s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)88.74s
响应时间(最大)168.71s
响应时间(总计)266.21s
-
通用智能
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)18.25s
响应时间(最大)18.25s
响应时间(总计)18.25s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.26s
响应时间(最大)9.02s
响应时间(总计)14.52s
-
谜题求解
: 9.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)10.23s
响应时间(最大)11.54s
响应时间(总计)30.68s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.38s
响应时间(最大)12.38s
响应时间(总计)12.38s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)48.32s
响应时间(最大)48.32s
响应时间(总计)48.32s
|
| #16#16 |
Qwen3.7 Plusmedium
|
8.4… |
Qwen |
$0.199
…
|
36.84s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 超时: 1
响应时间(平均)36.84s
响应时间(最大)178.04s
响应时间(总计)736.86s
…
|
- 总测试数
- 20
- 错误测试数
- 5
- 尝试通过率
- 80.0%
- 输入令牌
- 38,104
- 输出令牌
- 2,107
- 推理令牌
- 112,479
- 响应时间(平均)
- 36.84s
- 响应时间(总计)
- 736.86s
- 响应时间(最大)
- 178.04s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.58s
响应时间(最大)12.75s
响应时间(总计)34.33s
-
编程
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)122.40s
响应时间(最大)178.04s
响应时间(总计)244.81s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)65.24s
响应时间(最大)65.24s
响应时间(总计)65.24s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.75s
响应时间(最大)23.18s
响应时间(总计)43.49s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)45.35s
响应时间(最大)88.89s
响应时间(总计)136.04s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)25.48s
响应时间(最大)25.48s
响应时间(总计)25.48s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)16.13s
响应时间(最大)17.18s
响应时间(总计)32.26s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)16.38s
响应时间(最大)19.42s
响应时间(总计)49.14s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.02s
响应时间(最大)15.02s
响应时间(总计)15.02s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)91.07s
响应时间(最大)91.07s
响应时间(总计)91.07s
|
| #10#10 |
GPT-5.5medium
|
8.7… |
OpenAI |
$3.502
…
|
37.88s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)37.88s
响应时间(最大)332.10s
响应时间(总计)757.66s
…
|
- 总测试数
- 20
- 错误测试数
- 4
- 尝试通过率
- 86.7%
- 输入令牌
- 31,593
- 输出令牌
- 1,964
- 推理令牌
- 109,481
- 响应时间(平均)
- 37.88s
- 响应时间(总计)
- 757.66s
- 响应时间(最大)
- 332.10s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.66s
响应时间(最大)6.74s
响应时间(总计)18.65s
-
编程
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)69.68s
响应时间(最大)130.26s
响应时间(总计)139.35s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)19.29s
响应时间(最大)19.29s
响应时间(总计)19.29s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.18s
响应时间(最大)4.35s
响应时间(总计)8.36s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)164.14s
响应时间(最大)332.10s
响应时间(总计)492.41s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.16s
响应时间(最大)4.16s
响应时间(总计)4.16s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.36s
响应时间(最大)3.46s
响应时间(总计)6.73s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.76s
响应时间(最大)10.54s
响应时间(总计)20.28s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.57s
响应时间(最大)10.57s
响应时间(总计)10.57s
-
常识问答
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)37.86s
响应时间(最大)37.86s
响应时间(总计)37.86s
|
| #83#83 |
Step 3.5 Flashnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.6… |
Stepfun |
$0.020
…
|
39.03s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 4 未遵循指令: 1 答案错误: 1
响应时间(平均)39.03s
响应时间(最大)114.12s
响应时间(总计)312.26s
…
|
- 总测试数
- 12
- 错误测试数
- 6
- 尝试通过率
- 50.0%
- 输入令牌
- 1,971
- 输出令牌
- 64,795
- 推理令牌
- 0
- 响应时间(平均)
- 39.03s
- 响应时间(总计)
- 312.26s
- 响应时间(最大)
- 114.12s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)34.99s
响应时间(最大)109.60s
响应时间(总计)139.95s
-
编程
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
领域专项
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)34.54s
响应时间(最大)34.54s
响应时间(总计)34.54s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)14.37s
响应时间(最大)14.37s
响应时间(总计)14.37s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.30s
响应时间(最大)9.30s
响应时间(总计)9.30s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)114.12s
响应时间(最大)114.12s
响应时间(总计)114.12s
|
| #38#38 |
Qwen3.5-122B-A10Bmedium
|
7.7… |
Qwen |
$0.509
↓
…
|
39.40s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 超时: 2
响应时间(平均)39.40s
响应时间(最大)168.16s
响应时间(总计)788.00s
…
|
- 总测试数
- 20
- 错误测试数
- 7
- 尝试通过率
- 71.7%
- 输入令牌
- 38,997
- 输出令牌
- 26,166
- 推理令牌
- 213,524
- 响应时间(平均)
- 39.40s
- 响应时间(总计)
- 788.00s
- 响应时间(最大)
- 168.16s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.75s
响应时间(最大)18.03s
响应时间(总计)39.01s
-
编程
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)119.57s
响应时间(最大)168.16s
响应时间(总计)239.14s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)107.79s
响应时间(最大)107.79s
响应时间(总计)107.79s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.41s
响应时间(最大)29.79s
响应时间(总计)46.83s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)63.40s
响应时间(最大)119.29s
响应时间(总计)190.20s
-
通用智能
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)34.11s
响应时间(最大)34.11s
响应时间(总计)34.11s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.88s
响应时间(最大)15.44s
响应时间(总计)19.76s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.89s
响应时间(最大)31.99s
响应时间(总计)53.68s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.60s
响应时间(最大)4.60s
响应时间(总计)4.60s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)52.87s
响应时间(最大)52.87s
响应时间(总计)52.87s
|
| #116#116 |
Cobuddymedium
|
5.8… |
Baidu |
$0.000
…
|
39.90s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 3 无效工具调用: 1
响应时间(平均)39.90s
响应时间(最大)309.02s
响应时间(总计)797.98s
…
|
- 总测试数
- 20
- 错误测试数
- 13
- 尝试通过率
- 50.0%
- 输入令牌
- 37,449
- 输出令牌
- 1,677
- 推理令牌
- 116,703
- 响应时间(平均)
- 39.90s
- 响应时间(总计)
- 797.98s
- 响应时间(最大)
- 309.02s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.00s
响应时间(最大)11.53s
响应时间(总计)39.99s
-
编程
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)79.17s
响应时间(最大)104.76s
响应时间(总计)158.35s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)47.38s
响应时间(最大)47.38s
响应时间(总计)47.38s
-
数据解析与提取
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.36s
响应时间(最大)26.57s
响应时间(总计)34.71s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)128.15s
响应时间(最大)309.02s
响应时间(总计)384.46s
-
通用智能
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)23.23s
响应时间(最大)23.23s
响应时间(总计)23.23s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.60s
响应时间(最大)14.49s
响应时间(总计)23.20s
-
谜题求解
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)12.83s
响应时间(最大)24.40s
响应时间(总计)38.49s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.19s
响应时间(最大)11.19s
响应时间(总计)11.19s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)36.98s
响应时间(最大)36.98s
响应时间(总计)36.98s
|
| #75#75 |
Mimo V2 Omnimedium
|
6.9… |
Xiaomi |
$0.683
↓
…
|
41.16s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 2 无答案: 2 额外格式: 1
响应时间(平均)41.16s
响应时间(最大)299.23s
响应时间(总计)823.26s
…
|
- 总测试数
- 20
- 错误测试数
- 10
- 尝试通过率
- 58.3%
- 输入令牌
- 37,007
- 输出令牌
- 1,952
- 推理令牌
- 357,306
- 响应时间(平均)
- 41.16s
- 响应时间(总计)
- 823.26s
- 响应时间(最大)
- 299.23s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.75s
响应时间(最大)4.59s
响应时间(总计)10.98s
-
编程
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)183.89s
响应时间(最大)299.23s
响应时间(总计)367.78s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)25.87s
响应时间(最大)25.87s
响应时间(总计)25.87s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.04s
响应时间(最大)4.12s
响应时间(总计)6.07s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 无答案: 1 答案错误: 1
响应时间(平均)47.89s
响应时间(最大)134.52s
响应时间(总计)143.67s
-
通用智能
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.61s
响应时间(最大)3.61s
响应时间(总计)3.61s
-
指令遵循
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.99s
响应时间(最大)7.14s
响应时间(总计)9.99s
-
谜题求解
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.38s
响应时间(最大)3.69s
响应时间(总计)7.13s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.98s
响应时间(最大)13.98s
响应时间(总计)13.98s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)234.19s
响应时间(最大)234.19s
响应时间(总计)234.19s
|
| #40#40 |
Grok Build 0.1medium
|
7.7… |
X AI |
$0.729
…
|
42.39s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 额外格式: 3
响应时间(平均)42.39s
响应时间(最大)252.69s
响应时间(总计)847.76s
…
|
- 总测试数
- 20
- 错误测试数
- 7
- 尝试通过率
- 65.0%
- 输入令牌
- 41,496
- 输出令牌
- 2,258
- 推理令牌
- 341,381
- 响应时间(平均)
- 42.39s
- 响应时间(总计)
- 847.76s
- 响应时间(最大)
- 252.69s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)7.43s
响应时间(最大)10.89s
响应时间(总计)29.72s
-
编程
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)62.62s
响应时间(最大)94.25s
响应时间(总计)125.23s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)32.81s
响应时间(最大)32.81s
响应时间(总计)32.81s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.72s
响应时间(最大)12.13s
响应时间(总计)21.44s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)158.00s
响应时间(最大)252.69s
响应时间(总计)474.01s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)18.41s
响应时间(最大)18.41s
响应时间(总计)18.41s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.36s
响应时间(最大)20.80s
响应时间(总计)24.73s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)18.26s
响应时间(最大)44.40s
响应时间(总计)54.79s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.12s
响应时间(最大)13.12s
响应时间(总计)13.12s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)53.51s
响应时间(最大)53.51s
响应时间(总计)53.51s
|
| #55#55 |
Step 3.5 Flashmedium
|
7.4… |
Stepfun |
$0.062
↑
…
|
43.20s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 3 无答案: 1
响应时间(平均)43.20s
响应时间(最大)170.45s
响应时间(总计)561.54s
…
|
- 总测试数
- 19
- 错误测试数
- 8
- 尝试通过率
- 59.7%
- 输入令牌
- 33,555
- 输出令牌
- 90,478
- 推理令牌
- 173,544
- 响应时间(平均)
- 43.20s
- 响应时间(总计)
- 561.54s
- 响应时间(最大)
- 170.45s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)40.57s
响应时间(最大)110.43s
响应时间(总计)121.72s
-
编程
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)62.83s
响应时间(最大)62.83s
响应时间(总计)62.83s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)29.57s
响应时间(最大)29.57s
响应时间(总计)29.57s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.01s
响应时间(最大)15.01s
响应时间(总计)15.01s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)170.45s
响应时间(最大)170.45s
响应时间(总计)170.45s
-
通用智能
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)22.39s
响应时间(最大)22.39s
响应时间(总计)22.39s
-
指令遵循
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.78s
响应时间(最大)4.78s
响应时间(总计)4.78s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)7.22s
响应时间(最大)10.60s
响应时间(总计)14.44s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.91s
响应时间(最大)11.91s
响应时间(总计)11.91s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)108.45s
响应时间(最大)108.45s
响应时间(总计)108.45s
|
| #99#99 |
GPT-5 Nanomedium
|
6.1… |
OpenAI |
$0.077
…
|
43.52s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 2 超时: 1
响应时间(平均)43.52s
响应时间(最大)204.02s
响应时间(总计)565.82s
…
|
- 总测试数
- 20
- 错误测试数
- 12
- 尝试通过率
- 55.0%
- 输入令牌
- 31,489
- 输出令牌
- 5,328
- 推理令牌
- 181,056
- 响应时间(平均)
- 43.52s
- 响应时间(总计)
- 565.82s
- 响应时间(最大)
- 204.02s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)25.50s
响应时间(最大)37.73s
响应时间(总计)51.00s
-
编程
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)47.80s
响应时间(最大)54.86s
响应时间(总计)95.59s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)65.96s
响应时间(最大)65.96s
响应时间(总计)65.96s
-
数据解析与提取
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)21.42s
响应时间(最大)21.42s
响应时间(总计)21.42s
-
领域专项
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)204.02s
响应时间(最大)204.02s
响应时间(总计)204.02s
-
通用智能
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)17.51s
响应时间(最大)17.51s
响应时间(总计)17.51s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.64s
响应时间(最大)15.64s
响应时间(总计)15.64s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)20.63s
响应时间(最大)22.94s
响应时间(总计)41.26s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)33.30s
响应时间(最大)33.30s
响应时间(总计)33.30s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)20.13s
响应时间(最大)20.13s
响应时间(总计)20.13s
|
| #48#48 |
Qwen3.5 Plus 2026-04-20medium
|
7.5… |
Qwen |
$0.287
↓
…
|
43.65s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8
响应时间(平均)43.65s
响应时间(最大)189.38s
响应时间(总计)872.90s
…
|
- 总测试数
- 20
- 错误测试数
- 8
- 尝试通过率
- 65.0%
- 输入令牌
- 39,262
- 输出令牌
- 2,259
- 推理令牌
- 150,249
- 响应时间(平均)
- 43.65s
- 响应时间(总计)
- 872.90s
- 响应时间(最大)
- 189.38s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.84s
响应时间(最大)15.11s
响应时间(总计)43.36s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)137.55s
响应时间(最大)189.38s
响应时间(总计)275.10s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)92.41s
响应时间(最大)92.41s
响应时间(总计)92.41s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)38.32s
响应时间(最大)41.70s
响应时间(总计)76.63s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)53.10s
响应时间(最大)90.70s
响应时间(总计)159.30s
-
通用智能
: 4.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)25.30s
响应时间(最大)25.30s
响应时间(总计)25.30s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)20.25s
响应时间(最大)21.65s
响应时间(总计)40.50s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.67s
响应时间(最大)24.83s
响应时间(总计)53.02s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.72s
响应时间(最大)14.72s
响应时间(总计)14.72s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)92.57s
响应时间(最大)92.57s
响应时间(总计)92.57s
|
| #42#42 |
DeepSeek V4 Flashhigh
|
7.6… |
DeepSeek |
$0.027
↓
…
|
46.36s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 2
响应时间(平均)46.36s
响应时间(最大)218.13s
响应时间(总计)927.27s
…
|
- 总测试数
- 20
- 错误测试数
- 8
- 尝试通过率
- 73.3%
- 输入令牌
- 37,156
- 输出令牌
- 10,302
- 推理令牌
- 115,740
- 响应时间(平均)
- 46.36s
- 响应时间(总计)
- 927.27s
- 响应时间(最大)
- 218.13s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)28.51s
响应时间(最大)39.73s
响应时间(总计)114.05s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)58.13s
响应时间(最大)62.48s
响应时间(总计)116.27s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)76.57s
响应时间(最大)76.57s
响应时间(总计)76.57s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)28.03s
响应时间(最大)30.49s
响应时间(总计)56.07s
-
领域专项
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)100.31s
响应时间(最大)218.13s
响应时间(总计)300.92s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)25.15s
响应时间(最大)25.15s
响应时间(总计)25.15s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.36s
响应时间(最大)19.53s
响应时间(总计)30.73s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)26.11s
响应时间(最大)32.37s
响应时间(总计)78.32s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)74.73s
响应时间(最大)74.73s
响应时间(总计)74.73s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)54.46s
响应时间(最大)54.46s
响应时间(总计)54.46s
|
| #33#33 |
Grok 4.3medium
|
7.8… |
X AI |
$0.593
…
|
49.23s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 2 额外格式: 1
响应时间(平均)49.23s
响应时间(最大)216.69s
响应时间(总计)984.52s
…
|
- 总测试数
- 20
- 错误测试数
- 7
- 尝试通过率
- 75.0%
- 输入令牌
- 41,532
- 输出令牌
- 1,485
- 推理令牌
- 214,710
- 响应时间(平均)
- 49.23s
- 响应时间(总计)
- 984.52s
- 响应时间(最大)
- 216.69s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.83s
响应时间(最大)11.20s
响应时间(总计)35.31s
-
编程
: 7.4
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)55.26s
响应时间(最大)64.81s
响应时间(总计)110.53s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)63.99s
响应时间(最大)63.99s
响应时间(总计)63.99s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)18.97s
响应时间(最大)26.99s
响应时间(总计)37.93s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)181.74s
响应时间(最大)216.69s
响应时间(总计)545.21s
-
通用智能
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)24.70s
响应时间(最大)24.70s
响应时间(总计)24.70s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)18.58s
响应时间(最大)31.48s
响应时间(总计)37.15s
-
谜题求解
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)22.52s
响应时间(最大)51.75s
响应时间(总计)67.57s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.66s
响应时间(最大)17.66s
响应时间(总计)17.66s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)44.47s
响应时间(最大)44.47s
响应时间(总计)44.47s
|
| #66#66 |
Step 3.7 Flashhigh
|
7.2… |
Stepfun |
$0.960
…
|
49.43s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 无答案: 3
响应时间(平均)49.43s
响应时间(最大)192.75s
响应时间(总计)988.58s
…
|
- 总测试数
- 20
- 错误测试数
- 9
- 尝试通过率
- 63.3%
- 输入令牌
- 35,763
- 输出令牌
- 828,084
- 推理令牌
- 0
- 响应时间(平均)
- 49.43s
- 响应时间(总计)
- 988.58s
- 响应时间(最大)
- 192.75s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.40s
响应时间(最大)45.73s
响应时间(总计)53.58s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)126.82s
响应时间(最大)192.75s
响应时间(总计)253.65s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.01s
响应时间(最大)13.01s
响应时间(总计)13.01s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.72s
响应时间(最大)24.97s
响应时间(总计)29.43s
-
领域专项
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)149.64s
响应时间(最大)163.21s
响应时间(总计)448.91s
-
通用智能
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.17s
响应时间(最大)4.17s
响应时间(总计)4.17s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.52s
响应时间(最大)1.89s
响应时间(总计)3.03s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)10.22s
响应时间(最大)23.65s
响应时间(总计)30.66s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.79s
响应时间(最大)2.79s
响应时间(总计)2.79s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)149.34s
响应时间(最大)149.34s
响应时间(总计)149.34s
|
| #125#125 |
MiniMax M2.5medium
|
5.5… |
Minimax |
$0.294
↓
…
|
49.87s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 超时: 4 未遵循指令: 3 无效工具调用: 1
响应时间(平均)49.87s
响应时间(最大)237.27s
响应时间(总计)598.39s
…
|
- 总测试数
- 20
- 错误测试数
- 15
- 尝试通过率
- 48.3%
- 输入令牌
- 41,948
- 输出令牌
- 109,492
- 推理令牌
- 251,674
- 响应时间(平均)
- 49.87s
- 响应时间(总计)
- 598.39s
- 响应时间(最大)
- 237.27s
-
反AI技巧
: 7.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 超时: 1
响应时间(平均)20.82s
响应时间(最大)32.42s
响应时间(总计)41.63s
-
编程
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)125.80s
响应时间(最大)125.80s
响应时间(总计)125.80s
-
综合
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)60.39s
响应时间(最大)60.39s
响应时间(总计)60.39s
-
数据解析与提取
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)7.48s
响应时间(最大)7.48s
响应时间(总计)7.48s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)237.27s
响应时间(最大)237.27s
响应时间(总计)237.27s
-
通用智能
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)6.63s
响应时间(最大)6.63s
响应时间(总计)6.63s
-
指令遵循
: 7.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)621ms
响应时间(最大)621ms
响应时间(总计)621ms
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)11.21s
响应时间(最大)17.37s
响应时间(总计)22.43s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.35s
响应时间(最大)15.35s
响应时间(总计)15.35s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)80.79s
响应时间(最大)80.79s
响应时间(总计)80.79s
|
| #32#32 |
Gemma 4 26B A4Bmedium
|
7.8… |
Google |
$0.038
↓
…
|
50.92s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 超时: 2 无答案: 1
响应时间(平均)50.92s
响应时间(最大)369.32s
响应时间(总计)967.47s
…
|
- 总测试数
- 20
- 错误测试数
- 6
- 尝试通过率
- 73.3%
- 输入令牌
- 38,410
- 输出令牌
- 28,000
- 推理令牌
- 82,045
- 响应时间(平均)
- 50.92s
- 响应时间(总计)
- 967.47s
- 响应时间(最大)
- 369.32s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.20s
响应时间(最大)9.64s
响应时间(总计)24.78s
-
编程
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 超时: 1
响应时间(平均)258.40s
响应时间(最大)369.32s
响应时间(总计)516.79s
-
综合
: 9.6
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)73.55s
响应时间(最大)73.55s
响应时间(总计)73.55s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)16.51s
响应时间(最大)20.57s
响应时间(总计)33.02s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)23.62s
响应时间(最大)27.00s
响应时间(总计)47.23s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)29.76s
响应时间(最大)29.76s
响应时间(总计)29.76s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.54s
响应时间(最大)21.25s
响应时间(总计)35.08s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.79s
响应时间(最大)6.85s
响应时间(总计)17.36s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.01s
响应时间(最大)9.01s
响应时间(总计)9.01s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)180.87s
响应时间(最大)180.87s
响应时间(总计)180.87s
|
| #77#77 |
DeepSeek V3.2medium
|
6.8… |
DeepSeek |
$0.033
↓
…
|
53.34s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 API 错误: 2 超时: 2 未遵循指令: 1
响应时间(平均)53.34s
响应时间(最大)189.03s
响应时间(总计)1066.71s
…
|
- 总测试数
- 20
- 错误测试数
- 10
- 尝试通过率
- 63.3%
- 输入令牌
- 35,744
- 输出令牌
- 7,177
- 推理令牌
- 68,297
- 响应时间(平均)
- 53.34s
- 响应时间(总计)
- 1066.71s
- 响应时间(最大)
- 189.03s
-
反AI技巧
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)24.23s
响应时间(最大)29.86s
响应时间(总计)96.93s
-
编程
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)184.97s
响应时间(最大)189.03s
响应时间(总计)369.94s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)93.11s
响应时间(最大)93.11s
响应时间(总计)93.11s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)36.09s
响应时间(最大)39.12s
响应时间(总计)72.18s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)24.27s
响应时间(最大)33.91s
响应时间(总计)72.82s
-
通用智能
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)58.29s
响应时间(最大)58.29s
响应时间(总计)58.29s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)35.78s
响应时间(最大)47.30s
响应时间(总计)71.56s
-
谜题求解
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)37.69s
响应时间(最大)59.22s
响应时间(总计)113.08s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)34.81s
响应时间(最大)34.81s
响应时间(总计)34.81s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)83.99s
响应时间(最大)83.99s
响应时间(总计)83.99s
|
| #50#50 |
Kimi K2.6medium
|
7.4… |
Moonshot AI |
$0.803
↓
…
|
54.03s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 2 超时: 2 无答案: 1
响应时间(平均)54.03s
响应时间(最大)215.85s
响应时间(总计)1026.57s
…
|
- 总测试数
- 20
- 错误测试数
- 8
- 尝试通过率
- 68.3%
- 输入令牌
- 28,584
- 输出令牌
- 102,208
- 推理令牌
- 229,120
- 响应时间(平均)
- 54.03s
- 响应时间(总计)
- 1026.57s
- 响应时间(最大)
- 215.85s
-
反AI技巧
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)11.59s
响应时间(最大)23.94s
响应时间(总计)46.37s
-
编程
: 6.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)118.23s
响应时间(最大)129.50s
响应时间(总计)236.47s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)40.96s
响应时间(最大)40.96s
响应时间(总计)40.96s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)20.38s
响应时间(最大)22.88s
响应时间(总计)40.76s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2
响应时间(平均)202.38s
响应时间(最大)215.85s
响应时间(总计)404.76s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.83s
响应时间(最大)17.83s
响应时间(总计)17.83s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.53s
响应时间(最大)19.15s
响应时间(总计)25.06s
-
谜题求解
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)25.06s
响应时间(最大)56.89s
响应时间(总计)75.19s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.92s
响应时间(最大)8.92s
响应时间(总计)8.92s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)130.27s
响应时间(最大)130.27s
响应时间(总计)130.27s
|
| #93#93 |
Ring-2.6-1Tnone
|
6.4… |
Inclusionai |
$0.026
…
|
55.10s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 API 错误: 4 未遵循指令: 2
响应时间(平均)55.10s
响应时间(最大)143.82s
响应时间(总计)881.55s
…
|
- 总测试数
- 20
- 错误测试数
- 11
- 尝试通过率
- 50.0%
- 输入令牌
- 7,599
- 输出令牌
- 39,954
- 推理令牌
- 0
- 响应时间(平均)
- 55.10s
- 响应时间(总计)
- 881.55s
- 响应时间(最大)
- 143.82s
-
反AI技巧
: 9.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)43.33s
响应时间(最大)71.76s
响应时间(总计)173.31s
-
编程
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)143.82s
响应时间(最大)143.82s
响应时间(总计)143.82s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)45.87s
响应时间(最大)45.87s
响应时间(总计)45.87s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)73.40s
响应时间(最大)90.09s
响应时间(总计)220.20s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)15.63s
响应时间(最大)15.63s
响应时间(总计)15.63s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)27.36s
响应时间(最大)40.24s
响应时间(总计)54.72s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)31.47s
响应时间(最大)46.84s
响应时间(总计)94.41s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)133.60s
响应时间(最大)133.60s
响应时间(总计)133.60s
|
| #76#76 |
Hy3 previewhigh已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.9… |
Tencent |
$0.048
…
|
56.57s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 6 答案错误: 3
响应时间(平均)56.57s
响应时间(最大)149.94s
响应时间(总计)848.59s
…
|
- 总测试数
- 20
- 错误测试数
- 9
- 尝试通过率
- 58.3%
- 输入令牌
- 25,987
- 输出令牌
- 216,719
- 推理令牌
- 0
- 响应时间(平均)
- 56.57s
- 响应时间(总计)
- 848.59s
- 响应时间(最大)
- 149.94s
-
反AI技巧
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)15.12s
响应时间(最大)19.99s
响应时间(总计)45.37s
-
编程
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)99.76s
响应时间(最大)99.76s
响应时间(总计)99.76s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)113.09s
响应时间(最大)113.09s
响应时间(总计)113.09s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)12.11s
响应时间(最大)12.11s
响应时间(总计)12.11s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)109.04s
响应时间(最大)149.94s
响应时间(总计)327.11s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)34.36s
响应时间(最大)41.83s
响应时间(总计)68.73s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)27.94s
响应时间(最大)45.06s
响应时间(总计)55.89s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)78.83s
响应时间(最大)78.83s
响应时间(总计)78.83s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)47.71s
响应时间(最大)47.71s
响应时间(总计)47.71s
|
| #84#84 |
Qwen3.6 27Bmedium
|
6.6… |
Qwen |
$0.380
↑
…
|
57.79s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 无答案: 3 未遵循指令: 1 无效工具调用: 1
响应时间(平均)57.79s
响应时间(最大)168.22s
响应时间(总计)1155.83s
…
|
- 总测试数
- 20
- 错误测试数
- 11
- 尝试通过率
- 58.3%
- 输入令牌
- 36,541
- 输出令牌
- 12,981
- 推理令牌
- 105,822
- 响应时间(平均)
- 57.79s
- 响应时间(总计)
- 1155.83s
- 响应时间(最大)
- 168.22s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)12.62s
响应时间(最大)18.61s
响应时间(总计)50.50s
-
编程
: 6.6
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)165.39s
响应时间(最大)168.22s
响应时间(总计)330.78s
-
综合
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)83.07s
响应时间(最大)83.07s
响应时间(总计)83.07s
-
数据解析与提取
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 2
响应时间(平均)37.30s
响应时间(最大)54.01s
响应时间(总计)74.60s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)73.38s
响应时间(最大)101.55s
响应时间(总计)220.15s
-
通用智能
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)39.53s
响应时间(最大)39.53s
响应时间(总计)39.53s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)37.96s
响应时间(最大)47.48s
响应时间(总计)75.92s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)61.14s
响应时间(最大)97.76s
响应时间(总计)183.42s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)16.88s
响应时间(最大)16.88s
响应时间(总计)16.88s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)80.99s
响应时间(最大)80.99s
响应时间(总计)80.99s
|
| #15#15 |
Qwen3.6 Max Previewmedium
|
8.4… |
Qwen |
$0.872
↓
…
|
58.43s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5
响应时间(平均)58.43s
响应时间(最大)238.07s
响应时间(总计)1168.66s
…
|
- 总测试数
- 20
- 错误测试数
- 5
- 尝试通过率
- 80.0%
- 输入令牌
- 39,527
- 输出令牌
- 2,253
- 推理令牌
- 130,852
- 响应时间(平均)
- 58.43s
- 响应时间(总计)
- 1168.66s
- 响应时间(最大)
- 238.07s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)22.13s
响应时间(最大)28.70s
响应时间(总计)88.50s
-
编程
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)177.97s
响应时间(最大)238.07s
响应时间(总计)355.94s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)121.49s
响应时间(最大)121.49s
响应时间(总计)121.49s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)41.15s
响应时间(最大)48.02s
响应时间(总计)82.30s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)95.91s
响应时间(最大)186.74s
响应时间(总计)287.73s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)32.24s
响应时间(最大)32.24s
响应时间(总计)32.24s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)24.31s
响应时间(最大)27.94s
响应时间(总计)48.63s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)24.32s
响应时间(最大)37.68s
响应时间(总计)72.96s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)18.32s
响应时间(最大)18.32s
响应时间(总计)18.32s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)60.56s
响应时间(最大)60.56s
响应时间(总计)60.56s
|
| #100#100 |
DeepSeek V4 Prohigh
|
6.1… |
DeepSeek |
$0.062
↓
…
|
58.92s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 5 答案错误: 4 超时: 2 未遵循指令: 1
响应时间(平均)58.92s
响应时间(最大)358.35s
响应时间(总计)1119.51s
…
|
- 总测试数
- 20
- 错误测试数
- 12
- 尝试通过率
- 55.0%
- 输入令牌
- 30,514
- 输出令牌
- 12,244
- 推理令牌
- 53,958
- 响应时间(平均)
- 58.92s
- 响应时间(总计)
- 1119.51s
- 响应时间(最大)
- 358.35s
-
反AI技巧
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)16.53s
响应时间(最大)39.91s
响应时间(总计)66.11s
-
编程
: 2.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 超时: 1
响应时间(平均)51.77s
响应时间(最大)51.77s
响应时间(总计)51.77s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)65.02s
响应时间(最大)65.02s
响应时间(总计)65.02s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)23.62s
响应时间(最大)36.44s
响应时间(总计)47.24s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 超时: 1 答案错误: 1
响应时间(平均)205.66s
响应时间(最大)358.35s
响应时间(总计)616.97s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)25.09s
响应时间(最大)25.09s
响应时间(总计)25.09s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)41.16s
响应时间(最大)43.56s
响应时间(总计)82.32s
-
谜题求解
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)34.84s
响应时间(最大)76.46s
响应时间(总计)104.52s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.33s
响应时间(最大)21.33s
响应时间(总计)21.33s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)39.14s
响应时间(最大)39.14s
响应时间(总计)39.14s
|