| #69#69 |
Claude Opus 4.6medium
|
7.0… |
Anthropic |
$2.053
…
|
25.89s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 5 答案错误: 3 未遵循指令: 1
响应时间(平均)25.89s
响应时间(最大)83.40s
响应时间(总计)362.49s
…
|
- 总测试数
- 21
- 错误测试数
- 9
- 尝试通过率
- 61.9%
- 输入令牌
- 53,227
- 输出令牌
- 47,446
- 推理令牌
- 24,000
- 响应时间(平均)
- 25.89s
- 响应时间(总计)
- 362.49s
- 响应时间(最大)
- 83.40s
-
反AI技巧
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2
响应时间(平均)7.45s
响应时间(最大)11.88s
响应时间(总计)14.90s
-
编程
: 5.7
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 未遵循指令: 1
响应时间(平均)30.10s
响应时间(最大)35.63s
响应时间(总计)90.31s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)76.66s
响应时间(最大)76.66s
响应时间(总计)76.66s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.37s
响应时间(最大)7.37s
响应时间(总计)7.37s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 答案错误: 1
响应时间(平均)83.40s
响应时间(最大)83.40s
响应时间(总计)83.40s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.04s
响应时间(最大)5.04s
响应时间(总计)5.04s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.43s
响应时间(最大)2.43s
响应时间(总计)2.43s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.71s
响应时间(最大)4.75s
响应时间(总计)9.41s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.73s
响应时间(最大)9.73s
响应时间(总计)9.73s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)63.24s
响应时间(最大)63.24s
响应时间(总计)63.24s
|
| #70#70 |
GPT-5.4 Nanomedium
|
7.0… |
OpenAI |
$0.107
…
|
11.95s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 未遵循指令: 2
响应时间(平均)11.95s
响应时间(最大)94.06s
响应时间(总计)250.98s
…
|
- 总测试数
- 21
- 错误测试数
- 10
- 尝试通过率
- 63.5%
- 输入令牌
- 35,434
- 输出令牌
- 3,014
- 推理令牌
- 76,520
- 响应时间(平均)
- 11.95s
- 响应时间(总计)
- 250.98s
- 响应时间(最大)
- 94.06s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.52s
响应时间(最大)7.74s
响应时间(总计)18.10s
-
编程
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)19.12s
响应时间(最大)28.80s
响应时间(总计)57.37s
-
综合
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)24.13s
响应时间(最大)24.13s
响应时间(总计)24.13s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.54s
响应时间(最大)3.33s
响应时间(总计)5.08s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)38.18s
响应时间(最大)94.06s
响应时间(总计)114.53s
-
通用智能
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.15s
响应时间(最大)4.15s
响应时间(总计)4.15s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.88s
响应时间(最大)2.61s
响应时间(总计)3.75s
-
谜题求解
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)3.79s
响应时间(最大)4.02s
响应时间(总计)11.36s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.71s
响应时间(最大)7.71s
响应时间(总计)7.71s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.81s
响应时间(最大)4.81s
响应时间(总计)4.81s
|
| #71#71 |
Step 3.7 Flashhigh
|
7.0… |
Stepfun |
$1.148
…
|
64.46s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 无答案: 4
响应时间(平均)64.46s
响应时间(最大)364.99s
响应时间(总计)1353.57s
…
|
- 总测试数
- 21
- 错误测试数
- 10
- 尝试通过率
- 63.5%
- 输入令牌
- 38,391
- 输出令牌
- 991,355
- 推理令牌
- 0
- 响应时间(平均)
- 64.46s
- 响应时间(总计)
- 1353.57s
- 响应时间(最大)
- 364.99s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.40s
响应时间(最大)45.73s
响应时间(总计)53.58s
-
编程
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 2 答案错误: 1
响应时间(平均)206.21s
响应时间(最大)364.99s
响应时间(总计)618.64s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.01s
响应时间(最大)13.01s
响应时间(总计)13.01s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.72s
响应时间(最大)24.97s
响应时间(总计)29.43s
-
领域专项
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 无答案: 1
响应时间(平均)149.64s
响应时间(最大)163.21s
响应时间(总计)448.91s
-
通用智能
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.17s
响应时间(最大)4.17s
响应时间(总计)4.17s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.52s
响应时间(最大)1.89s
响应时间(总计)3.03s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)10.22s
响应时间(最大)23.65s
响应时间(总计)30.66s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.79s
响应时间(最大)2.79s
响应时间(总计)2.79s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)149.34s
响应时间(最大)149.34s
响应时间(总计)149.34s
|
| #72#72 |
DeepSeek V3.2medium
|
7.0… |
DeepSeek |
$0.044
↓
…
|
68.71s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 API 错误: 2 超时: 2 未遵循指令: 1
响应时间(平均)68.71s
响应时间(最大)376.10s
响应时间(总计)1442.81s
…
|
- 总测试数
- 21
- 错误测试数
- 10
- 尝试通过率
- 65.1%
- 输入令牌
- 38,333
- 输出令牌
- 7,186
- 推理令牌
- 99,081
- 响应时间(平均)
- 68.71s
- 响应时间(总计)
- 1442.81s
- 响应时间(最大)
- 376.10s
-
反AI技巧
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)24.23s
响应时间(最大)29.86s
响应时间(总计)96.93s
-
编程
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)248.68s
响应时间(最大)376.10s
响应时间(总计)746.04s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)93.11s
响应时间(最大)93.11s
响应时间(总计)93.11s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)36.09s
响应时间(最大)39.12s
响应时间(总计)72.18s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)24.27s
响应时间(最大)33.91s
响应时间(总计)72.82s
-
通用智能
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)58.29s
响应时间(最大)58.29s
响应时间(总计)58.29s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)35.78s
响应时间(最大)47.30s
响应时间(总计)71.56s
-
谜题求解
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)37.69s
响应时间(最大)59.22s
响应时间(总计)113.08s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)34.81s
响应时间(最大)34.81s
响应时间(总计)34.81s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)83.99s
响应时间(最大)83.99s
响应时间(总计)83.99s
|
| #74#74 |
Qwen3.6 Max Previewnone
|
6.9… |
Qwen |
$0.075
↓
…
|
3.30s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10
响应时间(平均)3.30s
响应时间(最大)20.51s
响应时间(总计)69.40s
…
|
- 总测试数
- 21
- 错误测试数
- 10
- 尝试通过率
- 58.7%
- 输入令牌
- 42,509
- 输出令牌
- 4,779
- 推理令牌
- 0
- 响应时间(平均)
- 3.30s
- 响应时间(总计)
- 69.40s
- 响应时间(最大)
- 20.51s
-
反AI技巧
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.63s
响应时间(最大)5.57s
响应时间(总计)10.53s
-
编程
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)3.12s
响应时间(最大)3.45s
响应时间(总计)9.35s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)20.51s
响应时间(最大)20.51s
响应时间(总计)20.51s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.87s
响应时间(最大)3.54s
响应时间(总计)5.74s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.22s
响应时间(最大)1.25s
响应时间(总计)3.67s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.62s
响应时间(最大)1.62s
响应时间(总计)1.62s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.40s
响应时间(最大)1.46s
响应时间(总计)2.79s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.65s
响应时间(最大)3.59s
响应时间(总计)7.94s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.27s
响应时间(最大)5.27s
响应时间(总计)5.27s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.97s
响应时间(最大)1.97s
响应时间(总计)1.97s
|
| #75#75 |
Ring-2.6-1Tmedium
|
6.9… |
Inclusionai |
$0.033
↕
…
|
61.29s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 API 错误: 2 未遵循指令: 2
响应时间(平均)61.29s
响应时间(最大)304.19s
响应时间(总计)1164.50s
…
|
- 总测试数
- 21
- 错误测试数
- 10
- 尝试通过率
- 60.3%
- 输入令牌
- 35,892
- 输出令牌
- 21,752
- 推理令牌
- 42,754
- 响应时间(平均)
- 61.29s
- 响应时间(总计)
- 1164.50s
- 响应时间(最大)
- 304.19s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)42.21s
响应时间(最大)89.34s
响应时间(总计)168.84s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)59.65s
响应时间(最大)59.65s
响应时间(总计)59.65s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)304.19s
响应时间(最大)304.19s
响应时间(总计)304.19s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)37.36s
响应时间(最大)54.24s
响应时间(总计)74.71s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)64.92s
响应时间(最大)150.55s
响应时间(总计)194.76s
-
通用智能
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)58.26s
响应时间(最大)58.26s
响应时间(总计)58.26s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.78s
响应时间(最大)17.75s
响应时间(总计)23.55s
-
谜题求解
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)20.73s
响应时间(最大)42.39s
响应时间(总计)62.19s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)104.44s
响应时间(最大)104.44s
响应时间(总计)104.44s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)113.91s
响应时间(最大)113.91s
响应时间(总计)113.91s
|
| #76#76 |
Kimi K2.5medium
|
6.8… |
Moonshot AI |
$0.328
↓
…
|
98.43s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 2 无答案: 2 超时: 2
响应时间(平均)98.43s
响应时间(最大)281.00s
响应时间(总计)1378.03s
…
|
- 总测试数
- 21
- 错误测试数
- 11
- 尝试通过率
- 68.3%
- 输入令牌
- 34,312
- 输出令牌
- 48,379
- 推理令牌
- 157,747
- 响应时间(平均)
- 98.43s
- 响应时间(总计)
- 1378.03s
- 响应时间(最大)
- 281.00s
-
反AI技巧
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)51.38s
响应时间(最大)85.28s
响应时间(总计)102.75s
-
编程
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 超时: 1
响应时间(平均)217.49s
响应时间(最大)281.00s
响应时间(总计)652.48s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)71.37s
响应时间(最大)71.37s
响应时间(总计)71.37s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)49.78s
响应时间(最大)49.78s
响应时间(总计)49.78s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)137.29s
响应时间(最大)137.29s
响应时间(总计)137.29s
-
通用智能
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)69.73s
响应时间(最大)69.73s
响应时间(总计)69.73s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)92.47s
响应时间(最大)92.47s
响应时间(总计)92.47s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)43.23s
响应时间(最大)82.75s
响应时间(总计)86.47s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)31.74s
响应时间(最大)31.74s
响应时间(总计)31.74s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)83.95s
响应时间(最大)83.95s
响应时间(总计)83.95s
|
| #77#77 |
Claude Sonnet 4.6none
|
6.8… |
Anthropic |
$0.316
…
|
5.04s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 额外格式: 4 未遵循指令: 1
响应时间(平均)5.04s
响应时间(最大)23.84s
响应时间(总计)70.60s
…
|
- 总测试数
- 21
- 错误测试数
- 10
- 尝试通过率
- 55.6%
- 输入令牌
- 57,886
- 输出令牌
- 9,465
- 推理令牌
- 0
- 响应时间(平均)
- 5.04s
- 响应时间(总计)
- 70.60s
- 响应时间(最大)
- 23.84s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 答案错误: 1
响应时间(平均)2.94s
响应时间(最大)4.83s
响应时间(总计)5.88s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)5.19s
响应时间(最大)9.79s
响应时间(总计)15.56s
-
综合
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.84s
响应时间(最大)23.84s
响应时间(总计)23.84s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.43s
响应时间(最大)3.43s
响应时间(总计)3.43s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.54s
响应时间(最大)3.54s
响应时间(总计)3.54s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.56s
响应时间(最大)2.56s
响应时间(总计)2.56s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.96s
响应时间(最大)1.96s
响应时间(总计)1.96s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)2.53s
响应时间(最大)2.54s
响应时间(总计)5.06s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.11s
响应时间(最大)4.11s
响应时间(总计)4.11s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.67s
响应时间(最大)4.67s
响应时间(总计)4.67s
|
| #78#78 |
Qwen3.6 27Bmedium
|
6.8… |
Qwen |
$0.444
↑
…
|
59.71s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 无答案: 3 未遵循指令: 1 无效工具调用: 1
响应时间(平均)59.71s
响应时间(最大)168.22s
响应时间(总计)1254.01s
…
|
- 总测试数
- 21
- 错误测试数
- 11
- 尝试通过率
- 60.3%
- 输入令牌
- 39,376
- 输出令牌
- 16,189
- 推理令牌
- 122,521
- 响应时间(平均)
- 59.71s
- 响应时间(总计)
- 1254.01s
- 响应时间(最大)
- 168.22s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)12.62s
响应时间(最大)18.61s
响应时间(总计)50.50s
-
编程
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)142.99s
响应时间(最大)168.22s
响应时间(总计)428.96s
-
综合
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)83.07s
响应时间(最大)83.07s
响应时间(总计)83.07s
-
数据解析与提取
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 2
响应时间(平均)37.30s
响应时间(最大)54.01s
响应时间(总计)74.60s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)73.38s
响应时间(最大)101.55s
响应时间(总计)220.15s
-
通用智能
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)39.53s
响应时间(最大)39.53s
响应时间(总计)39.53s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)37.96s
响应时间(最大)47.48s
响应时间(总计)75.92s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)61.14s
响应时间(最大)97.76s
响应时间(总计)183.42s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)16.88s
响应时间(最大)16.88s
响应时间(总计)16.88s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)80.99s
响应时间(最大)80.99s
响应时间(总计)80.99s
|
| #80#80 |
Mimo V2 Omnimedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.7… |
Xiaomi |
$0.683
↓
…
|
41.16s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 2 无答案: 2 API 错误: 1 额外格式: 1
响应时间(平均)41.16s
响应时间(最大)299.23s
响应时间(总计)823.26s
…
|
- 总测试数
- 21
- 错误测试数
- 11
- 尝试通过率
- 55.6%
- 输入令牌
- 37,007
- 输出令牌
- 1,952
- 推理令牌
- 357,306
- 响应时间(平均)
- 41.16s
- 响应时间(总计)
- 823.26s
- 响应时间(最大)
- 299.23s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.75s
响应时间(最大)4.59s
响应时间(总计)10.98s
-
编程
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 无答案: 1 答案错误: 1
响应时间(平均)183.89s
响应时间(最大)299.23s
响应时间(总计)367.78s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)25.87s
响应时间(最大)25.87s
响应时间(总计)25.87s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.04s
响应时间(最大)4.12s
响应时间(总计)6.07s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 无答案: 1 答案错误: 1
响应时间(平均)47.89s
响应时间(最大)134.52s
响应时间(总计)143.67s
-
通用智能
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.61s
响应时间(最大)3.61s
响应时间(总计)3.61s
-
指令遵循
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.99s
响应时间(最大)7.14s
响应时间(总计)9.99s
-
谜题求解
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.38s
响应时间(最大)3.69s
响应时间(总计)7.13s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.98s
响应时间(最大)13.98s
响应时间(总计)13.98s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)234.19s
响应时间(最大)234.19s
响应时间(总计)234.19s
|
| #81#81 |
Mercury 2medium
|
6.6… |
Inception |
$0.058
…
|
2.24s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 未遵循指令: 3
响应时间(平均)2.24s
响应时间(最大)14.63s
响应时间(总计)44.72s
…
|
- 总测试数
- 21
- 错误测试数
- 11
- 尝试通过率
- 54.0%
- 输入令牌
- 35,116
- 输出令牌
- 4,048
- 推理令牌
- 61,219
- 响应时间(平均)
- 2.24s
- 响应时间(总计)
- 44.72s
- 响应时间(最大)
- 14.63s
-
反AI技巧
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)1.12s
响应时间(最大)2.46s
响应时间(总计)4.49s
-
编程
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.04s
响应时间(最大)3.06s
响应时间(总计)6.11s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.28s
响应时间(最大)3.28s
响应时间(总计)3.28s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.11s
响应时间(最大)1.47s
响应时间(总计)2.21s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)6.48s
响应时间(最大)14.63s
响应时间(总计)19.43s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)821ms
响应时间(最大)821ms
响应时间(总计)821ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.07s
响应时间(最大)1.07s
响应时间(总计)1.07s
-
谜题求解
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)949ms
响应时间(最大)1.18s
响应时间(总计)2.85s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.89s
响应时间(最大)1.89s
响应时间(总计)1.89s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.58s
响应时间(最大)2.58s
响应时间(总计)2.58s
|
| #82#82 |
Hy3 previewhigh已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.6… |
Tencent |
$0.048
↕
…
|
56.57s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 7 答案错误: 3
响应时间(平均)56.57s
响应时间(最大)149.94s
响应时间(总计)848.59s
…
|
- 总测试数
- 21
- 错误测试数
- 10
- 尝试通过率
- 55.6%
- 输入令牌
- 25,987
- 输出令牌
- 216,719
- 推理令牌
- 0
- 响应时间(平均)
- 56.57s
- 响应时间(总计)
- 848.59s
- 响应时间(最大)
- 149.94s
-
反AI技巧
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)15.12s
响应时间(最大)19.99s
响应时间(总计)45.37s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)99.76s
响应时间(最大)99.76s
响应时间(总计)99.76s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)113.09s
响应时间(最大)113.09s
响应时间(总计)113.09s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)12.11s
响应时间(最大)12.11s
响应时间(总计)12.11s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)109.04s
响应时间(最大)149.94s
响应时间(总计)327.11s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)34.36s
响应时间(最大)41.83s
响应时间(总计)68.73s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)27.94s
响应时间(最大)45.06s
响应时间(总计)55.89s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)78.83s
响应时间(最大)78.83s
响应时间(总计)78.83s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)47.71s
响应时间(最大)47.71s
响应时间(总计)47.71s
|
| #83#83 |
Step 3.5 Flashnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.6… |
Stepfun |
$0.020
…
|
39.03s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 4 未遵循指令: 1 答案错误: 1
响应时间(平均)39.03s
响应时间(最大)114.12s
响应时间(总计)312.26s
…
|
- 总测试数
- 12
- 错误测试数
- 6
- 尝试通过率
- 50.0%
- 输入令牌
- 1,971
- 输出令牌
- 64,795
- 推理令牌
- 0
- 响应时间(平均)
- 39.03s
- 响应时间(总计)
- 312.26s
- 响应时间(最大)
- 114.12s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)34.99s
响应时间(最大)109.60s
响应时间(总计)139.95s
-
编程
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
领域专项
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)34.54s
响应时间(最大)34.54s
响应时间(总计)34.54s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)14.37s
响应时间(最大)14.37s
响应时间(总计)14.37s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.30s
响应时间(最大)9.30s
响应时间(总计)9.30s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)114.12s
响应时间(最大)114.12s
响应时间(总计)114.12s
|
| #85#85 |
Gemma 4 31Bnone
|
6.5… |
Google |
$0.004
↓
…
|
4.05s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 API 错误: 2 未遵循指令: 1
响应时间(平均)4.05s
响应时间(最大)26.13s
响应时间(总计)76.87s
…
|
- 总测试数
- 21
- 错误测试数
- 11
- 尝试通过率
- 47.6%
- 输入令牌
- 20,911
- 输出令牌
- 1,407
- 推理令牌
- 0
- 响应时间(平均)
- 4.05s
- 响应时间(总计)
- 76.87s
- 响应时间(最大)
- 26.13s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.85s
响应时间(最大)4.45s
响应时间(总计)7.40s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)11.19s
响应时间(最大)26.13s
响应时间(总计)33.58s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.25s
响应时间(最大)3.02s
响应时间(总计)4.51s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.22s
响应时间(最大)4.68s
响应时间(总计)9.67s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.09s
响应时间(最大)2.09s
响应时间(总计)2.09s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.84s
响应时间(最大)4.45s
响应时间(总计)5.68s
-
谜题求解
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)4.23s
响应时间(最大)7.63s
响应时间(总计)12.69s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.25s
响应时间(最大)1.25s
响应时间(总计)1.25s
|
| #86#86 |
Grok 4.1 Fastmedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.5… |
X AI |
$0.069
↑
…
|
23.85s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 4 答案错误: 4 无答案: 1 超时: 1
响应时间(平均)23.85s
响应时间(最大)121.79s
响应时间(总计)286.16s
…
|
- 总测试数
- 19
- 错误测试数
- 10
- 尝试通过率
- 61.4%
- 输入令牌
- 42,845
- 输出令牌
- 2,006
- 推理令牌
- 96,334
- 响应时间(平均)
- 23.85s
- 响应时间(总计)
- 286.16s
- 响应时间(最大)
- 121.79s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.81s
响应时间(最大)5.65s
响应时间(总计)7.62s
-
编程
: 2.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)23.58s
响应时间(最大)23.58s
响应时间(总计)23.58s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)37.64s
响应时间(最大)37.64s
响应时间(总计)37.64s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.63s
响应时间(最大)6.63s
响应时间(总计)6.63s
-
领域专项
: 5.8
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)121.79s
响应时间(最大)121.79s
响应时间(总计)121.79s
-
通用智能
: 4.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)16.25s
响应时间(最大)16.25s
响应时间(总计)16.25s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.63s
响应时间(最大)4.63s
响应时间(总计)4.63s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)7.40s
响应时间(最大)7.79s
响应时间(总计)14.81s
-
工具调用
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)27.71s
响应时间(最大)27.71s
响应时间(总计)27.71s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)25.52s
响应时间(最大)25.52s
响应时间(总计)25.52s
|
| #87#87 |
Gemini 3.1 Flash Liteminimal
|
6.4… |
Google |
$0.013
…
|
1.33s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 未遵循指令: 3
响应时间(平均)1.33s
响应时间(最大)4.49s
响应时间(总计)27.91s
…
|
- 总测试数
- 21
- 错误测试数
- 11
- 尝试通过率
- 54.0%
- 输入令牌
- 36,973
- 输出令牌
- 2,487
- 推理令牌
- 0
- 响应时间(平均)
- 1.33s
- 响应时间(总计)
- 27.91s
- 响应时间(最大)
- 4.49s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.10s
响应时间(最大)1.65s
响应时间(总计)4.42s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)831ms
响应时间(最大)1.31s
响应时间(总计)2.49s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.53s
响应时间(最大)2.53s
响应时间(总计)2.53s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.04s
响应时间(最大)1.32s
响应时间(总计)2.07s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.02s
响应时间(最大)1.16s
响应时间(总计)3.06s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)791ms
响应时间(最大)791ms
响应时间(总计)791ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)932ms
响应时间(最大)1.00s
响应时间(总计)1.86s
-
谜题求解
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2
响应时间(平均)2.15s
响应时间(最大)4.49s
响应时间(总计)6.45s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.51s
响应时间(最大)3.51s
响应时间(总计)3.51s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)724ms
响应时间(最大)724ms
响应时间(总计)724ms
|
| #88#88 |
Qwen3.7 Plusnone
|
6.4… |
Qwen |
$0.028
…
|
2.85s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 1
响应时间(平均)2.85s
响应时间(最大)29.38s
响应时间(总计)59.86s
…
|
- 总测试数
- 21
- 错误测试数
- 11
- 尝试通过率
- 47.6%
- 输入令牌
- 42,510
- 输出令牌
- 6,578
- 推理令牌
- 0
- 响应时间(平均)
- 2.85s
- 响应时间(总计)
- 59.86s
- 响应时间(最大)
- 29.38s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.38s
响应时间(最大)2.69s
响应时间(总计)5.51s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.15s
响应时间(最大)4.39s
响应时间(总计)6.44s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)29.38s
响应时间(最大)29.38s
响应时间(总计)29.38s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.43s
响应时间(最大)1.57s
响应时间(总计)2.86s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)868ms
响应时间(最大)1.02s
响应时间(总计)2.60s
-
通用智能
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.33s
响应时间(最大)1.33s
响应时间(总计)1.33s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)929ms
响应时间(最大)1.05s
响应时间(总计)1.86s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.71s
响应时间(最大)2.65s
响应时间(总计)5.13s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.54s
响应时间(最大)3.54s
响应时间(总计)3.54s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.21s
响应时间(最大)1.21s
响应时间(总计)1.21s
|
| #89#89 |
Hy3 previewlow已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.4… |
Tencent |
$0.015
↕
…
|
24.56s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 7 答案错误: 4
响应时间(平均)24.56s
响应时间(最大)78.74s
响应时间(总计)368.35s
…
|
- 总测试数
- 21
- 错误测试数
- 11
- 尝试通过率
- 52.4%
- 输入令牌
- 21,045
- 输出令牌
- 63,460
- 推理令牌
- 0
- 响应时间(平均)
- 24.56s
- 响应时间(总计)
- 368.35s
- 响应时间(最大)
- 78.74s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)9.32s
响应时间(最大)12.36s
响应时间(总计)27.96s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)27.94s
响应时间(最大)27.94s
响应时间(总计)27.94s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)78.74s
响应时间(最大)78.74s
响应时间(总计)78.74s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)5.85s
响应时间(最大)5.85s
响应时间(总计)5.85s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)40.44s
响应时间(最大)46.32s
响应时间(总计)121.31s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.98s
响应时间(最大)22.24s
响应时间(总计)31.97s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)7.51s
响应时间(最大)7.86s
响应时间(总计)15.02s
-
工具调用
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)17.84s
响应时间(最大)17.84s
响应时间(总计)17.84s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)41.74s
响应时间(最大)41.74s
响应时间(总计)41.74s
|
| #90#90 |
Gemini 3.1 Flash Litenone
|
6.4… |
Google |
$0.013
…
|
1.06s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11 未遵循指令: 1
响应时间(平均)1.06s
响应时间(最大)2.97s
响应时间(总计)22.35s
…
|
- 总测试数
- 21
- 错误测试数
- 12
- 尝试通过率
- 52.4%
- 输入令牌
- 36,710
- 输出令牌
- 2,484
- 推理令牌
- 0
- 响应时间(平均)
- 1.06s
- 响应时间(总计)
- 22.35s
- 响应时间(最大)
- 2.97s
-
反AI技巧
: 7.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.07s
响应时间(最大)1.91s
响应时间(总计)4.27s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)938ms
响应时间(最大)1.59s
响应时间(总计)2.81s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.73s
响应时间(最大)2.73s
响应时间(总计)2.73s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)843ms
响应时间(最大)907ms
响应时间(总计)1.69s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)762ms
响应时间(最大)814ms
响应时间(总计)2.29s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)992ms
响应时间(最大)992ms
响应时间(总计)992ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)859ms
响应时间(最大)975ms
响应时间(总计)1.72s
-
谜题求解
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)720ms
响应时间(最大)826ms
响应时间(总计)2.16s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.97s
响应时间(最大)2.97s
响应时间(总计)2.97s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)733ms
响应时间(最大)733ms
响应时间(总计)733ms
|
| #91#91 |
GPT-5.5none
|
6.4… |
OpenAI |
$0.231
…
|
1.89s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 11
响应时间(平均)1.89s
响应时间(最大)5.56s
响应时间(总计)39.64s
…
|
- 总测试数
- 21
- 错误测试数
- 11
- 尝试通过率
- 54.0%
- 输入令牌
- 34,212
- 输出令牌
- 1,971
- 推理令牌
- 0
- 响应时间(平均)
- 1.89s
- 响应时间(总计)
- 39.64s
- 响应时间(最大)
- 5.56s
-
反AI技巧
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.31s
响应时间(最大)2.08s
响应时间(总计)5.25s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.35s
响应时间(最大)2.05s
响应时间(总计)4.05s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.56s
响应时间(最大)5.56s
响应时间(总计)5.56s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.18s
响应时间(最大)1.24s
响应时间(总计)2.37s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.31s
响应时间(最大)1.39s
响应时间(总计)3.92s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.41s
响应时间(最大)3.41s
响应时间(总计)3.41s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.15s
响应时间(最大)1.19s
响应时间(总计)2.31s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.29s
响应时间(最大)1.56s
响应时间(总计)3.87s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.90s
响应时间(最大)3.90s
响应时间(总计)3.90s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.01s
响应时间(最大)5.01s
响应时间(总计)5.01s
|
| #92#92 |
Laguna M.1medium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.4… |
Poolside |
$0.000
…
|
14.73s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 4 答案错误: 4 未遵循指令: 1 无答案: 1
响应时间(平均)14.73s
响应时间(最大)53.14s
响应时间(总计)220.93s
…
|
- 总测试数
- 19
- 错误测试数
- 10
- 尝试通过率
- 52.6%
- 输入令牌
- 44,969
- 输出令牌
- 58,087
- 推理令牌
- 0
- 响应时间(平均)
- 14.73s
- 响应时间(总计)
- 220.93s
- 响应时间(最大)
- 53.14s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)4.87s
响应时间(最大)6.30s
响应时间(总计)14.62s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)35.61s
响应时间(最大)35.61s
响应时间(总计)35.61s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)53.14s
响应时间(最大)53.14s
响应时间(总计)53.14s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.93s
响应时间(最大)5.03s
响应时间(总计)9.86s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)24.14s
响应时间(最大)45.83s
响应时间(总计)72.43s
-
通用智能
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.30s
响应时间(最大)6.00s
响应时间(总计)8.59s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)10.19s
响应时间(最大)14.92s
响应时间(总计)20.37s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.31s
响应时间(最大)6.31s
响应时间(总计)6.31s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #94#94 |
GPT-5 Nanomedium
|
6.3… |
OpenAI |
$0.081
…
|
42.51s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 2 超时: 1
响应时间(平均)42.51s
响应时间(最大)204.02s
响应时间(总计)595.09s
…
|
- 总测试数
- 21
- 错误测试数
- 12
- 尝试通过率
- 57.1%
- 输入令牌
- 34,108
- 输出令牌
- 5,464
- 推理令牌
- 192,064
- 响应时间(平均)
- 42.51s
- 响应时间(总计)
- 595.09s
- 响应时间(最大)
- 204.02s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)25.50s
响应时间(最大)37.73s
响应时间(总计)51.00s
-
编程
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)41.62s
响应时间(最大)54.86s
响应时间(总计)124.86s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)65.96s
响应时间(最大)65.96s
响应时间(总计)65.96s
-
数据解析与提取
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)21.42s
响应时间(最大)21.42s
响应时间(总计)21.42s
-
领域专项
: 5.2
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)204.02s
响应时间(最大)204.02s
响应时间(总计)204.02s
-
通用智能
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)17.51s
响应时间(最大)17.51s
响应时间(总计)17.51s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.64s
响应时间(最大)15.64s
响应时间(总计)15.64s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)20.63s
响应时间(最大)22.94s
响应时间(总计)41.26s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)33.30s
响应时间(最大)33.30s
响应时间(总计)33.30s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)20.13s
响应时间(最大)20.13s
响应时间(总计)20.13s
|
| #95#95 |
Qwen3.5 Plus 2026-02-15none
|
6.3… |
Qwen |
$0.016
↓
…
|
2.31s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12
响应时间(平均)2.31s
响应时间(最大)6.65s
响应时间(总计)34.63s
…
|
- 总测试数
- 21
- 错误测试数
- 12
- 尝试通过率
- 46.0%
- 输入令牌
- 45,864
- 输出令牌
- 2,480
- 推理令牌
- 0
- 响应时间(平均)
- 2.31s
- 响应时间(总计)
- 34.63s
- 响应时间(最大)
- 6.65s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)1.91s
响应时间(最大)2.74s
响应时间(总计)3.82s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.05s
响应时间(最大)3.63s
响应时间(总计)6.15s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.65s
响应时间(最大)6.65s
响应时间(总计)6.65s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.89s
响应时间(最大)1.89s
响应时间(总计)1.89s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.17s
响应时间(最大)1.44s
响应时间(总计)2.33s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.26s
响应时间(最大)2.26s
响应时间(总计)2.26s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.67s
响应时间(最大)1.67s
响应时间(总计)1.67s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.71s
响应时间(最大)3.29s
响应时间(总计)5.41s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.33s
响应时间(最大)3.33s
响应时间(总计)3.33s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.11s
响应时间(最大)1.11s
响应时间(总计)1.11s
|
| #96#96 |
Ring-2.6-1Tnone
|
6.2… |
Inclusionai |
$0.026
↕
…
|
55.10s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 5 答案错误: 5 未遵循指令: 2
响应时间(平均)55.10s
响应时间(最大)143.82s
响应时间(总计)881.55s
…
|
- 总测试数
- 21
- 错误测试数
- 12
- 尝试通过率
- 47.6%
- 输入令牌
- 7,599
- 输出令牌
- 39,954
- 推理令牌
- 0
- 响应时间(平均)
- 55.10s
- 响应时间(总计)
- 881.55s
- 响应时间(最大)
- 143.82s
-
反AI技巧
: 9.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)43.33s
响应时间(最大)71.76s
响应时间(总计)173.31s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)143.82s
响应时间(最大)143.82s
响应时间(总计)143.82s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)45.87s
响应时间(最大)45.87s
响应时间(总计)45.87s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)73.40s
响应时间(最大)90.09s
响应时间(总计)220.20s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)15.63s
响应时间(最大)15.63s
响应时间(总计)15.63s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)27.36s
响应时间(最大)40.24s
响应时间(总计)54.72s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)31.47s
响应时间(最大)46.84s
响应时间(总计)94.41s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)133.60s
响应时间(最大)133.60s
响应时间(总计)133.60s
|
| #97#97 |
Gemini 2.5 Flashnone
|
6.2… |
Google |
$0.016
…
|
875ms… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12
响应时间(平均)875ms
响应时间(最大)4.39s
响应时间(总计)18.37s
…
|
- 总测试数
- 21
- 错误测试数
- 12
- 尝试通过率
- 46.0%
- 输入令牌
- 35,926
- 输出令牌
- 1,770
- 推理令牌
- 0
- 响应时间(平均)
- 875ms
- 响应时间(总计)
- 18.37s
- 响应时间(最大)
- 4.39s
-
反AI技巧
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)582ms
响应时间(最大)844ms
响应时间(总计)2.33s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)736ms
响应时间(最大)1.16s
响应时间(总计)2.21s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.39s
响应时间(最大)4.39s
响应时间(总计)4.39s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)652ms
响应时间(最大)660ms
响应时间(总计)1.30s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)495ms
响应时间(最大)642ms
响应时间(总计)1.49s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)615ms
响应时间(最大)615ms
响应时间(总计)615ms
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)590ms
响应时间(最大)622ms
响应时间(总计)1.18s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)604ms
响应时间(最大)700ms
响应时间(总计)1.81s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.91s
响应时间(最大)1.91s
响应时间(总计)1.91s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.15s
响应时间(最大)1.15s
响应时间(总计)1.15s
|
| #98#98 |
GLM 5none
|
6.1… |
Z.ai |
$0.027
↑
…
|
4.03s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 12
响应时间(平均)4.03s
响应时间(最大)11.07s
响应时间(总计)56.37s
…
|
- 总测试数
- 21
- 错误测试数
- 12
- 尝试通过率
- 44.4%
- 输入令牌
- 37,135
- 输出令牌
- 1,989
- 推理令牌
- 0
- 响应时间(平均)
- 4.03s
- 响应时间(总计)
- 56.37s
- 响应时间(最大)
- 11.07s
-
反AI技巧
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.37s
响应时间(最大)3.39s
响应时间(总计)4.75s
-
编程
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)5.12s
响应时间(最大)8.84s
响应时间(总计)15.36s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.98s
响应时间(最大)4.98s
响应时间(总计)4.98s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.78s
响应时间(最大)5.78s
响应时间(总计)5.78s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.24s
响应时间(最大)2.24s
响应时间(总计)2.24s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.27s
响应时间(最大)3.27s
响应时间(总计)3.27s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.48s
响应时间(最大)1.48s
响应时间(总计)1.48s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.91s
响应时间(最大)2.08s
响应时间(总计)3.82s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.07s
响应时间(最大)11.07s
响应时间(总计)11.07s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.62s
响应时间(最大)3.62s
响应时间(总计)3.62s
|
| #99#99 |
gpt-oss-120bmedium
|
6.1… |
OpenAI |
$0.013
↓
…
|
22.28s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 未遵循指令: 3
响应时间(平均)22.28s
响应时间(最大)68.16s
响应时间(总计)311.96s
…
|
- 总测试数
- 21
- 错误测试数
- 12
- 尝试通过率
- 52.4%
- 输入令牌
- 39,084
- 输出令牌
- 20,013
- 推理令牌
- 50,233
- 响应时间(平均)
- 22.28s
- 响应时间(总计)
- 311.96s
- 响应时间(最大)
- 68.16s
-
反AI技巧
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)10.21s
响应时间(最大)19.76s
响应时间(总计)20.43s
-
编程
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)38.37s
响应时间(最大)68.16s
响应时间(总计)115.10s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)31.18s
响应时间(最大)31.18s
响应时间(总计)31.18s
-
数据解析与提取
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.98s
响应时间(最大)1.98s
响应时间(总计)1.98s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)50.92s
响应时间(最大)50.92s
响应时间(总计)50.92s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)7.90s
响应时间(最大)7.90s
响应时间(总计)7.90s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.63s
响应时间(最大)7.63s
响应时间(总计)7.63s
-
谜题求解
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)21.71s
响应时间(最大)32.40s
响应时间(总计)43.41s
-
工具调用
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.91s
响应时间(最大)6.91s
响应时间(总计)6.91s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)26.51s
响应时间(最大)26.51s
响应时间(总计)26.51s
|
| #100#100 |
Grok Build 0.1none已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.0… |
X AI |
$0.547
…
|
28.69s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 API 错误: 3 未遵循指令: 2
响应时间(平均)28.69s
响应时间(最大)138.35s
响应时间(总计)459.00s
…
|
- 总测试数
- 19
- 错误测试数
- 12
- 尝试通过率
- 50.9%
- 输入令牌
- 11,793
- 输出令牌
- 267,275
- 推理令牌
- 0
- 响应时间(平均)
- 28.69s
- 响应时间(总计)
- 459.00s
- 响应时间(最大)
- 138.35s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.30s
响应时间(最大)9.80s
响应时间(总计)25.20s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.41s
响应时间(最大)21.41s
响应时间(总计)21.41s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)9.33s
响应时间(最大)9.33s
响应时间(总计)9.33s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)103.71s
响应时间(最大)138.35s
响应时间(总计)311.13s
-
通用智能
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)12.47s
响应时间(最大)12.47s
响应时间(总计)12.47s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.36s
响应时间(最大)11.05s
响应时间(总计)14.73s
-
谜题求解
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)9.55s
响应时间(最大)18.18s
响应时间(总计)28.65s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)36.09s
响应时间(最大)36.09s
响应时间(总计)36.09s
|
| #101#101 |
Mimo V2 Omninone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
6.0… |
Xiaomi |
$0.021
↓
…
|
2.44s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 API 错误: 1 额外格式: 1 未遵循指令: 1
响应时间(平均)2.44s
响应时间(最大)6.81s
响应时间(总计)48.81s
…
|
- 总测试数
- 21
- 错误测试数
- 13
- 尝试通过率
- 39.7%
- 输入令牌
- 40,852
- 输出令牌
- 3,314
- 推理令牌
- 0
- 响应时间(平均)
- 2.44s
- 响应时间(总计)
- 48.81s
- 响应时间(最大)
- 6.81s
-
反AI技巧
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1
响应时间(平均)1.63s
响应时间(最大)3.29s
响应时间(总计)6.52s
-
编程
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 额外格式: 1 答案错误: 1
响应时间(平均)2.75s
响应时间(最大)3.79s
响应时间(总计)5.50s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.96s
响应时间(最大)5.96s
响应时间(总计)5.96s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.76s
响应时间(最大)2.60s
响应时间(总计)3.51s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.10s
响应时间(最大)3.58s
响应时间(总计)6.30s
-
通用智能
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.33s
响应时间(最大)2.33s
响应时间(总计)2.33s
-
指令遵循
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.26s
响应时间(最大)6.81s
响应时间(总计)8.51s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.16s
响应时间(最大)1.55s
响应时间(总计)3.48s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.40s
响应时间(最大)5.40s
响应时间(总计)5.40s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.30s
响应时间(最大)1.30s
响应时间(总计)1.30s
|
| #102#102 |
Gemma 4 26B A4Bnone
|
6.0… |
Google |
$0.004
↓
…
|
5.91s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 2 超时: 1
响应时间(平均)5.91s
响应时间(最大)57.10s
响应时间(总计)124.05s
…
|
- 总测试数
- 21
- 错误测试数
- 13
- 尝试通过率
- 44.4%
- 输入令牌
- 40,038
- 输出令牌
- 1,824
- 推理令牌
- 0
- 响应时间(平均)
- 5.91s
- 响应时间(总计)
- 124.05s
- 响应时间(最大)
- 57.10s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.28s
响应时间(最大)2.09s
响应时间(总计)5.13s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)4.16s
响应时间(最大)7.07s
响应时间(总计)12.48s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)30.53s
响应时间(最大)30.53s
响应时间(总计)30.53s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.70s
响应时间(最大)2.21s
响应时间(总计)3.41s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)2.49s
响应时间(最大)4.23s
响应时间(总计)7.48s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.54s
响应时间(最大)3.54s
响应时间(总计)3.54s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)690ms
响应时间(最大)878ms
响应时间(总计)1.38s
-
谜题求解
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)744ms
响应时间(最大)972ms
响应时间(总计)2.23s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)57.10s
响应时间(最大)57.10s
响应时间(总计)57.10s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)778ms
响应时间(最大)778ms
响应时间(总计)778ms
|