| #151#151 |
MiMo-V2.6-Flashlow
|
7.1… |
Xiaomi |
$0.200
…
|
54.57s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 2 无答案: 2 额外格式: 1 无效工具调用: 1
响应时间(平均)54.57s
响应时间(最大)345.18s
响应时间(总计)1255.15s
…
|
- 总测试数
- 23
- 错误测试数
- 11
- 尝试通过率
- 66.7%
- 输入令牌
- 256,428
- 输出令牌
- 9,786
- 推理令牌
- 575,630
- 响应时间(平均)
- 54.57s
- 响应时间(总计)
- 1255.15s
- 响应时间(最大)
- 345.18s
-
智能体任务
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)107.91s
响应时间(最大)107.91s
响应时间(总计)107.91s
-
反AI技巧
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.51s
响应时间(最大)3.18s
响应时间(总计)6.04s
-
编程
: 8.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.97s
响应时间(最大)12.52s
响应时间(总计)32.91s
-
综合
: 6.6
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)20.80s
响应时间(最大)31.28s
响应时间(总计)41.61s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.51s
响应时间(最大)1.82s
响应时间(总计)3.02s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 2 额外格式: 1
响应时间(平均)276.95s
响应时间(最大)345.18s
响应时间(总计)830.85s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.60s
响应时间(最大)1.60s
响应时间(总计)1.60s
-
指令遵循
: 8.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)955ms
响应时间(最大)1.10s
响应时间(总计)1.91s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)24.19s
响应时间(最大)69.75s
响应时间(总计)72.58s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.29s
响应时间(最大)2.29s
响应时间(总计)2.29s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)154.43s
响应时间(最大)154.43s
响应时间(总计)154.43s
|
| #152#152 |
MiMo-V2.5medium
|
7.1… |
Xiaomi |
$0.130
↓
…
|
49.20s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 额外格式: 2 无答案: 2 未遵循指令: 1 无效工具调用: 1
响应时间(平均)49.20s
响应时间(最大)316.27s
响应时间(总计)1131.69s
…
|
- 总测试数
- 23
- 错误测试数
- 11
- 尝试通过率
- 69.6%
- 输入令牌
- 259,664
- 输出令牌
- 8,414
- 推理令牌
- 333,097
- 响应时间(平均)
- 49.20s
- 响应时间(总计)
- 1131.69s
- 响应时间(最大)
- 316.27s
-
智能体任务
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)113.57s
响应时间(最大)113.57s
响应时间(总计)113.57s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.14s
响应时间(最大)12.41s
响应时间(总计)16.57s
-
编程
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)97.14s
响应时间(最大)162.44s
响应时间(总计)291.41s
-
综合
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)77.97s
响应时间(最大)139.08s
响应时间(总计)155.93s
-
数据解析与提取
: 2.7
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)6.33s
响应时间(最大)7.45s
响应时间(总计)12.67s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 无答案: 1 答案错误: 1
响应时间(平均)137.75s
响应时间(最大)316.27s
响应时间(总计)413.25s
-
通用智能
: 5.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)5.37s
响应时间(最大)5.37s
响应时间(总计)5.37s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.80s
响应时间(最大)1.81s
响应时间(总计)3.60s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)20.25s
响应时间(最大)57.93s
响应时间(总计)60.76s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.29s
响应时间(最大)7.29s
响应时间(总计)7.29s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)51.29s
响应时间(最大)51.29s
响应时间(总计)51.29s
|
| #153#153 |
GPT-5.2 Chatnone
|
7.0… |
OpenAI |
$0.594
…
|
7.43s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 API 错误: 2 未遵循指令: 1 无答案: 1
响应时间(平均)7.43s
响应时间(最大)38.52s
响应时间(总计)163.35s
…
|
- 总测试数
- 23
- 错误测试数
- 10
- 尝试通过率
- 66.7%
- 输入令牌
- 101,104
- 输出令牌
- 29,742
- 推理令牌
- 0
- 响应时间(平均)
- 7.43s
- 响应时间(总计)
- 163.35s
- 响应时间(最大)
- 38.52s
-
智能体任务
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)955ms
响应时间(最大)955ms
响应时间(总计)955ms
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.40s
响应时间(最大)4.78s
响应时间(总计)13.59s
-
编程
: 8.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.82s
响应时间(最大)13.35s
响应时间(总计)29.45s
-
综合
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)13.91s
响应时间(最大)18.70s
响应时间(总计)27.82s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.05s
响应时间(最大)3.33s
响应时间(总计)6.10s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)23.67s
响应时间(最大)38.52s
响应时间(总计)47.34s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.20s
响应时间(最大)3.20s
响应时间(总计)3.20s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.51s
响应时间(最大)6.55s
响应时间(总计)11.02s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.10s
响应时间(最大)5.04s
响应时间(总计)12.31s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.68s
响应时间(最大)4.68s
响应时间(总计)4.68s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.89s
响应时间(最大)6.89s
响应时间(总计)6.89s
|
| #154#154 |
Qwen3.6 Max Previewmedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
7.0… |
Qwen |
$1.132
↓
…
|
66.52s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 超时: 1
响应时间(平均)66.52s
响应时间(最大)238.07s
响应时间(总计)1463.50s
…
|
- 总测试数
- 22
- 错误测试数
- 5
- 尝试通过率
- 79.7%
- 输入令牌
- 79,249
- 输出令牌
- 5,097
- 推理令牌
- 165,276
- 响应时间(平均)
- 66.52s
- 响应时间(总计)
- 1463.50s
- 响应时间(最大)
- 238.07s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)22.13s
响应时间(最大)28.70s
响应时间(总计)88.50s
-
编程
: 8.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)146.48s
响应时间(最大)238.07s
响应时间(总计)439.45s
-
综合
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)177.48s
响应时间(最大)233.47s
响应时间(总计)354.96s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)41.15s
响应时间(最大)48.02s
响应时间(总计)82.30s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)88.53s
响应时间(最大)186.74s
响应时间(总计)265.58s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)32.24s
响应时间(最大)32.24s
响应时间(总计)32.24s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)24.31s
响应时间(最大)27.94s
响应时间(总计)48.63s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)24.32s
响应时间(最大)37.68s
响应时间(总计)72.96s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)18.32s
响应时间(最大)18.32s
响应时间(总计)18.32s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)60.56s
响应时间(最大)60.56s
响应时间(总计)60.56s
|
| #155#155 |
Gemini 3.1 Flash Lite Previewmedium
|
7.0… |
Google |
$0.158
…
|
6.78s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7 未遵循指令: 1 无效工具调用: 1
响应时间(平均)6.78s
响应时间(最大)54.91s
响应时间(总计)155.96s
…
|
- 总测试数
- 23
- 错误测试数
- 9
- 尝试通过率
- 60.9%
- 输入令牌
- 272,221
- 输出令牌
- 12,345
- 推理令牌
- 47,189
- 响应时间(平均)
- 6.78s
- 响应时间(总计)
- 155.96s
- 响应时间(最大)
- 54.91s
-
智能体任务
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)54.91s
响应时间(最大)54.91s
响应时间(总计)54.91s
-
反AI技巧
: 9.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.33s
响应时间(最大)3.89s
响应时间(总计)9.30s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.09s
响应时间(最大)4.34s
响应时间(总计)12.27s
-
综合
: 7.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)16.63s
响应时间(最大)18.34s
响应时间(总计)33.26s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.29s
响应时间(最大)2.31s
响应时间(总计)4.59s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.09s
响应时间(最大)5.86s
响应时间(总计)12.28s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.16s
响应时间(最大)3.16s
响应时间(总计)3.16s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.91s
响应时间(最大)1.93s
响应时间(总计)3.82s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.30s
响应时间(最大)9.55s
响应时间(总计)15.89s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.80s
响应时间(最大)3.80s
响应时间(总计)3.80s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.68s
响应时间(最大)2.68s
响应时间(总计)2.68s
|
| #156#156 |
Kimi K2.7 Codemedium
|
7.0… |
Moonshot AI |
$1.136
↑
…
|
81.18s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 超时: 2 API 错误: 1 未遵循指令: 1
响应时间(平均)81.18s
响应时间(最大)365.80s
响应时间(总计)1785.87s
…
|
- 总测试数
- 23
- 错误测试数
- 12
- 尝试通过率
- 60.9%
- 输入令牌
- 245,179
- 输出令牌
- 62,697
- 推理令牌
- 196,621
- 响应时间(平均)
- 81.18s
- 响应时间(总计)
- 1785.87s
- 响应时间(最大)
- 365.80s
-
智能体任务
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)104.02s
响应时间(最大)104.02s
响应时间(总计)104.02s
-
反AI技巧
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)11.56s
响应时间(最大)16.30s
响应时间(总计)46.24s
-
编程
: 7.8
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)146.73s
响应时间(最大)365.80s
响应时间(总计)440.18s
-
综合
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)66.03s
响应时间(最大)97.22s
响应时间(总计)132.06s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.27s
响应时间(最大)18.56s
响应时间(总计)24.54s
-
领域专项
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)184.17s
响应时间(最大)331.73s
响应时间(总计)552.51s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.78s
响应时间(最大)10.78s
响应时间(总计)10.78s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.39s
响应时间(最大)6.01s
响应时间(总计)10.78s
-
谜题求解
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)41.00s
响应时间(最大)113.78s
响应时间(总计)123.01s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)341.76s
响应时间(最大)341.76s
响应时间(总计)341.76s
|
| #157#157 |
Ember-1low
|
7.0… |
Fireworks |
$1.488
…
|
34.90s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 6 答案错误: 3 无效工具调用: 1
响应时间(平均)34.90s
响应时间(最大)121.29s
响应时间(总计)802.79s
…
|
- 总测试数
- 23
- 错误测试数
- 10
- 尝试通过率
- 65.2%
- 输入令牌
- 211,908
- 输出令牌
- 14,158
- 推理令牌
- 42,608
- 响应时间(平均)
- 34.90s
- 响应时间(总计)
- 802.79s
- 响应时间(最大)
- 121.29s
-
智能体任务
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)121.29s
响应时间(最大)121.29s
响应时间(总计)121.29s
-
反AI技巧
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)22.18s
响应时间(最大)60.05s
响应时间(总计)88.72s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)37.91s
响应时间(最大)60.34s
响应时间(总计)113.74s
-
综合
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)51.45s
响应时间(最大)93.10s
响应时间(总计)102.91s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)34.82s
响应时间(最大)62.94s
响应时间(总计)69.64s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)56.17s
响应时间(最大)77.05s
响应时间(总计)168.51s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.67s
响应时间(最大)5.67s
响应时间(总计)5.67s
-
指令遵循
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)32.73s
响应时间(最大)60.73s
响应时间(总计)65.46s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.27s
响应时间(最大)4.30s
响应时间(总计)9.82s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)26.43s
响应时间(最大)26.43s
响应时间(总计)26.43s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)30.60s
响应时间(最大)30.60s
响应时间(总计)30.60s
|
| #158#158 |
Qwen3.5-122B-A10Bmedium
|
7.0… |
Qwen |
$1.152
↓
…
|
66.96s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 无效工具调用: 2 超时: 2
响应时间(平均)66.96s
响应时间(最大)519.30s
响应时间(总计)1539.99s
…
|
- 总测试数
- 23
- 错误测试数
- 9
- 尝试通过率
- 71.0%
- 输入令牌
- 251,695
- 输出令牌
- 49,415
- 推理令牌
- 472,775
- 响应时间(平均)
- 66.96s
- 响应时间(总计)
- 1539.99s
- 响应时间(最大)
- 519.30s
-
智能体任务
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)95.31s
响应时间(最大)95.31s
响应时间(总计)95.31s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.75s
响应时间(最大)18.03s
响应时间(总计)39.01s
-
编程
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)114.48s
响应时间(最大)168.16s
响应时间(总计)343.44s
-
综合
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)313.55s
响应时间(最大)519.30s
响应时间(总计)627.09s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.41s
响应时间(最大)29.79s
响应时间(总计)46.83s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)74.43s
响应时间(最大)119.29s
响应时间(总计)223.29s
-
通用智能
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)34.11s
响应时间(最大)34.11s
响应时间(总计)34.11s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.88s
响应时间(最大)15.44s
响应时间(总计)19.76s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.89s
响应时间(最大)31.99s
响应时间(总计)53.68s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.60s
响应时间(最大)4.60s
响应时间(总计)4.60s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)52.87s
响应时间(最大)52.87s
响应时间(总计)52.87s
|
| #159#159 |
Grok 4.6low
|
6.9… |
X AI |
$0.781
…
|
16.44s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8
响应时间(平均)16.44s
响应时间(最大)57.97s
响应时间(总计)378.14s
…
|
- 总测试数
- 23
- 错误测试数
- 8
- 尝试通过率
- 66.7%
- 输入令牌
- 263,427
- 输出令牌
- 6,006
- 推理令牌
- 36,309
- 响应时间(平均)
- 16.44s
- 响应时间(总计)
- 378.14s
- 响应时间(最大)
- 57.97s
-
智能体任务
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)57.97s
响应时间(最大)57.97s
响应时间(总计)57.97s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.00s
响应时间(最大)10.98s
响应时间(总计)36.02s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)21.69s
响应时间(最大)26.46s
响应时间(总计)65.08s
-
综合
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)23.33s
响应时间(最大)25.51s
响应时间(总计)46.67s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.63s
响应时间(最大)13.54s
响应时间(总计)23.25s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)18.19s
响应时间(最大)23.65s
响应时间(总计)54.57s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)16.29s
响应时间(最大)16.29s
响应时间(总计)16.29s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.64s
响应时间(最大)8.11s
响应时间(总计)13.28s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.16s
响应时间(最大)10.89s
响应时间(总计)24.49s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.42s
响应时间(最大)14.42s
响应时间(总计)14.42s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)26.11s
响应时间(最大)26.11s
响应时间(总计)26.11s
|
| #160#160 |
Gemini 3 Flash Previewlow
|
6.9… |
Google |
$0.254
…
|
8.51s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 7
响应时间(平均)8.51s
响应时间(最大)52.64s
响应时间(总计)195.76s
…
|
- 总测试数
- 23
- 错误测试数
- 7
- 尝试通过率
- 72.5%
- 输入令牌
- 251,677
- 输出令牌
- 11,196
- 推理令牌
- 31,204
- 响应时间(平均)
- 8.51s
- 响应时间(总计)
- 195.76s
- 响应时间(最大)
- 52.64s
-
智能体任务
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)52.64s
响应时间(最大)52.64s
响应时间(总计)52.64s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.48s
响应时间(最大)4.31s
响应时间(总计)13.94s
-
编程
: 5.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)6.00s
响应时间(最大)6.94s
响应时间(总计)18.00s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)10.20s
响应时间(最大)17.13s
响应时间(总计)20.39s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.40s
响应时间(最大)14.72s
响应时间(总计)18.80s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)9.74s
响应时间(最大)14.40s
响应时间(总计)29.22s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.68s
响应时间(最大)3.68s
响应时间(总计)3.68s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.02s
响应时间(最大)7.35s
响应时间(总计)14.03s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.77s
响应时间(最大)10.27s
响应时间(总计)17.32s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.99s
响应时间(最大)4.99s
响应时间(总计)4.99s
-
常识问答
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.75s
响应时间(最大)2.75s
响应时间(总计)2.75s
|
| #161#161 |
Muse Glimmer 30Blow
|
6.9… |
Meta |
$0.266
…
|
22.40s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 3 无效工具调用: 2 无答案: 1
响应时间(平均)22.40s
响应时间(最大)234.92s
响应时间(总计)515.14s
…
|
- 总测试数
- 23
- 错误测试数
- 12
- 尝试通过率
- 63.8%
- 输入令牌
- 307,228
- 输出令牌
- 36,044
- 推理令牌
- 71,621
- 响应时间(平均)
- 22.40s
- 响应时间(总计)
- 515.14s
- 响应时间(最大)
- 234.92s
-
智能体任务
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)104.96s
响应时间(最大)104.96s
响应时间(总计)104.96s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.57s
响应时间(最大)5.96s
响应时间(总计)14.27s
-
编程
: 8.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)16.52s
响应时间(最大)21.60s
响应时间(总计)49.55s
-
综合
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 无答案: 1
响应时间(平均)131.97s
响应时间(最大)234.92s
响应时间(总计)263.94s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.17s
响应时间(最大)4.56s
响应时间(总计)8.34s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)11.48s
响应时间(最大)22.96s
响应时间(总计)34.44s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.50s
响应时间(最大)2.50s
响应时间(总计)2.50s
-
指令遵循
: 8.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.60s
响应时间(最大)3.76s
响应时间(总计)7.20s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)5.06s
响应时间(最大)7.57s
响应时间(总计)15.18s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.04s
响应时间(最大)5.04s
响应时间(总计)5.04s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.71s
响应时间(最大)9.71s
响应时间(总计)9.71s
|
| #162#162 |
Gemini 3.1 Flash Litemedium
|
6.9… |
Google |
$0.153
…
|
6.27s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 未遵循指令: 1 无效工具调用: 1
响应时间(平均)6.27s
响应时间(最大)47.78s
响应时间(总计)144.10s
…
|
- 总测试数
- 23
- 错误测试数
- 10
- 尝试通过率
- 59.4%
- 输入令牌
- 228,023
- 输出令牌
- 10,779
- 推理令牌
- 53,188
- 响应时间(平均)
- 6.27s
- 响应时间(总计)
- 144.10s
- 响应时间(最大)
- 47.78s
-
智能体任务
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)47.78s
响应时间(最大)47.78s
响应时间(总计)47.78s
-
反AI技巧
: 9.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.39s
响应时间(最大)3.58s
响应时间(总计)9.57s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.81s
响应时间(最大)4.25s
响应时间(总计)11.44s
-
综合
: 7.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)18.55s
响应时间(最大)26.22s
响应时间(总计)37.09s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.60s
响应时间(最大)2.69s
响应时间(总计)5.19s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)3.93s
响应时间(最大)4.71s
响应时间(总计)11.79s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.60s
响应时间(最大)2.60s
响应时间(总计)2.60s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.59s
响应时间(最大)3.04s
响应时间(总计)5.17s
-
谜题求解
: 7.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.95s
响应时间(最大)2.48s
响应时间(总计)5.84s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.55s
响应时间(最大)4.55s
响应时间(总计)4.55s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.08s
响应时间(最大)3.08s
响应时间(总计)3.08s
|
| #163#163 |
Ember-1high
|
6.9… |
Fireworks |
$2.405
…
|
58.14s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 7 答案错误: 2 无效工具调用: 1 无答案: 1
响应时间(平均)58.14s
响应时间(最大)255.06s
响应时间(总计)1337.19s
…
|
- 总测试数
- 23
- 错误测试数
- 11
- 尝试通过率
- 71.0%
- 输入令牌
- 195,489
- 输出令牌
- 12,475
- 推理令牌
- 108,748
- 响应时间(平均)
- 58.14s
- 响应时间(总计)
- 1337.19s
- 响应时间(最大)
- 255.06s
-
智能体任务
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)88.31s
响应时间(最大)88.31s
响应时间(总计)88.31s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)24.05s
响应时间(最大)63.76s
响应时间(总计)96.19s
-
编程
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)72.23s
响应时间(最大)102.69s
响应时间(总计)216.69s
-
综合
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)79.89s
响应时间(最大)134.76s
响应时间(总计)159.78s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)36.10s
响应时间(最大)64.17s
响应时间(总计)72.19s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)175.49s
响应时间(最大)255.06s
响应时间(总计)526.47s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.49s
响应时间(最大)4.49s
响应时间(总计)4.49s
-
指令遵循
: 7.1
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)33.38s
响应时间(最大)62.32s
响应时间(总计)66.76s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.84s
响应时间(最大)6.35s
响应时间(总计)14.53s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)26.45s
响应时间(最大)26.45s
响应时间(总计)26.45s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)65.34s
响应时间(最大)65.34s
响应时间(总计)65.34s
|
| #164#164 |
Gemma 4 31Bmedium
|
6.9… |
Google |
$0.144
↓
…
|
78.76s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 API 错误: 2 无效工具调用: 1 无答案: 1 超时: 1
响应时间(平均)78.76s
响应时间(最大)437.40s
响应时间(总计)1653.96s
…
|
- 总测试数
- 23
- 错误测试数
- 9
- 尝试通过率
- 66.7%
- 输入令牌
- 251,164
- 输出令牌
- 36,112
- 推理令牌
- 241,203
- 响应时间(平均)
- 78.76s
- 响应时间(总计)
- 1653.96s
- 响应时间(最大)
- 437.40s
-
智能体任务
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)82.13s
响应时间(最大)82.13s
响应时间(总计)82.13s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.89s
响应时间(最大)26.66s
响应时间(总计)51.55s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 超时: 1 答案错误: 1
响应时间(平均)219.76s
响应时间(最大)437.40s
响应时间(总计)659.27s
-
综合
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 无效工具调用: 1
响应时间(平均)433.11s
响应时间(最大)433.11s
响应时间(总计)433.11s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.11s
响应时间(最大)21.94s
响应时间(总计)42.21s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)59.92s
响应时间(最大)77.78s
响应时间(总计)179.75s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.57s
响应时间(最大)9.57s
响应时间(总计)9.57s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.76s
响应时间(最大)17.53s
响应时间(总计)25.52s
-
谜题求解
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)26.91s
响应时间(最大)61.08s
响应时间(总计)80.72s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)90.14s
响应时间(最大)90.14s
响应时间(总计)90.14s
|
| #165#165 |
GPT-5.6 Lunalow
|
6.9… |
OpenAI |
$0.049
↓
…
|
6.96s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 1 无效工具调用: 1
响应时间(平均)6.96s
响应时间(最大)45.74s
响应时间(总计)160.19s
…
|
- 总测试数
- 23
- 错误测试数
- 12
- 尝试通过率
- 56.5%
- 输入令牌
- 202,680
- 输出令牌
- 9,230
- 推理令牌
- 18,771
- 响应时间(平均)
- 6.96s
- 响应时间(总计)
- 160.19s
- 响应时间(最大)
- 45.74s
-
智能体任务
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)45.74s
响应时间(最大)45.74s
响应时间(总计)45.74s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.21s
响应时间(最大)2.87s
响应时间(总计)8.84s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)4.61s
响应时间(最大)5.18s
响应时间(总计)13.83s
-
综合
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1 答案错误: 1
响应时间(平均)13.71s
响应时间(最大)19.44s
响应时间(总计)27.43s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.14s
响应时间(最大)2.49s
响应时间(总计)4.28s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)11.24s
响应时间(最大)18.06s
响应时间(总计)33.71s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.25s
响应时间(最大)2.25s
响应时间(总计)2.25s
-
指令遵循
: 8.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.04s
响应时间(最大)2.18s
响应时间(总计)4.07s
-
谜题求解
: 7.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.59s
响应时间(最大)4.55s
响应时间(总计)10.77s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.43s
响应时间(最大)4.43s
响应时间(总计)4.43s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.86s
响应时间(最大)4.86s
响应时间(总计)4.86s
|
| #166#166 |
Claude Sonnet 5.5low
|
6.9… |
Anthropic |
$0.909
…
|
7.46s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 5 未遵循指令: 5 无效工具调用: 1 无答案: 1 答案错误: 1
响应时间(平均)7.46s
响应时间(最大)46.61s
响应时间(总计)171.47s
…
|
- 总测试数
- 23
- 错误测试数
- 13
- 尝试通过率
- 46.4%
- 输入令牌
- 291,853
- 输出令牌
- 24,116
- 推理令牌
- 8,327
- 响应时间(平均)
- 7.46s
- 响应时间(总计)
- 171.47s
- 响应时间(最大)
- 46.61s
-
智能体任务
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)46.61s
响应时间(最大)46.61s
响应时间(总计)46.61s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 未遵循指令: 1
响应时间(平均)2.55s
响应时间(最大)4.32s
响应时间(总计)10.22s
-
编程
: 3.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 2 额外格式: 1
响应时间(平均)5.81s
响应时间(最大)6.85s
响应时间(总计)17.44s
-
综合
: 7.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)22.50s
响应时间(最大)22.74s
响应时间(总计)45.00s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.31s
响应时间(最大)2.95s
响应时间(总计)4.63s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2 答案错误: 1
响应时间(平均)8.09s
响应时间(最大)10.50s
响应时间(总计)24.28s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.33s
响应时间(最大)2.33s
响应时间(总计)2.33s
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)1.91s
响应时间(最大)2.24s
响应时间(总计)3.82s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)2.50s
响应时间(最大)3.14s
响应时间(总计)7.51s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.67s
响应时间(最大)4.67s
响应时间(总计)4.67s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)4.97s
响应时间(最大)4.97s
响应时间(总计)4.97s
|
| #167#167 |
Claude Opus 4.8none
|
6.9… |
Anthropic |
$2.334
…
|
7.54s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 额外格式: 3 未遵循指令: 1 无答案: 1
响应时间(平均)7.54s
响应时间(最大)65.07s
响应时间(总计)173.31s
…
|
- 总测试数
- 23
- 错误测试数
- 10
- 尝试通过率
- 60.9%
- 输入令牌
- 345,059
- 输出令牌
- 24,343
- 推理令牌
- 0
- 响应时间(平均)
- 7.54s
- 响应时间(总计)
- 173.31s
- 响应时间(最大)
- 65.07s
-
智能体任务
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)65.07s
响应时间(最大)65.07s
响应时间(总计)65.07s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 2
响应时间(平均)3.40s
响应时间(最大)6.36s
响应时间(总计)13.58s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)3.29s
响应时间(最大)4.34s
响应时间(总计)9.88s
-
综合
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)26.38s
响应时间(最大)35.03s
响应时间(总计)52.76s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.77s
响应时间(最大)1.93s
响应时间(总计)3.53s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.76s
响应时间(最大)2.16s
响应时间(总计)5.29s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.48s
响应时间(最大)3.48s
响应时间(总计)3.48s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.37s
响应时间(最大)1.40s
响应时间(总计)2.73s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)2.74s
响应时间(最大)3.46s
响应时间(总计)8.22s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.35s
响应时间(最大)5.35s
响应时间(总计)5.35s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)3.41s
响应时间(最大)3.41s
响应时间(总计)3.41s
|
| #168#168 |
Kimi K2.6medium
|
6.8… |
Moonshot AI |
$0.729
↓
…
|
121.25s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 超时: 3 未遵循指令: 2 无效工具调用: 1 无答案: 1
响应时间(平均)121.25s
响应时间(最大)876.20s
响应时间(总计)2667.55s
…
|
- 总测试数
- 23
- 错误测试数
- 11
- 尝试通过率
- 60.9%
- 输入令牌
- 226,880
- 输出令牌
- 65,346
- 推理令牌
- 331,325
- 响应时间(平均)
- 121.25s
- 响应时间(总计)
- 2667.55s
- 响应时间(最大)
- 876.20s
-
智能体任务
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)233.89s
响应时间(最大)233.89s
响应时间(总计)233.89s
-
反AI技巧
: 7.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)11.59s
响应时间(最大)23.94s
响应时间(总计)46.37s
-
编程
: 5.7
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 超时: 1
响应时间(平均)214.42s
响应时间(最大)406.78s
响应时间(总计)643.25s
-
综合
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)458.58s
响应时间(最大)876.20s
响应时间(总计)917.16s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)20.38s
响应时间(最大)22.88s
响应时间(总计)40.76s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2
响应时间(平均)264.43s
响应时间(最大)339.95s
响应时间(总计)528.86s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.83s
响应时间(最大)17.83s
响应时间(总计)17.83s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.53s
响应时间(最大)19.15s
响应时间(总计)25.06s
-
谜题求解
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)25.06s
响应时间(最大)56.89s
响应时间(总计)75.19s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.92s
响应时间(最大)8.92s
响应时间(总计)8.92s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)130.27s
响应时间(最大)130.27s
响应时间(总计)130.27s
|
| #169#169 |
Qwen3.5-Flashmedium
|
6.8… |
Qwen |
$0.184
…
|
83.68s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 超时: 3 API 错误: 1 未遵循指令: 1 无效工具调用: 1
响应时间(平均)83.68s
响应时间(最大)515.38s
响应时间(总计)1840.92s
…
|
- 总测试数
- 23
- 错误测试数
- 11
- 尝试通过率
- 66.7%
- 输入令牌
- 349,177
- 输出令牌
- 54,279
- 推理令牌
- 477,389
- 响应时间(平均)
- 83.68s
- 响应时间(总计)
- 1840.92s
- 响应时间(最大)
- 515.38s
-
智能体任务
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)67.72s
响应时间(最大)67.72s
响应时间(总计)67.72s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)59.11s
响应时间(最大)168.31s
响应时间(总计)236.44s
-
编程
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)58.87s
响应时间(最大)68.14s
响应时间(总计)176.60s
-
综合
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)266.58s
响应时间(最大)515.38s
响应时间(总计)533.16s
-
数据解析与提取
: 7.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)56.99s
响应时间(最大)80.14s
响应时间(总计)113.98s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)143.82s
响应时间(最大)234.29s
响应时间(总计)431.47s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)40.05s
响应时间(最大)40.05s
响应时间(总计)40.05s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)63.49s
响应时间(最大)111.61s
响应时间(总计)126.98s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)27.61s
响应时间(最大)31.84s
响应时间(总计)55.21s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.33s
响应时间(最大)10.33s
响应时间(总计)10.33s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)48.98s
响应时间(最大)48.98s
响应时间(总计)48.98s
|
| #170#170 |
Inklinglow
|
6.8… |
Thinkingmachines |
$0.298
↓
…
|
6.81s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 8 未遵循指令: 2 无效工具调用: 2
响应时间(平均)6.81s
响应时间(最大)44.24s
响应时间(总计)156.70s
…
|
- 总测试数
- 23
- 错误测试数
- 12
- 尝试通过率
- 56.5%
- 输入令牌
- 213,901
- 输出令牌
- 9,623
- 推理令牌
- 12,414
- 响应时间(平均)
- 6.81s
- 响应时间(总计)
- 156.70s
- 响应时间(最大)
- 44.24s
-
智能体任务
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)44.24s
响应时间(最大)44.24s
响应时间(总计)44.24s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.51s
响应时间(最大)5.19s
响应时间(总计)10.04s
-
编程
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)8.71s
响应时间(最大)12.24s
响应时间(总计)26.14s
-
综合
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 2
响应时间(平均)22.73s
响应时间(最大)41.58s
响应时间(总计)45.45s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.07s
响应时间(最大)2.28s
响应时间(总计)4.15s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.68s
响应时间(最大)2.19s
响应时间(总计)5.03s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.44s
响应时间(最大)3.44s
响应时间(总计)3.44s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.81s
响应时间(最大)1.83s
响应时间(总计)3.62s
-
谜题求解
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.97s
响应时间(最大)4.89s
响应时间(总计)8.91s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.57s
响应时间(最大)2.57s
响应时间(总计)2.57s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.12s
响应时间(最大)3.12s
响应时间(总计)3.12s
|
| #171#171 |
Mercury 2.5 Previewmedium
|
6.8… |
Inception |
$0.039
↑
…
|
6.66s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 API 错误: 1 未遵循指令: 1 无效工具调用: 1 无答案: 1
响应时间(平均)6.66s
响应时间(最大)74.63s
响应时间(总计)153.29s
…
|
- 总测试数
- 23
- 错误测试数
- 8
- 尝试通过率
- 66.7%
- 输入令牌
- 397,291
- 输出令牌
- 6,355
- 推理令牌
- 143,752
- 响应时间(平均)
- 6.66s
- 响应时间(总计)
- 153.29s
- 响应时间(最大)
- 74.63s
-
智能体任务
: 3.9
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)74.63s
响应时间(最大)74.63s
响应时间(总计)74.63s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.43s
响应时间(最大)2.33s
响应时间(总计)5.74s
-
编程
: 7.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.86s
响应时间(最大)4.25s
响应时间(总计)11.59s
-
综合
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)13.86s
响应时间(最大)17.84s
响应时间(总计)27.72s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.77s
响应时间(最大)3.49s
响应时间(总计)5.54s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.72s
响应时间(最大)4.49s
响应时间(总计)11.15s
-
通用智能
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)2.09s
响应时间(最大)2.09s
响应时间(总计)2.09s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.35s
响应时间(最大)1.79s
响应时间(总计)2.71s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.87s
响应时间(最大)2.63s
响应时间(总计)5.62s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)2.37s
响应时间(最大)2.37s
响应时间(总计)2.37s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.13s
响应时间(最大)4.13s
响应时间(总计)4.13s
|
| #172#172 |
GPT-6 Solnone
|
6.8… |
OpenAI |
$0.551
…
|
9.02s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10
响应时间(平均)9.02s
响应时间(最大)57.02s
响应时间(总计)207.45s
…
|
- 总测试数
- 23
- 错误测试数
- 10
- 尝试通过率
- 63.8%
- 输入令牌
- 235,086
- 输出令牌
- 7,989
- 推理令牌
- 0
- 响应时间(平均)
- 9.02s
- 响应时间(总计)
- 207.45s
- 响应时间(最大)
- 57.02s
-
智能体任务
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)57.02s
响应时间(最大)57.02s
响应时间(总计)57.02s
-
反AI技巧
: 6.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)1.23s
响应时间(最大)1.68s
响应时间(总计)4.90s
-
编程
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)12.23s
响应时间(最大)23.55s
响应时间(总计)36.69s
-
综合
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.61s
响应时间(最大)16.46s
响应时间(总计)21.22s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)20.98s
响应时间(最大)23.53s
响应时间(总计)41.97s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.41s
响应时间(最大)7.53s
响应时间(总计)10.22s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.89s
响应时间(最大)23.89s
响应时间(总计)23.89s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.23s
响应时间(最大)1.40s
响应时间(总计)2.46s
-
谜题求解
: 7.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.40s
响应时间(最大)1.64s
响应时间(总计)4.20s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.43s
响应时间(最大)3.43s
响应时间(总计)3.43s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.45s
响应时间(最大)1.45s
响应时间(总计)1.45s
|
| #173#173 |
Space Bunny Alphamax
|
6.7… |
Stealth |
$0.000
…
|
36.24s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 10 未遵循指令: 2
响应时间(平均)36.24s
响应时间(最大)320.00s
响应时间(总计)833.43s
…
|
- 总测试数
- 23
- 错误测试数
- 12
- 尝试通过率
- 59.4%
- 输入令牌
- 315,136
- 输出令牌
- 219,014
- 推理令牌
- 0
- 响应时间(平均)
- 36.24s
- 响应时间(总计)
- 833.43s
- 响应时间(最大)
- 320.00s
-
智能体任务
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)90.59s
响应时间(最大)90.59s
响应时间(总计)90.59s
-
反AI技巧
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)2.61s
响应时间(最大)5.90s
响应时间(总计)10.44s
-
编程
: 5.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)17.08s
响应时间(最大)28.16s
响应时间(总计)51.25s
-
综合
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)61.05s
响应时间(最大)112.81s
响应时间(总计)122.10s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.64s
响应时间(最大)2.66s
响应时间(总计)5.28s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)140.04s
响应时间(最大)320.00s
响应时间(总计)420.11s
-
通用智能
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)8.15s
响应时间(最大)8.15s
响应时间(总计)8.15s
-
指令遵循
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)3.78s
响应时间(最大)5.73s
响应时间(总计)7.56s
-
谜题求解
: 7.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.15s
响应时间(最大)18.64s
响应时间(总计)27.44s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.58s
响应时间(最大)5.58s
响应时间(总计)5.58s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)84.94s
响应时间(最大)84.94s
响应时间(总计)84.94s
|
| #174#174 |
Solar Pro 4xhigh
|
6.7… |
Upstage |
$0.067
…
|
142.76s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 3 无答案: 2 额外格式: 1
响应时间(平均)142.76s
响应时间(最大)491.42s
响应时间(总计)3283.43s
…
|
- 总测试数
- 23
- 错误测试数
- 11
- 尝试通过率
- 58.0%
- 输入令牌
- 150,033
- 输出令牌
- 22,347
- 推理令牌
- 402,143
- 响应时间(平均)
- 142.76s
- 响应时间(总计)
- 3283.43s
- 响应时间(最大)
- 491.42s
-
智能体任务
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)316.64s
响应时间(最大)316.64s
响应时间(总计)316.64s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)64.21s
响应时间(最大)110.51s
响应时间(总计)256.85s
-
编程
: 5.8
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1 答案错误: 1
响应时间(平均)292.21s
响应时间(最大)419.47s
响应时间(总计)876.62s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)202.54s
响应时间(最大)343.03s
响应时间(总计)405.07s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)48.39s
响应时间(最大)52.35s
响应时间(总计)96.79s
-
领域专项
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)287.68s
响应时间(最大)491.42s
响应时间(总计)863.04s
-
通用智能
: 5.5
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)61.87s
响应时间(最大)61.87s
响应时间(总计)61.87s
-
指令遵循
: 8.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)51.33s
响应时间(最大)52.89s
响应时间(总计)102.66s
-
谜题求解
: 8.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)58.05s
响应时间(最大)95.42s
响应时间(总计)174.14s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.87s
响应时间(最大)9.87s
响应时间(总计)9.87s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)119.88s
响应时间(最大)119.88s
响应时间(总计)119.88s
|
| #175#175 |
Grok 4.7xhigh
|
6.7… |
X AI |
$3.398
…
|
123.96s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 4 答案错误: 3 API 错误: 1 无效工具调用: 1
响应时间(平均)123.96s
响应时间(最大)775.64s
响应时间(总计)2851.07s
…
|
- 总测试数
- 23
- 错误测试数
- 9
- 尝试通过率
- 73.9%
- 输入令牌
- 310,049
- 输出令牌
- 6,094
- 推理令牌
- 566,221
- 响应时间(平均)
- 123.96s
- 响应时间(总计)
- 2851.07s
- 响应时间(最大)
- 775.64s
-
智能体任务
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)304.76s
响应时间(最大)304.76s
响应时间(总计)304.76s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)35.37s
响应时间(最大)83.16s
响应时间(总计)141.48s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1 答案错误: 1
响应时间(平均)414.53s
响应时间(最大)775.64s
响应时间(总计)1243.59s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)170.10s
响应时间(最大)307.48s
响应时间(总计)340.19s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.50s
响应时间(最大)8.31s
响应时间(总计)15.00s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 2 答案错误: 1
响应时间(平均)190.55s
响应时间(最大)240.86s
响应时间(总计)571.65s
-
通用智能
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)26.32s
响应时间(最大)26.32s
响应时间(总计)26.32s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.31s
响应时间(最大)27.10s
响应时间(总计)34.62s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)20.50s
响应时间(最大)30.41s
响应时间(总计)61.50s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.36s
响应时间(最大)5.36s
响应时间(总计)5.36s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)106.61s
响应时间(最大)106.61s
响应时间(总计)106.61s
|