| #1🥇 #1 |
Gemini 3 Flash Previewmedium
|
9.8… |
Google |
$0.667
…
|
18.64s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)18.64s
响应时间(最大)117.26s
响应时间(总计)391.35s
…
|
- 总测试数
- 21
- 错误测试数
- 1
- 尝试通过率
- 98.4%
- 输入令牌
- 37,017
- 输出令牌
- 2,006
- 推理令牌
- 214,153
- 响应时间(平均)
- 18.64s
- 响应时间(总计)
- 391.35s
- 响应时间(最大)
- 117.26s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.88s
响应时间(最大)5.73s
响应时间(总计)15.53s
-
编程
: 8.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)84.40s
响应时间(最大)117.26s
响应时间(总计)253.21s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)22.42s
响应时间(最大)22.42s
响应时间(总计)22.42s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.43s
响应时间(最大)6.18s
响应时间(总计)10.86s
-
领域专项
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.27s
响应时间(最大)34.09s
响应时间(总计)45.80s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.19s
响应时间(最大)5.19s
响应时间(总计)5.19s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.04s
响应时间(最大)4.70s
响应时间(总计)8.08s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.05s
响应时间(最大)5.64s
响应时间(总计)12.15s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.60s
响应时间(最大)12.60s
响应时间(总计)12.60s
-
常识问答
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.50s
响应时间(最大)5.50s
响应时间(总计)5.50s
|
| #2🥈 #2 |
Gemini 3.5 Flashhigh
|
9.6… |
Google |
$1.115
…
|
8.84s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)8.84s
响应时间(最大)34.82s
响应时间(总计)185.57s
…
|
- 总测试数
- 21
- 错误测试数
- 1
- 尝试通过率
- 96.8%
- 输入令牌
- 37,594
- 输出令牌
- 1,975
- 推理令牌
- 115,638
- 响应时间(平均)
- 8.84s
- 响应时间(总计)
- 185.57s
- 响应时间(最大)
- 34.82s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.57s
响应时间(最大)3.60s
响应时间(总计)10.27s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)22.96s
响应时间(最大)34.82s
响应时间(总计)68.88s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)22.37s
响应时间(最大)22.37s
响应时间(总计)22.37s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.43s
响应时间(最大)8.51s
响应时间(总计)12.87s
-
领域专项
: 7.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)14.09s
响应时间(最大)22.00s
响应时间(总计)42.27s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.63s
响应时间(最大)3.63s
响应时间(总计)3.63s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.35s
响应时间(最大)3.42s
响应时间(总计)6.69s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.23s
响应时间(最大)3.68s
响应时间(总计)9.69s
-
工具调用
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.96s
响应时间(最大)4.96s
响应时间(总计)4.96s
-
常识问答
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.94s
响应时间(最大)3.94s
响应时间(总计)3.94s
|
| #3🥉 #3 |
Gemini 3.5 Flashlow
|
9.4… |
Google |
$0.349
…
|
3.27s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)3.27s
响应时间(最大)9.05s
响应时间(总计)68.65s
…
|
- 总测试数
- 21
- 错误测试数
- 2
- 尝试通过率
- 90.5%
- 输入令牌
- 36,938
- 输出令牌
- 2,033
- 推理令牌
- 30,519
- 响应时间(平均)
- 3.27s
- 响应时间(总计)
- 68.65s
- 响应时间(最大)
- 9.05s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.52s
响应时间(最大)5.40s
响应时间(总计)10.08s
-
编程
: 7.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.71s
响应时间(最大)9.05s
响应时间(总计)20.13s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.44s
响应时间(最大)6.44s
响应时间(总计)6.44s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.81s
响应时间(最大)2.32s
响应时间(总计)3.63s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.39s
响应时间(最大)4.44s
响应时间(总计)10.16s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.27s
响应时间(最大)2.27s
响应时间(总计)2.27s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.86s
响应时间(最大)2.10s
响应时间(总计)3.73s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.35s
响应时间(最大)3.25s
响应时间(总计)7.06s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.27s
响应时间(最大)3.27s
响应时间(总计)3.27s
-
常识问答
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.88s
响应时间(最大)1.88s
响应时间(总计)1.88s
|
| #4#4 |
Gemini 3.1 Pro Previewmedium
|
9.4… |
Google |
$1.054
…
|
20.14s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)20.14s
响应时间(最大)88.68s
响应时间(总计)281.92s
…
|
- 总测试数
- 21
- 错误测试数
- 2
- 尝试通过率
- 90.5%
- 输入令牌
- 41,617
- 输出令牌
- 1,977
- 推理令牌
- 78,896
- 响应时间(平均)
- 20.14s
- 响应时间(总计)
- 281.92s
- 响应时间(最大)
- 88.68s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.90s
响应时间(最大)9.52s
响应时间(总计)15.80s
-
编程
: 7.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)40.17s
响应时间(最大)88.68s
响应时间(总计)120.52s
-
综合
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)40.61s
响应时间(最大)40.61s
响应时间(总计)40.61s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.72s
响应时间(最大)7.72s
响应时间(总计)7.72s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)32.73s
响应时间(最大)32.73s
响应时间(总计)32.73s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.77s
响应时间(最大)11.77s
响应时间(总计)11.77s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.56s
响应时间(最大)9.56s
响应时间(总计)9.56s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.90s
响应时间(最大)8.49s
响应时间(总计)13.79s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.15s
响应时间(最大)23.15s
响应时间(总计)23.15s
-
常识问答
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.27s
响应时间(最大)6.27s
响应时间(总计)6.27s
|
| #5#5 |
Qwen3.7 Maxmedium
|
9.1… |
Qwen |
$0.523
↓
…
|
16.02s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)16.02s
响应时间(最大)59.98s
响应时间(总计)336.51s
…
|
- 总测试数
- 21
- 错误测试数
- 3
- 尝试通过率
- 88.9%
- 输入令牌
- 42,360
- 输出令牌
- 2,129
- 推理令牌
- 122,959
- 响应时间(平均)
- 16.02s
- 响应时间(总计)
- 336.51s
- 响应时间(最大)
- 59.98s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.36s
响应时间(最大)8.75s
响应时间(总计)25.44s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)35.31s
响应时间(最大)59.98s
响应时间(总计)105.93s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)19.60s
响应时间(最大)19.60s
响应时间(总计)19.60s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.80s
响应时间(最大)10.25s
响应时间(总计)17.60s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)24.94s
响应时间(最大)29.00s
响应时间(总计)74.81s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.70s
响应时间(最大)11.70s
响应时间(总计)11.70s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.46s
响应时间(最大)10.17s
响应时间(总计)14.92s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.84s
响应时间(最大)11.71s
响应时间(总计)26.51s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.63s
响应时间(最大)6.63s
响应时间(总计)6.63s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)33.37s
响应时间(最大)33.37s
响应时间(总计)33.37s
|
| #6#6 |
GPT-5.5low
|
9.0… |
OpenAI |
$0.907
…
|
9.76s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)9.76s
响应时间(最大)56.19s
响应时间(总计)204.92s
…
|
- 总测试数
- 21
- 错误测试数
- 3
- 尝试通过率
- 85.7%
- 输入令牌
- 34,209
- 输出令牌
- 2,046
- 推理令牌
- 22,460
- 响应时间(平均)
- 9.76s
- 响应时间(总计)
- 204.92s
- 响应时间(最大)
- 56.19s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.41s
响应时间(最大)6.32s
响应时间(总计)17.64s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.04s
响应时间(最大)21.06s
响应时间(总计)45.11s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.56s
响应时间(最大)9.56s
响应时间(总计)9.56s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.28s
响应时间(最大)5.13s
响应时间(总计)6.56s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)28.05s
响应时间(最大)56.19s
响应时间(总计)84.16s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.17s
响应时间(最大)5.17s
响应时间(总计)5.17s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.74s
响应时间(最大)3.99s
响应时间(总计)7.48s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.74s
响应时间(最大)5.61s
响应时间(总计)14.21s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.96s
响应时间(最大)4.96s
响应时间(总计)4.96s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.06s
响应时间(最大)10.06s
响应时间(总计)10.06s
|
| #7#7 |
Gemini 3.5 Flashmedium
|
9.0… |
Google |
$0.582
…
|
4.94s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 未遵循指令: 1
响应时间(平均)4.94s
响应时间(最大)18.07s
响应时间(总计)103.79s
…
|
- 总测试数
- 21
- 错误测试数
- 3
- 尝试通过率
- 87.3%
- 输入令牌
- 36,936
- 输出令牌
- 2,001
- 推理令牌
- 56,408
- 响应时间(平均)
- 4.94s
- 响应时间(总计)
- 103.79s
- 响应时间(最大)
- 18.07s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.09s
响应时间(最大)2.56s
响应时间(总计)8.35s
-
编程
: 7.9
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)12.63s
响应时间(最大)18.07s
响应时间(总计)37.89s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.05s
响应时间(最大)12.05s
响应时间(总计)12.05s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.07s
响应时间(最大)5.60s
响应时间(总计)8.14s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)5.24s
响应时间(最大)6.43s
响应时间(总计)15.73s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.52s
响应时间(最大)2.52s
响应时间(总计)2.52s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.70s
响应时间(最大)3.07s
响应时间(总计)5.40s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.38s
响应时间(最大)2.55s
响应时间(总计)7.15s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.81s
响应时间(最大)3.81s
响应时间(总计)3.81s
-
常识问答
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.75s
响应时间(最大)2.75s
响应时间(总计)2.75s
|
| #8#8 |
Claude Opus 4.7none已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
8.9… |
Anthropic |
$0.505
…
|
3.02s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)3.02s
响应时间(最大)18.27s
响应时间(总计)57.44s
…
|
- 总测试数
- 19
- 错误测试数
- 3
- 尝试通过率
- 84.2%
- 输入令牌
- 69,576
- 输出令牌
- 6,265
- 推理令牌
- 0
- 响应时间(平均)
- 3.02s
- 响应时间(总计)
- 57.44s
- 响应时间(最大)
- 18.27s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.12s
响应时间(最大)3.75s
响应时间(总计)8.50s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.84s
响应时间(最大)2.84s
响应时间(总计)2.84s
-
综合
: 9.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)18.27s
响应时间(最大)18.27s
响应时间(总计)18.27s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.15s
响应时间(最大)2.33s
响应时间(总计)4.29s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.19s
响应时间(最大)1.40s
响应时间(总计)3.58s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.47s
响应时间(最大)3.47s
响应时间(总计)3.47s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.46s
响应时间(最大)1.68s
响应时间(总计)2.91s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.46s
响应时间(最大)3.72s
响应时间(总计)7.38s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.74s
响应时间(最大)4.74s
响应时间(总计)4.74s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.46s
响应时间(最大)1.46s
响应时间(总计)1.46s
|
| #9#9 |
GPT-5.5medium
|
8.8… |
OpenAI |
$3.679
…
|
37.98s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)37.98s
响应时间(最大)332.10s
响应时间(总计)797.60s
…
|
- 总测试数
- 21
- 错误测试数
- 4
- 尝试通过率
- 87.3%
- 输入令牌
- 34,212
- 输出令牌
- 1,985
- 推理令牌
- 114,925
- 响应时间(平均)
- 37.98s
- 响应时间(总计)
- 797.60s
- 响应时间(最大)
- 332.10s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.66s
响应时间(最大)6.74s
响应时间(总计)18.65s
-
编程
: 8.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)59.77s
响应时间(最大)130.26s
响应时间(总计)179.30s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)19.29s
响应时间(最大)19.29s
响应时间(总计)19.29s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.18s
响应时间(最大)4.35s
响应时间(总计)8.36s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)164.14s
响应时间(最大)332.10s
响应时间(总计)492.41s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.16s
响应时间(最大)4.16s
响应时间(总计)4.16s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.36s
响应时间(最大)3.46s
响应时间(总计)6.73s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.76s
响应时间(最大)10.54s
响应时间(总计)20.28s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)10.57s
响应时间(最大)10.57s
响应时间(总计)10.57s
-
常识问答
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)37.86s
响应时间(最大)37.86s
响应时间(总计)37.86s
|
| #10#10 |
Claude Opus 4.8medium
|
8.7… |
Anthropic |
$1.107
…
|
9.66s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 无答案: 1
响应时间(平均)9.66s
响应时间(最大)38.03s
响应时间(总计)202.89s
…
|
- 总测试数
- 21
- 错误测试数
- 4
- 尝试通过率
- 84.1%
- 输入令牌
- 61,007
- 输出令牌
- 26,495
- 推理令牌
- 5,901
- 响应时间(平均)
- 9.66s
- 响应时间(总计)
- 202.89s
- 响应时间(最大)
- 38.03s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.95s
响应时间(最大)5.76s
响应时间(总计)15.79s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.33s
响应时间(最大)22.27s
响应时间(总计)45.98s
-
综合
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)38.03s
响应时间(最大)38.03s
响应时间(总计)38.03s
-
数据解析与提取
: 7.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)12.29s
响应时间(最大)19.64s
响应时间(总计)24.59s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)14.15s
响应时间(最大)28.41s
响应时间(总计)42.46s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.46s
响应时间(最大)2.46s
响应时间(总计)2.46s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.32s
响应时间(最大)5.07s
响应时间(总计)6.63s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.95s
响应时间(最大)4.33s
响应时间(总计)11.85s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.96s
响应时间(最大)8.96s
响应时间(总计)8.96s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)6.14s
响应时间(最大)6.14s
响应时间(总计)6.14s
|
| #11#11 |
Claude Opus 4.7medium
|
8.7… |
Anthropic |
$0.679
…
|
4.73s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 超时: 1
响应时间(平均)4.73s
响应时间(最大)23.18s
响应时间(总计)94.51s
…
|
- 总测试数
- 21
- 错误测试数
- 4
- 尝试通过率
- 82.5%
- 输入令牌
- 65,406
- 输出令牌
- 11,858
- 推理令牌
- 2,198
- 响应时间(平均)
- 4.73s
- 响应时间(总计)
- 94.51s
- 响应时间(最大)
- 23.18s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.85s
响应时间(最大)2.71s
响应时间(总计)7.38s
-
编程
: 7.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)12.96s
响应时间(最大)23.18s
响应时间(总计)38.89s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.45s
响应时间(最大)21.45s
响应时间(总计)21.45s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.37s
响应时间(最大)3.30s
响应时间(总计)4.74s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)1.17s
响应时间(最大)1.40s
响应时间(总计)2.35s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.87s
响应时间(最大)2.87s
响应时间(总计)2.87s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.57s
响应时间(最大)1.66s
响应时间(总计)3.14s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.43s
响应时间(最大)2.89s
响应时间(总计)7.28s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.17s
响应时间(最大)4.17s
响应时间(总计)4.17s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.25s
响应时间(最大)2.25s
响应时间(总计)2.25s
|
| #14#14 |
Qwen3.6 Max Previewmedium
|
8.5… |
Qwen |
$0.960
↓
…
|
59.63s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5
响应时间(平均)59.63s
响应时间(最大)238.07s
响应时间(总计)1252.17s
…
|
- 总测试数
- 21
- 错误测试数
- 5
- 尝试通过率
- 81.0%
- 输入令牌
- 42,362
- 输出令牌
- 2,273
- 推理令牌
- 144,367
- 响应时间(平均)
- 59.63s
- 响应时间(总计)
- 1252.17s
- 响应时间(最大)
- 238.07s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)22.13s
响应时间(最大)28.70s
响应时间(总计)88.50s
-
编程
: 8.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)146.48s
响应时间(最大)238.07s
响应时间(总计)439.45s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)121.49s
响应时间(最大)121.49s
响应时间(总计)121.49s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)41.15s
响应时间(最大)48.02s
响应时间(总计)82.30s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)95.91s
响应时间(最大)186.74s
响应时间(总计)287.73s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)32.24s
响应时间(最大)32.24s
响应时间(总计)32.24s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)24.31s
响应时间(最大)27.94s
响应时间(总计)48.63s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)24.32s
响应时间(最大)37.68s
响应时间(总计)72.96s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)18.32s
响应时间(最大)18.32s
响应时间(总计)18.32s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)60.56s
响应时间(最大)60.56s
响应时间(总计)60.56s
|
| #15#15 |
GPT-5.3-Codexmedium
|
8.4… |
OpenAI |
$0.740
…
|
16.22s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 2
响应时间(平均)16.22s
响应时间(最大)100.93s
响应时间(总计)340.67s
…
|
- 总测试数
- 21
- 错误测试数
- 6
- 尝试通过率
- 82.5%
- 输入令牌
- 34,299
- 输出令牌
- 2,357
- 推理令牌
- 46,189
- 响应时间(平均)
- 16.22s
- 响应时间(总计)
- 340.67s
- 响应时间(最大)
- 100.93s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.16s
响应时间(最大)6.68s
响应时间(总计)16.63s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)19.50s
响应时间(最大)27.96s
响应时间(总计)58.49s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)19.56s
响应时间(最大)19.56s
响应时间(总计)19.56s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.07s
响应时间(最大)3.59s
响应时间(总计)6.15s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)64.31s
响应时间(最大)100.93s
响应时间(总计)192.94s
-
通用智能
: 4.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.87s
响应时间(最大)4.87s
响应时间(总计)4.87s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.04s
响应时间(最大)3.44s
响应时间(总计)6.07s
-
谜题求解
: 9.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)5.05s
响应时间(最大)8.73s
响应时间(总计)15.15s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.37s
响应时间(最大)6.37s
响应时间(总计)6.37s
-
常识问答
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)14.43s
响应时间(最大)14.43s
响应时间(总计)14.43s
|
| #16#16 |
Gemini 3 Flash Previewlow
|
8.4… |
Google |
$0.111
…
|
5.76s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5
响应时间(平均)5.76s
响应时间(最大)14.72s
响应时间(总计)120.93s
…
|
- 总测试数
- 21
- 错误测试数
- 5
- 尝试通过率
- 79.4%
- 输入令牌
- 36,769
- 输出令牌
- 2,076
- 推理令牌
- 28,518
- 响应时间(平均)
- 5.76s
- 响应时间(总计)
- 120.93s
- 响应时间(最大)
- 14.72s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.48s
响应时间(最大)4.31s
响应时间(总计)13.94s
-
编程
: 5.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)6.00s
响应时间(最大)6.94s
响应时间(总计)18.00s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.27s
响应时间(最大)3.27s
响应时间(总计)3.27s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.40s
响应时间(最大)14.72s
响应时间(总计)18.80s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)8.05s
响应时间(最大)14.40s
响应时间(总计)24.15s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.68s
响应时间(最大)3.68s
响应时间(总计)3.68s
-
指令遵循
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.02s
响应时间(最大)7.35s
响应时间(总计)14.03s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.77s
响应时间(最大)10.27s
响应时间(总计)17.32s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.99s
响应时间(最大)4.99s
响应时间(总计)4.99s
-
常识问答
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.75s
响应时间(最大)2.75s
响应时间(总计)2.75s
|
| #17#17 |
GLM 5medium
|
8.3… |
Z.ai |
$0.228
↓
…
|
33.54s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3 未遵循指令: 1 无答案: 1 超时: 1
响应时间(平均)33.54s
响应时间(最大)99.85s
响应时间(总计)435.99s
…
|
- 总测试数
- 21
- 错误测试数
- 6
- 尝试通过率
- 82.5%
- 输入令牌
- 35,224
- 输出令牌
- 21,570
- 推理令牌
- 102,996
- 响应时间(平均)
- 33.54s
- 响应时间(总计)
- 435.99s
- 响应时间(最大)
- 99.85s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.66s
响应时间(最大)25.06s
响应时间(总计)47.32s
-
编程
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)74.30s
响应时间(最大)99.85s
响应时间(总计)222.91s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)28.96s
响应时间(最大)28.96s
响应时间(总计)28.96s
-
数据解析与提取
: 7.1
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)8.90s
响应时间(最大)8.90s
响应时间(总计)8.90s
-
领域专项
: 3.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)14.69s
响应时间(最大)14.69s
响应时间(总计)14.69s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.25s
响应时间(最大)7.25s
响应时间(总计)7.25s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.33s
响应时间(最大)16.34s
响应时间(总计)22.66s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.93s
响应时间(最大)15.93s
响应时间(总计)15.93s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)67.37s
响应时间(最大)67.37s
响应时间(总计)67.37s
|
| #18#18 |
Qwen3.7 Plusmedium
|
8.2… |
Qwen |
$0.221
…
|
38.95s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 超时: 1
响应时间(平均)38.95s
响应时间(最大)178.04s
响应时间(总计)817.85s
…
|
- 总测试数
- 21
- 错误测试数
- 6
- 尝试通过率
- 77.8%
- 输入令牌
- 40,939
- 输出令牌
- 2,125
- 推理令牌
- 125,754
- 响应时间(平均)
- 38.95s
- 响应时间(总计)
- 817.85s
- 响应时间(最大)
- 178.04s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)8.58s
响应时间(最大)12.75s
响应时间(总计)34.33s
-
编程
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)108.60s
响应时间(最大)178.04s
响应时间(总计)325.79s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)65.24s
响应时间(最大)65.24s
响应时间(总计)65.24s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.75s
响应时间(最大)23.18s
响应时间(总计)43.49s
-
领域专项
: 3.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)45.35s
响应时间(最大)88.89s
响应时间(总计)136.04s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)25.48s
响应时间(最大)25.48s
响应时间(总计)25.48s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)16.13s
响应时间(最大)17.18s
响应时间(总计)32.26s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)16.38s
响应时间(最大)19.42s
响应时间(总计)49.14s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.02s
响应时间(最大)15.02s
响应时间(总计)15.02s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)91.07s
响应时间(最大)91.07s
响应时间(总计)91.07s
|
| #19#19 |
Seed-2.0-Litemedium
|
8.2… |
Bytedance Seed |
$0.175
…
|
47.07s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 2
响应时间(平均)47.07s
响应时间(最大)254.92s
响应时间(总计)988.37s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 76.2%
- 输入令牌
- 46,740
- 输出令牌
- 3,230
- 推理令牌
- 78,406
- 响应时间(平均)
- 47.07s
- 响应时间(总计)
- 988.37s
- 响应时间(最大)
- 254.92s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.99s
响应时间(最大)48.33s
响应时间(总计)71.98s
-
编程
: 8.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)156.74s
响应时间(最大)254.92s
响应时间(总计)470.22s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)37.67s
响应时间(最大)37.67s
响应时间(总计)37.67s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.07s
响应时间(最大)12.19s
响应时间(总计)18.14s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)88.74s
响应时间(最大)168.71s
响应时间(总计)266.21s
-
通用智能
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)18.25s
响应时间(最大)18.25s
响应时间(总计)18.25s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.26s
响应时间(最大)9.02s
响应时间(总计)14.52s
-
谜题求解
: 9.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)10.23s
响应时间(最大)11.54s
响应时间(总计)30.68s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.38s
响应时间(最大)12.38s
响应时间(总计)12.38s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)48.32s
响应时间(最大)48.32s
响应时间(总计)48.32s
|
| #20#20 |
Gemini 3.5 Flashnone
|
8.1… |
Google |
$1.079
…
|
9.93s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 3 答案错误: 3
响应时间(平均)9.93s
响应时间(最大)64.36s
响应时间(总计)178.68s
…
|
- 总测试数
- 21
- 错误测试数
- 6
- 尝试通过率
- 77.8%
- 输入令牌
- 13,843
- 输出令牌
- 117,518
- 推理令牌
- 0
- 响应时间(平均)
- 9.93s
- 响应时间(总计)
- 178.68s
- 响应时间(最大)
- 64.36s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.53s
响应时间(最大)3.43s
响应时间(总计)10.12s
-
编程
: 8.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)34.69s
响应时间(最大)64.36s
响应时间(总计)104.06s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)8.10s
响应时间(最大)8.10s
响应时间(总计)8.10s
-
领域专项
: 7.6
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.64s
响应时间(最大)14.00s
响应时间(总计)31.92s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.46s
响应时间(最大)3.46s
响应时间(总计)3.46s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.38s
响应时间(最大)3.40s
响应时间(总计)6.76s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.13s
响应时间(最大)3.33s
响应时间(总计)9.39s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 2.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.87s
响应时间(最大)4.87s
响应时间(总计)4.87s
|
| #21#21 |
GPT-5.4medium
|
8.0… |
OpenAI |
$1.210
…
|
22.35s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 2
响应时间(平均)22.35s
响应时间(最大)100.41s
响应时间(总计)469.29s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 76.2%
- 输入令牌
- 34,108
- 输出令牌
- 2,242
- 推理令牌
- 72,707
- 响应时间(平均)
- 22.35s
- 响应时间(总计)
- 469.29s
- 响应时间(最大)
- 100.41s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.11s
响应时间(最大)6.42s
响应时间(总计)16.42s
-
编程
: 8.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)44.36s
响应时间(最大)96.94s
响应时间(总计)133.08s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)20.57s
响应时间(最大)20.57s
响应时间(总计)20.57s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.32s
响应时间(最大)5.40s
响应时间(总计)10.64s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)74.27s
响应时间(最大)100.41s
响应时间(总计)222.80s
-
通用智能
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.92s
响应时间(最大)4.92s
响应时间(总计)4.92s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.11s
响应时间(最大)3.68s
响应时间(总计)6.22s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)9.14s
响应时间(最大)18.14s
响应时间(总计)27.41s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.28s
响应时间(最大)13.28s
响应时间(总计)13.28s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)13.95s
响应时间(最大)13.95s
响应时间(总计)13.95s
|
| #23#23 |
GLM 5 Turbomedium
|
8.0… |
Z.ai |
$0.323
↑
…
|
23.00s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 1 无答案: 1 超时: 1
响应时间(平均)23.00s
响应时间(最大)194.23s
响应时间(总计)482.97s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 74.6%
- 输入令牌
- 35,593
- 输出令牌
- 12,245
- 推理令牌
- 62,277
- 响应时间(平均)
- 23.00s
- 响应时间(总计)
- 482.97s
- 响应时间(最大)
- 194.23s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.82s
响应时间(最大)7.69s
响应时间(总计)19.26s
-
编程
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
无答案: 1
响应时间(平均)45.90s
响应时间(最大)95.57s
响应时间(总计)137.71s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.88s
响应时间(最大)13.88s
响应时间(总计)13.88s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.19s
响应时间(最大)6.42s
响应时间(总计)12.38s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 超时: 1
响应时间(平均)71.07s
响应时间(最大)194.23s
响应时间(总计)213.22s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)10.05s
响应时间(最大)10.05s
响应时间(总计)10.05s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.38s
响应时间(最大)5.70s
响应时间(总计)10.77s
-
谜题求解
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)5.23s
响应时间(最大)7.26s
响应时间(总计)15.69s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.84s
响应时间(最大)9.84s
响应时间(总计)9.84s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)40.17s
响应时间(最大)40.17s
响应时间(总计)40.17s
|
| #24#24 |
GPT-5.2 Chatnone
|
7.9… |
OpenAI |
$0.393
…
|
7.13s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 1
响应时间(平均)7.13s
响应时间(最大)38.52s
响应时间(总计)149.69s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 74.6%
- 输入令牌
- 34,212
- 输出令牌
- 23,744
- 推理令牌
- 0
- 响应时间(平均)
- 7.13s
- 响应时间(总计)
- 149.69s
- 响应时间(最大)
- 38.52s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.40s
响应时间(最大)4.78s
响应时间(总计)13.59s
-
编程
: 8.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.82s
响应时间(最大)13.35s
响应时间(总计)29.45s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.12s
响应时间(最大)9.12s
响应时间(总计)9.12s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)3.05s
响应时间(最大)3.33s
响应时间(总计)6.10s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)17.78s
响应时间(最大)38.52s
响应时间(总计)53.33s
-
通用智能
: 4.4
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)3.20s
响应时间(最大)3.20s
响应时间(总计)3.20s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.51s
响应时间(最大)6.55s
响应时间(总计)11.02s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)4.10s
响应时间(最大)5.04s
响应时间(总计)12.31s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.68s
响应时间(最大)4.68s
响应时间(总计)4.68s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.89s
响应时间(最大)6.89s
响应时间(总计)6.89s
|
| #25#25 |
Qwen3.5 Plus 2026-02-15medium
|
7.9… |
Qwen |
$0.310
↓
…
|
73.79s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 超时: 2 API 错误: 1
响应时间(平均)73.79s
响应时间(最大)266.69s
响应时间(总计)1033.07s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 73.0%
- 输入令牌
- 40,918
- 输出令牌
- 2,159
- 推理令牌
- 189,604
- 响应时间(平均)
- 73.79s
- 响应时间(总计)
- 1033.07s
- 响应时间(最大)
- 266.69s
-
反AI技巧
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)45.78s
响应时间(最大)81.20s
响应时间(总计)91.57s
-
编程
: 6.6
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)180.70s
响应时间(最大)266.69s
响应时间(总计)542.10s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)46.85s
响应时间(最大)46.85s
响应时间(总计)46.85s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)46.91s
响应时间(最大)46.91s
响应时间(总计)46.91s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)17.50s
响应时间(最大)17.50s
响应时间(总计)17.50s
-
通用智能
: 4.7
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)79.86s
响应时间(最大)79.86s
响应时间(总计)79.86s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)31.93s
响应时间(最大)31.93s
响应时间(总计)31.93s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)32.50s
响应时间(最大)49.12s
响应时间(总计)65.01s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.54s
响应时间(最大)7.54s
响应时间(总计)7.54s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)103.81s
响应时间(最大)103.81s
响应时间(总计)103.81s
|
| #26#26 |
Qwen3.6 Plusmedium
|
7.9… |
Qwen |
$0.294
↑
…
|
30.70s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 API 错误: 1 未遵循指令: 1
响应时间(平均)30.70s
响应时间(最大)201.68s
响应时间(总计)613.99s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 69.8%
- 输入令牌
- 41,565
- 输出令牌
- 1,853
- 推理令牌
- 141,973
- 响应时间(平均)
- 30.70s
- 响应时间(总计)
- 613.99s
- 响应时间(最大)
- 201.68s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.90s
响应时间(最大)19.37s
响应时间(总计)39.60s
-
编程
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)153.12s
响应时间(最大)201.68s
响应时间(总计)306.23s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)34.95s
响应时间(最大)34.95s
响应时间(总计)34.95s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)14.95s
响应时间(最大)15.40s
响应时间(总计)29.90s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)29.59s
响应时间(最大)43.55s
响应时间(总计)88.77s
-
通用智能
: 5.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)27.05s
响应时间(最大)27.05s
响应时间(总计)27.05s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.54s
响应时间(最大)11.67s
响应时间(总计)15.07s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.34s
响应时间(最大)7.52s
响应时间(总计)19.03s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)5.87s
响应时间(最大)5.87s
响应时间(总计)5.87s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)47.51s
响应时间(最大)47.51s
响应时间(总计)47.51s
|
| #27#27 |
Gemma 4 31Bmedium
|
7.8… |
Google |
$0.034
↓
…
|
56.55s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2 超时: 2 答案错误: 2 无答案: 1
响应时间(平均)56.55s
响应时间(最大)437.40s
响应时间(总计)1074.41s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 69.8%
- 输入令牌
- 17,957
- 输出令牌
- 22,356
- 推理令牌
- 65,726
- 响应时间(平均)
- 56.55s
- 响应时间(总计)
- 1074.41s
- 响应时间(最大)
- 437.40s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.89s
响应时间(最大)26.66s
响应时间(总计)51.55s
-
编程
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 2 无答案: 1
响应时间(平均)219.76s
响应时间(最大)437.40s
响应时间(总计)659.27s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)21.11s
响应时间(最大)21.94s
响应时间(总计)42.21s
-
领域专项
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)38.48s
响应时间(最大)68.92s
响应时间(总计)115.43s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.57s
响应时间(最大)9.57s
响应时间(总计)9.57s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)12.76s
响应时间(最大)17.53s
响应时间(总计)25.52s
-
谜题求解
: 9.9
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)26.91s
响应时间(最大)61.08s
响应时间(总计)80.72s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)90.14s
响应时间(最大)90.14s
响应时间(总计)90.14s
|
| #28#28 |
Gemini 2.5 Flashmedium
|
7.8… |
Google |
$0.379
…
|
15.49s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 1
响应时间(平均)15.49s
响应时间(最大)95.48s
响应时间(总计)325.39s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 69.8%
- 输入令牌
- 34,476
- 输出令牌
- 1,930
- 推理令牌
- 145,145
- 响应时间(平均)
- 15.49s
- 响应时间(总计)
- 325.39s
- 响应时间(最大)
- 95.48s
-
反AI技巧
: 8.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)6.30s
响应时间(最大)15.56s
响应时间(总计)25.21s
-
编程
: 7.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)41.01s
响应时间(最大)92.88s
响应时间(总计)123.04s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)28.44s
响应时间(最大)28.44s
响应时间(总计)28.44s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.06s
响应时间(最大)5.06s
响应时间(总计)8.11s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)37.34s
响应时间(最大)95.48s
响应时间(总计)112.01s
-
通用智能
: 4.8
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)4.86s
响应时间(最大)4.86s
响应时间(总计)4.86s
-
指令遵循
: 9.8
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.62s
响应时间(最大)2.78s
响应时间(总计)5.24s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.18s
响应时间(最大)4.05s
响应时间(总计)9.54s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.20s
响应时间(最大)6.20s
响应时间(总计)6.20s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.76s
响应时间(最大)2.76s
响应时间(总计)2.76s
|
| #29#29 |
Qwen3.5-122B-A10Bmedium
|
7.8… |
Qwen |
$0.588
↓
…
|
42.49s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 超时: 2
响应时间(平均)42.49s
响应时间(最大)168.16s
响应时间(总计)892.30s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 73.0%
- 输入令牌
- 41,832
- 输出令牌
- 26,187
- 推理令牌
- 251,028
- 响应时间(平均)
- 42.49s
- 响应时间(总计)
- 892.30s
- 响应时间(最大)
- 168.16s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.75s
响应时间(最大)18.03s
响应时间(总计)39.01s
-
编程
: 6.0
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)114.48s
响应时间(最大)168.16s
响应时间(总计)343.44s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)107.79s
响应时间(最大)107.79s
响应时间(总计)107.79s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)23.41s
响应时间(最大)29.79s
响应时间(总计)46.83s
-
领域专项
: 2.9
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)63.40s
响应时间(最大)119.29s
响应时间(总计)190.20s
-
通用智能
: 3.4
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1
响应时间(平均)34.11s
响应时间(最大)34.11s
响应时间(总计)34.11s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.88s
响应时间(最大)15.44s
响应时间(总计)19.76s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)17.89s
响应时间(最大)31.99s
响应时间(总计)53.68s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)4.60s
响应时间(最大)4.60s
响应时间(总计)4.60s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)52.87s
响应时间(最大)52.87s
响应时间(总计)52.87s
|
| #30#30 |
Qwen3.5-27Bmedium
|
7.8… |
Qwen |
$0.536
↓
…
|
68.39s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4 未遵循指令: 2 额外格式: 1 超时: 1
响应时间(平均)68.39s
响应时间(最大)234.36s
响应时间(总计)1436.24s
…
|
- 总测试数
- 21
- 错误测试数
- 8
- 尝试通过率
- 73.0%
- 输入令牌
- 42,164
- 输出令牌
- 8,534
- 推理令牌
- 329,289
- 响应时间(平均)
- 68.39s
- 响应时间(总计)
- 1436.24s
- 响应时间(最大)
- 234.36s
-
反AI技巧
: 8.7
只有当某个测试的所有运行都通过时,才计为完全通过。
额外格式: 1
响应时间(平均)19.75s
响应时间(最大)49.95s
响应时间(总计)79.01s
-
编程
: 6.2
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)160.69s
响应时间(最大)234.36s
响应时间(总计)482.07s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)163.96s
响应时间(最大)163.96s
响应时间(总计)163.96s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)30.26s
响应时间(最大)32.03s
响应时间(总计)60.52s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
超时: 1 答案错误: 1
响应时间(平均)79.53s
响应时间(最大)95.52s
响应时间(总计)238.59s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)101.41s
响应时间(最大)101.41s
响应时间(总计)101.41s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)19.66s
响应时间(最大)32.25s
响应时间(总计)39.32s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)59.60s
响应时间(最大)123.57s
响应时间(总计)178.80s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)7.45s
响应时间(最大)7.45s
响应时间(总计)7.45s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)85.11s
响应时间(最大)85.11s
响应时间(总计)85.11s
|
| #31#31 |
DeepSeek V4 Flashhigh
|
7.7… |
DeepSeek |
$0.029
↓
…
|
45.85s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 6 未遵循指令: 2
响应时间(平均)45.85s
响应时间(最大)218.13s
响应时间(总计)962.79s
…
|
- 总测试数
- 21
- 错误测试数
- 8
- 尝试通过率
- 74.6%
- 输入令牌
- 39,745
- 输出令牌
- 10,310
- 推理令牌
- 123,501
- 响应时间(平均)
- 45.85s
- 响应时间(总计)
- 962.79s
- 响应时间(最大)
- 218.13s
-
反AI技巧
: 8.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)28.51s
响应时间(最大)39.73s
响应时间(总计)114.05s
-
编程
: 7.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)50.60s
响应时间(最大)62.48s
响应时间(总计)151.79s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)76.57s
响应时间(最大)76.57s
响应时间(总计)76.57s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)28.03s
响应时间(最大)30.49s
响应时间(总计)56.07s
-
领域专项
: 4.1
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)100.31s
响应时间(最大)218.13s
响应时间(总计)300.92s
-
通用智能
: 6.1
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)25.15s
响应时间(最大)25.15s
响应时间(总计)25.15s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.36s
响应时间(最大)19.53s
响应时间(总计)30.73s
-
谜题求解
: 8.2
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)26.11s
响应时间(最大)32.37s
响应时间(总计)78.32s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)74.73s
响应时间(最大)74.73s
响应时间(总计)74.73s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)54.46s
响应时间(最大)54.46s
响应时间(总计)54.46s
|
| #32#32 |
Gemini 3.5 Flashminimal
|
7.7… |
Google |
$0.108
…
|
1.57s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5 未遵循指令: 1 无效工具调用: 1
响应时间(平均)1.57s
响应时间(最大)5.51s
响应时间(总计)33.02s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 68.3%
- 输入令牌
- 39,847
- 输出令牌
- 5,277
- 推理令牌
- 0
- 响应时间(平均)
- 1.57s
- 响应时间(总计)
- 33.02s
- 响应时间(最大)
- 5.51s
-
反AI技巧
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)892ms
响应时间(最大)1.38s
响应时间(总计)3.57s
-
编程
: 5.6
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1 答案错误: 1
响应时间(平均)2.75s
响应时间(最大)5.51s
响应时间(总计)8.26s
-
综合
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
无效工具调用: 1
响应时间(平均)3.56s
响应时间(最大)3.56s
响应时间(总计)3.56s
-
数据解析与提取
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.66s
响应时间(最大)2.11s
响应时间(总计)3.32s
-
领域专项
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)899ms
响应时间(最大)1.04s
响应时间(总计)2.70s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)922ms
响应时间(最大)922ms
响应时间(总计)922ms
-
指令遵循
: 6.4
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)893ms
响应时间(最大)964ms
响应时间(总计)1.79s
-
谜题求解
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)1.45s
响应时间(最大)2.30s
响应时间(总计)4.36s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)2.79s
响应时间(最大)2.79s
响应时间(总计)2.79s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)1.76s
响应时间(最大)1.76s
响应时间(总计)1.76s
|
| #33#33 |
Hy3 previewmedium已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
7.7… |
Tencent |
$0.018
↕
…
|
16.28s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 3 答案错误: 3 未遵循指令: 1
响应时间(平均)16.28s
响应时间(最大)46.04s
响应时间(总计)293.12s
…
|
- 总测试数
- 21
- 错误测试数
- 7
- 尝试通过率
- 66.7%
- 输入令牌
- 27,030
- 输出令牌
- 73,544
- 推理令牌
- 0
- 响应时间(平均)
- 16.28s
- 响应时间(总计)
- 293.12s
- 响应时间(最大)
- 46.04s
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.59s
响应时间(最大)10.20s
响应时间(总计)26.37s
-
编程
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 2
响应时间(平均)31.37s
响应时间(最大)31.37s
响应时间(总计)31.37s
-
综合
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)46.04s
响应时间(最大)46.04s
响应时间(总计)46.04s
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)5.25s
响应时间(最大)5.25s
响应时间(总计)5.25s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)22.30s
响应时间(最大)30.51s
响应时间(总计)66.90s
-
通用智能
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)16.84s
响应时间(最大)16.84s
响应时间(总计)16.84s
-
指令遵循
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)6.16s
响应时间(最大)7.72s
响应时间(总计)12.31s
-
谜题求解
: 7.7
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)11.06s
响应时间(最大)14.35s
响应时间(总计)33.17s
-
工具调用
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)15.02s
响应时间(最大)15.02s
响应时间(总计)15.02s
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)39.86s
响应时间(最大)39.86s
响应时间(总计)39.86s
|