| #376#376 |
Kev 4Bnone36/69 次尝试. 选项由适配器提供。支持 12/23 项测试。其他测试不受支持,并非失败。分数按完整测试集计算。
|
2.4… |
Jaredpalmer |
$0.002
…
|
5.63s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9
响应时间(平均)5.63s
响应时间(最大)17.79s
响应时间(总计)67.61s
…
|
- 总测试数
- 12
- 错误测试数
- 9
- 尝试通过率
- 15.9%
- 输入令牌
- 42,804
- 输出令牌
- 28,061
- 推理令牌
- 0
- 响应时间(平均)
- 5.63s
- 响应时间(总计)
- 67.61s
- 响应时间(最大)
- 17.79s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 2.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)3.65s
响应时间(最大)9.32s
响应时间(总计)10.95s
-
编程
: 4.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)771ms
响应时间(最大)954ms
响应时间(总计)1.54s
-
综合
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 6.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)9.09s
响应时间(最大)17.37s
响应时间(总计)18.18s
-
领域专项
: 5.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)6.34s
响应时间(最大)17.79s
响应时间(总计)19.02s
-
通用智能
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)17.27s
响应时间(最大)17.27s
响应时间(总计)17.27s
-
谜题求解
: 2.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)646ms
响应时间(最大)646ms
响应时间(总计)646ms
-
工具调用
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #377#377 |
Step 3.5 Flashnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
1.9… |
Stepfun |
$0.020
…
|
39.03s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 4 未遵循指令: 1 答案错误: 1
响应时间(平均)39.03s
响应时间(最大)114.12s
响应时间(总计)312.26s
…
|
- 总测试数
- 12
- 错误测试数
- 6
- 尝试通过率
- 26.1%
- 输入令牌
- 1,971
- 输出令牌
- 64,795
- 推理令牌
- 0
- 响应时间(平均)
- 39.03s
- 响应时间(总计)
- 312.26s
- 响应时间(最大)
- 114.12s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)34.99s
响应时间(最大)109.60s
响应时间(总计)139.95s
-
编程
: 1.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
领域专项
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)34.54s
响应时间(最大)34.54s
响应时间(总计)34.54s
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)14.37s
响应时间(最大)14.37s
响应时间(总计)14.37s
-
指令遵循
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)9.30s
响应时间(最大)9.30s
响应时间(总计)9.30s
-
谜题求解
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)114.12s
响应时间(最大)114.12s
响应时间(总计)114.12s
|
| #378#378 |
Gemini 3 Flash Previewhigh3/69 次尝试 (目标:每项测试重复 3 次)
|
1.8… |
Google |
$0.105
…
|
52.45s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)52.45s
响应时间(最大)52.45s
响应时间(总计)52.45s
…
|
- 总测试数
- 1
- 错误测试数
- 0
- 尝试通过率
- 4.4%
- 输入令牌
- 134,050
- 输出令牌
- 1,029
- 推理令牌
- 11,528
- 响应时间(平均)
- 52.45s
- 响应时间(总计)
- 52.45s
- 响应时间(最大)
- 52.45s
-
智能体任务
: 10.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)52.45s
响应时间(最大)52.45s
响应时间(总计)52.45s
-
反AI技巧
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
编程
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
领域专项
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
通用智能
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
谜题求解
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
工具调用
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #379#379 |
LFM2-24B-A2Bnone已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
1.8… |
Liquid |
$0.001
…
|
782ms… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 9 API 错误: 4 未遵循指令: 1
响应时间(平均)782ms
响应时间(最大)3.15s
响应时间(总计)10.94s
…
|
- 总测试数
- 16
- 错误测试数
- 14
- 尝试通过率
- 11.6%
- 输入令牌
- 10,771
- 输出令牌
- 1,173
- 推理令牌
- 0
- 响应时间(平均)
- 782ms
- 响应时间(总计)
- 10.94s
- 响应时间(最大)
- 3.15s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 2.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 3
响应时间(平均)471ms
响应时间(最大)872ms
响应时间(总计)1.41s
-
编程
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)714ms
响应时间(最大)987ms
响应时间(总计)1.43s
-
领域专项
: 5.9
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1 答案错误: 1
响应时间(平均)287ms
响应时间(最大)334ms
响应时间(总计)860ms
-
通用智能
: 4.0
只有当某个测试的所有运行都通过时,才计为完全通过。
未遵循指令: 1
响应时间(平均)395ms
响应时间(最大)395ms
响应时间(总计)395ms
-
指令遵循
: 6.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)752ms
响应时间(最大)1.22s
响应时间(总计)1.50s
-
谜题求解
: 3.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2 API 错误: 1
响应时间(平均)1.78s
响应时间(最大)3.15s
响应时间(总计)5.34s
-
工具调用
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
API 错误: 1
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #380#380 |
Solar Decidenone21/69 次尝试. 选项由适配器提供。支持 7/23 项测试。其他测试不受支持,并非失败。分数按完整测试集计算。
|
1.0… |
Upstage |
$0.009
↑
…
|
6.01s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 5
响应时间(平均)6.01s
响应时间(最大)13.10s
响应时间(总计)42.05s
…
|
- 总测试数
- 7
- 错误测试数
- 5
- 尝试通过率
- 14.5%
- 输入令牌
- 47,586
- 输出令牌
- 51
- 推理令牌
- 0
- 响应时间(平均)
- 6.01s
- 响应时间(总计)
- 42.05s
- 响应时间(最大)
- 13.10s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 0.8
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)2.41s
响应时间(最大)2.41s
响应时间(总计)2.41s
-
编程
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)5.00s
响应时间(最大)6.86s
响应时间(总计)10.00s
-
领域专项
: 4.3
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)7.26s
响应时间(最大)13.10s
响应时间(总计)14.52s
-
通用智能
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 5.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)11.66s
响应时间(最大)11.66s
响应时间(总计)11.66s
-
谜题求解
: 1.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)3.47s
响应时间(最大)3.47s
响应时间(总计)3.47s
-
工具调用
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #381#381 |
Tev1 4B Experimentalnone21/69 次尝试. 选项由适配器提供。支持 7/23 项测试。其他测试不受支持,并非失败。分数按完整测试集计算。
|
1.0… |
Togethercomputer |
$0.002
…
|
498ms… |
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 4
响应时间(平均)498ms
响应时间(最大)602ms
响应时间(总计)3.49s
…
|
- 总测试数
- 7
- 错误测试数
- 4
- 尝试通过率
- 13.0%
- 输入令牌
- 33,864
- 输出令牌
- 96
- 推理令牌
- 0
- 响应时间(平均)
- 498ms
- 响应时间(总计)
- 3.49s
- 响应时间(最大)
- 602ms
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 2.5
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)602ms
响应时间(最大)602ms
响应时间(总计)602ms
-
编程
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 3.0
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 2
响应时间(平均)509ms
响应时间(最大)563ms
响应时间(总计)1.02s
-
领域专项
: 6.7
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)440ms
响应时间(最大)491ms
响应时间(总计)879ms
-
通用智能
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 1.5
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)555ms
响应时间(最大)555ms
响应时间(总计)555ms
-
谜题求解
: 1.7
只有当某个测试的所有运行都通过时,才计为完全通过。
答案错误: 1
响应时间(平均)432ms
响应时间(最大)432ms
响应时间(总计)432ms
-
工具调用
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|
| #382#382 |
Claude Opus 5.5none已归档模型:该模型将不再更新,也不会在新测试中继续测试。
|
0.2… |
Anthropic |
$0.015
…
|
13.58s… |
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.58s
响应时间(最大)13.58s
响应时间(总计)13.58s
…
|
- 总测试数
- 1
- 错误测试数
- 0
- 尝试通过率
- 4.4%
- 输入令牌
- 73
- 输出令牌
- 735
- 推理令牌
- 0
- 响应时间(平均)
- 13.58s
- 响应时间(总计)
- 13.58s
- 响应时间(最大)
- 13.58s
-
智能体任务
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
反AI技巧
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
编程
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
综合
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
数据解析与提取
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
领域专项
: 3.3
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)13.58s
响应时间(最大)13.58s
响应时间(总计)13.58s
-
通用智能
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
指令遵循
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
谜题求解
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
工具调用
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
-
常识问答
: 0.0
只有当某个测试的所有运行都通过时,才计为完全通过。
没有失败答案。
响应时间(平均)0ms
响应时间(最大)0ms
响应时间(总计)0ms
|