| #140#140 |
Qwen3 Coder Nextnone
|
4.9… |
Qwen |
$0.009
↓
…
|
8.62s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 14 余分な書式: 1 指示に従っていない: 1
応答時間(平均)8.62s
応答時間(最大)45.14s
応答時間(合計)129.37s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 16
- 試行ごとの合格率
- 27.0%
- 入力トークン
- 47,507
- 出力トークン
- 3,584
- 推論トークン
- 0
- 応答時間(平均)
- 8.62s
- 応答時間(合計)
- 129.37s
- 応答時間(最大)
- 45.14s
-
反AIトリック
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 余分な書式: 1 指示に従っていない: 1
応答時間(平均)3.31s
応答時間(最大)4.39s
応答時間(合計)6.63s
-
コーディング
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)2.22s
応答時間(最大)3.14s
応答時間(合計)6.67s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)45.14s
応答時間(最大)45.14s
応答時間(合計)45.14s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.32s
応答時間(最大)1.32s
応答時間(合計)1.32s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)962ms
応答時間(最大)962ms
応答時間(合計)962ms
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.34s
応答時間(最大)1.34s
応答時間(合計)1.34s
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)7.78s
応答時間(最大)14.65s
応答時間(合計)15.56s
-
パズル解決
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)24.34s
応答時間(最大)42.58s
応答時間(合計)48.69s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.47s
応答時間(最大)2.47s
応答時間(合計)2.47s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)601ms
応答時間(最大)601ms
応答時間(合計)601ms
|
| #141#141 |
Nemotron 3 Supernone
|
4.9… |
NVIDIA |
$0.007
↑
…
|
5.30s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 14 指示に従っていない: 2
応答時間(平均)5.30s
応答時間(最大)16.45s
応答時間(合計)111.31s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 16
- 試行ごとの合格率
- 31.8%
- 入力トークン
- 36,456
- 出力トークン
- 6,195
- 推論トークン
- 0
- 応答時間(平均)
- 5.30s
- 応答時間(合計)
- 111.31s
- 応答時間(最大)
- 16.45s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)4.46s
応答時間(最大)9.94s
応答時間(合計)17.83s
-
コーディング
: 3.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)2.64s
応答時間(最大)3.05s
応答時間(合計)7.92s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)16.45s
応答時間(最大)16.45s
応答時間(合計)16.45s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.92s
応答時間(最大)13.23s
応答時間(合計)15.84s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)6.23s
応答時間(最大)14.38s
応答時間(合計)18.70s
-
汎用知能
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)950ms
応答時間(最大)950ms
応答時間(合計)950ms
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)804ms
応答時間(最大)921ms
応答時間(合計)1.61s
-
パズル解決
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)2.36s
応答時間(最大)3.27s
応答時間(合計)7.07s
-
ツール呼び出し
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)16.00s
応答時間(最大)16.00s
応答時間(合計)16.00s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)8.94s
応答時間(最大)8.94s
応答時間(合計)8.94s
|
| #142#142 |
Mistral Small 4none
|
4.9… |
Mistral |
$0.007
…
|
630ms… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 15 指示に従っていない: 1
応答時間(平均)630ms
応答時間(最大)1.72s
応答時間(合計)13.22s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 16
- 試行ごとの合格率
- 27.0%
- 入力トークン
- 37,309
- 出力トークン
- 2,201
- 推論トークン
- 0
- 応答時間(平均)
- 630ms
- 応答時間(合計)
- 13.22s
- 応答時間(最大)
- 1.72s
-
反AIトリック
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)395ms
応答時間(最大)769ms
応答時間(合計)1.58s
-
コーディング
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)901ms
応答時間(最大)1.28s
応答時間(合計)2.70s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.72s
応答時間(最大)1.72s
応答時間(合計)1.72s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)822ms
応答時間(最大)1.08s
応答時間(合計)1.64s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)367ms
応答時間(最大)388ms
応答時間(合計)1.10s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)729ms
応答時間(最大)729ms
応答時間(合計)729ms
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)380ms
応答時間(最大)380ms
応答時間(合計)759ms
-
パズル解決
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)399ms
応答時間(最大)570ms
応答時間(合計)1.20s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.40s
応答時間(最大)1.40s
応答時間(合計)1.40s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)397ms
応答時間(最大)397ms
応答時間(合計)397ms
|
| #143#143 |
MiMo-V2.5none
|
4.9… |
Xiaomi |
$0.007
↓
…
|
2.20s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 14 余分な書式: 1 指示に従っていない: 1
応答時間(平均)2.20s
応答時間(最大)6.86s
応答時間(合計)46.21s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 16
- 試行ごとの合格率
- 27.0%
- 入力トークン
- 41,985
- 出力トークン
- 2,267
- 推論トークン
- 0
- 応答時間(平均)
- 2.20s
- 応答時間(合計)
- 46.21s
- 応答時間(最大)
- 6.86s
-
反AIトリック
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)2.19s
応答時間(最大)6.85s
応答時間(合計)8.74s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)3.24s
応答時間(最大)5.52s
応答時間(合計)9.72s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.36s
応答時間(最大)2.36s
応答時間(合計)2.36s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)1.01s
応答時間(最大)1.18s
応答時間(合計)2.03s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)756ms
応答時間(最大)877ms
応答時間(合計)2.27s
-
汎用知能
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.86s
応答時間(最大)6.86s
応答時間(合計)6.86s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)751ms
応答時間(最大)821ms
応答時間(合計)1.50s
-
パズル解決
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)2.13s
応答時間(最大)5.18s
応答時間(合計)6.40s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.43s
応答時間(最大)2.43s
応答時間(合計)2.43s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.89s
応答時間(最大)3.89s
応答時間(合計)3.89s
|
| #144#144 |
GPT-5.4 Mininone
|
4.9… |
OpenAI |
$0.038
…
|
1.13s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13 指示に従っていない: 3
応答時間(平均)1.13s
応答時間(最大)2.52s
応答時間(合計)23.82s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 16
- 試行ごとの合格率
- 30.2%
- 入力トークン
- 34,244
- 出力トークン
- 2,541
- 推論トークン
- 0
- 応答時間(平均)
- 1.13s
- 応答時間(合計)
- 23.82s
- 応答時間(最大)
- 2.52s
-
反AIトリック
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)929ms
応答時間(最大)1.55s
応答時間(合計)3.72s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)913ms
応答時間(最大)1.19s
応答時間(合計)2.74s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.52s
応答時間(最大)2.52s
応答時間(合計)2.52s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.30s
応答時間(最大)1.58s
応答時間(合計)2.61s
-
ドメイン特化
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)937ms
応答時間(最大)1.25s
応答時間(合計)2.81s
-
汎用知能
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.82s
応答時間(最大)1.82s
応答時間(合計)1.82s
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)728ms
応答時間(最大)731ms
応答時間(合計)1.46s
-
パズル解決
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)836ms
応答時間(最大)958ms
応答時間(合計)2.51s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.32s
応答時間(最大)2.32s
応答時間(合計)2.32s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.33s
応答時間(最大)1.33s
応答時間(合計)1.33s
|
| #146#146 |
Laguna Xs.2noneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
4.8… |
Poolside |
$0.000
…
|
806ms… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 8 API エラー: 4 指示に従っていない: 1 無効なツール呼び出し: 1
応答時間(平均)806ms
応答時間(最大)2.01s
応答時間(合計)12.09s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 14
- 試行ごとの合格率
- 26.3%
- 入力トークン
- 33,675
- 出力トークン
- 2,826
- 推論トークン
- 0
- 応答時間(平均)
- 806ms
- 応答時間(合計)
- 12.09s
- 応答時間(最大)
- 2.01s
-
反AIトリック
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 API エラー: 1 指示に従っていない: 1
応答時間(平均)534ms
応答時間(最大)906ms
応答時間(合計)1.60s
-
コーディング
: 2.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.96s
応答時間(最大)1.96s
応答時間(合計)1.96s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.01s
応答時間(最大)2.01s
応答時間(合計)2.01s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)646ms
応答時間(最大)658ms
応答時間(合計)1.29s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)371ms
応答時間(最大)419ms
応答時間(合計)1.11s
-
汎用知能
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)439ms
応答時間(最大)448ms
応答時間(合計)878ms
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)650ms
応答時間(最大)843ms
応答時間(合計)1.30s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)1.93s
応答時間(最大)1.93s
応答時間(合計)1.93s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #147#147 |
GPT-4o-mininone
|
4.8… |
OpenAI |
$0.006
…
|
1.77s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 15 指示に従っていない: 1
応答時間(平均)1.77s
応答時間(最大)7.58s
応答時間(合計)24.80s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 16
- 試行ごとの合格率
- 23.8%
- 入力トークン
- 31,518
- 出力トークン
- 1,982
- 推論トークン
- 0
- 応答時間(平均)
- 1.77s
- 応答時間(合計)
- 24.80s
- 応答時間(最大)
- 7.58s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.34s
応答時間(最大)1.83s
応答時間(合計)2.67s
-
コーディング
: 3.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.63s
応答時間(最大)2.55s
応答時間(合計)4.90s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)7.58s
応答時間(最大)7.58s
応答時間(合計)7.58s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.27s
応答時間(最大)1.27s
応答時間(合計)1.27s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)637ms
応答時間(最大)637ms
応答時間(合計)637ms
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)909ms
応答時間(最大)909ms
応答時間(合計)909ms
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.11s
応答時間(最大)1.11s
応答時間(合計)1.11s
-
パズル解決
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)1.21s
応答時間(最大)1.37s
応答時間(合計)2.42s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.51s
応答時間(最大)2.51s
応答時間(合計)2.51s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)794ms
応答時間(最大)794ms
応答時間(合計)794ms
|
| #148#148 |
GPT-5.4 Nanonone
|
4.7… |
OpenAI |
$0.011
…
|
1.48s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 15 指示に従っていない: 2
応答時間(平均)1.48s
応答時間(最大)4.47s
応答時間(合計)31.01s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 17
- 試行ごとの合格率
- 30.2%
- 入力トークン
- 34,212
- 出力トークン
- 2,784
- 推論トークン
- 0
- 応答時間(平均)
- 1.48s
- 応答時間(合計)
- 31.01s
- 応答時間(最大)
- 4.47s
-
反AIトリック
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)1.18s
応答時間(最大)1.81s
応答時間(合計)4.70s
-
コーディング
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)2.22s
応答時間(最大)4.47s
応答時間(合計)6.65s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.84s
応答時間(最大)3.84s
応答時間(合計)3.84s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.11s
応答時間(最大)1.25s
応答時間(合計)2.23s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)926ms
応答時間(最大)959ms
応答時間(合計)2.78s
-
汎用知能
: 3.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.31s
応答時間(最大)1.31s
応答時間(合計)1.31s
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)784ms
応答時間(最大)859ms
応答時間(合計)1.57s
-
パズル解決
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)1.25s
応答時間(最大)1.53s
応答時間(合計)3.76s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.40s
応答時間(最大)3.40s
応答時間(合計)3.40s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)773ms
応答時間(最大)773ms
応答時間(合計)773ms
|
| #149#149 |
Nemotron 3 Nano Omni 30b A3b Reasoningmediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
4.6… |
NVIDIA |
$0.000
…
|
17.13s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 7 API エラー: 6 指示に従っていない: 1 回答なし: 1
応答時間(平均)17.13s
応答時間(最大)147.45s
応答時間(合計)222.66s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 15
- 試行ごとの合格率
- 31.6%
- 入力トークン
- 11,661
- 出力トークン
- 48,491
- 推論トークン
- 180,695
- 応答時間(平均)
- 17.13s
- 応答時間(合計)
- 222.66s
- 応答時間(最大)
- 147.45s
-
反AIトリック
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)1.20s
応答時間(最大)1.48s
応答時間(合計)3.59s
-
コーディング
: 3.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)38.09s
応答時間(最大)38.09s
応答時間(合計)38.09s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.72s
応答時間(最大)3.88s
応答時間(合計)5.43s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 回答なし: 1
応答時間(平均)56.67s
応答時間(最大)147.45s
応答時間(合計)170.02s
-
汎用知能
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
指示追従
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.37s
応答時間(最大)1.56s
応答時間(合計)2.74s
-
パズル解決
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 API エラー: 1
応答時間(平均)1.40s
応答時間(最大)1.57s
応答時間(合計)2.79s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #150#150 |
Qwen3 Coder Nextmedium
|
4.6… |
Qwen |
$0.008
↓
…
|
8.58s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13 指示に従っていない: 3 タイムアウト: 1
応答時間(平均)8.58s
応答時間(最大)81.80s
応答時間(合計)128.68s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 17
- 試行ごとの合格率
- 28.6%
- 入力トークン
- 47,250
- 出力トークン
- 3,319
- 推論トークン
- 0
- 応答時間(平均)
- 8.58s
- 応答時間(合計)
- 128.68s
- 応答時間(最大)
- 81.80s
-
反AIトリック
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 1
応答時間(平均)8.64s
応答時間(最大)15.28s
応答時間(合計)17.29s
-
コーディング
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)924ms
応答時間(最大)1.69s
応答時間(合計)2.77s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.28s
応答時間(最大)4.28s
応答時間(合計)4.28s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)81.80s
応答時間(最大)81.80s
応答時間(合計)81.80s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)638ms
応答時間(最大)638ms
応答時間(合計)638ms
-
汎用知能
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.39s
応答時間(最大)1.39s
応答時間(合計)1.39s
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)7.49s
応答時間(最大)13.67s
応答時間(合計)14.99s
-
パズル解決
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)1.25s
応答時間(最大)1.68s
応答時間(合計)2.49s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.64s
応答時間(最大)2.64s
応答時間(合計)2.64s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)399ms
応答時間(最大)399ms
応答時間(合計)399ms
|
| #151#151 |
Trinity Large Previewnone
|
4.6… |
Arcee AI |
$0.008
↑
…
|
2.98s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 12 指示に従っていない: 3 API エラー: 2
応答時間(平均)2.98s
応答時間(最大)14.34s
応答時間(合計)56.57s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 17
- 試行ごとの合格率
- 22.2%
- 入力トークン
- 29,828
- 出力トークン
- 2,169
- 推論トークン
- 0
- 応答時間(平均)
- 2.98s
- 応答時間(合計)
- 56.57s
- 応答時間(最大)
- 14.34s
-
反AIトリック
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)2.07s
応答時間(最大)4.40s
応答時間(合計)8.30s
-
コーディング
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 2 不正解: 1
応答時間(平均)14.34s
応答時間(最大)14.34s
応答時間(合計)14.34s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)8.91s
応答時間(最大)8.91s
応答時間(合計)8.91s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.26s
応答時間(最大)4.66s
応答時間(合計)6.52s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)877ms
応答時間(最大)894ms
応答時間(合計)2.63s
-
汎用知能
: 4.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)873ms
応答時間(最大)873ms
応答時間(合計)873ms
-
指示追従
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)822ms
応答時間(最大)960ms
応答時間(合計)1.64s
-
パズル解決
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)1.97s
応答時間(最大)2.87s
応答時間(合計)5.91s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.67s
応答時間(最大)6.67s
応答時間(合計)6.67s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)777ms
応答時間(最大)777ms
応答時間(合計)777ms
|
| #153#153 |
Qwen3.6 35B A3Bnone
|
4.6… |
Qwen |
$0.031
↑
…
|
3.73s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13 API エラー: 2 指示に従っていない: 2
応答時間(平均)3.73s
応答時間(最大)22.52s
応答時間(合計)70.86s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 17
- 試行ごとの合格率
- 30.2%
- 入力トークン
- 19,329
- 出力トークン
- 27,755
- 推論トークン
- 0
- 応答時間(平均)
- 3.73s
- 応答時間(合計)
- 70.86s
- 応答時間(最大)
- 22.52s
-
反AIトリック
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)2.10s
応答時間(最大)6.15s
応答時間(合計)8.41s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)8.77s
応答時間(最大)22.52s
応答時間(合計)26.32s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.46s
応答時間(最大)2.03s
応答時間(合計)2.93s
-
ドメイン特化
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)7.45s
応答時間(最大)12.46s
応答時間(合計)22.35s
-
汎用知能
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.51s
応答時間(最大)3.51s
応答時間(合計)3.51s
-
指示追従
: 6.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.86s
応答時間(最大)2.83s
応答時間(合計)3.73s
-
パズル解決
: 3.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2 不正解: 1
応答時間(平均)1.07s
応答時間(最大)1.24s
応答時間(合計)3.20s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)414ms
応答時間(最大)414ms
応答時間(合計)414ms
|
| #154#154 |
Qwen3.5-9Bnone
|
4.6… |
Qwen |
$0.003
↓
…
|
1.89s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 14 指示に従っていない: 2 無効なツール呼び出し: 1
応答時間(平均)1.89s
応答時間(最大)6.03s
応答時間(合計)39.68s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 17
- 試行ごとの合格率
- 20.6%
- 入力トークン
- 48,041
- 出力トークン
- 3,952
- 推論トークン
- 0
- 応答時間(平均)
- 1.89s
- 応答時間(合計)
- 39.68s
- 応答時間(最大)
- 6.03s
-
反AIトリック
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)1.71s
応答時間(最大)3.79s
応答時間(合計)6.84s
-
コーディング
: 3.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)5.60s
応答時間(最大)6.03s
応答時間(合計)16.81s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)5.91s
応答時間(最大)5.91s
応答時間(合計)5.91s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)847ms
応答時間(最大)1.09s
応答時間(合計)1.69s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)464ms
応答時間(最大)622ms
応答時間(合計)1.39s
-
汎用知能
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)552ms
応答時間(最大)552ms
応答時間(合計)552ms
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)514ms
応答時間(最大)582ms
応答時間(合計)1.03s
-
パズル解決
: 3.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)621ms
応答時間(最大)759ms
応答時間(合計)1.86s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.27s
応答時間(最大)1.27s
応答時間(合計)1.27s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.32s
応答時間(最大)2.32s
応答時間(合計)2.32s
|
| #155#155 |
Mercury 2none
|
4.5… |
Inception |
$0.011
…
|
653ms… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 16 指示に従っていない: 1
応答時間(平均)653ms
応答時間(最大)1.43s
応答時間(合計)13.72s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 17
- 試行ごとの合格率
- 23.8%
- 入力トークン
- 28,113
- 出力トークン
- 4,439
- 推論トークン
- 0
- 応答時間(平均)
- 653ms
- 応答時間(合計)
- 13.72s
- 応答時間(最大)
- 1.43s
-
反AIトリック
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)483ms
応答時間(最大)716ms
応答時間(合計)1.93s
-
コーディング
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.03s
応答時間(最大)1.43s
応答時間(合計)3.10s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)606ms
応答時間(最大)606ms
応答時間(合計)606ms
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)667ms
応答時間(最大)819ms
応答時間(合計)1.33s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)534ms
応答時間(最大)733ms
応答時間(合計)1.60s
-
汎用知能
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)628ms
応答時間(最大)628ms
応答時間(合計)628ms
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)551ms
応答時間(最大)622ms
応答時間(合計)1.10s
-
パズル解決
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)535ms
応答時間(最大)642ms
応答時間(合計)1.60s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.27s
応答時間(最大)1.27s
応答時間(合計)1.27s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)548ms
応答時間(最大)548ms
応答時間(合計)548ms
|
| #156#156 |
Hy3 previewnoneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
4.4… |
Tencent |
$0.003
↕
…
|
12.92s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 8 API エラー: 4 指示に従っていない: 4 余分な書式: 1
応答時間(平均)12.92s
応答時間(最大)35.84s
応答時間(合計)232.64s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 17
- 試行ごとの合格率
- 23.8%
- 入力トークン
- 27,172
- 出力トークン
- 2,661
- 推論トークン
- 0
- 応答時間(平均)
- 12.92s
- 応答時間(合計)
- 232.64s
- 応答時間(最大)
- 35.84s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2 不正解: 1
応答時間(平均)11.10s
応答時間(最大)26.88s
応答時間(合計)44.41s
-
コーディング
: 2.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 2 不正解: 1
応答時間(平均)4.56s
応答時間(最大)4.56s
応答時間(合計)4.56s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)35.84s
応答時間(最大)35.84s
応答時間(合計)35.84s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)2.85s
応答時間(最大)2.85s
応答時間(合計)2.85s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 API エラー: 1
応答時間(平均)17.61s
応答時間(最大)25.68s
応答時間(合計)52.82s
-
汎用知能
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)16.07s
応答時間(最大)16.07s
応答時間(合計)16.07s
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)12.98s
応答時間(最大)23.51s
応答時間(合計)25.95s
-
パズル解決
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)4.56s
応答時間(最大)7.35s
応答時間(合計)13.67s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)33.76s
応答時間(最大)33.76s
応答時間(合計)33.76s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.71s
応答時間(最大)2.71s
応答時間(合計)2.71s
|
| #157#157 |
Grok 4.1 Fastnoneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
4.4… |
X AI |
$0.008
↓
…
|
1.62s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13 指示に従っていない: 3
応答時間(平均)1.62s
応答時間(最大)5.51s
応答時間(合計)19.48s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 16
- 試行ごとの合格率
- 22.8%
- 入力トークン
- 36,608
- 出力トークン
- 1,723
- 推論トークン
- 0
- 応答時間(平均)
- 1.62s
- 応答時間(合計)
- 19.48s
- 応答時間(最大)
- 5.51s
-
反AIトリック
: 3.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 1
応答時間(平均)1.07s
応答時間(最大)1.73s
応答時間(合計)2.15s
-
コーディング
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.79s
応答時間(最大)1.79s
応答時間(合計)1.79s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.33s
応答時間(最大)3.33s
応答時間(合計)3.33s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)943ms
応答時間(最大)943ms
応答時間(合計)943ms
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.06s
応答時間(最大)1.06s
応答時間(合計)1.06s
-
汎用知能
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.08s
応答時間(最大)1.08s
応答時間(合計)1.08s
-
指示追従
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)685ms
応答時間(最大)685ms
応答時間(合計)685ms
-
パズル解決
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.10s
応答時間(最大)1.36s
応答時間(合計)2.21s
-
ツール呼び出し
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)5.51s
応答時間(最大)5.51s
応答時間(合計)5.51s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)731ms
応答時間(最大)731ms
応答時間(合計)731ms
|
| #162#162 |
Nemotron 3 Nano Omni 30b A3b Reasoningnoneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
4.1… |
NVIDIA |
$0.000
…
|
728ms… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9 API エラー: 6 指示に従っていない: 2
応答時間(平均)728ms
応答時間(最大)2.21s
応答時間(合計)9.47s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 17
- 試行ごとの合格率
- 17.5%
- 入力トークン
- 11,661
- 出力トークン
- 1,302
- 推論トークン
- 0
- 応答時間(平均)
- 728ms
- 応答時間(合計)
- 9.47s
- 応答時間(最大)
- 2.21s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 API エラー: 1
応答時間(平均)584ms
応答時間(最大)772ms
応答時間(合計)1.75s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.27s
応答時間(最大)1.27s
応答時間(合計)1.27s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 3.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.42s
応答時間(最大)2.21s
応答時間(合計)2.84s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)489ms
応答時間(最大)513ms
応答時間(合計)1.47s
-
汎用知能
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
指示追従
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)541ms
応答時間(最大)542ms
応答時間(合計)1.08s
-
パズル解決
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 指示に従っていない: 1 不正解: 1
応答時間(平均)532ms
応答時間(最大)580ms
応答時間(合計)1.06s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #163#163 |
Granite 4.1 8Bnone
|
4.0… |
IBM Granite |
$0.003
…
|
728ms… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13 指示に従っていない: 4 余分な書式: 1 無効なツール呼び出し: 1
応答時間(平均)728ms
応答時間(最大)2.17s
応答時間(合計)15.29s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 19
- 試行ごとの合格率
- 9.5%
- 入力トークン
- 46,285
- 出力トークン
- 2,911
- 推論トークン
- 0
- 応答時間(平均)
- 728ms
- 応答時間(合計)
- 15.29s
- 応答時間(最大)
- 2.17s
-
反AIトリック
: 4.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)844ms
応答時間(最大)1.91s
応答時間(合計)3.38s
-
コーディング
: 4.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 指示に従っていない: 1 不正解: 1
応答時間(平均)775ms
応答時間(最大)1.07s
応答時間(合計)2.33s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)1.88s
応答時間(最大)1.88s
応答時間(合計)1.88s
-
データ解析と抽出
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)575ms
応答時間(最大)583ms
応答時間(合計)1.15s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)357ms
応答時間(最大)463ms
応答時間(合計)1.07s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)499ms
応答時間(最大)499ms
応答時間(合計)499ms
-
指示追従
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)344ms
応答時間(最大)358ms
応答時間(合計)687ms
-
パズル解決
: 3.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)608ms
応答時間(最大)960ms
応答時間(合計)1.82s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.17s
応答時間(最大)2.17s
応答時間(合計)2.17s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)306ms
応答時間(最大)306ms
応答時間(合計)306ms
|
| #22#22 |
Step 3.7 Flashmedium
|
8.0… |
Stepfun |
$0.376
…
|
20.35s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 1 回答なし: 1
応答時間(平均)20.35s
応答時間(最大)113.98s
応答時間(合計)427.42s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 73.0%
- 入力トークン
- 39,981
- 出力トークン
- 319,958
- 推論トークン
- 0
- 応答時間(平均)
- 20.35s
- 応答時間(合計)
- 427.42s
- 応答時間(最大)
- 113.98s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)9.65s
応答時間(最大)35.08s
応答時間(合計)38.62s
-
コーディング
: 8.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)27.42s
応答時間(最大)60.98s
応答時間(合計)82.26s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.06s
応答時間(最大)9.06s
応答時間(合計)9.06s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.75s
応答時間(最大)3.35s
応答時間(合計)5.49s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)48.27s
応答時間(最大)97.10s
応答時間(合計)144.81s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.85s
応答時間(最大)6.85s
応答時間(合計)6.85s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.83s
応答時間(最大)2.21s
応答時間(合計)3.65s
-
パズル解決
: 5.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)6.19s
応答時間(最大)12.51s
応答時間(合計)18.56s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.16s
応答時間(最大)4.16s
応答時間(合計)4.16s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)113.98s
応答時間(最大)113.98s
応答時間(合計)113.98s
|
| #145#145 |
Laguna M.1noneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
4.8… |
Poolside |
$0.000
…
|
2.89s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 10 API エラー: 4 無効なツール呼び出し: 1
応答時間(平均)2.89s
応答時間(最大)15.42s
応答時間(合計)43.28s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 15
- 試行ごとの合格率
- 31.6%
- 入力トークン
- 38,147
- 出力トークン
- 2,054
- 推論トークン
- 0
- 応答時間(平均)
- 2.89s
- 応答時間(合計)
- 43.28s
- 応答時間(最大)
- 15.42s
-
反AIトリック
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 API エラー: 1
応答時間(平均)705ms
応答時間(最大)975ms
応答時間(合計)2.12s
-
コーディング
: 7.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.93s
応答時間(最大)2.93s
応答時間(合計)2.93s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)4.32s
応答時間(最大)4.32s
応答時間(合計)4.32s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.37s
応答時間(最大)5.76s
応答時間(合計)6.73s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)5.50s
応答時間(最大)15.42s
応答時間(合計)16.50s
-
汎用知能
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)683ms
応答時間(最大)691ms
応答時間(合計)1.37s
-
パズル解決
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 API エラー: 1
応答時間(平均)891ms
応答時間(最大)1.21s
応答時間(合計)1.78s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.54s
応答時間(最大)7.54s
応答時間(合計)7.54s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #41#41 |
Nemotron 3 Ultra 550b A55bmedium
|
7.5… |
NVIDIA |
$0.177
↕
…
|
15.05s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 7 API エラー: 1
応答時間(平均)15.05s
応答時間(最大)43.93s
応答時間(合計)316.09s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 69.8%
- 入力トークン
- 46,813
- 出力トークン
- 18,002
- 推論トークン
- 53,091
- 応答時間(平均)
- 15.05s
- 応答時間(合計)
- 316.09s
- 応答時間(最大)
- 43.93s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.62s
応答時間(最大)16.86s
応答時間(合計)34.49s
-
コーディング
: 8.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)26.53s
応答時間(最大)31.91s
応答時間(合計)79.58s
-
複合
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)43.93s
応答時間(最大)43.93s
応答時間(合計)43.93s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.68s
応答時間(最大)7.94s
応答時間(合計)11.36s
-
ドメイン特化
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)24.90s
応答時間(最大)34.96s
応答時間(合計)74.71s
-
汎用知能
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)2.52s
応答時間(最大)2.52s
応答時間(合計)2.52s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.35s
応答時間(最大)9.38s
応答時間(合計)12.69s
-
パズル解決
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)3.54s
応答時間(最大)6.03s
応答時間(合計)10.62s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.72s
応答時間(最大)7.72s
応答時間(合計)7.72s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)38.47s
応答時間(最大)38.47s
応答時間(合計)38.47s
|
| #51#51 |
Mimo V2 PROmediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
7.4… |
Xiaomi |
$0.333
↑
…
|
22.16s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 API エラー: 1 余分な書式: 1 指示に従っていない: 1 タイムアウト: 1
応答時間(平均)22.16s
応答時間(最大)136.29s
応答時間(合計)443.22s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 73.0%
- 入力トークン
- 40,961
- 出力トークン
- 2,518
- 推論トークン
- 81,801
- 応答時間(平均)
- 22.16s
- 応答時間(合計)
- 443.22s
- 応答時間(最大)
- 136.29s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.86s
応答時間(最大)3.92s
応答時間(合計)11.45s
-
コーディング
: 6.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)94.21s
応答時間(最大)136.29s
応答時間(合計)188.41s
-
複合
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)64.71s
応答時間(最大)64.71s
応答時間(合計)64.71s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)17.20s
応答時間(最大)17.44s
応答時間(合計)34.40s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)8.82s
応答時間(最大)14.48s
応答時間(合計)26.47s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.92s
応答時間(最大)4.92s
応答時間(合計)4.92s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.36s
応答時間(最大)4.35s
応答時間(合計)6.72s
-
パズル解決
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 指示に従っていない: 1
応答時間(平均)5.08s
応答時間(最大)6.41s
応答時間(合計)15.23s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.19s
応答時間(最大)8.19s
応答時間(合計)8.19s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)82.71s
応答時間(最大)82.71s
応答時間(合計)82.71s
|
| #67#67 |
MiniMax M3medium
|
7.1… |
Minimax |
$0.131
…
|
68.17s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 3 不正解: 3 指示に従っていない: 2 余分な書式: 1 回答なし: 1
応答時間(平均)68.17s
応答時間(最大)431.03s
応答時間(合計)1363.38s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 10
- 試行ごとの合格率
- 65.1%
- 入力トークン
- 46,546
- 出力トークン
- 49,036
- 推論トークン
- 92,543
- 応答時間(平均)
- 68.17s
- 応答時間(合計)
- 1363.38s
- 応答時間(最大)
- 431.03s
-
反AIトリック
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)14.95s
応答時間(最大)44.99s
応答時間(合計)59.78s
-
コーディング
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 タイムアウト: 1
応答時間(平均)144.74s
応答時間(最大)218.40s
応答時間(合計)434.22s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)65.30s
応答時間(最大)65.30s
応答時間(合計)65.30s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.92s
応答時間(最大)16.89s
応答時間(合計)29.85s
-
ドメイン特化
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2
応答時間(平均)233.13s
応答時間(最大)431.03s
応答時間(合計)466.26s
-
汎用知能
: 5.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)33.25s
応答時間(最大)33.25s
応答時間(合計)33.25s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.14s
応答時間(最大)6.80s
応答時間(合計)12.27s
-
パズル解決
: 7.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)49.91s
応答時間(最大)128.09s
応答時間(合計)149.74s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.91s
応答時間(最大)11.91s
応答時間(合計)11.91s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)100.80s
応答時間(最大)100.80s
応答時間(合計)100.80s
|
| #103#103 |
DeepSeek V4 Prohigh
|
6.0… |
DeepSeek |
$0.079
↓
…
|
65.21s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 5 不正解: 4 タイムアウト: 3 指示に従っていない: 1
応答時間(平均)65.21s
応答時間(最大)358.35s
応答時間(合計)1304.19s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 13
- 試行ごとの合格率
- 52.4%
- 入力トークン
- 32,240
- 出力トークン
- 12,250
- 推論トークン
- 72,257
- 応答時間(平均)
- 65.21s
- 応答時間(合計)
- 1304.19s
- 応答時間(最大)
- 358.35s
-
反AIトリック
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)16.53s
応答時間(最大)39.91s
応答時間(合計)66.11s
-
コーディング
: 3.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2 API エラー: 1
応答時間(平均)118.23s
応答時間(最大)184.68s
応答時間(合計)236.45s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)65.02s
応答時間(最大)65.02s
応答時間(合計)65.02s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)23.62s
応答時間(最大)36.44s
応答時間(合計)47.24s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 タイムアウト: 1 不正解: 1
応答時間(平均)205.66s
応答時間(最大)358.35s
応答時間(合計)616.97s
-
汎用知能
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)25.09s
応答時間(最大)25.09s
応答時間(合計)25.09s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)41.16s
応答時間(最大)43.56s
応答時間(合計)82.32s
-
パズル解決
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)34.84s
応答時間(最大)76.46s
応答時間(合計)104.52s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)21.33s
応答時間(最大)21.33s
応答時間(合計)21.33s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)39.14s
応答時間(最大)39.14s
応答時間(合計)39.14s
|
| #113#113 |
DeepSeek V4 Pronone
|
5.7… |
DeepSeek |
$0.025
↓
…
|
12.38s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 10 指示に従っていない: 2 API エラー: 1 余分な書式: 1
応答時間(平均)12.38s
応答時間(最大)58.65s
応答時間(合計)260.06s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 14
- 試行ごとの合格率
- 42.9%
- 入力トークン
- 44,845
- 出力トークン
- 5,349
- 推論トークン
- 0
- 応答時間(平均)
- 12.38s
- 応答時間(合計)
- 260.06s
- 応答時間(最大)
- 58.65s
-
反AIトリック
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 1
応答時間(平均)14.02s
応答時間(最大)38.83s
応答時間(合計)56.07s
-
コーディング
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)6.11s
応答時間(最大)14.69s
応答時間(合計)18.33s
-
複合
: 9.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)25.49s
応答時間(最大)25.49s
応答時間(合計)25.49s
-
データ解析と抽出
: 6.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)30.54s
応答時間(最大)58.65s
応答時間(合計)61.08s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)3.17s
応答時間(最大)6.59s
応答時間(合計)9.52s
-
汎用知能
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)3.75s
応答時間(最大)3.75s
応答時間(合計)3.75s
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)8.23s
応答時間(最大)13.43s
応答時間(合計)16.45s
-
パズル解決
: 7.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)15.95s
応答時間(最大)27.12s
応答時間(合計)47.86s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.92s
応答時間(最大)5.92s
応答時間(合計)5.92s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)15.59s
応答時間(最大)15.59s
応答時間(合計)15.59s
|
| #55#55 |
GLM 5.1medium
|
7.3… |
Z.ai |
$0.292
↓
…
|
33.67s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 タイムアウト: 2 API エラー: 1 余分な書式: 1 回答なし: 1
応答時間(平均)33.67s
応答時間(最大)172.60s
応答時間(合計)673.41s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 68.3%
- 入力トークン
- 32,995
- 出力トークン
- 11,655
- 推論トークン
- 75,421
- 応答時間(平均)
- 33.67s
- 応答時間(合計)
- 673.41s
- 応答時間(最大)
- 172.60s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.31s
応答時間(最大)14.20s
応答時間(合計)33.24s
-
コーディング
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 回答なし: 1 タイムアウト: 1
応答時間(平均)109.63s
応答時間(最大)172.60s
応答時間(合計)328.90s
-
複合
: 9.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)43.11s
応答時間(最大)43.11s
応答時間(合計)43.11s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.33s
応答時間(最大)9.40s
応答時間(合計)18.66s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)29.77s
応答時間(最大)32.22s
応答時間(合計)89.30s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)20.95s
応答時間(最大)20.95s
応答時間(合計)20.95s
-
指示追従
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)7.47s
応答時間(最大)10.16s
応答時間(合計)14.94s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)31.64s
応答時間(最大)46.04s
応答時間(合計)94.91s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)29.40s
応答時間(最大)29.40s
応答時間(合計)29.40s
|
| #73#73 |
Seed-2.0-Minimedium
|
6.9… |
Bytedance Seed |
$0.044
…
|
80.22s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 5 不正解: 4 指示に従っていない: 1
応答時間(平均)80.22s
応答時間(最大)262.83s
応答時間(合計)1363.72s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 10
- 試行ごとの合格率
- 57.1%
- 入力トークン
- 41,904
- 出力トークン
- 2,555
- 推論トークン
- 95,974
- 応答時間(平均)
- 80.22s
- 応答時間(合計)
- 1363.72s
- 応答時間(最大)
- 262.83s
-
反AIトリック
: 6.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)74.75s
応答時間(最大)182.10s
応答時間(合計)298.98s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)220.48s
応答時間(最大)243.66s
応答時間(合計)440.97s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)262.83s
応答時間(最大)262.83s
応答時間(合計)262.83s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)24.27s
応答時間(最大)27.52s
応答時間(合計)48.54s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 3
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
汎用知能
: 5.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)36.65s
応答時間(最大)36.65s
応答時間(合計)36.65s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.47s
応答時間(最大)19.46s
応答時間(合計)34.93s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)31.79s
応答時間(最大)50.78s
応答時間(合計)95.38s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)88.68s
応答時間(最大)88.68s
応答時間(合計)88.68s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)56.76s
応答時間(最大)56.76s
応答時間(合計)56.76s
|
| #152#152 |
MiMo-V2-Flashnone
|
4.6… |
Xiaomi |
$0.025
↑
…
|
2.76s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13 指示に従っていない: 2 API エラー: 1 余分な書式: 1
応答時間(平均)2.76s
応答時間(最大)19.68s
応答時間(合計)46.99s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 17
- 試行ごとの合格率
- 25.4%
- 入力トークン
- 36,851
- 出力トークン
- 68,882
- 推論トークン
- 0
- 応答時間(平均)
- 2.76s
- 応答時間(合計)
- 46.99s
- 応答時間(最大)
- 19.68s
-
反AIトリック
: 3.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)1.19s
応答時間(最大)2.73s
応答時間(合計)4.76s
-
コーディング
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)2.64s
応答時間(最大)3.84s
応答時間(合計)7.92s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.87s
応答時間(最大)2.87s
応答時間(合計)2.87s
-
データ解析と抽出
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 余分な書式: 1
応答時間(平均)19.68s
応答時間(最大)19.68s
応答時間(合計)19.68s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)564ms
応答時間(最大)564ms
応答時間(合計)564ms
-
汎用知能
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.67s
応答時間(最大)1.67s
応答時間(合計)1.67s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)857ms
応答時間(最大)955ms
応答時間(合計)1.71s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.86s
応答時間(最大)2.70s
応答時間(合計)3.71s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.28s
応答時間(最大)2.28s
応答時間(合計)2.28s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.82s
応答時間(最大)1.82s
応答時間(合計)1.82s
|
| #158#158 |
GLM 4.7 Flashmedium
|
4.4… |
Z.ai |
$0.054
…
|
35.10s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9 回答なし: 3 指示に従っていない: 2 タイムアウト: 2 無効なツール呼び出し: 1
応答時間(平均)35.10s
応答時間(最大)174.55s
応答時間(合計)456.24s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 17
- 試行ごとの合格率
- 33.3%
- 入力トークン
- 37,206
- 出力トークン
- 43,754
- 推論トークン
- 89,079
- 応答時間(平均)
- 35.10s
- 応答時間(合計)
- 456.24s
- 応答時間(最大)
- 174.55s
-
反AIトリック
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)14.95s
応答時間(最大)27.09s
応答時間(合計)29.90s
-
コーディング
: 3.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2 回答なし: 1
応答時間(平均)55.33s
応答時間(最大)89.40s
応答時間(合計)110.66s
-
複合
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)65.57s
応答時間(最大)65.57s
応答時間(合計)65.57s
-
データ解析と抽出
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)1.51s
応答時間(最大)1.51s
応答時間(合計)1.51s
-
ドメイン特化
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 回答なし: 1
応答時間(平均)174.55s
応答時間(最大)174.55s
応答時間(合計)174.55s
-
汎用知能
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)18.14s
応答時間(最大)18.14s
応答時間(合計)18.14s
-
指示追従
: 6.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.97s
応答時間(最大)2.97s
応答時間(合計)2.97s
-
パズル解決
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)12.93s
応答時間(最大)22.33s
応答時間(合計)25.85s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.95s
応答時間(最大)15.95s
応答時間(合計)15.95s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)11.13s
応答時間(最大)11.13s
応答時間(合計)11.13s
|
| #161#161 |
Qwen3.5-9Bmedium
|
4.2… |
Qwen |
$0.035
↓
…
|
82.24s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 11 回答なし: 2 不正解: 2 API エラー: 1 余分な書式: 1 指示に従っていない: 1
応答時間(平均)82.24s
応答時間(最大)226.38s
応答時間(合計)1315.88s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 18
- 試行ごとの合格率
- 27.0%
- 入力トークン
- 17,070
- 出力トークン
- 29,045
- 推論トークン
- 209,516
- 応答時間(平均)
- 82.24s
- 応答時間(合計)
- 1315.88s
- 応答時間(最大)
- 226.38s
-
反AIトリック
: 5.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2 不正解: 1
応答時間(平均)34.44s
応答時間(最大)57.86s
応答時間(合計)103.31s
-
コーディング
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 回答なし: 1 タイムアウト: 1
応答時間(平均)100.88s
応答時間(最大)135.61s
応答時間(合計)201.75s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 タイムアウト: 1
応答時間(平均)87.31s
応答時間(最大)87.31s
応答時間(合計)87.31s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 3
応答時間(平均)137.75s
応答時間(最大)202.61s
応答時間(合計)413.24s
-
汎用知能
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)226.38s
応答時間(最大)226.38s
応答時間(合計)226.38s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)5.75s
応答時間(最大)5.75s
応答時間(合計)5.75s
-
パズル解決
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2 不正解: 1
応答時間(平均)32.27s
応答時間(最大)47.31s
応答時間(合計)96.80s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.31s
応答時間(最大)4.31s
応答時間(合計)4.31s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)177.02s
応答時間(最大)177.02s
応答時間(合計)177.02s
|