| #54#54 |
Gemini 3 Flash Previewlow
|
7.4… |
Google |
$0.111
…
|
5.76s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5
応答時間(平均)5.76s
応答時間(最大)14.72s
応答時間(合計)120.93s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 5
- 試行ごとの合格率
- 79.4%
- 入力トークン
- 36,769
- 出力トークン
- 2,076
- 推論トークン
- 28,518
- 応答時間(平均)
- 5.76s
- 応答時間(合計)
- 120.93s
- 応答時間(最大)
- 14.72s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.48s
応答時間(最大)4.31s
応答時間(合計)13.94s
-
コーディング
: 5.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)6.00s
応答時間(最大)6.94s
応答時間(合計)18.00s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.27s
応答時間(最大)3.27s
応答時間(合計)3.27s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.40s
応答時間(最大)14.72s
応答時間(合計)18.80s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)8.05s
応答時間(最大)14.40s
応答時間(合計)24.15s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.68s
応答時間(最大)3.68s
応答時間(合計)3.68s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.02s
応答時間(最大)7.35s
応答時間(合計)14.03s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.77s
応答時間(最大)10.27s
応答時間(合計)17.32s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.99s
応答時間(最大)4.99s
応答時間(合計)4.99s
-
雑学
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.75s
応答時間(最大)2.75s
応答時間(合計)2.75s
|
| #53#53 |
MiMo-V2.5-Promedium
|
7.4… |
Xiaomi |
$0.106
↓
…
|
26.13s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 3 不正解: 3 指示に従っていない: 2 API エラー: 1
応答時間(平均)26.13s
応答時間(最大)130.77s
応答時間(合計)548.65s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 68.3%
- 入力トークン
- 40,854
- 出力トークン
- 5,015
- 推論トークン
- 97,742
- 応答時間(平均)
- 26.13s
- 応答時間(合計)
- 548.65s
- 応答時間(最大)
- 130.77s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.26s
応答時間(最大)6.38s
応答時間(合計)13.06s
-
コーディング
: 6.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 余分な書式: 1
応答時間(平均)92.07s
応答時間(最大)130.77s
応答時間(合計)276.20s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)53.36s
応答時間(最大)53.36s
応答時間(合計)53.36s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)18.81s
応答時間(最大)20.29s
応答時間(合計)37.61s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 2
応答時間(平均)37.87s
応答時間(最大)84.22s
応答時間(合計)113.60s
-
汎用知能
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.02s
応答時間(最大)4.02s
応答時間(合計)4.02s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.77s
応答時間(最大)3.21s
応答時間(合計)5.54s
-
パズル解決
: 6.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)5.31s
応答時間(最大)9.12s
応答時間(合計)15.94s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)16.87s
応答時間(最大)16.87s
応答時間(合計)16.87s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)12.46s
応答時間(最大)12.46s
応答時間(合計)12.46s
|
| #52#52 |
Seed-2.0-Minimedium
|
7.4… |
Bytedance Seed |
$0.044
…
|
80.22s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 5 不正解: 4 指示に従っていない: 1
応答時間(平均)80.22s
応答時間(最大)262.83s
応答時間(合計)1363.72s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 10
- 試行ごとの合格率
- 57.1%
- 入力トークン
- 41,904
- 出力トークン
- 2,555
- 推論トークン
- 95,974
- 応答時間(平均)
- 80.22s
- 応答時間(合計)
- 1363.72s
- 応答時間(最大)
- 262.83s
-
反AIトリック
: 6.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)74.75s
応答時間(最大)182.10s
応答時間(合計)298.98s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)220.48s
応答時間(最大)243.66s
応答時間(合計)440.97s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)262.83s
応答時間(最大)262.83s
応答時間(合計)262.83s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)24.27s
応答時間(最大)27.52s
応答時間(合計)48.54s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 3
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
汎用知能
: 5.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)36.65s
応答時間(最大)36.65s
応答時間(合計)36.65s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.47s
応答時間(最大)19.46s
応答時間(合計)34.93s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)31.79s
応答時間(最大)50.78s
応答時間(合計)95.38s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)88.68s
応答時間(最大)88.68s
応答時間(合計)88.68s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)56.76s
応答時間(最大)56.76s
応答時間(合計)56.76s
|
| #51#51 |
Claude Opus 4.7noneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
7.4… |
Anthropic |
$0.505
…
|
3.02s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)3.02s
応答時間(最大)18.27s
応答時間(合計)57.44s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 3
- 試行ごとの合格率
- 76.2%
- 入力トークン
- 69,576
- 出力トークン
- 6,265
- 推論トークン
- 0
- 応答時間(平均)
- 3.02s
- 応答時間(合計)
- 57.44s
- 応答時間(最大)
- 18.27s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.12s
応答時間(最大)3.75s
応答時間(合計)8.50s
-
コーディング
: 3.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.84s
応答時間(最大)2.84s
応答時間(合計)2.84s
-
複合
: 9.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)18.27s
応答時間(最大)18.27s
応答時間(合計)18.27s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.15s
応答時間(最大)2.33s
応答時間(合計)4.29s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.19s
応答時間(最大)1.40s
応答時間(合計)3.58s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.47s
応答時間(最大)3.47s
応答時間(合計)3.47s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.46s
応答時間(最大)1.68s
応答時間(合計)2.91s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.46s
応答時間(最大)3.72s
応答時間(合計)7.38s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.74s
応答時間(最大)4.74s
応答時間(合計)4.74s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.46s
応答時間(最大)1.46s
応答時間(合計)1.46s
|
| #50#50 |
DeepSeek V3.2medium
|
7.5… |
DeepSeek |
$0.044
↓
…
|
68.71s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 API エラー: 2 タイムアウト: 2 指示に従っていない: 1
応答時間(平均)68.71s
応答時間(最大)376.10s
応答時間(合計)1442.81s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 10
- 試行ごとの合格率
- 65.1%
- 入力トークン
- 38,333
- 出力トークン
- 7,186
- 推論トークン
- 99,081
- 応答時間(平均)
- 68.71s
- 応答時間(合計)
- 1442.81s
- 応答時間(最大)
- 376.10s
-
反AIトリック
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)24.23s
応答時間(最大)29.86s
応答時間(合計)96.93s
-
コーディング
: 6.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)248.68s
応答時間(最大)376.10s
応答時間(合計)746.04s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)93.11s
応答時間(最大)93.11s
応答時間(合計)93.11s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)36.09s
応答時間(最大)39.12s
応答時間(合計)72.18s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)24.27s
応答時間(最大)33.91s
応答時間(合計)72.82s
-
汎用知能
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)58.29s
応答時間(最大)58.29s
応答時間(合計)58.29s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)35.78s
応答時間(最大)47.30s
応答時間(合計)71.56s
-
パズル解決
: 7.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)37.69s
応答時間(最大)59.22s
応答時間(合計)113.08s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)34.81s
応答時間(最大)34.81s
応答時間(合計)34.81s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)83.99s
応答時間(最大)83.99s
応答時間(合計)83.99s
|
| #49#49 |
Qwen3.6 Flashmedium
|
7.5… |
Qwen |
$0.288
↓
…
|
19.25s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 8 指示に従っていない: 1
応答時間(平均)19.25s
応答時間(最大)122.87s
応答時間(合計)404.20s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 71.4%
- 入力トークン
- 42,362
- 出力トークン
- 2,995
- 推論トークン
- 245,358
- 応答時間(平均)
- 19.25s
- 応答時間(合計)
- 404.20s
- 応答時間(最大)
- 122.87s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.10s
応答時間(最大)9.60s
応答時間(合計)24.39s
-
コーディング
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)42.85s
応答時間(最大)78.01s
応答時間(合計)128.55s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)20.28s
応答時間(最大)20.28s
応答時間(合計)20.28s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.65s
応答時間(最大)10.35s
応答時間(合計)19.31s
-
ドメイン特化
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)14.65s
応答時間(最大)26.85s
応答時間(合計)43.95s
-
汎用知能
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)9.88s
応答時間(最大)9.88s
応答時間(合計)9.88s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.05s
応答時間(最大)6.94s
応答時間(合計)12.10s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)6.29s
応答時間(最大)8.18s
応答時間(合計)18.87s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.00s
応答時間(最大)4.00s
応答時間(合計)4.00s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)122.87s
応答時間(最大)122.87s
応答時間(合計)122.87s
|
| #48#48 |
GPT-5.4 Nanomedium
|
7.5… |
OpenAI |
$0.107
…
|
11.95s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 8 指示に従っていない: 2
応答時間(平均)11.95s
応答時間(最大)94.06s
応答時間(合計)250.98s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 10
- 試行ごとの合格率
- 63.5%
- 入力トークン
- 35,434
- 出力トークン
- 3,014
- 推論トークン
- 76,520
- 応答時間(平均)
- 11.95s
- 応答時間(合計)
- 250.98s
- 応答時間(最大)
- 94.06s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.52s
応答時間(最大)7.74s
応答時間(合計)18.10s
-
コーディング
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)19.12s
応答時間(最大)28.80s
応答時間(合計)57.37s
-
複合
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)24.13s
応答時間(最大)24.13s
応答時間(合計)24.13s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.54s
応答時間(最大)3.33s
応答時間(合計)5.08s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)38.18s
応答時間(最大)94.06s
応答時間(合計)114.53s
-
汎用知能
: 4.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.15s
応答時間(最大)4.15s
応答時間(合計)4.15s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.88s
応答時間(最大)2.61s
応答時間(合計)3.75s
-
パズル解決
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)3.79s
応答時間(最大)4.02s
応答時間(合計)11.36s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.71s
応答時間(最大)7.71s
応答時間(合計)7.71s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.81s
応答時間(最大)4.81s
応答時間(合計)4.81s
|
| #47#47 |
GPT-5.3 Chatnone
|
7.5… |
OpenAI |
$0.433
…
|
6.34s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 7 指示に従っていない: 2
応答時間(平均)6.34s
応答時間(最大)18.33s
応答時間(合計)133.13s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 66.7%
- 入力トークン
- 34,209
- 出力トークン
- 26,617
- 推論トークン
- 0
- 応答時間(平均)
- 6.34s
- 応答時間(合計)
- 133.13s
- 応答時間(最大)
- 18.33s
-
反AIトリック
: 6.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)3.86s
応答時間(最大)7.35s
応答時間(合計)15.44s
-
コーディング
: 5.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)10.52s
応答時間(最大)11.72s
応答時間(合計)31.55s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.96s
応答時間(最大)11.96s
応答時間(合計)11.96s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.21s
応答時間(最大)2.52s
応答時間(合計)4.42s
-
ドメイン特化
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)13.01s
応答時間(最大)18.33s
応答時間(合計)39.04s
-
汎用知能
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.99s
応答時間(最大)1.99s
応答時間(合計)1.99s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.51s
応答時間(最大)4.60s
応答時間(合計)7.01s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.99s
応答時間(最大)3.16s
応答時間(合計)8.97s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.36s
応答時間(最大)8.36s
応答時間(合計)8.36s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.38s
応答時間(最大)4.38s
応答時間(合計)4.38s
|
| #46#46 |
Mercury 2medium
|
7.5… |
Inception |
$0.058
…
|
2.24s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 8 指示に従っていない: 3
応答時間(平均)2.24s
応答時間(最大)14.63s
応答時間(合計)44.72s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 11
- 試行ごとの合格率
- 54.0%
- 入力トークン
- 35,116
- 出力トークン
- 4,048
- 推論トークン
- 61,219
- 応答時間(平均)
- 2.24s
- 応答時間(合計)
- 44.72s
- 応答時間(最大)
- 14.63s
-
反AIトリック
: 6.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)1.12s
応答時間(最大)2.46s
応答時間(合計)4.49s
-
コーディング
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.04s
応答時間(最大)3.06s
応答時間(合計)6.11s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.28s
応答時間(最大)3.28s
応答時間(合計)3.28s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.11s
応答時間(最大)1.47s
応答時間(合計)2.21s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)6.48s
応答時間(最大)14.63s
応答時間(合計)19.43s
-
汎用知能
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)821ms
応答時間(最大)821ms
応答時間(合計)821ms
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.07s
応答時間(最大)1.07s
応答時間(合計)1.07s
-
パズル解決
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)949ms
応答時間(最大)1.18s
応答時間(合計)2.85s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.89s
応答時間(最大)1.89s
応答時間(合計)1.89s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.58s
応答時間(最大)2.58s
応答時間(合計)2.58s
|
| #45#45 |
Kimi K2.5medium
|
7.5… |
Moonshot AI |
$0.348
↓
…
|
98.43s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 2 回答なし: 2 タイムアウト: 2
応答時間(平均)98.43s
応答時間(最大)281.00s
応答時間(合計)1378.03s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 11
- 試行ごとの合格率
- 68.3%
- 入力トークン
- 34,312
- 出力トークン
- 48,379
- 推論トークン
- 157,747
- 応答時間(平均)
- 98.43s
- 応答時間(合計)
- 1378.03s
- 応答時間(最大)
- 281.00s
-
反AIトリック
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1 不正解: 1
応答時間(平均)51.38s
応答時間(最大)85.28s
応答時間(合計)102.75s
-
コーディング
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1 タイムアウト: 1
応答時間(平均)217.49s
応答時間(最大)281.00s
応答時間(合計)652.48s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)71.37s
応答時間(最大)71.37s
応答時間(合計)71.37s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)49.78s
応答時間(最大)49.78s
応答時間(合計)49.78s
-
ドメイン特化
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)137.29s
応答時間(最大)137.29s
応答時間(合計)137.29s
-
汎用知能
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)69.73s
応答時間(最大)69.73s
応答時間(合計)69.73s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)92.47s
応答時間(最大)92.47s
応答時間(合計)92.47s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)43.23s
応答時間(最大)82.75s
応答時間(合計)86.47s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)31.74s
応答時間(最大)31.74s
応答時間(合計)31.74s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)83.95s
応答時間(最大)83.95s
応答時間(合計)83.95s
|
| #44#44 |
Grok Build 0.1medium
|
7.6… |
X AI |
$0.927
…
|
49.90s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 余分な書式: 3
応答時間(平均)49.90s
応答時間(最大)252.69s
応答時間(合計)1047.92s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 61.9%
- 入力トークン
- 44,418
- 出力トークン
- 2,782
- 推論トークン
- 438,018
- 応答時間(平均)
- 49.90s
- 応答時間(合計)
- 1047.92s
- 応答時間(最大)
- 252.69s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)7.43s
応答時間(最大)10.89s
応答時間(合計)29.72s
-
コーディング
: 5.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)108.46s
応答時間(最大)200.16s
応答時間(合計)325.39s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)32.81s
応答時間(最大)32.81s
応答時間(合計)32.81s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)10.72s
応答時間(最大)12.13s
応答時間(合計)21.44s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)158.00s
応答時間(最大)252.69s
応答時間(合計)474.01s
-
汎用知能
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)18.41s
応答時間(最大)18.41s
応答時間(合計)18.41s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.36s
応答時間(最大)20.80s
応答時間(合計)24.73s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)18.26s
応答時間(最大)44.40s
応答時間(合計)54.79s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.12s
応答時間(最大)13.12s
応答時間(合計)13.12s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)53.51s
応答時間(最大)53.51s
応答時間(合計)53.51s
|
| #43#43 |
DeepSeek V4 Prohigh
|
7.6… |
DeepSeek |
$0.157
…
|
77.20s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 指示に従っていない: 2 API エラー: 1 余分な書式: 1 回答なし: 1 タイムアウト: 1
応答時間(平均)77.20s
応答時間(最大)416.76s
応答時間(合計)1621.17s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 12
- 試行ごとの合格率
- 66.7%
- 入力トークン
- 38,726
- 出力トークン
- 6,334
- 推論トークン
- 159,151
- 応答時間(平均)
- 77.20s
- 応答時間(合計)
- 1621.17s
- 応答時間(最大)
- 416.76s
-
反AIトリック
: 5.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 回答なし: 1
応答時間(平均)25.70s
応答時間(最大)48.19s
応答時間(合計)102.80s
-
コーディング
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 タイムアウト: 1
応答時間(平均)243.00s
応答時間(最大)416.76s
応答時間(合計)729.00s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)38.17s
応答時間(最大)38.17s
応答時間(合計)38.17s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)25.03s
応答時間(最大)27.49s
応答時間(合計)50.06s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 余分な書式: 1
応答時間(平均)151.46s
応答時間(最大)387.23s
応答時間(合計)454.38s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.83s
応答時間(最大)8.83s
応答時間(合計)8.83s
-
指示追従
: 7.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)8.73s
応答時間(最大)9.53s
応答時間(合計)17.45s
-
パズル解決
: 6.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)56.85s
応答時間(最大)146.68s
応答時間(合計)170.55s
-
ツール呼び出し
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.92s
応答時間(最大)15.92s
応答時間(合計)15.92s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)34.01s
応答時間(最大)34.01s
応答時間(合計)34.01s
|
| #42#42 |
MiniMax M3medium
|
7.6… |
Minimax |
$0.131
…
|
68.17s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 3 不正解: 3 指示に従っていない: 2 余分な書式: 1 回答なし: 1
応答時間(平均)68.17s
応答時間(最大)431.03s
応答時間(合計)1363.38s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 10
- 試行ごとの合格率
- 65.1%
- 入力トークン
- 46,546
- 出力トークン
- 49,036
- 推論トークン
- 92,543
- 応答時間(平均)
- 68.17s
- 応答時間(合計)
- 1363.38s
- 応答時間(最大)
- 431.03s
-
反AIトリック
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)14.95s
応答時間(最大)44.99s
応答時間(合計)59.78s
-
コーディング
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 タイムアウト: 1
応答時間(平均)144.74s
応答時間(最大)218.40s
応答時間(合計)434.22s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)65.30s
応答時間(最大)65.30s
応答時間(合計)65.30s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.92s
応答時間(最大)16.89s
応答時間(合計)29.85s
-
ドメイン特化
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2
応答時間(平均)233.13s
応答時間(最大)431.03s
応答時間(合計)466.26s
-
汎用知能
: 5.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)33.25s
応答時間(最大)33.25s
応答時間(合計)33.25s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.14s
応答時間(最大)6.80s
応答時間(合計)12.27s
-
パズル解決
: 7.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)49.91s
応答時間(最大)128.09s
応答時間(合計)149.74s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.91s
応答時間(最大)11.91s
応答時間(合計)11.91s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)100.80s
応答時間(最大)100.80s
応答時間(合計)100.80s
|
| #41#41 |
Step 3.7 Flashlow
|
7.7… |
Stepfun |
$0.341
…
|
15.74s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 8 回答なし: 1
応答時間(平均)15.74s
応答時間(最大)124.75s
応答時間(合計)330.63s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 68.3%
- 入力トークン
- 40,101
- 出力トークン
- 289,325
- 推論トークン
- 0
- 応答時間(平均)
- 15.74s
- 応答時間(合計)
- 330.63s
- 応答時間(最大)
- 124.75s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.02s
応答時間(最大)12.52s
応答時間(合計)16.10s
-
コーディング
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)9.46s
応答時間(最大)12.69s
応答時間(合計)28.38s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.98s
応答時間(最大)7.98s
応答時間(合計)7.98s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.29s
応答時間(最大)3.15s
応答時間(合計)4.58s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)43.31s
応答時間(最大)72.27s
応答時間(合計)129.92s
-
汎用知能
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)7.00s
応答時間(最大)7.00s
応答時間(合計)7.00s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.58s
応答時間(最大)1.80s
応答時間(合計)3.16s
-
パズル解決
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.84s
応答時間(最大)3.42s
応答時間(合計)5.52s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.25s
応答時間(最大)3.25s
応答時間(合計)3.25s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)124.75s
応答時間(最大)124.75s
応答時間(合計)124.75s
|
| #40#40 |
Claude Opus 4.6medium
|
7.7… |
Anthropic |
$2.053
…
|
25.89s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 5 不正解: 3 指示に従っていない: 1
応答時間(平均)25.89s
応答時間(最大)83.40s
応答時間(合計)362.49s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 61.9%
- 入力トークン
- 53,227
- 出力トークン
- 47,446
- 推論トークン
- 24,000
- 応答時間(平均)
- 25.89s
- 応答時間(合計)
- 362.49s
- 応答時間(最大)
- 83.40s
-
反AIトリック
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 2
応答時間(平均)7.45s
応答時間(最大)11.88s
応答時間(合計)14.90s
-
コーディング
: 5.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 指示に従っていない: 1
応答時間(平均)30.10s
応答時間(最大)35.63s
応答時間(合計)90.31s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)76.66s
応答時間(最大)76.66s
応答時間(合計)76.66s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.37s
応答時間(最大)7.37s
応答時間(合計)7.37s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 2 不正解: 1
応答時間(平均)83.40s
応答時間(最大)83.40s
応答時間(合計)83.40s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.04s
応答時間(最大)5.04s
応答時間(合計)5.04s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.43s
応答時間(最大)2.43s
応答時間(合計)2.43s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.71s
応答時間(最大)4.75s
応答時間(合計)9.41s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.73s
応答時間(最大)9.73s
応答時間(合計)9.73s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)63.24s
応答時間(最大)63.24s
応答時間(合計)63.24s
|
| #39#39 |
Grok 4.3medium
|
7.7… |
X AI |
$0.614
…
|
47.51s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 2 余分な書式: 1
応答時間(平均)47.51s
応答時間(最大)216.69s
応答時間(合計)997.68s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 71.4%
- 入力トークン
- 44,472
- 出力トークン
- 1,981
- 推論トークン
- 221,382
- 応答時間(平均)
- 47.51s
- 応答時間(合計)
- 997.68s
- 応答時間(最大)
- 216.69s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.83s
応答時間(最大)11.20s
応答時間(合計)35.31s
-
コーディング
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)41.23s
応答時間(最大)64.81s
応答時間(合計)123.69s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)63.99s
応答時間(最大)63.99s
応答時間(合計)63.99s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)18.97s
応答時間(最大)26.99s
応答時間(合計)37.93s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)181.74s
応答時間(最大)216.69s
応答時間(合計)545.21s
-
汎用知能
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)24.70s
応答時間(最大)24.70s
応答時間(合計)24.70s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)18.58s
応答時間(最大)31.48s
応答時間(合計)37.15s
-
パズル解決
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)22.52s
応答時間(最大)51.75s
応答時間(合計)67.57s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.66s
応答時間(最大)17.66s
応答時間(合計)17.66s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)44.47s
応答時間(最大)44.47s
応答時間(合計)44.47s
|
| #38#38 |
Claude Opus 4.8low
|
7.7… |
Anthropic |
$1.270
…
|
10.83s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 余分な書式: 1 回答なし: 1
応答時間(平均)10.83s
応答時間(最大)127.97s
応答時間(合計)227.39s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 6
- 試行ごとの合格率
- 79.4%
- 入力トークン
- 60,946
- 出力トークン
- 31,771
- 推論トークン
- 6,831
- 応答時間(平均)
- 10.83s
- 応答時間(合計)
- 227.39s
- 応答時間(最大)
- 127.97s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.30s
応答時間(最大)4.34s
応答時間(合計)13.18s
-
コーディング
: 6.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)7.58s
応答時間(最大)12.19s
応答時間(合計)22.74s
-
複合
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)20.84s
応答時間(最大)20.84s
応答時間(合計)20.84s
-
データ解析と抽出
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.27s
応答時間(最大)2.50s
応答時間(合計)4.54s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)45.53s
応答時間(最大)127.97s
応答時間(合計)136.60s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.55s
応答時間(最大)2.55s
応答時間(合計)2.55s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.78s
応答時間(最大)3.78s
応答時間(合計)5.56s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.01s
応答時間(最大)3.31s
応答時間(合計)9.04s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.85s
応答時間(最大)6.85s
応答時間(合計)6.85s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)5.48s
応答時間(最大)5.48s
応答時間(合計)5.48s
|
| #37#37 |
Qwen3.5-122B-A10Bmedium
|
7.7… |
Qwen |
$0.588
↓
…
|
42.49s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 タイムアウト: 2
応答時間(平均)42.49s
応答時間(最大)168.16s
応答時間(合計)892.30s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 73.0%
- 入力トークン
- 41,832
- 出力トークン
- 26,187
- 推論トークン
- 251,028
- 応答時間(平均)
- 42.49s
- 応答時間(合計)
- 892.30s
- 応答時間(最大)
- 168.16s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.75s
応答時間(最大)18.03s
応答時間(合計)39.01s
-
コーディング
: 6.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)114.48s
応答時間(最大)168.16s
応答時間(合計)343.44s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)107.79s
応答時間(最大)107.79s
応答時間(合計)107.79s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.41s
応答時間(最大)29.79s
応答時間(合計)46.83s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)63.40s
応答時間(最大)119.29s
応答時間(合計)190.20s
-
汎用知能
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)34.11s
応答時間(最大)34.11s
応答時間(合計)34.11s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.88s
応答時間(最大)15.44s
応答時間(合計)19.76s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.89s
応答時間(最大)31.99s
応答時間(合計)53.68s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.60s
応答時間(最大)4.60s
応答時間(合計)4.60s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)52.87s
応答時間(最大)52.87s
応答時間(合計)52.87s
|
| #36#36 |
Kimi K2.6medium
|
7.8… |
Moonshot AI |
$0.888
↓
…
|
71.67s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 3 不正解: 3 指示に従っていない: 2 回答なし: 1
応答時間(平均)71.67s
応答時間(最大)406.78s
応答時間(合計)1433.36s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 65.1%
- 入力トークン
- 29,450
- 出力トークン
- 102,923
- 推論トークン
- 254,094
- 応答時間(平均)
- 71.67s
- 応答時間(合計)
- 1433.36s
- 応答時間(最大)
- 406.78s
-
反AIトリック
: 7.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)11.59s
応答時間(最大)23.94s
応答時間(合計)46.37s
-
コーディング
: 5.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1 タイムアウト: 1
応答時間(平均)214.42s
応答時間(最大)406.78s
応答時間(合計)643.25s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)40.96s
応答時間(最大)40.96s
応答時間(合計)40.96s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)20.38s
応答時間(最大)22.88s
応答時間(合計)40.76s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2
応答時間(平均)202.38s
応答時間(最大)215.85s
応答時間(合計)404.76s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.83s
応答時間(最大)17.83s
応答時間(合計)17.83s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.53s
応答時間(最大)19.15s
応答時間(合計)25.06s
-
パズル解決
: 6.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)25.06s
応答時間(最大)56.89s
応答時間(合計)75.19s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.92s
応答時間(最大)8.92s
応答時間(合計)8.92s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)130.27s
応答時間(最大)130.27s
応答時間(合計)130.27s
|
| #35#35 |
Gemini 3.1 Flash Litemedium
|
7.8… |
Google |
$0.071
…
|
3.23s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 7 指示に従っていない: 1
応答時間(平均)3.23s
応答時間(最大)10.87s
応答時間(合計)67.80s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 65.1%
- 入力トークン
- 36,808
- 出力トークン
- 2,254
- 推論トークン
- 38,300
- 応答時間(平均)
- 3.23s
- 応答時間(合計)
- 67.80s
- 応答時間(最大)
- 10.87s
-
反AIトリック
: 9.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.39s
応答時間(最大)3.58s
応答時間(合計)9.57s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)3.81s
応答時間(最大)4.25s
応答時間(合計)11.44s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)10.87s
応答時間(最大)10.87s
応答時間(合計)10.87s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.60s
応答時間(最大)2.69s
応答時間(合計)5.19s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)3.16s
応答時間(最大)3.89s
応答時間(合計)9.49s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.60s
応答時間(最大)2.60s
応答時間(合計)2.60s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.59s
応答時間(最大)3.04s
応答時間(合計)5.17s
-
パズル解決
: 7.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.95s
応答時間(最大)2.48s
応答時間(合計)5.84s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.55s
応答時間(最大)4.55s
応答時間(合計)4.55s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.08s
応答時間(最大)3.08s
応答時間(合計)3.08s
|
| #34#34 |
Qwen3.5 Plus 2026-04-20medium
|
7.8… |
Qwen |
$0.317
↓
…
|
46.36s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 8
応答時間(平均)46.36s
応答時間(最大)189.38s
応答時間(合計)973.57s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 66.7%
- 入力トークン
- 42,097
- 出力トークン
- 2,280
- 推論トークン
- 166,613
- 応答時間(平均)
- 46.36s
- 応答時間(合計)
- 973.57s
- 応答時間(最大)
- 189.38s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)10.84s
応答時間(最大)15.11s
応答時間(合計)43.36s
-
コーディング
: 6.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)125.25s
応答時間(最大)189.38s
応答時間(合計)375.76s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)92.41s
応答時間(最大)92.41s
応答時間(合計)92.41s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)38.32s
応答時間(最大)41.70s
応答時間(合計)76.63s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)53.10s
応答時間(最大)90.70s
応答時間(合計)159.30s
-
汎用知能
: 4.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)25.30s
応答時間(最大)25.30s
応答時間(合計)25.30s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)20.25s
応答時間(最大)21.65s
応答時間(合計)40.50s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)17.67s
応答時間(最大)24.83s
応答時間(合計)53.02s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.72s
応答時間(最大)14.72s
応答時間(合計)14.72s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)92.57s
応答時間(最大)92.57s
応答時間(合計)92.57s
|
| #33#33 |
Gemini 3.1 Flash Lite Previewmedium
|
7.8… |
Google |
$0.068
…
|
3.96s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 7 指示に従っていない: 1
応答時間(平均)3.96s
応答時間(最大)14.93s
応答時間(合計)83.06s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 61.9%
- 入力トークン
- 37,786
- 出力トークン
- 2,210
- 推論トークン
- 36,744
- 応答時間(平均)
- 3.96s
- 応答時間(合計)
- 83.06s
- 応答時間(最大)
- 14.93s
-
反AIトリック
: 9.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.33s
応答時間(最大)3.89s
応答時間(合計)9.30s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)4.09s
応答時間(最大)4.34s
応答時間(合計)12.27s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.93s
応答時間(最大)14.93s
応答時間(合計)14.93s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.29s
応答時間(最大)2.31s
応答時間(合計)4.59s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)4.21s
応答時間(最大)5.86s
応答時間(合計)12.62s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.16s
応答時間(最大)3.16s
応答時間(合計)3.16s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.91s
応答時間(最大)1.93s
応答時間(合計)3.82s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)5.30s
応答時間(最大)9.55s
応答時間(合計)15.89s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.80s
応答時間(最大)3.80s
応答時間(合計)3.80s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.68s
応答時間(最大)2.68s
応答時間(合計)2.68s
|
| #32#32 |
Claude Sonnet 4.6medium
|
7.8… |
Anthropic |
$1.418
…
|
17.06s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 余分な書式: 3 タイムアウト: 1
応答時間(平均)17.06s
応答時間(最大)46.35s
応答時間(合計)221.83s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 65.1%
- 入力トークン
- 49,112
- 出力トークン
- 54,703
- 推論トークン
- 29,970
- 応答時間(平均)
- 17.06s
- 応答時間(合計)
- 221.83s
- 応答時間(最大)
- 46.35s
-
反AIトリック
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)2.98s
応答時間(最大)4.95s
応答時間(合計)5.97s
-
コーディング
: 5.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)33.29s
応答時間(最大)35.76s
応答時間(合計)99.86s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)46.35s
応答時間(最大)46.35s
応答時間(合計)46.35s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.90s
応答時間(最大)13.90s
応答時間(合計)13.90s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 タイムアウト: 1 不正解: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.94s
応答時間(最大)4.94s
応答時間(合計)4.94s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.61s
応答時間(最大)2.61s
応答時間(合計)2.61s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.31s
応答時間(最大)6.24s
応答時間(合計)10.62s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.48s
応答時間(最大)7.48s
応答時間(合計)7.48s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)30.09s
応答時間(最大)30.09s
応答時間(合計)30.09s
|
| #31#31 |
Qwen3.6 Plusmedium
|
7.8… |
Qwen |
$0.294
↑
…
|
30.70s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 API エラー: 1 指示に従っていない: 1
応答時間(平均)30.70s
応答時間(最大)201.68s
応答時間(合計)613.99s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 69.8%
- 入力トークン
- 41,565
- 出力トークン
- 1,853
- 推論トークン
- 141,973
- 応答時間(平均)
- 30.70s
- 応答時間(合計)
- 613.99s
- 応答時間(最大)
- 201.68s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.90s
応答時間(最大)19.37s
応答時間(合計)39.60s
-
コーディング
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)153.12s
応答時間(最大)201.68s
応答時間(合計)306.23s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)34.95s
応答時間(最大)34.95s
応答時間(合計)34.95s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.95s
応答時間(最大)15.40s
応答時間(合計)29.90s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)29.59s
応答時間(最大)43.55s
応答時間(合計)88.77s
-
汎用知能
: 5.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)27.05s
応答時間(最大)27.05s
応答時間(合計)27.05s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.54s
応答時間(最大)11.67s
応答時間(合計)15.07s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.34s
応答時間(最大)7.52s
応答時間(合計)19.03s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.87s
応答時間(最大)5.87s
応答時間(合計)5.87s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)47.51s
応答時間(最大)47.51s
応答時間(合計)47.51s
|
| #30#30 |
Claude Sonnet 5medium
|
7.9… |
Anthropic |
$0.550
…
|
9.94s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 1 無効なツール呼び出し: 1
応答時間(平均)9.94s
応答時間(最大)56.94s
応答時間(合計)208.71s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 6
- 試行ごとの合格率
- 79.4%
- 入力トークン
- 67,416
- 出力トークン
- 34,012
- 推論トークン
- 7,673
- 応答時間(平均)
- 9.94s
- 応答時間(合計)
- 208.71s
- 応答時間(最大)
- 56.94s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.80s
応答時間(最大)5.73s
応答時間(合計)15.21s
-
コーディング
: 9.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)17.28s
応答時間(最大)31.73s
応答時間(合計)51.84s
-
複合
: 4.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)37.01s
応答時間(最大)37.01s
応答時間(合計)37.01s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.16s
応答時間(最大)3.47s
応答時間(合計)6.32s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)20.38s
応答時間(最大)56.94s
応答時間(合計)61.13s
-
汎用知能
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.32s
応答時間(最大)4.32s
応答時間(合計)4.32s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.10s
応答時間(最大)3.61s
応答時間(合計)6.20s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.98s
応答時間(最大)3.20s
応答時間(合計)8.93s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)10.70s
応答時間(最大)10.70s
応答時間(合計)10.70s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)7.06s
応答時間(最大)7.06s
応答時間(合計)7.06s
|
| #29#29 |
Qwen3.5-27Bmedium
|
7.9… |
Qwen |
$0.536
↓
…
|
68.39s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 2 余分な書式: 1 タイムアウト: 1
応答時間(平均)68.39s
応答時間(最大)234.36s
応答時間(合計)1436.24s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 73.0%
- 入力トークン
- 42,164
- 出力トークン
- 8,534
- 推論トークン
- 329,289
- 応答時間(平均)
- 68.39s
- 応答時間(合計)
- 1436.24s
- 応答時間(最大)
- 234.36s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)19.75s
応答時間(最大)49.95s
応答時間(合計)79.01s
-
コーディング
: 6.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)160.69s
応答時間(最大)234.36s
応答時間(合計)482.07s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)163.96s
応答時間(最大)163.96s
応答時間(合計)163.96s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)30.26s
応答時間(最大)32.03s
応答時間(合計)60.52s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)79.53s
応答時間(最大)95.52s
応答時間(合計)238.59s
-
汎用知能
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)101.41s
応答時間(最大)101.41s
応答時間(合計)101.41s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)19.66s
応答時間(最大)32.25s
応答時間(合計)39.32s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)59.60s
応答時間(最大)123.57s
応答時間(合計)178.80s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.45s
応答時間(最大)7.45s
応答時間(合計)7.45s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)85.11s
応答時間(最大)85.11s
応答時間(合計)85.11s
|
| #28#28 |
Qwen3.5 Plus 2026-02-15medium
|
8.0… |
Qwen |
$0.310
↓
…
|
73.79s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 タイムアウト: 2 API エラー: 1
応答時間(平均)73.79s
応答時間(最大)266.69s
応答時間(合計)1033.07s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 73.0%
- 入力トークン
- 40,918
- 出力トークン
- 2,159
- 推論トークン
- 189,604
- 応答時間(平均)
- 73.79s
- 応答時間(合計)
- 1033.07s
- 応答時間(最大)
- 266.69s
-
反AIトリック
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)45.78s
応答時間(最大)81.20s
応答時間(合計)91.57s
-
コーディング
: 6.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)180.70s
応答時間(最大)266.69s
応答時間(合計)542.10s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)46.85s
応答時間(最大)46.85s
応答時間(合計)46.85s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)46.91s
応答時間(最大)46.91s
応答時間(合計)46.91s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)17.50s
応答時間(最大)17.50s
応答時間(合計)17.50s
-
汎用知能
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)79.86s
応答時間(最大)79.86s
応答時間(合計)79.86s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)31.93s
応答時間(最大)31.93s
応答時間(合計)31.93s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)32.50s
応答時間(最大)49.12s
応答時間(合計)65.01s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.54s
応答時間(最大)7.54s
応答時間(合計)7.54s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)103.81s
応答時間(最大)103.81s
応答時間(合計)103.81s
|
| #27#27 |
GPT-5.4 Minimedium
|
8.0… |
OpenAI |
$0.526
…
|
22.34s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 指示に従っていない: 3
応答時間(平均)22.34s
応答時間(最大)138.75s
応答時間(合計)469.20s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 73.0%
- 入力トークン
- 34,116
- 出力トークン
- 2,181
- 推論トークン
- 108,937
- 応答時間(平均)
- 22.34s
- 応答時間(合計)
- 469.20s
- 応答時間(最大)
- 138.75s
-
反AIトリック
: 8.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.05s
応答時間(最大)6.69s
応答時間(合計)16.20s
-
コーディング
: 8.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)57.87s
応答時間(最大)138.75s
応答時間(合計)173.61s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.81s
応答時間(最大)17.81s
応答時間(合計)17.81s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.43s
応答時間(最大)3.39s
応答時間(合計)4.87s
-
ドメイン特化
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)65.31s
応答時間(最大)102.91s
応答時間(合計)195.92s
-
汎用知能
: 4.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)3.72s
応答時間(最大)3.72s
応答時間(合計)3.72s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.13s
応答時間(最大)2.45s
応答時間(合計)4.25s
-
パズル解決
: 7.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.37s
応答時間(最大)7.27s
応答時間(合計)13.11s
-
ツール呼び出し
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)9.62s
応答時間(最大)9.62s
応答時間(合計)9.62s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)30.10s
応答時間(最大)30.10s
応答時間(合計)30.10s
|
| #26#26 |
Nemotron 3 Ultra 550b A55bmedium
|
8.1… |
NVIDIA |
$0.158
↕
…
|
15.05s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 7 API エラー: 1
応答時間(平均)15.05s
応答時間(最大)43.93s
応答時間(合計)316.09s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 69.8%
- 入力トークン
- 46,813
- 出力トークン
- 18,002
- 推論トークン
- 53,091
- 応答時間(平均)
- 15.05s
- 応答時間(合計)
- 316.09s
- 応答時間(最大)
- 43.93s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.62s
応答時間(最大)16.86s
応答時間(合計)34.49s
-
コーディング
: 8.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)26.53s
応答時間(最大)31.91s
応答時間(合計)79.58s
-
複合
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)43.93s
応答時間(最大)43.93s
応答時間(合計)43.93s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.68s
応答時間(最大)7.94s
応答時間(合計)11.36s
-
ドメイン特化
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)24.90s
応答時間(最大)34.96s
応答時間(合計)74.71s
-
汎用知能
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)2.52s
応答時間(最大)2.52s
応答時間(合計)2.52s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.35s
応答時間(最大)9.38s
応答時間(合計)12.69s
-
パズル解決
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)3.54s
応答時間(最大)6.03s
応答時間(合計)10.62s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.72s
応答時間(最大)7.72s
応答時間(合計)7.72s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)38.47s
応答時間(最大)38.47s
応答時間(合計)38.47s
|
| #25#25 |
Qwen3.7 Plusmedium
|
8.2… |
Qwen |
$0.177
↓
…
|
38.95s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 タイムアウト: 1
応答時間(平均)38.95s
応答時間(最大)178.04s
応答時間(合計)817.85s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 6
- 試行ごとの合格率
- 77.8%
- 入力トークン
- 40,939
- 出力トークン
- 2,125
- 推論トークン
- 125,754
- 応答時間(平均)
- 38.95s
- 応答時間(合計)
- 817.85s
- 応答時間(最大)
- 178.04s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.58s
応答時間(最大)12.75s
応答時間(合計)34.33s
-
コーディング
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)108.60s
応答時間(最大)178.04s
応答時間(合計)325.79s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)65.24s
応答時間(最大)65.24s
応答時間(合計)65.24s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)21.75s
応答時間(最大)23.18s
応答時間(合計)43.49s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)45.35s
応答時間(最大)88.89s
応答時間(合計)136.04s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)25.48s
応答時間(最大)25.48s
応答時間(合計)25.48s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)16.13s
応答時間(最大)17.18s
応答時間(合計)32.26s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)16.38s
応答時間(最大)19.42s
応答時間(合計)49.14s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.02s
応答時間(最大)15.02s
応答時間(合計)15.02s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)91.07s
応答時間(最大)91.07s
応答時間(合計)91.07s
|