| #24#24 |
Grok 4.3medium
|
8.0… |
X AI |
$0.550… |
48.41s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 2
応答時間(平均)48.41s
応答時間(最大)216.69s
応答時間(合計)919.73s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 6
- 試行ごとの合格率
- 77.2%
- 出力トークン
- 1,237
- 推論トークン
- 200,033
- 応答時間(平均)
- 48.41s
- 応答時間(合計)
- 919.73s
- 応答時間(最大)
- 216.69s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.83s
応答時間(最大)11.20s
応答時間(合計)35.31s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)45.72s
応答時間(最大)45.72s
応答時間(合計)45.72s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)63.99s
応答時間(最大)63.99s
応答時間(合計)63.99s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)18.97s
応答時間(最大)26.99s
応答時間(合計)37.93s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)181.74s
応答時間(最大)216.69s
応答時間(合計)545.21s
-
汎用知能
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)24.70s
応答時間(最大)24.70s
応答時間(合計)24.70s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)18.58s
応答時間(最大)31.48s
応答時間(合計)37.15s
-
パズル解決
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)22.53s
応答時間(最大)51.75s
応答時間(合計)67.59s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.66s
応答時間(最大)17.66s
応答時間(合計)17.66s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)44.47s
応答時間(最大)44.47s
応答時間(合計)44.47s
|
| #23#23 |
Gemini 3.1 Flash Lite Previewmedium
|
8.0… |
Google |
$0.058… |
3.68s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 1
応答時間(平均)3.68s
応答時間(最大)14.93s
応答時間(合計)69.99s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 6
- 試行ごとの合格率
- 68.4%
- 出力トークン
- 2,180
- 推論トークン
- 30,831
- 応答時間(平均)
- 3.68s
- 応答時間(合計)
- 69.99s
- 応答時間(最大)
- 14.93s
-
反AIトリック
: 9.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.33s
応答時間(最大)3.89s
応答時間(合計)9.30s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.34s
応答時間(最大)4.34s
応答時間(合計)4.34s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.93s
応答時間(最大)14.93s
応答時間(合計)14.93s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.29s
応答時間(最大)2.31s
応答時間(合計)4.59s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)4.21s
応答時間(最大)5.86s
応答時間(合計)12.62s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.16s
応答時間(最大)3.16s
応答時間(合計)3.16s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.91s
応答時間(最大)1.93s
応答時間(合計)3.82s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.58s
応答時間(最大)4.41s
応答時間(合計)10.75s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.80s
応答時間(最大)3.80s
応答時間(合計)3.80s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.68s
応答時間(最大)2.68s
応答時間(合計)2.68s
|
| #22#22 |
Hy3 previewhighアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
8.0… |
Tencent |
$0.000… |
56.77s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 API エラー: 1
応答時間(平均)56.77s
応答時間(最大)149.94s
応答時間(合計)851.49s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 4
- 試行ごとの合格率
- 77.1%
- 出力トークン
- 216,503
- 推論トークン
- 0
- 応答時間(平均)
- 56.77s
- 応答時間(合計)
- 851.49s
- 応答時間(最大)
- 149.94s
-
反AIトリック
: 8.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.12s
応答時間(最大)19.99s
応答時間(合計)45.37s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)99.76s
応答時間(最大)99.76s
応答時間(合計)99.76s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)113.09s
応答時間(最大)113.09s
応答時間(合計)113.09s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)12.11s
応答時間(最大)12.11s
応答時間(合計)12.11s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)109.04s
応答時間(最大)149.94s
応答時間(合計)327.11s
-
汎用知能
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)34.02s
応答時間(最大)41.83s
応答時間(合計)68.04s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)29.74s
応答時間(最大)45.06s
応答時間(合計)59.48s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)78.83s
応答時間(最大)78.83s
応答時間(合計)78.83s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)47.71s
応答時間(最大)47.71s
応答時間(合計)47.71s
|
| #21#21 |
Qwen3.6 35B A3Bmedium
|
8.0… |
Qwen |
$0.116… |
13.22s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 1
応答時間(平均)13.22s
応答時間(最大)45.02s
応答時間(合計)224.66s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 5
- 試行ごとの合格率
- 74.5%
- 出力トークン
- 15,018
- 推論トークン
- 108,331
- 応答時間(平均)
- 13.22s
- 応答時間(合計)
- 224.66s
- 応答時間(最大)
- 45.02s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.02s
応答時間(最大)8.79s
応答時間(合計)24.07s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)32.58s
応答時間(最大)32.58s
応答時間(合計)32.58s
-
複合
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.99s
応答時間(最大)13.75s
応答時間(合計)25.99s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)22.50s
応答時間(最大)45.02s
応答時間(合計)67.51s
-
汎用知能
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)8.66s
応答時間(最大)8.66s
応答時間(合計)8.66s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.50s
応答時間(最大)10.22s
応答時間(合計)15.00s
-
パズル解決
: 7.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)5.98s
応答時間(最大)8.42s
応答時間(合計)17.95s
-
ツール呼び出し
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)32.90s
応答時間(最大)32.90s
応答時間(合計)32.90s
|
| #20#20 |
GLM 5 Turbomedium
|
8.1… |
Z.ai |
$0.187… |
18.85s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 1 タイムアウト: 1
応答時間(平均)18.85s
応答時間(最大)194.23s
応答時間(合計)358.15s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 6
- 試行ごとの合格率
- 77.2%
- 出力トークン
- 12,217
- 推論トークン
- 40,252
- 応答時間(平均)
- 18.85s
- 応答時間(合計)
- 358.15s
- 応答時間(最大)
- 194.23s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.82s
応答時間(最大)7.69s
応答時間(合計)19.26s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.26s
応答時間(最大)12.26s
応答時間(合計)12.26s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.88s
応答時間(最大)13.88s
応答時間(合計)13.88s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.19s
応答時間(最大)6.42s
応答時間(合計)12.38s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)71.07s
応答時間(最大)194.23s
応答時間(合計)213.22s
-
汎用知能
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.05s
応答時間(最大)10.05s
応答時間(合計)10.05s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.38s
応答時間(最大)5.70s
応答時間(合計)10.77s
-
パズル解決
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)5.44s
応答時間(最大)7.26s
応答時間(合計)16.32s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.84s
応答時間(最大)9.84s
応答時間(合計)9.84s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)40.17s
応答時間(最大)40.17s
応答時間(合計)40.17s
|
| #19#19 |
GLM 5medium
|
8.1… |
Z.ai |
$0.180… |
27.34s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 1 回答なし: 1 タイムアウト: 1
応答時間(平均)27.34s
応答時間(最大)79.09s
応答時間(合計)300.78s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 6
- 試行ごとの合格率
- 80.7%
- 出力トークン
- 20,564
- 推論トークン
- 70,787
- 応答時間(平均)
- 27.34s
- 応答時間(合計)
- 300.78s
- 応答時間(最大)
- 79.09s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.66s
応答時間(最大)25.06s
応答時間(合計)47.32s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)79.09s
応答時間(最大)79.09s
応答時間(合計)79.09s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)28.96s
応答時間(最大)28.96s
応答時間(合計)28.96s
-
データ解析と抽出
: 7.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)8.90s
応答時間(最大)8.90s
応答時間(合計)8.90s
-
ドメイン特化
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
汎用知能
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)14.69s
応答時間(最大)14.69s
応答時間(合計)14.69s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.25s
応答時間(最大)7.25s
応答時間(合計)7.25s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.64s
応答時間(最大)16.34s
応答時間(合計)31.27s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.93s
応答時間(最大)15.93s
応答時間(合計)15.93s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)67.37s
応答時間(最大)67.37s
応答時間(合計)67.37s
|
| #18#18 |
MiMo-V2.5-Promedium
|
8.1… |
Xiaomi |
$0.200… |
16.23s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 2 指示に従っていない: 2 不正解: 2
応答時間(平均)16.23s
応答時間(最大)84.22s
応答時間(合計)292.10s
…
|
- 合計テスト数
- 18
- 誤答テスト数
- 6
- 試行ごとの合格率
- 74.1%
- 出力トークン
- 2,790
- 推論トークン
- 52,001
- 応答時間(平均)
- 16.23s
- 応答時間(合計)
- 292.10s
- 応答時間(最大)
- 84.22s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.26s
応答時間(最大)6.38s
応答時間(合計)13.06s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)32.58s
応答時間(最大)32.58s
応答時間(合計)32.58s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)53.36s
応答時間(最大)53.36s
応答時間(合計)53.36s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)18.81s
応答時間(最大)20.29s
応答時間(合計)37.61s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 2
応答時間(平均)37.87s
応答時間(最大)84.22s
応答時間(合計)113.60s
-
汎用知能
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.02s
応答時間(最大)4.02s
応答時間(合計)4.02s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.77s
応答時間(最大)3.21s
応答時間(合計)5.54s
-
パズル解決
: 6.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)5.16s
応答時間(最大)9.12s
応答時間(合計)15.47s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)16.87s
応答時間(最大)16.87s
応答時間(合計)16.87s
|
| #17#17 |
Qwen3.5-27Bmedium
|
8.1… |
Qwen |
$0.534… |
54.71s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2 不正解: 2 余分な書式: 1 タイムアウト: 1
応答時間(平均)54.71s
応答時間(最大)163.96s
応答時間(合計)1039.57s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 6
- 試行ごとの合格率
- 77.2%
- 出力トークン
- 2,531
- 推論トークン
- 266,183
- 応答時間(平均)
- 54.71s
- 応答時間(合計)
- 1039.57s
- 応答時間(最大)
- 163.96s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)19.75s
応答時間(最大)49.95s
応答時間(合計)79.01s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)70.35s
応答時間(最大)70.35s
応答時間(合計)70.35s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)163.96s
応答時間(最大)163.96s
応答時間(合計)163.96s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)30.26s
応答時間(最大)32.03s
応答時間(合計)60.52s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)79.53s
応答時間(最大)95.52s
応答時間(合計)238.59s
-
汎用知能
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)101.41s
応答時間(最大)101.41s
応答時間(合計)101.41s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)19.66s
応答時間(最大)32.25s
応答時間(合計)39.32s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)64.61s
応答時間(最大)123.57s
応答時間(合計)193.84s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.45s
応答時間(最大)7.45s
応答時間(合計)7.45s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)85.11s
応答時間(最大)85.11s
応答時間(合計)85.11s
|
| #16#16 |
Grok 4.20 Betamediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
8.2… |
X AI |
$0.633… |
9.81s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 1
応答時間(平均)9.81s
応答時間(最大)31.36s
応答時間(合計)176.62s
…
|
- 合計テスト数
- 18
- 誤答テスト数
- 5
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 79.6%
- 出力トークン
- 1,568
- 推論トークン
- 91,909
- 応答時間(平均)
- 9.81s
- 応答時間(合計)
- 176.62s
- 応答時間(最大)
- 31.36s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.16s
応答時間(最大)3.44s
応答時間(合計)12.65s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)31.36s
応答時間(最大)31.36s
応答時間(合計)31.36s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)20.93s
応答時間(最大)20.93s
応答時間(合計)20.93s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.01s
応答時間(最大)4.27s
応答時間(合計)8.02s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)21.33s
応答時間(最大)24.21s
応答時間(合計)64.00s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.78s
応答時間(最大)5.78s
応答時間(合計)5.78s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.97s
応答時間(最大)6.05s
応答時間(合計)9.94s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.85s
応答時間(最大)4.53s
応答時間(合計)11.55s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)12.39s
応答時間(最大)12.39s
応答時間(合計)12.39s
|
| #15#15 |
Qwen3.6 Plus Previewmediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
8.2… |
Qwen |
$0.000… |
15.25s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)15.25s
応答時間(最大)43.55s
応答時間(合計)182.96s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 3
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 75.0%
- 出力トークン
- 1,153
- 推論トークン
- 62,197
- 応答時間(平均)
- 15.25s
- 応答時間(合計)
- 182.96s
- 応答時間(最大)
- 43.55s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.69s
応答時間(最大)19.37s
応答時間(合計)35.08s
-
コーディング
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)34.95s
応答時間(最大)34.95s
応答時間(合計)34.95s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.95s
応答時間(最大)15.40s
応答時間(合計)29.90s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)22.08s
応答時間(最大)43.55s
応答時間(合計)66.23s
-
汎用知能
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.40s
応答時間(最大)3.40s
応答時間(合計)3.40s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.52s
応答時間(最大)7.52s
応答時間(合計)7.52s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.87s
応答時間(最大)5.87s
応答時間(合計)5.87s
-
雑学
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #14#14 |
Gemma 4 31Bmedium
|
8.2… |
Google |
$0.023… |
28.72s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 2 不正解: 2 タイムアウト: 1
応答時間(平均)28.72s
応答時間(最大)90.14s
応答時間(合計)488.27s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 5
- 試行ごとの合格率
- 77.2%
- 出力トークン
- 14,426
- 推論トークン
- 37,964
- 応答時間(平均)
- 28.72s
- 応答時間(合計)
- 488.27s
- 応答時間(最大)
- 90.14s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.89s
応答時間(最大)26.66s
応答時間(合計)51.55s
-
コーディング
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)70.97s
応答時間(最大)70.97s
応答時間(合計)70.97s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)21.11s
応答時間(最大)21.94s
応答時間(合計)42.21s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)38.48s
応答時間(最大)68.92s
応答時間(合計)115.43s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.57s
応答時間(最大)9.57s
応答時間(合計)9.57s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.76s
応答時間(最大)17.53s
応答時間(合計)25.52s
-
パズル解決
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)27.63s
応答時間(最大)61.08s
応答時間(合計)82.89s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)90.14s
応答時間(最大)90.14s
応答時間(合計)90.14s
|
| #13#13 |
GPT-5.3-Codexmedium
|
8.2… |
OpenAI |
$0.598… |
15.33s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 2
応答時間(平均)15.33s
応答時間(最大)100.93s
応答時間(合計)291.34s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 6
- 試行ごとの合格率
- 80.7%
- 出力トークン
- 2,309
- 推論トークン
- 36,880
- 応答時間(平均)
- 15.33s
- 応答時間(合計)
- 291.34s
- 応答時間(最大)
- 100.93s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.16s
応答時間(最大)6.68s
応答時間(合計)16.63s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.95s
応答時間(最大)8.95s
応答時間(合計)8.95s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)19.56s
応答時間(最大)19.56s
応答時間(合計)19.56s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.07s
応答時間(最大)3.59s
応答時間(合計)6.15s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)64.31s
応答時間(最大)100.93s
応答時間(合計)192.94s
-
汎用知能
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.87s
応答時間(最大)4.87s
応答時間(合計)4.87s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.04s
応答時間(最大)3.44s
応答時間(合計)6.07s
-
パズル解決
: 9.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)5.12s
応答時間(最大)8.73s
応答時間(合計)15.37s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.37s
応答時間(最大)6.37s
応答時間(合計)6.37s
-
雑学
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)14.43s
応答時間(最大)14.43s
応答時間(合計)14.43s
|
| #12#12 |
Qwen3.5 Plus 2026-02-15medium
|
8.2… |
Qwen |
$0.247… |
51.33s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 タイムアウト: 2
応答時間(平均)51.33s
応答時間(最大)120.91s
応答時間(合計)616.01s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 5
- 試行ごとの合格率
- 79.0%
- 出力トークン
- 2,145
- 推論トークン
- 129,019
- 応答時間(平均)
- 51.33s
- 応答時間(合計)
- 616.01s
- 応答時間(最大)
- 120.91s
-
反AIトリック
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)45.78s
応答時間(最大)81.20s
応答時間(合計)91.57s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)120.91s
応答時間(最大)120.91s
応答時間(合計)120.91s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)46.85s
応答時間(最大)46.85s
応答時間(合計)46.85s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)46.91s
応答時間(最大)46.91s
応答時間(合計)46.91s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)17.50s
応答時間(最大)17.50s
応答時間(合計)17.50s
-
汎用知能
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)79.86s
応答時間(最大)79.86s
応答時間(合計)79.86s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)31.93s
応答時間(最大)31.93s
応答時間(合計)31.93s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)34.57s
応答時間(最大)49.12s
応答時間(合計)69.13s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.54s
応答時間(最大)7.54s
応答時間(合計)7.54s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)103.81s
応答時間(最大)103.81s
応答時間(合計)103.81s
|
| #11#11 |
Seed-2.0-Litemedium
|
8.3… |
Bytedance Seed |
$0.125… |
31.32s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 2
応答時間(平均)31.32s
応答時間(最大)168.71s
応答時間(合計)595.04s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 6
- 試行ごとの合格率
- 79.0%
- 出力トークン
- 3,266
- 推論トークン
- 54,082
- 応答時間(平均)
- 31.32s
- 応答時間(合計)
- 595.04s
- 応答時間(最大)
- 168.71s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)17.99s
応答時間(最大)48.33s
応答時間(合計)71.98s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)74.49s
応答時間(最大)74.49s
応答時間(合計)74.49s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)37.67s
応答時間(最大)37.67s
応答時間(合計)37.67s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.07s
応答時間(最大)12.19s
応答時間(合計)18.14s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)88.74s
応答時間(最大)168.71s
応答時間(合計)266.21s
-
汎用知能
: 6.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)18.25s
応答時間(最大)18.25s
応答時間(合計)18.25s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.26s
応答時間(最大)9.02s
応答時間(合計)14.52s
-
パズル解決
: 9.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)11.03s
応答時間(最大)13.85s
応答時間(合計)33.09s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.38s
応答時間(最大)12.38s
応答時間(合計)12.38s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)48.32s
応答時間(最大)48.32s
応答時間(合計)48.32s
|
| #10#10 |
Gemini 3 PRO Previewmedium
|
8.4… |
Google |
$0.197… |
9.06s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 API エラー: 1
応答時間(平均)9.06s
応答時間(最大)26.24s
応答時間(合計)90.58s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 4
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 77.8%
- 出力トークン
- 1,508
- 推論トークン
- 10,084
- 応答時間(平均)
- 9.06s
- 応答時間(合計)
- 90.58s
- 応答時間(最大)
- 26.24s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.99s
応答時間(最大)26.24s
応答時間(合計)29.99s
-
コーディング
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.37s
応答時間(最大)10.37s
応答時間(合計)10.37s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)10.84s
応答時間(最大)10.84s
応答時間(合計)10.84s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)7.01s
応答時間(最大)7.01s
応答時間(合計)7.01s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.34s
応答時間(最大)9.34s
応答時間(合計)9.34s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.26s
応答時間(最大)3.26s
応答時間(合計)3.26s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.91s
応答時間(最大)4.23s
応答時間(合計)7.81s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.96s
応答時間(最大)11.96s
応答時間(合計)11.96s
-
雑学
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #9#9 |
Qwen3.6 Max Previewmedium
|
8.5… |
Qwen |
$0.872… |
48.96s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)48.96s
応答時間(最大)186.74s
応答時間(合計)930.20s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 4
- 試行ごとの合格率
- 80.7%
- 出力トークン
- 2,186
- 推論トークン
- 105,156
- 応答時間(平均)
- 48.96s
- 応答時間(合計)
- 930.20s
- 応答時間(最大)
- 186.74s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)22.13s
応答時間(最大)28.70s
応答時間(合計)88.50s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)117.87s
応答時間(最大)117.87s
応答時間(合計)117.87s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)121.49s
応答時間(最大)121.49s
応答時間(合計)121.49s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)41.15s
応答時間(最大)48.02s
応答時間(合計)82.30s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)95.91s
応答時間(最大)186.74s
応答時間(合計)287.73s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)32.24s
応答時間(最大)32.24s
応答時間(合計)32.24s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)24.31s
応答時間(最大)27.94s
応答時間(合計)48.63s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)24.19s
応答時間(最大)37.68s
応答時間(合計)72.57s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)18.32s
応答時間(最大)18.32s
応答時間(合計)18.32s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)60.56s
応答時間(最大)60.56s
応答時間(合計)60.56s
|
| #8#8 |
Gemini 3.1 Flash Lite Previewhighアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
8.6… |
Google |
$2.310… |
68.83s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)68.83s
応答時間(最大)280.52s
応答時間(合計)1101.32s
…
|
- 合計テスト数
- 16
- 誤答テスト数
- 3
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 81.3%
- 出力トークン
- 1,283
- 推論トークン
- 1,533,310
- 応答時間(平均)
- 68.83s
- 応答時間(合計)
- 1101.32s
- 応答時間(最大)
- 280.52s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)43.87s
応答時間(最大)121.88s
応答時間(合計)131.62s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)280.52s
応答時間(最大)280.52s
応答時間(合計)280.52s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.16s
応答時間(最大)8.54s
応答時間(合計)14.31s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)127.58s
応答時間(最大)133.93s
応答時間(合計)382.74s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.25s
応答時間(最大)5.25s
応答時間(合計)5.25s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)70.07s
応答時間(最大)136.53s
応答時間(合計)140.14s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)46.33s
応答時間(最大)134.22s
応答時間(合計)139.00s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.73s
応答時間(最大)7.73s
応答時間(合計)7.73s
|
| #7#7 |
Gemini 3 Flash Previewlow
|
8.8… |
Google |
$0.093… |
5.84s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)5.84s
応答時間(最大)14.72s
応答時間(合計)110.87s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 3
- 試行ごとの合格率
- 86.0%
- 出力トークン
- 2,027
- 推論トークン
- 23,906
- 応答時間(平均)
- 5.84s
- 応答時間(合計)
- 110.87s
- 応答時間(最大)
- 14.72s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.48s
応答時間(最大)4.31s
応答時間(合計)13.94s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.94s
応答時間(最大)6.94s
応答時間(合計)6.94s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.27s
応答時間(最大)3.27s
応答時間(合計)3.27s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.40s
応答時間(最大)14.72s
応答時間(合計)18.80s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)8.05s
応答時間(最大)14.40s
応答時間(合計)24.15s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.68s
応答時間(最大)3.68s
応答時間(合計)3.68s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.02s
応答時間(最大)7.35s
応答時間(合計)14.03s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.11s
応答時間(最大)10.27s
応答時間(合計)18.32s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.99s
応答時間(最大)4.99s
応答時間(合計)4.99s
-
雑学
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.75s
応答時間(最大)2.75s
応答時間(合計)2.75s
|
| #5#5 |
Claude Opus 4.7noneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
8.9… |
Anthropic |
$0.507… |
3.04s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)3.04s
応答時間(最大)18.27s
応答時間(合計)57.79s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 3
- 試行ごとの合格率
- 84.2%
- 出力トークン
- 6,329
- 推論トークン
- 0
- 応答時間(平均)
- 3.04s
- 応答時間(合計)
- 57.79s
- 応答時間(最大)
- 18.27s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.12s
応答時間(最大)3.75s
応答時間(合計)8.50s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.84s
応答時間(最大)2.84s
応答時間(合計)2.84s
-
複合
: 9.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)18.27s
応答時間(最大)18.27s
応答時間(合計)18.27s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.15s
応答時間(最大)2.33s
応答時間(合計)4.29s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.19s
応答時間(最大)1.40s
応答時間(合計)3.58s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.47s
応答時間(最大)3.47s
応答時間(合計)3.47s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.46s
応答時間(最大)1.68s
応答時間(合計)2.91s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.58s
応答時間(最大)4.07s
応答時間(合計)7.73s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.74s
応答時間(最大)4.74s
応答時間(合計)4.74s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.46s
応答時間(最大)1.46s
応答時間(合計)1.46s
|
| #6#6 |
GPT-5.5low
|
8.9… |
OpenAI |
$0.706… |
8.80s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)8.80s
応答時間(最大)56.19s
応答時間(合計)167.26s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 3
- 試行ごとの合格率
- 84.2%
- 出力トークン
- 2,008
- 推論トークン
- 16,914
- 応答時間(平均)
- 8.80s
- 応答時間(合計)
- 167.26s
- 応答時間(最大)
- 56.19s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.43s
応答時間(最大)6.39s
応答時間(合計)17.71s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.79s
応答時間(最大)7.79s
応答時間(合計)7.79s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.56s
応答時間(最大)9.56s
応答時間(合計)9.56s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.28s
応答時間(最大)5.13s
応答時間(合計)6.56s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)27.57s
応答時間(最大)56.19s
応答時間(合計)82.70s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.14s
応答時間(最大)7.14s
応答時間(合計)7.14s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.98s
応答時間(最大)3.49s
応答時間(合計)5.97s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.94s
応答時間(最大)5.74s
応答時間(合計)14.81s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.96s
応答時間(最大)4.96s
応答時間(合計)4.96s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.06s
応答時間(最大)10.06s
応答時間(合計)10.06s
|
| #4#4 |
GPT-5.5medium
|
8.9… |
OpenAI |
$2.939… |
33.02s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)33.02s
応答時間(最大)332.10s
応答時間(合計)627.45s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 3
- 試行ごとの合格率
- 87.7%
- 出力トークン
- 1,950
- 推論トークン
- 91,386
- 応答時間(平均)
- 33.02s
- 応答時間(合計)
- 627.45s
- 応答時間(最大)
- 332.10s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.66s
応答時間(最大)6.74s
応答時間(合計)18.65s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.09s
応答時間(最大)9.09s
応答時間(合計)9.09s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)19.29s
応答時間(最大)19.29s
応答時間(合計)19.29s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.18s
応答時間(最大)4.35s
応答時間(合計)8.36s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)164.14s
応答時間(最大)332.10s
応答時間(合計)492.41s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.16s
応答時間(最大)4.16s
応答時間(合計)4.16s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.36s
応答時間(最大)3.46s
応答時間(合計)6.73s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.78s
応答時間(最大)10.54s
応答時間(合計)20.33s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)10.57s
応答時間(最大)10.57s
応答時間(合計)10.57s
-
雑学
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)37.86s
応答時間(最大)37.86s
応答時間(合計)37.86s
|
| #3🥉 #3 |
Claude Opus 4.7medium
|
8.9… |
Anthropic |
$0.449… |
3.46s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)3.46s
応答時間(最大)21.45s
応答時間(合計)62.29s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 3
- 試行ごとの合格率
- 84.2%
- 出力トークン
- 5,399
- 推論トークン
- 1,341
- 応答時間(平均)
- 3.46s
- 応答時間(合計)
- 62.29s
- 応答時間(最大)
- 21.45s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.85s
応答時間(最大)2.71s
応答時間(合計)7.38s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.41s
応答時間(最大)6.41s
応答時間(合計)6.41s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)21.45s
応答時間(最大)21.45s
応答時間(合計)21.45s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.37s
応答時間(最大)3.30s
応答時間(合計)4.74s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)1.17s
応答時間(最大)1.40s
応答時間(合計)2.35s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.87s
応答時間(最大)2.87s
応答時間(合計)2.87s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.57s
応答時間(最大)1.66s
応答時間(合計)3.14s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.51s
応答時間(最大)2.89s
応答時間(合計)7.54s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.17s
応答時間(最大)4.17s
応答時間(合計)4.17s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.25s
応答時間(最大)2.25s
応答時間(合計)2.25s
|
| #2🥈 #2 |
Gemini 3.1 Pro Previewmedium
|
9.6… |
Google |
$0.594… |
15.15s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)15.15s
応答時間(最大)40.61s
応答時間(合計)181.78s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 1
- 試行ごとの合格率
- 94.7%
- 出力トークン
- 1,944
- 推論トークン
- 41,839
- 応答時間(平均)
- 15.15s
- 応答時間(合計)
- 181.78s
- 応答時間(最大)
- 40.61s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.90s
応答時間(最大)9.52s
応答時間(合計)15.80s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)19.88s
応答時間(最大)19.88s
応答時間(合計)19.88s
-
複合
: 9.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)40.61s
応答時間(最大)40.61s
応答時間(合計)40.61s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.72s
応答時間(最大)7.72s
応答時間(合計)7.72s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)32.73s
応答時間(最大)32.73s
応答時間(合計)32.73s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.77s
応答時間(最大)11.77s
応答時間(合計)11.77s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.56s
応答時間(最大)9.56s
応答時間(合計)9.56s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.15s
応答時間(最大)8.49s
応答時間(合計)14.30s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.15s
応答時間(最大)23.15s
応答時間(合計)23.15s
-
雑学
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.27s
応答時間(最大)6.27s
応答時間(合計)6.27s
|
| #1🥇 #1 |
Gemini 3 Flash Previewmedium
|
10.0… |
Google |
$0.328… |
11.43s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.43s
応答時間(最大)74.66s
応答時間(合計)217.10s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 0
- 試行ごとの合格率
- 100.0%
- 出力トークン
- 1,985
- 推論トークン
- 102,122
- 応答時間(平均)
- 11.43s
- 応答時間(合計)
- 217.10s
- 応答時間(最大)
- 74.66s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.88s
応答時間(最大)5.73s
応答時間(合計)15.53s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)74.66s
応答時間(最大)74.66s
応答時間(合計)74.66s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)22.42s
応答時間(最大)22.42s
応答時間(合計)22.42s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.43s
応答時間(最大)6.18s
応答時間(合計)10.86s
-
ドメイン特化
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.27s
応答時間(最大)34.09s
応答時間(合計)45.80s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.19s
応答時間(最大)5.19s
応答時間(合計)5.19s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.04s
応答時間(最大)4.70s
応答時間(合計)8.08s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.48s
応答時間(最大)7.24s
応答時間(合計)16.45s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.60s
応答時間(最大)12.60s
応答時間(合計)12.60s
-
雑学
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.50s
応答時間(最大)5.50s
応答時間(合計)5.50s
|