| #40#40 |
Gemini 3.1 Flash Lite Previewmedium
|
7.5… |
Google |
$0.068
…
|
3.96s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 7 指示に従っていない: 1
応答時間(平均)3.96s
応答時間(最大)14.93s
応答時間(合計)83.06s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 61.9%
- 入力トークン
- 37,786
- 出力トークン
- 2,210
- 推論トークン
- 36,744
- 応答時間(平均)
- 3.96s
- 応答時間(合計)
- 83.06s
- 応答時間(最大)
- 14.93s
-
反AIトリック
: 9.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.33s
応答時間(最大)3.89s
応答時間(合計)9.30s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)4.09s
応答時間(最大)4.34s
応答時間(合計)12.27s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.93s
応答時間(最大)14.93s
応答時間(合計)14.93s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.29s
応答時間(最大)2.31s
応答時間(合計)4.59s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)4.21s
応答時間(最大)5.86s
応答時間(合計)12.62s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.16s
応答時間(最大)3.16s
応答時間(合計)3.16s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.91s
応答時間(最大)1.93s
応答時間(合計)3.82s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)5.30s
応答時間(最大)9.55s
応答時間(合計)15.89s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.80s
応答時間(最大)3.80s
応答時間(合計)3.80s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.68s
応答時間(最大)2.68s
応答時間(合計)2.68s
|
| #41#41 |
Nemotron 3 Ultra 550b A55bmedium
|
7.5… |
NVIDIA |
$0.000
…
|
15.05s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 7 API エラー: 1
応答時間(平均)15.05s
応答時間(最大)43.93s
応答時間(合計)316.09s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 69.8%
- 入力トークン
- 46,813
- 出力トークン
- 18,002
- 推論トークン
- 53,091
- 応答時間(平均)
- 15.05s
- 応答時間(合計)
- 316.09s
- 応答時間(最大)
- 43.93s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.62s
応答時間(最大)16.86s
応答時間(合計)34.49s
-
コーディング
: 8.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)26.53s
応答時間(最大)31.91s
応答時間(合計)79.58s
-
複合
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)43.93s
応答時間(最大)43.93s
応答時間(合計)43.93s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.68s
応答時間(最大)7.94s
応答時間(合計)11.36s
-
ドメイン特化
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)24.90s
応答時間(最大)34.96s
応答時間(合計)74.71s
-
汎用知能
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)2.52s
応答時間(最大)2.52s
応答時間(合計)2.52s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.35s
応答時間(最大)9.38s
応答時間(合計)12.69s
-
パズル解決
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)3.54s
応答時間(最大)6.03s
応答時間(合計)10.62s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.72s
応答時間(最大)7.72s
応答時間(合計)7.72s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)38.47s
応答時間(最大)38.47s
応答時間(合計)38.47s
|
| #42#42 |
GPT-5.2medium
|
7.5… |
OpenAI |
$0.548
…
|
16.88s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 3 不正解: 3 回答なし: 1 タイムアウト: 1
応答時間(平均)16.88s
応答時間(最大)77.80s
応答時間(合計)236.34s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 71.4%
- 入力トークン
- 33,967
- 出力トークン
- 2,901
- 推論トークン
- 31,932
- 応答時間(平均)
- 16.88s
- 応答時間(合計)
- 236.34s
- 応答時間(最大)
- 77.80s
-
反AIトリック
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)7.81s
応答時間(最大)14.34s
応答時間(合計)15.62s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)22.73s
応答時間(最大)31.19s
応答時間(合計)68.20s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.06s
応答時間(最大)14.06s
応答時間(合計)14.06s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.15s
応答時間(最大)3.15s
応答時間(合計)3.15s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)77.80s
応答時間(最大)77.80s
応答時間(合計)77.80s
-
汎用知能
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.32s
応答時間(最大)4.32s
応答時間(合計)4.32s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.12s
応答時間(最大)3.12s
応答時間(合計)3.12s
-
パズル解決
: 7.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)5.80s
応答時間(最大)6.45s
応答時間(合計)11.61s
-
ツール呼び出し
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)10.30s
応答時間(最大)10.30s
応答時間(合計)10.30s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)28.18s
応答時間(最大)28.18s
応答時間(合計)28.18s
|
| #44#44 |
Gemini 3.1 Flash Litemedium
|
7.5… |
Google |
$0.071
…
|
3.23s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 7 指示に従っていない: 1
応答時間(平均)3.23s
応答時間(最大)10.87s
応答時間(合計)67.80s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 65.1%
- 入力トークン
- 36,808
- 出力トークン
- 2,254
- 推論トークン
- 38,300
- 応答時間(平均)
- 3.23s
- 応答時間(合計)
- 67.80s
- 応答時間(最大)
- 10.87s
-
反AIトリック
: 9.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.39s
応答時間(最大)3.58s
応答時間(合計)9.57s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)3.81s
応答時間(最大)4.25s
応答時間(合計)11.44s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)10.87s
応答時間(最大)10.87s
応答時間(合計)10.87s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.60s
応答時間(最大)2.69s
応答時間(合計)5.19s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)3.16s
応答時間(最大)3.89s
応答時間(合計)9.49s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.60s
応答時間(最大)2.60s
応答時間(合計)2.60s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.59s
応答時間(最大)3.04s
応答時間(合計)5.17s
-
パズル解決
: 7.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.95s
応答時間(最大)2.48s
応答時間(合計)5.84s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.55s
応答時間(最大)4.55s
応答時間(合計)4.55s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.08s
応答時間(最大)3.08s
応答時間(合計)3.08s
|
| #46#46 |
Qwen3.6 35B A3Bmedium
|
7.4… |
Qwen |
$0.146
↑
…
|
18.08s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 API エラー: 2 指示に従っていない: 1 回答なし: 1
応答時間(平均)18.08s
応答時間(最大)86.11s
応答時間(合計)343.61s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 63.5%
- 入力トークン
- 16,385
- 出力トークン
- 19,632
- 推論トークン
- 130,219
- 応答時間(平均)
- 18.08s
- 応答時間(合計)
- 343.61s
- 応答時間(最大)
- 86.11s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.02s
応答時間(最大)8.79s
応答時間(合計)24.07s
-
コーディング
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)50.55s
応答時間(最大)86.11s
応答時間(合計)151.65s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.99s
応答時間(最大)13.75s
応答時間(合計)25.99s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)22.50s
応答時間(最大)45.02s
応答時間(合計)67.51s
-
汎用知能
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)8.66s
応答時間(最大)8.66s
応答時間(合計)8.66s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.50s
応答時間(最大)10.22s
応答時間(合計)15.00s
-
パズル解決
: 8.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)5.95s
応答時間(最大)8.42s
応答時間(合計)17.84s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)32.90s
応答時間(最大)32.90s
応答時間(合計)32.90s
|
| #47#47 |
Grok Build 0.1medium
|
7.4… |
X AI |
$0.927
…
|
49.90s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 余分な書式: 3
応答時間(平均)49.90s
応答時間(最大)252.69s
応答時間(合計)1047.92s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 61.9%
- 入力トークン
- 44,418
- 出力トークン
- 2,782
- 推論トークン
- 438,018
- 応答時間(平均)
- 49.90s
- 応答時間(合計)
- 1047.92s
- 応答時間(最大)
- 252.69s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)7.43s
応答時間(最大)10.89s
応答時間(合計)29.72s
-
コーディング
: 5.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)108.46s
応答時間(最大)200.16s
応答時間(合計)325.39s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)32.81s
応答時間(最大)32.81s
応答時間(合計)32.81s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)10.72s
応答時間(最大)12.13s
応答時間(合計)21.44s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)158.00s
応答時間(最大)252.69s
応答時間(合計)474.01s
-
汎用知能
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)18.41s
応答時間(最大)18.41s
応答時間(合計)18.41s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.36s
応答時間(最大)20.80s
応答時間(合計)24.73s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)18.26s
応答時間(最大)44.40s
応答時間(合計)54.79s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.12s
応答時間(最大)13.12s
応答時間(合計)13.12s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)53.51s
応答時間(最大)53.51s
応答時間(合計)53.51s
|
| #48#48 |
Gemini 3 Flash Previewnone
|
7.4… |
Google |
$0.025
…
|
1.65s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 8
応答時間(平均)1.65s
応答時間(最大)3.56s
応答時間(合計)23.07s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 66.7%
- 入力トークン
- 37,011
- 出力トークン
- 1,885
- 推論トークン
- 0
- 応答時間(平均)
- 1.65s
- 応答時間(合計)
- 23.07s
- 応答時間(最大)
- 3.56s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.25s
応答時間(最大)1.59s
応答時間(合計)2.49s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.80s
応答時間(最大)2.79s
応答時間(合計)5.40s
-
複合
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.56s
応答時間(最大)3.56s
応答時間(合計)3.56s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.41s
応答時間(最大)1.41s
応答時間(合計)1.41s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)963ms
応答時間(最大)963ms
応答時間(合計)963ms
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.13s
応答時間(最大)1.13s
応答時間(合計)1.13s
-
指示追従
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.58s
応答時間(最大)1.58s
応答時間(合計)1.58s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.05s
応答時間(最大)1.06s
応答時間(合計)2.11s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.35s
応答時間(最大)3.35s
応答時間(合計)3.35s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.07s
応答時間(最大)1.07s
応答時間(合計)1.07s
|
| #50#50 |
Gemini 3.1 Flash Lite Previewlow
|
7.4… |
Google |
$0.026
…
|
2.77s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 7 指示に従っていない: 1
応答時間(平均)2.77s
応答時間(最大)11.91s
応答時間(合計)58.12s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 61.9%
- 入力トークン
- 32,715
- 出力トークン
- 2,286
- 推論トークン
- 9,166
- 応答時間(平均)
- 2.77s
- 応答時間(合計)
- 58.12s
- 応答時間(最大)
- 11.91s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.12s
応答時間(最大)3.18s
応答時間(合計)8.50s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.39s
応答時間(最大)2.20s
応答時間(合計)4.16s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)11.91s
応答時間(最大)11.91s
応答時間(合計)11.91s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.00s
応答時間(最大)3.74s
応答時間(合計)5.99s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)2.36s
応答時間(最大)3.51s
応答時間(合計)7.07s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.54s
応答時間(最大)1.54s
応答時間(合計)1.54s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.49s
応答時間(最大)1.66s
応答時間(合計)2.99s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.69s
応答時間(最大)1.89s
応答時間(合計)5.08s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.54s
応答時間(最大)9.54s
応答時間(合計)9.54s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.35s
応答時間(最大)1.35s
応答時間(合計)1.35s
|
| #52#52 |
Claude Sonnet 4.6medium
|
7.4… |
Anthropic |
$1.418
…
|
17.06s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 余分な書式: 3 タイムアウト: 1
応答時間(平均)17.06s
応答時間(最大)46.35s
応答時間(合計)221.83s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 65.1%
- 入力トークン
- 49,112
- 出力トークン
- 54,703
- 推論トークン
- 29,970
- 応答時間(平均)
- 17.06s
- 応答時間(合計)
- 221.83s
- 応答時間(最大)
- 46.35s
-
反AIトリック
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)2.98s
応答時間(最大)4.95s
応答時間(合計)5.97s
-
コーディング
: 5.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)33.29s
応答時間(最大)35.76s
応答時間(合計)99.86s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)46.35s
応答時間(最大)46.35s
応答時間(合計)46.35s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.90s
応答時間(最大)13.90s
応答時間(合計)13.90s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 タイムアウト: 1 不正解: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.94s
応答時間(最大)4.94s
応答時間(合計)4.94s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.61s
応答時間(最大)2.61s
応答時間(合計)2.61s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.31s
応答時間(最大)6.24s
応答時間(合計)10.62s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.48s
応答時間(最大)7.48s
応答時間(合計)7.48s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)30.09s
応答時間(最大)30.09s
応答時間(合計)30.09s
|
| #19#19 |
Seed-2.0-Litemedium
|
8.2… |
Bytedance Seed |
$0.175
…
|
47.07s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 2
応答時間(平均)47.07s
応答時間(最大)254.92s
応答時間(合計)988.37s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 76.2%
- 入力トークン
- 46,740
- 出力トークン
- 3,230
- 推論トークン
- 78,406
- 応答時間(平均)
- 47.07s
- 応答時間(合計)
- 988.37s
- 応答時間(最大)
- 254.92s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)17.99s
応答時間(最大)48.33s
応答時間(合計)71.98s
-
コーディング
: 8.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)156.74s
応答時間(最大)254.92s
応答時間(合計)470.22s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)37.67s
応答時間(最大)37.67s
応答時間(合計)37.67s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.07s
応答時間(最大)12.19s
応答時間(合計)18.14s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)88.74s
応答時間(最大)168.71s
応答時間(合計)266.21s
-
汎用知能
: 6.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)18.25s
応答時間(最大)18.25s
応答時間(合計)18.25s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.26s
応答時間(最大)9.02s
応答時間(合計)14.52s
-
パズル解決
: 9.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)10.23s
応答時間(最大)11.54s
応答時間(合計)30.68s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.38s
応答時間(最大)12.38s
応答時間(合計)12.38s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)48.32s
応答時間(最大)48.32s
応答時間(合計)48.32s
|
| #21#21 |
GPT-5.4medium
|
8.0… |
OpenAI |
$1.210
…
|
22.35s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 2
応答時間(平均)22.35s
応答時間(最大)100.41s
応答時間(合計)469.29s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 76.2%
- 入力トークン
- 34,108
- 出力トークン
- 2,242
- 推論トークン
- 72,707
- 応答時間(平均)
- 22.35s
- 応答時間(合計)
- 469.29s
- 応答時間(最大)
- 100.41s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.11s
応答時間(最大)6.42s
応答時間(合計)16.42s
-
コーディング
: 8.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)44.36s
応答時間(最大)96.94s
応答時間(合計)133.08s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)20.57s
応答時間(最大)20.57s
応答時間(合計)20.57s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.32s
応答時間(最大)5.40s
応答時間(合計)10.64s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)74.27s
応答時間(最大)100.41s
応答時間(合計)222.80s
-
汎用知能
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.92s
応答時間(最大)4.92s
応答時間(合計)4.92s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.11s
応答時間(最大)3.68s
応答時間(合計)6.22s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)9.14s
応答時間(最大)18.14s
応答時間(合計)27.41s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.28s
応答時間(最大)13.28s
応答時間(合計)13.28s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)13.95s
応答時間(最大)13.95s
応答時間(合計)13.95s
|
| #22#22 |
Step 3.7 Flashmedium
|
8.0… |
Stepfun |
$0.376
…
|
20.35s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 1 回答なし: 1
応答時間(平均)20.35s
応答時間(最大)113.98s
応答時間(合計)427.42s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 73.0%
- 入力トークン
- 39,981
- 出力トークン
- 319,958
- 推論トークン
- 0
- 応答時間(平均)
- 20.35s
- 応答時間(合計)
- 427.42s
- 応答時間(最大)
- 113.98s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)9.65s
応答時間(最大)35.08s
応答時間(合計)38.62s
-
コーディング
: 8.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)27.42s
応答時間(最大)60.98s
応答時間(合計)82.26s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.06s
応答時間(最大)9.06s
応答時間(合計)9.06s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.75s
応答時間(最大)3.35s
応答時間(合計)5.49s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)48.27s
応答時間(最大)97.10s
応答時間(合計)144.81s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.85s
応答時間(最大)6.85s
応答時間(合計)6.85s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.83s
応答時間(最大)2.21s
応答時間(合計)3.65s
-
パズル解決
: 5.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)6.19s
応答時間(最大)12.51s
応答時間(合計)18.56s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.16s
応答時間(最大)4.16s
応答時間(合計)4.16s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)113.98s
応答時間(最大)113.98s
応答時間(合計)113.98s
|
| #23#23 |
GLM 5 Turbomedium
|
8.0… |
Z.ai |
$0.323
↑
…
|
23.00s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 1 回答なし: 1 タイムアウト: 1
応答時間(平均)23.00s
応答時間(最大)194.23s
応答時間(合計)482.97s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 74.6%
- 入力トークン
- 35,593
- 出力トークン
- 12,245
- 推論トークン
- 62,277
- 応答時間(平均)
- 23.00s
- 応答時間(合計)
- 482.97s
- 応答時間(最大)
- 194.23s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.82s
応答時間(最大)7.69s
応答時間(合計)19.26s
-
コーディング
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)45.90s
応答時間(最大)95.57s
応答時間(合計)137.71s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.88s
応答時間(最大)13.88s
応答時間(合計)13.88s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.19s
応答時間(最大)6.42s
応答時間(合計)12.38s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)71.07s
応答時間(最大)194.23s
応答時間(合計)213.22s
-
汎用知能
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.05s
応答時間(最大)10.05s
応答時間(合計)10.05s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.38s
応答時間(最大)5.70s
応答時間(合計)10.77s
-
パズル解決
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)5.23s
応答時間(最大)7.26s
応答時間(合計)15.69s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.84s
応答時間(最大)9.84s
応答時間(合計)9.84s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)40.17s
応答時間(最大)40.17s
応答時間(合計)40.17s
|
| #24#24 |
GPT-5.2 Chatnone
|
7.9… |
OpenAI |
$0.393
…
|
7.13s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 指示に従っていない: 1
応答時間(平均)7.13s
応答時間(最大)38.52s
応答時間(合計)149.69s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 74.6%
- 入力トークン
- 34,212
- 出力トークン
- 23,744
- 推論トークン
- 0
- 応答時間(平均)
- 7.13s
- 応答時間(合計)
- 149.69s
- 応答時間(最大)
- 38.52s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.40s
応答時間(最大)4.78s
応答時間(合計)13.59s
-
コーディング
: 8.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)9.82s
応答時間(最大)13.35s
応答時間(合計)29.45s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.12s
応答時間(最大)9.12s
応答時間(合計)9.12s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.05s
応答時間(最大)3.33s
応答時間(合計)6.10s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)17.78s
応答時間(最大)38.52s
応答時間(合計)53.33s
-
汎用知能
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)3.20s
応答時間(最大)3.20s
応答時間(合計)3.20s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.51s
応答時間(最大)6.55s
応答時間(合計)11.02s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.10s
応答時間(最大)5.04s
応答時間(合計)12.31s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.68s
応答時間(最大)4.68s
応答時間(合計)4.68s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.89s
応答時間(最大)6.89s
応答時間(合計)6.89s
|
| #25#25 |
Qwen3.5 Plus 2026-02-15medium
|
7.9… |
Qwen |
$0.310
↓
…
|
73.79s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 タイムアウト: 2 API エラー: 1
応答時間(平均)73.79s
応答時間(最大)266.69s
応答時間(合計)1033.07s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 73.0%
- 入力トークン
- 40,918
- 出力トークン
- 2,159
- 推論トークン
- 189,604
- 応答時間(平均)
- 73.79s
- 応答時間(合計)
- 1033.07s
- 応答時間(最大)
- 266.69s
-
反AIトリック
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)45.78s
応答時間(最大)81.20s
応答時間(合計)91.57s
-
コーディング
: 6.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)180.70s
応答時間(最大)266.69s
応答時間(合計)542.10s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)46.85s
応答時間(最大)46.85s
応答時間(合計)46.85s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)46.91s
応答時間(最大)46.91s
応答時間(合計)46.91s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)17.50s
応答時間(最大)17.50s
応答時間(合計)17.50s
-
汎用知能
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)79.86s
応答時間(最大)79.86s
応答時間(合計)79.86s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)31.93s
応答時間(最大)31.93s
応答時間(合計)31.93s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)32.50s
応答時間(最大)49.12s
応答時間(合計)65.01s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.54s
応答時間(最大)7.54s
応答時間(合計)7.54s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)103.81s
応答時間(最大)103.81s
応答時間(合計)103.81s
|
| #26#26 |
Qwen3.6 Plusmedium
|
7.9… |
Qwen |
$0.294
↑
…
|
30.70s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 API エラー: 1 指示に従っていない: 1
応答時間(平均)30.70s
応答時間(最大)201.68s
応答時間(合計)613.99s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 69.8%
- 入力トークン
- 41,565
- 出力トークン
- 1,853
- 推論トークン
- 141,973
- 応答時間(平均)
- 30.70s
- 応答時間(合計)
- 613.99s
- 応答時間(最大)
- 201.68s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.90s
応答時間(最大)19.37s
応答時間(合計)39.60s
-
コーディング
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)153.12s
応答時間(最大)201.68s
応答時間(合計)306.23s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)34.95s
応答時間(最大)34.95s
応答時間(合計)34.95s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.95s
応答時間(最大)15.40s
応答時間(合計)29.90s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)29.59s
応答時間(最大)43.55s
応答時間(合計)88.77s
-
汎用知能
: 5.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)27.05s
応答時間(最大)27.05s
応答時間(合計)27.05s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.54s
応答時間(最大)11.67s
応答時間(合計)15.07s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.34s
応答時間(最大)7.52s
応答時間(合計)19.03s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.87s
応答時間(最大)5.87s
応答時間(合計)5.87s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)47.51s
応答時間(最大)47.51s
応答時間(合計)47.51s
|
| #27#27 |
Gemma 4 31Bmedium
|
7.8… |
Google |
$0.035
↓
…
|
56.55s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 2 タイムアウト: 2 不正解: 2 回答なし: 1
応答時間(平均)56.55s
応答時間(最大)437.40s
応答時間(合計)1074.41s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 69.8%
- 入力トークン
- 17,957
- 出力トークン
- 22,356
- 推論トークン
- 65,726
- 応答時間(平均)
- 56.55s
- 応答時間(合計)
- 1074.41s
- 応答時間(最大)
- 437.40s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.89s
応答時間(最大)26.66s
応答時間(合計)51.55s
-
コーディング
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2 回答なし: 1
応答時間(平均)219.76s
応答時間(最大)437.40s
応答時間(合計)659.27s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)21.11s
応答時間(最大)21.94s
応答時間(合計)42.21s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)38.48s
応答時間(最大)68.92s
応答時間(合計)115.43s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.57s
応答時間(最大)9.57s
応答時間(合計)9.57s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.76s
応答時間(最大)17.53s
応答時間(合計)25.52s
-
パズル解決
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)26.91s
応答時間(最大)61.08s
応答時間(合計)80.72s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)90.14s
応答時間(最大)90.14s
応答時間(合計)90.14s
|
| #28#28 |
Gemini 2.5 Flashmedium
|
7.8… |
Google |
$0.379
…
|
15.49s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 指示に従っていない: 1
応答時間(平均)15.49s
応答時間(最大)95.48s
応答時間(合計)325.39s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 69.8%
- 入力トークン
- 34,476
- 出力トークン
- 1,930
- 推論トークン
- 145,145
- 応答時間(平均)
- 15.49s
- 応答時間(合計)
- 325.39s
- 応答時間(最大)
- 95.48s
-
反AIトリック
: 8.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.30s
応答時間(最大)15.56s
応答時間(合計)25.21s
-
コーディング
: 7.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)41.01s
応答時間(最大)92.88s
応答時間(合計)123.04s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)28.44s
応答時間(最大)28.44s
応答時間(合計)28.44s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.06s
応答時間(最大)5.06s
応答時間(合計)8.11s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)37.34s
応答時間(最大)95.48s
応答時間(合計)112.01s
-
汎用知能
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.86s
応答時間(最大)4.86s
応答時間(合計)4.86s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.62s
応答時間(最大)2.78s
応答時間(合計)5.24s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.18s
応答時間(最大)4.05s
応答時間(合計)9.54s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.20s
応答時間(最大)6.20s
応答時間(合計)6.20s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.76s
応答時間(最大)2.76s
応答時間(合計)2.76s
|
| #29#29 |
Qwen3.5-122B-A10Bmedium
|
7.8… |
Qwen |
$0.588
↓
…
|
42.49s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 タイムアウト: 2
応答時間(平均)42.49s
応答時間(最大)168.16s
応答時間(合計)892.30s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 73.0%
- 入力トークン
- 41,832
- 出力トークン
- 26,187
- 推論トークン
- 251,028
- 応答時間(平均)
- 42.49s
- 応答時間(合計)
- 892.30s
- 応答時間(最大)
- 168.16s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.75s
応答時間(最大)18.03s
応答時間(合計)39.01s
-
コーディング
: 6.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)114.48s
応答時間(最大)168.16s
応答時間(合計)343.44s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)107.79s
応答時間(最大)107.79s
応答時間(合計)107.79s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.41s
応答時間(最大)29.79s
応答時間(合計)46.83s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)63.40s
応答時間(最大)119.29s
応答時間(合計)190.20s
-
汎用知能
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)34.11s
応答時間(最大)34.11s
応答時間(合計)34.11s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.88s
応答時間(最大)15.44s
応答時間(合計)19.76s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.89s
応答時間(最大)31.99s
応答時間(合計)53.68s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.60s
応答時間(最大)4.60s
応答時間(合計)4.60s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)52.87s
応答時間(最大)52.87s
応答時間(合計)52.87s
|
| #32#32 |
Gemini 3.5 Flashminimal
|
7.7… |
Google |
$0.108
…
|
1.57s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 1 無効なツール呼び出し: 1
応答時間(平均)1.57s
応答時間(最大)5.51s
応答時間(合計)33.02s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 68.3%
- 入力トークン
- 39,847
- 出力トークン
- 5,277
- 推論トークン
- 0
- 応答時間(平均)
- 1.57s
- 応答時間(合計)
- 33.02s
- 応答時間(最大)
- 5.51s
-
反AIトリック
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)892ms
応答時間(最大)1.38s
応答時間(合計)3.57s
-
コーディング
: 5.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)2.75s
応答時間(最大)5.51s
応答時間(合計)8.26s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)3.56s
応答時間(最大)3.56s
応答時間(合計)3.56s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.66s
応答時間(最大)2.11s
応答時間(合計)3.32s
-
ドメイン特化
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)899ms
応答時間(最大)1.04s
応答時間(合計)2.70s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)922ms
応答時間(最大)922ms
応答時間(合計)922ms
-
指示追従
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)893ms
応答時間(最大)964ms
応答時間(合計)1.79s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.45s
応答時間(最大)2.30s
応答時間(合計)4.36s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.79s
応答時間(最大)2.79s
応答時間(合計)2.79s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.76s
応答時間(最大)1.76s
応答時間(合計)1.76s
|
| #33#33 |
Hy3 previewmediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
7.7… |
Tencent |
$0.018
…
|
16.28s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 3 不正解: 3 指示に従っていない: 1
応答時間(平均)16.28s
応答時間(最大)46.04s
応答時間(合計)293.12s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 66.7%
- 入力トークン
- 27,030
- 出力トークン
- 73,544
- 推論トークン
- 0
- 応答時間(平均)
- 16.28s
- 応答時間(合計)
- 293.12s
- 応答時間(最大)
- 46.04s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.59s
応答時間(最大)10.20s
応答時間(合計)26.37s
-
コーディング
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 2
応答時間(平均)31.37s
応答時間(最大)31.37s
応答時間(合計)31.37s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)46.04s
応答時間(最大)46.04s
応答時間(合計)46.04s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)5.25s
応答時間(最大)5.25s
応答時間(合計)5.25s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)22.30s
応答時間(最大)30.51s
応答時間(合計)66.90s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)16.84s
応答時間(最大)16.84s
応答時間(合計)16.84s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.16s
応答時間(最大)7.72s
応答時間(合計)12.31s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)11.06s
応答時間(最大)14.35s
応答時間(合計)33.17s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.02s
応答時間(最大)15.02s
応答時間(合計)15.02s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)39.86s
応答時間(最大)39.86s
応答時間(合計)39.86s
|
| #34#34 |
Qwen3.7 Maxnone
|
7.7… |
Qwen |
$0.054
↓
…
|
1.30s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 7
応答時間(平均)1.30s
応答時間(最大)3.92s
応答時間(合計)27.21s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 66.7%
- 入力トークン
- 37,107
- 出力トークン
- 1,994
- 推論トークン
- 0
- 応答時間(平均)
- 1.30s
- 応答時間(合計)
- 27.21s
- 応答時間(最大)
- 3.92s
-
反AIトリック
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.08s
応答時間(最大)1.39s
応答時間(合計)4.30s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.35s
応答時間(最大)1.63s
応答時間(合計)4.04s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.17s
応答時間(最大)2.17s
応答時間(合計)2.17s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.35s
応答時間(最大)1.43s
応答時間(合計)2.69s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)975ms
応答時間(最大)1.08s
応答時間(合計)2.92s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.04s
応答時間(最大)1.04s
応答時間(合計)1.04s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)943ms
応答時間(最大)974ms
応答時間(合計)1.89s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.13s
応答時間(最大)1.29s
応答時間(合計)3.40s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.92s
応答時間(最大)3.92s
応答時間(合計)3.92s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)856ms
応答時間(最大)856ms
応答時間(合計)856ms
|
| #35#35 |
Gemini 3 PRO Previewmedium
|
7.6… |
Google |
$0.385
↑
…
|
9.05s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 4 不正解: 3
応答時間(平均)9.05s
応答時間(最大)26.24s
応答時間(合計)90.53s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 66.7%
- 入力トークン
- 28,848
- 出力トークン
- 1,490
- 推論トークン
- 10,102
- 応答時間(平均)
- 9.05s
- 応答時間(合計)
- 90.53s
- 応答時間(最大)
- 26.24s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.99s
応答時間(最大)26.24s
応答時間(合計)29.99s
-
コーディング
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 3
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.37s
応答時間(最大)10.37s
応答時間(合計)10.37s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)10.84s
応答時間(最大)10.84s
応答時間(合計)10.84s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)7.01s
応答時間(最大)7.01s
応答時間(合計)7.01s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.34s
応答時間(最大)9.34s
応答時間(合計)9.34s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.26s
応答時間(最大)3.26s
応答時間(合計)3.26s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.88s
応答時間(最大)4.23s
応答時間(合計)7.77s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.96s
応答時間(最大)11.96s
応答時間(合計)11.96s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #37#37 |
Gemma 4 26B A4Bmedium
|
7.6… |
Google |
$0.045
↓
…
|
63.41s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 回答なし: 2 タイムアウト: 2
応答時間(平均)63.41s
応答時間(最大)369.32s
応答時間(合計)1268.28s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 69.8%
- 入力トークン
- 40,252
- 出力トークン
- 28,000
- 推論トークン
- 100,490
- 応答時間(平均)
- 63.41s
- 応答時間(合計)
- 1268.28s
- 応答時間(最大)
- 369.32s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.20s
応答時間(最大)9.64s
応答時間(合計)24.78s
-
コーディング
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 2 タイムアウト: 1
応答時間(平均)272.54s
応答時間(最大)369.32s
応答時間(合計)817.61s
-
複合
: 9.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)73.55s
応答時間(最大)73.55s
応答時間(合計)73.55s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)16.51s
応答時間(最大)20.57s
応答時間(合計)33.02s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)23.62s
応答時間(最大)27.00s
応答時間(合計)47.23s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)29.76s
応答時間(最大)29.76s
応答時間(合計)29.76s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.54s
応答時間(最大)21.25s
応答時間(合計)35.08s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.79s
応答時間(最大)6.85s
応答時間(合計)17.36s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.01s
応答時間(最大)9.01s
応答時間(合計)9.01s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)180.87s
応答時間(最大)180.87s
応答時間(合計)180.87s
|
| #15#15 |
GPT-5.3-Codexmedium
|
8.4… |
OpenAI |
$0.740
…
|
16.22s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 2
応答時間(平均)16.22s
応答時間(最大)100.93s
応答時間(合計)340.67s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 6
- 試行ごとの合格率
- 82.5%
- 入力トークン
- 34,299
- 出力トークン
- 2,357
- 推論トークン
- 46,189
- 応答時間(平均)
- 16.22s
- 応答時間(合計)
- 340.67s
- 応答時間(最大)
- 100.93s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.16s
応答時間(最大)6.68s
応答時間(合計)16.63s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)19.50s
応答時間(最大)27.96s
応答時間(合計)58.49s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)19.56s
応答時間(最大)19.56s
応答時間(合計)19.56s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.07s
応答時間(最大)3.59s
応答時間(合計)6.15s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)64.31s
応答時間(最大)100.93s
応答時間(合計)192.94s
-
汎用知能
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.87s
応答時間(最大)4.87s
応答時間(合計)4.87s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.04s
応答時間(最大)3.44s
応答時間(合計)6.07s
-
パズル解決
: 9.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)5.05s
応答時間(最大)8.73s
応答時間(合計)15.15s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.37s
応答時間(最大)6.37s
応答時間(合計)6.37s
-
雑学
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)14.43s
応答時間(最大)14.43s
応答時間(合計)14.43s
|
| #17#17 |
GLM 5medium
|
8.3… |
Z.ai |
$0.228
↓
…
|
33.54s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 1 回答なし: 1 タイムアウト: 1
応答時間(平均)33.54s
応答時間(最大)99.85s
応答時間(合計)435.99s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 6
- 試行ごとの合格率
- 82.5%
- 入力トークン
- 35,224
- 出力トークン
- 21,570
- 推論トークン
- 102,996
- 応答時間(平均)
- 33.54s
- 応答時間(合計)
- 435.99s
- 応答時間(最大)
- 99.85s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.66s
応答時間(最大)25.06s
応答時間(合計)47.32s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)74.30s
応答時間(最大)99.85s
応答時間(合計)222.91s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)28.96s
応答時間(最大)28.96s
応答時間(合計)28.96s
-
データ解析と抽出
: 7.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)8.90s
応答時間(最大)8.90s
応答時間(合計)8.90s
-
ドメイン特化
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
汎用知能
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)14.69s
応答時間(最大)14.69s
応答時間(合計)14.69s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.25s
応答時間(最大)7.25s
応答時間(合計)7.25s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.33s
応答時間(最大)16.34s
応答時間(合計)22.66s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.93s
応答時間(最大)15.93s
応答時間(合計)15.93s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)67.37s
応答時間(最大)67.37s
応答時間(合計)67.37s
|
| #18#18 |
Qwen3.7 Plusmedium
|
8.2… |
Qwen |
$0.221
…
|
38.95s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 タイムアウト: 1
応答時間(平均)38.95s
応答時間(最大)178.04s
応答時間(合計)817.85s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 6
- 試行ごとの合格率
- 77.8%
- 入力トークン
- 40,939
- 出力トークン
- 2,125
- 推論トークン
- 125,754
- 応答時間(平均)
- 38.95s
- 応答時間(合計)
- 817.85s
- 応答時間(最大)
- 178.04s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.58s
応答時間(最大)12.75s
応答時間(合計)34.33s
-
コーディング
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)108.60s
応答時間(最大)178.04s
応答時間(合計)325.79s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)65.24s
応答時間(最大)65.24s
応答時間(合計)65.24s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)21.75s
応答時間(最大)23.18s
応答時間(合計)43.49s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)45.35s
応答時間(最大)88.89s
応答時間(合計)136.04s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)25.48s
応答時間(最大)25.48s
応答時間(合計)25.48s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)16.13s
応答時間(最大)17.18s
応答時間(合計)32.26s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)16.38s
応答時間(最大)19.42s
応答時間(合計)49.14s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.02s
応答時間(最大)15.02s
応答時間(合計)15.02s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)91.07s
応答時間(最大)91.07s
応答時間(合計)91.07s
|
| #20#20 |
Gemini 3.5 Flashnone
|
8.1… |
Google |
$1.079
…
|
9.93s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 3 不正解: 3
応答時間(平均)9.93s
応答時間(最大)64.36s
応答時間(合計)178.68s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 6
- 試行ごとの合格率
- 77.8%
- 入力トークン
- 13,843
- 出力トークン
- 117,518
- 推論トークン
- 0
- 応答時間(平均)
- 9.93s
- 応答時間(合計)
- 178.68s
- 応答時間(最大)
- 64.36s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.53s
応答時間(最大)3.43s
応答時間(合計)10.12s
-
コーディング
: 8.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)34.69s
応答時間(最大)64.36s
応答時間(合計)104.06s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)8.10s
応答時間(最大)8.10s
応答時間(合計)8.10s
-
ドメイン特化
: 7.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.64s
応答時間(最大)14.00s
応答時間(合計)31.92s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.46s
応答時間(最大)3.46s
応答時間(合計)3.46s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.38s
応答時間(最大)3.40s
応答時間(合計)6.76s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.13s
応答時間(最大)3.33s
応答時間(合計)9.39s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.87s
応答時間(最大)4.87s
応答時間(合計)4.87s
|
| #14#14 |
Qwen3.6 Max Previewmedium
|
8.5… |
Qwen |
$0.960
↓
…
|
59.63s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5
応答時間(平均)59.63s
応答時間(最大)238.07s
応答時間(合計)1252.17s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 5
- 試行ごとの合格率
- 81.0%
- 入力トークン
- 42,362
- 出力トークン
- 2,273
- 推論トークン
- 144,367
- 応答時間(平均)
- 59.63s
- 応答時間(合計)
- 1252.17s
- 応答時間(最大)
- 238.07s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)22.13s
応答時間(最大)28.70s
応答時間(合計)88.50s
-
コーディング
: 8.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)146.48s
応答時間(最大)238.07s
応答時間(合計)439.45s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)121.49s
応答時間(最大)121.49s
応答時間(合計)121.49s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)41.15s
応答時間(最大)48.02s
応答時間(合計)82.30s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)95.91s
応答時間(最大)186.74s
応答時間(合計)287.73s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)32.24s
応答時間(最大)32.24s
応答時間(合計)32.24s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)24.31s
応答時間(最大)27.94s
応答時間(合計)48.63s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)24.32s
応答時間(最大)37.68s
応答時間(合計)72.96s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)18.32s
応答時間(最大)18.32s
応答時間(合計)18.32s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)60.56s
応答時間(最大)60.56s
応答時間(合計)60.56s
|
| #16#16 |
Gemini 3 Flash Previewlow
|
8.4… |
Google |
$0.111
…
|
5.76s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5
応答時間(平均)5.76s
応答時間(最大)14.72s
応答時間(合計)120.93s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 5
- 試行ごとの合格率
- 79.4%
- 入力トークン
- 36,769
- 出力トークン
- 2,076
- 推論トークン
- 28,518
- 応答時間(平均)
- 5.76s
- 応答時間(合計)
- 120.93s
- 応答時間(最大)
- 14.72s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.48s
応答時間(最大)4.31s
応答時間(合計)13.94s
-
コーディング
: 5.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)6.00s
応答時間(最大)6.94s
応答時間(合計)18.00s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.27s
応答時間(最大)3.27s
応答時間(合計)3.27s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.40s
応答時間(最大)14.72s
応答時間(合計)18.80s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)8.05s
応答時間(最大)14.40s
応答時間(合計)24.15s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.68s
応答時間(最大)3.68s
応答時間(合計)3.68s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.02s
応答時間(最大)7.35s
応答時間(合計)14.03s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.77s
応答時間(最大)10.27s
応答時間(合計)17.32s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.99s
応答時間(最大)4.99s
応答時間(合計)4.99s
-
雑学
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.75s
応答時間(最大)2.75s
応答時間(合計)2.75s
|