| #84#84 |
Gemma 4 26B A4Bnone
|
6.3… |
Google |
$0.005… |
6.28s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 8 指示に従っていない: 2 タイムアウト: 1
応答時間(平均)6.28s
応答時間(最大)57.10s
応答時間(合計)119.39s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 11
- 試行ごとの合格率
- 49.1%
- 出力トークン
- 1,796
- 推論トークン
- 0
- 応答時間(平均)
- 6.28s
- 応答時間(合計)
- 119.39s
- 応答時間(最大)
- 57.10s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.28s
応答時間(最大)2.09s
応答時間(合計)5.13s
-
コーディング
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)7.07s
応答時間(最大)7.07s
応答時間(合計)7.07s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)30.53s
応答時間(最大)30.53s
応答時間(合計)30.53s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.70s
応答時間(最大)2.21s
応答時間(合計)3.41s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)2.49s
応答時間(最大)4.23s
応答時間(合計)7.48s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)3.54s
応答時間(最大)3.54s
応答時間(合計)3.54s
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.08s
応答時間(最大)1.65s
応答時間(合計)2.15s
-
パズル解決
: 6.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)739ms
応答時間(最大)972ms
応答時間(合計)2.22s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)57.10s
応答時間(最大)57.10s
応答時間(合計)57.10s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)778ms
応答時間(最大)778ms
応答時間(合計)778ms
|
| #83#83 |
Gemini 2.5 Flashnone
|
6.3… |
Google |
$0.013… |
916ms… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 10 指示に従っていない: 1
応答時間(平均)916ms
応答時間(最大)4.39s
応答時間(合計)17.41s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 11
- 試行ごとの合格率
- 49.1%
- 出力トークン
- 1,738
- 推論トークン
- 0
- 応答時間(平均)
- 916ms
- 応答時間(合計)
- 17.41s
- 応答時間(最大)
- 4.39s
-
反AIトリック
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)582ms
応答時間(最大)844ms
応答時間(合計)2.33s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.16s
応答時間(最大)1.16s
応答時間(合計)1.16s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.39s
応答時間(最大)4.39s
応答時間(合計)4.39s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)652ms
応答時間(最大)660ms
応答時間(合計)1.30s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)495ms
応答時間(最大)642ms
応答時間(合計)1.49s
-
汎用知能
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)615ms
応答時間(最大)615ms
応答時間(合計)615ms
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)672ms
応答時間(最大)785ms
応答時間(合計)1.34s
-
パズル解決
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)576ms
応答時間(最大)700ms
応答時間(合計)1.73s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.91s
応答時間(最大)1.91s
応答時間(合計)1.91s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.15s
応答時間(最大)1.15s
応答時間(合計)1.15s
|
| #82#82 |
Mercury 2medium
|
6.3… |
Inception |
$0.050… |
2.23s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 8 指示に従っていない: 3
応答時間(平均)2.23s
応答時間(最大)14.63s
応答時間(合計)40.10s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 11
- 試行ごとの合格率
- 50.9%
- 出力トークン
- 3,994
- 推論トークン
- 52,081
- 応答時間(平均)
- 2.23s
- 応答時間(合計)
- 40.10s
- 応答時間(最大)
- 14.63s
-
反AIトリック
: 6.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)1.12s
応答時間(最大)2.46s
応答時間(合計)4.49s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.53s
応答時間(最大)1.53s
応答時間(合計)1.53s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.28s
応答時間(最大)3.28s
応答時間(合計)3.28s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.11s
応答時間(最大)1.47s
応答時間(合計)2.21s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)6.48s
応答時間(最大)14.63s
応答時間(合計)19.43s
-
汎用知能
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)821ms
応答時間(最大)821ms
応答時間(合計)821ms
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.07s
応答時間(最大)1.07s
応答時間(合計)1.07s
-
パズル解決
: 3.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)934ms
応答時間(最大)1.18s
応答時間(合計)2.80s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.89s
応答時間(最大)1.89s
応答時間(合計)1.89s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.58s
応答時間(最大)2.58s
応答時間(合計)2.58s
|
| #81#81 |
MiMo-V2-Omninone
|
6.3… |
Xiaomi |
$0.020… |
2.37s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 10 指示に従っていない: 1
応答時間(平均)2.37s
応答時間(最大)6.81s
応答時間(合計)45.03s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 11
- 試行ごとの合格率
- 43.9%
- 出力トークン
- 2,254
- 推論トークン
- 0
- 応答時間(平均)
- 2.37s
- 応答時間(合計)
- 45.03s
- 応答時間(最大)
- 6.81s
-
反AIトリック
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 1
応答時間(平均)1.63s
応答時間(最大)3.29s
応答時間(合計)6.52s
-
コーディング
: 6.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.72s
応答時間(最大)1.72s
応答時間(合計)1.72s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)5.96s
応答時間(最大)5.96s
応答時間(合計)5.96s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.76s
応答時間(最大)2.60s
応答時間(合計)3.51s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)2.10s
応答時間(最大)3.58s
応答時間(合計)6.30s
-
汎用知能
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.33s
応答時間(最大)2.33s
応答時間(合計)2.33s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.26s
応答時間(最大)6.81s
応答時間(合計)8.51s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.16s
応答時間(最大)1.55s
応答時間(合計)3.48s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.40s
応答時間(最大)5.40s
応答時間(合計)5.40s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.30s
応答時間(最大)1.30s
応答時間(合計)1.30s
|
| #80#80 |
GLM 5none
|
6.5… |
Z.ai |
$0.020… |
4.18s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 10
応答時間(平均)4.18s
応答時間(最大)11.07s
応答時間(合計)50.12s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 10
- 試行ごとの合格率
- 49.1%
- 出力トークン
- 1,972
- 推論トークン
- 0
- 応答時間(平均)
- 4.18s
- 応答時間(合計)
- 50.12s
- 応答時間(最大)
- 11.07s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)2.37s
応答時間(最大)3.39s
応答時間(合計)4.75s
-
コーディング
: 5.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)8.84s
応答時間(最大)8.84s
応答時間(合計)8.84s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.98s
応答時間(最大)4.98s
応答時間(合計)4.98s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.78s
応答時間(最大)5.78s
応答時間(合計)5.78s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)2.24s
応答時間(最大)2.24s
応答時間(合計)2.24s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.27s
応答時間(最大)3.27s
応答時間(合計)3.27s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.48s
応答時間(最大)1.48s
応答時間(合計)1.48s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.05s
応答時間(最大)2.08s
応答時間(合計)4.10s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.07s
応答時間(最大)11.07s
応答時間(合計)11.07s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.62s
応答時間(最大)3.62s
応答時間(合計)3.62s
|
| #79#79 |
Grok 4.1 Fastmedium
|
6.5… |
X AI |
$0.058… |
24.01s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 4 不正解: 4 回答なし: 1 タイムアウト: 1
応答時間(平均)24.01s
応答時間(最大)121.79s
応答時間(合計)288.18s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 10
- 試行ごとの合格率
- 61.4%
- 出力トークン
- 2,025
- 推論トークン
- 96,679
- 応答時間(平均)
- 24.01s
- 応答時間(合計)
- 288.18s
- 応答時間(最大)
- 121.79s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.81s
応答時間(最大)5.65s
応答時間(合計)7.62s
-
コーディング
: 2.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)23.58s
応答時間(最大)23.58s
応答時間(合計)23.58s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)37.64s
応答時間(最大)37.64s
応答時間(合計)37.64s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.63s
応答時間(最大)6.63s
応答時間(合計)6.63s
-
ドメイン特化
: 5.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)121.79s
応答時間(最大)121.79s
応答時間(合計)121.79s
-
汎用知能
: 4.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)16.25s
応答時間(最大)16.25s
応答時間(合計)16.25s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)5.30s
応答時間(最大)5.30s
応答時間(合計)5.30s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)8.08s
応答時間(最大)8.38s
応答時間(合計)16.17s
-
ツール呼び出し
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)27.71s
応答時間(最大)27.71s
応答時間(合計)27.71s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)25.52s
応答時間(最大)25.52s
応答時間(合計)25.52s
|
| #78#78 |
Qwen3.5 Plus 2026-02-15none
|
6.5… |
Qwen |
$0.017… |
2.49s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 10
応答時間(平均)2.49s
応答時間(最大)6.65s
応答時間(合計)32.33s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 10
- 試行ごとの合格率
- 50.9%
- 出力トークン
- 2,472
- 推論トークン
- 0
- 応答時間(平均)
- 2.49s
- 応答時間(合計)
- 32.33s
- 応答時間(最大)
- 6.65s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.91s
応答時間(最大)2.74s
応答時間(合計)3.82s
-
コーディング
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.63s
応答時間(最大)3.63s
応答時間(合計)3.63s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.65s
応答時間(最大)6.65s
応答時間(合計)6.65s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.89s
応答時間(最大)1.89s
応答時間(合計)1.89s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.17s
応答時間(最大)1.44s
応答時間(合計)2.33s
-
汎用知能
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.26s
応答時間(最大)2.26s
応答時間(合計)2.26s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.67s
応答時間(最大)1.67s
応答時間(合計)1.67s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.82s
応答時間(最大)3.52s
応答時間(合計)5.65s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.33s
応答時間(最大)3.33s
応答時間(合計)3.33s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.11s
応答時間(最大)1.11s
応答時間(合計)1.11s
|
| #77#77 |
Laguna Xs.2mediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
6.6… |
Poolside |
$0.000… |
6.74s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 回答なし: 2 無効なツール呼び出し: 1
応答時間(平均)6.74s
応答時間(最大)29.11s
応答時間(合計)101.08s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 9
- 試行ごとの合格率
- 64.5%
- 出力トークン
- 54,284
- 推論トークン
- 0
- 応答時間(平均)
- 6.74s
- 応答時間(合計)
- 101.08s
- 応答時間(最大)
- 29.11s
-
反AIトリック
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.68s
応答時間(最大)3.09s
応答時間(合計)8.04s
-
コーディング
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)14.36s
応答時間(最大)14.36s
応答時間(合計)14.36s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)15.92s
応答時間(最大)15.92s
応答時間(合計)15.92s
-
データ解析と抽出
: 7.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)9.34s
応答時間(最大)16.71s
応答時間(合計)18.68s
-
ドメイン特化
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 回答なし: 1
応答時間(平均)11.12s
応答時間(最大)29.11s
応答時間(合計)33.35s
-
汎用知能
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.68s
応答時間(最大)2.03s
応答時間(合計)3.36s
-
パズル解決
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.99s
応答時間(最大)2.00s
応答時間(合計)3.97s
-
ツール呼び出し
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)3.39s
応答時間(最大)3.39s
応答時間(合計)3.39s
-
雑学
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #76#76 |
Grok 4.20 Multi Agent Betamediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
6.6… |
X AI |
$5.074… |
9.80s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 API エラー: 2 余分な書式: 2 指示に従っていない: 2
応答時間(平均)9.80s
応答時間(最大)35.28s
応答時間(合計)156.75s
…
|
- 合計テスト数
- 18
- 誤答テスト数
- 10
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 63.0%
- 出力トークン
- 299,034
- 推論トークン
- 309,670
- 応答時間(平均)
- 9.80s
- 応答時間(合計)
- 156.75s
- 応答時間(最大)
- 35.28s
-
反AIトリック
: 6.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)3.46s
応答時間(最大)4.38s
応答時間(合計)13.86s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)27.11s
応答時間(最大)27.11s
応答時間(合計)27.11s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.54s
応答時間(最大)7.51s
応答時間(合計)11.08s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 余分な書式: 1
応答時間(平均)24.67s
応答時間(最大)35.28s
応答時間(合計)74.02s
-
汎用知能
: 5.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)6.40s
応答時間(最大)6.40s
応答時間(合計)6.40s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.63s
応答時間(最大)5.46s
応答時間(合計)9.26s
-
パズル解決
: 7.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)5.01s
応答時間(最大)5.49s
応答時間(合計)15.03s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #75#75 |
Gemini 3.1 Flash Litenone
|
6.7… |
Google |
$0.012… |
1.11s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9 指示に従っていない: 1
応答時間(平均)1.11s
応答時間(最大)2.97s
応答時間(合計)21.13s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 10
- 試行ごとの合格率
- 57.9%
- 出力トークン
- 2,454
- 推論トークン
- 0
- 応答時間(平均)
- 1.11s
- 応答時間(合計)
- 21.13s
- 応答時間(最大)
- 2.97s
-
反AIトリック
: 7.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.07s
応答時間(最大)1.91s
応答時間(合計)4.27s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.59s
応答時間(最大)1.59s
応答時間(合計)1.59s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.73s
応答時間(最大)2.73s
応答時間(合計)2.73s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)843ms
応答時間(最大)907ms
応答時間(合計)1.69s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)762ms
応答時間(最大)814ms
応答時間(合計)2.29s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)992ms
応答時間(最大)992ms
応答時間(合計)992ms
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)859ms
応答時間(最大)975ms
応答時間(合計)1.72s
-
パズル解決
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)720ms
応答時間(最大)826ms
応答時間(合計)2.16s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.97s
応答時間(最大)2.97s
応答時間(合計)2.97s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)733ms
応答時間(最大)733ms
応答時間(合計)733ms
|
| #74#74 |
GPT-5.5none
|
6.7… |
OpenAI |
$0.197… |
1.99s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9
応答時間(平均)1.99s
応答時間(最大)5.56s
応答時間(合計)37.87s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 9
- 試行ごとの合格率
- 59.7%
- 出力トークン
- 1,928
- 推論トークン
- 0
- 応答時間(平均)
- 1.99s
- 応答時間(合計)
- 37.87s
- 応答時間(最大)
- 5.56s
-
反AIトリック
: 6.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.31s
応答時間(最大)2.08s
応答時間(合計)5.25s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.05s
応答時間(最大)2.05s
応答時間(合計)2.05s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)5.56s
応答時間(最大)5.56s
応答時間(合計)5.56s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.18s
応答時間(最大)1.24s
応答時間(合計)2.37s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.31s
応答時間(最大)1.39s
応答時間(合計)3.92s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.41s
応答時間(最大)3.41s
応答時間(合計)3.41s
-
指示追従
: 6.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.15s
応答時間(最大)1.19s
応答時間(合計)2.31s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.36s
応答時間(最大)1.56s
応答時間(合計)4.09s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.90s
応答時間(最大)3.90s
応答時間(合計)3.90s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)5.01s
応答時間(最大)5.01s
応答時間(合計)5.01s
|
| #73#73 |
Hunter Alphamediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
6.7… |
OpenRouter |
$0.000… |
10.33s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 2 タイムアウト: 2 API エラー: 1 余分な書式: 1
応答時間(平均)10.33s
応答時間(最大)30.53s
応答時間(合計)175.60s
…
|
- 合計テスト数
- 18
- 誤答テスト数
- 10
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 64.8%
- 出力トークン
- 4,724
- 推論トークン
- 17,921
- 応答時間(平均)
- 10.33s
- 応答時間(合計)
- 175.60s
- 応答時間(最大)
- 30.53s
-
反AIトリック
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)4.75s
応答時間(最大)7.62s
応答時間(合計)19.00s
-
コーディング
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
複合
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)30.53s
応答時間(最大)30.53s
応答時間(合計)30.53s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.16s
応答時間(最大)26.55s
応答時間(合計)46.33s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 タイムアウト: 1 不正解: 1
応答時間(平均)10.52s
応答時間(最大)18.68s
応答時間(合計)31.56s
-
汎用知能
: 7.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)6.44s
応答時間(最大)6.44s
応答時間(合計)6.44s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.18s
応答時間(最大)4.46s
応答時間(合計)8.36s
-
パズル解決
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)5.36s
応答時間(最大)6.20s
応答時間(合計)16.07s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.33s
応答時間(最大)17.33s
応答時間(合計)17.33s
|
| #72#72 |
Qwen3.6 27Bmedium
|
6.8… |
Qwen |
$0.229… |
52.13s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 回答なし: 2 指示に従っていない: 1 無効なツール呼び出し: 1
応答時間(平均)52.13s
応答時間(最大)168.22s
応答時間(合計)990.48s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 10
- 試行ごとの合格率
- 61.4%
- 出力トークン
- 8,680
- 推論トークン
- 96,890
- 応答時間(平均)
- 52.13s
- 応答時間(合計)
- 990.48s
- 応答時間(最大)
- 168.22s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)12.62s
応答時間(最大)18.61s
応答時間(合計)50.50s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)168.22s
応答時間(最大)168.22s
応答時間(合計)168.22s
-
複合
: 7.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)83.07s
応答時間(最大)83.07s
応答時間(合計)83.07s
-
データ解析と抽出
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 2
応答時間(平均)37.30s
応答時間(最大)54.01s
応答時間(合計)74.60s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)73.38s
応答時間(最大)101.55s
応答時間(合計)220.15s
-
汎用知能
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)39.53s
応答時間(最大)39.53s
応答時間(合計)39.53s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)37.96s
応答時間(最大)47.48s
応答時間(合計)75.92s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)60.21s
応答時間(最大)97.76s
応答時間(合計)180.63s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)16.88s
応答時間(最大)16.88s
応答時間(合計)16.88s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)80.99s
応答時間(最大)80.99s
応答時間(合計)80.99s
|
| #71#71 |
Kimi K2.5medium
|
6.8… |
Moonshot AI |
$0.236… |
73.39s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 2 タイムアウト: 2 回答なし: 1
応答時間(平均)73.39s
応答時間(最大)150.77s
応答時間(合計)880.65s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 10
- 試行ごとの合格率
- 68.4%
- 出力トークン
- 42,188
- 推論トークン
- 92,514
- 応答時間(平均)
- 73.39s
- 応答時間(合計)
- 880.65s
- 応答時間(最大)
- 150.77s
-
反AIトリック
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1 不正解: 1
応答時間(平均)51.38s
応答時間(最大)85.28s
応答時間(合計)102.75s
-
コーディング
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)150.77s
応答時間(最大)150.77s
応答時間(合計)150.77s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)71.37s
応答時間(最大)71.37s
応答時間(合計)71.37s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)49.78s
応答時間(最大)49.78s
応答時間(合計)49.78s
-
ドメイン特化
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)137.29s
応答時間(最大)137.29s
応答時間(合計)137.29s
-
汎用知能
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)69.73s
応答時間(最大)69.73s
応答時間(合計)69.73s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)92.47s
応答時間(最大)92.47s
応答時間(合計)92.47s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)45.40s
応答時間(最大)82.75s
応答時間(合計)90.79s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)31.74s
応答時間(最大)31.74s
応答時間(合計)31.74s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)83.95s
応答時間(最大)83.95s
応答時間(合計)83.95s
|
| #70#70 |
Gemini 3.1 Flash Liteminimal
|
6.8… |
Google |
$0.012… |
1.41s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 指示に従っていない: 3
応答時間(平均)1.41s
応答時間(最大)4.49s
応答時間(合計)26.72s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 9
- 試行ごとの合格率
- 59.7%
- 出力トークン
- 2,457
- 推論トークン
- 0
- 応答時間(平均)
- 1.41s
- 応答時間(合計)
- 26.72s
- 応答時間(最大)
- 4.49s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.10s
応答時間(最大)1.65s
応答時間(合計)4.42s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.31s
応答時間(最大)1.31s
応答時間(合計)1.31s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.53s
応答時間(最大)2.53s
応答時間(合計)2.53s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.04s
応答時間(最大)1.32s
応答時間(合計)2.07s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.02s
応答時間(最大)1.16s
応答時間(合計)3.06s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)791ms
応答時間(最大)791ms
応答時間(合計)791ms
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)932ms
応答時間(最大)1.00s
応答時間(合計)1.86s
-
パズル解決
: 6.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2
応答時間(平均)2.15s
応答時間(最大)4.49s
応答時間(合計)6.45s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.51s
応答時間(最大)3.51s
応答時間(合計)3.51s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)724ms
応答時間(最大)724ms
応答時間(合計)724ms
|
| #69#69 |
GPT-5 Minimedium
|
6.8… |
OpenAI |
$0.132… |
23.24s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 4 タイムアウト: 1
応答時間(平均)23.24s
応答時間(最大)88.15s
応答時間(合計)441.55s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 10
- 試行ごとの合格率
- 57.9%
- 出力トークン
- 6,539
- 推論トークン
- 55,338
- 応答時間(平均)
- 23.24s
- 応答時間(合計)
- 441.55s
- 応答時間(最大)
- 88.15s
-
反AIトリック
: 7.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)13.86s
応答時間(最大)26.00s
応答時間(合計)55.45s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.18s
応答時間(最大)23.18s
応答時間(合計)23.18s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)88.15s
応答時間(最大)88.15s
応答時間(合計)88.15s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.58s
応答時間(最大)13.87s
応答時間(合計)25.16s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)44.63s
応答時間(最大)82.55s
応答時間(合計)133.89s
-
汎用知能
: 4.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)13.50s
応答時間(最大)13.50s
応答時間(合計)13.50s
-
指示追従
: 7.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)15.66s
応答時間(最大)21.80s
応答時間(合計)31.32s
-
パズル解決
: 5.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)14.09s
応答時間(最大)16.81s
応答時間(合計)42.28s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)18.64s
応答時間(最大)18.64s
応答時間(合計)18.64s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)9.99s
応答時間(最大)9.99s
応答時間(合計)9.99s
|
| #68#68 |
Grok 4.20medium
|
6.9… |
X AI |
$0.756… |
14.53s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 2 余分な書式: 1 回答なし: 1
応答時間(平均)14.53s
応答時間(最大)63.48s
応答時間(合計)276.06s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 9
- 試行ごとの合格率
- 63.2%
- 出力トークン
- 1,784
- 推論トークン
- 128,233
- 応答時間(平均)
- 14.53s
- 応答時間(合計)
- 276.06s
- 応答時間(最大)
- 63.48s
-
反AIトリック
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.95s
応答時間(最大)5.68s
応答時間(合計)15.80s
-
コーディング
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)24.33s
応答時間(最大)24.33s
応答時間(合計)24.33s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.40s
応答時間(最大)17.40s
応答時間(合計)17.40s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.17s
応答時間(最大)5.02s
応答時間(合計)8.34s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)27.03s
応答時間(最大)29.87s
応答時間(合計)81.10s
-
汎用知能
: 3.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)24.48s
応答時間(最大)24.48s
応答時間(合計)24.48s
-
指示追従
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)4.42s
応答時間(最大)4.46s
応答時間(合計)8.84s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.20s
応答時間(最大)11.63s
応答時間(合計)18.61s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)13.68s
応答時間(最大)13.68s
応答時間(合計)13.68s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)63.48s
応答時間(最大)63.48s
応答時間(合計)63.48s
|
| #67#67 |
DeepSeek V4 Prohigh
|
6.9… |
DeepSeek |
$0.212… |
58.93s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 指示に従っていない: 2
応答時間(平均)58.93s
応答時間(最大)358.35s
応答時間(合計)1119.75s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 8
- 試行ごとの合格率
- 70.2%
- 出力トークン
- 12,211
- 推論トークン
- 53,774
- 応答時間(平均)
- 58.93s
- 応答時間(合計)
- 1119.75s
- 応答時間(最大)
- 358.35s
-
反AIトリック
: 7.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)16.53s
応答時間(最大)39.91s
応答時間(合計)66.11s
-
コーディング
: 2.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)51.77s
応答時間(最大)51.77s
応答時間(合計)51.77s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)65.02s
応答時間(最大)65.02s
応答時間(合計)65.02s
-
データ解析と抽出
: 8.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.62s
応答時間(最大)36.44s
応答時間(合計)47.24s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)205.66s
応答時間(最大)358.35s
応答時間(合計)616.97s
-
汎用知能
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)25.09s
応答時間(最大)25.09s
応答時間(合計)25.09s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)41.16s
応答時間(最大)43.56s
応答時間(合計)82.32s
-
パズル解決
: 7.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)34.92s
応答時間(最大)76.46s
応答時間(合計)104.76s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)21.33s
応答時間(最大)21.33s
応答時間(合計)21.33s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)39.14s
応答時間(最大)39.14s
応答時間(合計)39.14s
|
| #66#66 |
Gemma 4 31Bnone
|
6.9… |
Google |
$0.003… |
3.86s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 API エラー: 2 指示に従っていない: 1
応答時間(平均)3.86s
応答時間(最大)26.13s
応答時間(合計)65.57s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 9
- 試行ごとの合格率
- 52.6%
- 出力トークン
- 1,371
- 推論トークン
- 0
- 応答時間(平均)
- 3.86s
- 応答時間(合計)
- 65.57s
- 応答時間(最大)
- 26.13s
-
反AIトリック
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.85s
応答時間(最大)4.45s
応答時間(合計)7.40s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)26.13s
応答時間(最大)26.13s
応答時間(合計)26.13s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.25s
応答時間(最大)3.02s
応答時間(合計)4.51s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.22s
応答時間(最大)4.68s
応答時間(合計)9.67s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.09s
応答時間(最大)2.09s
応答時間(合計)2.09s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.84s
応答時間(最大)4.45s
応答時間(合計)5.68s
-
パズル解決
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)2.95s
応答時間(最大)4.05s
応答時間(合計)8.85s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.25s
応答時間(最大)1.25s
応答時間(合計)1.25s
|
| #65#65 |
Laguna M.1mediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
6.9… |
Poolside |
$0.000… |
14.38s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 回答なし: 2 指示に従っていない: 1
応答時間(平均)14.38s
応答時間(最大)53.14s
応答時間(合計)215.70s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 7
- 試行ごとの合格率
- 64.4%
- 出力トークン
- 56,620
- 推論トークン
- 0
- 応答時間(平均)
- 14.38s
- 応答時間(合計)
- 215.70s
- 応答時間(最大)
- 53.14s
-
反AIトリック
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.87s
応答時間(最大)6.30s
応答時間(合計)14.62s
-
コーディング
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)35.61s
応答時間(最大)35.61s
応答時間(合計)35.61s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)53.14s
応答時間(最大)53.14s
応答時間(合計)53.14s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.93s
応答時間(最大)5.03s
応答時間(合計)9.86s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)24.14s
応答時間(最大)45.83s
応答時間(合計)72.43s
-
汎用知能
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.30s
応答時間(最大)6.00s
応答時間(合計)8.59s
-
パズル解決
: 3.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1 不正解: 1
応答時間(平均)7.57s
応答時間(最大)9.69s
応答時間(合計)15.14s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.31s
応答時間(最大)6.31s
応答時間(合計)6.31s
-
雑学
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #64#64 |
MiMo-V2-Omnimedium
|
7.2… |
Xiaomi |
$0.451… |
27.58s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 2 余分な書式: 1 回答なし: 1
応答時間(平均)27.58s
応答時間(最大)234.19s
応答時間(合計)524.03s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 9
- 試行ごとの合格率
- 59.7%
- 出力トークン
- 1,925
- 推論トークン
- 216,652
- 応答時間(平均)
- 27.58s
- 応答時間(合計)
- 524.03s
- 応答時間(最大)
- 234.19s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.75s
応答時間(最大)4.59s
応答時間(合計)10.98s
-
コーディング
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)68.55s
応答時間(最大)68.55s
応答時間(合計)68.55s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)25.87s
応答時間(最大)25.87s
応答時間(合計)25.87s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.04s
応答時間(最大)4.12s
応答時間(合計)6.07s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 回答なし: 1 不正解: 1
応答時間(平均)47.89s
応答時間(最大)134.52s
応答時間(合計)143.67s
-
汎用知能
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.61s
応答時間(最大)3.61s
応答時間(合計)3.61s
-
指示追従
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.99s
応答時間(最大)7.14s
応答時間(合計)9.99s
-
パズル解決
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)2.38s
応答時間(最大)3.69s
応答時間(合計)7.13s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.98s
応答時間(最大)13.98s
応答時間(合計)13.98s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)234.19s
応答時間(最大)234.19s
応答時間(合計)234.19s
|
| #63#63 |
Claude Sonnet 4.6none
|
7.2… |
Anthropic |
$0.269… |
4.96s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 余分な書式: 3 指示に従っていない: 1
応答時間(平均)4.96s
応答時間(最大)23.84s
応答時間(合計)59.50s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 8
- 試行ごとの合格率
- 61.4%
- 出力トークン
- 7,864
- 推論トークン
- 0
- 応答時間(平均)
- 4.96s
- 応答時間(合計)
- 59.50s
- 応答時間(最大)
- 23.84s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 2 不正解: 1
応答時間(平均)2.94s
応答時間(最大)4.83s
応答時間(合計)5.88s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.67s
応答時間(最大)3.67s
応答時間(合計)3.67s
-
複合
: 9.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.84s
応答時間(最大)23.84s
応答時間(合計)23.84s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.43s
応答時間(最大)3.43s
応答時間(合計)3.43s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.54s
応答時間(最大)3.54s
応答時間(合計)3.54s
-
汎用知能
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.56s
応答時間(最大)2.56s
応答時間(合計)2.56s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.96s
応答時間(最大)1.96s
応答時間(合計)1.96s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)2.92s
応答時間(最大)3.33s
応答時間(合計)5.84s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.11s
応答時間(最大)4.11s
応答時間(合計)4.11s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.67s
応答時間(最大)4.67s
応答時間(合計)4.67s
|
| #62#62 |
GPT-5.4 Minimedium
|
7.2… |
OpenAI |
$0.345… |
16.00s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 4
応答時間(平均)16.00s
応答時間(最大)102.91s
応答時間(合計)303.99s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 9
- 試行ごとの合格率
- 68.4%
- 出力トークン
- 2,163
- 推論トークン
- 69,741
- 応答時間(平均)
- 16.00s
- 応答時間(合計)
- 303.99s
- 応答時間(最大)
- 102.91s
-
反AIトリック
: 8.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.05s
応答時間(最大)6.69s
応答時間(合計)16.20s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.76s
応答時間(最大)7.76s
応答時間(合計)7.76s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.81s
応答時間(最大)17.81s
応答時間(合計)17.81s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.43s
応答時間(最大)3.39s
応答時間(合計)4.87s
-
ドメイン特化
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)65.31s
応答時間(最大)102.91s
応答時間(合計)195.92s
-
汎用知能
: 4.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)3.72s
応答時間(最大)3.72s
応答時間(合計)3.72s
-
指示追従
: 7.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.50s
応答時間(最大)2.55s
応答時間(合計)5.00s
-
パズル解決
: 7.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.33s
応答時間(最大)7.27s
応答時間(合計)13.00s
-
ツール呼び出し
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)9.62s
応答時間(最大)9.62s
応答時間(合計)9.62s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)30.10s
応答時間(最大)30.10s
応答時間(合計)30.10s
|
| #61#61 |
DeepSeek V3.2medium
|
7.2… |
DeepSeek |
$0.031… |
46.06s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 2 タイムアウト: 2
応答時間(平均)46.06s
応答時間(最大)180.92s
応答時間(合計)875.23s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 8
- 試行ごとの合格率
- 72.8%
- 出力トークン
- 7,035
- 推論トークン
- 53,765
- 応答時間(平均)
- 46.06s
- 応答時間(合計)
- 875.23s
- 応答時間(最大)
- 180.92s
-
反AIトリック
: 9.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)24.23s
応答時間(最大)29.86s
応答時間(合計)96.93s
-
コーディング
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)180.92s
応答時間(最大)180.92s
応答時間(合計)180.92s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)93.11s
応答時間(最大)93.11s
応答時間(合計)93.11s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)36.09s
応答時間(最大)39.12s
応答時間(合計)72.18s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)24.27s
応答時間(最大)33.91s
応答時間(合計)72.82s
-
汎用知能
: 3.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)58.29s
応答時間(最大)58.29s
応答時間(合計)58.29s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)35.78s
応答時間(最大)47.30s
応答時間(合計)71.56s
-
パズル解決
: 6.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)36.87s
応答時間(最大)59.22s
応答時間(合計)110.62s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)34.81s
応答時間(最大)34.81s
応答時間(合計)34.81s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)83.99s
応答時間(最大)83.99s
応答時間(合計)83.99s
|
| #60#60 |
GPT-5.2medium
|
7.2… |
OpenAI |
$0.397… |
15.22s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 3 不正解: 3 回答なし: 1 タイムアウト: 1
応答時間(平均)15.22s
応答時間(最大)77.80s
応答時間(合計)182.59s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 8
- 試行ごとの合格率
- 68.4%
- 出力トークン
- 2,731
- 推論トークン
- 22,200
- 応答時間(平均)
- 15.22s
- 応答時間(合計)
- 182.59s
- 応答時間(最大)
- 77.80s
-
反AIトリック
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)7.81s
応答時間(最大)14.34s
応答時間(合計)15.62s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.12s
応答時間(最大)15.12s
応答時間(合計)15.12s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.06s
応答時間(最大)14.06s
応答時間(合計)14.06s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.15s
応答時間(最大)3.15s
応答時間(合計)3.15s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)77.80s
応答時間(最大)77.80s
応答時間(合計)77.80s
-
汎用知能
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.32s
応答時間(最大)4.32s
応答時間(合計)4.32s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.12s
応答時間(最大)3.12s
応答時間(合計)3.12s
-
パズル解決
: 7.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)5.47s
応答時間(最大)6.45s
応答時間(合計)10.94s
-
ツール呼び出し
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)10.30s
応答時間(最大)10.30s
応答時間(合計)10.30s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)28.18s
応答時間(最大)28.18s
応答時間(合計)28.18s
|
| #59#59 |
Qwen3.5-35B-A3Bmedium
|
7.2… |
Qwen |
$0.481… |
51.50s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 4 不正解: 3 API エラー: 1 回答なし: 1
応答時間(平均)51.50s
応答時間(最大)177.35s
応答時間(合計)978.57s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 9
- 試行ごとの合格率
- 75.4%
- 出力トークン
- 21,056
- 推論トークン
- 280,814
- 応答時間(平均)
- 51.50s
- 応答時間(合計)
- 978.57s
- 応答時間(最大)
- 177.35s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)21.13s
応答時間(最大)34.96s
応答時間(合計)84.53s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)79.09s
応答時間(最大)79.09s
応答時間(合計)79.09s
-
複合
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)75.34s
応答時間(最大)75.34s
応答時間(合計)75.34s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)59.33s
応答時間(最大)97.12s
応答時間(合計)118.65s
-
ドメイン特化
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2 不正解: 1
応答時間(平均)88.34s
応答時間(最大)106.00s
応答時間(合計)265.01s
-
汎用知能
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)30.30s
応答時間(最大)30.30s
応答時間(合計)30.30s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)24.45s
応答時間(最大)43.36s
応答時間(合計)48.89s
-
パズル解決
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)31.58s
応答時間(最大)60.18s
応答時間(合計)94.75s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.65s
応答時間(最大)4.65s
応答時間(合計)4.65s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)177.35s
応答時間(最大)177.35s
応答時間(合計)177.35s
|
| #58#58 |
Seed-2.0-Minimedium
|
7.2… |
Bytedance Seed |
$0.038… |
68.89s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 4 不正解: 3 指示に従っていない: 1
応答時間(平均)68.89s
応答時間(最大)262.83s
応答時間(合計)1102.23s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 8
- 試行ごとの合格率
- 63.2%
- 出力トークン
- 2,469
- 推論トークン
- 81,017
- 応答時間(平均)
- 68.89s
- 応答時間(合計)
- 1102.23s
- 応答時間(最大)
- 262.83s
-
反AIトリック
: 6.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)74.75s
応答時間(最大)182.10s
応答時間(合計)298.98s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)197.31s
応答時間(最大)197.31s
応答時間(合計)197.31s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)262.83s
応答時間(最大)262.83s
応答時間(合計)262.83s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)24.27s
応答時間(最大)27.52s
応答時間(合計)48.54s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 3
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
汎用知能
: 5.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)36.65s
応答時間(最大)36.65s
応答時間(合計)36.65s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.47s
応答時間(最大)19.46s
応答時間(合計)34.93s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)25.85s
応答時間(最大)32.95s
応答時間(合計)77.55s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)88.68s
応答時間(最大)88.68s
応答時間(合計)88.68s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)56.76s
応答時間(最大)56.76s
応答時間(合計)56.76s
|
| #57#57 |
Ring 2.6 1tnone
|
7.2… |
Inclusionai |
$0.000… |
55.10s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 2
応答時間(平均)55.10s
応答時間(最大)143.82s
応答時間(合計)881.55s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 7
- 試行ごとの合格率
- 62.5%
- 出力トークン
- 39,954
- 推論トークン
- 0
- 応答時間(平均)
- 55.10s
- 応答時間(合計)
- 881.55s
- 応答時間(最大)
- 143.82s
-
反AIトリック
: 9.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)43.33s
応答時間(最大)71.76s
応答時間(合計)173.31s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)143.82s
応答時間(最大)143.82s
応答時間(合計)143.82s
-
複合
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)45.87s
応答時間(最大)45.87s
応答時間(合計)45.87s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)73.40s
応答時間(最大)90.09s
応答時間(合計)220.20s
-
汎用知能
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)15.63s
応答時間(最大)15.63s
応答時間(合計)15.63s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)27.36s
応答時間(最大)40.24s
応答時間(合計)54.72s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)31.47s
応答時間(最大)46.84s
応答時間(合計)94.41s
-
ツール呼び出し
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)133.60s
応答時間(最大)133.60s
応答時間(合計)133.60s
|
| #55#55 |
Ring 2.6 1tmedium
|
7.2… |
Inclusionai |
$0.000… |
61.29s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 指示に従っていない: 2
応答時間(平均)61.29s
応答時間(最大)304.19s
応答時間(合計)1164.50s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 8
- 試行ごとの合格率
- 66.7%
- 出力トークン
- 21,752
- 推論トークン
- 42,754
- 応答時間(平均)
- 61.29s
- 応答時間(合計)
- 1164.50s
- 応答時間(最大)
- 304.19s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)42.21s
応答時間(最大)89.34s
応答時間(合計)168.84s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)59.65s
応答時間(最大)59.65s
応答時間(合計)59.65s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)304.19s
応答時間(最大)304.19s
応答時間(合計)304.19s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)37.36s
応答時間(最大)54.24s
応答時間(合計)74.71s
-
ドメイン特化
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)64.92s
応答時間(最大)150.55s
応答時間(合計)194.76s
-
汎用知能
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)58.26s
応答時間(最大)58.26s
応答時間(合計)58.26s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.78s
応答時間(最大)17.75s
応答時間(合計)23.55s
-
パズル解決
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)20.73s
応答時間(最大)42.39s
応答時間(合計)62.19s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)104.44s
応答時間(最大)104.44s
応答時間(合計)104.44s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)113.91s
応答時間(最大)113.91s
応答時間(合計)113.91s
|
| #56#56 |
MiMo-V2-Flashmedium
|
7.2… |
Xiaomi |
$0.038… |
21.71s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 API エラー: 1 余分な書式: 1 指示に従っていない: 1 タイムアウト: 1
応答時間(平均)21.71s
応答時間(最大)96.01s
応答時間(合計)282.29s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 8
- 試行ごとの合格率
- 66.7%
- 出力トークン
- 12,399
- 推論トークン
- 115,182
- 応答時間(平均)
- 21.71s
- 応答時間(合計)
- 282.29s
- 応答時間(最大)
- 96.01s
-
反AIトリック
: 8.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)15.85s
応答時間(最大)20.83s
応答時間(合計)47.55s
-
コーディング
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)13.03s
応答時間(最大)13.03s
応答時間(合計)13.03s
-
複合
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)75.68s
応答時間(最大)75.68s
応答時間(合計)75.68s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)96.01s
応答時間(最大)96.01s
応答時間(合計)96.01s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.20s
応答時間(最大)4.20s
応答時間(合計)4.20s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.28s
応答時間(最大)7.37s
応答時間(合計)8.55s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.77s
応答時間(最大)5.26s
応答時間(合計)7.55s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)27.78s
応答時間(最大)27.78s
応答時間(合計)27.78s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.96s
応答時間(最大)1.96s
応答時間(合計)1.96s
|