| #109#109 |
GLM 5V Turbonone
|
5.8… |
Z.ai |
$0.052
…
|
2.99s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 11 指示に従っていない: 2
応答時間(平均)2.99s
応答時間(最大)6.51s
応答時間(合計)62.74s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 13
- 試行ごとの合格率
- 38.1%
- 入力トークン
- 37,100
- 出力トークン
- 1,766
- 推論トークン
- 0
- 応答時間(平均)
- 2.99s
- 応答時間(合計)
- 62.74s
- 応答時間(最大)
- 6.51s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)3.13s
応答時間(最大)5.90s
応答時間(合計)12.50s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)3.13s
応答時間(最大)5.30s
応答時間(合計)9.40s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.51s
応答時間(最大)6.51s
応答時間(合計)6.51s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.81s
応答時間(最大)5.69s
応答時間(合計)7.62s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)2.09s
応答時間(最大)2.39s
応答時間(合計)6.26s
-
汎用知能
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.22s
応答時間(最大)2.22s
応答時間(合計)2.22s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.97s
応答時間(最大)2.43s
応答時間(合計)3.93s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)2.40s
応答時間(最大)3.81s
応答時間(合計)7.21s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.86s
応答時間(最大)4.86s
応答時間(合計)4.86s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.23s
応答時間(最大)2.23s
応答時間(合計)2.23s
|
| #151#151 |
Trinity Large Previewnone
|
4.6… |
Arcee AI |
$0.008
↑
…
|
2.98s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 12 指示に従っていない: 3 API エラー: 2
応答時間(平均)2.98s
応答時間(最大)14.34s
応答時間(合計)56.57s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 17
- 試行ごとの合格率
- 22.2%
- 入力トークン
- 29,828
- 出力トークン
- 2,169
- 推論トークン
- 0
- 応答時間(平均)
- 2.98s
- 応答時間(合計)
- 56.57s
- 応答時間(最大)
- 14.34s
-
反AIトリック
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)2.07s
応答時間(最大)4.40s
応答時間(合計)8.30s
-
コーディング
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 2 不正解: 1
応答時間(平均)14.34s
応答時間(最大)14.34s
応答時間(合計)14.34s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)8.91s
応答時間(最大)8.91s
応答時間(合計)8.91s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.26s
応答時間(最大)4.66s
応答時間(合計)6.52s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)877ms
応答時間(最大)894ms
応答時間(合計)2.63s
-
汎用知能
: 4.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)873ms
応答時間(最大)873ms
応答時間(合計)873ms
-
指示追従
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)822ms
応答時間(最大)960ms
応答時間(合計)1.64s
-
パズル解決
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)1.97s
応答時間(最大)2.87s
応答時間(合計)5.91s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.67s
応答時間(最大)6.67s
応答時間(合計)6.67s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)777ms
応答時間(最大)777ms
応答時間(合計)777ms
|
| #145#145 |
Laguna M.1noneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
4.8… |
Poolside |
$0.000
…
|
2.89s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 10 API エラー: 4 無効なツール呼び出し: 1
応答時間(平均)2.89s
応答時間(最大)15.42s
応答時間(合計)43.28s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 15
- 試行ごとの合格率
- 31.6%
- 入力トークン
- 38,147
- 出力トークン
- 2,054
- 推論トークン
- 0
- 応答時間(平均)
- 2.89s
- 応答時間(合計)
- 43.28s
- 応答時間(最大)
- 15.42s
-
反AIトリック
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 API エラー: 1
応答時間(平均)705ms
応答時間(最大)975ms
応答時間(合計)2.12s
-
コーディング
: 7.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.93s
応答時間(最大)2.93s
応答時間(合計)2.93s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)4.32s
応答時間(最大)4.32s
応答時間(合計)4.32s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.37s
応答時間(最大)5.76s
応答時間(合計)6.73s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)5.50s
応答時間(最大)15.42s
応答時間(合計)16.50s
-
汎用知能
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)683ms
応答時間(最大)691ms
応答時間(合計)1.37s
-
パズル解決
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 API エラー: 1
応答時間(平均)891ms
応答時間(最大)1.21s
応答時間(合計)1.78s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.54s
応答時間(最大)7.54s
応答時間(合計)7.54s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #122#122 |
GLM 4.7 Flashnone
|
5.5… |
Z.ai |
$0.004
…
|
2.86s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13 指示に従っていない: 1 無効なツール呼び出し: 1
応答時間(平均)2.86s
応答時間(最大)7.05s
応答時間(合計)40.04s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 15
- 試行ごとの合格率
- 36.5%
- 入力トークン
- 38,745
- 出力トークン
- 2,521
- 推論トークン
- 0
- 応答時間(平均)
- 2.86s
- 応答時間(合計)
- 40.04s
- 応答時間(最大)
- 7.05s
-
反AIトリック
: 5.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)5.51s
応答時間(最大)6.59s
応答時間(合計)11.02s
-
コーディング
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)2.54s
応答時間(最大)5.57s
応答時間(合計)7.62s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)3.22s
応答時間(最大)3.22s
応答時間(合計)3.22s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.82s
応答時間(最大)4.82s
応答時間(合計)4.82s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)744ms
応答時間(最大)744ms
応答時間(合計)744ms
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.59s
応答時間(最大)1.59s
応答時間(合計)1.59s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)888ms
応答時間(最大)888ms
応答時間(合計)888ms
-
パズル解決
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)1.20s
応答時間(最大)1.27s
応答時間(合計)2.39s
-
ツール呼び出し
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)7.05s
応答時間(最大)7.05s
応答時間(合計)7.05s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)692ms
応答時間(最大)692ms
応答時間(合計)692ms
|
| #88#88 |
Qwen3.7 Plusnone
|
6.4… |
Qwen |
$0.028
…
|
2.85s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 10 指示に従っていない: 1
応答時間(平均)2.85s
応答時間(最大)29.38s
応答時間(合計)59.86s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 11
- 試行ごとの合格率
- 47.6%
- 入力トークン
- 42,510
- 出力トークン
- 6,578
- 推論トークン
- 0
- 応答時間(平均)
- 2.85s
- 応答時間(合計)
- 59.86s
- 応答時間(最大)
- 29.38s
-
反AIトリック
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.38s
応答時間(最大)2.69s
応答時間(合計)5.51s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)2.15s
応答時間(最大)4.39s
応答時間(合計)6.44s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)29.38s
応答時間(最大)29.38s
応答時間(合計)29.38s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.43s
応答時間(最大)1.57s
応答時間(合計)2.86s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)868ms
応答時間(最大)1.02s
応答時間(合計)2.60s
-
汎用知能
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.33s
応答時間(最大)1.33s
応答時間(合計)1.33s
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)929ms
応答時間(最大)1.05s
応答時間(合計)1.86s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.71s
応答時間(最大)2.65s
応答時間(合計)5.13s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.54s
応答時間(最大)3.54s
応答時間(合計)3.54s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.21s
応答時間(最大)1.21s
応答時間(合計)1.21s
|
| #134#134 |
GLM 5 Turbonone
|
5.2… |
Z.ai |
$0.047
↑
…
|
2.82s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13 指示に従っていない: 2
応答時間(平均)2.82s
応答時間(最大)8.21s
応答時間(合計)59.29s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 15
- 試行ごとの合格率
- 31.8%
- 入力トークン
- 32,525
- 出力トークン
- 1,815
- 推論トークン
- 0
- 応答時間(平均)
- 2.82s
- 応答時間(合計)
- 59.29s
- 応答時間(最大)
- 8.21s
-
反AIトリック
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)2.84s
応答時間(最大)4.15s
応答時間(合計)11.35s
-
コーディング
: 3.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)2.41s
応答時間(最大)3.93s
応答時間(合計)7.22s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.89s
応答時間(最大)4.89s
応答時間(合計)4.89s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.47s
応答時間(最大)2.48s
応答時間(合計)4.95s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.97s
応答時間(最大)2.65s
応答時間(合計)5.92s
-
汎用知能
: 4.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.18s
応答時間(最大)2.18s
応答時間(合計)2.18s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.13s
応答時間(最大)2.53s
応答時間(合計)4.27s
-
パズル解決
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)2.65s
応答時間(最大)3.34s
応答時間(合計)7.94s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.21s
応答時間(最大)8.21s
応答時間(合計)8.21s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.37s
応答時間(最大)2.37s
応答時間(合計)2.37s
|
| #50#50 |
Gemini 3.1 Flash Lite Previewlow
|
7.4… |
Google |
$0.026
…
|
2.77s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 7 指示に従っていない: 1
応答時間(平均)2.77s
応答時間(最大)11.91s
応答時間(合計)58.12s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 61.9%
- 入力トークン
- 32,715
- 出力トークン
- 2,286
- 推論トークン
- 9,166
- 応答時間(平均)
- 2.77s
- 応答時間(合計)
- 58.12s
- 応答時間(最大)
- 11.91s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.12s
応答時間(最大)3.18s
応答時間(合計)8.50s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.39s
応答時間(最大)2.20s
応答時間(合計)4.16s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)11.91s
応答時間(最大)11.91s
応答時間(合計)11.91s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.00s
応答時間(最大)3.74s
応答時間(合計)5.99s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)2.36s
応答時間(最大)3.51s
応答時間(合計)7.07s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.54s
応答時間(最大)1.54s
応答時間(合計)1.54s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.49s
応答時間(最大)1.66s
応答時間(合計)2.99s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.69s
応答時間(最大)1.89s
応答時間(合計)5.08s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.54s
応答時間(最大)9.54s
応答時間(合計)9.54s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.35s
応答時間(最大)1.35s
応答時間(合計)1.35s
|
| #152#152 |
MiMo-V2-Flashnone
|
4.6… |
Xiaomi |
$0.025
↑
…
|
2.76s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13 指示に従っていない: 2 API エラー: 1 余分な書式: 1
応答時間(平均)2.76s
応答時間(最大)19.68s
応答時間(合計)46.99s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 17
- 試行ごとの合格率
- 25.4%
- 入力トークン
- 36,851
- 出力トークン
- 68,882
- 推論トークン
- 0
- 応答時間(平均)
- 2.76s
- 応答時間(合計)
- 46.99s
- 応答時間(最大)
- 19.68s
-
反AIトリック
: 3.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)1.19s
応答時間(最大)2.73s
応答時間(合計)4.76s
-
コーディング
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)2.64s
応答時間(最大)3.84s
応答時間(合計)7.92s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.87s
応答時間(最大)2.87s
応答時間(合計)2.87s
-
データ解析と抽出
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 余分な書式: 1
応答時間(平均)19.68s
応答時間(最大)19.68s
応答時間(合計)19.68s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)564ms
応答時間(最大)564ms
応答時間(合計)564ms
-
汎用知能
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.67s
応答時間(最大)1.67s
応答時間(合計)1.67s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)857ms
応答時間(最大)955ms
応答時間(合計)1.71s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.86s
応答時間(最大)2.70s
応答時間(合計)3.71s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.28s
応答時間(最大)2.28s
応答時間(合計)2.28s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.82s
応答時間(最大)1.82s
応答時間(合計)1.82s
|
| #110#110 |
Seed-2.0-Litenone
|
5.8… |
Bytedance Seed |
$0.019
…
|
2.49s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13
応答時間(平均)2.49s
応答時間(最大)6.70s
応答時間(合計)52.26s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 13
- 試行ごとの合格率
- 46.0%
- 入力トークン
- 46,573
- 出力トークン
- 3,259
- 推論トークン
- 0
- 応答時間(平均)
- 2.49s
- 応答時間(合計)
- 52.26s
- 応答時間(最大)
- 6.70s
-
反AIトリック
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)2.43s
応答時間(最大)6.70s
応答時間(合計)9.73s
-
コーディング
: 5.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)2.83s
応答時間(最大)4.61s
応答時間(合計)8.49s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.59s
応答時間(最大)6.59s
応答時間(合計)6.59s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.82s
応答時間(最大)1.97s
応答時間(合計)3.63s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.33s
応答時間(最大)1.53s
応答時間(合計)4.00s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.45s
応答時間(最大)3.45s
応答時間(合計)3.45s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.06s
応答時間(最大)1.09s
応答時間(合計)2.12s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)2.78s
応答時間(最大)5.20s
応答時間(合計)8.34s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.94s
応答時間(最大)3.94s
応答時間(合計)3.94s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.96s
応答時間(最大)1.96s
応答時間(合計)1.96s
|
| #101#101 |
Mimo V2 Omninone
|
6.0… |
Xiaomi |
$0.021
↓
…
|
2.44s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 10 API エラー: 1 余分な書式: 1 指示に従っていない: 1
応答時間(平均)2.44s
応答時間(最大)6.81s
応答時間(合計)48.81s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 13
- 試行ごとの合格率
- 39.7%
- 入力トークン
- 40,852
- 出力トークン
- 3,314
- 推論トークン
- 0
- 応答時間(平均)
- 2.44s
- 応答時間(合計)
- 48.81s
- 応答時間(最大)
- 6.81s
-
反AIトリック
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 1
応答時間(平均)1.63s
応答時間(最大)3.29s
応答時間(合計)6.52s
-
コーディング
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 余分な書式: 1 不正解: 1
応答時間(平均)2.75s
応答時間(最大)3.79s
応答時間(合計)5.50s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)5.96s
応答時間(最大)5.96s
応答時間(合計)5.96s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.76s
応答時間(最大)2.60s
応答時間(合計)3.51s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)2.10s
応答時間(最大)3.58s
応答時間(合計)6.30s
-
汎用知能
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.33s
応答時間(最大)2.33s
応答時間(合計)2.33s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.26s
応答時間(最大)6.81s
応答時間(合計)8.51s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.16s
応答時間(最大)1.55s
応答時間(合計)3.48s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.40s
応答時間(最大)5.40s
応答時間(合計)5.40s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.30s
応答時間(最大)1.30s
応答時間(合計)1.30s
|
| #95#95 |
Qwen3.5 Plus 2026-02-15none
|
6.3… |
Qwen |
$0.016
↓
…
|
2.31s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 12
応答時間(平均)2.31s
応答時間(最大)6.65s
応答時間(合計)34.63s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 12
- 試行ごとの合格率
- 46.0%
- 入力トークン
- 45,864
- 出力トークン
- 2,480
- 推論トークン
- 0
- 応答時間(平均)
- 2.31s
- 応答時間(合計)
- 34.63s
- 応答時間(最大)
- 6.65s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.91s
応答時間(最大)2.74s
応答時間(合計)3.82s
-
コーディング
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)2.05s
応答時間(最大)3.63s
応答時間(合計)6.15s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.65s
応答時間(最大)6.65s
応答時間(合計)6.65s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.89s
応答時間(最大)1.89s
応答時間(合計)1.89s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.17s
応答時間(最大)1.44s
応答時間(合計)2.33s
-
汎用知能
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.26s
応答時間(最大)2.26s
応答時間(合計)2.26s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.67s
応答時間(最大)1.67s
応答時間(合計)1.67s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.71s
応答時間(最大)3.29s
応答時間(合計)5.41s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.33s
応答時間(最大)3.33s
応答時間(合計)3.33s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.11s
応答時間(最大)1.11s
応答時間(合計)1.11s
|
| #120#120 |
Mimo V2 PROnone
|
5.6… |
Xiaomi |
$0.045
↓
…
|
2.27s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 11 指示に従っていない: 2 API エラー: 1
応答時間(平均)2.27s
応答時間(最大)6.58s
応答時間(合計)45.50s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 14
- 試行ごとの合格率
- 41.3%
- 入力トークン
- 39,344
- 出力トークン
- 2,352
- 推論トークン
- 0
- 応答時間(平均)
- 2.27s
- 応答時間(合計)
- 45.50s
- 応答時間(最大)
- 6.58s
-
反AIトリック
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)1.80s
応答時間(最大)2.62s
応答時間(合計)7.19s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)2.65s
応答時間(最大)3.82s
応答時間(合計)5.30s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.58s
応答時間(最大)6.58s
応答時間(合計)6.58s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.39s
応答時間(最大)1.42s
応答時間(合計)2.78s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.78s
応答時間(最大)2.49s
応答時間(合計)5.34s
-
汎用知能
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.44s
応答時間(最大)2.44s
応答時間(合計)2.44s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.51s
応答時間(最大)2.95s
応答時間(合計)5.02s
-
パズル解決
: 6.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)1.61s
応答時間(最大)2.15s
応答時間(合計)4.83s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.39s
応答時間(最大)4.39s
応答時間(合計)4.39s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.63s
応答時間(最大)1.63s
応答時間(合計)1.63s
|
| #104#104 |
Nemotron 3 Ultra 550b A55bnone
|
6.0… |
NVIDIA |
$0.000
…
|
2.27s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 12 指示に従っていない: 1
応答時間(平均)2.27s
応答時間(最大)13.49s
応答時間(合計)47.65s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 13
- 試行ごとの合格率
- 44.4%
- 入力トークン
- 43,326
- 出力トークン
- 2,138
- 推論トークン
- 0
- 応答時間(平均)
- 2.27s
- 応答時間(合計)
- 47.65s
- 応答時間(最大)
- 13.49s
-
反AIトリック
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)2.35s
応答時間(最大)6.55s
応答時間(合計)9.42s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.02s
応答時間(最大)1.83s
応答時間(合計)3.07s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.79s
応答時間(最大)4.79s
応答時間(合計)4.79s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.94s
応答時間(最大)2.86s
応答時間(合計)3.89s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)698ms
応答時間(最大)1.00s
応答時間(合計)2.09s
-
汎用知能
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)13.49s
応答時間(最大)13.49s
応答時間(合計)13.49s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.46s
応答時間(最大)1.72s
応答時間(合計)2.92s
-
パズル解決
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)1.06s
応答時間(最大)1.53s
応答時間(合計)3.17s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.99s
応答時間(最大)2.99s
応答時間(合計)2.99s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.83s
応答時間(最大)1.83s
応答時間(合計)1.83s
|
| #81#81 |
Mercury 2medium
|
6.6… |
Inception |
$0.058
…
|
2.24s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 8 指示に従っていない: 3
応答時間(平均)2.24s
応答時間(最大)14.63s
応答時間(合計)44.72s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 11
- 試行ごとの合格率
- 54.0%
- 入力トークン
- 35,116
- 出力トークン
- 4,048
- 推論トークン
- 61,219
- 応答時間(平均)
- 2.24s
- 応答時間(合計)
- 44.72s
- 応答時間(最大)
- 14.63s
-
反AIトリック
: 6.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)1.12s
応答時間(最大)2.46s
応答時間(合計)4.49s
-
コーディング
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.04s
応答時間(最大)3.06s
応答時間(合計)6.11s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.28s
応答時間(最大)3.28s
応答時間(合計)3.28s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.11s
応答時間(最大)1.47s
応答時間(合計)2.21s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)6.48s
応答時間(最大)14.63s
応答時間(合計)19.43s
-
汎用知能
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)821ms
応答時間(最大)821ms
応答時間(合計)821ms
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.07s
応答時間(最大)1.07s
応答時間(合計)1.07s
-
パズル解決
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)949ms
応答時間(最大)1.18s
応答時間(合計)2.85s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.89s
応答時間(最大)1.89s
応答時間(合計)1.89s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.58s
応答時間(最大)2.58s
応答時間(合計)2.58s
|
| #143#143 |
MiMo-V2.5none
|
4.9… |
Xiaomi |
$0.007
↓
…
|
2.20s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 14 余分な書式: 1 指示に従っていない: 1
応答時間(平均)2.20s
応答時間(最大)6.86s
応答時間(合計)46.21s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 16
- 試行ごとの合格率
- 27.0%
- 入力トークン
- 41,985
- 出力トークン
- 2,267
- 推論トークン
- 0
- 応答時間(平均)
- 2.20s
- 応答時間(合計)
- 46.21s
- 応答時間(最大)
- 6.86s
-
反AIトリック
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)2.19s
応答時間(最大)6.85s
応答時間(合計)8.74s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)3.24s
応答時間(最大)5.52s
応答時間(合計)9.72s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.36s
応答時間(最大)2.36s
応答時間(合計)2.36s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)1.01s
応答時間(最大)1.18s
応答時間(合計)2.03s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)756ms
応答時間(最大)877ms
応答時間(合計)2.27s
-
汎用知能
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.86s
応答時間(最大)6.86s
応答時間(合計)6.86s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)751ms
応答時間(最大)821ms
応答時間(合計)1.50s
-
パズル解決
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)2.13s
応答時間(最大)5.18s
応答時間(合計)6.40s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.43s
応答時間(最大)2.43s
応答時間(合計)2.43s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.89s
応答時間(最大)3.89s
応答時間(合計)3.89s
|
| #154#154 |
Qwen3.5-9Bnone
|
4.6… |
Qwen |
$0.003
↓
…
|
1.89s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 14 指示に従っていない: 2 無効なツール呼び出し: 1
応答時間(平均)1.89s
応答時間(最大)6.03s
応答時間(合計)39.68s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 17
- 試行ごとの合格率
- 20.6%
- 入力トークン
- 48,041
- 出力トークン
- 3,952
- 推論トークン
- 0
- 応答時間(平均)
- 1.89s
- 応答時間(合計)
- 39.68s
- 応答時間(最大)
- 6.03s
-
反AIトリック
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)1.71s
応答時間(最大)3.79s
応答時間(合計)6.84s
-
コーディング
: 3.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)5.60s
応答時間(最大)6.03s
応答時間(合計)16.81s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)5.91s
応答時間(最大)5.91s
応答時間(合計)5.91s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)847ms
応答時間(最大)1.09s
応答時間(合計)1.69s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)464ms
応答時間(最大)622ms
応答時間(合計)1.39s
-
汎用知能
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)552ms
応答時間(最大)552ms
応答時間(合計)552ms
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)514ms
応答時間(最大)582ms
応答時間(合計)1.03s
-
パズル解決
: 3.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)621ms
応答時間(最大)759ms
応答時間(合計)1.86s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.27s
応答時間(最大)1.27s
応答時間(合計)1.27s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.32s
応答時間(最大)2.32s
応答時間(合計)2.32s
|
| #91#91 |
GPT-5.5none
|
6.4… |
OpenAI |
$0.231
…
|
1.89s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 11
応答時間(平均)1.89s
応答時間(最大)5.56s
応答時間(合計)39.64s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 11
- 試行ごとの合格率
- 54.0%
- 入力トークン
- 34,212
- 出力トークン
- 1,971
- 推論トークン
- 0
- 応答時間(平均)
- 1.89s
- 応答時間(合計)
- 39.64s
- 応答時間(最大)
- 5.56s
-
反AIトリック
: 6.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.31s
応答時間(最大)2.08s
応答時間(合計)5.25s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.35s
応答時間(最大)2.05s
応答時間(合計)4.05s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)5.56s
応答時間(最大)5.56s
応答時間(合計)5.56s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.18s
応答時間(最大)1.24s
応答時間(合計)2.37s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.31s
応答時間(最大)1.39s
応答時間(合計)3.92s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.41s
応答時間(最大)3.41s
応答時間(合計)3.41s
-
指示追従
: 6.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.15s
応答時間(最大)1.19s
応答時間(合計)2.31s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.29s
応答時間(最大)1.56s
応答時間(合計)3.87s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.90s
応答時間(最大)3.90s
応答時間(合計)3.90s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)5.01s
応答時間(最大)5.01s
応答時間(合計)5.01s
|
| #61#61 |
Gemini 3.1 Flash Litelow
|
7.2… |
Google |
$0.028
…
|
1.89s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9
応答時間(平均)1.89s
応答時間(最大)5.66s
応答時間(合計)39.62s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 61.9%
- 入力トークン
- 36,892
- 出力トークン
- 2,732
- 推論トークン
- 9,260
- 応答時間(平均)
- 1.89s
- 応答時間(合計)
- 39.62s
- 応答時間(最大)
- 5.66s
-
反AIトリック
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.84s
応答時間(最大)3.08s
応答時間(合計)7.37s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.53s
応答時間(最大)1.97s
応答時間(合計)4.58s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.48s
応答時間(最大)4.48s
応答時間(合計)4.48s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.44s
応答時間(最大)1.51s
応答時間(合計)2.89s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.52s
応答時間(最大)1.63s
応答時間(合計)4.57s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.37s
応答時間(最大)1.37s
応答時間(合計)1.37s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.52s
応答時間(最大)1.68s
応答時間(合計)3.04s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.40s
応答時間(最大)1.41s
応答時間(合計)4.20s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.66s
応答時間(最大)5.66s
応答時間(合計)5.66s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.46s
応答時間(最大)1.46s
応答時間(合計)1.46s
|
| #123#123 |
MiMo-V2.5-Pronone
|
5.5… |
Xiaomi |
$0.017
↓
…
|
1.78s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 11 指示に従っていない: 4
応答時間(平均)1.78s
応答時間(最大)8.32s
応答時間(合計)37.42s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 15
- 試行ごとの合格率
- 39.7%
- 入力トークン
- 30,724
- 出力トークン
- 3,043
- 推論トークン
- 0
- 応答時間(平均)
- 1.78s
- 応答時間(合計)
- 37.42s
- 応答時間(最大)
- 8.32s
-
反AIトリック
: 3.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 1
応答時間(平均)2.67s
応答時間(最大)8.32s
応答時間(合計)10.67s
-
コーディング
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)1.41s
応答時間(最大)2.39s
応答時間(合計)4.23s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)3.54s
応答時間(最大)3.54s
応答時間(合計)3.54s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.32s
応答時間(最大)1.42s
応答時間(合計)2.64s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)877ms
応答時間(最大)904ms
応答時間(合計)2.63s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.58s
応答時間(最大)2.58s
応答時間(合計)2.58s
-
指示追従
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.03s
応答時間(最大)1.10s
応答時間(合計)2.06s
-
パズル解決
: 6.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)1.30s
応答時間(最大)1.61s
応答時間(合計)3.90s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.30s
応答時間(最大)3.30s
応答時間(合計)3.30s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.89s
応答時間(最大)1.89s
応答時間(合計)1.89s
|
| #147#147 |
GPT-4o-mininone
|
4.8… |
OpenAI |
$0.006
…
|
1.77s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 15 指示に従っていない: 1
応答時間(平均)1.77s
応答時間(最大)7.58s
応答時間(合計)24.80s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 16
- 試行ごとの合格率
- 23.8%
- 入力トークン
- 31,518
- 出力トークン
- 1,982
- 推論トークン
- 0
- 応答時間(平均)
- 1.77s
- 応答時間(合計)
- 24.80s
- 応答時間(最大)
- 7.58s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.34s
応答時間(最大)1.83s
応答時間(合計)2.67s
-
コーディング
: 3.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.63s
応答時間(最大)2.55s
応答時間(合計)4.90s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)7.58s
応答時間(最大)7.58s
応答時間(合計)7.58s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.27s
応答時間(最大)1.27s
応答時間(合計)1.27s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)637ms
応答時間(最大)637ms
応答時間(合計)637ms
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)909ms
応答時間(最大)909ms
応答時間(合計)909ms
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.11s
応答時間(最大)1.11s
応答時間(合計)1.11s
-
パズル解決
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)1.21s
応答時間(最大)1.37s
応答時間(合計)2.42s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.51s
応答時間(最大)2.51s
応答時間(合計)2.51s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)794ms
応答時間(最大)794ms
応答時間(合計)794ms
|
| #115#115 |
Qwen3.5-27Bnone
|
5.7… |
Qwen |
$0.015
↓
…
|
1.68s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 12 指示に従っていない: 2
応答時間(平均)1.68s
応答時間(最大)9.39s
応答時間(合計)35.25s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 14
- 試行ごとの合格率
- 38.1%
- 入力トークン
- 44,478
- 出力トークン
- 3,592
- 推論トークン
- 0
- 応答時間(平均)
- 1.68s
- 応答時間(合計)
- 35.25s
- 応答時間(最大)
- 9.39s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)788ms
応答時間(最大)1.34s
応答時間(合計)3.15s
-
コーディング
: 5.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.80s
応答時間(最大)2.51s
応答時間(合計)5.40s
-
複合
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)9.39s
応答時間(最大)9.39s
応答時間(合計)9.39s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.43s
応答時間(最大)1.45s
応答時間(合計)2.86s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)540ms
応答時間(最大)649ms
応答時間(合計)1.62s
-
汎用知能
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.51s
応答時間(最大)2.51s
応答時間(合計)2.51s
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.03s
応答時間(最大)1.40s
応答時間(合計)2.06s
-
パズル解決
: 6.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)1.38s
応答時間(最大)2.24s
応答時間(合計)4.13s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.54s
応答時間(最大)3.54s
応答時間(合計)3.54s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)599ms
応答時間(最大)599ms
応答時間(合計)599ms
|
| #48#48 |
Gemini 3 Flash Previewnone
|
7.4… |
Google |
$0.025
…
|
1.65s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 8
応答時間(平均)1.65s
応答時間(最大)3.56s
応答時間(合計)23.07s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 66.7%
- 入力トークン
- 37,011
- 出力トークン
- 1,885
- 推論トークン
- 0
- 応答時間(平均)
- 1.65s
- 応答時間(合計)
- 23.07s
- 応答時間(最大)
- 3.56s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.25s
応答時間(最大)1.59s
応答時間(合計)2.49s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.80s
応答時間(最大)2.79s
応答時間(合計)5.40s
-
複合
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.56s
応答時間(最大)3.56s
応答時間(合計)3.56s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.41s
応答時間(最大)1.41s
応答時間(合計)1.41s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)963ms
応答時間(最大)963ms
応答時間(合計)963ms
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.13s
応答時間(最大)1.13s
応答時間(合計)1.13s
-
指示追従
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.58s
応答時間(最大)1.58s
応答時間(合計)1.58s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.05s
応答時間(最大)1.06s
応答時間(合計)2.11s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.35s
応答時間(最大)3.35s
応答時間(合計)3.35s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.07s
応答時間(最大)1.07s
応答時間(合計)1.07s
|
| #157#157 |
Grok 4.1 Fastnoneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
4.4… |
X AI |
$0.008
↓
…
|
1.62s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13 指示に従っていない: 3
応答時間(平均)1.62s
応答時間(最大)5.51s
応答時間(合計)19.48s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 16
- 試行ごとの合格率
- 22.8%
- 入力トークン
- 36,608
- 出力トークン
- 1,723
- 推論トークン
- 0
- 応答時間(平均)
- 1.62s
- 応答時間(合計)
- 19.48s
- 応答時間(最大)
- 5.51s
-
反AIトリック
: 3.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 1
応答時間(平均)1.07s
応答時間(最大)1.73s
応答時間(合計)2.15s
-
コーディング
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.79s
応答時間(最大)1.79s
応答時間(合計)1.79s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.33s
応答時間(最大)3.33s
応答時間(合計)3.33s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)943ms
応答時間(最大)943ms
応答時間(合計)943ms
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.06s
応答時間(最大)1.06s
応答時間(合計)1.06s
-
汎用知能
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.08s
応答時間(最大)1.08s
応答時間(合計)1.08s
-
指示追従
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)685ms
応答時間(最大)685ms
応答時間(合計)685ms
-
パズル解決
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.10s
応答時間(最大)1.36s
応答時間(合計)2.21s
-
ツール呼び出し
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)5.51s
応答時間(最大)5.51s
応答時間(合計)5.51s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)731ms
応答時間(最大)731ms
応答時間(合計)731ms
|
| #128#128 |
Qwen3.6 Flashnone
|
5.4… |
Qwen |
$0.015
↓
…
|
1.60s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 12 指示に従っていない: 1 無効なツール呼び出し: 1
応答時間(平均)1.60s
応答時間(最大)4.60s
応答時間(合計)33.59s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 14
- 試行ごとの合格率
- 33.3%
- 入力トークン
- 50,810
- 出力トークン
- 4,164
- 推論トークン
- 0
- 応答時間(平均)
- 1.60s
- 応答時間(合計)
- 33.59s
- 応答時間(最大)
- 4.60s
-
反AIトリック
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)1.63s
応答時間(最大)4.60s
応答時間(合計)6.51s
-
コーディング
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.79s
応答時間(最大)2.46s
応答時間(合計)5.36s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)4.22s
応答時間(最大)4.22s
応答時間(合計)4.22s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.13s
応答時間(最大)3.35s
応答時間(合計)4.26s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.11s
応答時間(最大)1.89s
応答時間(合計)3.32s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)947ms
応答時間(最大)947ms
応答時間(合計)947ms
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.10s
応答時間(最大)1.36s
応答時間(合計)2.19s
-
パズル解決
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)1.21s
応答時間(最大)1.80s
応答時間(合計)3.64s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.49s
応答時間(最大)2.49s
応答時間(合計)2.49s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)649ms
応答時間(最大)649ms
応答時間(合計)649ms
|
| #32#32 |
Gemini 3.5 Flashminimal
|
7.7… |
Google |
$0.108
…
|
1.57s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 1 無効なツール呼び出し: 1
応答時間(平均)1.57s
応答時間(最大)5.51s
応答時間(合計)33.02s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 68.3%
- 入力トークン
- 39,847
- 出力トークン
- 5,277
- 推論トークン
- 0
- 応答時間(平均)
- 1.57s
- 応答時間(合計)
- 33.02s
- 応答時間(最大)
- 5.51s
-
反AIトリック
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)892ms
応答時間(最大)1.38s
応答時間(合計)3.57s
-
コーディング
: 5.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)2.75s
応答時間(最大)5.51s
応答時間(合計)8.26s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)3.56s
応答時間(最大)3.56s
応答時間(合計)3.56s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.66s
応答時間(最大)2.11s
応答時間(合計)3.32s
-
ドメイン特化
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)899ms
応答時間(最大)1.04s
応答時間(合計)2.70s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)922ms
応答時間(最大)922ms
応答時間(合計)922ms
-
指示追従
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)893ms
応答時間(最大)964ms
応答時間(合計)1.79s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.45s
応答時間(最大)2.30s
応答時間(合計)4.36s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.79s
応答時間(最大)2.79s
応答時間(合計)2.79s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.76s
応答時間(最大)1.76s
応答時間(合計)1.76s
|
| #148#148 |
GPT-5.4 Nanonone
|
4.7… |
OpenAI |
$0.011
…
|
1.48s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 15 指示に従っていない: 2
応答時間(平均)1.48s
応答時間(最大)4.47s
応答時間(合計)31.01s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 17
- 試行ごとの合格率
- 30.2%
- 入力トークン
- 34,212
- 出力トークン
- 2,784
- 推論トークン
- 0
- 応答時間(平均)
- 1.48s
- 応答時間(合計)
- 31.01s
- 応答時間(最大)
- 4.47s
-
反AIトリック
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)1.18s
応答時間(最大)1.81s
応答時間(合計)4.70s
-
コーディング
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)2.22s
応答時間(最大)4.47s
応答時間(合計)6.65s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.84s
応答時間(最大)3.84s
応答時間(合計)3.84s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.11s
応答時間(最大)1.25s
応答時間(合計)2.23s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)926ms
応答時間(最大)959ms
応答時間(合計)2.78s
-
汎用知能
: 3.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.31s
応答時間(最大)1.31s
応答時間(合計)1.31s
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)784ms
応答時間(最大)859ms
応答時間(合計)1.57s
-
パズル解決
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)1.25s
応答時間(最大)1.53s
応答時間(合計)3.76s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.40s
応答時間(最大)3.40s
応答時間(合計)3.40s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)773ms
応答時間(最大)773ms
応答時間(合計)773ms
|
| #125#125 |
GPT-5.4none
|
5.5… |
OpenAI |
$0.122
…
|
1.42s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13 指示に従っていない: 1
応答時間(平均)1.42s
応答時間(最大)2.95s
応答時間(合計)29.87s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 14
- 試行ごとの合格率
- 36.5%
- 入力トークン
- 34,212
- 出力トークン
- 2,417
- 推論トークン
- 0
- 応答時間(平均)
- 1.42s
- 応答時間(合計)
- 29.87s
- 応答時間(最大)
- 2.95s
-
反AIトリック
: 3.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)1.21s
応答時間(最大)2.58s
応答時間(合計)4.85s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.62s
応答時間(最大)2.95s
応答時間(合計)4.85s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.89s
応答時間(最大)2.89s
応答時間(合計)2.89s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.04s
応答時間(最大)1.06s
応答時間(合計)2.08s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.07s
応答時間(最大)1.54s
応答時間(合計)3.22s
-
汎用知能
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.78s
応答時間(最大)1.78s
応答時間(合計)1.78s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.07s
応答時間(最大)1.17s
応答時間(合計)2.15s
-
パズル解決
: 5.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)1.44s
応答時間(最大)1.82s
応答時間(合計)4.33s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.75s
応答時間(最大)2.75s
応答時間(合計)2.75s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)990ms
応答時間(最大)990ms
応答時間(合計)990ms
|
| #87#87 |
Gemini 3.1 Flash Liteminimal
|
6.4… |
Google |
$0.013
…
|
1.33s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 8 指示に従っていない: 3
応答時間(平均)1.33s
応答時間(最大)4.49s
応答時間(合計)27.91s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 11
- 試行ごとの合格率
- 54.0%
- 入力トークン
- 36,973
- 出力トークン
- 2,487
- 推論トークン
- 0
- 応答時間(平均)
- 1.33s
- 応答時間(合計)
- 27.91s
- 応答時間(最大)
- 4.49s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.10s
応答時間(最大)1.65s
応答時間(合計)4.42s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)831ms
応答時間(最大)1.31s
応答時間(合計)2.49s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.53s
応答時間(最大)2.53s
応答時間(合計)2.53s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.04s
応答時間(最大)1.32s
応答時間(合計)2.07s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.02s
応答時間(最大)1.16s
応答時間(合計)3.06s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)791ms
応答時間(最大)791ms
応答時間(合計)791ms
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)932ms
応答時間(最大)1.00s
応答時間(合計)1.86s
-
パズル解決
: 6.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2
応答時間(平均)2.15s
応答時間(最大)4.49s
応答時間(合計)6.45s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.51s
応答時間(最大)3.51s
応答時間(合計)3.51s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)724ms
応答時間(最大)724ms
応答時間(合計)724ms
|
| #34#34 |
Qwen3.7 Maxnone
|
7.7… |
Qwen |
$0.054
↓
…
|
1.30s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 7
応答時間(平均)1.30s
応答時間(最大)3.92s
応答時間(合計)27.21s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 66.7%
- 入力トークン
- 37,107
- 出力トークン
- 1,994
- 推論トークン
- 0
- 応答時間(平均)
- 1.30s
- 応答時間(合計)
- 27.21s
- 応答時間(最大)
- 3.92s
-
反AIトリック
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.08s
応答時間(最大)1.39s
応答時間(合計)4.30s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.35s
応答時間(最大)1.63s
応答時間(合計)4.04s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.17s
応答時間(最大)2.17s
応答時間(合計)2.17s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.35s
応答時間(最大)1.43s
応答時間(合計)2.69s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)975ms
応答時間(最大)1.08s
応答時間(合計)2.92s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.04s
応答時間(最大)1.04s
応答時間(合計)1.04s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)943ms
応答時間(最大)974ms
応答時間(合計)1.89s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.13s
応答時間(最大)1.29s
応答時間(合計)3.40s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.92s
応答時間(最大)3.92s
応答時間(合計)3.92s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)856ms
応答時間(最大)856ms
応答時間(合計)856ms
|
| #136#136 |
Elephant Alphamedium
|
5.1… |
Openrouter |
$0.000
…
|
1.27s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9 API エラー: 3 指示に従っていない: 2 無効なツール呼び出し: 1
応答時間(平均)1.27s
応答時間(最大)3.70s
応答時間(合計)22.82s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 15
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 30.2%
- 入力トークン
- 33,744
- 出力トークン
- 2,596
- 推論トークン
- 0
- 応答時間(平均)
- 1.27s
- 応答時間(合計)
- 22.82s
- 応答時間(最大)
- 3.70s
-
反AIトリック
: 6.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.19s
応答時間(最大)2.04s
応答時間(合計)4.75s
-
コーディング
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 2 不正解: 1
応答時間(平均)1.30s
応答時間(最大)1.30s
応答時間(合計)1.30s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.70s
応答時間(最大)3.70s
応答時間(合計)3.70s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)979ms
応答時間(最大)1.02s
応答時間(合計)1.96s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)925ms
応答時間(最大)1.16s
応答時間(合計)2.77s
-
汎用知能
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)920ms
応答時間(最大)920ms
応答時間(合計)920ms
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)987ms
応答時間(最大)1.13s
応答時間(合計)1.97s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)868ms
応答時間(最大)972ms
応答時間(合計)2.60s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)2.83s
応答時間(最大)2.83s
応答時間(合計)2.83s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|