| #31#31 |
Qwen3.5-122B-A10Bmedium
|
7.9… |
Qwen |
$0.561… |
32.51s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 タイムアウト: 2
応答時間(平均)32.51s
応答時間(最大)119.29s
応答時間(合計)617.70s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 6
- 試行ごとの合格率
- 75.4%
- 出力トークン
- 18,457
- 推論トークン
- 177,734
- 応答時間(平均)
- 32.51s
- 応答時間(合計)
- 617.70s
- 応答時間(最大)
- 119.29s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.75s
応答時間(最大)18.03s
応答時間(合計)39.01s
-
コーディング
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)70.98s
応答時間(最大)70.98s
応答時間(合計)70.98s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)107.79s
応答時間(最大)107.79s
応答時間(合計)107.79s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.41s
応答時間(最大)29.79s
応答時間(合計)46.83s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)63.40s
応答時間(最大)119.29s
応答時間(合計)190.20s
-
汎用知能
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)34.11s
応答時間(最大)34.11s
応答時間(合計)34.11s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.88s
応答時間(最大)15.44s
応答時間(合計)19.76s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.18s
応答時間(最大)31.99s
応答時間(合計)51.55s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.60s
応答時間(最大)4.60s
応答時間(合計)4.60s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)52.87s
応答時間(最大)52.87s
応答時間(合計)52.87s
|
| #32#32 |
MiMo-V2.5medium
|
7.8… |
Xiaomi |
$0.253… |
14.40s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 2 不正解: 2 指示に従っていない: 1 回答なし: 1
応答時間(平均)14.40s
応答時間(最大)86.93s
応答時間(合計)259.20s
…
|
- 合計テスト数
- 18
- 誤答テスト数
- 6
- 試行ごとの合格率
- 75.9%
- 出力トークン
- 2,821
- 推論トークン
- 116,207
- 応答時間(平均)
- 14.40s
- 応答時間(合計)
- 259.20s
- 応答時間(最大)
- 86.93s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.14s
応答時間(最大)12.41s
応答時間(合計)16.57s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)31.48s
応答時間(最大)31.48s
応答時間(合計)31.48s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)16.86s
応答時間(最大)16.86s
応答時間(合計)16.86s
-
データ解析と抽出
: 2.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)6.33s
応答時間(最大)7.45s
応答時間(合計)12.67s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)34.53s
応答時間(最大)86.93s
応答時間(合計)103.59s
-
汎用知能
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)5.37s
応答時間(最大)5.37s
応答時間(合計)5.37s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.80s
応答時間(最大)1.81s
応答時間(合計)3.60s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)20.60s
応答時間(最大)57.93s
応答時間(合計)61.79s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.29s
応答時間(最大)7.29s
応答時間(合計)7.29s
|
| #33#33 |
Qwen3.5 Plus 2026-04-20medium
|
7.8… |
Qwen |
$0.305… |
35.96s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6
応答時間(平均)35.96s
応答時間(最大)92.57s
応答時間(合計)683.23s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 6
- 試行ごとの合格率
- 73.7%
- 出力トークン
- 2,206
- 推論トークン
- 118,998
- 応答時間(平均)
- 35.96s
- 応答時間(合計)
- 683.23s
- 応答時間(最大)
- 92.57s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)10.84s
応答時間(最大)15.11s
応答時間(合計)43.36s
-
コーディング
: 7.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)85.72s
応答時間(最大)85.72s
応答時間(合計)85.72s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)92.41s
応答時間(最大)92.41s
応答時間(合計)92.41s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)38.32s
応答時間(最大)41.70s
応答時間(合計)76.63s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)53.10s
応答時間(最大)90.70s
応答時間(合計)159.30s
-
汎用知能
: 4.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)25.30s
応答時間(最大)25.30s
応答時間(合計)25.30s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)20.25s
応答時間(最大)21.65s
応答時間(合計)40.50s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)17.58s
応答時間(最大)24.83s
応答時間(合計)52.73s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.72s
応答時間(最大)14.72s
応答時間(合計)14.72s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)92.57s
応答時間(最大)92.57s
応答時間(合計)92.57s
|
| #34#34 |
Hy3 previewmediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
7.8… |
Tencent |
$0.000… |
16.03s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 API エラー: 1 指示に従っていない: 1
応答時間(平均)16.03s
応答時間(最大)46.04s
応答時間(合計)288.59s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 6
- 試行ごとの合格率
- 70.2%
- 出力トークン
- 72,551
- 推論トークン
- 0
- 応答時間(平均)
- 16.03s
- 応答時間(合計)
- 288.59s
- 応答時間(最大)
- 46.04s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.59s
応答時間(最大)10.20s
応答時間(合計)26.37s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)31.37s
応答時間(最大)31.37s
応答時間(合計)31.37s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)46.04s
応答時間(最大)46.04s
応答時間(合計)46.04s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)5.25s
応答時間(最大)5.25s
応答時間(合計)5.25s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)22.30s
応答時間(最大)30.51s
応答時間(合計)66.90s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)16.84s
応答時間(最大)16.84s
応答時間(合計)16.84s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.16s
応答時間(最大)7.72s
応答時間(合計)12.31s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)9.55s
応答時間(最大)14.35s
応答時間(合計)28.64s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.02s
応答時間(最大)15.02s
応答時間(合計)15.02s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)39.86s
応答時間(最大)39.86s
応答時間(合計)39.86s
|
| #35#35 |
Claude Sonnet 4.6medium
|
7.8… |
Anthropic |
$1.237… |
14.25s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 余分な書式: 2 タイムアウト: 1
応答時間(平均)14.25s
応答時間(最大)46.35s
応答時間(合計)156.71s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 6
- 試行ごとの合格率
- 70.2%
- 出力トークン
- 45,505
- 推論トークン
- 28,370
- 応答時間(平均)
- 14.25s
- 応答時間(合計)
- 156.71s
- 応答時間(最大)
- 46.35s
-
反AIトリック
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)2.98s
応答時間(最大)4.95s
応答時間(合計)5.97s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)35.76s
応答時間(最大)35.76s
応答時間(合計)35.76s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)46.35s
応答時間(最大)46.35s
応答時間(合計)46.35s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.90s
応答時間(最大)13.90s
応答時間(合計)13.90s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 タイムアウト: 1 不正解: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.94s
応答時間(最大)4.94s
応答時間(合計)4.94s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.61s
応答時間(最大)2.61s
応答時間(合計)2.61s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.80s
応答時間(最大)5.22s
応答時間(合計)9.60s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.48s
応答時間(最大)7.48s
応答時間(合計)7.48s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)30.09s
応答時間(最大)30.09s
応答時間(合計)30.09s
|
| #36#36 |
Step 3.5 Flashnoneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
7.8… |
Stepfun |
$0.020… |
39.03s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 指示に従っていない: 1 不正解: 1
応答時間(平均)39.03s
応答時間(最大)114.12s
応答時間(合計)312.26s
…
|
- 合計テスト数
- 12
- 誤答テスト数
- 3
- 試行ごとの合格率
- 66.7%
- 出力トークン
- 64,795
- 推論トークン
- 0
- 応答時間(平均)
- 39.03s
- 応答時間(合計)
- 312.26s
- 応答時間(最大)
- 114.12s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)34.99s
応答時間(最大)109.60s
応答時間(合計)139.95s
-
コーディング
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
複合
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
ドメイン特化
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)34.54s
応答時間(最大)34.54s
応答時間(合計)34.54s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)14.37s
応答時間(最大)14.37s
応答時間(合計)14.37s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.30s
応答時間(最大)9.30s
応答時間(合計)9.30s
-
ツール呼び出し
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)114.12s
応答時間(最大)114.12s
応答時間(合計)114.12s
|
| #37#37 |
MiMo-V2-Promedium
|
7.7… |
Xiaomi |
$0.212… |
16.18s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 余分な書式: 1 指示に従っていない: 1 タイムアウト: 1
応答時間(平均)16.18s
応答時間(最大)82.71s
応答時間(合計)307.48s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 7
- 試行ごとの合格率
- 77.2%
- 出力トークン
- 2,514
- 推論トークン
- 55,816
- 応答時間(平均)
- 16.18s
- 応答時間(合計)
- 307.48s
- 応答時間(最大)
- 82.71s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.86s
応答時間(最大)3.92s
応答時間(合計)11.45s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)52.12s
応答時間(最大)52.12s
応答時間(合計)52.12s
-
複合
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)64.71s
応答時間(最大)64.71s
応答時間(合計)64.71s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)17.20s
応答時間(最大)17.44s
応答時間(合計)34.40s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)8.82s
応答時間(最大)14.48s
応答時間(合計)26.47s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.92s
応答時間(最大)4.92s
応答時間(合計)4.92s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.36s
応答時間(最大)4.35s
応答時間(合計)6.72s
-
パズル解決
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 指示に従っていない: 1
応答時間(平均)5.26s
応答時間(最大)6.41s
応答時間(合計)15.78s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.19s
応答時間(最大)8.19s
応答時間(合計)8.19s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)82.71s
応答時間(最大)82.71s
応答時間(合計)82.71s
|
| #38#38 |
Gemma 4 26B A4Bmedium
|
7.7… |
Google |
$0.034… |
33.69s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 タイムアウト: 2
応答時間(平均)33.69s
応答時間(最大)180.87s
応答時間(合計)606.35s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 6
- 試行ごとの合格率
- 73.7%
- 出力トークン
- 16,725
- 推論トークン
- 61,536
- 応答時間(平均)
- 33.69s
- 応答時間(合計)
- 606.35s
- 応答時間(最大)
- 180.87s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.20s
応答時間(最大)9.64s
応答時間(合計)24.78s
-
コーディング
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)147.47s
応答時間(最大)147.47s
応答時間(合計)147.47s
-
複合
: 9.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)73.55s
応答時間(最大)73.55s
応答時間(合計)73.55s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)16.51s
応答時間(最大)20.57s
応答時間(合計)33.02s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)23.62s
応答時間(最大)27.00s
応答時間(合計)47.23s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)29.76s
応答時間(最大)29.76s
応答時間(合計)29.76s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.54s
応答時間(最大)21.25s
応答時間(合計)35.08s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)8.52s
応答時間(最大)12.73s
応答時間(合計)25.56s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.01s
応答時間(最大)9.01s
応答時間(合計)9.01s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)180.87s
応答時間(最大)180.87s
応答時間(合計)180.87s
|
| #39#39 |
Hy3 previewlowアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
7.7… |
Tencent |
$0.000… |
24.58s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 API エラー: 1
応答時間(平均)24.58s
応答時間(最大)78.74s
応答時間(合計)368.71s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 5
- 試行ごとの合格率
- 72.9%
- 出力トークン
- 63,155
- 推論トークン
- 0
- 応答時間(平均)
- 24.58s
- 応答時間(合計)
- 368.71s
- 応答時間(最大)
- 78.74s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.32s
応答時間(最大)12.36s
応答時間(合計)27.96s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)27.94s
応答時間(最大)27.94s
応答時間(合計)27.94s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)78.74s
応答時間(最大)78.74s
応答時間(合計)78.74s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)5.85s
応答時間(最大)5.85s
応答時間(合計)5.85s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)40.44s
応答時間(最大)46.32s
応答時間(合計)121.31s
-
汎用知能
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.98s
応答時間(最大)22.24s
応答時間(合計)31.97s
-
パズル解決
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)7.69s
応答時間(最大)8.22s
応答時間(合計)15.37s
-
ツール呼び出し
: 6.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.84s
応答時間(最大)17.84s
応答時間(合計)17.84s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)41.74s
応答時間(最大)41.74s
応答時間(合計)41.74s
|
| #40#40 |
Gemini 3.1 Flash Lite Previewnone
|
7.7… |
Google |
$0.016… |
1.28s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 2
応答時間(平均)1.28s
応答時間(最大)3.39s
応答時間(合計)24.23s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 7
- 試行ごとの合格率
- 66.7%
- 出力トークン
- 5,370
- 推論トークン
- 0
- 応答時間(平均)
- 1.28s
- 応答時間(合計)
- 24.23s
- 応答時間(最大)
- 3.39s
-
反AIトリック
: 7.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)1.04s
応答時間(最大)1.47s
応答時間(合計)4.17s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.47s
応答時間(最大)1.47s
応答時間(合計)1.47s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.20s
応答時間(最大)3.20s
応答時間(合計)3.20s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.22s
応答時間(最大)1.33s
応答時間(合計)2.44s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)942ms
応答時間(最大)1.12s
応答時間(合計)2.83s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)741ms
応答時間(最大)741ms
応答時間(合計)741ms
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.13s
応答時間(最大)1.14s
応答時間(合計)2.27s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)972ms
応答時間(最大)1.13s
応答時間(合計)2.92s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.39s
応答時間(最大)3.39s
応答時間(合計)3.39s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)814ms
応答時間(最大)814ms
応答時間(合計)814ms
|
| #41#41 |
GPT-5.2 Chatnone
|
7.6… |
OpenAI |
$0.309… |
6.85s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 2
応答時間(平均)6.85s
応答時間(最大)38.52s
応答時間(合計)130.06s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 7
- 試行ごとの合格率
- 71.9%
- 出力トークン
- 18,585
- 推論トークン
- 0
- 応答時間(平均)
- 6.85s
- 応答時間(合計)
- 130.06s
- 応答時間(最大)
- 38.52s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.40s
応答時間(最大)4.78s
応答時間(合計)13.59s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.97s
応答時間(最大)8.97s
応答時間(合計)8.97s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.12s
応答時間(最大)9.12s
応答時間(合計)9.12s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.05s
応答時間(最大)3.33s
応答時間(合計)6.10s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)17.78s
応答時間(最大)38.52s
応答時間(合計)53.33s
-
汎用知能
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)3.20s
応答時間(最大)3.20s
応答時間(合計)3.20s
-
指示追従
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)5.46s
応答時間(最大)6.45s
応答時間(合計)10.92s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.42s
応答時間(最大)5.04s
応答時間(合計)13.27s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.68s
応答時間(最大)4.68s
応答時間(合計)4.68s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.89s
応答時間(最大)6.89s
応答時間(合計)6.89s
|
| #42#42 |
Kimi K2.6medium
|
7.6… |
Moonshot AI |
$0.778… |
49.92s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 2 タイムアウト: 2
応答時間(平均)49.92s
応答時間(最大)215.85s
応答時間(合計)898.64s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 7
- 試行ごとの合格率
- 71.9%
- 出力トークン
- 96,469
- 推論トークン
- 195,991
- 応答時間(平均)
- 49.92s
- 応答時間(合計)
- 898.64s
- 応答時間(最大)
- 215.85s
-
反AIトリック
: 7.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)11.59s
応答時間(最大)23.94s
応答時間(合計)46.37s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)106.96s
応答時間(最大)106.96s
応答時間(合計)106.96s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)40.96s
応答時間(最大)40.96s
応答時間(合計)40.96s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)20.38s
応答時間(最大)22.88s
応答時間(合計)40.76s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2
応答時間(平均)202.38s
応答時間(最大)215.85s
応答時間(合計)404.76s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.83s
応答時間(最大)17.83s
応答時間(合計)17.83s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.53s
応答時間(最大)19.15s
応答時間(合計)25.06s
-
パズル解決
: 6.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)25.59s
応答時間(最大)56.89s
応答時間(合計)76.76s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.92s
応答時間(最大)8.92s
応答時間(合計)8.92s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)130.27s
応答時間(最大)130.27s
応答時間(合計)130.27s
|
| #43#43 |
Step 3.5 Flashmedium
|
7.6… |
Stepfun |
$0.011… |
41.66s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 3
応答時間(平均)41.66s
応答時間(最大)170.45s
応答時間(合計)499.91s
…
|
- 合計テスト数
- 18
- 誤答テスト数
- 7
- 試行ごとの合格率
- 66.7%
- 出力トークン
- 78,299
- 推論トークン
- 173,409
- 応答時間(平均)
- 41.66s
- 応答時間(合計)
- 499.91s
- 応答時間(最大)
- 170.45s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)40.57s
応答時間(最大)110.43s
応答時間(合計)121.72s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)29.57s
応答時間(最大)29.57s
応答時間(合計)29.57s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.01s
応答時間(最大)15.01s
応答時間(合計)15.01s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)170.45s
応答時間(最大)170.45s
応答時間(合計)170.45s
-
汎用知能
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)22.39s
応答時間(最大)22.39s
応答時間(合計)22.39s
-
指示追従
: 8.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.98s
応答時間(最大)4.98s
応答時間(合計)4.98s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)7.72s
応答時間(最大)10.60s
応答時間(合計)15.44s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.91s
応答時間(最大)11.91s
応答時間(合計)11.91s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)108.45s
応答時間(最大)108.45s
応答時間(合計)108.45s
|
| #44#44 |
Gemini 3.1 Flash Litelow
|
7.6… |
Google |
$0.025… |
1.92s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 7
応答時間(平均)1.92s
応答時間(最大)5.66s
応答時間(合計)36.49s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 7
- 試行ごとの合格率
- 68.4%
- 出力トークン
- 2,702
- 推論トークン
- 8,596
- 応答時間(平均)
- 1.92s
- 応答時間(合計)
- 36.49s
- 応答時間(最大)
- 5.66s
-
反AIトリック
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.84s
応答時間(最大)3.08s
応答時間(合計)7.37s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.46s
応答時間(最大)1.46s
応答時間(合計)1.46s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.48s
応答時間(最大)4.48s
応答時間(合計)4.48s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.44s
応答時間(最大)1.51s
応答時間(合計)2.89s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.52s
応答時間(最大)1.63s
応答時間(合計)4.57s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.37s
応答時間(最大)1.37s
応答時間(合計)1.37s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.52s
応答時間(最大)1.68s
応答時間(合計)3.04s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.40s
応答時間(最大)1.41s
応答時間(合計)4.20s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.66s
応答時間(最大)5.66s
応答時間(合計)5.66s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.46s
応答時間(最大)1.46s
応答時間(合計)1.46s
|
| #45#45 |
Qwen3.5-Flashmedium
|
7.6… |
Qwen |
$0.089… |
65.79s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 3 不正解: 3 API エラー: 1 指示に従っていない: 1
応答時間(平均)65.79s
応答時間(最大)234.29s
応答時間(合計)1250.00s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 8
- 試行ごとの合格率
- 77.2%
- 出力トークン
- 2,105
- 推論トークン
- 228,936
- 応答時間(平均)
- 65.79s
- 応答時間(合計)
- 1250.00s
- 応答時間(最大)
- 234.29s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)59.11s
応答時間(最大)168.31s
応答時間(合計)236.44s
-
コーディング
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)45.75s
応答時間(最大)45.75s
応答時間(合計)45.75s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.78s
応答時間(最大)17.78s
応答時間(合計)17.78s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)56.99s
応答時間(最大)80.14s
応答時間(合計)113.98s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)146.50s
応答時間(最大)234.29s
応答時間(合計)439.49s
-
汎用知能
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)40.05s
応答時間(最大)40.05s
応答時間(合計)40.05s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)63.49s
応答時間(最大)111.61s
応答時間(合計)126.98s
-
パズル解決
: 6.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)56.74s
応答時間(最大)115.01s
応答時間(合計)170.23s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)10.33s
応答時間(最大)10.33s
応答時間(合計)10.33s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)48.98s
応答時間(最大)48.98s
応答時間(合計)48.98s
|
| #46#46 |
GPT-5.3 Chatnone
|
7.6… |
OpenAI |
$0.348… |
5.80s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 2
応答時間(平均)5.80s
応答時間(最大)18.33s
応答時間(合計)110.27s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 7
- 試行ごとの合格率
- 70.2%
- 出力トークン
- 21,353
- 推論トークン
- 0
- 応答時間(平均)
- 5.80s
- 応答時間(合計)
- 110.27s
- 応答時間(最大)
- 18.33s
-
反AIトリック
: 6.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)3.86s
応答時間(最大)7.35s
応答時間(合計)15.44s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.32s
応答時間(最大)9.32s
応答時間(合計)9.32s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.96s
応答時間(最大)11.96s
応答時間(合計)11.96s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.21s
応答時間(最大)2.52s
応答時間(合計)4.42s
-
ドメイン特化
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)13.01s
応答時間(最大)18.33s
応答時間(合計)39.04s
-
汎用知能
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.99s
応答時間(最大)1.99s
応答時間(合計)1.99s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.29s
応答時間(最大)4.18s
応答時間(合計)6.59s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.93s
応答時間(最大)3.05s
応答時間(合計)8.78s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.36s
応答時間(最大)8.36s
応答時間(合計)8.36s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.38s
応答時間(最大)4.38s
応答時間(合計)4.38s
|
| #47#47 |
GLM 5.1medium
|
7.6… |
Z.ai |
$0.209… |
24.43s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 タイムアウト: 2 API エラー: 1
応答時間(平均)24.43s
応答時間(最大)118.52s
応答時間(合計)439.65s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 7
- 試行ごとの合格率
- 71.9%
- 出力トークン
- 8,087
- 推論トークン
- 51,269
- 応答時間(平均)
- 24.43s
- 応答時間(合計)
- 439.65s
- 応答時間(最大)
- 118.52s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.31s
応答時間(最大)14.20s
応答時間(合計)33.24s
-
コーディング
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)118.52s
応答時間(最大)118.52s
応答時間(合計)118.52s
-
複合
: 9.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)43.11s
応答時間(最大)43.11s
応答時間(合計)43.11s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.33s
応答時間(最大)9.40s
応答時間(合計)18.66s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)29.77s
応答時間(最大)32.22s
応答時間(合計)89.30s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)20.95s
応答時間(最大)20.95s
応答時間(合計)20.95s
-
指示追従
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)7.47s
応答時間(最大)10.16s
応答時間(合計)14.94s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)23.85s
応答時間(最大)33.09s
応答時間(合計)71.54s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)29.40s
応答時間(最大)29.40s
応答時間(合計)29.40s
|
| #48#48 |
DeepSeek V4 Flashhigh
|
7.6… |
DeepSeek |
$0.033… |
45.88s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 指示に従っていない: 2
応答時間(平均)45.88s
応答時間(最大)218.13s
応答時間(合計)871.76s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 8
- 試行ごとの合格率
- 75.4%
- 出力トークン
- 10,281
- 推論トークン
- 98,830
- 応答時間(平均)
- 45.88s
- 応答時間(合計)
- 871.76s
- 応答時間(最大)
- 218.13s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)28.51s
応答時間(最大)39.73s
応答時間(合計)114.05s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)62.48s
応答時間(最大)62.48s
応答時間(合計)62.48s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)76.57s
応答時間(最大)76.57s
応答時間(合計)76.57s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)28.03s
応答時間(最大)30.49s
応答時間(合計)56.07s
-
ドメイン特化
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)100.31s
応答時間(最大)218.13s
応答時間(合計)300.92s
-
汎用知能
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)25.15s
応答時間(最大)25.15s
応答時間(合計)25.15s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.36s
応答時間(最大)19.53s
応答時間(合計)30.73s
-
パズル解決
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)25.53s
応答時間(最大)32.37s
応答時間(合計)76.60s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)74.73s
応答時間(最大)74.73s
応答時間(合計)74.73s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)54.46s
応答時間(最大)54.46s
応答時間(合計)54.46s
|
| #49#49 |
GLM 5V Turbomedium
|
7.5… |
Z.ai |
$0.322… |
16.33s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 無効なツール呼び出し: 2 指示に従っていない: 1
応答時間(平均)16.33s
応答時間(最大)67.08s
応答時間(合計)310.29s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 8
- 試行ごとの合格率
- 73.7%
- 出力トークン
- 2,373
- 推論トークン
- 66,463
- 応答時間(平均)
- 16.33s
- 応答時間(合計)
- 310.29s
- 応答時間(最大)
- 67.08s
-
反AIトリック
: 7.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)10.76s
応答時間(最大)14.40s
応答時間(合計)43.02s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.78s
応答時間(最大)13.78s
応答時間(合計)13.78s
-
複合
: 6.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)15.06s
応答時間(最大)15.06s
応答時間(合計)15.06s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.60s
応答時間(最大)9.92s
応答時間(合計)19.19s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)38.15s
応答時間(最大)67.08s
応答時間(合計)114.45s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.09s
応答時間(最大)11.09s
応答時間(合計)11.09s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.74s
応答時間(最大)5.23s
応答時間(合計)7.47s
-
パズル解決
: 7.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.91s
応答時間(最大)18.97s
応答時間(合計)32.74s
-
ツール呼び出し
: 7.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)12.53s
応答時間(最大)12.53s
応答時間(合計)12.53s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)40.96s
応答時間(最大)40.96s
応答時間(合計)40.96s
|
| #50#50 |
Qwen3.6 Flashmedium
|
7.5… |
Qwen |
$0.305… |
15.85s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 指示に従っていない: 2
応答時間(平均)15.85s
応答時間(最大)122.87s
応答時間(合計)301.13s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 8
- 試行ごとの合格率
- 71.9%
- 出力トークン
- 2,830
- 推論トークン
- 194,258
- 応答時間(平均)
- 15.85s
- 応答時間(合計)
- 301.13s
- 応答時間(最大)
- 122.87s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.10s
応答時間(最大)9.60s
応答時間(合計)24.39s
-
コーディング
: 6.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)25.84s
応答時間(最大)25.84s
応答時間(合計)25.84s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)20.28s
応答時間(最大)20.28s
応答時間(合計)20.28s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.65s
応答時間(最大)10.35s
応答時間(合計)19.31s
-
ドメイン特化
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)14.65s
応答時間(最大)26.85s
応答時間(合計)43.95s
-
汎用知能
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)9.88s
応答時間(最大)9.88s
応答時間(合計)9.88s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.05s
応答時間(最大)6.94s
応答時間(合計)12.10s
-
パズル解決
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2
応答時間(平均)6.17s
応答時間(最大)8.18s
応答時間(合計)18.52s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.00s
応答時間(最大)4.00s
応答時間(合計)4.00s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)122.87s
応答時間(最大)122.87s
応答時間(合計)122.87s
|
| #51#51 |
Gemini 3.1 Flash Litehighアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
7.5… |
Google |
$2.044… |
61.96s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 3 不正解: 3 回答なし: 1
応答時間(平均)61.96s
応答時間(最大)149.23s
応答時間(合計)1115.31s
…
|
- 合計テスト数
- 18
- 誤答テスト数
- 7
- 試行ごとの合格率
- 74.1%
- 出力トークン
- 1,984
- 推論トークン
- 1,355,583
- 応答時間(平均)
- 61.96s
- 応答時間(合計)
- 1115.31s
- 応答時間(最大)
- 149.23s
-
反AIトリック
: 9.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)37.16s
応答時間(最大)140.53s
応答時間(合計)148.65s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)137.63s
応答時間(最大)137.63s
応答時間(合計)137.63s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)149.23s
応答時間(最大)149.23s
応答時間(合計)149.23s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.49s
応答時間(最大)4.96s
応答時間(合計)8.98s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)139.90s
応答時間(最大)141.40s
応答時間(合計)419.69s
-
汎用知能
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)45.69s
応答時間(最大)45.69s
応答時間(合計)45.69s
-
指示追従
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)23.26s
応答時間(最大)43.87s
応答時間(合計)46.51s
-
パズル解決
: 5.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2
応答時間(平均)50.83s
応答時間(最大)144.85s
応答時間(合計)152.49s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.44s
応答時間(最大)6.44s
応答時間(合計)6.44s
|
| #52#52 |
Claude Opus 4.6medium
|
7.4… |
Anthropic |
$1.710… |
24.59s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 4 不正解: 3
応答時間(平均)24.59s
応答時間(最大)83.40s
応答時間(合計)295.08s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 7
- 試行ごとの合格率
- 66.7%
- 出力トークン
- 37,874
- 推論トークン
- 21,390
- 応答時間(平均)
- 24.59s
- 応答時間(合計)
- 295.08s
- 応答時間(最大)
- 83.40s
-
反AIトリック
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 2
応答時間(平均)7.45s
応答時間(最大)11.88s
応答時間(合計)14.90s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.11s
応答時間(最大)23.11s
応答時間(合計)23.11s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)76.66s
応答時間(最大)76.66s
応答時間(合計)76.66s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.37s
応答時間(最大)7.37s
応答時間(合計)7.37s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 2 不正解: 1
応答時間(平均)83.40s
応答時間(最大)83.40s
応答時間(合計)83.40s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.04s
応答時間(最大)5.04s
応答時間(合計)5.04s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.43s
応答時間(最大)2.43s
応答時間(合計)2.43s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.60s
応答時間(最大)4.66s
応答時間(合計)9.20s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.73s
応答時間(最大)9.73s
応答時間(合計)9.73s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)63.24s
応答時間(最大)63.24s
応答時間(合計)63.24s
|
| #53#53 |
GPT-5.4 Nanomedium
|
7.3… |
OpenAI |
$0.084… |
10.87s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 指示に従っていない: 2
応答時間(平均)10.87s
応答時間(最大)94.06s
応答時間(合計)206.61s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 8
- 試行ごとの合格率
- 64.9%
- 出力トークン
- 3,016
- 推論トークン
- 59,306
- 応答時間(平均)
- 10.87s
- 応答時間(合計)
- 206.61s
- 応答時間(最大)
- 94.06s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.52s
応答時間(最大)7.74s
応答時間(合計)18.10s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.41s
応答時間(最大)13.41s
応答時間(合計)13.41s
-
複合
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)24.13s
応答時間(最大)24.13s
応答時間(合計)24.13s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.54s
応答時間(最大)3.33s
応答時間(合計)5.08s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)38.18s
応答時間(最大)94.06s
応答時間(合計)114.53s
-
汎用知能
: 4.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.15s
応答時間(最大)4.15s
応答時間(合計)4.15s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.88s
応答時間(最大)2.61s
応答時間(合計)3.75s
-
パズル解決
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)3.65s
応答時間(最大)4.02s
応答時間(合計)10.95s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.71s
応答時間(最大)7.71s
応答時間(合計)7.71s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.81s
応答時間(最大)4.81s
応答時間(合計)4.81s
|
| #54#54 |
Qwen3.6 Max Previewnone
|
7.2… |
Qwen |
$0.083… |
3.31s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 8
応答時間(平均)3.31s
応答時間(最大)20.51s
応答時間(合計)62.80s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 8
- 試行ごとの合格率
- 64.9%
- 出力トークン
- 4,751
- 推論トークン
- 0
- 応答時間(平均)
- 3.31s
- 応答時間(合計)
- 62.80s
- 応答時間(最大)
- 20.51s
-
反AIトリック
: 5.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)2.63s
応答時間(最大)5.57s
応答時間(合計)10.53s
-
コーディング
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.45s
応答時間(最大)3.45s
応答時間(合計)3.45s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)20.51s
応答時間(最大)20.51s
応答時間(合計)20.51s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.87s
応答時間(最大)3.54s
応答時間(合計)5.74s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.22s
応答時間(最大)1.25s
応答時間(合計)3.67s
-
汎用知能
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.62s
応答時間(最大)1.62s
応答時間(合計)1.62s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.45s
応答時間(最大)1.56s
応答時間(合計)2.89s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.38s
応答時間(最大)2.80s
応答時間(合計)7.15s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.27s
応答時間(最大)5.27s
応答時間(合計)5.27s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.97s
応答時間(最大)1.97s
応答時間(合計)1.97s
|
| #55#55 |
Ring 2.6 1tmedium
|
7.2… |
Inclusionai |
$0.000… |
61.29s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 指示に従っていない: 2
応答時間(平均)61.29s
応答時間(最大)304.19s
応答時間(合計)1164.50s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 8
- 試行ごとの合格率
- 66.7%
- 出力トークン
- 21,752
- 推論トークン
- 42,754
- 応答時間(平均)
- 61.29s
- 応答時間(合計)
- 1164.50s
- 応答時間(最大)
- 304.19s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)42.21s
応答時間(最大)89.34s
応答時間(合計)168.84s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)59.65s
応答時間(最大)59.65s
応答時間(合計)59.65s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)304.19s
応答時間(最大)304.19s
応答時間(合計)304.19s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)37.36s
応答時間(最大)54.24s
応答時間(合計)74.71s
-
ドメイン特化
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)64.92s
応答時間(最大)150.55s
応答時間(合計)194.76s
-
汎用知能
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)58.26s
応答時間(最大)58.26s
応答時間(合計)58.26s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.78s
応答時間(最大)17.75s
応答時間(合計)23.55s
-
パズル解決
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)20.73s
応答時間(最大)42.39s
応答時間(合計)62.19s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)104.44s
応答時間(最大)104.44s
応答時間(合計)104.44s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)113.91s
応答時間(最大)113.91s
応答時間(合計)113.91s
|
| #56#56 |
MiMo-V2-Flashmedium
|
7.2… |
Xiaomi |
$0.038… |
21.71s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 API エラー: 1 余分な書式: 1 指示に従っていない: 1 タイムアウト: 1
応答時間(平均)21.71s
応答時間(最大)96.01s
応答時間(合計)282.29s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 8
- 試行ごとの合格率
- 66.7%
- 出力トークン
- 12,399
- 推論トークン
- 115,182
- 応答時間(平均)
- 21.71s
- 応答時間(合計)
- 282.29s
- 応答時間(最大)
- 96.01s
-
反AIトリック
: 8.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)15.85s
応答時間(最大)20.83s
応答時間(合計)47.55s
-
コーディング
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)13.03s
応答時間(最大)13.03s
応答時間(合計)13.03s
-
複合
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)75.68s
応答時間(最大)75.68s
応答時間(合計)75.68s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)96.01s
応答時間(最大)96.01s
応答時間(合計)96.01s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.20s
応答時間(最大)4.20s
応答時間(合計)4.20s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.28s
応答時間(最大)7.37s
応答時間(合計)8.55s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.77s
応答時間(最大)5.26s
応答時間(合計)7.55s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)27.78s
応答時間(最大)27.78s
応答時間(合計)27.78s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.96s
応答時間(最大)1.96s
応答時間(合計)1.96s
|
| #57#57 |
Ring 2.6 1tnone
|
7.2… |
Inclusionai |
$0.000… |
55.10s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 2
応答時間(平均)55.10s
応答時間(最大)143.82s
応答時間(合計)881.55s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 7
- 試行ごとの合格率
- 62.5%
- 出力トークン
- 39,954
- 推論トークン
- 0
- 応答時間(平均)
- 55.10s
- 応答時間(合計)
- 881.55s
- 応答時間(最大)
- 143.82s
-
反AIトリック
: 9.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)43.33s
応答時間(最大)71.76s
応答時間(合計)173.31s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)143.82s
応答時間(最大)143.82s
応答時間(合計)143.82s
-
複合
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)45.87s
応答時間(最大)45.87s
応答時間(合計)45.87s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)73.40s
応答時間(最大)90.09s
応答時間(合計)220.20s
-
汎用知能
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)15.63s
応答時間(最大)15.63s
応答時間(合計)15.63s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)27.36s
応答時間(最大)40.24s
応答時間(合計)54.72s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)31.47s
応答時間(最大)46.84s
応答時間(合計)94.41s
-
ツール呼び出し
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)133.60s
応答時間(最大)133.60s
応答時間(合計)133.60s
|
| #58#58 |
Seed-2.0-Minimedium
|
7.2… |
Bytedance Seed |
$0.038… |
68.89s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 4 不正解: 3 指示に従っていない: 1
応答時間(平均)68.89s
応答時間(最大)262.83s
応答時間(合計)1102.23s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 8
- 試行ごとの合格率
- 63.2%
- 出力トークン
- 2,469
- 推論トークン
- 81,017
- 応答時間(平均)
- 68.89s
- 応答時間(合計)
- 1102.23s
- 応答時間(最大)
- 262.83s
-
反AIトリック
: 6.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)74.75s
応答時間(最大)182.10s
応答時間(合計)298.98s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)197.31s
応答時間(最大)197.31s
応答時間(合計)197.31s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)262.83s
応答時間(最大)262.83s
応答時間(合計)262.83s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)24.27s
応答時間(最大)27.52s
応答時間(合計)48.54s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 3
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
汎用知能
: 5.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)36.65s
応答時間(最大)36.65s
応答時間(合計)36.65s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.47s
応答時間(最大)19.46s
応答時間(合計)34.93s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)25.85s
応答時間(最大)32.95s
応答時間(合計)77.55s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)88.68s
応答時間(最大)88.68s
応答時間(合計)88.68s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)56.76s
応答時間(最大)56.76s
応答時間(合計)56.76s
|
| #59#59 |
Qwen3.5-35B-A3Bmedium
|
7.2… |
Qwen |
$0.481… |
51.50s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 4 不正解: 3 API エラー: 1 回答なし: 1
応答時間(平均)51.50s
応答時間(最大)177.35s
応答時間(合計)978.57s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 9
- 試行ごとの合格率
- 75.4%
- 出力トークン
- 21,056
- 推論トークン
- 280,814
- 応答時間(平均)
- 51.50s
- 応答時間(合計)
- 978.57s
- 応答時間(最大)
- 177.35s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)21.13s
応答時間(最大)34.96s
応答時間(合計)84.53s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)79.09s
応答時間(最大)79.09s
応答時間(合計)79.09s
-
複合
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)75.34s
応答時間(最大)75.34s
応答時間(合計)75.34s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)59.33s
応答時間(最大)97.12s
応答時間(合計)118.65s
-
ドメイン特化
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2 不正解: 1
応答時間(平均)88.34s
応答時間(最大)106.00s
応答時間(合計)265.01s
-
汎用知能
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)30.30s
応答時間(最大)30.30s
応答時間(合計)30.30s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)24.45s
応答時間(最大)43.36s
応答時間(合計)48.89s
-
パズル解決
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)31.58s
応答時間(最大)60.18s
応答時間(合計)94.75s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.65s
応答時間(最大)4.65s
応答時間(合計)4.65s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)177.35s
応答時間(最大)177.35s
応答時間(合計)177.35s
|
| #60#60 |
GPT-5.2medium
|
7.2… |
OpenAI |
$0.397… |
15.22s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 3 不正解: 3 回答なし: 1 タイムアウト: 1
応答時間(平均)15.22s
応答時間(最大)77.80s
応答時間(合計)182.59s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 8
- 試行ごとの合格率
- 68.4%
- 出力トークン
- 2,731
- 推論トークン
- 22,200
- 応答時間(平均)
- 15.22s
- 応答時間(合計)
- 182.59s
- 応答時間(最大)
- 77.80s
-
反AIトリック
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)7.81s
応答時間(最大)14.34s
応答時間(合計)15.62s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.12s
応答時間(最大)15.12s
応答時間(合計)15.12s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.06s
応答時間(最大)14.06s
応答時間(合計)14.06s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.15s
応答時間(最大)3.15s
応答時間(合計)3.15s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)77.80s
応答時間(最大)77.80s
応答時間(合計)77.80s
-
汎用知能
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.32s
応答時間(最大)4.32s
応答時間(合計)4.32s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.12s
応答時間(最大)3.12s
応答時間(合計)3.12s
-
パズル解決
: 7.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)5.47s
応答時間(最大)6.45s
応答時間(合計)10.94s
-
ツール呼び出し
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)10.30s
応答時間(最大)10.30s
応答時間(合計)10.30s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)28.18s
応答時間(最大)28.18s
応答時間(合計)28.18s
|