| #76#76 |
Kimi K2.5medium
|
6.8… |
Moonshot AI |
$0.328
↓
…
|
98.43s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 2 回答なし: 2 タイムアウト: 2
応答時間(平均)98.43s
応答時間(最大)281.00s
応答時間(合計)1378.03s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 11
- 試行ごとの合格率
- 68.3%
- 入力トークン
- 34,312
- 出力トークン
- 48,379
- 推論トークン
- 157,747
- 応答時間(平均)
- 98.43s
- 応答時間(合計)
- 1378.03s
- 応答時間(最大)
- 281.00s
-
反AIトリック
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1 不正解: 1
応答時間(平均)51.38s
応答時間(最大)85.28s
応答時間(合計)102.75s
-
コーディング
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1 タイムアウト: 1
応答時間(平均)217.49s
応答時間(最大)281.00s
応答時間(合計)652.48s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)71.37s
応答時間(最大)71.37s
応答時間(合計)71.37s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)49.78s
応答時間(最大)49.78s
応答時間(合計)49.78s
-
ドメイン特化
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)137.29s
応答時間(最大)137.29s
応答時間(合計)137.29s
-
汎用知能
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)69.73s
応答時間(最大)69.73s
応答時間(合計)69.73s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)92.47s
応答時間(最大)92.47s
応答時間(合計)92.47s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)43.23s
応答時間(最大)82.75s
応答時間(合計)86.47s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)31.74s
応答時間(最大)31.74s
応答時間(合計)31.74s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)83.95s
応答時間(最大)83.95s
応答時間(合計)83.95s
|
| #161#161 |
Qwen3.5-9Bmedium
|
4.2… |
Qwen |
$0.035
↓
…
|
82.24s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 11 回答なし: 2 不正解: 2 API エラー: 1 余分な書式: 1 指示に従っていない: 1
応答時間(平均)82.24s
応答時間(最大)226.38s
応答時間(合計)1315.88s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 18
- 試行ごとの合格率
- 27.0%
- 入力トークン
- 17,070
- 出力トークン
- 29,045
- 推論トークン
- 209,516
- 応答時間(平均)
- 82.24s
- 応答時間(合計)
- 1315.88s
- 応答時間(最大)
- 226.38s
-
反AIトリック
: 5.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2 不正解: 1
応答時間(平均)34.44s
応答時間(最大)57.86s
応答時間(合計)103.31s
-
コーディング
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 回答なし: 1 タイムアウト: 1
応答時間(平均)100.88s
応答時間(最大)135.61s
応答時間(合計)201.75s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 タイムアウト: 1
応答時間(平均)87.31s
応答時間(最大)87.31s
応答時間(合計)87.31s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 3
応答時間(平均)137.75s
応答時間(最大)202.61s
応答時間(合計)413.24s
-
汎用知能
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)226.38s
応答時間(最大)226.38s
応答時間(合計)226.38s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)5.75s
応答時間(最大)5.75s
応答時間(合計)5.75s
-
パズル解決
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2 不正解: 1
応答時間(平均)32.27s
応答時間(最大)47.31s
応答時間(合計)96.80s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.31s
応答時間(最大)4.31s
応答時間(合計)4.31s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)177.02s
応答時間(最大)177.02s
応答時間(合計)177.02s
|
| #73#73 |
Seed-2.0-Minimedium
|
6.9… |
Bytedance Seed |
$0.044
…
|
80.22s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 5 不正解: 4 指示に従っていない: 1
応答時間(平均)80.22s
応答時間(最大)262.83s
応答時間(合計)1363.72s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 10
- 試行ごとの合格率
- 57.1%
- 入力トークン
- 41,904
- 出力トークン
- 2,555
- 推論トークン
- 95,974
- 応答時間(平均)
- 80.22s
- 応答時間(合計)
- 1363.72s
- 応答時間(最大)
- 262.83s
-
反AIトリック
: 6.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)74.75s
応答時間(最大)182.10s
応答時間(合計)298.98s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)220.48s
応答時間(最大)243.66s
応答時間(合計)440.97s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)262.83s
応答時間(最大)262.83s
応答時間(合計)262.83s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)24.27s
応答時間(最大)27.52s
応答時間(合計)48.54s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 3
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
汎用知能
: 5.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)36.65s
応答時間(最大)36.65s
応答時間(合計)36.65s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.47s
応答時間(最大)19.46s
応答時間(合計)34.93s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)31.79s
応答時間(最大)50.78s
応答時間(合計)95.38s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)88.68s
応答時間(最大)88.68s
応答時間(合計)88.68s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)56.76s
応答時間(最大)56.76s
応答時間(合計)56.76s
|
| #25#25 |
Qwen3.5 Plus 2026-02-15medium
|
7.9… |
Qwen |
$0.310
↓
…
|
73.79s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 タイムアウト: 2 API エラー: 1
応答時間(平均)73.79s
応答時間(最大)266.69s
応答時間(合計)1033.07s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 73.0%
- 入力トークン
- 40,918
- 出力トークン
- 2,159
- 推論トークン
- 189,604
- 応答時間(平均)
- 73.79s
- 応答時間(合計)
- 1033.07s
- 応答時間(最大)
- 266.69s
-
反AIトリック
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)45.78s
応答時間(最大)81.20s
応答時間(合計)91.57s
-
コーディング
: 6.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)180.70s
応答時間(最大)266.69s
応答時間(合計)542.10s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)46.85s
応答時間(最大)46.85s
応答時間(合計)46.85s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)46.91s
応答時間(最大)46.91s
応答時間(合計)46.91s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)17.50s
応答時間(最大)17.50s
応答時間(合計)17.50s
-
汎用知能
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)79.86s
応答時間(最大)79.86s
応答時間(合計)79.86s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)31.93s
応答時間(最大)31.93s
応答時間(合計)31.93s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)32.50s
応答時間(最大)49.12s
応答時間(合計)65.01s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.54s
応答時間(最大)7.54s
応答時間(合計)7.54s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)103.81s
応答時間(最大)103.81s
応答時間(合計)103.81s
|
| #66#66 |
Qwen3.5-35B-A3Bmedium
|
7.1… |
Qwen |
$0.401
↓
…
|
72.57s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 5 回答なし: 2 不正解: 2 API エラー: 1
応答時間(平均)72.57s
応答時間(最大)409.98s
応答時間(合計)1524.04s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 10
- 試行ごとの合格率
- 69.8%
- 入力トークン
- 42,196
- 出力トークン
- 40,630
- 推論トークン
- 353,577
- 応答時間(平均)
- 72.57s
- 応答時間(合計)
- 1524.04s
- 応答時間(最大)
- 409.98s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)21.13s
応答時間(最大)34.96s
応答時間(合計)84.53s
-
コーディング
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1 タイムアウト: 1
応答時間(平均)206.65s
応答時間(最大)409.98s
応答時間(合計)619.94s
-
複合
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)75.34s
応答時間(最大)75.34s
応答時間(合計)75.34s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)59.33s
応答時間(最大)97.12s
応答時間(合計)118.65s
-
ドメイン特化
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2 不正解: 1
応答時間(平均)88.34s
応答時間(最大)106.00s
応答時間(合計)265.01s
-
汎用知能
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)30.30s
応答時間(最大)30.30s
応答時間(合計)30.30s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)24.45s
応答時間(最大)43.36s
応答時間(合計)48.89s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)33.13s
応答時間(最大)64.81s
応答時間(合計)99.38s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.65s
応答時間(最大)4.65s
応答時間(合計)4.65s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)177.35s
応答時間(最大)177.35s
応答時間(合計)177.35s
|
| #62#62 |
Step 3.5 Flashmedium
|
7.2… |
Stepfun |
$0.070
↑
…
|
72.53s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 3 回答なし: 1 タイムアウト: 1
応答時間(平均)72.53s
応答時間(最大)453.94s
応答時間(合計)1015.47s
…
|
- 合計テスト数
- 20
- 誤答テスト数
- 9
- 試行ごとの合格率
- 56.7%
- 入力トークン
- 34,431
- 出力トークン
- 91,587
- 推論トークン
- 195,973
- 応答時間(平均)
- 72.53s
- 応答時間(合計)
- 1015.47s
- 応答時間(最大)
- 453.94s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)40.57s
応答時間(最大)110.43s
応答時間(合計)121.72s
-
コーディング
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1 タイムアウト: 1
応答時間(平均)258.38s
応答時間(最大)453.94s
応答時間(合計)516.77s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)29.57s
応答時間(最大)29.57s
応答時間(合計)29.57s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.01s
応答時間(最大)15.01s
応答時間(合計)15.01s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)170.45s
応答時間(最大)170.45s
応答時間(合計)170.45s
-
汎用知能
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)22.39s
応答時間(最大)22.39s
応答時間(合計)22.39s
-
指示追従
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.78s
応答時間(最大)4.78s
応答時間(合計)4.78s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)7.22s
応答時間(最大)10.60s
応答時間(合計)14.44s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.91s
応答時間(最大)11.91s
応答時間(合計)11.91s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)108.45s
応答時間(最大)108.45s
応答時間(合計)108.45s
|
| #60#60 |
Kimi K2.6medium
|
7.2… |
Moonshot AI |
$0.891
↓
…
|
71.67s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 3 不正解: 3 指示に従っていない: 2 回答なし: 1
応答時間(平均)71.67s
応答時間(最大)406.78s
応答時間(合計)1433.36s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 65.1%
- 入力トークン
- 29,450
- 出力トークン
- 102,923
- 推論トークン
- 254,094
- 応答時間(平均)
- 71.67s
- 応答時間(合計)
- 1433.36s
- 応答時間(最大)
- 406.78s
-
反AIトリック
: 7.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)11.59s
応答時間(最大)23.94s
応答時間(合計)46.37s
-
コーディング
: 5.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1 タイムアウト: 1
応答時間(平均)214.42s
応答時間(最大)406.78s
応答時間(合計)643.25s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)40.96s
応答時間(最大)40.96s
応答時間(合計)40.96s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)20.38s
応答時間(最大)22.88s
応答時間(合計)40.76s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2
応答時間(平均)202.38s
応答時間(最大)215.85s
応答時間(合計)404.76s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.83s
応答時間(最大)17.83s
応答時間(合計)17.83s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.53s
応答時間(最大)19.15s
応答時間(合計)25.06s
-
パズル解決
: 6.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)25.06s
応答時間(最大)56.89s
応答時間(合計)75.19s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.92s
応答時間(最大)8.92s
応答時間(合計)8.92s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)130.27s
応答時間(最大)130.27s
応答時間(合計)130.27s
|
| #72#72 |
DeepSeek V3.2medium
|
7.0… |
DeepSeek |
$0.044
↓
…
|
68.71s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 API エラー: 2 タイムアウト: 2 指示に従っていない: 1
応答時間(平均)68.71s
応答時間(最大)376.10s
応答時間(合計)1442.81s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 10
- 試行ごとの合格率
- 65.1%
- 入力トークン
- 38,333
- 出力トークン
- 7,186
- 推論トークン
- 99,081
- 応答時間(平均)
- 68.71s
- 応答時間(合計)
- 1442.81s
- 応答時間(最大)
- 376.10s
-
反AIトリック
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)24.23s
応答時間(最大)29.86s
応答時間(合計)96.93s
-
コーディング
: 6.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)248.68s
応答時間(最大)376.10s
応答時間(合計)746.04s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)93.11s
応答時間(最大)93.11s
応答時間(合計)93.11s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)36.09s
応答時間(最大)39.12s
応答時間(合計)72.18s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)24.27s
応答時間(最大)33.91s
応答時間(合計)72.82s
-
汎用知能
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)58.29s
応答時間(最大)58.29s
応答時間(合計)58.29s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)35.78s
応答時間(最大)47.30s
応答時間(合計)71.56s
-
パズル解決
: 7.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)37.69s
応答時間(最大)59.22s
応答時間(合計)113.08s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)34.81s
応答時間(最大)34.81s
応答時間(合計)34.81s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)83.99s
応答時間(最大)83.99s
応答時間(合計)83.99s
|
| #30#30 |
Qwen3.5-27Bmedium
|
7.8… |
Qwen |
$0.536
↓
…
|
68.39s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 2 余分な書式: 1 タイムアウト: 1
応答時間(平均)68.39s
応答時間(最大)234.36s
応答時間(合計)1436.24s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 73.0%
- 入力トークン
- 42,164
- 出力トークン
- 8,534
- 推論トークン
- 329,289
- 応答時間(平均)
- 68.39s
- 応答時間(合計)
- 1436.24s
- 応答時間(最大)
- 234.36s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)19.75s
応答時間(最大)49.95s
応答時間(合計)79.01s
-
コーディング
: 6.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)160.69s
応答時間(最大)234.36s
応答時間(合計)482.07s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)163.96s
応答時間(最大)163.96s
応答時間(合計)163.96s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)30.26s
応答時間(最大)32.03s
応答時間(合計)60.52s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)79.53s
応答時間(最大)95.52s
応答時間(合計)238.59s
-
汎用知能
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)101.41s
応答時間(最大)101.41s
応答時間(合計)101.41s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)19.66s
応答時間(最大)32.25s
応答時間(合計)39.32s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)59.60s
応答時間(最大)123.57s
応答時間(合計)178.80s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.45s
応答時間(最大)7.45s
応答時間(合計)7.45s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)85.11s
応答時間(最大)85.11s
応答時間(合計)85.11s
|
| #67#67 |
MiniMax M3medium
|
7.1… |
Minimax |
$0.131
…
|
68.17s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 3 不正解: 3 指示に従っていない: 2 余分な書式: 1 回答なし: 1
応答時間(平均)68.17s
応答時間(最大)431.03s
応答時間(合計)1363.38s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 10
- 試行ごとの合格率
- 65.1%
- 入力トークン
- 46,546
- 出力トークン
- 49,036
- 推論トークン
- 92,543
- 応答時間(平均)
- 68.17s
- 応答時間(合計)
- 1363.38s
- 応答時間(最大)
- 431.03s
-
反AIトリック
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)14.95s
応答時間(最大)44.99s
応答時間(合計)59.78s
-
コーディング
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 タイムアウト: 1
応答時間(平均)144.74s
応答時間(最大)218.40s
応答時間(合計)434.22s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)65.30s
応答時間(最大)65.30s
応答時間(合計)65.30s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.92s
応答時間(最大)16.89s
応答時間(合計)29.85s
-
ドメイン特化
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2
応答時間(平均)233.13s
応答時間(最大)431.03s
応答時間(合計)466.26s
-
汎用知能
: 5.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)33.25s
応答時間(最大)33.25s
応答時間(合計)33.25s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.14s
応答時間(最大)6.80s
応答時間(合計)12.27s
-
パズル解決
: 7.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)49.91s
応答時間(最大)128.09s
応答時間(合計)149.74s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.91s
応答時間(最大)11.91s
応答時間(合計)11.91s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)100.80s
応答時間(最大)100.80s
応答時間(合計)100.80s
|
| #12#12 |
Gemini 3.1 Flash Lite Previewhighアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
8.6… |
Google |
$2.310
…
|
68.14s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)68.14s
応答時間(最大)280.52s
応答時間(合計)1090.28s
…
|
- 合計テスト数
- 16
- 誤答テスト数
- 3
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 81.3%
- 入力トークン
- 28,980
- 出力トークン
- 1,283
- 推論トークン
- 1,533,310
- 応答時間(平均)
- 68.14s
- 応答時間(合計)
- 1090.28s
- 応答時間(最大)
- 280.52s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)43.87s
応答時間(最大)121.88s
応答時間(合計)131.62s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)280.52s
応答時間(最大)280.52s
応答時間(合計)280.52s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.16s
応答時間(最大)8.54s
応答時間(合計)14.31s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)127.58s
応答時間(最大)133.93s
応答時間(合計)382.74s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.25s
応答時間(最大)5.25s
応答時間(合計)5.25s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)64.03s
応答時間(最大)124.45s
応答時間(合計)128.06s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)46.68s
応答時間(最大)134.22s
応答時間(合計)140.04s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.73s
応答時間(最大)7.73s
応答時間(合計)7.73s
|
| #129#129 |
MiniMax M2.5medium
|
5.3… |
Minimax |
$0.385
↓
…
|
65.37s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 7 タイムアウト: 4 指示に従っていない: 3 無効なツール呼び出し: 1 回答なし: 1
応答時間(平均)65.37s
応答時間(最大)251.36s
応答時間(合計)849.76s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 16
- 試行ごとの合格率
- 46.0%
- 入力トークン
- 43,706
- 出力トークン
- 109,495
- 推論トークン
- 330,814
- 応答時間(平均)
- 65.37s
- 応答時間(合計)
- 849.76s
- 応答時間(最大)
- 251.36s
-
反AIトリック
: 7.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 タイムアウト: 1
応答時間(平均)20.82s
応答時間(最大)32.42s
応答時間(合計)41.63s
-
コーディング
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1 タイムアウト: 1 不正解: 1
応答時間(平均)188.58s
応答時間(最大)251.36s
応答時間(合計)377.16s
-
複合
: 4.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)60.39s
応答時間(最大)60.39s
応答時間(合計)60.39s
-
データ解析と抽出
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)7.48s
応答時間(最大)7.48s
応答時間(合計)7.48s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)237.27s
応答時間(最大)237.27s
応答時間(合計)237.27s
-
汎用知能
: 3.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)6.63s
応答時間(最大)6.63s
応答時間(合計)6.63s
-
指示追従
: 7.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)621ms
応答時間(最大)621ms
応答時間(合計)621ms
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)11.21s
応答時間(最大)17.37s
応答時間(合計)22.43s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.35s
応答時間(最大)15.35s
応答時間(合計)15.35s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)80.79s
応答時間(最大)80.79s
応答時間(合計)80.79s
|
| #103#103 |
DeepSeek V4 Prohigh
|
6.0… |
DeepSeek |
$0.079
↓
…
|
65.21s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 5 不正解: 4 タイムアウト: 3 指示に従っていない: 1
応答時間(平均)65.21s
応答時間(最大)358.35s
応答時間(合計)1304.19s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 13
- 試行ごとの合格率
- 52.4%
- 入力トークン
- 32,240
- 出力トークン
- 12,250
- 推論トークン
- 72,257
- 応答時間(平均)
- 65.21s
- 応答時間(合計)
- 1304.19s
- 応答時間(最大)
- 358.35s
-
反AIトリック
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)16.53s
応答時間(最大)39.91s
応答時間(合計)66.11s
-
コーディング
: 3.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2 API エラー: 1
応答時間(平均)118.23s
応答時間(最大)184.68s
応答時間(合計)236.45s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)65.02s
応答時間(最大)65.02s
応答時間(合計)65.02s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)23.62s
応答時間(最大)36.44s
応答時間(合計)47.24s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 タイムアウト: 1 不正解: 1
応答時間(平均)205.66s
応答時間(最大)358.35s
応答時間(合計)616.97s
-
汎用知能
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)25.09s
応答時間(最大)25.09s
応答時間(合計)25.09s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)41.16s
応答時間(最大)43.56s
応答時間(合計)82.32s
-
パズル解決
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)34.84s
応答時間(最大)76.46s
応答時間(合計)104.52s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)21.33s
応答時間(最大)21.33s
応答時間(合計)21.33s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)39.14s
応答時間(最大)39.14s
応答時間(合計)39.14s
|
| #71#71 |
Step 3.7 Flashhigh
|
7.0… |
Stepfun |
$1.148
…
|
64.46s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 回答なし: 4
応答時間(平均)64.46s
応答時間(最大)364.99s
応答時間(合計)1353.57s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 10
- 試行ごとの合格率
- 63.5%
- 入力トークン
- 38,391
- 出力トークン
- 991,355
- 推論トークン
- 0
- 応答時間(平均)
- 64.46s
- 応答時間(合計)
- 1353.57s
- 応答時間(最大)
- 364.99s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.40s
応答時間(最大)45.73s
応答時間(合計)53.58s
-
コーディング
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 2 不正解: 1
応答時間(平均)206.21s
応答時間(最大)364.99s
応答時間(合計)618.64s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.01s
応答時間(最大)13.01s
応答時間(合計)13.01s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.72s
応答時間(最大)24.97s
応答時間(合計)29.43s
-
ドメイン特化
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 回答なし: 1
応答時間(平均)149.64s
応答時間(最大)163.21s
応答時間(合計)448.91s
-
汎用知能
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.17s
応答時間(最大)4.17s
応答時間(合計)4.17s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.52s
応答時間(最大)1.89s
応答時間(合計)3.03s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)10.22s
応答時間(最大)23.65s
応答時間(合計)30.66s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.79s
応答時間(最大)2.79s
応答時間(合計)2.79s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)149.34s
応答時間(最大)149.34s
応答時間(合計)149.34s
|
| #37#37 |
Gemma 4 26B A4Bmedium
|
7.6… |
Google |
$0.045
↓
…
|
63.41s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 回答なし: 2 タイムアウト: 2
応答時間(平均)63.41s
応答時間(最大)369.32s
応答時間(合計)1268.28s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 69.8%
- 入力トークン
- 40,252
- 出力トークン
- 28,000
- 推論トークン
- 100,490
- 応答時間(平均)
- 63.41s
- 応答時間(合計)
- 1268.28s
- 応答時間(最大)
- 369.32s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.20s
応答時間(最大)9.64s
応答時間(合計)24.78s
-
コーディング
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 2 タイムアウト: 1
応答時間(平均)272.54s
応答時間(最大)369.32s
応答時間(合計)817.61s
-
複合
: 9.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)73.55s
応答時間(最大)73.55s
応答時間(合計)73.55s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)16.51s
応答時間(最大)20.57s
応答時間(合計)33.02s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)23.62s
応答時間(最大)27.00s
応答時間(合計)47.23s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)29.76s
応答時間(最大)29.76s
応答時間(合計)29.76s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.54s
応答時間(最大)21.25s
応答時間(合計)35.08s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.79s
応答時間(最大)6.85s
応答時間(合計)17.36s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.01s
応答時間(最大)9.01s
応答時間(合計)9.01s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)180.87s
応答時間(最大)180.87s
応答時間(合計)180.87s
|
| #49#49 |
Qwen3.5-Flashmedium
|
7.4… |
Qwen |
$0.080
↓
…
|
63.29s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 タイムアウト: 3 API エラー: 1 指示に従っていない: 1
応答時間(平均)63.29s
応答時間(最大)234.29s
応答時間(合計)1265.85s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 71.4%
- 入力トークン
- 38,926
- 出力トークン
- 2,088
- 推論トークン
- 294,598
- 応答時間(平均)
- 63.29s
- 応答時間(合計)
- 1265.85s
- 応答時間(最大)
- 234.29s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)59.11s
応答時間(最大)168.31s
応答時間(合計)236.44s
-
コーディング
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)58.87s
応答時間(最大)68.14s
応答時間(合計)176.60s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.78s
応答時間(最大)17.78s
応答時間(合計)17.78s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)56.99s
応答時間(最大)80.14s
応答時間(合計)113.98s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)146.50s
応答時間(最大)234.29s
応答時間(合計)439.49s
-
汎用知能
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)40.05s
応答時間(最大)40.05s
応答時間(合計)40.05s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)63.49s
応答時間(最大)111.61s
応答時間(合計)126.98s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)27.61s
応答時間(最大)31.84s
応答時間(合計)55.21s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)10.33s
応答時間(最大)10.33s
応答時間(合計)10.33s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)48.98s
応答時間(最大)48.98s
応答時間(合計)48.98s
|
| #53#53 |
Gemini 3.1 Flash Litehighアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
7.3… |
Google |
$2.044
…
|
61.96s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 3 回答なし: 1
応答時間(平均)61.96s
応答時間(最大)149.23s
応答時間(合計)1115.31s
…
|
- 合計テスト数
- 18
- 誤答テスト数
- 8
- 試行ごとの合格率
- 68.5%
- 入力トークン
- 29,134
- 出力トークン
- 1,984
- 推論トークン
- 1,355,583
- 応答時間(平均)
- 61.96s
- 応答時間(合計)
- 1115.31s
- 応答時間(最大)
- 149.23s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)37.16s
応答時間(最大)140.53s
応答時間(合計)148.65s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)137.63s
応答時間(最大)137.63s
応答時間(合計)137.63s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)149.23s
応答時間(最大)149.23s
応答時間(合計)149.23s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.49s
応答時間(最大)4.96s
応答時間(合計)8.98s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)139.90s
応答時間(最大)141.40s
応答時間(合計)419.69s
-
汎用知能
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)45.69s
応答時間(最大)45.69s
応答時間(合計)45.69s
-
指示追従
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)23.26s
応答時間(最大)43.87s
応答時間(合計)46.51s
-
パズル解決
: 5.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2
応答時間(平均)50.83s
応答時間(最大)144.85s
応答時間(合計)152.49s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.44s
応答時間(最大)6.44s
応答時間(合計)6.44s
|
| #75#75 |
Ring-2.6-1Tmedium
|
6.9… |
Inclusionai |
$0.033
…
|
61.29s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 API エラー: 2 指示に従っていない: 2
応答時間(平均)61.29s
応答時間(最大)304.19s
応答時間(合計)1164.50s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 10
- 試行ごとの合格率
- 60.3%
- 入力トークン
- 35,892
- 出力トークン
- 21,752
- 推論トークン
- 42,754
- 応答時間(平均)
- 61.29s
- 応答時間(合計)
- 1164.50s
- 応答時間(最大)
- 304.19s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)42.21s
応答時間(最大)89.34s
応答時間(合計)168.84s
-
コーディング
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 2
応答時間(平均)59.65s
応答時間(最大)59.65s
応答時間(合計)59.65s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)304.19s
応答時間(最大)304.19s
応答時間(合計)304.19s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)37.36s
応答時間(最大)54.24s
応答時間(合計)74.71s
-
ドメイン特化
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)64.92s
応答時間(最大)150.55s
応答時間(合計)194.76s
-
汎用知能
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)58.26s
応答時間(最大)58.26s
応答時間(合計)58.26s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.78s
応答時間(最大)17.75s
応答時間(合計)23.55s
-
パズル解決
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)20.73s
応答時間(最大)42.39s
応答時間(合計)62.19s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)104.44s
応答時間(最大)104.44s
応答時間(合計)104.44s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)113.91s
応答時間(最大)113.91s
応答時間(合計)113.91s
|
| #78#78 |
Qwen3.6 27Bmedium
|
6.8… |
Qwen |
$0.444
↑
…
|
59.71s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 回答なし: 3 指示に従っていない: 1 無効なツール呼び出し: 1
応答時間(平均)59.71s
応答時間(最大)168.22s
応答時間(合計)1254.01s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 11
- 試行ごとの合格率
- 60.3%
- 入力トークン
- 39,376
- 出力トークン
- 16,189
- 推論トークン
- 122,521
- 応答時間(平均)
- 59.71s
- 応答時間(合計)
- 1254.01s
- 応答時間(最大)
- 168.22s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)12.62s
応答時間(最大)18.61s
応答時間(合計)50.50s
-
コーディング
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)142.99s
応答時間(最大)168.22s
応答時間(合計)428.96s
-
複合
: 7.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)83.07s
応答時間(最大)83.07s
応答時間(合計)83.07s
-
データ解析と抽出
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 2
応答時間(平均)37.30s
応答時間(最大)54.01s
応答時間(合計)74.60s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)73.38s
応答時間(最大)101.55s
応答時間(合計)220.15s
-
汎用知能
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)39.53s
応答時間(最大)39.53s
応答時間(合計)39.53s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)37.96s
応答時間(最大)47.48s
応答時間(合計)75.92s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)61.14s
応答時間(最大)97.76s
応答時間(合計)183.42s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)16.88s
応答時間(最大)16.88s
応答時間(合計)16.88s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)80.99s
応答時間(最大)80.99s
応答時間(合計)80.99s
|
| #14#14 |
Qwen3.6 Max Previewmedium
|
8.5… |
Qwen |
$0.960
↓
…
|
59.63s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5
応答時間(平均)59.63s
応答時間(最大)238.07s
応答時間(合計)1252.17s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 5
- 試行ごとの合格率
- 81.0%
- 入力トークン
- 42,362
- 出力トークン
- 2,273
- 推論トークン
- 144,367
- 応答時間(平均)
- 59.63s
- 応答時間(合計)
- 1252.17s
- 応答時間(最大)
- 238.07s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)22.13s
応答時間(最大)28.70s
応答時間(合計)88.50s
-
コーディング
: 8.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)146.48s
応答時間(最大)238.07s
応答時間(合計)439.45s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)121.49s
応答時間(最大)121.49s
応答時間(合計)121.49s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)41.15s
応答時間(最大)48.02s
応答時間(合計)82.30s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)95.91s
応答時間(最大)186.74s
応答時間(合計)287.73s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)32.24s
応答時間(最大)32.24s
応答時間(合計)32.24s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)24.31s
応答時間(最大)27.94s
応答時間(合計)48.63s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)24.32s
応答時間(最大)37.68s
応答時間(合計)72.96s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)18.32s
応答時間(最大)18.32s
応答時間(合計)18.32s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)60.56s
応答時間(最大)60.56s
応答時間(合計)60.56s
|
| #82#82 |
Hy3 previewhighアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
6.6… |
Tencent |
$0.048
…
|
56.57s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 7 不正解: 3
応答時間(平均)56.57s
応答時間(最大)149.94s
応答時間(合計)848.59s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 10
- 試行ごとの合格率
- 55.6%
- 入力トークン
- 25,987
- 出力トークン
- 216,719
- 推論トークン
- 0
- 応答時間(平均)
- 56.57s
- 応答時間(合計)
- 848.59s
- 応答時間(最大)
- 149.94s
-
反AIトリック
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 2
応答時間(平均)15.12s
応答時間(最大)19.99s
応答時間(合計)45.37s
-
コーディング
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 2
応答時間(平均)99.76s
応答時間(最大)99.76s
応答時間(合計)99.76s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)113.09s
応答時間(最大)113.09s
応答時間(合計)113.09s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)12.11s
応答時間(最大)12.11s
応答時間(合計)12.11s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)109.04s
応答時間(最大)149.94s
応答時間(合計)327.11s
-
汎用知能
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)34.36s
応答時間(最大)41.83s
応答時間(合計)68.73s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)27.94s
応答時間(最大)45.06s
応答時間(合計)55.89s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)78.83s
応答時間(最大)78.83s
応答時間(合計)78.83s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)47.71s
応答時間(最大)47.71s
応答時間(合計)47.71s
|
| #27#27 |
Gemma 4 31Bmedium
|
7.8… |
Google |
$0.035
↓
…
|
56.55s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 2 タイムアウト: 2 不正解: 2 回答なし: 1
応答時間(平均)56.55s
応答時間(最大)437.40s
応答時間(合計)1074.41s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 69.8%
- 入力トークン
- 17,957
- 出力トークン
- 22,356
- 推論トークン
- 65,726
- 応答時間(平均)
- 56.55s
- 応答時間(合計)
- 1074.41s
- 応答時間(最大)
- 437.40s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.89s
応答時間(最大)26.66s
応答時間(合計)51.55s
-
コーディング
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2 回答なし: 1
応答時間(平均)219.76s
応答時間(最大)437.40s
応答時間(合計)659.27s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)21.11s
応答時間(最大)21.94s
応答時間(合計)42.21s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)38.48s
応答時間(最大)68.92s
応答時間(合計)115.43s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.57s
応答時間(最大)9.57s
応答時間(合計)9.57s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.76s
応答時間(最大)17.53s
応答時間(合計)25.52s
-
パズル解決
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)26.91s
応答時間(最大)61.08s
応答時間(合計)80.72s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)90.14s
応答時間(最大)90.14s
応答時間(合計)90.14s
|
| #96#96 |
Ring-2.6-1Tnone
|
6.2… |
Inclusionai |
$0.026
…
|
55.10s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 5 不正解: 5 指示に従っていない: 2
応答時間(平均)55.10s
応答時間(最大)143.82s
応答時間(合計)881.55s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 12
- 試行ごとの合格率
- 47.6%
- 入力トークン
- 7,599
- 出力トークン
- 39,954
- 推論トークン
- 0
- 応答時間(平均)
- 55.10s
- 応答時間(合計)
- 881.55s
- 応答時間(最大)
- 143.82s
-
反AIトリック
: 9.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)43.33s
応答時間(最大)71.76s
応答時間(合計)173.31s
-
コーディング
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 2
応答時間(平均)143.82s
応答時間(最大)143.82s
応答時間(合計)143.82s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)45.87s
応答時間(最大)45.87s
応答時間(合計)45.87s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)73.40s
応答時間(最大)90.09s
応答時間(合計)220.20s
-
汎用知能
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)15.63s
応答時間(最大)15.63s
応答時間(合計)15.63s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)27.36s
応答時間(最大)40.24s
応答時間(合計)54.72s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)31.47s
応答時間(最大)46.84s
応答時間(合計)94.41s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)133.60s
応答時間(最大)133.60s
応答時間(合計)133.60s
|
| #47#47 |
Grok Build 0.1medium
|
7.4… |
X AI |
$0.927
…
|
49.90s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 余分な書式: 3
応答時間(平均)49.90s
応答時間(最大)252.69s
応答時間(合計)1047.92s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 61.9%
- 入力トークン
- 44,418
- 出力トークン
- 2,782
- 推論トークン
- 438,018
- 応答時間(平均)
- 49.90s
- 応答時間(合計)
- 1047.92s
- 応答時間(最大)
- 252.69s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)7.43s
応答時間(最大)10.89s
応答時間(合計)29.72s
-
コーディング
: 5.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)108.46s
応答時間(最大)200.16s
応答時間(合計)325.39s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)32.81s
応答時間(最大)32.81s
応答時間(合計)32.81s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)10.72s
応答時間(最大)12.13s
応答時間(合計)21.44s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)158.00s
応答時間(最大)252.69s
応答時間(合計)474.01s
-
汎用知能
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)18.41s
応答時間(最大)18.41s
応答時間(合計)18.41s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.36s
応答時間(最大)20.80s
応答時間(合計)24.73s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)18.26s
応答時間(最大)44.40s
応答時間(合計)54.79s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.12s
応答時間(最大)13.12s
応答時間(合計)13.12s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)53.51s
応答時間(最大)53.51s
応答時間(合計)53.51s
|
| #38#38 |
Grok 4.3medium
|
7.6… |
X AI |
$0.614
…
|
47.51s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 2 余分な書式: 1
応答時間(平均)47.51s
応答時間(最大)216.69s
応答時間(合計)997.68s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 71.4%
- 入力トークン
- 44,472
- 出力トークン
- 1,981
- 推論トークン
- 221,382
- 応答時間(平均)
- 47.51s
- 応答時間(合計)
- 997.68s
- 応答時間(最大)
- 216.69s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.83s
応答時間(最大)11.20s
応答時間(合計)35.31s
-
コーディング
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)41.23s
応答時間(最大)64.81s
応答時間(合計)123.69s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)63.99s
応答時間(最大)63.99s
応答時間(合計)63.99s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)18.97s
応答時間(最大)26.99s
応答時間(合計)37.93s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)181.74s
応答時間(最大)216.69s
応答時間(合計)545.21s
-
汎用知能
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)24.70s
応答時間(最大)24.70s
応答時間(合計)24.70s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)18.58s
応答時間(最大)31.48s
応答時間(合計)37.15s
-
パズル解決
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)22.52s
応答時間(最大)51.75s
応答時間(合計)67.57s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.66s
応答時間(最大)17.66s
応答時間(合計)17.66s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)44.47s
応答時間(最大)44.47s
応答時間(合計)44.47s
|
| #19#19 |
Seed-2.0-Litemedium
|
8.2… |
Bytedance Seed |
$0.175
…
|
47.07s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 2
応答時間(平均)47.07s
応答時間(最大)254.92s
応答時間(合計)988.37s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 76.2%
- 入力トークン
- 46,740
- 出力トークン
- 3,230
- 推論トークン
- 78,406
- 応答時間(平均)
- 47.07s
- 応答時間(合計)
- 988.37s
- 応答時間(最大)
- 254.92s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)17.99s
応答時間(最大)48.33s
応答時間(合計)71.98s
-
コーディング
: 8.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)156.74s
応答時間(最大)254.92s
応答時間(合計)470.22s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)37.67s
応答時間(最大)37.67s
応答時間(合計)37.67s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.07s
応答時間(最大)12.19s
応答時間(合計)18.14s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)88.74s
応答時間(最大)168.71s
応答時間(合計)266.21s
-
汎用知能
: 6.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)18.25s
応答時間(最大)18.25s
応答時間(合計)18.25s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.26s
応答時間(最大)9.02s
応答時間(合計)14.52s
-
パズル解決
: 9.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)10.23s
応答時間(最大)11.54s
応答時間(合計)30.68s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.38s
応答時間(最大)12.38s
応答時間(合計)12.38s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)48.32s
応答時間(最大)48.32s
応答時間(合計)48.32s
|
| #36#36 |
Qwen3.5 Plus 2026-04-20medium
|
7.6… |
Qwen |
$0.317
↓
…
|
46.36s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 8
応答時間(平均)46.36s
応答時間(最大)189.38s
応答時間(合計)973.57s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 66.7%
- 入力トークン
- 42,097
- 出力トークン
- 2,280
- 推論トークン
- 166,613
- 応答時間(平均)
- 46.36s
- 応答時間(合計)
- 973.57s
- 応答時間(最大)
- 189.38s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)10.84s
応答時間(最大)15.11s
応答時間(合計)43.36s
-
コーディング
: 6.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)125.25s
応答時間(最大)189.38s
応答時間(合計)375.76s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)92.41s
応答時間(最大)92.41s
応答時間(合計)92.41s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)38.32s
応答時間(最大)41.70s
応答時間(合計)76.63s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)53.10s
応答時間(最大)90.70s
応答時間(合計)159.30s
-
汎用知能
: 4.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)25.30s
応答時間(最大)25.30s
応答時間(合計)25.30s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)20.25s
応答時間(最大)21.65s
応答時間(合計)40.50s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)17.67s
応答時間(最大)24.83s
応答時間(合計)53.02s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.72s
応答時間(最大)14.72s
応答時間(合計)14.72s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)92.57s
応答時間(最大)92.57s
応答時間(合計)92.57s
|
| #31#31 |
DeepSeek V4 Flashhigh
|
7.7… |
DeepSeek |
$0.029
↓
…
|
45.85s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 指示に従っていない: 2
応答時間(平均)45.85s
応答時間(最大)218.13s
応答時間(合計)962.79s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 74.6%
- 入力トークン
- 39,745
- 出力トークン
- 10,310
- 推論トークン
- 123,501
- 応答時間(平均)
- 45.85s
- 応答時間(合計)
- 962.79s
- 応答時間(最大)
- 218.13s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)28.51s
応答時間(最大)39.73s
応答時間(合計)114.05s
-
コーディング
: 7.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)50.60s
応答時間(最大)62.48s
応答時間(合計)151.79s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)76.57s
応答時間(最大)76.57s
応答時間(合計)76.57s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)28.03s
応答時間(最大)30.49s
応答時間(合計)56.07s
-
ドメイン特化
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)100.31s
応答時間(最大)218.13s
応答時間(合計)300.92s
-
汎用知能
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)25.15s
応答時間(最大)25.15s
応答時間(合計)25.15s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.36s
応答時間(最大)19.53s
応答時間(合計)30.73s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)26.11s
応答時間(最大)32.37s
応答時間(合計)78.32s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)74.73s
応答時間(最大)74.73s
応答時間(合計)74.73s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)54.46s
応答時間(最大)54.46s
応答時間(合計)54.46s
|
| #94#94 |
GPT-5 Nanomedium
|
6.3… |
OpenAI |
$0.081
…
|
42.51s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9 指示に従っていない: 2 タイムアウト: 1
応答時間(平均)42.51s
応答時間(最大)204.02s
応答時間(合計)595.09s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 12
- 試行ごとの合格率
- 57.1%
- 入力トークン
- 34,108
- 出力トークン
- 5,464
- 推論トークン
- 192,064
- 応答時間(平均)
- 42.51s
- 応答時間(合計)
- 595.09s
- 応答時間(最大)
- 204.02s
-
反AIトリック
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)25.50s
応答時間(最大)37.73s
応答時間(合計)51.00s
-
コーディング
: 7.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)41.62s
応答時間(最大)54.86s
応答時間(合計)124.86s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)65.96s
応答時間(最大)65.96s
応答時間(合計)65.96s
-
データ解析と抽出
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)21.42s
応答時間(最大)21.42s
応答時間(合計)21.42s
-
ドメイン特化
: 5.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)204.02s
応答時間(最大)204.02s
応答時間(合計)204.02s
-
汎用知能
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)17.51s
応答時間(最大)17.51s
応答時間(合計)17.51s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.64s
応答時間(最大)15.64s
応答時間(合計)15.64s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)20.63s
応答時間(最大)22.94s
応答時間(合計)41.26s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)33.30s
応答時間(最大)33.30s
応答時間(合計)33.30s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)20.13s
応答時間(最大)20.13s
応答時間(合計)20.13s
|
| #29#29 |
Qwen3.5-122B-A10Bmedium
|
7.8… |
Qwen |
$0.588
↓
…
|
42.49s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 タイムアウト: 2
応答時間(平均)42.49s
応答時間(最大)168.16s
応答時間(合計)892.30s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 73.0%
- 入力トークン
- 41,832
- 出力トークン
- 26,187
- 推論トークン
- 251,028
- 応答時間(平均)
- 42.49s
- 応答時間(合計)
- 892.30s
- 応答時間(最大)
- 168.16s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.75s
応答時間(最大)18.03s
応答時間(合計)39.01s
-
コーディング
: 6.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)114.48s
応答時間(最大)168.16s
応答時間(合計)343.44s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)107.79s
応答時間(最大)107.79s
応答時間(合計)107.79s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.41s
応答時間(最大)29.79s
応答時間(合計)46.83s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)63.40s
応答時間(最大)119.29s
応答時間(合計)190.20s
-
汎用知能
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)34.11s
応答時間(最大)34.11s
応答時間(合計)34.11s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.88s
応答時間(最大)15.44s
応答時間(合計)19.76s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.89s
応答時間(最大)31.99s
応答時間(合計)53.68s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.60s
応答時間(最大)4.60s
応答時間(合計)4.60s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)52.87s
応答時間(最大)52.87s
応答時間(合計)52.87s
|