| #104#104 |
Nemotron 3 Ultra 550b A55bnone
|
6.0… |
NVIDIA |
$0.028
↕
…
|
2.27s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 12 指示に従っていない: 1
応答時間(平均)2.27s
応答時間(最大)13.49s
応答時間(合計)47.65s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 13
- 試行ごとの合格率
- 44.4%
- 入力トークン
- 43,326
- 出力トークン
- 2,138
- 推論トークン
- 0
- 応答時間(平均)
- 2.27s
- 応答時間(合計)
- 47.65s
- 応答時間(最大)
- 13.49s
-
反AIトリック
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)2.35s
応答時間(最大)6.55s
応答時間(合計)9.42s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.02s
応答時間(最大)1.83s
応答時間(合計)3.07s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.79s
応答時間(最大)4.79s
応答時間(合計)4.79s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.94s
応答時間(最大)2.86s
応答時間(合計)3.89s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)698ms
応答時間(最大)1.00s
応答時間(合計)2.09s
-
汎用知能
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)13.49s
応答時間(最大)13.49s
応答時間(合計)13.49s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.46s
応答時間(最大)1.72s
応答時間(合計)2.92s
-
パズル解決
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)1.06s
応答時間(最大)1.53s
応答時間(合計)3.17s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.99s
応答時間(最大)2.99s
応答時間(合計)2.99s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.83s
応答時間(最大)1.83s
応答時間(合計)1.83s
|
| #105#105 |
Nemotron 3 Supermedium
|
5.8… |
NVIDIA |
$0.021
↑
…
|
32.00s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 API エラー: 3 指示に従っていない: 3 回答なし: 1 タイムアウト: 1
応答時間(平均)32.00s
応答時間(最大)232.25s
応答時間(合計)607.91s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 13
- 試行ごとの合格率
- 41.3%
- 入力トークン
- 37,527
- 出力トークン
- 14,850
- 推論トークン
- 33,754
- 応答時間(平均)
- 32.00s
- 応答時間(合計)
- 607.91s
- 応答時間(最大)
- 232.25s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)7.85s
応答時間(最大)22.30s
応答時間(合計)31.40s
-
コーディング
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 3
応答時間(平均)147.32s
応答時間(最大)232.25s
応答時間(合計)294.64s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)87.80s
応答時間(最大)87.80s
応答時間(合計)87.80s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)18.16s
応答時間(最大)20.65s
応答時間(合計)36.33s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)16.19s
応答時間(最大)21.56s
応答時間(合計)32.39s
-
汎用知能
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)6.91s
応答時間(最大)6.91s
応答時間(合計)6.91s
-
指示追従
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)6.97s
応答時間(最大)11.23s
応答時間(合計)13.95s
-
パズル解決
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)3.15s
応答時間(最大)4.52s
応答時間(合計)9.45s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)39.75s
応答時間(最大)39.75s
応答時間(合計)39.75s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)55.32s
応答時間(最大)55.32s
応答時間(合計)55.32s
|
| #107#107 |
Laguna Xs.2mediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
5.8… |
Poolside |
$0.000
…
|
6.73s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 API エラー: 4 回答なし: 2 無効なツール呼び出し: 1
応答時間(平均)6.73s
応答時間(最大)29.11s
応答時間(合計)100.98s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 13
- 試行ごとの合格率
- 50.9%
- 入力トークン
- 39,481
- 出力トークン
- 54,218
- 推論トークン
- 0
- 応答時間(平均)
- 6.73s
- 応答時間(合計)
- 100.98s
- 応答時間(最大)
- 29.11s
-
反AIトリック
: 6.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)2.68s
応答時間(最大)3.09s
応答時間(合計)8.04s
-
コーディング
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)14.36s
応答時間(最大)14.36s
応答時間(合計)14.36s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)15.92s
応答時間(最大)15.92s
応答時間(合計)15.92s
-
データ解析と抽出
: 7.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)9.34s
応答時間(最大)16.71s
応答時間(合計)18.68s
-
ドメイン特化
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 回答なし: 1
応答時間(平均)11.12s
応答時間(最大)29.11s
応答時間(合計)33.35s
-
汎用知能
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.68s
応答時間(最大)2.03s
応答時間(合計)3.36s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)1.93s
応答時間(最大)1.97s
応答時間(合計)3.87s
-
ツール呼び出し
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)3.39s
応答時間(最大)3.39s
応答時間(合計)3.39s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #108#108 |
Qwen3.5-Flashnone
|
5.8… |
Qwen |
$0.005
↓
…
|
3.58s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13
応答時間(平均)3.58s
応答時間(最大)27.18s
応答時間(合計)75.28s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 13
- 試行ごとの合格率
- 39.7%
- 入力トークン
- 46,439
- 出力トークン
- 4,276
- 推論トークン
- 0
- 応答時間(平均)
- 3.58s
- 応答時間(合計)
- 75.28s
- 応答時間(最大)
- 27.18s
-
反AIトリック
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)1.32s
応答時間(最大)3.89s
応答時間(合計)5.30s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)850ms
応答時間(最大)1.29s
応答時間(合計)2.55s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.22s
応答時間(最大)6.22s
応答時間(合計)6.22s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.57s
応答時間(最大)1.83s
応答時間(合計)3.14s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)905ms
応答時間(最大)1.10s
応答時間(合計)2.71s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)803ms
応答時間(最大)803ms
応答時間(合計)803ms
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)8.81s
応答時間(最大)13.73s
応答時間(合計)17.61s
-
パズル解決
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)10.89s
応答時間(最大)27.18s
応答時間(合計)32.68s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.67s
応答時間(最大)3.67s
応答時間(合計)3.67s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)588ms
応答時間(最大)588ms
応答時間(合計)588ms
|
| #109#109 |
GLM 5V Turbonone
|
5.8… |
Z.ai |
$0.052
…
|
2.99s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 11 指示に従っていない: 2
応答時間(平均)2.99s
応答時間(最大)6.51s
応答時間(合計)62.74s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 13
- 試行ごとの合格率
- 38.1%
- 入力トークン
- 37,100
- 出力トークン
- 1,766
- 推論トークン
- 0
- 応答時間(平均)
- 2.99s
- 応答時間(合計)
- 62.74s
- 応答時間(最大)
- 6.51s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)3.13s
応答時間(最大)5.90s
応答時間(合計)12.50s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)3.13s
応答時間(最大)5.30s
応答時間(合計)9.40s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.51s
応答時間(最大)6.51s
応答時間(合計)6.51s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.81s
応答時間(最大)5.69s
応答時間(合計)7.62s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)2.09s
応答時間(最大)2.39s
応答時間(合計)6.26s
-
汎用知能
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.22s
応答時間(最大)2.22s
応答時間(合計)2.22s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.97s
応答時間(最大)2.43s
応答時間(合計)3.93s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)2.40s
応答時間(最大)3.81s
応答時間(合計)7.21s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.86s
応答時間(最大)4.86s
応答時間(合計)4.86s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.23s
応答時間(最大)2.23s
応答時間(合計)2.23s
|
| #110#110 |
Seed-2.0-Litenone
|
5.8… |
Bytedance Seed |
$0.019
…
|
2.49s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13
応答時間(平均)2.49s
応答時間(最大)6.70s
応答時間(合計)52.26s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 13
- 試行ごとの合格率
- 46.0%
- 入力トークン
- 46,573
- 出力トークン
- 3,259
- 推論トークン
- 0
- 応答時間(平均)
- 2.49s
- 応答時間(合計)
- 52.26s
- 応答時間(最大)
- 6.70s
-
反AIトリック
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)2.43s
応答時間(最大)6.70s
応答時間(合計)9.73s
-
コーディング
: 5.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)2.83s
応答時間(最大)4.61s
応答時間(合計)8.49s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.59s
応答時間(最大)6.59s
応答時間(合計)6.59s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.82s
応答時間(最大)1.97s
応答時間(合計)3.63s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.33s
応答時間(最大)1.53s
応答時間(合計)4.00s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.45s
応答時間(最大)3.45s
応答時間(合計)3.45s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.06s
応答時間(最大)1.09s
応答時間(合計)2.12s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)2.78s
応答時間(最大)5.20s
応答時間(合計)8.34s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.94s
応答時間(最大)3.94s
応答時間(合計)3.94s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.96s
応答時間(最大)1.96s
応答時間(合計)1.96s
|
| #111#111 |
Owl Alphamediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
5.7… |
Openrouter |
$0.000
…
|
11.95s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 10 指示に従っていない: 2 API エラー: 1
応答時間(平均)11.95s
応答時間(最大)58.63s
応答時間(合計)250.88s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 13
- 試行ごとの合格率
- 39.7%
- 入力トークン
- 43,478
- 出力トークン
- 2,974
- 推論トークン
- 0
- 応答時間(平均)
- 11.95s
- 応答時間(合計)
- 250.88s
- 応答時間(最大)
- 58.63s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)3.97s
応答時間(最大)7.48s
応答時間(合計)15.89s
-
コーディング
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)18.74s
応答時間(最大)30.81s
応答時間(合計)56.21s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.01s
応答時間(最大)10.01s
応答時間(合計)10.01s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)21.64s
応答時間(最大)29.16s
応答時間(合計)43.28s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)8.58s
応答時間(最大)9.48s
応答時間(合計)25.74s
-
汎用知能
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)58.63s
応答時間(最大)58.63s
応答時間(合計)58.63s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.15s
応答時間(最大)15.94s
応答時間(合計)20.30s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)3.40s
応答時間(最大)4.60s
応答時間(合計)10.19s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.26s
応答時間(最大)8.26s
応答時間(合計)8.26s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.38s
応答時間(最大)2.38s
応答時間(合計)2.38s
|
| #112#112 |
GLM 5.1none
|
5.7… |
Z.ai |
$0.058
↓
…
|
4.10s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13 無効なツール呼び出し: 1
応答時間(平均)4.10s
応答時間(最大)32.57s
応答時間(合計)86.18s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 14
- 試行ごとの合格率
- 41.3%
- 入力トークン
- 47,133
- 出力トークン
- 3,754
- 推論トークン
- 0
- 応答時間(平均)
- 4.10s
- 応答時間(合計)
- 86.18s
- 応答時間(最大)
- 32.57s
-
反AIトリック
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)2.11s
応答時間(最大)3.94s
応答時間(合計)8.46s
-
コーディング
: 3.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)4.96s
応答時間(最大)9.79s
応答時間(合計)14.89s
-
複合
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)32.57s
応答時間(最大)32.57s
応答時間(合計)32.57s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.08s
応答時間(最大)1.62s
応答時間(合計)2.15s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.99s
応答時間(最大)3.99s
応答時間(合計)5.98s
-
汎用知能
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)790ms
応答時間(最大)790ms
応答時間(合計)790ms
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.98s
応答時間(最大)2.28s
応答時間(合計)3.97s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.45s
応答時間(最大)2.09s
応答時間(合計)4.36s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)10.68s
応答時間(最大)10.68s
応答時間(合計)10.68s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.34s
応答時間(最大)2.34s
応答時間(合計)2.34s
|
| #114#114 |
Qwen3.5 Plus 2026-04-20none
|
5.7… |
Qwen |
$0.032
↓
…
|
4.39s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 12 指示に従っていない: 2
応答時間(平均)4.39s
応答時間(最大)33.34s
応答時間(合計)92.26s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 14
- 試行ごとの合格率
- 41.3%
- 入力トークン
- 38,910
- 出力トークン
- 11,145
- 推論トークン
- 0
- 応答時間(平均)
- 4.39s
- 応答時間(合計)
- 92.26s
- 応答時間(最大)
- 33.34s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.88s
応答時間(最大)4.81s
応答時間(合計)7.53s
-
コーディング
: 3.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)1.69s
応答時間(最大)3.20s
応答時間(合計)5.06s
-
複合
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)13.32s
応答時間(最大)13.32s
応答時間(合計)13.32s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.82s
応答時間(最大)3.86s
応答時間(合計)5.65s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)4.43s
応答時間(最大)10.83s
応答時間(合計)13.28s
-
汎用知能
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.41s
応答時間(最大)1.41s
応答時間(合計)1.41s
-
指示追従
: 6.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.17s
応答時間(最大)1.33s
応答時間(合計)2.35s
-
パズル解決
: 6.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.97s
応答時間(最大)3.43s
応答時間(合計)5.91s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.42s
応答時間(最大)4.42s
応答時間(合計)4.42s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)33.34s
応答時間(最大)33.34s
応答時間(合計)33.34s
|
| #115#115 |
Qwen3.5-27Bnone
|
5.7… |
Qwen |
$0.015
↓
…
|
1.68s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 12 指示に従っていない: 2
応答時間(平均)1.68s
応答時間(最大)9.39s
応答時間(合計)35.25s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 14
- 試行ごとの合格率
- 38.1%
- 入力トークン
- 44,478
- 出力トークン
- 3,592
- 推論トークン
- 0
- 応答時間(平均)
- 1.68s
- 応答時間(合計)
- 35.25s
- 応答時間(最大)
- 9.39s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)788ms
応答時間(最大)1.34s
応答時間(合計)3.15s
-
コーディング
: 5.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.80s
応答時間(最大)2.51s
応答時間(合計)5.40s
-
複合
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)9.39s
応答時間(最大)9.39s
応答時間(合計)9.39s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.43s
応答時間(最大)1.45s
応答時間(合計)2.86s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)540ms
応答時間(最大)649ms
応答時間(合計)1.62s
-
汎用知能
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.51s
応答時間(最大)2.51s
応答時間(合計)2.51s
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.03s
応答時間(最大)1.40s
応答時間(合計)2.06s
-
パズル解決
: 6.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)1.38s
応答時間(最大)2.24s
応答時間(合計)4.13s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.54s
応答時間(最大)3.54s
応答時間(合計)3.54s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)599ms
応答時間(最大)599ms
応答時間(合計)599ms
|
| #117#117 |
Qwen3.5-35B-A3Bnone
|
5.6… |
Qwen |
$0.012
↓
…
|
3.37s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 12 指示に従っていない: 2
応答時間(平均)3.37s
応答時間(最大)47.43s
応答時間(合計)70.75s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 14
- 試行ごとの合格率
- 42.9%
- 入力トークン
- 48,194
- 出力トークン
- 4,343
- 推論トークン
- 0
- 応答時間(平均)
- 3.37s
- 応答時間(合計)
- 70.75s
- 応答時間(最大)
- 47.43s
-
反AIトリック
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)1.43s
応答時間(最大)4.39s
応答時間(合計)5.71s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.39s
応答時間(最大)2.67s
応答時間(合計)4.18s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)47.43s
応答時間(最大)47.43s
応答時間(合計)47.43s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.16s
応答時間(最大)1.42s
応答時間(合計)2.33s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)485ms
応答時間(最大)549ms
応答時間(合計)1.45s
-
汎用知能
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.19s
応答時間(最大)1.19s
応答時間(合計)1.19s
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)809ms
応答時間(最大)983ms
応答時間(合計)1.62s
-
パズル解決
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)1.35s
応答時間(最大)2.26s
応答時間(合計)4.05s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.30s
応答時間(最大)2.30s
応答時間(合計)2.30s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)493ms
応答時間(最大)493ms
応答時間(合計)493ms
|
| #118#118 |
Qwen3.6 27Bnone
|
5.6… |
Qwen |
$0.028
↓
…
|
3.72s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 11 指示に従っていない: 2 無効なツール呼び出し: 1
応答時間(平均)3.72s
応答時間(最大)11.82s
応答時間(合計)78.08s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 14
- 試行ごとの合格率
- 47.6%
- 入力トークン
- 52,721
- 出力トークン
- 3,812
- 推論トークン
- 0
- 応答時間(平均)
- 3.72s
- 応答時間(合計)
- 78.08s
- 応答時間(最大)
- 11.82s
-
反AIトリック
: 3.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)2.83s
応答時間(最大)7.62s
応答時間(合計)11.33s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)4.16s
応答時間(最大)10.18s
応答時間(合計)12.49s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)9.95s
応答時間(最大)9.95s
応答時間(合計)9.95s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.06s
応答時間(最大)2.39s
応答時間(合計)4.11s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.03s
応答時間(最大)4.83s
応答時間(合計)9.08s
-
汎用知能
: 5.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.07s
応答時間(最大)1.07s
応答時間(合計)1.07s
-
指示追従
: 6.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.92s
応答時間(最大)1.94s
応答時間(合計)3.83s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)5.15s
応答時間(最大)11.82s
応答時間(合計)15.45s
-
ツール呼び出し
: 9.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.74s
応答時間(最大)6.74s
応答時間(合計)6.74s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.03s
応答時間(最大)4.03s
応答時間(合計)4.03s
|
| #119#119 |
Cobuddymedium
|
5.6… |
Baidu |
$0.000
…
|
39.90s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9 指示に従っていない: 3 API エラー: 1 無効なツール呼び出し: 1
応答時間(平均)39.90s
応答時間(最大)309.02s
応答時間(合計)797.98s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 14
- 試行ごとの合格率
- 47.6%
- 入力トークン
- 37,449
- 出力トークン
- 1,677
- 推論トークン
- 116,703
- 応答時間(平均)
- 39.90s
- 応答時間(合計)
- 797.98s
- 応答時間(最大)
- 309.02s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.00s
応答時間(最大)11.53s
応答時間(合計)39.99s
-
コーディング
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 指示に従っていない: 1 不正解: 1
応答時間(平均)79.17s
応答時間(最大)104.76s
応答時間(合計)158.35s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)47.38s
応答時間(最大)47.38s
応答時間(合計)47.38s
-
データ解析と抽出
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)17.36s
応答時間(最大)26.57s
応答時間(合計)34.71s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)128.15s
応答時間(最大)309.02s
応答時間(合計)384.46s
-
汎用知能
: 4.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)23.23s
応答時間(最大)23.23s
応答時間(合計)23.23s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.60s
応答時間(最大)14.49s
応答時間(合計)23.20s
-
パズル解決
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)12.83s
応答時間(最大)24.40s
応答時間(合計)38.49s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.19s
応答時間(最大)11.19s
応答時間(合計)11.19s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)36.98s
応答時間(最大)36.98s
応答時間(合計)36.98s
|
| #120#120 |
Mimo V2 PROnoneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
5.6… |
Xiaomi |
$0.045
↓
…
|
2.27s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 11 指示に従っていない: 2 API エラー: 1
応答時間(平均)2.27s
応答時間(最大)6.58s
応答時間(合計)45.50s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 14
- 試行ごとの合格率
- 41.3%
- 入力トークン
- 39,344
- 出力トークン
- 2,352
- 推論トークン
- 0
- 応答時間(平均)
- 2.27s
- 応答時間(合計)
- 45.50s
- 応答時間(最大)
- 6.58s
-
反AIトリック
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)1.80s
応答時間(最大)2.62s
応答時間(合計)7.19s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)2.65s
応答時間(最大)3.82s
応答時間(合計)5.30s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.58s
応答時間(最大)6.58s
応答時間(合計)6.58s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.39s
応答時間(最大)1.42s
応答時間(合計)2.78s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.78s
応答時間(最大)2.49s
応答時間(合計)5.34s
-
汎用知能
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.44s
応答時間(最大)2.44s
応答時間(合計)2.44s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.51s
応答時間(最大)2.95s
応答時間(合計)5.02s
-
パズル解決
: 6.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)1.61s
応答時間(最大)2.15s
応答時間(合計)4.83s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.39s
応答時間(最大)4.39s
応答時間(合計)4.39s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.63s
応答時間(最大)1.63s
応答時間(合計)1.63s
|
| #121#121 |
Owl Alphanoneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
5.5… |
Openrouter |
$0.000
…
|
9.88s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 10 指示に従っていない: 3 余分な書式: 1
応答時間(平均)9.88s
応答時間(最大)47.10s
応答時間(合計)207.38s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 14
- 試行ごとの合格率
- 36.5%
- 入力トークン
- 42,283
- 出力トークン
- 5,913
- 推論トークン
- 0
- 応答時間(平均)
- 9.88s
- 応答時間(合計)
- 207.38s
- 応答時間(最大)
- 47.10s
-
反AIトリック
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 1
応答時間(平均)2.78s
応答時間(最大)3.09s
応答時間(合計)11.10s
-
コーディング
: 5.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)36.89s
応答時間(最大)47.10s
応答時間(合計)110.66s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)21.74s
応答時間(最大)21.74s
応答時間(合計)21.74s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.60s
応答時間(最大)3.92s
応答時間(合計)7.19s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)3.00s
応答時間(最大)4.69s
応答時間(合計)8.99s
-
汎用知能
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.61s
応答時間(最大)4.61s
応答時間(合計)4.61s
-
指示追従
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.63s
応答時間(最大)2.77s
応答時間(合計)5.27s
-
パズル解決
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)4.18s
応答時間(最大)8.27s
応答時間(合計)12.54s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)22.78s
応答時間(最大)22.78s
応答時間(合計)22.78s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.50s
応答時間(最大)2.50s
応答時間(合計)2.50s
|
| #122#122 |
GLM 4.7 Flashnone
|
5.5… |
Z.ai |
$0.004
…
|
2.86s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13 指示に従っていない: 1 無効なツール呼び出し: 1
応答時間(平均)2.86s
応答時間(最大)7.05s
応答時間(合計)40.04s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 15
- 試行ごとの合格率
- 36.5%
- 入力トークン
- 38,745
- 出力トークン
- 2,521
- 推論トークン
- 0
- 応答時間(平均)
- 2.86s
- 応答時間(合計)
- 40.04s
- 応答時間(最大)
- 7.05s
-
反AIトリック
: 5.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)5.51s
応答時間(最大)6.59s
応答時間(合計)11.02s
-
コーディング
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)2.54s
応答時間(最大)5.57s
応答時間(合計)7.62s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)3.22s
応答時間(最大)3.22s
応答時間(合計)3.22s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.82s
応答時間(最大)4.82s
応答時間(合計)4.82s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)744ms
応答時間(最大)744ms
応答時間(合計)744ms
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.59s
応答時間(最大)1.59s
応答時間(合計)1.59s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)888ms
応答時間(最大)888ms
応答時間(合計)888ms
-
パズル解決
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)1.20s
応答時間(最大)1.27s
応答時間(合計)2.39s
-
ツール呼び出し
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)7.05s
応答時間(最大)7.05s
応答時間(合計)7.05s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)692ms
応答時間(最大)692ms
応答時間(合計)692ms
|
| #123#123 |
MiMo-V2.5-Pronone
|
5.5… |
Xiaomi |
$0.017
↓
…
|
1.78s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 11 指示に従っていない: 4
応答時間(平均)1.78s
応答時間(最大)8.32s
応答時間(合計)37.42s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 15
- 試行ごとの合格率
- 39.7%
- 入力トークン
- 30,724
- 出力トークン
- 3,043
- 推論トークン
- 0
- 応答時間(平均)
- 1.78s
- 応答時間(合計)
- 37.42s
- 応答時間(最大)
- 8.32s
-
反AIトリック
: 3.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 1
応答時間(平均)2.67s
応答時間(最大)8.32s
応答時間(合計)10.67s
-
コーディング
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)1.41s
応答時間(最大)2.39s
応答時間(合計)4.23s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)3.54s
応答時間(最大)3.54s
応答時間(合計)3.54s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.32s
応答時間(最大)1.42s
応答時間(合計)2.64s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)877ms
応答時間(最大)904ms
応答時間(合計)2.63s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.58s
応答時間(最大)2.58s
応答時間(合計)2.58s
-
指示追従
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.03s
応答時間(最大)1.10s
応答時間(合計)2.06s
-
パズル解決
: 6.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)1.30s
応答時間(最大)1.61s
応答時間(合計)3.90s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.30s
応答時間(最大)3.30s
応答時間(合計)3.30s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.89s
応答時間(最大)1.89s
応答時間(合計)1.89s
|
| #124#124 |
Kimi K2.6none
|
5.5… |
Moonshot AI |
$0.079
↓
…
|
13.27s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 11 指示に従っていない: 3
応答時間(平均)13.27s
応答時間(最大)238.89s
応答時間(合計)278.57s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 14
- 試行ごとの合格率
- 36.5%
- 入力トークン
- 32,916
- 出力トークン
- 16,410
- 推論トークン
- 0
- 応答時間(平均)
- 13.27s
- 応答時間(合計)
- 278.57s
- 応答時間(最大)
- 238.89s
-
反AIトリック
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.39s
応答時間(最大)2.96s
応答時間(合計)5.56s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)82.57s
応答時間(最大)238.89s
応答時間(合計)247.72s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.38s
応答時間(最大)3.38s
応答時間(合計)3.38s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.32s
応答時間(最大)1.39s
応答時間(合計)2.64s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.48s
応答時間(最大)1.85s
応答時間(合計)4.45s
-
汎用知能
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.55s
応答時間(最大)1.55s
応答時間(合計)1.55s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.64s
応答時間(最大)1.80s
応答時間(合計)3.28s
-
パズル解決
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)1.40s
応答時間(最大)1.81s
応答時間(合計)4.19s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.46s
応答時間(最大)4.46s
応答時間(合計)4.46s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.36s
応答時間(最大)1.36s
応答時間(合計)1.36s
|
| #125#125 |
GPT-5.4none
|
5.5… |
OpenAI |
$0.122
…
|
1.42s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13 指示に従っていない: 1
応答時間(平均)1.42s
応答時間(最大)2.95s
応答時間(合計)29.87s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 14
- 試行ごとの合格率
- 36.5%
- 入力トークン
- 34,212
- 出力トークン
- 2,417
- 推論トークン
- 0
- 応答時間(平均)
- 1.42s
- 応答時間(合計)
- 29.87s
- 応答時間(最大)
- 2.95s
-
反AIトリック
: 3.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)1.21s
応答時間(最大)2.58s
応答時間(合計)4.85s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.62s
応答時間(最大)2.95s
応答時間(合計)4.85s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.89s
応答時間(最大)2.89s
応答時間(合計)2.89s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.04s
応答時間(最大)1.06s
応答時間(合計)2.08s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.07s
応答時間(最大)1.54s
応答時間(合計)3.22s
-
汎用知能
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.78s
応答時間(最大)1.78s
応答時間(合計)1.78s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.07s
応答時間(最大)1.17s
応答時間(合計)2.15s
-
パズル解決
: 5.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)1.44s
応答時間(最大)1.82s
応答時間(合計)4.33s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.75s
応答時間(最大)2.75s
応答時間(合計)2.75s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)990ms
応答時間(最大)990ms
応答時間(合計)990ms
|
| #126#126 |
gpt-oss-120bnone
|
5.4… |
OpenAI |
$0.010
↓
…
|
21.61s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 8 API エラー: 3 指示に従っていない: 2
応答時間(平均)21.61s
応答時間(最大)113.71s
応答時間(合計)345.79s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 13
- 試行ごとの合格率
- 38.6%
- 入力トークン
- 9,081
- 出力トークン
- 51,664
- 推論トークン
- 0
- 応答時間(平均)
- 21.61s
- 応答時間(合計)
- 345.79s
- 応答時間(最大)
- 113.71s
-
反AIトリック
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)32.84s
応答時間(最大)113.71s
応答時間(合計)131.35s
-
コーディング
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)9.57s
応答時間(最大)9.57s
応答時間(合計)9.57s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)7.12s
応答時間(最大)7.12s
応答時間(合計)7.12s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)34.98s
応答時間(最大)68.97s
応答時間(合計)104.94s
-
汎用知能
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.79s
応答時間(最大)10.79s
応答時間(合計)10.79s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.06s
応答時間(最大)5.85s
応答時間(合計)10.12s
-
パズル解決
: 6.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)8.21s
応答時間(最大)11.82s
応答時間(合計)24.62s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)47.29s
応答時間(最大)47.29s
応答時間(合計)47.29s
|
| #128#128 |
Qwen3.6 Flashnone
|
5.4… |
Qwen |
$0.015
↓
…
|
1.60s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 12 指示に従っていない: 1 無効なツール呼び出し: 1
応答時間(平均)1.60s
応答時間(最大)4.60s
応答時間(合計)33.59s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 14
- 試行ごとの合格率
- 33.3%
- 入力トークン
- 50,810
- 出力トークン
- 4,164
- 推論トークン
- 0
- 応答時間(平均)
- 1.60s
- 応答時間(合計)
- 33.59s
- 応答時間(最大)
- 4.60s
-
反AIトリック
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)1.63s
応答時間(最大)4.60s
応答時間(合計)6.51s
-
コーディング
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.79s
応答時間(最大)2.46s
応答時間(合計)5.36s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)4.22s
応答時間(最大)4.22s
応答時間(合計)4.22s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.13s
応答時間(最大)3.35s
応答時間(合計)4.26s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.11s
応答時間(最大)1.89s
応答時間(合計)3.32s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)947ms
応答時間(最大)947ms
応答時間(合計)947ms
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.10s
応答時間(最大)1.36s
応答時間(合計)2.19s
-
パズル解決
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)1.21s
応答時間(最大)1.80s
応答時間(合計)3.64s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.49s
応答時間(最大)2.49s
応答時間(合計)2.49s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)649ms
応答時間(最大)649ms
応答時間(合計)649ms
|
| #129#129 |
MiniMax M2.5medium
|
5.3… |
Minimax |
$0.385
↓
…
|
65.37s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 7 タイムアウト: 4 指示に従っていない: 3 無効なツール呼び出し: 1 回答なし: 1
応答時間(平均)65.37s
応答時間(最大)251.36s
応答時間(合計)849.76s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 16
- 試行ごとの合格率
- 46.0%
- 入力トークン
- 43,706
- 出力トークン
- 109,495
- 推論トークン
- 330,814
- 応答時間(平均)
- 65.37s
- 応答時間(合計)
- 849.76s
- 応答時間(最大)
- 251.36s
-
反AIトリック
: 7.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 タイムアウト: 1
応答時間(平均)20.82s
応答時間(最大)32.42s
応答時間(合計)41.63s
-
コーディング
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1 タイムアウト: 1 不正解: 1
応答時間(平均)188.58s
応答時間(最大)251.36s
応答時間(合計)377.16s
-
複合
: 4.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)60.39s
応答時間(最大)60.39s
応答時間(合計)60.39s
-
データ解析と抽出
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)7.48s
応答時間(最大)7.48s
応答時間(合計)7.48s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)237.27s
応答時間(最大)237.27s
応答時間(合計)237.27s
-
汎用知能
: 3.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)6.63s
応答時間(最大)6.63s
応答時間(合計)6.63s
-
指示追従
: 7.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)621ms
応答時間(最大)621ms
応答時間(合計)621ms
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)11.21s
応答時間(最大)17.37s
応答時間(合計)22.43s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.35s
応答時間(最大)15.35s
応答時間(合計)15.35s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)80.79s
応答時間(最大)80.79s
応答時間(合計)80.79s
|
| #130#130 |
MiniMax M2.7medium
|
5.3… |
Minimax |
$0.124
↓
…
|
38.18s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 指示に従っていない: 5 タイムアウト: 2 API エラー: 1 無効なツール呼び出し: 1 回答なし: 1
応答時間(平均)38.18s
応答時間(最大)196.21s
応答時間(合計)763.60s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 16
- 試行ごとの合格率
- 46.0%
- 入力トークン
- 34,371
- 出力トークン
- 8,981
- 推論トークン
- 89,812
- 応答時間(平均)
- 38.18s
- 応答時間(合計)
- 763.60s
- 応答時間(最大)
- 196.21s
-
反AIトリック
: 7.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)40.32s
応答時間(最大)117.04s
応答時間(合計)161.28s
-
コーディング
: 5.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 回答なし: 1
応答時間(平均)101.89s
応答時間(最大)196.21s
応答時間(合計)305.67s
-
複合
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)41.03s
応答時間(最大)41.03s
応答時間(合計)41.03s
-
データ解析と抽出
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)21.95s
応答時間(最大)24.88s
応答時間(合計)43.89s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2 不正解: 1
応答時間(平均)19.00s
応答時間(最大)21.63s
応答時間(合計)38.01s
-
汎用知能
: 3.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)38.70s
応答時間(最大)38.70s
応答時間(合計)38.70s
-
指示追従
: 3.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)12.80s
応答時間(最大)15.23s
応答時間(合計)25.60s
-
パズル解決
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)24.87s
応答時間(最大)46.29s
応答時間(合計)74.61s
-
ツール呼び出し
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)12.05s
応答時間(最大)12.05s
応答時間(合計)12.05s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)22.77s
応答時間(最大)22.77s
応答時間(合計)22.77s
|
| #131#131 |
Qwen3.5-122B-A10Bnone
|
5.3… |
Qwen |
$0.020
↓
…
|
3.41s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13 指示に従っていない: 2
応答時間(平均)3.41s
応答時間(最大)46.00s
応答時間(合計)71.59s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 15
- 試行ごとの合格率
- 31.8%
- 入力トークン
- 47,735
- 出力トークン
- 3,383
- 推論トークン
- 0
- 応答時間(平均)
- 3.41s
- 応答時間(合計)
- 71.59s
- 応答時間(最大)
- 46.00s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.59s
応答時間(最大)3.60s
応答時間(合計)6.38s
-
コーディング
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)2.77s
応答時間(最大)4.03s
応答時間(合計)8.32s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)46.00s
応答時間(最大)46.00s
応答時間(合計)46.00s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.01s
応答時間(最大)1.06s
応答時間(合計)2.02s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)465ms
応答時間(最大)492ms
応答時間(合計)1.39s
-
汎用知能
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.12s
応答時間(最大)1.12s
応答時間(合計)1.12s
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)513ms
応答時間(最大)570ms
応答時間(合計)1.03s
-
パズル解決
: 3.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)1.00s
応答時間(最大)1.41s
応答時間(合計)3.00s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.04s
応答時間(最大)2.04s
応答時間(合計)2.04s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)295ms
応答時間(最大)295ms
応答時間(合計)295ms
|
| #132#132 |
Mistral Small 4medium
|
5.3… |
Mistral |
$0.068
…
|
9.40s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 12 API エラー: 2 指示に従っていない: 2
応答時間(平均)9.40s
応答時間(最大)59.15s
応答時間(合計)197.39s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 16
- 試行ごとの合格率
- 44.4%
- 入力トークン
- 42,576
- 出力トークン
- 24,184
- 推論トークン
- 84,678
- 応答時間(平均)
- 9.40s
- 応答時間(合計)
- 197.39s
- 応答時間(最大)
- 59.15s
-
反AIトリック
: 5.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)2.67s
応答時間(最大)5.03s
応答時間(合計)10.66s
-
コーディング
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)39.98s
応答時間(最大)59.15s
応答時間(合計)119.95s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)25.25s
応答時間(最大)25.25s
応答時間(合計)25.25s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)1.23s
応答時間(最大)1.96s
応答時間(合計)2.46s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)6.11s
応答時間(最大)13.72s
応答時間(合計)18.34s
-
汎用知能
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.05s
応答時間(最大)2.05s
応答時間(合計)2.05s
-
指示追従
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.38s
応答時間(最大)1.61s
応答時間(合計)2.75s
-
パズル解決
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)2.17s
応答時間(最大)2.60s
応答時間(合計)6.50s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.50s
応答時間(最大)3.50s
応答時間(合計)3.50s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)5.92s
応答時間(最大)5.92s
応答時間(合計)5.92s
|
| #133#133 |
DeepSeek V3.2none
|
5.2… |
DeepSeek |
$0.017
↓
…
|
13.83s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 7 API エラー: 4 余分な書式: 2 指示に従っていない: 1 無効なツール呼び出し: 1
応答時間(平均)13.83s
応答時間(最大)115.89s
応答時間(合計)290.43s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 15
- 試行ごとの合格率
- 39.7%
- 入力トークン
- 55,997
- 出力トークン
- 11,165
- 推論トークン
- 0
- 応答時間(平均)
- 13.83s
- 応答時間(合計)
- 290.43s
- 応答時間(最大)
- 115.89s
-
反AIトリック
: 3.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 2 API エラー: 1 不正解: 1
応答時間(平均)9.35s
応答時間(最大)16.77s
応答時間(合計)37.40s
-
コーディング
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)14.54s
応答時間(最大)34.11s
応答時間(合計)43.62s
-
複合
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)115.89s
応答時間(最大)115.89s
応答時間(合計)115.89s
-
データ解析と抽出
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)9.42s
応答時間(最大)16.20s
応答時間(合計)18.84s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 API エラー: 1
応答時間(平均)4.17s
応答時間(最大)9.09s
応答時間(合計)12.51s
-
汎用知能
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)9.32s
応答時間(最大)9.32s
応答時間(合計)9.32s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.52s
応答時間(最大)1.99s
応答時間(合計)3.04s
-
パズル解決
: 7.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)6.91s
応答時間(最大)10.09s
応答時間(合計)20.74s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.85s
応答時間(最大)11.85s
応答時間(合計)11.85s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)17.23s
応答時間(最大)17.23s
応答時間(合計)17.23s
|
| #134#134 |
GLM 5 Turbonone
|
5.2… |
Z.ai |
$0.047
↑
…
|
2.82s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13 指示に従っていない: 2
応答時間(平均)2.82s
応答時間(最大)8.21s
応答時間(合計)59.29s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 15
- 試行ごとの合格率
- 31.8%
- 入力トークン
- 32,525
- 出力トークン
- 1,815
- 推論トークン
- 0
- 応答時間(平均)
- 2.82s
- 応答時間(合計)
- 59.29s
- 応答時間(最大)
- 8.21s
-
反AIトリック
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)2.84s
応答時間(最大)4.15s
応答時間(合計)11.35s
-
コーディング
: 3.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)2.41s
応答時間(最大)3.93s
応答時間(合計)7.22s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.89s
応答時間(最大)4.89s
応答時間(合計)4.89s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.47s
応答時間(最大)2.48s
応答時間(合計)4.95s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.97s
応答時間(最大)2.65s
応答時間(合計)5.92s
-
汎用知能
: 4.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.18s
応答時間(最大)2.18s
応答時間(合計)2.18s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.13s
応答時間(最大)2.53s
応答時間(合計)4.27s
-
パズル解決
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)2.65s
応答時間(最大)3.34s
応答時間(合計)7.94s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.21s
応答時間(最大)8.21s
応答時間(合計)8.21s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.37s
応答時間(最大)2.37s
応答時間(合計)2.37s
|
| #135#135 |
Kimi K2.5none
|
5.2… |
Moonshot AI |
$0.028
↑
…
|
13.18s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 15
応答時間(平均)13.18s
応答時間(最大)42.13s
応答時間(合計)184.47s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 15
- 試行ごとの合格率
- 34.9%
- 入力トークン
- 36,034
- 出力トークン
- 6,657
- 推論トークン
- 0
- 応答時間(平均)
- 13.18s
- 応答時間(合計)
- 184.47s
- 応答時間(最大)
- 42.13s
-
反AIトリック
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)6.24s
応答時間(最大)11.38s
応答時間(合計)12.48s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)24.56s
応答時間(最大)38.78s
応答時間(合計)73.69s
-
複合
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)19.16s
応答時間(最大)19.16s
応答時間(合計)19.16s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)42.13s
応答時間(最大)42.13s
応答時間(合計)42.13s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)4.38s
応答時間(最大)4.38s
応答時間(合計)4.38s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.00s
応答時間(最大)4.00s
応答時間(合計)4.00s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.67s
応答時間(最大)2.67s
応答時間(合計)2.67s
-
パズル解決
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)4.04s
応答時間(最大)7.81s
応答時間(合計)8.08s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.99s
応答時間(最大)13.99s
応答時間(合計)13.99s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.90s
応答時間(最大)3.90s
応答時間(合計)3.90s
|
| #138#138 |
Ling-2.6-flashnone
|
5.0… |
Inclusionai |
$0.001
↑
…
|
9.34s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9 API エラー: 2 指示に従っていない: 2 無効なツール呼び出し: 2
応答時間(平均)9.34s
応答時間(最大)35.34s
応答時間(合計)177.48s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 15
- 試行ごとの合格率
- 31.8%
- 入力トークン
- 40,718
- 出力トークン
- 2,878
- 推論トークン
- 0
- 応答時間(平均)
- 9.34s
- 応答時間(合計)
- 177.48s
- 応答時間(最大)
- 35.34s
-
反AIトリック
: 6.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)11.81s
応答時間(最大)16.60s
応答時間(合計)47.23s
-
コーディング
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 2
応答時間(平均)11.21s
応答時間(最大)11.21s
応答時間(合計)11.21s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)35.34s
応答時間(最大)35.34s
応答時間(合計)35.34s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)8.48s
応答時間(最大)12.71s
応答時間(合計)16.96s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)4.95s
応答時間(最大)7.65s
応答時間(合計)14.84s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.45s
応答時間(最大)1.45s
応答時間(合計)1.45s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.52s
応答時間(最大)8.19s
応答時間(合計)11.04s
-
パズル解決
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)6.51s
応答時間(最大)17.06s
応答時間(合計)19.54s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)18.80s
応答時間(最大)18.80s
応答時間(合計)18.80s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.06s
応答時間(最大)1.06s
応答時間(合計)1.06s
|
| #139#139 |
DeepSeek V4 Flashnone
|
5.0… |
DeepSeek |
$0.008
↓
…
|
26.75s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 12 余分な書式: 2 指示に従っていない: 1 無効なツール呼び出し: 1
応答時間(平均)26.75s
応答時間(最大)111.96s
応答時間(合計)561.82s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 16
- 試行ごとの合格率
- 30.2%
- 入力トークン
- 50,127
- 出力トークン
- 13,710
- 推論トークン
- 0
- 応答時間(平均)
- 26.75s
- 応答時間(合計)
- 561.82s
- 応答時間(最大)
- 111.96s
-
反AIトリック
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)20.18s
応答時間(最大)26.54s
応答時間(合計)80.73s
-
コーディング
: 4.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)17.13s
応答時間(最大)24.90s
応答時間(合計)51.40s
-
複合
: 4.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)111.96s
応答時間(最大)111.96s
応答時間(合計)111.96s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.79s
応答時間(最大)23.85s
応答時間(合計)47.57s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)19.73s
応答時間(最大)27.66s
応答時間(合計)59.18s
-
汎用知能
: 4.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)23.74s
応答時間(最大)23.74s
応答時間(合計)23.74s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)17.54s
応答時間(最大)18.51s
応答時間(合計)35.08s
-
パズル解決
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 指示に従っていない: 1 不正解: 1
応答時間(平均)23.72s
応答時間(最大)29.24s
応答時間(合計)71.16s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)77.93s
応答時間(最大)77.93s
応答時間(合計)77.93s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.07s
応答時間(最大)3.07s
応答時間(合計)3.07s
|