| #7#7 |
Gemini 3.5 Flashmedium
|
9.0… |
Google |
$0.582
…
|
4.94s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)4.94s
応答時間(最大)18.07s
応答時間(合計)103.79s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 3
- 試行ごとの合格率
- 87.3%
- 入力トークン
- 36,936
- 出力トークン
- 2,001
- 推論トークン
- 56,408
- 応答時間(平均)
- 4.94s
- 応答時間(合計)
- 103.79s
- 応答時間(最大)
- 18.07s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.09s
応答時間(最大)2.56s
応答時間(合計)8.35s
-
コーディング
: 7.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)12.63s
応答時間(最大)18.07s
応答時間(合計)37.89s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.05s
応答時間(最大)12.05s
応答時間(合計)12.05s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.07s
応答時間(最大)5.60s
応答時間(合計)8.14s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)5.24s
応答時間(最大)6.43s
応答時間(合計)15.73s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.52s
応答時間(最大)2.52s
応答時間(合計)2.52s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.70s
応答時間(最大)3.07s
応答時間(合計)5.40s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.38s
応答時間(最大)2.55s
応答時間(合計)7.15s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.81s
応答時間(最大)3.81s
応答時間(合計)3.81s
-
雑学
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.75s
応答時間(最大)2.75s
応答時間(合計)2.75s
|
| #77#77 |
Claude Sonnet 4.6none
|
6.8… |
Anthropic |
$0.316
…
|
5.04s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 余分な書式: 4 指示に従っていない: 1
応答時間(平均)5.04s
応答時間(最大)23.84s
応答時間(合計)70.60s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 10
- 試行ごとの合格率
- 55.6%
- 入力トークン
- 57,886
- 出力トークン
- 9,465
- 推論トークン
- 0
- 応答時間(平均)
- 5.04s
- 応答時間(合計)
- 70.60s
- 応答時間(最大)
- 23.84s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 2 不正解: 1
応答時間(平均)2.94s
応答時間(最大)4.83s
応答時間(合計)5.88s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)5.19s
応答時間(最大)9.79s
応答時間(合計)15.56s
-
複合
: 9.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.84s
応答時間(最大)23.84s
応答時間(合計)23.84s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.43s
応答時間(最大)3.43s
応答時間(合計)3.43s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.54s
応答時間(最大)3.54s
応答時間(合計)3.54s
-
汎用知能
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.56s
応答時間(最大)2.56s
応答時間(合計)2.56s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.96s
応答時間(最大)1.96s
応答時間(合計)1.96s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)2.53s
応答時間(最大)2.54s
応答時間(合計)5.06s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.11s
応答時間(最大)4.11s
応答時間(合計)4.11s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.67s
応答時間(最大)4.67s
応答時間(合計)4.67s
|
| #141#141 |
Nemotron 3 Supernone
|
4.9… |
NVIDIA |
$0.007
↑
…
|
5.30s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 14 指示に従っていない: 2
応答時間(平均)5.30s
応答時間(最大)16.45s
応答時間(合計)111.31s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 16
- 試行ごとの合格率
- 31.8%
- 入力トークン
- 36,456
- 出力トークン
- 6,195
- 推論トークン
- 0
- 応答時間(平均)
- 5.30s
- 応答時間(合計)
- 111.31s
- 応答時間(最大)
- 16.45s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)4.46s
応答時間(最大)9.94s
応答時間(合計)17.83s
-
コーディング
: 3.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)2.64s
応答時間(最大)3.05s
応答時間(合計)7.92s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)16.45s
応答時間(最大)16.45s
応答時間(合計)16.45s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.92s
応答時間(最大)13.23s
応答時間(合計)15.84s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)6.23s
応答時間(最大)14.38s
応答時間(合計)18.70s
-
汎用知能
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)950ms
応答時間(最大)950ms
応答時間(合計)950ms
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)804ms
応答時間(最大)921ms
応答時間(合計)1.61s
-
パズル解決
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)2.36s
応答時間(最大)3.27s
応答時間(合計)7.07s
-
ツール呼び出し
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)16.00s
応答時間(最大)16.00s
応答時間(合計)16.00s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)8.94s
応答時間(最大)8.94s
応答時間(合計)8.94s
|
| #16#16 |
Gemini 3 Flash Previewlow
|
8.4… |
Google |
$0.111
…
|
5.76s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5
応答時間(平均)5.76s
応答時間(最大)14.72s
応答時間(合計)120.93s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 5
- 試行ごとの合格率
- 79.4%
- 入力トークン
- 36,769
- 出力トークン
- 2,076
- 推論トークン
- 28,518
- 応答時間(平均)
- 5.76s
- 応答時間(合計)
- 120.93s
- 応答時間(最大)
- 14.72s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.48s
応答時間(最大)4.31s
応答時間(合計)13.94s
-
コーディング
: 5.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)6.00s
応答時間(最大)6.94s
応答時間(合計)18.00s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.27s
応答時間(最大)3.27s
応答時間(合計)3.27s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.40s
応答時間(最大)14.72s
応答時間(合計)18.80s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)8.05s
応答時間(最大)14.40s
応答時間(合計)24.15s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.68s
応答時間(最大)3.68s
応答時間(合計)3.68s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.02s
応答時間(最大)7.35s
応答時間(合計)14.03s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.77s
応答時間(最大)10.27s
応答時間(合計)17.32s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.99s
応答時間(最大)4.99s
応答時間(合計)4.99s
-
雑学
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.75s
応答時間(最大)2.75s
応答時間(合計)2.75s
|
| #102#102 |
Gemma 4 26B A4Bnone
|
6.0… |
Google |
$0.004
↓
…
|
5.91s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 10 指示に従っていない: 2 タイムアウト: 1
応答時間(平均)5.91s
応答時間(最大)57.10s
応答時間(合計)124.05s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 13
- 試行ごとの合格率
- 44.4%
- 入力トークン
- 40,038
- 出力トークン
- 1,824
- 推論トークン
- 0
- 応答時間(平均)
- 5.91s
- 応答時間(合計)
- 124.05s
- 応答時間(最大)
- 57.10s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.28s
応答時間(最大)2.09s
応答時間(合計)5.13s
-
コーディング
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)4.16s
応答時間(最大)7.07s
応答時間(合計)12.48s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)30.53s
応答時間(最大)30.53s
応答時間(合計)30.53s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.70s
応答時間(最大)2.21s
応答時間(合計)3.41s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)2.49s
応答時間(最大)4.23s
応答時間(合計)7.48s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)3.54s
応答時間(最大)3.54s
応答時間(合計)3.54s
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)690ms
応答時間(最大)878ms
応答時間(合計)1.38s
-
パズル解決
: 6.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)744ms
応答時間(最大)972ms
応答時間(合計)2.23s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)57.10s
応答時間(最大)57.10s
応答時間(合計)57.10s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)778ms
応答時間(最大)778ms
応答時間(合計)778ms
|
| #63#63 |
GPT-5.3 Chatnone
|
7.2… |
OpenAI |
$0.433
…
|
6.34s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 7 指示に従っていない: 2
応答時間(平均)6.34s
応答時間(最大)18.33s
応答時間(合計)133.13s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 66.7%
- 入力トークン
- 34,209
- 出力トークン
- 26,617
- 推論トークン
- 0
- 応答時間(平均)
- 6.34s
- 応答時間(合計)
- 133.13s
- 応答時間(最大)
- 18.33s
-
反AIトリック
: 6.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)3.86s
応答時間(最大)7.35s
応答時間(合計)15.44s
-
コーディング
: 5.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)10.52s
応答時間(最大)11.72s
応答時間(合計)31.55s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.96s
応答時間(最大)11.96s
応答時間(合計)11.96s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.21s
応答時間(最大)2.52s
応答時間(合計)4.42s
-
ドメイン特化
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)13.01s
応答時間(最大)18.33s
応答時間(合計)39.04s
-
汎用知能
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.99s
応答時間(最大)1.99s
応答時間(合計)1.99s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.51s
応答時間(最大)4.60s
応答時間(合計)7.01s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.99s
応答時間(最大)3.16s
応答時間(合計)8.97s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.36s
応答時間(最大)8.36s
応答時間(合計)8.36s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.38s
応答時間(最大)4.38s
応答時間(合計)4.38s
|
| #107#107 |
Laguna Xs.2mediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
5.8… |
Poolside |
$0.000
…
|
6.73s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 API エラー: 4 回答なし: 2 無効なツール呼び出し: 1
応答時間(平均)6.73s
応答時間(最大)29.11s
応答時間(合計)100.98s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 13
- 試行ごとの合格率
- 50.9%
- 入力トークン
- 39,481
- 出力トークン
- 54,218
- 推論トークン
- 0
- 応答時間(平均)
- 6.73s
- 応答時間(合計)
- 100.98s
- 応答時間(最大)
- 29.11s
-
反AIトリック
: 6.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)2.68s
応答時間(最大)3.09s
応答時間(合計)8.04s
-
コーディング
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)14.36s
応答時間(最大)14.36s
応答時間(合計)14.36s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)15.92s
応答時間(最大)15.92s
応答時間(合計)15.92s
-
データ解析と抽出
: 7.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)9.34s
応答時間(最大)16.71s
応答時間(合計)18.68s
-
ドメイン特化
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 回答なし: 1
応答時間(平均)11.12s
応答時間(最大)29.11s
応答時間(合計)33.35s
-
汎用知能
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.68s
応答時間(最大)2.03s
応答時間(合計)3.36s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)1.93s
応答時間(最大)1.97s
応答時間(合計)3.87s
-
ツール呼び出し
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)3.39s
応答時間(最大)3.39s
応答時間(合計)3.39s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #24#24 |
GPT-5.2 Chatnone
|
7.9… |
OpenAI |
$0.393
…
|
7.13s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 指示に従っていない: 1
応答時間(平均)7.13s
応答時間(最大)38.52s
応答時間(合計)149.69s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 74.6%
- 入力トークン
- 34,212
- 出力トークン
- 23,744
- 推論トークン
- 0
- 応答時間(平均)
- 7.13s
- 応答時間(合計)
- 149.69s
- 応答時間(最大)
- 38.52s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.40s
応答時間(最大)4.78s
応答時間(合計)13.59s
-
コーディング
: 8.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)9.82s
応答時間(最大)13.35s
応答時間(合計)29.45s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.12s
応答時間(最大)9.12s
応答時間(合計)9.12s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.05s
応答時間(最大)3.33s
応答時間(合計)6.10s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)17.78s
応答時間(最大)38.52s
応答時間(合計)53.33s
-
汎用知能
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)3.20s
応答時間(最大)3.20s
応答時間(合計)3.20s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.51s
応答時間(最大)6.55s
応答時間(合計)11.02s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.10s
応答時間(最大)5.04s
応答時間(合計)12.31s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.68s
応答時間(最大)4.68s
応答時間(合計)4.68s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.89s
応答時間(最大)6.89s
応答時間(合計)6.89s
|
| #159#159 |
Ling-2.6-1Tnone
|
4.3… |
Inclusionai |
$0.005
…
|
7.72s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 12 API エラー: 3 指示に従っていない: 2 無効なツール呼び出し: 1
応答時間(平均)7.72s
応答時間(最大)25.72s
応答時間(合計)139.00s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 18
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 14.3%
- 入力トークン
- 34,905
- 出力トークン
- 2,434
- 推論トークン
- 0
- 応答時間(平均)
- 7.72s
- 応答時間(合計)
- 139.00s
- 応答時間(最大)
- 25.72s
-
反AIトリック
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)6.55s
応答時間(最大)9.41s
応答時間(合計)26.19s
-
コーディング
: 3.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 2 不正解: 1
応答時間(平均)10.57s
応答時間(最大)10.57s
応答時間(合計)10.57s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)23.53s
応答時間(最大)23.53s
応答時間(合計)23.53s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.37s
応答時間(最大)1.37s
応答時間(合計)2.73s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.04s
応答時間(最大)1.08s
応答時間(合計)3.11s
-
汎用知能
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)20.34s
応答時間(最大)20.34s
応答時間(合計)20.34s
-
指示追従
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)5.36s
応答時間(最大)9.81s
応答時間(合計)10.73s
-
パズル解決
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)5.36s
応答時間(最大)13.26s
応答時間(合計)16.09s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)25.72s
応答時間(最大)25.72s
応答時間(合計)25.72s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #150#150 |
Qwen3 Coder Nextmedium
|
4.6… |
Qwen |
$0.008
↓
…
|
8.58s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13 指示に従っていない: 3 タイムアウト: 1
応答時間(平均)8.58s
応答時間(最大)81.80s
応答時間(合計)128.68s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 17
- 試行ごとの合格率
- 28.6%
- 入力トークン
- 47,250
- 出力トークン
- 3,319
- 推論トークン
- 0
- 応答時間(平均)
- 8.58s
- 応答時間(合計)
- 128.68s
- 応答時間(最大)
- 81.80s
-
反AIトリック
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 1
応答時間(平均)8.64s
応答時間(最大)15.28s
応答時間(合計)17.29s
-
コーディング
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)924ms
応答時間(最大)1.69s
応答時間(合計)2.77s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.28s
応答時間(最大)4.28s
応答時間(合計)4.28s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)81.80s
応答時間(最大)81.80s
応答時間(合計)81.80s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)638ms
応答時間(最大)638ms
応答時間(合計)638ms
-
汎用知能
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.39s
応答時間(最大)1.39s
応答時間(合計)1.39s
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)7.49s
応答時間(最大)13.67s
応答時間(合計)14.99s
-
パズル解決
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)1.25s
応答時間(最大)1.68s
応答時間(合計)2.49s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.64s
応答時間(最大)2.64s
応答時間(合計)2.64s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)399ms
応答時間(最大)399ms
応答時間(合計)399ms
|
| #140#140 |
Qwen3 Coder Nextnone
|
4.9… |
Qwen |
$0.009
↓
…
|
8.62s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 14 余分な書式: 1 指示に従っていない: 1
応答時間(平均)8.62s
応答時間(最大)45.14s
応答時間(合計)129.37s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 16
- 試行ごとの合格率
- 27.0%
- 入力トークン
- 47,507
- 出力トークン
- 3,584
- 推論トークン
- 0
- 応答時間(平均)
- 8.62s
- 応答時間(合計)
- 129.37s
- 応答時間(最大)
- 45.14s
-
反AIトリック
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 余分な書式: 1 指示に従っていない: 1
応答時間(平均)3.31s
応答時間(最大)4.39s
応答時間(合計)6.63s
-
コーディング
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)2.22s
応答時間(最大)3.14s
応答時間(合計)6.67s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)45.14s
応答時間(最大)45.14s
応答時間(合計)45.14s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.32s
応答時間(最大)1.32s
応答時間(合計)1.32s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)962ms
応答時間(最大)962ms
応答時間(合計)962ms
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.34s
応答時間(最大)1.34s
応答時間(合計)1.34s
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)7.78s
応答時間(最大)14.65s
応答時間(合計)15.56s
-
パズル解決
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)24.34s
応答時間(最大)42.58s
応答時間(合計)48.69s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.47s
応答時間(最大)2.47s
応答時間(合計)2.47s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)601ms
応答時間(最大)601ms
応答時間(合計)601ms
|
| #2🥈 #2 |
Gemini 3.5 Flashhigh
|
9.6… |
Google |
$1.115
…
|
8.84s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)8.84s
応答時間(最大)34.82s
応答時間(合計)185.57s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 1
- 試行ごとの合格率
- 96.8%
- 入力トークン
- 37,594
- 出力トークン
- 1,975
- 推論トークン
- 115,638
- 応答時間(平均)
- 8.84s
- 応答時間(合計)
- 185.57s
- 応答時間(最大)
- 34.82s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.57s
応答時間(最大)3.60s
応答時間(合計)10.27s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)22.96s
応答時間(最大)34.82s
応答時間(合計)68.88s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)22.37s
応答時間(最大)22.37s
応答時間(合計)22.37s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.43s
応答時間(最大)8.51s
応答時間(合計)12.87s
-
ドメイン特化
: 7.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)14.09s
応答時間(最大)22.00s
応答時間(合計)42.27s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.63s
応答時間(最大)3.63s
応答時間(合計)3.63s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.35s
応答時間(最大)3.42s
応答時間(合計)6.69s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.23s
応答時間(最大)3.68s
応答時間(合計)9.69s
-
ツール呼び出し
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.96s
応答時間(最大)4.96s
応答時間(合計)4.96s
-
雑学
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.94s
応答時間(最大)3.94s
応答時間(合計)3.94s
|
| #35#35 |
Gemini 3 PRO Previewmedium
|
7.6… |
Google |
$0.385
↑
…
|
9.05s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 4 不正解: 3
応答時間(平均)9.05s
応答時間(最大)26.24s
応答時間(合計)90.53s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 66.7%
- 入力トークン
- 28,848
- 出力トークン
- 1,490
- 推論トークン
- 10,102
- 応答時間(平均)
- 9.05s
- 応答時間(合計)
- 90.53s
- 応答時間(最大)
- 26.24s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.99s
応答時間(最大)26.24s
応答時間(合計)29.99s
-
コーディング
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 3
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.37s
応答時間(最大)10.37s
応答時間(合計)10.37s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)10.84s
応答時間(最大)10.84s
応答時間(合計)10.84s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)7.01s
応答時間(最大)7.01s
応答時間(合計)7.01s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.34s
応答時間(最大)9.34s
応答時間(合計)9.34s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.26s
応答時間(最大)3.26s
応答時間(合計)3.26s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.88s
応答時間(最大)4.23s
応答時間(合計)7.77s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.96s
応答時間(最大)11.96s
応答時間(合計)11.96s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #138#138 |
Ling-2.6-flashnone
|
5.0… |
Inclusionai |
$0.001
↑
…
|
9.34s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9 API エラー: 2 指示に従っていない: 2 無効なツール呼び出し: 2
応答時間(平均)9.34s
応答時間(最大)35.34s
応答時間(合計)177.48s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 15
- 試行ごとの合格率
- 31.8%
- 入力トークン
- 40,718
- 出力トークン
- 2,878
- 推論トークン
- 0
- 応答時間(平均)
- 9.34s
- 応答時間(合計)
- 177.48s
- 応答時間(最大)
- 35.34s
-
反AIトリック
: 6.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)11.81s
応答時間(最大)16.60s
応答時間(合計)47.23s
-
コーディング
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 2
応答時間(平均)11.21s
応答時間(最大)11.21s
応答時間(合計)11.21s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)35.34s
応答時間(最大)35.34s
応答時間(合計)35.34s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)8.48s
応答時間(最大)12.71s
応答時間(合計)16.96s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)4.95s
応答時間(最大)7.65s
応答時間(合計)14.84s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.45s
応答時間(最大)1.45s
応答時間(合計)1.45s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.52s
応答時間(最大)8.19s
応答時間(合計)11.04s
-
パズル解決
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)6.51s
応答時間(最大)17.06s
応答時間(合計)19.54s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)18.80s
応答時間(最大)18.80s
応答時間(合計)18.80s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.06s
応答時間(最大)1.06s
応答時間(合計)1.06s
|
| #132#132 |
Mistral Small 4medium
|
5.3… |
Mistral |
$0.068
…
|
9.40s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 12 API エラー: 2 指示に従っていない: 2
応答時間(平均)9.40s
応答時間(最大)59.15s
応答時間(合計)197.39s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 16
- 試行ごとの合格率
- 44.4%
- 入力トークン
- 42,576
- 出力トークン
- 24,184
- 推論トークン
- 84,678
- 応答時間(平均)
- 9.40s
- 応答時間(合計)
- 197.39s
- 応答時間(最大)
- 59.15s
-
反AIトリック
: 5.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)2.67s
応答時間(最大)5.03s
応答時間(合計)10.66s
-
コーディング
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)39.98s
応答時間(最大)59.15s
応答時間(合計)119.95s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)25.25s
応答時間(最大)25.25s
応答時間(合計)25.25s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)1.23s
応答時間(最大)1.96s
応答時間(合計)2.46s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)6.11s
応答時間(最大)13.72s
応答時間(合計)18.34s
-
汎用知能
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.05s
応答時間(最大)2.05s
応答時間(合計)2.05s
-
指示追従
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.38s
応答時間(最大)1.61s
応答時間(合計)2.75s
-
パズル解決
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)2.17s
応答時間(最大)2.60s
応答時間(合計)6.50s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.50s
応答時間(最大)3.50s
応答時間(合計)3.50s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)5.92s
応答時間(最大)5.92s
応答時間(合計)5.92s
|
| #10#10 |
Claude Opus 4.8medium
|
8.7… |
Anthropic |
$1.107
…
|
9.66s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 回答なし: 1
応答時間(平均)9.66s
応答時間(最大)38.03s
応答時間(合計)202.89s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 4
- 試行ごとの合格率
- 84.1%
- 入力トークン
- 61,007
- 出力トークン
- 26,495
- 推論トークン
- 5,901
- 応答時間(平均)
- 9.66s
- 応答時間(合計)
- 202.89s
- 応答時間(最大)
- 38.03s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.95s
応答時間(最大)5.76s
応答時間(合計)15.79s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.33s
応答時間(最大)22.27s
応答時間(合計)45.98s
-
複合
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)38.03s
応答時間(最大)38.03s
応答時間(合計)38.03s
-
データ解析と抽出
: 7.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)12.29s
応答時間(最大)19.64s
応答時間(合計)24.59s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)14.15s
応答時間(最大)28.41s
応答時間(合計)42.46s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.46s
応答時間(最大)2.46s
応答時間(合計)2.46s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.32s
応答時間(最大)5.07s
応答時間(合計)6.63s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.95s
応答時間(最大)4.33s
応答時間(合計)11.85s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.96s
応答時間(最大)8.96s
応答時間(合計)8.96s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)6.14s
応答時間(最大)6.14s
応答時間(合計)6.14s
|
| #84#84 |
Grok 4.20 Multi Agent Betamediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
6.6… |
X AI |
$5.599
↑
…
|
9.69s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 API エラー: 2 余分な書式: 2 指示に従っていない: 2
応答時間(平均)9.69s
応答時間(最大)35.28s
応答時間(合計)155.07s
…
|
- 合計テスト数
- 18
- 誤答テスト数
- 10
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 59.3%
- 入力トークン
- 721,952
- 出力トークン
- 294,668
- 推論トークン
- 305,374
- 応答時間(平均)
- 9.69s
- 応答時間(合計)
- 155.07s
- 応答時間(最大)
- 35.28s
-
反AIトリック
: 6.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)3.46s
応答時間(最大)4.38s
応答時間(合計)13.86s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)27.11s
応答時間(最大)27.11s
応答時間(合計)27.11s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.54s
応答時間(最大)7.51s
応答時間(合計)11.08s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 余分な書式: 1
応答時間(平均)24.67s
応答時間(最大)35.28s
応答時間(合計)74.02s
-
汎用知能
: 5.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)6.40s
応答時間(最大)6.40s
応答時間(合計)6.40s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.52s
応答時間(最大)3.80s
応答時間(合計)7.04s
-
パズル解決
: 6.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)5.19s
応答時間(最大)5.49s
応答時間(合計)15.57s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #13#13 |
Grok 4.20 Betamediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
8.5… |
X AI |
$0.750
↑
…
|
9.75s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 1
応答時間(平均)9.75s
応答時間(最大)31.36s
応答時間(合計)175.48s
…
|
- 合計テスト数
- 18
- 誤答テスト数
- 4
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 81.5%
- 入力トークン
- 35,955
- 出力トークン
- 1,647
- 推論トークン
- 91,565
- 応答時間(平均)
- 9.75s
- 応答時間(合計)
- 175.48s
- 応答時間(最大)
- 31.36s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.16s
応答時間(最大)3.44s
応答時間(合計)12.65s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)31.36s
応答時間(最大)31.36s
応答時間(合計)31.36s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)20.93s
応答時間(最大)20.93s
応答時間(合計)20.93s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.01s
応答時間(最大)4.27s
応答時間(合計)8.02s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)21.33s
応答時間(最大)24.21s
応答時間(合計)64.00s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.78s
応答時間(最大)5.78s
応答時間(合計)5.78s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.89s
応答時間(最大)5.89s
応答時間(合計)9.78s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.52s
応答時間(最大)4.53s
応答時間(合計)10.57s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)12.39s
応答時間(最大)12.39s
応答時間(合計)12.39s
|
| #6#6 |
GPT-5.5low
|
9.0… |
OpenAI |
$0.907
…
|
9.76s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)9.76s
応答時間(最大)56.19s
応答時間(合計)204.92s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 3
- 試行ごとの合格率
- 85.7%
- 入力トークン
- 34,209
- 出力トークン
- 2,046
- 推論トークン
- 22,460
- 応答時間(平均)
- 9.76s
- 応答時間(合計)
- 204.92s
- 応答時間(最大)
- 56.19s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.41s
応答時間(最大)6.32s
応答時間(合計)17.64s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.04s
応答時間(最大)21.06s
応答時間(合計)45.11s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.56s
応答時間(最大)9.56s
応答時間(合計)9.56s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.28s
応答時間(最大)5.13s
応答時間(合計)6.56s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)28.05s
応答時間(最大)56.19s
応答時間(合計)84.16s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.17s
応答時間(最大)5.17s
応答時間(合計)5.17s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.74s
応答時間(最大)3.99s
応答時間(合計)7.48s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.74s
応答時間(最大)5.61s
応答時間(合計)14.21s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.96s
応答時間(最大)4.96s
応答時間(合計)4.96s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.06s
応答時間(最大)10.06s
応答時間(合計)10.06s
|
| #121#121 |
Owl Alphanone
|
5.5… |
Openrouter |
$0.000
…
|
9.88s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 10 指示に従っていない: 3 余分な書式: 1
応答時間(平均)9.88s
応答時間(最大)47.10s
応答時間(合計)207.38s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 14
- 試行ごとの合格率
- 36.5%
- 入力トークン
- 42,283
- 出力トークン
- 5,913
- 推論トークン
- 0
- 応答時間(平均)
- 9.88s
- 応答時間(合計)
- 207.38s
- 応答時間(最大)
- 47.10s
-
反AIトリック
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 1
応答時間(平均)2.78s
応答時間(最大)3.09s
応答時間(合計)11.10s
-
コーディング
: 5.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)36.89s
応答時間(最大)47.10s
応答時間(合計)110.66s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)21.74s
応答時間(最大)21.74s
応答時間(合計)21.74s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.60s
応答時間(最大)3.92s
応答時間(合計)7.19s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)3.00s
応答時間(最大)4.69s
応答時間(合計)8.99s
-
汎用知能
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.61s
応答時間(最大)4.61s
応答時間(合計)4.61s
-
指示追従
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.63s
応答時間(最大)2.77s
応答時間(合計)5.27s
-
パズル解決
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)4.18s
応答時間(最大)8.27s
応答時間(合計)12.54s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)22.78s
応答時間(最大)22.78s
応答時間(合計)22.78s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.50s
応答時間(最大)2.50s
応答時間(合計)2.50s
|
| #20#20 |
Gemini 3.5 Flashnone
|
8.1… |
Google |
$1.079
…
|
9.93s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 3 不正解: 3
応答時間(平均)9.93s
応答時間(最大)64.36s
応答時間(合計)178.68s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 6
- 試行ごとの合格率
- 77.8%
- 入力トークン
- 13,843
- 出力トークン
- 117,518
- 推論トークン
- 0
- 応答時間(平均)
- 9.93s
- 応答時間(合計)
- 178.68s
- 応答時間(最大)
- 64.36s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.53s
応答時間(最大)3.43s
応答時間(合計)10.12s
-
コーディング
: 8.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)34.69s
応答時間(最大)64.36s
応答時間(合計)104.06s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)8.10s
応答時間(最大)8.10s
応答時間(合計)8.10s
-
ドメイン特化
: 7.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.64s
応答時間(最大)14.00s
応答時間(合計)31.92s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.46s
応答時間(最大)3.46s
応答時間(合計)3.46s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.38s
応答時間(最大)3.40s
応答時間(合計)6.76s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.13s
応答時間(最大)3.33s
応答時間(合計)9.39s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.87s
応答時間(最大)4.87s
応答時間(合計)4.87s
|
| #79#79 |
Hunter Alphamediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
6.7… |
OpenRouter |
$0.000
…
|
10.33s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 2 タイムアウト: 2 API エラー: 1 余分な書式: 1
応答時間(平均)10.33s
応答時間(最大)30.53s
応答時間(合計)175.58s
…
|
- 合計テスト数
- 18
- 誤答テスト数
- 10
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 64.8%
- 入力トークン
- 28,927
- 出力トークン
- 4,682
- 推論トークン
- 17,969
- 応答時間(平均)
- 10.33s
- 応答時間(合計)
- 175.58s
- 応答時間(最大)
- 30.53s
-
反AIトリック
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)4.75s
応答時間(最大)7.62s
応答時間(合計)19.00s
-
コーディング
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
複合
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)30.53s
応答時間(最大)30.53s
応答時間(合計)30.53s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.16s
応答時間(最大)26.55s
応答時間(合計)46.33s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 タイムアウト: 1 不正解: 1
応答時間(平均)10.52s
応答時間(最大)18.68s
応答時間(合計)31.56s
-
汎用知能
: 7.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)6.44s
応答時間(最大)6.44s
応答時間(合計)6.44s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.18s
応答時間(最大)4.46s
応答時間(合計)8.36s
-
パズル解決
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)5.35s
応答時間(最大)6.20s
応答時間(合計)16.06s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.33s
応答時間(最大)17.33s
応答時間(合計)17.33s
|
| #111#111 |
Owl Alphamedium
|
5.7… |
Openrouter |
$0.000
…
|
11.95s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 10 指示に従っていない: 2 API エラー: 1
応答時間(平均)11.95s
応答時間(最大)58.63s
応答時間(合計)250.88s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 13
- 試行ごとの合格率
- 39.7%
- 入力トークン
- 43,478
- 出力トークン
- 2,974
- 推論トークン
- 0
- 応答時間(平均)
- 11.95s
- 応答時間(合計)
- 250.88s
- 応答時間(最大)
- 58.63s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)3.97s
応答時間(最大)7.48s
応答時間(合計)15.89s
-
コーディング
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)18.74s
応答時間(最大)30.81s
応答時間(合計)56.21s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.01s
応答時間(最大)10.01s
応答時間(合計)10.01s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)21.64s
応答時間(最大)29.16s
応答時間(合計)43.28s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)8.58s
応答時間(最大)9.48s
応答時間(合計)25.74s
-
汎用知能
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)58.63s
応答時間(最大)58.63s
応答時間(合計)58.63s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.15s
応答時間(最大)15.94s
応答時間(合計)20.30s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)3.40s
応答時間(最大)4.60s
応答時間(合計)10.19s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.26s
応答時間(最大)8.26s
応答時間(合計)8.26s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.38s
応答時間(最大)2.38s
応答時間(合計)2.38s
|
| #70#70 |
GPT-5.4 Nanomedium
|
7.0… |
OpenAI |
$0.107
…
|
11.95s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 8 指示に従っていない: 2
応答時間(平均)11.95s
応答時間(最大)94.06s
応答時間(合計)250.98s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 10
- 試行ごとの合格率
- 63.5%
- 入力トークン
- 35,434
- 出力トークン
- 3,014
- 推論トークン
- 76,520
- 応答時間(平均)
- 11.95s
- 応答時間(合計)
- 250.98s
- 応答時間(最大)
- 94.06s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.52s
応答時間(最大)7.74s
応答時間(合計)18.10s
-
コーディング
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)19.12s
応答時間(最大)28.80s
応答時間(合計)57.37s
-
複合
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)24.13s
応答時間(最大)24.13s
応答時間(合計)24.13s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.54s
応答時間(最大)3.33s
応答時間(合計)5.08s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)38.18s
応答時間(最大)94.06s
応答時間(合計)114.53s
-
汎用知能
: 4.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.15s
応答時間(最大)4.15s
応答時間(合計)4.15s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.88s
応答時間(最大)2.61s
応答時間(合計)3.75s
-
パズル解決
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)3.79s
応答時間(最大)4.02s
応答時間(合計)11.36s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.71s
応答時間(最大)7.71s
応答時間(合計)7.71s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.81s
応答時間(最大)4.81s
応答時間(合計)4.81s
|
| #113#113 |
DeepSeek V4 Pronone
|
5.7… |
DeepSeek |
$0.025
↓
…
|
12.38s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 10 指示に従っていない: 2 API エラー: 1 余分な書式: 1
応答時間(平均)12.38s
応答時間(最大)58.65s
応答時間(合計)260.06s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 14
- 試行ごとの合格率
- 42.9%
- 入力トークン
- 44,845
- 出力トークン
- 5,349
- 推論トークン
- 0
- 応答時間(平均)
- 12.38s
- 応答時間(合計)
- 260.06s
- 応答時間(最大)
- 58.65s
-
反AIトリック
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 1
応答時間(平均)14.02s
応答時間(最大)38.83s
応答時間(合計)56.07s
-
コーディング
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)6.11s
応答時間(最大)14.69s
応答時間(合計)18.33s
-
複合
: 9.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)25.49s
応答時間(最大)25.49s
応答時間(合計)25.49s
-
データ解析と抽出
: 6.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)30.54s
応答時間(最大)58.65s
応答時間(合計)61.08s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)3.17s
応答時間(最大)6.59s
応答時間(合計)9.52s
-
汎用知能
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)3.75s
応答時間(最大)3.75s
応答時間(合計)3.75s
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)8.23s
応答時間(最大)13.43s
応答時間(合計)16.45s
-
パズル解決
: 7.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)15.95s
応答時間(最大)27.12s
応答時間(合計)47.86s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.92s
応答時間(最大)5.92s
応答時間(合計)5.92s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)15.59s
応答時間(最大)15.59s
応答時間(合計)15.59s
|
| #156#156 |
Hy3 previewnoneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
4.4… |
Tencent |
$0.003
…
|
12.92s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 8 API エラー: 4 指示に従っていない: 4 余分な書式: 1
応答時間(平均)12.92s
応答時間(最大)35.84s
応答時間(合計)232.64s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 17
- 試行ごとの合格率
- 23.8%
- 入力トークン
- 27,172
- 出力トークン
- 2,661
- 推論トークン
- 0
- 応答時間(平均)
- 12.92s
- 応答時間(合計)
- 232.64s
- 応答時間(最大)
- 35.84s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2 不正解: 1
応答時間(平均)11.10s
応答時間(最大)26.88s
応答時間(合計)44.41s
-
コーディング
: 2.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 2 不正解: 1
応答時間(平均)4.56s
応答時間(最大)4.56s
応答時間(合計)4.56s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)35.84s
応答時間(最大)35.84s
応答時間(合計)35.84s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)2.85s
応答時間(最大)2.85s
応答時間(合計)2.85s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 API エラー: 1
応答時間(平均)17.61s
応答時間(最大)25.68s
応答時間(合計)52.82s
-
汎用知能
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)16.07s
応答時間(最大)16.07s
応答時間(合計)16.07s
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)12.98s
応答時間(最大)23.51s
応答時間(合計)25.95s
-
パズル解決
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)4.56s
応答時間(最大)7.35s
応答時間(合計)13.67s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)33.76s
応答時間(最大)33.76s
応答時間(合計)33.76s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.71s
応答時間(最大)2.71s
応答時間(合計)2.71s
|
| #135#135 |
Kimi K2.5none
|
5.2… |
Moonshot AI |
$0.028
↑
…
|
13.18s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 15
応答時間(平均)13.18s
応答時間(最大)42.13s
応答時間(合計)184.47s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 15
- 試行ごとの合格率
- 34.9%
- 入力トークン
- 36,034
- 出力トークン
- 6,657
- 推論トークン
- 0
- 応答時間(平均)
- 13.18s
- 応答時間(合計)
- 184.47s
- 応答時間(最大)
- 42.13s
-
反AIトリック
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)6.24s
応答時間(最大)11.38s
応答時間(合計)12.48s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)24.56s
応答時間(最大)38.78s
応答時間(合計)73.69s
-
複合
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)19.16s
応答時間(最大)19.16s
応答時間(合計)19.16s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)42.13s
応答時間(最大)42.13s
応答時間(合計)42.13s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)4.38s
応答時間(最大)4.38s
応答時間(合計)4.38s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.00s
応答時間(最大)4.00s
応答時間(合計)4.00s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.67s
応答時間(最大)2.67s
応答時間(合計)2.67s
-
パズル解決
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)4.04s
応答時間(最大)7.81s
応答時間(合計)8.08s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.99s
応答時間(最大)13.99s
応答時間(合計)13.99s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.90s
応答時間(最大)3.90s
応答時間(合計)3.90s
|
| #124#124 |
Kimi K2.6none
|
5.5… |
Moonshot AI |
$0.079
↓
…
|
13.27s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 11 指示に従っていない: 3
応答時間(平均)13.27s
応答時間(最大)238.89s
応答時間(合計)278.57s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 14
- 試行ごとの合格率
- 36.5%
- 入力トークン
- 32,916
- 出力トークン
- 16,410
- 推論トークン
- 0
- 応答時間(平均)
- 13.27s
- 応答時間(合計)
- 278.57s
- 応答時間(最大)
- 238.89s
-
反AIトリック
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.39s
応答時間(最大)2.96s
応答時間(合計)5.56s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)82.57s
応答時間(最大)238.89s
応答時間(合計)247.72s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.38s
応答時間(最大)3.38s
応答時間(合計)3.38s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.32s
応答時間(最大)1.39s
応答時間(合計)2.64s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.48s
応答時間(最大)1.85s
応答時間(合計)4.45s
-
汎用知能
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.55s
応答時間(最大)1.55s
応答時間(合計)1.55s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.64s
応答時間(最大)1.80s
応答時間(合計)3.28s
-
パズル解決
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)1.40s
応答時間(最大)1.81s
応答時間(合計)4.19s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.46s
応答時間(最大)4.46s
応答時間(合計)4.46s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.36s
応答時間(最大)1.36s
応答時間(合計)1.36s
|
| #133#133 |
DeepSeek V3.2none
|
5.2… |
DeepSeek |
$0.017
↓
…
|
13.83s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 7 API エラー: 4 余分な書式: 2 指示に従っていない: 1 無効なツール呼び出し: 1
応答時間(平均)13.83s
応答時間(最大)115.89s
応答時間(合計)290.43s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 15
- 試行ごとの合格率
- 39.7%
- 入力トークン
- 55,997
- 出力トークン
- 11,165
- 推論トークン
- 0
- 応答時間(平均)
- 13.83s
- 応答時間(合計)
- 290.43s
- 応答時間(最大)
- 115.89s
-
反AIトリック
: 3.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 2 API エラー: 1 不正解: 1
応答時間(平均)9.35s
応答時間(最大)16.77s
応答時間(合計)37.40s
-
コーディング
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)14.54s
応答時間(最大)34.11s
応答時間(合計)43.62s
-
複合
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)115.89s
応答時間(最大)115.89s
応答時間(合計)115.89s
-
データ解析と抽出
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)9.42s
応答時間(最大)16.20s
応答時間(合計)18.84s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 API エラー: 1
応答時間(平均)4.17s
応答時間(最大)9.09s
応答時間(合計)12.51s
-
汎用知能
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)9.32s
応答時間(最大)9.32s
応答時間(合計)9.32s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.52s
応答時間(最大)1.99s
応答時間(合計)3.04s
-
パズル解決
: 7.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)6.91s
応答時間(最大)10.09s
応答時間(合計)20.74s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.85s
応答時間(最大)11.85s
応答時間(合計)11.85s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)17.23s
応答時間(最大)17.23s
応答時間(合計)17.23s
|
| #92#92 |
Laguna M.1mediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
6.4… |
Poolside |
$0.000
…
|
14.73s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 4 不正解: 4 指示に従っていない: 1 回答なし: 1
応答時間(平均)14.73s
応答時間(最大)53.14s
応答時間(合計)220.93s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 10
- 試行ごとの合格率
- 52.6%
- 入力トークン
- 44,969
- 出力トークン
- 58,087
- 推論トークン
- 0
- 応答時間(平均)
- 14.73s
- 応答時間(合計)
- 220.93s
- 応答時間(最大)
- 53.14s
-
反AIトリック
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)4.87s
応答時間(最大)6.30s
応答時間(合計)14.62s
-
コーディング
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)35.61s
応答時間(最大)35.61s
応答時間(合計)35.61s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)53.14s
応答時間(最大)53.14s
応答時間(合計)53.14s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.93s
応答時間(最大)5.03s
応答時間(合計)9.86s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)24.14s
応答時間(最大)45.83s
応答時間(合計)72.43s
-
汎用知能
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.30s
応答時間(最大)6.00s
応答時間(合計)8.59s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)10.19s
応答時間(最大)14.92s
応答時間(合計)20.37s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.31s
応答時間(最大)6.31s
応答時間(合計)6.31s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|