| #1🥇 #1 |
Gemini 3 Flash Previewmedium
|
10.0… |
Google |
$0.108… |
12.11s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.11s
応答時間(最大)82.37s
応答時間(合計)217.93s
…
|
合計テスト数: 18
誤答テスト数: 0
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 100.0%
不安定なテスト: 0…
出力トークン: 655
推論トークン: 33,749
応答時間: 平均 12.11s · 合計 217.93s · 最大 82.37s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.26s
応答時間(最大)5.01s
応答時間(合計)13.04s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)82.37s
応答時間(最大)82.37s
応答時間(合計)82.37s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.58s
応答時間(最大)23.58s
応答時間(合計)23.58s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.62s
応答時間(最大)8.37s
応答時間(合計)15.24s
-
ドメイン特化
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.81s
応答時間(最大)32.44s
応答時間(合計)44.43s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.34s
応答時間(最大)6.34s
応答時間(合計)6.34s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.30s
応答時間(最大)5.19s
応答時間(合計)8.59s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.86s
応答時間(最大)7.59s
応答時間(合計)14.57s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.78s
応答時間(最大)9.78s
応答時間(合計)9.78s
|
| #2🥈 #2 |
Gemini 3.1 Pro Previewmedium
|
9.6… |
Google |
$0.578… |
15.96s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)15.96s
応答時間(最大)40.61s
応答時間(合計)175.52s
…
|
合計テスト数: 18
誤答テスト数: 1
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 94.4%
不安定なテスト: 0…
出力トークン: 1,932
推論トークン: 40,542
応答時間: 平均 15.96s · 合計 175.52s · 最大 40.61s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.90s
応答時間(最大)9.52s
応答時間(合計)15.80s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)19.88s
応答時間(最大)19.88s
応答時間(合計)19.88s
-
複合
: 9.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)40.61s
応答時間(最大)40.61s
応答時間(合計)40.61s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.72s
応答時間(最大)7.72s
応答時間(合計)7.72s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)32.73s
応答時間(最大)32.73s
応答時間(合計)32.73s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.77s
応答時間(最大)11.77s
応答時間(合計)11.77s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.56s
応答時間(最大)9.56s
応答時間(合計)9.56s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.15s
応答時間(最大)8.49s
応答時間(合計)14.30s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.15s
応答時間(最大)23.15s
応答時間(合計)23.15s
|
| #3🥉 #3 |
Claude Opus 4.7medium
|
9.2… |
Anthropic |
$0.447… |
3.53s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)3.53s
応答時間(最大)21.45s
応答時間(合計)60.03s
…
|
合計テスト数: 18
誤答テスト数: 2
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 88.9%
不安定なテスト: 0…
出力トークン: 5,375
推論トークン: 1,341
応答時間: 平均 3.53s · 合計 60.03s · 最大 21.45s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.85s
応答時間(最大)2.71s
応答時間(合計)7.38s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.41s
応答時間(最大)6.41s
応答時間(合計)6.41s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)21.45s
応答時間(最大)21.45s
応答時間(合計)21.45s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.37s
応答時間(最大)3.30s
応答時間(合計)4.74s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)1.17s
応答時間(最大)1.40s
応答時間(合計)2.35s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.87s
応答時間(最大)2.87s
応答時間(合計)2.87s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.57s
応答時間(最大)1.66s
応答時間(合計)3.14s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.51s
応答時間(最大)2.89s
応答時間(合計)7.54s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.17s
応答時間(最大)4.17s
応答時間(合計)4.17s
|
| #4#4 |
Claude Opus 4.7none
|
9.2… |
Anthropic |
$0.505… |
3.13s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)3.13s
応答時間(最大)18.27s
応答時間(合計)56.33s
…
|
合計テスト数: 18
誤答テスト数: 2
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 88.9%
不安定なテスト: 0…
出力トークン: 6,326
推論トークン: 0
応答時間: 平均 3.13s · 合計 56.33s · 最大 18.27s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.12s
応答時間(最大)3.75s
応答時間(合計)8.50s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.84s
応答時間(最大)2.84s
応答時間(合計)2.84s
-
複合
: 9.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)18.27s
応答時間(最大)18.27s
応答時間(合計)18.27s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.15s
応答時間(最大)2.33s
応答時間(合計)4.29s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.19s
応答時間(最大)1.40s
応答時間(合計)3.58s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.47s
応答時間(最大)3.47s
応答時間(合計)3.47s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.46s
応答時間(最大)1.68s
応答時間(合計)2.91s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.58s
応答時間(最大)4.07s
応答時間(合計)7.73s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.74s
応答時間(最大)4.74s
応答時間(合計)4.74s
|
| #5#5 |
GPT-5.5medium
|
9.0… |
OpenAI |
$2.884… |
32.75s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)32.75s
応答時間(最大)332.10s
応答時間(合計)589.59s
…
|
合計テスト数: 18
誤答テスト数: 3
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 87.0%
不安定なテスト: 2…
出力トークン: 1,920
推論トークン: 89,632
応答時間: 平均 32.75s · 合計 589.59s · 最大 332.10s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.66s
応答時間(最大)6.74s
応答時間(合計)18.65s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.09s
応答時間(最大)9.09s
応答時間(合計)9.09s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)19.29s
応答時間(最大)19.29s
応答時間(合計)19.29s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.18s
応答時間(最大)4.35s
応答時間(合計)8.36s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)164.14s
応答時間(最大)332.10s
応答時間(合計)492.41s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.16s
応答時間(最大)4.16s
応答時間(合計)4.16s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.36s
応答時間(最大)3.46s
応答時間(合計)6.73s
-
パズル解決
: 8.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)6.78s
応答時間(最大)10.54s
応答時間(合計)20.33s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)10.57s
応答時間(最大)10.57s
応答時間(合計)10.57s
|
| #6#6 |
Gemini 3 Flash Previewlow
|
8.8… |
Google |
$0.091… |
6.01s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)6.01s
応答時間(最大)14.72s
応答時間(合計)108.12s
…
|
合計テスト数: 18
誤答テスト数: 3
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 85.2%
不安定なテスト: 1…
出力トークン: 2,018
推論トークン: 23,273
応答時間: 平均 6.01s · 合計 108.12s · 最大 14.72s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.48s
応答時間(最大)4.31s
応答時間(合計)13.94s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.94s
応答時間(最大)6.94s
応答時間(合計)6.94s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.27s
応答時間(最大)3.27s
応答時間(合計)3.27s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.40s
応答時間(最大)14.72s
応答時間(合計)18.80s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)8.05s
応答時間(最大)14.40s
応答時間(合計)24.15s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.68s
応答時間(最大)3.68s
応答時間(合計)3.68s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.02s
応答時間(最大)7.35s
応答時間(合計)14.03s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.11s
応答時間(最大)10.27s
応答時間(合計)18.32s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.99s
応答時間(最大)4.99s
応答時間(合計)4.99s
|
| #7#7 |
Seed-2.0-Litemedium
|
8.6… |
Bytedance Seed |
$0.121… |
30.37s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 2
応答時間(平均)30.37s
応答時間(最大)168.71s
応答時間(合計)546.72s
…
|
合計テスト数: 18
誤答テスト数: 5
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 83.3%
不安定なテスト: 3…
出力トークン: 3,257
推論トークン: 52,042
応答時間: 平均 30.37s · 合計 546.72s · 最大 168.71s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)17.99s
応答時間(最大)48.33s
応答時間(合計)71.98s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)74.49s
応答時間(最大)74.49s
応答時間(合計)74.49s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)37.67s
応答時間(最大)37.67s
応答時間(合計)37.67s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.07s
応答時間(最大)12.19s
応答時間(合計)18.14s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)88.74s
応答時間(最大)168.71s
応答時間(合計)266.21s
-
汎用知能
: 6.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)18.25s
応答時間(最大)18.25s
応答時間(合計)18.25s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.26s
応答時間(最大)9.02s
応答時間(合計)14.52s
-
パズル解決
: 9.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)11.03s
応答時間(最大)13.85s
応答時間(合計)33.09s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.38s
応答時間(最大)12.38s
応答時間(合計)12.38s
|
| #8#8 |
GPT-5.3-Codexmedium
|
8.6… |
OpenAI |
$0.573… |
15.38s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 2
応答時間(平均)15.38s
応答時間(最大)100.93s
応答時間(合計)276.91s
…
|
合計テスト数: 18
誤答テスト数: 5
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 83.3%
不安定なテスト: 3…
出力トークン: 2,279
推論トークン: 35,179
応答時間: 平均 15.38s · 合計 276.91s · 最大 100.93s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.16s
応答時間(最大)6.68s
応答時間(合計)16.63s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.95s
応答時間(最大)8.95s
応答時間(合計)8.95s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)19.56s
応答時間(最大)19.56s
応答時間(合計)19.56s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.07s
応答時間(最大)3.59s
応答時間(合計)6.15s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)64.31s
応答時間(最大)100.93s
応答時間(合計)192.94s
-
汎用知能
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.87s
応答時間(最大)4.87s
応答時間(合計)4.87s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.04s
応答時間(最大)3.44s
応答時間(合計)6.07s
-
パズル解決
: 9.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)5.12s
応答時間(最大)8.73s
応答時間(合計)15.37s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.37s
応答時間(最大)6.37s
応答時間(合計)6.37s
|
| #9#9 |
Qwen3.5 Plus 2026-02-15medium
|
8.5… |
Qwen |
$0.220… |
46.56s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2 不正解: 2
応答時間(平均)46.56s
応答時間(最大)120.91s
応答時間(合計)512.20s
…
|
合計テスト数: 18
誤答テスト数: 4
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 83.3%
不安定なテスト: 2…
出力トークン: 2,121
推論トークン: 111,889
応答時間: 平均 46.56s · 合計 512.20s · 最大 120.91s
-
反AIトリック
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)45.78s
応答時間(最大)81.20s
応答時間(合計)91.57s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)120.91s
応答時間(最大)120.91s
応答時間(合計)120.91s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)46.85s
応答時間(最大)46.85s
応答時間(合計)46.85s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)46.91s
応答時間(最大)46.91s
応答時間(合計)46.91s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)17.50s
応答時間(最大)17.50s
応答時間(合計)17.50s
-
汎用知能
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)79.86s
応答時間(最大)79.86s
応答時間(合計)79.86s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)31.93s
応答時間(最大)31.93s
応答時間(合計)31.93s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)34.57s
応答時間(最大)49.12s
応答時間(合計)69.13s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.54s
応答時間(最大)7.54s
応答時間(合計)7.54s
|
| #10#10 |
HY3 Previewhigh
|
8.5… |
Tencent |
$0.000… |
55.19s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2 不正解: 2 API エラー: 1
応答時間(平均)55.19s
応答時間(最大)149.94s
応答時間(合計)938.23s
…
|
合計テスト数: 18
誤答テスト数: 5
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 81.5%
不安定なテスト: 3…
出力トークン: 238,920
推論トークン: 0
応答時間: 平均 55.19s · 合計 938.23s · 最大 149.94s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)32.69s
応答時間(最大)85.41s
応答時間(合計)130.78s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)99.76s
応答時間(最大)99.76s
応答時間(合計)99.76s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)113.09s
応答時間(最大)113.09s
応答時間(合計)113.09s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)12.11s
応答時間(最大)12.11s
応答時間(合計)12.11s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)109.04s
応答時間(最大)149.94s
応答時間(合計)327.11s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)24.31s
応答時間(最大)24.31s
応答時間(合計)24.31s
-
指示追従
: 8.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)34.02s
応答時間(最大)41.83s
応答時間(合計)68.04s
-
パズル解決
: 9.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)28.07s
応答時間(最大)45.06s
応答時間(合計)84.21s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)78.83s
応答時間(最大)78.83s
応答時間(合計)78.83s
|
| #11#11 |
Qwen3.6 Plus Previewmedium
|
8.5… |
Qwen |
$0.000… |
13.94s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 1
応答時間(平均)13.94s
応答時間(最大)43.55s
応答時間(合計)237.01s
…
|
合計テスト数: 17
誤答テスト数: 4
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 76.5%
不安定なテスト: 0…
出力トークン: 1,756
推論トークン: 77,213
応答時間: 平均 13.94s · 合計 237.01s · 最大 43.55s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.90s
応答時間(最大)19.37s
応答時間(合計)39.60s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)34.95s
応答時間(最大)34.95s
応答時間(合計)34.95s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.95s
応答時間(最大)15.40s
応答時間(合計)29.90s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)22.08s
応答時間(最大)43.55s
応答時間(合計)66.23s
-
汎用知能
: 5.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)27.05s
応答時間(最大)27.05s
応答時間(合計)27.05s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.54s
応答時間(最大)11.67s
応答時間(合計)15.07s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.11s
応答時間(最大)7.52s
応答時間(合計)18.34s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.87s
応答時間(最大)5.87s
応答時間(合計)5.87s
|
| #12#12 |
Qwen3.5-27Bmedium
|
8.4… |
Qwen |
$0.497… |
53.03s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2 余分な書式: 1 タイムアウト: 1 不正解: 1
応答時間(平均)53.03s
応答時間(最大)163.96s
応答時間(合計)954.46s
…
|
合計テスト数: 18
誤答テスト数: 5
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 81.5%
不安定なテスト: 3…
出力トークン: 2,500
推論トークン: 242,500
応答時間: 平均 53.03s · 合計 954.46s · 最大 163.96s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)19.75s
応答時間(最大)49.95s
応答時間(合計)79.01s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)70.35s
応答時間(最大)70.35s
応答時間(合計)70.35s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)163.96s
応答時間(最大)163.96s
応答時間(合計)163.96s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)30.26s
応答時間(最大)32.03s
応答時間(合計)60.52s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)79.53s
応答時間(最大)95.52s
応答時間(合計)238.59s
-
汎用知能
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)101.41s
応答時間(最大)101.41s
応答時間(合計)101.41s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)19.66s
応答時間(最大)32.25s
応答時間(合計)39.32s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)64.61s
応答時間(最大)123.57s
応答時間(合計)193.84s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.45s
応答時間(最大)7.45s
応答時間(合計)7.45s
|
| #13#13 |
Gemini 3.1 Flash Lite Previewhighアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
8.4… |
Google |
$2.310… |
68.83s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 1
応答時間(平均)68.83s
応答時間(最大)280.52s
応答時間(合計)1101.32s
…
|
合計テスト数: 16
誤答テスト数: 4
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 77.1%
不安定なテスト: 1…
出力トークン: 1,283
推論トークン: 1,533,310
応答時間: 平均 68.83s · 合計 1101.32s · 最大 280.52s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)43.87s
応答時間(最大)121.88s
応答時間(合計)131.62s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)280.52s
応答時間(最大)280.52s
応答時間(合計)280.52s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.16s
応答時間(最大)8.54s
応答時間(合計)14.31s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)127.58s
応答時間(最大)133.93s
応答時間(合計)382.74s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.25s
応答時間(最大)5.25s
応答時間(合計)5.25s
-
指示追従
: 7.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)70.07s
応答時間(最大)136.53s
応答時間(合計)140.14s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)46.33s
応答時間(最大)134.22s
応答時間(合計)139.00s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.73s
応答時間(最大)7.73s
応答時間(合計)7.73s
|
| #14#14 |
Gemini 3 PRO Previewmedium
|
8.4… |
Google |
$0.197… |
9.06s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 API エラー: 1
応答時間(平均)9.06s
応答時間(最大)26.24s
応答時間(合計)90.58s
…
|
合計テスト数: 18
誤答テスト数: 4
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 77.8%
不安定なテスト: 0…
出力トークン: 1,508
推論トークン: 10,084
応答時間: 平均 9.06s · 合計 90.58s · 最大 26.24s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.99s
応答時間(最大)26.24s
応答時間(合計)29.99s
-
コーディング
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.37s
応答時間(最大)10.37s
応答時間(合計)10.37s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)10.84s
応答時間(最大)10.84s
応答時間(合計)10.84s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)7.01s
応答時間(最大)7.01s
応答時間(合計)7.01s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.34s
応答時間(最大)9.34s
応答時間(合計)9.34s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.26s
応答時間(最大)3.26s
応答時間(合計)3.26s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.91s
応答時間(最大)4.23s
応答時間(合計)7.81s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.96s
応答時間(最大)11.96s
応答時間(合計)11.96s
|
| #15#15 |
GLM 5medium
|
8.4… |
Z.ai |
$0.155… |
23.34s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1 回答なし: 1 タイムアウト: 1
応答時間(平均)23.34s
応答時間(最大)79.09s
応答時間(合計)233.40s
…
|
合計テスト数: 18
誤答テスト数: 5
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 85.2%
不安定なテスト: 4…
出力トークン: 20,163
推論トークン: 58,337
応答時間: 平均 23.34s · 合計 233.40s · 最大 79.09s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.66s
応答時間(最大)25.06s
応答時間(合計)47.32s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)79.09s
応答時間(最大)79.09s
応答時間(合計)79.09s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)28.96s
応答時間(最大)28.96s
応答時間(合計)28.96s
-
データ解析と抽出
: 7.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)8.90s
応答時間(最大)8.90s
応答時間(合計)8.90s
-
ドメイン特化
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
汎用知能
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)14.69s
応答時間(最大)14.69s
応答時間(合計)14.69s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.25s
応答時間(最大)7.25s
応答時間(合計)7.25s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.64s
応答時間(最大)16.34s
応答時間(合計)31.27s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.93s
応答時間(最大)15.93s
応答時間(合計)15.93s
|
| #16#16 |
Gemma 4 31Bmedium
|
8.3… |
Google |
$0.018… |
24.88s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 2 指示に従っていない: 1 タイムアウト: 1 不正解: 1
応答時間(平均)24.88s
応答時間(最大)70.97s
応答時間(合計)398.13s
…
|
合計テスト数: 18
誤答テスト数: 5
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 79.6%
不安定なテスト: 2…
出力トークン: 12,734
推論トークン: 27,950
応答時間: 平均 24.88s · 合計 398.13s · 最大 70.97s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.89s
応答時間(最大)26.66s
応答時間(合計)51.55s
-
コーディング
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)70.97s
応答時間(最大)70.97s
応答時間(合計)70.97s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)21.11s
応答時間(最大)21.94s
応答時間(合計)42.21s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)38.48s
応答時間(最大)68.92s
応答時間(合計)115.43s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.57s
応答時間(最大)9.57s
応答時間(合計)9.57s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.76s
応答時間(最大)17.53s
応答時間(合計)25.52s
-
パズル解決
: 8.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)27.63s
応答時間(最大)61.08s
応答時間(合計)82.89s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #17#17 |
Gemini 2.5 Flashmedium
|
8.2… |
Google |
$0.319… |
12.12s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 1
応答時間(平均)12.12s
応答時間(最大)95.48s
応答時間(合計)218.12s
…
|
合計テスト数: 18
誤答テスト数: 5
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 75.9%
不安定なテスト: 1…
出力トークン: 1,898
推論トークン: 122,273
応答時間: 平均 12.12s · 合計 218.12s · 最大 95.48s
-
反AIトリック
: 8.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.30s
応答時間(最大)15.56s
応答時間(合計)25.21s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)16.23s
応答時間(最大)16.23s
応答時間(合計)16.23s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)28.44s
応答時間(最大)28.44s
応答時間(合計)28.44s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.06s
応答時間(最大)5.06s
応答時間(合計)8.11s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)37.34s
応答時間(最大)95.48s
応答時間(合計)112.01s
-
汎用知能
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.86s
応答時間(最大)4.86s
応答時間(合計)4.86s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.62s
応答時間(最大)2.78s
応答時間(合計)5.24s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.94s
応答時間(最大)6.33s
応答時間(合計)11.83s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.20s
応答時間(最大)6.20s
応答時間(合計)6.20s
|
| #18#18 |
GPT-5.4medium
|
8.2… |
OpenAI |
$0.832… |
18.63s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 2
応答時間(平均)18.63s
応答時間(最大)100.41s
応答時間(合計)335.26s
…
|
合計テスト数: 18
誤答テスト数: 5
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 79.6%
不安定なテスト: 3…
出力トークン: 2,169
推論トークン: 48,732
応答時間: 平均 18.63s · 合計 335.26s · 最大 100.41s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.11s
応答時間(最大)6.42s
応答時間(合計)16.42s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.03s
応答時間(最大)13.03s
応答時間(合計)13.03s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)20.57s
応答時間(最大)20.57s
応答時間(合計)20.57s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.32s
応答時間(最大)5.40s
応答時間(合計)10.64s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)74.27s
応答時間(最大)100.41s
応答時間(合計)222.80s
-
汎用知能
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.92s
応答時間(最大)4.92s
応答時間(合計)4.92s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.11s
応答時間(最大)3.68s
応答時間(合計)6.22s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)9.13s
応答時間(最大)18.14s
応答時間(合計)27.39s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.28s
応答時間(最大)13.28s
応答時間(合計)13.28s
|
| #19#19 |
Gemini 3.1 Flash Lite Previewmedium
|
8.2… |
Google |
$0.055… |
3.74s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 1
応答時間(平均)3.74s
応答時間(最大)14.93s
応答時間(合計)67.31s
…
|
合計テスト数: 18
誤答テスト数: 5
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 72.2%
不安定なテスト: 0…
出力トークン: 2,168
推論トークン: 29,030
応答時間: 平均 3.74s · 合計 67.31s · 最大 14.93s
-
反AIトリック
: 9.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.33s
応答時間(最大)3.89s
応答時間(合計)9.30s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.34s
応答時間(最大)4.34s
応答時間(合計)4.34s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.93s
応答時間(最大)14.93s
応答時間(合計)14.93s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.29s
応答時間(最大)2.31s
応答時間(合計)4.59s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)4.21s
応答時間(最大)5.86s
応答時間(合計)12.62s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.16s
応答時間(最大)3.16s
応答時間(合計)3.16s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.91s
応答時間(最大)1.93s
応答時間(合計)3.82s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.58s
応答時間(最大)4.41s
応答時間(合計)10.75s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.80s
応答時間(最大)3.80s
応答時間(合計)3.80s
|
| #20#20 |
DeepSeek V4 Prohigh
|
8.2… |
DeepSeek |
$0.160… |
71.21s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 2
応答時間(平均)71.21s
応答時間(最大)351.99s
応答時間(合計)1281.73s
…
|
合計テスト数: 18
誤答テスト数: 5
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 74.1%
不安定なテスト: 1…
出力トークン: 671
推論トークン: 39,383
応答時間: 平均 71.21s · 合計 1281.73s · 最大 351.99s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)26.93s
応答時間(最大)61.35s
応答時間(合計)107.71s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)93.00s
応答時間(最大)93.00s
応答時間(合計)93.00s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)71.08s
応答時間(最大)71.08s
応答時間(合計)71.08s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)63.00s
応答時間(最大)102.80s
応答時間(合計)126.00s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)202.56s
応答時間(最大)351.99s
応答時間(合計)607.68s
-
汎用知能
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)26.96s
応答時間(最大)26.96s
応答時間(合計)26.96s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.60s
応答時間(最大)20.03s
応答時間(合計)29.20s
-
パズル解決
: 7.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)69.69s
応答時間(最大)92.65s
応答時間(合計)209.06s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.05s
応答時間(最大)11.05s
応答時間(合計)11.05s
|
| #21#21 |
GLM 5 Turbomedium
|
8.1… |
Z.ai |
$0.182… |
17.67s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 2 タイムアウト: 1
応答時間(平均)17.67s
応答時間(最大)194.23s
応答時間(合計)317.98s
…
|
合計テスト数: 18
誤答テスト数: 6
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 77.8%
不安定なテスト: 5…
出力トークン: 12,197
推論トークン: 38,933
応答時間: 平均 17.67s · 合計 317.98s · 最大 194.23s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.82s
応答時間(最大)7.69s
応答時間(合計)19.26s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.26s
応答時間(最大)12.26s
応答時間(合計)12.26s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.88s
応答時間(最大)13.88s
応答時間(合計)13.88s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.19s
応答時間(最大)6.42s
応答時間(合計)12.38s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)71.07s
応答時間(最大)194.23s
応答時間(合計)213.22s
-
汎用知能
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.05s
応答時間(最大)10.05s
応答時間(合計)10.05s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.38s
応答時間(最大)5.70s
応答時間(合計)10.77s
-
パズル解決
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2
応答時間(平均)5.44s
応答時間(最大)7.26s
応答時間(合計)16.32s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.84s
応答時間(最大)9.84s
応答時間(合計)9.84s
|
| #22#22 |
Qwen3.5-122B-A10Bmedium
|
8.1… |
Qwen |
$0.528… |
31.38s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 タイムアウト: 2
応答時間(平均)31.38s
応答時間(最大)119.29s
応答時間(合計)564.84s
…
|
合計テスト数: 18
誤答テスト数: 5
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 79.6%
不安定なテスト: 3…
出力トークン: 17,635
推論トークン: 162,668
応答時間: 平均 31.38s · 合計 564.84s · 最大 119.29s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.75s
応答時間(最大)18.03s
応答時間(合計)39.01s
-
コーディング
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)70.98s
応答時間(最大)70.98s
応答時間(合計)70.98s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)107.79s
応答時間(最大)107.79s
応答時間(合計)107.79s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.41s
応答時間(最大)29.79s
応答時間(合計)46.83s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)63.40s
応答時間(最大)119.29s
応答時間(合計)190.20s
-
汎用知能
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)34.11s
応答時間(最大)34.11s
応答時間(合計)34.11s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.88s
応答時間(最大)15.44s
応答時間(合計)19.76s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.18s
応答時間(最大)31.99s
応答時間(合計)51.55s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.60s
応答時間(最大)4.60s
応答時間(合計)4.60s
|
| #23#23 |
Qwen3.6 Plusmedium
|
8.1… |
Qwen |
$0.000… |
15.27s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 API エラー: 1 指示に従っていない: 1
応答時間(平均)15.27s
応答時間(最大)43.55s
応答時間(合計)259.55s
…
|
合計テスト数: 18
誤答テスト数: 5
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 74.1%
不安定なテスト: 1…
出力トークン: 1,763
推論トークン: 83,782
応答時間: 平均 15.27s · 合計 259.55s · 最大 43.55s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.90s
応答時間(最大)19.37s
応答時間(合計)39.60s
-
コーディング
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)34.95s
応答時間(最大)34.95s
応答時間(合計)34.95s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.95s
応答時間(最大)15.40s
応答時間(合計)29.90s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)29.59s
応答時間(最大)43.55s
応答時間(合計)88.77s
-
汎用知能
: 5.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)27.05s
応答時間(最大)27.05s
応答時間(合計)27.05s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.54s
応答時間(最大)11.67s
応答時間(合計)15.07s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.11s
応答時間(最大)7.52s
応答時間(合計)18.34s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.87s
応答時間(最大)5.87s
応答時間(合計)5.87s
|
| #24#24 |
HY3 Previewlow
|
8.1… |
Tencent |
$0.000… |
23.98s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2 不正解: 2 API エラー: 1
応答時間(平均)23.98s
応答時間(最大)78.74s
応答時間(合計)407.72s
…
|
合計テスト数: 18
誤答テスト数: 5
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 75.9%
不安定なテスト: 1…
出力トークン: 65,778
推論トークン: 0
応答時間: 平均 23.98s · 合計 407.72s · 最大 78.74s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)16.61s
応答時間(最大)38.50s
応答時間(合計)66.46s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)27.94s
応答時間(最大)27.94s
応答時間(合計)27.94s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)78.74s
応答時間(最大)78.74s
応答時間(合計)78.74s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)5.85s
応答時間(最大)5.85s
応答時間(合計)5.85s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)40.44s
応答時間(最大)46.32s
応答時間(合計)121.31s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)16.44s
応答時間(最大)16.44s
応答時間(合計)16.44s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.98s
応答時間(最大)22.24s
応答時間(合計)31.97s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2
応答時間(平均)13.73s
応答時間(最大)25.82s
応答時間(合計)41.19s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.84s
応答時間(最大)17.84s
応答時間(合計)17.84s
|
| #25#25 |
Gemini 3 Flash Previewnone
|
8.1… |
Google |
$0.021… |
1.65s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5
応答時間(平均)1.65s
応答時間(最大)3.56s
応答時間(合計)18.20s
…
|
合計テスト数: 18
誤答テスト数: 5
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 77.8%
不安定なテスト: 2…
出力トークン: 1,840
推論トークン: 0
応答時間: 平均 1.65s · 合計 18.20s · 最大 3.56s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.25s
応答時間(最大)1.59s
応答時間(合計)2.49s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.59s
応答時間(最大)1.59s
応答時間(合計)1.59s
-
複合
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.56s
応答時間(最大)3.56s
応答時間(合計)3.56s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.41s
応答時間(最大)1.41s
応答時間(合計)1.41s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)963ms
応答時間(最大)963ms
応答時間(合計)963ms
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.13s
応答時間(最大)1.13s
応答時間(合計)1.13s
-
指示追従
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.58s
応答時間(最大)1.58s
応答時間(合計)1.58s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.06s
応答時間(最大)1.06s
応答時間(合計)2.12s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.35s
応答時間(最大)3.35s
応答時間(合計)3.35s
|
| #26#26 |
Gemini 3.1 Flash Lite Previewlow
|
8.1… |
Google |
$0.022… |
3.22s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 1
応答時間(平均)3.22s
応答時間(最大)11.91s
応答時間(合計)58.00s
…
|
合計テスト数: 18
誤答テスト数: 5
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 72.2%
不安定なテスト: 0…
出力トークン: 2,247
推論トークン: 8,058
応答時間: 平均 3.22s · 合計 58.00s · 最大 11.91s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.12s
応答時間(最大)3.18s
応答時間(合計)8.50s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.20s
応答時間(最大)2.20s
応答時間(合計)2.20s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)11.91s
応答時間(最大)11.91s
応答時間(合計)11.91s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.00s
応答時間(最大)3.74s
応答時間(合計)5.99s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)2.36s
応答時間(最大)3.51s
応答時間(合計)7.07s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.54s
応答時間(最大)1.54s
応答時間(合計)1.54s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.49s
応答時間(最大)1.66s
応答時間(合計)2.99s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.76s
応答時間(最大)5.08s
応答時間(合計)8.27s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.54s
応答時間(最大)9.54s
応答時間(合計)9.54s
|
| #27#27 |
MiMo-V2.5-Promedium
|
8.1… |
Xiaomi |
$0.201… |
16.17s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 2 指示に従っていない: 2 不正解: 2
応答時間(平均)16.17s
応答時間(最大)84.22s
応答時間(合計)291.09s
…
|
合計テスト数: 18
誤答テスト数: 6
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 75.9%
不安定なテスト: 3…
出力トークン: 2,735
推論トークン: 52,571
応答時間: 平均 16.17s · 合計 291.09s · 最大 84.22s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.95s
応答時間(最大)5.12s
応答時間(合計)11.80s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)32.58s
応答時間(最大)32.58s
応答時間(合計)32.58s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)53.36s
応答時間(最大)53.36s
応答時間(合計)53.36s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)18.81s
応答時間(最大)20.29s
応答時間(合計)37.61s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 2
応答時間(平均)37.87s
応答時間(最大)84.22s
応答時間(合計)113.60s
-
汎用知能
: 5.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.27s
応答時間(最大)4.27s
応答時間(合計)4.27s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.77s
応答時間(最大)3.21s
応答時間(合計)5.54s
-
パズル解決
: 6.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)5.16s
応答時間(最大)9.12s
応答時間(合計)15.47s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)16.87s
応答時間(最大)16.87s
応答時間(合計)16.87s
|
| #28#28 |
MiMo-V2-Promedium
|
8.1… |
Xiaomi |
$0.159… |
12.27s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 余分な書式: 1 指示に従っていない: 1 タイムアウト: 1
応答時間(平均)12.27s
応答時間(最大)64.71s
応答時間(合計)208.56s
…
|
合計テスト数: 18
誤答テスト数: 6
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 77.8%
不安定なテスト: 3…
出力トークン: 2,360
推論トークン: 38,320
応答時間: 平均 12.27s · 合計 208.56s · 最大 64.71s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.06s
応答時間(最大)4.70s
応答時間(合計)12.23s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)52.12s
応答時間(最大)52.12s
応答時間(合計)52.12s
-
複合
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)64.71s
応答時間(最大)64.71s
応答時間(合計)64.71s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)17.20s
応答時間(最大)17.44s
応答時間(合計)34.40s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)6.00s
応答時間(最大)6.14s
応答時間(合計)12.01s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.06s
応答時間(最大)4.06s
応答時間(合計)4.06s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.36s
応答時間(最大)4.35s
応答時間(合計)6.72s
-
パズル解決
: 7.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 指示に従っていない: 1
応答時間(平均)4.71s
応答時間(最大)5.23s
応答時間(合計)14.13s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.19s
応答時間(最大)8.19s
応答時間(合計)8.19s
|
| #29#29 |
HY3 Previewmedium
|
8.1… |
Tencent |
$0.000… |
14.63s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2 不正解: 2 API エラー: 1
応答時間(平均)14.63s
応答時間(最大)46.04s
応答時間(合計)248.72s
…
|
合計テスト数: 18
誤答テスト数: 5
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 74.1%
不安定なテスト: 1…
出力トークン: 65,057
推論トークン: 0
応答時間: 平均 14.63s · 合計 248.72s · 最大 46.04s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.59s
応答時間(最大)10.20s
応答時間(合計)26.37s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)31.37s
応答時間(最大)31.37s
応答時間(合計)31.37s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)46.04s
応答時間(最大)46.04s
応答時間(合計)46.04s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)5.25s
応答時間(最大)5.25s
応答時間(合計)5.25s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)22.30s
応答時間(最大)30.51s
応答時間(合計)66.90s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)16.84s
応答時間(最大)16.84s
応答時間(合計)16.84s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.16s
応答時間(最大)7.72s
応答時間(合計)12.31s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2
応答時間(平均)9.55s
応答時間(最大)14.35s
応答時間(合計)28.64s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.02s
応答時間(最大)15.02s
応答時間(合計)15.02s
|
| #30#30 |
Gemma 4 26B A4Bmedium
|
8.0… |
Google |
$0.028… |
25.03s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2 不正解: 2 指示に従っていない: 1
応答時間(平均)25.03s
応答時間(最大)147.47s
応答時間(合計)425.48s
…
|
合計テスト数: 18
誤答テスト数: 5
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 75.9%
不安定なテスト: 2…
出力トークン: 15,928
推論トークン: 44,631
応答時間: 平均 25.03s · 合計 425.48s · 最大 147.47s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.20s
応答時間(最大)9.64s
応答時間(合計)24.78s
-
コーディング
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)147.47s
応答時間(最大)147.47s
応答時間(合計)147.47s
-
複合
: 9.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)73.55s
応答時間(最大)73.55s
応答時間(合計)73.55s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)16.51s
応答時間(最大)20.57s
応答時間(合計)33.02s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)23.62s
応答時間(最大)27.00s
応答時間(合計)47.23s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)29.76s
応答時間(最大)29.76s
応答時間(合計)29.76s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.54s
応答時間(最大)21.25s
応答時間(合計)35.08s
-
パズル解決
: 7.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)8.52s
応答時間(最大)12.73s
応答時間(合計)25.56s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.01s
応答時間(最大)9.01s
応答時間(合計)9.01s
|
| #31#31 |
Grok 4.20 Betamediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
8.0… |
X AI |
$0.633… |
9.81s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 3 不正解: 3
応答時間(平均)9.81s
応答時間(最大)31.36s
応答時間(合計)176.62s
…
|
合計テスト数: 18
誤答テスト数: 6
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 74.1%
不安定なテスト: 2…
出力トークン: 1,568
推論トークン: 91,909
応答時間: 平均 9.81s · 合計 176.62s · 最大 31.36s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.16s
応答時間(最大)3.44s
応答時間(合計)12.65s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)31.36s
応答時間(最大)31.36s
応答時間(合計)31.36s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)20.93s
応答時間(最大)20.93s
応答時間(合計)20.93s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.01s
応答時間(最大)4.27s
応答時間(合計)8.02s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)21.33s
応答時間(最大)24.21s
応答時間(合計)64.00s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.78s
応答時間(最大)5.78s
応答時間(合計)5.78s
-
指示追従
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.97s
応答時間(最大)6.05s
応答時間(合計)9.94s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)3.85s
応答時間(最大)4.53s
応答時間(合計)11.55s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)12.39s
応答時間(最大)12.39s
応答時間(合計)12.39s
|
| #32#32 |
Claude Sonnet 4.6medium
|
8.0… |
Anthropic |
$1.161… |
12.66s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 2 不正解: 2 タイムアウト: 1
応答時間(平均)12.66s
応答時間(最大)46.35s
応答時間(合計)126.62s
…
|
合計テスト数: 18
誤答テスト数: 5
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 74.1%
不安定なテスト: 1…
出力トークン: 42,068
推論トークン: 26,784
応答時間: 平均 12.66s · 合計 126.62s · 最大 46.35s
-
反AIトリック
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)2.98s
応答時間(最大)4.95s
応答時間(合計)5.97s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)35.76s
応答時間(最大)35.76s
応答時間(合計)35.76s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)46.35s
応答時間(最大)46.35s
応答時間(合計)46.35s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.90s
応答時間(最大)13.90s
応答時間(合計)13.90s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 タイムアウト: 1 不正解: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.94s
応答時間(最大)4.94s
応答時間(合計)4.94s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.61s
応答時間(最大)2.61s
応答時間(合計)2.61s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.80s
応答時間(最大)5.22s
応答時間(合計)9.60s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.48s
応答時間(最大)7.48s
応答時間(合計)7.48s
|
| #33#33 |
DeepSeek V3.2medium
|
8.0… |
DeepSeek |
$0.028… |
43.49s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 タイムアウト: 2 指示に従っていない: 1
応答時間(平均)43.49s
応答時間(最大)180.92s
応答時間(合計)782.73s
…
|
合計テスト数: 18
誤答テスト数: 6
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 79.6%
不安定なテスト: 4…
出力トークン: 7,554
推論トークン: 45,588
応答時間: 平均 43.49s · 合計 782.73s · 最大 180.92s
-
反AIトリック
: 8.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)30.72s
応答時間(最大)44.23s
応答時間(合計)122.88s
-
コーディング
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)180.92s
応答時間(最大)180.92s
応答時間(合計)180.92s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)93.11s
応答時間(最大)93.11s
応答時間(合計)93.11s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)36.09s
応答時間(最大)39.12s
応答時間(合計)72.18s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)21.78s
応答時間(最大)30.66s
応答時間(合計)65.35s
-
汎用知能
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)31.30s
応答時間(最大)31.30s
応答時間(合計)31.30s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)35.78s
応答時間(最大)47.30s
応答時間(合計)71.56s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)36.87s
応答時間(最大)59.22s
応答時間(合計)110.62s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)34.81s
応答時間(最大)34.81s
応答時間(合計)34.81s
|
| #34#34 |
GPT-5.2 Chatnone
|
7.9… |
OpenAI |
$0.291… |
6.84s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 1
応答時間(平均)6.84s
応答時間(最大)38.52s
応答時間(合計)123.17s
…
|
合計テスト数: 18
誤答テスト数: 6
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 75.9%
不安定なテスト: 3…
出力トークン: 17,346
推論トークン: 0
応答時間: 平均 6.84s · 合計 123.17s · 最大 38.52s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.40s
応答時間(最大)4.78s
応答時間(合計)13.59s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.97s
応答時間(最大)8.97s
応答時間(合計)8.97s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.12s
応答時間(最大)9.12s
応答時間(合計)9.12s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.05s
応答時間(最大)3.33s
応答時間(合計)6.10s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)17.78s
応答時間(最大)38.52s
応答時間(合計)53.33s
-
汎用知能
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)3.20s
応答時間(最大)3.20s
応答時間(合計)3.20s
-
指示追従
: 7.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)5.46s
応答時間(最大)6.45s
応答時間(合計)10.92s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.42s
応答時間(最大)5.04s
応答時間(合計)13.27s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.68s
応答時間(最大)4.68s
応答時間(合計)4.68s
|
| #35#35 |
Gemini 3.1 Flash Lite Previewnone
|
7.9… |
Google |
$0.016… |
1.30s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 2
応答時間(平均)1.30s
応答時間(最大)3.39s
応答時間(合計)23.42s
…
|
合計テスト数: 18
誤答テスト数: 6
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 70.4%
不安定なテスト: 1…
出力トークン: 5,361
推論トークン: 0
応答時間: 平均 1.30s · 合計 23.42s · 最大 3.39s
-
反AIトリック
: 7.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)1.04s
応答時間(最大)1.47s
応答時間(合計)4.17s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.47s
応答時間(最大)1.47s
応答時間(合計)1.47s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.20s
応答時間(最大)3.20s
応答時間(合計)3.20s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.22s
応答時間(最大)1.33s
応答時間(合計)2.44s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)942ms
応答時間(最大)1.12s
応答時間(合計)2.83s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)741ms
応答時間(最大)741ms
応答時間(合計)741ms
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.13s
応答時間(最大)1.14s
応答時間(合計)2.27s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)972ms
応答時間(最大)1.13s
応答時間(合計)2.92s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.39s
応答時間(最大)3.39s
応答時間(合計)3.39s
|
| #36#36 |
Step 3.5 Flashmedium
|
7.9… |
Stepfun |
$0.000… |
26.78s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 3 不正解: 3
応答時間(平均)26.78s
応答時間(最大)170.45s
応答時間(合計)294.58s
…
|
合計テスト数: 17
誤答テスト数: 6
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 70.6%
不安定なテスト: 2…
出力トークン: 71,904
推論トークン: 155,607
応答時間: 平均 26.78s · 合計 294.58s · 最大 170.45s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.56s
応答時間(最大)32.30s
応答時間(合計)40.68s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)29.57s
応答時間(最大)29.57s
応答時間(合計)29.57s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.01s
応答時間(最大)15.01s
応答時間(合計)15.01s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)170.45s
応答時間(最大)170.45s
応答時間(合計)170.45s
-
汎用知能
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)6.54s
応答時間(最大)6.54s
応答時間(合計)6.54s
-
指示追従
: 8.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.98s
応答時間(最大)4.98s
応答時間(合計)4.98s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)7.72s
応答時間(最大)10.60s
応答時間(合計)15.44s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.91s
応答時間(最大)11.91s
応答時間(合計)11.91s
|
| #37#37 |
DeepSeek V4 Flashhigh
|
7.8… |
DeepSeek |
$0.021… |
47.47s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 3
応答時間(平均)47.47s
応答時間(最大)255.28s
応答時間(合計)854.45s
…
|
合計テスト数: 18
誤答テスト数: 7
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 79.6%
不安定なテスト: 5…
出力トークン: 1,757
推論トークン: 55,907
応答時間: 平均 47.47s · 合計 854.45s · 最大 255.28s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)28.51s
応答時間(最大)39.73s
応答時間(合計)114.05s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)62.48s
応答時間(最大)62.48s
応答時間(合計)62.48s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)76.57s
応答時間(最大)76.57s
応答時間(合計)76.57s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)28.03s
応答時間(最大)30.49s
応答時間(合計)56.07s
-
ドメイン特化
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)112.69s
応答時間(最大)255.28s
応答時間(合計)338.07s
-
汎用知能
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)25.15s
応答時間(最大)25.15s
応答時間(合計)25.15s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.36s
応答時間(最大)19.53s
応答時間(合計)30.73s
-
パズル解決
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2
応答時間(平均)25.53s
応答時間(最大)32.37s
応答時間(合計)76.60s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)74.73s
応答時間(最大)74.73s
応答時間(合計)74.73s
|
| #38#38 |
GLM 5V Turbomedium
|
7.8… |
Z.ai |
$0.291… |
14.96s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 2 無効なツール呼び出し: 2
応答時間(平均)14.96s
応答時間(最大)67.08s
応答時間(合計)269.32s
…
|
合計テスト数: 18
誤答テスト数: 7
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 77.8%
不安定なテスト: 6…
出力トークン: 2,351
推論トークン: 58,941
応答時間: 平均 14.96s · 合計 269.32s · 最大 67.08s
-
反AIトリック
: 7.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)10.76s
応答時間(最大)14.40s
応答時間(合計)43.02s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.78s
応答時間(最大)13.78s
応答時間(合計)13.78s
-
複合
: 6.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)15.06s
応答時間(最大)15.06s
応答時間(合計)15.06s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.60s
応答時間(最大)9.92s
応答時間(合計)19.19s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)38.15s
応答時間(最大)67.08s
応答時間(合計)114.45s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.09s
応答時間(最大)11.09s
応答時間(合計)11.09s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.74s
応答時間(最大)5.23s
応答時間(合計)7.47s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)10.91s
応答時間(最大)18.97s
応答時間(合計)32.74s
-
ツール呼び出し
: 7.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)12.53s
応答時間(最大)12.53s
応答時間(合計)12.53s
|
| #39#39 |
Qwen3.5-Flashmedium
|
7.8… |
Qwen |
$0.080… |
66.72s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 4 API エラー: 1 指示に従っていない: 1 不正解: 1
応答時間(平均)66.72s
応答時間(最大)234.29s
応答時間(合計)1201.03s
…
|
合計テスト数: 18
誤答テスト数: 7
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 81.5%
不安定なテスト: 6…
出力トークン: 2,073
推論トークン: 191,899
応答時間: 平均 66.72s · 合計 1201.03s · 最大 234.29s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)59.11s
応答時間(最大)168.31s
応答時間(合計)236.44s
-
コーディング
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)45.75s
応答時間(最大)45.75s
応答時間(合計)45.75s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.78s
応答時間(最大)17.78s
応答時間(合計)17.78s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)56.99s
応答時間(最大)80.14s
応答時間(合計)113.98s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)146.50s
応答時間(最大)234.29s
応答時間(合計)439.49s
-
汎用知能
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)40.05s
応答時間(最大)40.05s
応答時間(合計)40.05s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)63.49s
応答時間(最大)111.61s
応答時間(合計)126.98s
-
パズル解決
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2
応答時間(平均)56.74s
応答時間(最大)115.01s
応答時間(合計)170.23s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)10.33s
応答時間(最大)10.33s
応答時間(合計)10.33s
|
| #40#40 |
GLM 5.1medium
|
7.8… |
Z.ai |
$0.201… |
24.13s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 タイムアウト: 2 API エラー: 1
応答時間(平均)24.13s
応答時間(最大)118.52s
応答時間(合計)410.25s
…
|
合計テスト数: 18
誤答テスト数: 6
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 75.9%
不安定なテスト: 3…
出力トークン: 8,005
推論トークン: 49,090
応答時間: 平均 24.13s · 合計 410.25s · 最大 118.52s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.31s
応答時間(最大)14.20s
応答時間(合計)33.24s
-
コーディング
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)118.52s
応答時間(最大)118.52s
応答時間(合計)118.52s
-
複合
: 9.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)43.11s
応答時間(最大)43.11s
応答時間(合計)43.11s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.33s
応答時間(最大)9.40s
応答時間(合計)18.66s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)29.77s
応答時間(最大)32.22s
応答時間(合計)89.30s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)20.95s
応答時間(最大)20.95s
応答時間(合計)20.95s
-
指示追従
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)7.47s
応答時間(最大)10.16s
応答時間(合計)14.94s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)23.85s
応答時間(最大)33.09s
応答時間(合計)71.54s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #41#41 |
MiMo-V2.5medium
|
7.8… |
Xiaomi |
$0.253… |
13.71s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 2 不正解: 2 指示に従っていない: 1 回答なし: 1
応答時間(平均)13.71s
応答時間(最大)86.93s
応答時間(合計)246.73s
…
|
合計テスト数: 18
誤答テスト数: 6
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 74.1%
不安定なテスト: 3…
出力トークン: 2,840
推論トークン: 116,242
応答時間: 平均 13.71s · 合計 246.73s · 最大 86.93s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.98s
応答時間(最大)3.76s
応答時間(合計)7.92s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)31.48s
応答時間(最大)31.48s
応答時間(合計)31.48s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)16.86s
応答時間(最大)16.86s
応答時間(合計)16.86s
-
データ解析と抽出
: 2.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)6.33s
応答時間(最大)7.45s
応答時間(合計)12.67s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)34.53s
応答時間(最大)86.93s
応答時間(合計)103.59s
-
汎用知能
: 3.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.55s
応答時間(最大)1.55s
応答時間(合計)1.55s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.80s
応答時間(最大)1.81s
応答時間(合計)3.60s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)20.60s
応答時間(最大)57.93s
応答時間(合計)61.79s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.29s
応答時間(最大)7.29s
応答時間(合計)7.29s
|
| #42#42 |
Kimi K2.6medium
|
7.7… |
Moonshot AI |
$0.722… |
45.20s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 3 タイムアウト: 2 不正解: 2
応答時間(平均)45.20s
応答時間(最大)215.85s
応答時間(合計)768.37s
…
|
合計テスト数: 18
誤答テスト数: 7
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 74.1%
不安定なテスト: 4…
出力トークン: 80,759
推論トークン: 179,814
応答時間: 平均 45.20s · 合計 768.37s · 最大 215.85s
-
反AIトリック
: 7.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)11.59s
応答時間(最大)23.94s
応答時間(合計)46.37s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)106.96s
応答時間(最大)106.96s
応答時間(合計)106.96s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)40.96s
応答時間(最大)40.96s
応答時間(合計)40.96s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)20.38s
応答時間(最大)22.88s
応答時間(合計)40.76s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2
応答時間(平均)202.38s
応答時間(最大)215.85s
応答時間(合計)404.76s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.83s
応答時間(最大)17.83s
応答時間(合計)17.83s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.53s
応答時間(最大)19.15s
応答時間(合計)25.06s
-
パズル解決
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2 不正解: 1
応答時間(平均)25.59s
応答時間(最大)56.89s
応答時間(合計)76.76s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.92s
応答時間(最大)8.92s
応答時間(合計)8.92s
|
| #43#43 |
MiMo-V2-Omnimedium
|
7.7… |
Xiaomi |
$0.153… |
16.76s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 2 余分な書式: 1 回答なし: 1
応答時間(平均)16.76s
応答時間(最大)158.78s
応答時間(合計)301.61s
…
|
合計テスト数: 18
誤答テスト数: 7
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 61.1%
不安定なテスト: 0…
出力トークン: 928
推論トークン: 72,661
応答時間: 平均 16.76s · 合計 301.61s · 最大 158.78s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.11s
応答時間(最大)3.43s
応答時間(合計)8.43s
-
コーディング
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)68.55s
応答時間(最大)68.55s
応答時間(合計)68.55s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)19.29s
応答時間(最大)19.29s
応答時間(合計)19.29s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.29s
応答時間(最大)2.62s
応答時間(合計)4.58s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 回答なし: 1 不正解: 1
応答時間(平均)55.12s
応答時間(最大)158.78s
応答時間(合計)165.36s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.86s
応答時間(最大)2.86s
応答時間(合計)2.86s
-
指示追従
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.92s
応答時間(最大)7.14s
応答時間(合計)9.83s
-
パズル解決
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)3.88s
応答時間(最大)8.21s
応答時間(合計)11.65s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.07s
応答時間(最大)11.07s
応答時間(合計)11.07s
|
| #44#44 |
GPT-5.3 Chatnone
|
7.7… |
OpenAI |
$0.340… |
5.88s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 2
応答時間(平均)5.88s
応答時間(最大)18.33s
応答時間(合計)105.90s
…
|
合計テスト数: 18
誤答テスト数: 7
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 68.5%
不安定なテスト: 3…
出力トークン: 20,784
推論トークン: 0
応答時間: 平均 5.88s · 合計 105.90s · 最大 18.33s
-
反AIトリック
: 6.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)3.86s
応答時間(最大)7.35s
応答時間(合計)15.44s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.32s
応答時間(最大)9.32s
応答時間(合計)9.32s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.96s
応答時間(最大)11.96s
応答時間(合計)11.96s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.21s
応答時間(最大)2.52s
応答時間(合計)4.42s
-
ドメイン特化
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)13.01s
応答時間(最大)18.33s
応答時間(合計)39.04s
-
汎用知能
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.99s
応答時間(最大)1.99s
応答時間(合計)1.99s
-
指示追従
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.29s
応答時間(最大)4.18s
応答時間(合計)6.59s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.93s
応答時間(最大)3.05s
応答時間(合計)8.78s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.36s
応答時間(最大)8.36s
応答時間(合計)8.36s
|
| #45#45 |
Claude Opus 4.6medium
|
7.6… |
Anthropic |
$1.446… |
21.08s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 4 不正解: 2
応答時間(平均)21.08s
応答時間(最大)83.40s
応答時間(合計)231.84s
…
|
合計テスト数: 18
誤答テスト数: 6
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 70.4%
不安定なテスト: 2…
出力トークン: 29,829
推論トークン: 18,938
応答時間: 平均 21.08s · 合計 231.84s · 最大 83.40s
-
反AIトリック
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 2
応答時間(平均)7.45s
応答時間(最大)11.88s
応答時間(合計)14.90s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.11s
応答時間(最大)23.11s
応答時間(合計)23.11s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)76.66s
応答時間(最大)76.66s
応答時間(合計)76.66s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.37s
応答時間(最大)7.37s
応答時間(合計)7.37s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 2 不正解: 1
応答時間(平均)83.40s
応答時間(最大)83.40s
応答時間(合計)83.40s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.04s
応答時間(最大)5.04s
応答時間(合計)5.04s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.43s
応答時間(最大)2.43s
応答時間(合計)2.43s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.60s
応答時間(最大)4.66s
応答時間(合計)9.20s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.73s
応答時間(最大)9.73s
応答時間(合計)9.73s
|
| #46#46 |
GPT-5.4 Nanomedium
|
7.6… |
OpenAI |
$0.083… |
11.21s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 3
応答時間(平均)11.21s
応答時間(最大)94.06s
応答時間(合計)201.80s
…
|
合計テスト数: 18
誤答テスト数: 7
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 68.5%
不安定なテスト: 2…
出力トークン: 2,946
推論トークン: 58,132
応答時間: 平均 11.21s · 合計 201.80s · 最大 94.06s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.52s
応答時間(最大)7.74s
応答時間(合計)18.10s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.41s
応答時間(最大)13.41s
応答時間(合計)13.41s
-
複合
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)24.13s
応答時間(最大)24.13s
応答時間(合計)24.13s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.54s
応答時間(最大)3.33s
応答時間(合計)5.08s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)38.18s
応答時間(最大)94.06s
応答時間(合計)114.53s
-
汎用知能
: 4.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.15s
応答時間(最大)4.15s
応答時間(合計)4.15s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.88s
応答時間(最大)2.61s
応答時間(合計)3.75s
-
パズル解決
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2 不正解: 1
応答時間(平均)3.65s
応答時間(最大)4.02s
応答時間(合計)10.95s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.71s
応答時間(最大)7.71s
応答時間(合計)7.71s
|
| #47#47 |
Seed-2.0-Minimedium
|
7.5… |
Bytedance Seed |
$0.037… |
69.70s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 4 不正解: 2 指示に従っていない: 1
応答時間(平均)69.70s
応答時間(最大)262.83s
応答時間(合計)1045.47s
…
|
合計テスト数: 18
誤答テスト数: 7
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 66.7%
不安定なテスト: 2…
出力トークン: 2,419
推論トークン: 79,238
応答時間: 平均 69.70s · 合計 1045.47s · 最大 262.83s
-
反AIトリック
: 6.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)74.75s
応答時間(最大)182.10s
応答時間(合計)298.98s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)197.31s
応答時間(最大)197.31s
応答時間(合計)197.31s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)262.83s
応答時間(最大)262.83s
応答時間(合計)262.83s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)24.27s
応答時間(最大)27.52s
応答時間(合計)48.54s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 3
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
汎用知能
: 5.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)36.65s
応答時間(最大)36.65s
応答時間(合計)36.65s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.47s
応答時間(最大)19.46s
応答時間(合計)34.93s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)25.85s
応答時間(最大)32.95s
応答時間(合計)77.55s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)88.68s
応答時間(最大)88.68s
応答時間(合計)88.68s
|
| #48#48 |
GPT-5.2medium
|
7.5… |
OpenAI |
$0.352… |
14.04s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 3 不正解: 2 回答なし: 1 タイムアウト: 1
応答時間(平均)14.04s
応答時間(最大)77.80s
応答時間(合計)154.41s
…
|
合計テスト数: 18
誤答テスト数: 7
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 72.2%
不安定なテスト: 4…
出力トークン: 2,705
推論トークン: 18,977
応答時間: 平均 14.04s · 合計 154.41s · 最大 77.80s
-
反AIトリック
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)7.81s
応答時間(最大)14.34s
応答時間(合計)15.62s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.12s
応答時間(最大)15.12s
応答時間(合計)15.12s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.06s
応答時間(最大)14.06s
応答時間(合計)14.06s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.15s
応答時間(最大)3.15s
応答時間(合計)3.15s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)77.80s
応答時間(最大)77.80s
応答時間(合計)77.80s
-
汎用知能
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.32s
応答時間(最大)4.32s
応答時間(合計)4.32s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.12s
応答時間(最大)3.12s
応答時間(合計)3.12s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)5.47s
応答時間(最大)6.45s
応答時間(合計)10.94s
-
ツール呼び出し
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)10.30s
応答時間(最大)10.30s
応答時間(合計)10.30s
|
| #49#49 |
MiMo-V2-Flashmedium
|
7.5… |
Xiaomi |
$0.038… |
23.36s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 API エラー: 1 余分な書式: 1 指示に従っていない: 1 タイムアウト: 1
応答時間(平均)23.36s
応答時間(最大)96.01s
応答時間(合計)280.34s
…
|
合計テスト数: 18
誤答テスト数: 7
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 70.4%
不安定なテスト: 3…
出力トークン: 12,387
推論トークン: 115,182
応答時間: 平均 23.36s · 合計 280.34s · 最大 96.01s
-
反AIトリック
: 8.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)15.85s
応答時間(最大)20.83s
応答時間(合計)47.55s
-
コーディング
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)13.03s
応答時間(最大)13.03s
応答時間(合計)13.03s
-
複合
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)75.68s
応答時間(最大)75.68s
応答時間(合計)75.68s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)96.01s
応答時間(最大)96.01s
応答時間(合計)96.01s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.20s
応答時間(最大)4.20s
応答時間(合計)4.20s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.28s
応答時間(最大)7.37s
応答時間(合計)8.55s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.77s
応答時間(最大)5.26s
応答時間(合計)7.55s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)27.78s
応答時間(最大)27.78s
応答時間(合計)27.78s
|
| #50#50 |
Claude Sonnet 4.6none
|
7.4… |
Anthropic |
$0.262… |
4.98s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 3 不正解: 3 指示に従っていない: 1
応答時間(平均)4.98s
応答時間(最大)23.84s
応答時間(合計)54.83s
…
|
合計テスト数: 18
誤答テスト数: 7
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 64.8%
不安定なテスト: 1…
出力トークン: 7,433
推論トークン: 0
応答時間: 平均 4.98s · 合計 54.83s · 最大 23.84s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 2 不正解: 1
応答時間(平均)2.94s
応答時間(最大)4.83s
応答時間(合計)5.88s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.67s
応答時間(最大)3.67s
応答時間(合計)3.67s
-
複合
: 9.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.84s
応答時間(最大)23.84s
応答時間(合計)23.84s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.43s
応答時間(最大)3.43s
応答時間(合計)3.43s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.54s
応答時間(最大)3.54s
応答時間(合計)3.54s
-
汎用知能
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.56s
応答時間(最大)2.56s
応答時間(合計)2.56s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.96s
応答時間(最大)1.96s
応答時間(合計)1.96s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)2.92s
応答時間(最大)3.33s
応答時間(合計)5.84s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.11s
応答時間(最大)4.11s
応答時間(合計)4.11s
|