| #91#91 |
DeepSeek V4 Flashnone
|
5.3… |
DeepSeek |
$0.008… |
29.39s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 8 余分な書式: 2 指示に従っていない: 2 無効なツール呼び出し: 1
応答時間(平均)29.39s
応答時間(最大)111.96s
応答時間(合計)529.10s
…
|
合計テスト数: 18
誤答テスト数: 13
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 33.3%
不安定なテスト: 2…
出力トークン: 4,444
推論トークン: 0
応答時間: 平均 29.39s · 合計 529.10s · 最大 111.96s
-
反AIトリック
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)20.18s
応答時間(最大)26.54s
応答時間(合計)80.73s
-
コーディング
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)24.04s
応答時間(最大)24.04s
応答時間(合計)24.04s
-
複合
: 4.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)111.96s
応答時間(最大)111.96s
応答時間(合計)111.96s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.79s
応答時間(最大)23.85s
応答時間(合計)47.57s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)19.73s
応答時間(最大)27.66s
応答時間(合計)59.18s
-
汎用知能
: 4.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)23.74s
応答時間(最大)23.74s
応答時間(合計)23.74s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)17.54s
応答時間(最大)18.51s
応答時間(合計)35.08s
-
パズル解決
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2 余分な書式: 1
応答時間(平均)22.96s
応答時間(最大)29.24s
応答時間(合計)68.87s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)77.93s
応答時間(最大)77.93s
応答時間(合計)77.93s
|
| #92#92 |
Grok 4.20 Betanoneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
5.3… |
X AI |
$0.091… |
1.19s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 10 指示に従っていない: 3 無効なツール呼び出し: 1
応答時間(平均)1.19s
応答時間(最大)6.48s
応答時間(合計)21.37s
…
|
合計テスト数: 18
誤答テスト数: 14
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 29.6%
不安定なテスト: 2…
出力トークン: 1,591
推論トークン: 0
応答時間: 平均 1.19s · 合計 21.37s · 最大 6.48s
-
反AIトリック
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)597ms
応答時間(最大)866ms
応答時間(合計)2.39s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.14s
応答時間(最大)1.14s
応答時間(合計)1.14s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)6.48s
応答時間(最大)6.48s
応答時間(合計)6.48s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)601ms
応答時間(最大)634ms
応答時間(合計)1.20s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)611ms
応答時間(最大)616ms
応答時間(合計)1.83s
-
汎用知能
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)541ms
応答時間(最大)541ms
応答時間(合計)541ms
-
指示追従
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)687ms
応答時間(最大)952ms
応答時間(合計)1.37s
-
パズル解決
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)541ms
応答時間(最大)677ms
応答時間(合計)1.62s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.79s
応答時間(最大)4.79s
応答時間(合計)4.79s
|
| #93#93 |
MiniMax M2.7medium
|
5.3… |
Minimax |
$0.091… |
31.08s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 6 不正解: 5 タイムアウト: 2 無効なツール呼び出し: 1
応答時間(平均)31.08s
応答時間(最大)117.04s
応答時間(合計)528.37s
…
|
合計テスト数: 18
誤答テスト数: 14
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 51.9%
不安定なテスト: 10…
出力トークン: 4,984
推論トークン: 62,787
応答時間: 平均 31.08s · 合計 528.37s · 最大 117.04s
-
反AIトリック
: 7.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)40.32s
応答時間(最大)117.04s
応答時間(合計)161.28s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)91.27s
応答時間(最大)91.27s
応答時間(合計)91.27s
-
複合
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)41.03s
応答時間(最大)41.03s
応答時間(合計)41.03s
-
データ解析と抽出
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)21.95s
応答時間(最大)24.88s
応答時間(合計)43.89s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2 不正解: 1
応答時間(平均)19.00s
応答時間(最大)21.63s
応答時間(合計)38.01s
-
汎用知能
: 3.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)38.70s
応答時間(最大)38.70s
応答時間(合計)38.70s
-
指示追従
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)12.64s
応答時間(最大)15.23s
応答時間(合計)25.28s
-
パズル解決
: 3.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2 不正解: 1
応答時間(平均)25.62s
応答時間(最大)46.29s
応答時間(合計)76.87s
-
ツール呼び出し
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)12.05s
応答時間(最大)12.05s
応答時間(合計)12.05s
|
| #94#94 |
Elephant Alphamedium
|
5.2… |
Openrouter |
$0.000… |
1.27s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9 指示に従っていない: 3 無効なツール呼び出し: 1
応答時間(平均)1.27s
応答時間(最大)3.70s
応答時間(合計)22.82s
…
|
合計テスト数: 18
誤答テスト数: 13
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 29.6%
不安定なテスト: 1…
出力トークン: 2,596
推論トークン: 0
応答時間: 平均 1.27s · 合計 22.82s · 最大 3.70s
-
反AIトリック
: 6.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.19s
応答時間(最大)2.04s
応答時間(合計)4.75s
-
コーディング
: 5.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.30s
応答時間(最大)1.30s
応答時間(合計)1.30s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.70s
応答時間(最大)3.70s
応答時間(合計)3.70s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)979ms
応答時間(最大)1.02s
応答時間(合計)1.96s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)925ms
応答時間(最大)1.16s
応答時間(合計)2.77s
-
汎用知能
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)920ms
応答時間(最大)920ms
応答時間(合計)920ms
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)987ms
応答時間(最大)1.13s
応答時間(合計)1.97s
-
パズル解決
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2 不正解: 1
応答時間(平均)867ms
応答時間(最大)972ms
応答時間(合計)2.60s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)2.83s
応答時間(最大)2.83s
応答時間(合計)2.83s
|
| #95#95 |
Grok 4.20none
|
5.2… |
X AI |
$0.095… |
1.11s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9 指示に従っていない: 2 余分な書式: 1 無効なツール呼び出し: 1
応答時間(平均)1.11s
応答時間(最大)6.04s
応答時間(合計)20.02s
…
|
合計テスト数: 18
誤答テスト数: 13
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 29.6%
不安定なテスト: 1…
出力トークン: 1,967
推論トークン: 0
応答時間: 平均 1.11s · 合計 20.02s · 最大 6.04s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)501ms
応答時間(最大)839ms
応答時間(合計)2.01s
-
コーディング
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.22s
応答時間(最大)1.22s
応答時間(合計)1.22s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)6.04s
応答時間(最大)6.04s
応答時間(合計)6.04s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)522ms
応答時間(最大)537ms
応答時間(合計)1.04s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 余分な書式: 1
応答時間(平均)687ms
応答時間(最大)821ms
応答時間(合計)2.06s
-
汎用知能
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)659ms
応答時間(最大)659ms
応答時間(合計)659ms
-
指示追従
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)455ms
応答時間(最大)505ms
応答時間(合計)910ms
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)487ms
応答時間(最大)539ms
応答時間(合計)1.46s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.63s
応答時間(最大)4.63s
応答時間(合計)4.63s
|
| #96#96 |
Mistral Small 4none
|
5.2… |
Mistral |
$0.006… |
665ms… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 11 指示に従っていない: 2
応答時間(平均)665ms
応答時間(最大)1.72s
応答時間(合計)11.97s
…
|
合計テスト数: 18
誤答テスト数: 13
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 31.5%
不安定なテスト: 1…
出力トークン: 2,207
推論トークン: 0
応答時間: 平均 665ms · 合計 11.97s · 最大 1.72s
-
反AIトリック
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)395ms
応答時間(最大)769ms
応答時間(合計)1.58s
-
コーディング
: 4.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.28s
応答時間(最大)1.28s
応答時間(合計)1.28s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.72s
応答時間(最大)1.72s
応答時間(合計)1.72s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)822ms
応答時間(最大)1.08s
応答時間(合計)1.64s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)367ms
応答時間(最大)388ms
応答時間(合計)1.10s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)729ms
応答時間(最大)729ms
応答時間(合計)729ms
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)380ms
応答時間(最大)380ms
応答時間(合計)759ms
-
パズル解決
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2 不正解: 1
応答時間(平均)589ms
応答時間(最大)853ms
応答時間(合計)1.77s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.40s
応答時間(最大)1.40s
応答時間(合計)1.40s
|
| #97#97 |
gpt-oss-120bnone
|
5.2… |
OpenAI |
$0.009… |
11.96s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 指示に従っていない: 5 API エラー: 3
応答時間(平均)11.96s
応答時間(最大)68.97s
応答時間(合計)179.34s
…
|
合計テスト数: 18
誤答テスト数: 14
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 38.9%
不安定なテスト: 5…
出力トークン: 44,652
推論トークン: 0
応答時間: 平均 11.96s · 合計 179.34s · 最大 68.97s
-
反AIトリック
: 6.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)6.03s
応答時間(最大)13.33s
応答時間(合計)24.10s
-
コーディング
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)9.57s
応答時間(最大)9.57s
応答時間(合計)9.57s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)7.12s
応答時間(最大)7.12s
応答時間(合計)7.12s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)34.98s
応答時間(最大)68.97s
応答時間(合計)104.94s
-
汎用知能
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.83s
応答時間(最大)2.83s
応答時間(合計)2.83s
-
指示追従
: 8.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)5.10s
応答時間(最大)5.85s
応答時間(合計)10.21s
-
パズル解決
: 4.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2 不正解: 1
応答時間(平均)6.86s
応答時間(最大)10.66s
応答時間(合計)20.59s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #98#98 |
Elephant Alphanone
|
5.2… |
Openrouter |
$0.000… |
1.23s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9 指示に従っていない: 3 無効なツール呼び出し: 1
応答時間(平均)1.23s
応答時間(最大)3.81s
応答時間(合計)22.16s
…
|
合計テスト数: 18
誤答テスト数: 13
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 31.5%
不安定なテスト: 1…
出力トークン: 2,573
推論トークン: 0
応答時間: 平均 1.23s · 合計 22.16s · 最大 3.81s
-
反AIトリック
: 6.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)963ms
応答時間(最大)1.68s
応答時間(合計)3.85s
-
コーディング
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.39s
応答時間(最大)1.39s
応答時間(合計)1.39s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.81s
応答時間(最大)3.81s
応答時間(合計)3.81s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.04s
応答時間(最大)1.05s
応答時間(合計)2.08s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)927ms
応答時間(最大)1.17s
応答時間(合計)2.78s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)854ms
応答時間(最大)854ms
応答時間(合計)854ms
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.03s
応答時間(最大)1.17s
応答時間(合計)2.07s
-
パズル解決
: 3.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)849ms
応答時間(最大)925ms
応答時間(合計)2.55s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)2.79s
応答時間(最大)2.79s
応答時間(合計)2.79s
|
| #99#99 |
GPT-5.4 Mininone
|
5.1… |
OpenAI |
$0.032… |
1.17s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 10 指示に従っていない: 3
応答時間(平均)1.17s
応答時間(最大)2.52s
応答時間(合計)21.01s
…
|
合計テスト数: 18
誤答テスト数: 13
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 35.2%
不安定なテスト: 3…
出力トークン: 2,418
推論トークン: 0
応答時間: 平均 1.17s · 合計 21.01s · 最大 2.52s
-
反AIトリック
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)929ms
応答時間(最大)1.55s
応答時間(合計)3.72s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.19s
応答時間(最大)1.19s
応答時間(合計)1.19s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.52s
応答時間(最大)2.52s
応答時間(合計)2.52s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.30s
応答時間(最大)1.58s
応答時間(合計)2.61s
-
ドメイン特化
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)937ms
応答時間(最大)1.25s
応答時間(合計)2.81s
-
汎用知能
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.82s
応答時間(最大)1.82s
応答時間(合計)1.82s
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)728ms
応答時間(最大)731ms
応答時間(合計)1.46s
-
パズル解決
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)860ms
応答時間(最大)958ms
応答時間(合計)2.58s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.32s
応答時間(最大)2.32s
応答時間(合計)2.32s
|
| #100#100 |
Qwen3 Coder Nextnone
|
5.1… |
Qwen |
$0.008… |
10.18s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 12 余分な書式: 1 指示に従っていない: 1
応答時間(平均)10.18s
応答時間(最大)45.14s
応答時間(合計)122.13s
…
|
合計テスト数: 18
誤答テスト数: 14
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 25.9%
不安定なテスト: 1…
出力トークン: 3,617
推論トークン: 0
応答時間: 平均 10.18s · 合計 122.13s · 最大 45.14s
-
反AIトリック
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 余分な書式: 1 指示に従っていない: 1
応答時間(平均)3.31s
応答時間(最大)4.39s
応答時間(合計)6.63s
-
コーディング
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.14s
応答時間(最大)3.14s
応答時間(合計)3.14s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)45.14s
応答時間(最大)45.14s
応答時間(合計)45.14s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.32s
応答時間(最大)1.32s
応答時間(合計)1.32s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)962ms
応答時間(最大)962ms
応答時間(合計)962ms
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.34s
応答時間(最大)1.34s
応答時間(合計)1.34s
-
指示追従
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)7.71s
応答時間(最大)14.65s
応答時間(合計)15.42s
-
パズル解決
: 3.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)22.86s
応答時間(最大)42.58s
応答時間(合計)45.73s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.47s
応答時間(最大)2.47s
応答時間(合計)2.47s
|
| #101#101 |
MiMo-V2.5none
|
5.1… |
Xiaomi |
$0.019… |
1.05s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 10 指示に従っていない: 2 余分な書式: 1
応答時間(平均)1.05s
応答時間(最大)2.43s
応答時間(合計)18.94s
…
|
合計テスト数: 18
誤答テスト数: 13
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 27.8%
不安定なテスト: 0…
出力トークン: 2,177
推論トークン: 0
応答時間: 平均 1.05s · 合計 18.94s · 最大 2.43s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)842ms
応答時間(最大)1.47s
応答時間(合計)3.37s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.95s
応答時間(最大)1.95s
応答時間(合計)1.95s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.36s
応答時間(最大)2.36s
応答時間(合計)2.36s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)1.01s
応答時間(最大)1.18s
応答時間(合計)2.03s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)756ms
応答時間(最大)877ms
応答時間(合計)2.27s
-
汎用知能
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)841ms
応答時間(最大)841ms
応答時間(合計)841ms
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)751ms
応答時間(最大)821ms
応答時間(合計)1.50s
-
パズル解決
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2 不正解: 1
応答時間(平均)731ms
応答時間(最大)958ms
応答時間(合計)2.19s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.43s
応答時間(最大)2.43s
応答時間(合計)2.43s
|
| #102#102 |
Nemotron 3 Supernone
|
5.1… |
NVIDIA |
$0.000… |
8.54s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 10 指示に従っていない: 4
応答時間(平均)8.54s
応答時間(最大)24.97s
応答時間(合計)153.69s
…
|
合計テスト数: 18
誤答テスト数: 14
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 35.2%
不安定なテスト: 4…
出力トークン: 4,760
推論トークン: 0
応答時間: 平均 8.54s · 合計 153.69s · 最大 24.97s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)7.43s
応答時間(最大)16.69s
応答時間(合計)29.72s
-
コーディング
: 3.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.99s
応答時間(最大)2.99s
応答時間(合計)2.99s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)19.98s
応答時間(最大)19.98s
応答時間(合計)19.98s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.92s
応答時間(最大)13.23s
応答時間(合計)15.84s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)6.23s
応答時間(最大)14.38s
応答時間(合計)18.70s
-
汎用知能
: 4.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)24.97s
応答時間(最大)24.97s
応答時間(合計)24.97s
-
指示追従
: 4.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)1.50s
応答時間(最大)2.07s
応答時間(合計)2.99s
-
パズル解決
: 5.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)7.50s
応答時間(最大)15.00s
応答時間(合計)22.50s
-
ツール呼び出し
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)16.00s
応答時間(最大)16.00s
応答時間(合計)16.00s
|
| #103#103 |
GPT-4o-mininone
|
4.9… |
OpenAI |
$0.005… |
2.00s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13 指示に従っていない: 1
応答時間(平均)2.00s
応答時間(最大)7.58s
応答時間(合計)21.99s
…
|
合計テスト数: 18
誤答テスト数: 14
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 22.2%
不安定なテスト: 0…
出力トークン: 1,947
推論トークン: 0
応答時間: 平均 2.00s · 合計 21.99s · 最大 7.58s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.34s
応答時間(最大)1.83s
応答時間(合計)2.67s
-
コーディング
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.55s
応答時間(最大)2.55s
応答時間(合計)2.55s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)7.58s
応答時間(最大)7.58s
応答時間(合計)7.58s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.27s
応答時間(最大)1.27s
応答時間(合計)1.27s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)637ms
応答時間(最大)637ms
応答時間(合計)637ms
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)909ms
応答時間(最大)909ms
応答時間(合計)909ms
-
指示追従
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)1.27s
応答時間(最大)1.27s
応答時間(合計)1.27s
-
パズル解決
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.30s
応答時間(最大)1.54s
応答時間(合計)2.60s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.51s
応答時間(最大)2.51s
応答時間(合計)2.51s
|
| #104#104 |
Qwen3.5-9Bnone
|
4.8… |
Qwen |
$0.005… |
1.47s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 10 指示に従っていない: 3 無効なツール呼び出し: 1
応答時間(平均)1.47s
応答時間(最大)5.91s
応答時間(合計)26.43s
…
|
合計テスト数: 18
誤答テスト数: 14
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 24.1%
不安定なテスト: 1…
出力トークン: 3,951
推論トークン: 0
応答時間: 平均 1.47s · 合計 26.43s · 最大 5.91s
-
反AIトリック
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)1.71s
応答時間(最大)3.79s
応答時間(合計)6.84s
-
コーディング
: 5.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)5.69s
応答時間(最大)5.69s
応答時間(合計)5.69s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)5.91s
応答時間(最大)5.91s
応答時間(合計)5.91s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)847ms
応答時間(最大)1.09s
応答時間(合計)1.69s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)464ms
応答時間(最大)622ms
応答時間(合計)1.39s
-
汎用知能
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)552ms
応答時間(最大)552ms
応答時間(合計)552ms
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)514ms
応答時間(最大)582ms
応答時間(合計)1.03s
-
パズル解決
: 3.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2 不正解: 1
応答時間(平均)683ms
応答時間(最大)945ms
応答時間(合計)2.05s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.27s
応答時間(最大)1.27s
応答時間(合計)1.27s
|
| #105#105 |
Mercury 2none
|
4.8… |
Inception |
$0.007… |
613ms… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13 指示に従っていない: 1
応答時間(平均)613ms
応答時間(最大)1.27s
応答時間(合計)11.04s
…
|
合計テスト数: 18
誤答テスト数: 14
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 27.8%
不安定なテスト: 2…
出力トークン: 1,625
推論トークン: 0
応答時間: 平均 613ms · 合計 11.04s · 最大 1.27s
-
反AIトリック
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)483ms
応答時間(最大)716ms
応答時間(合計)1.93s
-
コーディング
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)969ms
応答時間(最大)969ms
応答時間(合計)969ms
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)606ms
応答時間(最大)606ms
応答時間(合計)606ms
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)667ms
応答時間(最大)819ms
応答時間(合計)1.33s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)534ms
応答時間(最大)733ms
応答時間(合計)1.60s
-
汎用知能
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)628ms
応答時間(最大)628ms
応答時間(合計)628ms
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)551ms
応答時間(最大)622ms
応答時間(合計)1.10s
-
パズル解決
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)533ms
応答時間(最大)637ms
応答時間(合計)1.60s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.27s
応答時間(最大)1.27s
応答時間(合計)1.27s
|
| #106#106 |
Qwen3 Coder Nextmedium
|
4.7… |
Qwen |
$0.008… |
10.75s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9 指示に従っていない: 5 タイムアウト: 1
応答時間(平均)10.75s
応答時間(最大)81.80s
応答時間(合計)129.01s
…
|
合計テスト数: 18
誤答テスト数: 15
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 27.8%
不安定なテスト: 3…
出力トークン: 3,241
推論トークン: 0
応答時間: 平均 10.75s · 合計 129.01s · 最大 81.80s
-
反AIトリック
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 1
応答時間(平均)8.64s
応答時間(最大)15.28s
応答時間(合計)17.29s
-
コーディング
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)1.69s
応答時間(最大)1.69s
応答時間(合計)1.69s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.28s
応答時間(最大)4.28s
応答時間(合計)4.28s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)81.80s
応答時間(最大)81.80s
応答時間(合計)81.80s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)638ms
応答時間(最大)638ms
応答時間(合計)638ms
-
汎用知能
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.39s
応答時間(最大)1.39s
応答時間(合計)1.39s
-
指示追従
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)7.34s
応答時間(最大)13.67s
応答時間(合計)14.68s
-
パズル解決
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2 不正解: 1
応答時間(平均)2.30s
応答時間(最大)3.80s
応答時間(合計)4.61s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.64s
応答時間(最大)2.64s
応答時間(合計)2.64s
|
| #107#107 |
HY3 Previewnone
|
4.7… |
Tencent |
$0.000… |
13.56s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 7 指示に従っていない: 4 API エラー: 2 余分な書式: 1
応答時間(平均)13.56s
応答時間(最大)35.84s
応答時間(合計)230.55s
…
|
合計テスト数: 18
誤答テスト数: 14
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 27.8%
不安定なテスト: 2…
出力トークン: 2,639
推論トークン: 0
応答時間: 平均 13.56s · 合計 230.55s · 最大 35.84s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2 不正解: 1
応答時間(平均)11.10s
応答時間(最大)26.88s
応答時間(合計)44.41s
-
コーディング
: 2.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.56s
応答時間(最大)4.56s
応答時間(合計)4.56s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)35.84s
応答時間(最大)35.84s
応答時間(合計)35.84s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)2.85s
応答時間(最大)2.85s
応答時間(合計)2.85s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 API エラー: 1
応答時間(平均)17.61s
応答時間(最大)25.68s
応答時間(合計)52.82s
-
汎用知能
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)16.07s
応答時間(最大)16.07s
応答時間(合計)16.07s
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)12.98s
応答時間(最大)23.51s
応答時間(合計)25.95s
-
パズル解決
: 3.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)4.76s
応答時間(最大)7.35s
応答時間(合計)14.29s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)33.76s
応答時間(最大)33.76s
応答時間(合計)33.76s
|
| #108#108 |
GLM 4.7 Flashmedium
|
4.6… |
Z.ai |
$0.046… |
32.33s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 8 指示に従っていない: 2 回答なし: 2 無効なツール呼び出し: 1 タイムアウト: 1
応答時間(平均)32.33s
応答時間(最大)174.55s
応答時間(合計)355.65s
…
|
合計テスト数: 18
誤答テスト数: 14
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 38.9%
不安定なテスト: 8…
出力トークン: 39,688
推論トークン: 72,401
応答時間: 平均 32.33s · 合計 355.65s · 最大 174.55s
-
反AIトリック
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)14.95s
応答時間(最大)27.09s
応答時間(合計)29.90s
-
コーディング
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)21.26s
応答時間(最大)21.26s
応答時間(合計)21.26s
-
複合
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)65.57s
応答時間(最大)65.57s
応答時間(合計)65.57s
-
データ解析と抽出
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)1.51s
応答時間(最大)1.51s
応答時間(合計)1.51s
-
ドメイン特化
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 回答なし: 1
応答時間(平均)174.55s
応答時間(最大)174.55s
応答時間(合計)174.55s
-
汎用知能
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)18.14s
応答時間(最大)18.14s
応答時間(合計)18.14s
-
指示追従
: 6.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.97s
応答時間(最大)2.97s
応答時間(合計)2.97s
-
パズル解決
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)12.90s
応答時間(最大)22.33s
応答時間(合計)25.80s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.95s
応答時間(最大)15.95s
応答時間(合計)15.95s
|
| #109#109 |
MiMo-V2-Flashnone
|
4.5… |
Xiaomi |
$0.023… |
2.79s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 12 API エラー: 1 余分な書式: 1 指示に従っていない: 1
応答時間(平均)2.79s
応答時間(最大)19.68s
応答時間(合計)39.08s
…
|
合計テスト数: 18
誤答テスト数: 15
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 27.8%
不安定なテスト: 5…
出力トークン: 68,522
推論トークン: 0
応答時間: 平均 2.79s · 合計 39.08s · 最大 19.68s
-
反AIトリック
: 3.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)1.19s
応答時間(最大)2.73s
応答時間(合計)4.76s
-
コーディング
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.79s
応答時間(最大)2.79s
応答時間(合計)2.79s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.87s
応答時間(最大)2.87s
応答時間(合計)2.87s
-
データ解析と抽出
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 余分な書式: 1
応答時間(平均)19.68s
応答時間(最大)19.68s
応答時間(合計)19.68s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)564ms
応答時間(最大)564ms
応答時間(合計)564ms
-
汎用知能
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.67s
応答時間(最大)1.67s
応答時間(合計)1.67s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)857ms
応答時間(最大)955ms
応答時間(合計)1.71s
-
パズル解決
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.38s
応答時間(最大)1.74s
応答時間(合計)2.75s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.28s
応答時間(最大)2.28s
応答時間(合計)2.28s
|
| #110#110 |
Grok 4.1 Fastnone
|
4.5… |
X AI |
$0.009… |
1.76s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13 指示に従っていない: 2
応答時間(平均)1.76s
応答時間(最大)5.51s
応答時間(合計)19.35s
…
|
合計テスト数: 18
誤答テスト数: 15
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 24.1%
不安定なテスト: 3…
出力トークン: 1,721
推論トークン: 0
応答時間: 平均 1.76s · 合計 19.35s · 最大 5.51s
-
反AIトリック
: 3.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 1
応答時間(平均)1.07s
応答時間(最大)1.73s
応答時間(合計)2.15s
-
コーディング
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.79s
応答時間(最大)1.79s
応答時間(合計)1.79s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.33s
応答時間(最大)3.33s
応答時間(合計)3.33s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)943ms
応答時間(最大)943ms
応答時間(合計)943ms
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.06s
応答時間(最大)1.06s
応答時間(合計)1.06s
-
汎用知能
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.08s
応答時間(最大)1.08s
応答時間(合計)1.08s
-
指示追従
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)923ms
応答時間(最大)923ms
応答時間(合計)923ms
-
パズル解決
: 3.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.28s
応答時間(最大)1.36s
応答時間(合計)2.56s
-
ツール呼び出し
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)5.51s
応答時間(最大)5.51s
応答時間(合計)5.51s
|
| #111#111 |
Ling 2.6 1tnone
|
4.5… |
Inclusionai |
$0.000… |
8.79s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 11 指示に従っていない: 3 無効なツール呼び出し: 1
応答時間(平均)8.79s
応答時間(最大)25.72s
応答時間(合計)158.19s
…
|
合計テスト数: 18
誤答テスト数: 15
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 16.7%
不安定なテスト: 0…
出力トークン: 2,434
推論トークン: 0
応答時間: 平均 8.79s · 合計 158.19s · 最大 25.72s
-
反AIトリック
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)6.55s
応答時間(最大)9.41s
応答時間(合計)26.19s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.57s
応答時間(最大)10.57s
応答時間(合計)10.57s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)23.53s
応答時間(最大)23.53s
応答時間(合計)23.53s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.37s
応答時間(最大)1.37s
応答時間(合計)2.73s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.04s
応答時間(最大)1.08s
応答時間(合計)3.11s
-
汎用知能
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)20.34s
応答時間(最大)20.34s
応答時間(合計)20.34s
-
指示追従
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)5.36s
応答時間(最大)9.81s
応答時間(合計)10.73s
-
パズル解決
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2 不正解: 1
応答時間(平均)11.76s
応答時間(最大)20.15s
応答時間(合計)35.28s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)25.72s
応答時間(最大)25.72s
応答時間(合計)25.72s
|
| #112#112 |
GPT-5.4 Nanonone
|
4.5… |
OpenAI |
$0.009… |
1.40s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13 指示に従っていない: 3
応答時間(平均)1.40s
応答時間(最大)3.84s
応答時間(合計)25.14s
…
|
合計テスト数: 18
誤答テスト数: 16
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 31.5%
不安定なテスト: 7…
出力トークン: 2,762
推論トークン: 0
応答時間: 平均 1.40s · 合計 25.14s · 最大 3.84s
-
反AIトリック
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)1.18s
応答時間(最大)1.81s
応答時間(合計)4.70s
-
コーディング
: 7.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.43s
応答時間(最大)1.43s
応答時間(合計)1.43s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.84s
応答時間(最大)3.84s
応答時間(合計)3.84s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.11s
応答時間(最大)1.25s
応答時間(合計)2.23s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)926ms
応答時間(最大)959ms
応答時間(合計)2.78s
-
汎用知能
: 3.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.31s
応答時間(最大)1.31s
応答時間(合計)1.31s
-
指示追従
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)787ms
応答時間(最大)865ms
応答時間(合計)1.57s
-
パズル解決
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)1.29s
応答時間(最大)1.64s
応答時間(合計)3.86s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.40s
応答時間(最大)3.40s
応答時間(合計)3.40s
|
| #113#113 |
Qwen3.5-9Bmedium
|
4.4… |
Qwen |
$0.030… |
73.64s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 11 指示に従っていない: 2 余分な書式: 1 不正解: 1
応答時間(平均)73.64s
応答時間(最大)226.38s
応答時間(合計)1104.60s
…
|
合計テスト数: 18
誤答テスト数: 15
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 33.3%
不安定なテスト: 6…
出力トークン: 24,291
推論トークン: 172,597
応答時間: 平均 73.64s · 合計 1104.60s · 最大 226.38s
-
反AIトリック
: 5.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2 不正解: 1
応答時間(平均)34.44s
応答時間(最大)57.86s
応答時間(合計)103.31s
-
コーディング
: 2.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)135.61s
応答時間(最大)135.61s
応答時間(合計)135.61s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 タイムアウト: 1
応答時間(平均)87.31s
応答時間(最大)87.31s
応答時間(合計)87.31s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 3
応答時間(平均)137.75s
応答時間(最大)202.61s
応答時間(合計)413.24s
-
汎用知能
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)226.38s
応答時間(最大)226.38s
応答時間(合計)226.38s
-
指示追従
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)17.15s
応答時間(最大)28.54s
応答時間(合計)34.29s
-
パズル解決
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2 指示に従っていない: 1
応答時間(平均)33.38s
応答時間(最大)47.31s
応答時間(合計)100.14s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.31s
応答時間(最大)4.31s
応答時間(合計)4.31s
|
| #114#114 |
LFM2-24B-A2Bnoneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
4.1… |
Liquid |
$0.001… |
811ms… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9 API エラー: 4 指示に従っていない: 2
応答時間(平均)811ms
応答時間(最大)2.88s
応答時間(合計)11.35s
…
|
合計テスト数: 16
誤答テスト数: 15
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 14.6%
不安定なテスト: 2…
出力トークン: 1,185
推論トークン: 0
応答時間: 平均 811ms · 合計 11.35s · 最大 2.88s
-
反AIトリック
: 3.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)471ms
応答時間(最大)872ms
応答時間(合計)1.41s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)714ms
応答時間(最大)987ms
応答時間(合計)1.43s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)287ms
応答時間(最大)334ms
応答時間(合計)860ms
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)395ms
応答時間(最大)395ms
応答時間(合計)395ms
-
指示追従
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.09s
応答時間(最大)1.90s
応答時間(合計)2.18s
-
パズル解決
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 指示に従っていない: 1 不正解: 1
応答時間(平均)1.69s
応答時間(最大)2.88s
応答時間(合計)5.08s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #115#115 |
Step 3.5 Flashnone
|
3.0… |
Stepfun |
$0.000… |
0ms… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
…
|
合計テスト数: 1
誤答テスト数: 1
信頼性: 該当なしこのモデルの信頼性テレメトリは利用できないか、不完全です。
試行ごとの合格率: 0.0%
不安定なテスト: 0…
出力トークン: 0
推論トークン: 0
応答時間: 平均 0ms · 合計 0ms · 最大 0ms
-
コーディング
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|