| #301#301 |
MiMo-V2-Flashnoneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
4.0… |
Xiaomi |
$0.025
↑
…
|
2.76s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13 指示に従っていない: 2 API エラー: 1 余分な書式: 1
応答時間(平均)2.76s
応答時間(最大)19.68s
応答時間(合計)46.99s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 17
- 試行ごとの合格率
- 24.2%
- 入力トークン
- 36,851
- 出力トークン
- 68,882
- 推論トークン
- 0
- 応答時間(平均)
- 2.76s
- 応答時間(合計)
- 46.99s
- 応答時間(最大)
- 19.68s
-
反AIトリック
: 3.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)1.19s
応答時間(最大)2.73s
応答時間(合計)4.76s
-
コーディング
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)2.64s
応答時間(最大)3.84s
応答時間(合計)7.92s
-
複合
: 1.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.87s
応答時間(最大)2.87s
応答時間(合計)2.87s
-
データ解析と抽出
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 余分な書式: 1
応答時間(平均)19.68s
応答時間(最大)19.68s
応答時間(合計)19.68s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)564ms
応答時間(最大)564ms
応答時間(合計)564ms
-
汎用知能
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.67s
応答時間(最大)1.67s
応答時間(合計)1.67s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)857ms
応答時間(最大)955ms
応答時間(合計)1.71s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.86s
応答時間(最大)2.70s
応答時間(合計)3.71s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.28s
応答時間(最大)2.28s
応答時間(合計)2.28s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.82s
応答時間(最大)1.82s
応答時間(合計)1.82s
|
| #309#309 |
Qwen3.5-9Bmedium
|
3.8… |
Qwen |
$0.062
↑
…
|
107.51s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 11 回答なし: 3 不正解: 2 API エラー: 1 余分な書式: 1 指示に従っていない: 1
応答時間(平均)107.51s
応答時間(最大)569.97s
応答時間(合計)1720.15s
…
|
- 合計テスト数
- 22
- 誤答テスト数
- 19
- 試行ごとの合格率
- 25.8%
- 入力トークン
- 17,195
- 出力トークン
- 46,735
- 推論トークン
- 366,707
- 応答時間(平均)
- 107.51s
- 応答時間(合計)
- 1720.15s
- 応答時間(最大)
- 569.97s
-
反AIトリック
: 5.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2 不正解: 1
応答時間(平均)34.44s
応答時間(最大)57.86s
応答時間(合計)103.31s
-
コーディング
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 回答なし: 1 タイムアウト: 1
応答時間(平均)100.88s
応答時間(最大)135.61s
応答時間(合計)201.75s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 タイムアウト: 1
応答時間(平均)87.31s
応答時間(最大)87.31s
応答時間(合計)87.31s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2 回答なし: 1
応答時間(平均)272.50s
応答時間(最大)569.97s
応答時間(合計)817.51s
-
汎用知能
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)226.38s
応答時間(最大)226.38s
応答時間(合計)226.38s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)5.75s
応答時間(最大)5.75s
応答時間(合計)5.75s
-
パズル解決
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2 不正解: 1
応答時間(平均)32.27s
応答時間(最大)47.31s
応答時間(合計)96.80s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.31s
応答時間(最大)4.31s
応答時間(合計)4.31s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)177.02s
応答時間(最大)177.02s
応答時間(合計)177.02s
|
| #233#233 |
Hy4 previewlow
|
5.6… |
Tencent |
$1.745
…
|
214.25s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 14 不正解: 3 指示に従っていない: 1 回答なし: 1
応答時間(平均)214.25s
応答時間(最大)597.45s
応答時間(合計)4713.56s
…
|
- 合計テスト数
- 22
- 誤答テスト数
- 19
- 試行ごとの合格率
- 19.7%
- 入力トークン
- 45,154
- 出力トークン
- 4,022
- 推論トークン
- 678,516
- 応答時間(平均)
- 214.25s
- 応答時間(合計)
- 4713.56s
- 応答時間(最大)
- 597.45s
-
反AIトリック
: 6.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 4
応答時間(平均)129.60s
応答時間(最大)237.97s
応答時間(合計)518.41s
-
コーディング
: 5.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 3
応答時間(平均)219.15s
応答時間(最大)259.22s
応答時間(合計)657.45s
-
複合
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 2
応答時間(平均)139.43s
応答時間(最大)171.85s
応答時間(合計)278.85s
-
データ解析と抽出
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)88.53s
応答時間(最大)120.56s
応答時間(合計)177.06s
-
ドメイン特化
: 4.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 API エラー: 1
応答時間(平均)470.24s
応答時間(最大)547.52s
応答時間(合計)1410.71s
-
汎用知能
: 7.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)110.43s
応答時間(最大)110.43s
応答時間(合計)110.43s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)77.72s
応答時間(最大)91.04s
応答時間(合計)155.43s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 指示に従っていない: 1 不正解: 1
応答時間(平均)238.03s
応答時間(最大)373.63s
応答時間(合計)714.10s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)93.67s
応答時間(最大)93.67s
応答時間(合計)93.67s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)597.45s
応答時間(最大)597.45s
応答時間(合計)597.45s
|
| #273#273 |
Hy4 previewnone
|
4.8… |
Tencent |
$0.041
…
|
39.24s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9 API エラー: 7 指示に従っていない: 2 余分な書式: 1
応答時間(平均)39.24s
応答時間(最大)95.32s
応答時間(合計)863.30s
…
|
- 合計テスト数
- 22
- 誤答テスト数
- 19
- 試行ごとの合格率
- 16.7%
- 入力トークン
- 26,376
- 出力トークン
- 7,306
- 推論トークン
- 0
- 応答時間(平均)
- 39.24s
- 応答時間(合計)
- 863.30s
- 応答時間(最大)
- 95.32s
-
反AIトリック
: 3.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 余分な書式: 1
応答時間(平均)31.54s
応答時間(最大)41.19s
応答時間(合計)126.18s
-
コーディング
: 3.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 指示に従っていない: 1 不正解: 1
応答時間(平均)45.53s
応答時間(最大)73.98s
応答時間(合計)136.60s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)75.12s
応答時間(最大)95.32s
応答時間(合計)150.23s
-
データ解析と抽出
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)22.81s
応答時間(最大)29.63s
応答時間(合計)45.63s
-
ドメイン特化
: 6.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)25.61s
応答時間(最大)45.05s
応答時間(合計)76.83s
-
汎用知能
: 5.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)58.28s
応答時間(最大)58.28s
応答時間(合計)58.28s
-
指示追従
: 7.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)47.90s
応答時間(最大)50.25s
応答時間(合計)95.81s
-
パズル解決
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 指示に従っていない: 1 不正解: 1
応答時間(平均)24.12s
応答時間(最大)30.85s
応答時間(合計)72.36s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)81.53s
応答時間(最大)81.53s
応答時間(合計)81.53s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)19.87s
応答時間(最大)19.87s
応答時間(合計)19.87s
|
| #201#201 |
Grok 4.20 Betamediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
6.0… |
X AI |
$0.750
↑
…
|
9.75s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 1
応答時間(平均)9.75s
応答時間(最大)31.36s
応答時間(合計)175.48s
…
|
- 合計テスト数
- 18
- 誤答テスト数
- 4
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 66.7%
- 入力トークン
- 35,955
- 出力トークン
- 1,647
- 推論トークン
- 91,565
- 応答時間(平均)
- 9.75s
- 応答時間(合計)
- 175.48s
- 応答時間(最大)
- 31.36s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.16s
応答時間(最大)3.44s
応答時間(合計)12.65s
-
コーディング
: 3.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)31.36s
応答時間(最大)31.36s
応答時間(合計)31.36s
-
複合
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)20.93s
応答時間(最大)20.93s
応答時間(合計)20.93s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.01s
応答時間(最大)4.27s
応答時間(合計)8.02s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)21.33s
応答時間(最大)24.21s
応答時間(合計)64.00s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.78s
応答時間(最大)5.78s
応答時間(合計)5.78s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.89s
応答時間(最大)5.89s
応答時間(合計)9.78s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.52s
応答時間(最大)4.53s
応答時間(合計)10.57s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)12.39s
応答時間(最大)12.39s
応答時間(合計)12.39s
-
雑学
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #203#203 |
Gemini 3 PRO Previewmediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
6.0… |
Google |
$0.385
↑
…
|
9.05s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 4 不正解: 3
応答時間(平均)9.05s
応答時間(最大)26.24s
応答時間(合計)90.53s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 63.6%
- 入力トークン
- 28,848
- 出力トークン
- 1,490
- 推論トークン
- 10,102
- 応答時間(平均)
- 9.05s
- 応答時間(合計)
- 90.53s
- 応答時間(最大)
- 26.24s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.99s
応答時間(最大)26.24s
応答時間(合計)29.99s
-
コーディング
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 3
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
複合
: 1.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.37s
応答時間(最大)10.37s
応答時間(合計)10.37s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)10.84s
応答時間(最大)10.84s
応答時間(合計)10.84s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)7.01s
応答時間(最大)7.01s
応答時間(合計)7.01s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.34s
応答時間(最大)9.34s
応答時間(合計)9.34s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.26s
応答時間(最大)3.26s
応答時間(合計)3.26s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.88s
応答時間(最大)4.23s
応答時間(合計)7.77s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.96s
応答時間(最大)11.96s
応答時間(合計)11.96s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #250#250 |
Gemini 3.1 Flash Lite Previewhighアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
5.3… |
Google |
$2.310
…
|
68.14s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)68.14s
応答時間(最大)280.52s
応答時間(合計)1090.28s
…
|
- 合計テスト数
- 16
- 誤答テスト数
- 3
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 59.1%
- 入力トークン
- 28,980
- 出力トークン
- 1,283
- 推論トークン
- 1,533,310
- 応答時間(平均)
- 68.14s
- 応答時間(合計)
- 1090.28s
- 応答時間(最大)
- 280.52s
-
反AIトリック
: 7.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)43.87s
応答時間(最大)121.88s
応答時間(合計)131.62s
-
コーディング
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
複合
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)280.52s
応答時間(最大)280.52s
応答時間(合計)280.52s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.16s
応答時間(最大)8.54s
応答時間(合計)14.31s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)127.58s
応答時間(最大)133.93s
応答時間(合計)382.74s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.25s
応答時間(最大)5.25s
応答時間(合計)5.25s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)64.03s
応答時間(最大)124.45s
応答時間(合計)128.06s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)46.68s
応答時間(最大)134.22s
応答時間(合計)140.04s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.73s
応答時間(最大)7.73s
応答時間(合計)7.73s
-
雑学
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #269#269 |
Qwen3.6 Plus Previewmediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
4.9… |
Qwen |
$0.000
…
|
15.25s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 8 不正解: 2
応答時間(平均)15.25s
応答時間(最大)43.55s
応答時間(合計)182.96s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 10
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 40.9%
- 入力トークン
- 32,639
- 出力トークン
- 1,153
- 推論トークン
- 62,197
- 応答時間(平均)
- 15.25s
- 応答時間(合計)
- 182.96s
- 応答時間(最大)
- 43.55s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)11.69s
応答時間(最大)19.37s
応答時間(合計)35.08s
-
コーディング
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
複合
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)34.95s
応答時間(最大)34.95s
応答時間(合計)34.95s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.95s
応答時間(最大)15.40s
応答時間(合計)29.90s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 API エラー: 1
応答時間(平均)22.08s
応答時間(最大)43.55s
応答時間(合計)66.23s
-
汎用知能
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)3.40s
応答時間(最大)3.40s
応答時間(合計)3.40s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 2
応答時間(平均)7.52s
応答時間(最大)7.52s
応答時間(合計)7.52s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.87s
応答時間(最大)5.87s
応答時間(合計)5.87s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #278#278 |
Grok 4.20 Multi Agent Betamediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
4.8… |
X AI |
$5.599
↑
…
|
9.69s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 API エラー: 2 余分な書式: 2 指示に従っていない: 2
応答時間(平均)9.69s
応答時間(最大)35.28s
応答時間(合計)155.07s
…
|
- 合計テスト数
- 18
- 誤答テスト数
- 10
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 48.5%
- 入力トークン
- 721,952
- 出力トークン
- 294,668
- 推論トークン
- 305,374
- 応答時間(平均)
- 9.69s
- 応答時間(合計)
- 155.07s
- 応答時間(最大)
- 35.28s
-
反AIトリック
: 6.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)3.46s
応答時間(最大)4.38s
応答時間(合計)13.86s
-
コーディング
: 3.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)27.11s
応答時間(最大)27.11s
応答時間(合計)27.11s
-
複合
: 1.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.54s
応答時間(最大)7.51s
応答時間(合計)11.08s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 余分な書式: 1
応答時間(平均)24.67s
応答時間(最大)35.28s
応答時間(合計)74.02s
-
汎用知能
: 5.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)6.40s
応答時間(最大)6.40s
応答時間(合計)6.40s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.52s
応答時間(最大)3.80s
応答時間(合計)7.04s
-
パズル解決
: 6.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)5.19s
応答時間(最大)5.49s
応答時間(合計)15.57s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #282#282 |
Hunter Alphamediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
4.7… |
OpenRouter |
$0.000
…
|
10.33s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 2 タイムアウト: 2 API エラー: 1 余分な書式: 1
応答時間(平均)10.33s
応答時間(最大)30.53s
応答時間(合計)175.58s
…
|
- 合計テスト数
- 18
- 誤答テスト数
- 10
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 53.0%
- 入力トークン
- 28,927
- 出力トークン
- 4,682
- 推論トークン
- 17,969
- 応答時間(平均)
- 10.33s
- 応答時間(合計)
- 175.58s
- 応答時間(最大)
- 30.53s
-
反AIトリック
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)4.75s
応答時間(最大)7.62s
応答時間(合計)19.00s
-
コーディング
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
複合
: 2.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)30.53s
応答時間(最大)30.53s
応答時間(合計)30.53s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.16s
応答時間(最大)26.55s
応答時間(合計)46.33s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 タイムアウト: 1 不正解: 1
応答時間(平均)10.52s
応答時間(最大)18.68s
応答時間(合計)31.56s
-
汎用知能
: 7.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)6.44s
応答時間(最大)6.44s
応答時間(合計)6.44s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.18s
応答時間(最大)4.46s
応答時間(合計)8.36s
-
パズル解決
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)5.35s
応答時間(最大)6.20s
応答時間(合計)16.06s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.33s
応答時間(最大)17.33s
応答時間(合計)17.33s
-
雑学
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #291#291 |
Grok 4.20 Betanoneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
4.4… |
X AI |
$0.087
↓
…
|
1.19s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 10 指示に従っていない: 1 無効なツール呼び出し: 1
応答時間(平均)1.19s
応答時間(最大)6.48s
応答時間(合計)21.43s
…
|
- 合計テスト数
- 18
- 誤答テスト数
- 12
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 30.3%
- 入力トークン
- 40,597
- 出力トークン
- 1,657
- 推論トークン
- 0
- 応答時間(平均)
- 1.19s
- 応答時間(合計)
- 21.43s
- 応答時間(最大)
- 6.48s
-
反AIトリック
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)597ms
応答時間(最大)866ms
応答時間(合計)2.39s
-
コーディング
: 1.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.14s
応答時間(最大)1.14s
応答時間(合計)1.14s
-
複合
: 1.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)6.48s
応答時間(最大)6.48s
応答時間(合計)6.48s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)601ms
応答時間(最大)634ms
応答時間(合計)1.20s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)611ms
応答時間(最大)616ms
応答時間(合計)1.83s
-
汎用知能
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)541ms
応答時間(最大)541ms
応答時間(合計)541ms
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)649ms
応答時間(最大)952ms
応答時間(合計)1.30s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)586ms
応答時間(最大)813ms
応答時間(合計)1.76s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.79s
応答時間(最大)4.79s
応答時間(合計)4.79s
-
雑学
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #293#293 |
Elephant Alphanoneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
4.3… |
Openrouter |
$0.000
…
|
1.22s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9 API エラー: 3 指示に従っていない: 3 無効なツール呼び出し: 1
応答時間(平均)1.22s
応答時間(最大)3.81s
応答時間(合計)22.03s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 16
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 25.8%
- 入力トークン
- 33,743
- 出力トークン
- 2,573
- 推論トークン
- 0
- 応答時間(平均)
- 1.22s
- 応答時間(合計)
- 22.03s
- 応答時間(最大)
- 3.81s
-
反AIトリック
: 6.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)963ms
応答時間(最大)1.68s
応答時間(合計)3.85s
-
コーディング
: 4.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 2 不正解: 1
応答時間(平均)1.39s
応答時間(最大)1.39s
応答時間(合計)1.39s
-
複合
: 1.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.81s
応答時間(最大)3.81s
応答時間(合計)3.81s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.04s
応答時間(最大)1.05s
応答時間(合計)2.08s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)927ms
応答時間(最大)1.17s
応答時間(合計)2.78s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)854ms
応答時間(最大)854ms
応答時間(合計)854ms
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.03s
応答時間(最大)1.17s
応答時間(合計)2.07s
-
パズル解決
: 4.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)807ms
応答時間(最大)925ms
応答時間(合計)2.42s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)2.79s
応答時間(最大)2.79s
応答時間(合計)2.79s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #295#295 |
Elephant Alphamediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
4.3… |
Openrouter |
$0.000
…
|
1.27s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9 API エラー: 3 指示に従っていない: 2 無効なツール呼び出し: 1
応答時間(平均)1.27s
応答時間(最大)3.70s
応答時間(合計)22.82s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 15
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 28.8%
- 入力トークン
- 33,744
- 出力トークン
- 2,596
- 推論トークン
- 0
- 応答時間(平均)
- 1.27s
- 応答時間(合計)
- 22.82s
- 応答時間(最大)
- 3.70s
-
反AIトリック
: 6.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.19s
応答時間(最大)2.04s
応答時間(合計)4.75s
-
コーディング
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 2 不正解: 1
応答時間(平均)1.30s
応答時間(最大)1.30s
応答時間(合計)1.30s
-
複合
: 1.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.70s
応答時間(最大)3.70s
応答時間(合計)3.70s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)979ms
応答時間(最大)1.02s
応答時間(合計)1.96s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)925ms
応答時間(最大)1.16s
応答時間(合計)2.77s
-
汎用知能
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)920ms
応答時間(最大)920ms
応答時間(合計)920ms
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)987ms
応答時間(最大)1.13s
応答時間(合計)1.97s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)868ms
応答時間(最大)972ms
応答時間(合計)2.60s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)2.83s
応答時間(最大)2.83s
応答時間(合計)2.83s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #297#297 |
Hunter Alphanoneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
4.2… |
OpenRouter |
$0.000
…
|
4.70s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9 指示に従っていない: 2 API エラー: 1
応答時間(平均)4.70s
応答時間(最大)15.17s
応答時間(合計)79.86s
…
|
- 合計テスト数
- 18
- 誤答テスト数
- 12
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 37.9%
- 入力トークン
- 34,329
- 出力トークン
- 2,264
- 推論トークン
- 0
- 応答時間(平均)
- 4.70s
- 応答時間(合計)
- 79.86s
- 応答時間(最大)
- 15.17s
-
反AIトリック
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)3.81s
応答時間(最大)6.85s
応答時間(合計)15.23s
-
コーディング
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
複合
: 1.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)15.17s
応答時間(最大)15.17s
応答時間(合計)15.17s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.49s
応答時間(最大)14.02s
応答時間(合計)16.98s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)2.33s
応答時間(最大)2.94s
応答時間(合計)6.99s
-
汎用知能
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.71s
応答時間(最大)2.71s
応答時間(合計)2.71s
-
指示追従
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.82s
応答時間(最大)2.92s
応答時間(合計)5.65s
-
パズル解決
: 5.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)3.71s
応答時間(最大)5.43s
応答時間(合計)11.13s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.02s
応答時間(最大)6.02s
応答時間(合計)6.02s
-
雑学
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #298#298 |
Grok 4.20none54/66 回 (目標: テストごとに 3 回)
|
4.1… |
X AI |
$0.057
↓
…
|
1.11s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 10 余分な書式: 1 無効なツール呼び出し: 1
応答時間(平均)1.11s
応答時間(最大)6.04s
応答時間(合計)19.96s
…
|
- 合計テスト数
- 18
- 誤答テスト数
- 12
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 27.3%
- 入力トークン
- 41,313
- 出力トークン
- 1,923
- 推論トークン
- 0
- 応答時間(平均)
- 1.11s
- 応答時間(合計)
- 19.96s
- 応答時間(最大)
- 6.04s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)501ms
応答時間(最大)839ms
応答時間(合計)2.01s
-
コーディング
: 1.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.22s
応答時間(最大)1.22s
応答時間(合計)1.22s
-
複合
: 1.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)6.04s
応答時間(最大)6.04s
応答時間(合計)6.04s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)522ms
応答時間(最大)537ms
応答時間(合計)1.04s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 余分な書式: 1
応答時間(平均)687ms
応答時間(最大)821ms
応答時間(合計)2.06s
-
汎用知能
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)659ms
応答時間(最大)659ms
応答時間(合計)659ms
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)445ms
応答時間(最大)505ms
応答時間(合計)889ms
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)473ms
応答時間(最大)502ms
応答時間(合計)1.42s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.63s
応答時間(最大)4.63s
応答時間(合計)4.63s
-
雑学
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #316#316 |
LFM2-24B-A2Bnoneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
2.2… |
Liquid |
$0.001
…
|
782ms… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9 API エラー: 4 指示に従っていない: 1
応答時間(平均)782ms
応答時間(最大)3.15s
応答時間(合計)10.94s
…
|
- 合計テスト数
- 16
- 誤答テスト数
- 14
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 12.1%
- 入力トークン
- 10,771
- 出力トークン
- 1,173
- 推論トークン
- 0
- 応答時間(平均)
- 782ms
- 応答時間(合計)
- 10.94s
- 応答時間(最大)
- 3.15s
-
反AIトリック
: 2.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)471ms
応答時間(最大)872ms
応答時間(合計)1.41s
-
コーディング
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
複合
: 1.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)714ms
応答時間(最大)987ms
応答時間(合計)1.43s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)287ms
応答時間(最大)334ms
応答時間(合計)860ms
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)395ms
応答時間(最大)395ms
応答時間(合計)395ms
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)752ms
応答時間(最大)1.22s
応答時間(合計)1.50s
-
パズル解決
: 3.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 API エラー: 1
応答時間(平均)1.78s
応答時間(最大)3.15s
応答時間(合計)5.34s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|