| #80#80 |
Mimo V2 Omnimedium
|
6.7… |
Xiaomi |
$0.683
↓
…
|
41.16s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 2 回答なし: 2 API エラー: 1 余分な書式: 1
応答時間(平均)41.16s
応答時間(最大)299.23s
応答時間(合計)823.26s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 11
- 試行ごとの合格率
- 55.6%
- 入力トークン
- 37,007
- 出力トークン
- 1,952
- 推論トークン
- 357,306
- 応答時間(平均)
- 41.16s
- 応答時間(合計)
- 823.26s
- 応答時間(最大)
- 299.23s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.75s
応答時間(最大)4.59s
応答時間(合計)10.98s
-
コーディング
: 3.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 回答なし: 1 不正解: 1
応答時間(平均)183.89s
応答時間(最大)299.23s
応答時間(合計)367.78s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)25.87s
応答時間(最大)25.87s
応答時間(合計)25.87s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.04s
応答時間(最大)4.12s
応答時間(合計)6.07s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 回答なし: 1 不正解: 1
応答時間(平均)47.89s
応答時間(最大)134.52s
応答時間(合計)143.67s
-
汎用知能
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.61s
応答時間(最大)3.61s
応答時間(合計)3.61s
-
指示追従
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.99s
応答時間(最大)7.14s
応答時間(合計)9.99s
-
パズル解決
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)2.38s
応答時間(最大)3.69s
応答時間(合計)7.13s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.98s
応答時間(最大)13.98s
応答時間(合計)13.98s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)234.19s
応答時間(最大)234.19s
応答時間(合計)234.19s
|
| #119#119 |
Cobuddymedium
|
5.6… |
Baidu |
$0.000
…
|
39.90s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9 指示に従っていない: 3 API エラー: 1 無効なツール呼び出し: 1
応答時間(平均)39.90s
応答時間(最大)309.02s
応答時間(合計)797.98s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 14
- 試行ごとの合格率
- 47.6%
- 入力トークン
- 37,449
- 出力トークン
- 1,677
- 推論トークン
- 116,703
- 応答時間(平均)
- 39.90s
- 応答時間(合計)
- 797.98s
- 応答時間(最大)
- 309.02s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.00s
応答時間(最大)11.53s
応答時間(合計)39.99s
-
コーディング
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 指示に従っていない: 1 不正解: 1
応答時間(平均)79.17s
応答時間(最大)104.76s
応答時間(合計)158.35s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)47.38s
応答時間(最大)47.38s
応答時間(合計)47.38s
-
データ解析と抽出
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)17.36s
応答時間(最大)26.57s
応答時間(合計)34.71s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)128.15s
応答時間(最大)309.02s
応答時間(合計)384.46s
-
汎用知能
: 4.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)23.23s
応答時間(最大)23.23s
応答時間(合計)23.23s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.60s
応答時間(最大)14.49s
応答時間(合計)23.20s
-
パズル解決
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)12.83s
応答時間(最大)24.40s
応答時間(合計)38.49s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.19s
応答時間(最大)11.19s
応答時間(合計)11.19s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)36.98s
応答時間(最大)36.98s
応答時間(合計)36.98s
|
| #83#83 |
Step 3.5 Flashnoneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
6.6… |
Stepfun |
$0.020
…
|
39.03s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 4 指示に従っていない: 1 不正解: 1
応答時間(平均)39.03s
応答時間(最大)114.12s
応答時間(合計)312.26s
…
|
- 合計テスト数
- 12
- 誤答テスト数
- 6
- 試行ごとの合格率
- 50.0%
- 入力トークン
- 1,971
- 出力トークン
- 64,795
- 推論トークン
- 0
- 応答時間(平均)
- 39.03s
- 応答時間(合計)
- 312.26s
- 応答時間(最大)
- 114.12s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)34.99s
応答時間(最大)109.60s
応答時間(合計)139.95s
-
コーディング
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
ドメイン特化
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)34.54s
応答時間(最大)34.54s
応答時間(合計)34.54s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)14.37s
応答時間(最大)14.37s
応答時間(合計)14.37s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.30s
応答時間(最大)9.30s
応答時間(合計)9.30s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)114.12s
応答時間(最大)114.12s
応答時間(合計)114.12s
|
| #18#18 |
Qwen3.7 Plusmedium
|
8.2… |
Qwen |
$0.221
…
|
38.95s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 タイムアウト: 1
応答時間(平均)38.95s
応答時間(最大)178.04s
応答時間(合計)817.85s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 6
- 試行ごとの合格率
- 77.8%
- 入力トークン
- 40,939
- 出力トークン
- 2,125
- 推論トークン
- 125,754
- 応答時間(平均)
- 38.95s
- 応答時間(合計)
- 817.85s
- 応答時間(最大)
- 178.04s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.58s
応答時間(最大)12.75s
応答時間(合計)34.33s
-
コーディング
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)108.60s
応答時間(最大)178.04s
応答時間(合計)325.79s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)65.24s
応答時間(最大)65.24s
応答時間(合計)65.24s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)21.75s
応答時間(最大)23.18s
応答時間(合計)43.49s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)45.35s
応答時間(最大)88.89s
応答時間(合計)136.04s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)25.48s
応答時間(最大)25.48s
応答時間(合計)25.48s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)16.13s
応答時間(最大)17.18s
応答時間(合計)32.26s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)16.38s
応答時間(最大)19.42s
応答時間(合計)49.14s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.02s
応答時間(最大)15.02s
応答時間(合計)15.02s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)91.07s
応答時間(最大)91.07s
応答時間(合計)91.07s
|
| #130#130 |
MiniMax M2.7medium
|
5.3… |
Minimax |
$0.124
↓
…
|
38.18s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 指示に従っていない: 5 タイムアウト: 2 API エラー: 1 無効なツール呼び出し: 1 回答なし: 1
応答時間(平均)38.18s
応答時間(最大)196.21s
応答時間(合計)763.60s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 16
- 試行ごとの合格率
- 46.0%
- 入力トークン
- 34,371
- 出力トークン
- 8,981
- 推論トークン
- 89,812
- 応答時間(平均)
- 38.18s
- 応答時間(合計)
- 763.60s
- 応答時間(最大)
- 196.21s
-
反AIトリック
: 7.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)40.32s
応答時間(最大)117.04s
応答時間(合計)161.28s
-
コーディング
: 5.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 回答なし: 1
応答時間(平均)101.89s
応答時間(最大)196.21s
応答時間(合計)305.67s
-
複合
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)41.03s
応答時間(最大)41.03s
応答時間(合計)41.03s
-
データ解析と抽出
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)21.95s
応答時間(最大)24.88s
応答時間(合計)43.89s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2 不正解: 1
応答時間(平均)19.00s
応答時間(最大)21.63s
応答時間(合計)38.01s
-
汎用知能
: 3.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)38.70s
応答時間(最大)38.70s
応答時間(合計)38.70s
-
指示追従
: 3.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)12.80s
応答時間(最大)15.23s
応答時間(合計)25.60s
-
パズル解決
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)24.87s
応答時間(最大)46.29s
応答時間(合計)74.61s
-
ツール呼び出し
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)12.05s
応答時間(最大)12.05s
応答時間(合計)12.05s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)22.77s
応答時間(最大)22.77s
応答時間(合計)22.77s
|
| #9#9 |
GPT-5.5medium
|
8.8… |
OpenAI |
$3.679
…
|
37.98s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)37.98s
応答時間(最大)332.10s
応答時間(合計)797.60s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 4
- 試行ごとの合格率
- 87.3%
- 入力トークン
- 34,212
- 出力トークン
- 1,985
- 推論トークン
- 114,925
- 応答時間(平均)
- 37.98s
- 応答時間(合計)
- 797.60s
- 応答時間(最大)
- 332.10s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.66s
応答時間(最大)6.74s
応答時間(合計)18.65s
-
コーディング
: 8.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)59.77s
応答時間(最大)130.26s
応答時間(合計)179.30s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)19.29s
応答時間(最大)19.29s
応答時間(合計)19.29s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.18s
応答時間(最大)4.35s
応答時間(合計)8.36s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)164.14s
応答時間(最大)332.10s
応答時間(合計)492.41s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.16s
応答時間(最大)4.16s
応答時間(合計)4.16s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.36s
応答時間(最大)3.46s
応答時間(合計)6.73s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.76s
応答時間(最大)10.54s
応答時間(合計)20.28s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)10.57s
応答時間(最大)10.57s
応答時間(合計)10.57s
-
雑学
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)37.86s
応答時間(最大)37.86s
応答時間(合計)37.86s
|
| #158#158 |
GLM 4.7 Flashmedium
|
4.4… |
Z.ai |
$0.054
…
|
35.10s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9 回答なし: 3 指示に従っていない: 2 タイムアウト: 2 無効なツール呼び出し: 1
応答時間(平均)35.10s
応答時間(最大)174.55s
応答時間(合計)456.24s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 17
- 試行ごとの合格率
- 33.3%
- 入力トークン
- 37,206
- 出力トークン
- 43,754
- 推論トークン
- 89,079
- 応答時間(平均)
- 35.10s
- 応答時間(合計)
- 456.24s
- 応答時間(最大)
- 174.55s
-
反AIトリック
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)14.95s
応答時間(最大)27.09s
応答時間(合計)29.90s
-
コーディング
: 3.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2 回答なし: 1
応答時間(平均)55.33s
応答時間(最大)89.40s
応答時間(合計)110.66s
-
複合
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)65.57s
応答時間(最大)65.57s
応答時間(合計)65.57s
-
データ解析と抽出
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)1.51s
応答時間(最大)1.51s
応答時間(合計)1.51s
-
ドメイン特化
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 回答なし: 1
応答時間(平均)174.55s
応答時間(最大)174.55s
応答時間(合計)174.55s
-
汎用知能
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)18.14s
応答時間(最大)18.14s
応答時間(合計)18.14s
-
指示追従
: 6.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.97s
応答時間(最大)2.97s
応答時間(合計)2.97s
-
パズル解決
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)12.93s
応答時間(最大)22.33s
応答時間(合計)25.85s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.95s
応答時間(最大)15.95s
応答時間(合計)15.95s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)11.13s
応答時間(最大)11.13s
応答時間(合計)11.13s
|
| #55#55 |
GLM 5.1medium
|
7.3… |
Z.ai |
$0.292
↓
…
|
33.67s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 タイムアウト: 2 API エラー: 1 余分な書式: 1 回答なし: 1
応答時間(平均)33.67s
応答時間(最大)172.60s
応答時間(合計)673.41s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 68.3%
- 入力トークン
- 32,995
- 出力トークン
- 11,655
- 推論トークン
- 75,421
- 応答時間(平均)
- 33.67s
- 応答時間(合計)
- 673.41s
- 応答時間(最大)
- 172.60s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.31s
応答時間(最大)14.20s
応答時間(合計)33.24s
-
コーディング
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 回答なし: 1 タイムアウト: 1
応答時間(平均)109.63s
応答時間(最大)172.60s
応答時間(合計)328.90s
-
複合
: 9.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)43.11s
応答時間(最大)43.11s
応答時間(合計)43.11s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.33s
応答時間(最大)9.40s
応答時間(合計)18.66s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)29.77s
応答時間(最大)32.22s
応答時間(合計)89.30s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)20.95s
応答時間(最大)20.95s
応答時間(合計)20.95s
-
指示追従
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)7.47s
応答時間(最大)10.16s
応答時間(合計)14.94s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)31.64s
応答時間(最大)46.04s
応答時間(合計)94.91s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)29.40s
応答時間(最大)29.40s
応答時間(合計)29.40s
|
| #17#17 |
GLM 5medium
|
8.3… |
Z.ai |
$0.228
↓
…
|
33.54s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 1 回答なし: 1 タイムアウト: 1
応答時間(平均)33.54s
応答時間(最大)99.85s
応答時間(合計)435.99s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 6
- 試行ごとの合格率
- 82.5%
- 入力トークン
- 35,224
- 出力トークン
- 21,570
- 推論トークン
- 102,996
- 応答時間(平均)
- 33.54s
- 応答時間(合計)
- 435.99s
- 応答時間(最大)
- 99.85s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.66s
応答時間(最大)25.06s
応答時間(合計)47.32s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)74.30s
応答時間(最大)99.85s
応答時間(合計)222.91s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)28.96s
応答時間(最大)28.96s
応答時間(合計)28.96s
-
データ解析と抽出
: 7.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)8.90s
応答時間(最大)8.90s
応答時間(合計)8.90s
-
ドメイン特化
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
汎用知能
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)14.69s
応答時間(最大)14.69s
応答時間(合計)14.69s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.25s
応答時間(最大)7.25s
応答時間(合計)7.25s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.33s
応答時間(最大)16.34s
応答時間(合計)22.66s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.93s
応答時間(最大)15.93s
応答時間(合計)15.93s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)67.37s
応答時間(最大)67.37s
応答時間(合計)67.37s
|
| #105#105 |
Nemotron 3 Supermedium
|
5.8… |
NVIDIA |
$0.021
↑
…
|
32.00s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 API エラー: 3 指示に従っていない: 3 回答なし: 1 タイムアウト: 1
応答時間(平均)32.00s
応答時間(最大)232.25s
応答時間(合計)607.91s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 13
- 試行ごとの合格率
- 41.3%
- 入力トークン
- 37,527
- 出力トークン
- 14,850
- 推論トークン
- 33,754
- 応答時間(平均)
- 32.00s
- 応答時間(合計)
- 607.91s
- 応答時間(最大)
- 232.25s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)7.85s
応答時間(最大)22.30s
応答時間(合計)31.40s
-
コーディング
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 3
応答時間(平均)147.32s
応答時間(最大)232.25s
応答時間(合計)294.64s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)87.80s
応答時間(最大)87.80s
応答時間(合計)87.80s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)18.16s
応答時間(最大)20.65s
応答時間(合計)36.33s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)16.19s
応答時間(最大)21.56s
応答時間(合計)32.39s
-
汎用知能
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)6.91s
応答時間(最大)6.91s
応答時間(合計)6.91s
-
指示追従
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)6.97s
応答時間(最大)11.23s
応答時間(合計)13.95s
-
パズル解決
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)3.15s
応答時間(最大)4.52s
応答時間(合計)9.45s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)39.75s
応答時間(最大)39.75s
応答時間(合計)39.75s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)55.32s
応答時間(最大)55.32s
応答時間(合計)55.32s
|
| #26#26 |
Qwen3.6 Plusmedium
|
7.9… |
Qwen |
$0.294
↑
…
|
30.70s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 API エラー: 1 指示に従っていない: 1
応答時間(平均)30.70s
応答時間(最大)201.68s
応答時間(合計)613.99s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 69.8%
- 入力トークン
- 41,565
- 出力トークン
- 1,853
- 推論トークン
- 141,973
- 応答時間(平均)
- 30.70s
- 応答時間(合計)
- 613.99s
- 応答時間(最大)
- 201.68s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.90s
応答時間(最大)19.37s
応答時間(合計)39.60s
-
コーディング
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)153.12s
応答時間(最大)201.68s
応答時間(合計)306.23s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)34.95s
応答時間(最大)34.95s
応答時間(合計)34.95s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.95s
応答時間(最大)15.40s
応答時間(合計)29.90s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)29.59s
応答時間(最大)43.55s
応答時間(合計)88.77s
-
汎用知能
: 5.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)27.05s
応答時間(最大)27.05s
応答時間(合計)27.05s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.54s
応答時間(最大)11.67s
応答時間(合計)15.07s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.34s
応答時間(最大)7.52s
応答時間(合計)19.03s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.87s
応答時間(最大)5.87s
応答時間(合計)5.87s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)47.51s
応答時間(最大)47.51s
応答時間(合計)47.51s
|
| #100#100 |
Grok Build 0.1noneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
6.0… |
X AI |
$0.547
…
|
28.69s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 7 API エラー: 3 指示に従っていない: 2
応答時間(平均)28.69s
応答時間(最大)138.35s
応答時間(合計)459.00s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 12
- 試行ごとの合格率
- 50.9%
- 入力トークン
- 11,793
- 出力トークン
- 267,275
- 推論トークン
- 0
- 応答時間(平均)
- 28.69s
- 応答時間(合計)
- 459.00s
- 応答時間(最大)
- 138.35s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.30s
応答時間(最大)9.80s
応答時間(合計)25.20s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)21.41s
応答時間(最大)21.41s
応答時間(合計)21.41s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 3.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)9.33s
応答時間(最大)9.33s
応答時間(合計)9.33s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)103.71s
応答時間(最大)138.35s
応答時間(合計)311.13s
-
汎用知能
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)12.47s
応答時間(最大)12.47s
応答時間(合計)12.47s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.36s
応答時間(最大)11.05s
応答時間(合計)14.73s
-
パズル解決
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)9.55s
応答時間(最大)18.18s
応答時間(合計)28.65s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)36.09s
応答時間(最大)36.09s
応答時間(合計)36.09s
|
| #65#65 |
Grok 4.20medium
|
7.1… |
X AI |
$0.609
↓
…
|
27.68s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 指示に従っていない: 2 余分な書式: 1
応答時間(平均)27.68s
応答時間(最大)199.66s
応答時間(合計)581.26s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 63.5%
- 入力トークン
- 44,433
- 出力トークン
- 1,819
- 推論トークン
- 219,524
- 応答時間(平均)
- 27.68s
- 応答時間(合計)
- 581.26s
- 応答時間(最大)
- 199.66s
-
反AIトリック
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.95s
応答時間(最大)5.68s
応答時間(合計)15.80s
-
コーディング
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)109.93s
応答時間(最大)199.66s
応答時間(合計)329.79s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.40s
応答時間(最大)17.40s
応答時間(合計)17.40s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.17s
応答時間(最大)5.02s
応答時間(合計)8.34s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)27.03s
応答時間(最大)29.87s
応答時間(合計)81.10s
-
汎用知能
: 3.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)24.48s
応答時間(最大)24.48s
応答時間(合計)24.48s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.26s
応答時間(最大)4.46s
応答時間(合計)8.52s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.22s
応答時間(最大)11.63s
応答時間(合計)18.66s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)13.68s
応答時間(最大)13.68s
応答時間(合計)13.68s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)63.48s
応答時間(最大)63.48s
応答時間(合計)63.48s
|
| #56#56 |
MiMo-V2.5medium
|
7.3… |
Xiaomi |
$0.063
↓
…
|
27.11s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 余分な書式: 2 指示に従っていない: 1 回答なし: 1
応答時間(平均)27.11s
応答時間(最大)162.44s
応答時間(合計)569.38s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 69.8%
- 入力トークン
- 41,838
- 出力トークン
- 2,827
- 推論トークン
- 198,898
- 応答時間(平均)
- 27.11s
- 応答時間(合計)
- 569.38s
- 応答時間(最大)
- 162.44s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.14s
応答時間(最大)12.41s
応答時間(合計)16.57s
-
コーディング
: 6.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)97.14s
応答時間(最大)162.44s
応答時間(合計)291.41s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)16.86s
応答時間(最大)16.86s
応答時間(合計)16.86s
-
データ解析と抽出
: 2.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)6.33s
応答時間(最大)7.45s
応答時間(合計)12.67s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)34.53s
応答時間(最大)86.93s
応答時間(合計)103.59s
-
汎用知能
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)5.37s
応答時間(最大)5.37s
応答時間(合計)5.37s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.80s
応答時間(最大)1.81s
応答時間(合計)3.60s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)20.25s
応答時間(最大)57.93s
応答時間(合計)60.76s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.29s
応答時間(最大)7.29s
応答時間(合計)7.29s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)51.29s
応答時間(最大)51.29s
応答時間(合計)51.29s
|
| #139#139 |
DeepSeek V4 Flashnone
|
5.0… |
DeepSeek |
$0.008
↓
…
|
26.75s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 12 余分な書式: 2 指示に従っていない: 1 無効なツール呼び出し: 1
応答時間(平均)26.75s
応答時間(最大)111.96s
応答時間(合計)561.82s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 16
- 試行ごとの合格率
- 30.2%
- 入力トークン
- 50,127
- 出力トークン
- 13,710
- 推論トークン
- 0
- 応答時間(平均)
- 26.75s
- 応答時間(合計)
- 561.82s
- 応答時間(最大)
- 111.96s
-
反AIトリック
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)20.18s
応答時間(最大)26.54s
応答時間(合計)80.73s
-
コーディング
: 4.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)17.13s
応答時間(最大)24.90s
応答時間(合計)51.40s
-
複合
: 4.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)111.96s
応答時間(最大)111.96s
応答時間(合計)111.96s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.79s
応答時間(最大)23.85s
応答時間(合計)47.57s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)19.73s
応答時間(最大)27.66s
応答時間(合計)59.18s
-
汎用知能
: 4.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)23.74s
応答時間(最大)23.74s
応答時間(合計)23.74s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)17.54s
応答時間(最大)18.51s
応答時間(合計)35.08s
-
パズル解決
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 指示に従っていない: 1 不正解: 1
応答時間(平均)23.72s
応答時間(最大)29.24s
応答時間(合計)71.16s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)77.93s
応答時間(最大)77.93s
応答時間(合計)77.93s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.07s
応答時間(最大)3.07s
応答時間(合計)3.07s
|
| #43#43 |
MiMo-V2.5-Promedium
|
7.5… |
Xiaomi |
$0.106
↓
…
|
26.13s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 3 不正解: 3 指示に従っていない: 2 API エラー: 1
応答時間(平均)26.13s
応答時間(最大)130.77s
応答時間(合計)548.65s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 68.3%
- 入力トークン
- 40,854
- 出力トークン
- 5,015
- 推論トークン
- 97,742
- 応答時間(平均)
- 26.13s
- 応答時間(合計)
- 548.65s
- 応答時間(最大)
- 130.77s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.26s
応答時間(最大)6.38s
応答時間(合計)13.06s
-
コーディング
: 6.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 余分な書式: 1
応答時間(平均)92.07s
応答時間(最大)130.77s
応答時間(合計)276.20s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)53.36s
応答時間(最大)53.36s
応答時間(合計)53.36s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)18.81s
応答時間(最大)20.29s
応答時間(合計)37.61s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 2
応答時間(平均)37.87s
応答時間(最大)84.22s
応答時間(合計)113.60s
-
汎用知能
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.02s
応答時間(最大)4.02s
応答時間(合計)4.02s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.77s
応答時間(最大)3.21s
応答時間(合計)5.54s
-
パズル解決
: 6.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)5.31s
応答時間(最大)9.12s
応答時間(合計)15.94s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)16.87s
応答時間(最大)16.87s
応答時間(合計)16.87s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)12.46s
応答時間(最大)12.46s
応答時間(合計)12.46s
|
| #69#69 |
Claude Opus 4.6medium
|
7.0… |
Anthropic |
$2.053
…
|
25.89s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 5 不正解: 3 指示に従っていない: 1
応答時間(平均)25.89s
応答時間(最大)83.40s
応答時間(合計)362.49s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 61.9%
- 入力トークン
- 53,227
- 出力トークン
- 47,446
- 推論トークン
- 24,000
- 応答時間(平均)
- 25.89s
- 応答時間(合計)
- 362.49s
- 応答時間(最大)
- 83.40s
-
反AIトリック
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 2
応答時間(平均)7.45s
応答時間(最大)11.88s
応答時間(合計)14.90s
-
コーディング
: 5.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 指示に従っていない: 1
応答時間(平均)30.10s
応答時間(最大)35.63s
応答時間(合計)90.31s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)76.66s
応答時間(最大)76.66s
応答時間(合計)76.66s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.37s
応答時間(最大)7.37s
応答時間(合計)7.37s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 2 不正解: 1
応答時間(平均)83.40s
応答時間(最大)83.40s
応答時間(合計)83.40s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.04s
応答時間(最大)5.04s
応答時間(合計)5.04s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.43s
応答時間(最大)2.43s
応答時間(合計)2.43s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.71s
応答時間(最大)4.75s
応答時間(合計)9.41s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.73s
応答時間(最大)9.73s
応答時間(合計)9.73s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)63.24s
応答時間(最大)63.24s
応答時間(合計)63.24s
|
| #89#89 |
Hy3 previewlowアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
6.4… |
Tencent |
$0.015
…
|
24.56s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 7 不正解: 4
応答時間(平均)24.56s
応答時間(最大)78.74s
応答時間(合計)368.35s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 11
- 試行ごとの合格率
- 52.4%
- 入力トークン
- 21,045
- 出力トークン
- 63,460
- 推論トークン
- 0
- 応答時間(平均)
- 24.56s
- 応答時間(合計)
- 368.35s
- 応答時間(最大)
- 78.74s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)9.32s
応答時間(最大)12.36s
応答時間(合計)27.96s
-
コーディング
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 2
応答時間(平均)27.94s
応答時間(最大)27.94s
応答時間(合計)27.94s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)78.74s
応答時間(最大)78.74s
応答時間(合計)78.74s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)5.85s
応答時間(最大)5.85s
応答時間(合計)5.85s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)40.44s
応答時間(最大)46.32s
応答時間(合計)121.31s
-
汎用知能
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.98s
応答時間(最大)22.24s
応答時間(合計)31.97s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)7.51s
応答時間(最大)7.86s
応答時間(合計)15.02s
-
ツール呼び出し
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)17.84s
応答時間(最大)17.84s
応答時間(合計)17.84s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)41.74s
応答時間(最大)41.74s
応答時間(合計)41.74s
|
| #86#86 |
Grok 4.1 Fastmediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
6.5… |
X AI |
$0.069
↑
…
|
23.85s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 4 不正解: 4 回答なし: 1 タイムアウト: 1
応答時間(平均)23.85s
応答時間(最大)121.79s
応答時間(合計)286.16s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 10
- 試行ごとの合格率
- 61.4%
- 入力トークン
- 42,845
- 出力トークン
- 2,006
- 推論トークン
- 96,334
- 応答時間(平均)
- 23.85s
- 応答時間(合計)
- 286.16s
- 応答時間(最大)
- 121.79s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.81s
応答時間(最大)5.65s
応答時間(合計)7.62s
-
コーディング
: 2.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)23.58s
応答時間(最大)23.58s
応答時間(合計)23.58s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)37.64s
応答時間(最大)37.64s
応答時間(合計)37.64s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.63s
応答時間(最大)6.63s
応答時間(合計)6.63s
-
ドメイン特化
: 5.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)121.79s
応答時間(最大)121.79s
応答時間(合計)121.79s
-
汎用知能
: 4.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)16.25s
応答時間(最大)16.25s
応答時間(合計)16.25s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.63s
応答時間(最大)4.63s
応答時間(合計)4.63s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)7.40s
応答時間(最大)7.79s
応答時間(合計)14.81s
-
ツール呼び出し
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)27.71s
応答時間(最大)27.71s
応答時間(合計)27.71s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)25.52s
応答時間(最大)25.52s
応答時間(合計)25.52s
|
| #54#54 |
GPT-5 Minimedium
|
7.3… |
OpenAI |
$0.159
…
|
23.64s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 3 タイムアウト: 1
応答時間(平均)23.64s
応答時間(最大)88.15s
応答時間(合計)496.44s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 63.5%
- 入力トークン
- 37,100
- 出力トークン
- 6,801
- 推論トークン
- 67,690
- 応答時間(平均)
- 23.64s
- 応答時間(合計)
- 496.44s
- 応答時間(最大)
- 88.15s
-
反AIトリック
: 7.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)13.86s
応答時間(最大)26.00s
応答時間(合計)55.45s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)27.63s
応答時間(最大)38.31s
応答時間(合計)82.89s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)88.15s
応答時間(最大)88.15s
応答時間(合計)88.15s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.58s
応答時間(最大)13.87s
応答時間(合計)25.16s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)44.63s
応答時間(最大)82.55s
応答時間(合計)133.89s
-
汎用知能
: 4.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)13.50s
応答時間(最大)13.50s
応答時間(合計)13.50s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.59s
応答時間(最大)13.66s
応答時間(合計)23.18s
-
パズル解決
: 5.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)15.20s
応答時間(最大)18.90s
応答時間(合計)45.59s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)18.64s
応答時間(最大)18.64s
応答時間(合計)18.64s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)9.99s
応答時間(最大)9.99s
応答時間(合計)9.99s
|
| #59#59 |
GLM 5V Turbomedium
|
7.2… |
Z.ai |
$0.457
…
|
23.08s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 7 無効なツール呼び出し: 2 指示に従っていない: 1
応答時間(平均)23.08s
応答時間(最大)95.88s
応答時間(合計)484.63s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 10
- 試行ごとの合格率
- 68.3%
- 入力トークン
- 44,615
- 出力トークン
- 2,347
- 推論トークン
- 98,415
- 応答時間(平均)
- 23.08s
- 応答時間(合計)
- 484.63s
- 応答時間(最大)
- 95.88s
-
反AIトリック
: 7.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)10.76s
応答時間(最大)14.40s
応答時間(合計)43.02s
-
コーディング
: 6.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)63.38s
応答時間(最大)95.88s
応答時間(合計)190.15s
-
複合
: 6.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)15.06s
応答時間(最大)15.06s
応答時間(合計)15.06s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.60s
応答時間(最大)9.92s
応答時間(合計)19.19s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)38.15s
応答時間(最大)67.08s
応答時間(合計)114.45s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.09s
応答時間(最大)11.09s
応答時間(合計)11.09s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.74s
応答時間(最大)5.23s
応答時間(合計)7.47s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.24s
応答時間(最大)16.95s
応答時間(合計)30.72s
-
ツール呼び出し
: 7.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)12.53s
応答時間(最大)12.53s
応答時間(合計)12.53s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)40.96s
応答時間(最大)40.96s
応答時間(合計)40.96s
|
| #23#23 |
GLM 5 Turbomedium
|
8.0… |
Z.ai |
$0.323
↑
…
|
23.00s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 1 回答なし: 1 タイムアウト: 1
応答時間(平均)23.00s
応答時間(最大)194.23s
応答時間(合計)482.97s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 74.6%
- 入力トークン
- 35,593
- 出力トークン
- 12,245
- 推論トークン
- 62,277
- 応答時間(平均)
- 23.00s
- 応答時間(合計)
- 482.97s
- 応答時間(最大)
- 194.23s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.82s
応答時間(最大)7.69s
応答時間(合計)19.26s
-
コーディング
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)45.90s
応答時間(最大)95.57s
応答時間(合計)137.71s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.88s
応答時間(最大)13.88s
応答時間(合計)13.88s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.19s
応答時間(最大)6.42s
応答時間(合計)12.38s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)71.07s
応答時間(最大)194.23s
応答時間(合計)213.22s
-
汎用知能
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.05s
応答時間(最大)10.05s
応答時間(合計)10.05s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.38s
応答時間(最大)5.70s
応答時間(合計)10.77s
-
パズル解決
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)5.23s
応答時間(最大)7.26s
応答時間(合計)15.69s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.84s
応答時間(最大)9.84s
応答時間(合計)9.84s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)40.17s
応答時間(最大)40.17s
応答時間(合計)40.17s
|
| #21#21 |
GPT-5.4medium
|
8.0… |
OpenAI |
$1.210
…
|
22.35s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 2
応答時間(平均)22.35s
応答時間(最大)100.41s
応答時間(合計)469.29s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 76.2%
- 入力トークン
- 34,108
- 出力トークン
- 2,242
- 推論トークン
- 72,707
- 応答時間(平均)
- 22.35s
- 応答時間(合計)
- 469.29s
- 応答時間(最大)
- 100.41s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.11s
応答時間(最大)6.42s
応答時間(合計)16.42s
-
コーディング
: 8.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)44.36s
応答時間(最大)96.94s
応答時間(合計)133.08s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)20.57s
応答時間(最大)20.57s
応答時間(合計)20.57s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.32s
応答時間(最大)5.40s
応答時間(合計)10.64s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)74.27s
応答時間(最大)100.41s
応答時間(合計)222.80s
-
汎用知能
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.92s
応答時間(最大)4.92s
応答時間(合計)4.92s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.11s
応答時間(最大)3.68s
応答時間(合計)6.22s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)9.14s
応答時間(最大)18.14s
応答時間(合計)27.41s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.28s
応答時間(最大)13.28s
応答時間(合計)13.28s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)13.95s
応答時間(最大)13.95s
応答時間(合計)13.95s
|
| #45#45 |
GPT-5.4 Minimedium
|
7.5… |
OpenAI |
$0.526
…
|
22.34s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 指示に従っていない: 3
応答時間(平均)22.34s
応答時間(最大)138.75s
応答時間(合計)469.20s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 73.0%
- 入力トークン
- 34,116
- 出力トークン
- 2,181
- 推論トークン
- 108,937
- 応答時間(平均)
- 22.34s
- 応答時間(合計)
- 469.20s
- 応答時間(最大)
- 138.75s
-
反AIトリック
: 8.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.05s
応答時間(最大)6.69s
応答時間(合計)16.20s
-
コーディング
: 8.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)57.87s
応答時間(最大)138.75s
応答時間(合計)173.61s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.81s
応答時間(最大)17.81s
応答時間(合計)17.81s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.43s
応答時間(最大)3.39s
応答時間(合計)4.87s
-
ドメイン特化
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)65.31s
応答時間(最大)102.91s
応答時間(合計)195.92s
-
汎用知能
: 4.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)3.72s
応答時間(最大)3.72s
応答時間(合計)3.72s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.13s
応答時間(最大)2.45s
応答時間(合計)4.25s
-
パズル解決
: 7.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.37s
応答時間(最大)7.27s
応答時間(合計)13.11s
-
ツール呼び出し
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)9.62s
応答時間(最大)9.62s
応答時間(合計)9.62s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)30.10s
応答時間(最大)30.10s
応答時間(合計)30.10s
|
| #99#99 |
gpt-oss-120bmedium
|
6.1… |
OpenAI |
$0.013
↓
…
|
22.28s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9 指示に従っていない: 3
応答時間(平均)22.28s
応答時間(最大)68.16s
応答時間(合計)311.96s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 12
- 試行ごとの合格率
- 52.4%
- 入力トークン
- 39,084
- 出力トークン
- 20,013
- 推論トークン
- 50,233
- 応答時間(平均)
- 22.28s
- 応答時間(合計)
- 311.96s
- 応答時間(最大)
- 68.16s
-
反AIトリック
: 6.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)10.21s
応答時間(最大)19.76s
応答時間(合計)20.43s
-
コーディング
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)38.37s
応答時間(最大)68.16s
応答時間(合計)115.10s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)31.18s
応答時間(最大)31.18s
応答時間(合計)31.18s
-
データ解析と抽出
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.98s
応答時間(最大)1.98s
応答時間(合計)1.98s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)50.92s
応答時間(最大)50.92s
応答時間(合計)50.92s
-
汎用知能
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)7.90s
応答時間(最大)7.90s
応答時間(合計)7.90s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.63s
応答時間(最大)7.63s
応答時間(合計)7.63s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)21.71s
応答時間(最大)32.40s
応答時間(合計)43.41s
-
ツール呼び出し
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.91s
応答時間(最大)6.91s
応答時間(合計)6.91s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)26.51s
応答時間(最大)26.51s
応答時間(合計)26.51s
|
| #51#51 |
Mimo V2 PROmedium
|
7.4… |
Xiaomi |
$0.333
↑
…
|
22.16s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 API エラー: 1 余分な書式: 1 指示に従っていない: 1 タイムアウト: 1
応答時間(平均)22.16s
応答時間(最大)136.29s
応答時間(合計)443.22s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 73.0%
- 入力トークン
- 40,961
- 出力トークン
- 2,518
- 推論トークン
- 81,801
- 応答時間(平均)
- 22.16s
- 応答時間(合計)
- 443.22s
- 応答時間(最大)
- 136.29s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.86s
応答時間(最大)3.92s
応答時間(合計)11.45s
-
コーディング
: 6.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)94.21s
応答時間(最大)136.29s
応答時間(合計)188.41s
-
複合
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)64.71s
応答時間(最大)64.71s
応答時間(合計)64.71s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)17.20s
応答時間(最大)17.44s
応答時間(合計)34.40s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)8.82s
応答時間(最大)14.48s
応答時間(合計)26.47s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.92s
応答時間(最大)4.92s
応答時間(合計)4.92s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.36s
応答時間(最大)4.35s
応答時間(合計)6.72s
-
パズル解決
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 指示に従っていない: 1
応答時間(平均)5.08s
応答時間(最大)6.41s
応答時間(合計)15.23s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.19s
応答時間(最大)8.19s
応答時間(合計)8.19s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)82.71s
応答時間(最大)82.71s
応答時間(合計)82.71s
|
| #126#126 |
gpt-oss-120bnone
|
5.4… |
OpenAI |
$0.010
↓
…
|
21.61s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 8 API エラー: 3 指示に従っていない: 2
応答時間(平均)21.61s
応答時間(最大)113.71s
応答時間(合計)345.79s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 13
- 試行ごとの合格率
- 38.6%
- 入力トークン
- 9,081
- 出力トークン
- 51,664
- 推論トークン
- 0
- 応答時間(平均)
- 21.61s
- 応答時間(合計)
- 345.79s
- 応答時間(最大)
- 113.71s
-
反AIトリック
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)32.84s
応答時間(最大)113.71s
応答時間(合計)131.35s
-
コーディング
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)9.57s
応答時間(最大)9.57s
応答時間(合計)9.57s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)7.12s
応答時間(最大)7.12s
応答時間(合計)7.12s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)34.98s
応答時間(最大)68.97s
応答時間(合計)104.94s
-
汎用知能
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.79s
応答時間(最大)10.79s
応答時間(合計)10.79s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.06s
応答時間(最大)5.85s
応答時間(合計)10.12s
-
パズル解決
: 6.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)8.21s
応答時間(最大)11.82s
応答時間(合計)24.62s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)47.29s
応答時間(最大)47.29s
応答時間(合計)47.29s
|
| #22#22 |
Step 3.7 Flashmedium
|
8.0… |
Stepfun |
$0.376
…
|
20.35s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 1 回答なし: 1
応答時間(平均)20.35s
応答時間(最大)113.98s
応答時間(合計)427.42s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 73.0%
- 入力トークン
- 39,981
- 出力トークン
- 319,958
- 推論トークン
- 0
- 応答時間(平均)
- 20.35s
- 応答時間(合計)
- 427.42s
- 応答時間(最大)
- 113.98s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)9.65s
応答時間(最大)35.08s
応答時間(合計)38.62s
-
コーディング
: 8.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)27.42s
応答時間(最大)60.98s
応答時間(合計)82.26s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.06s
応答時間(最大)9.06s
応答時間(合計)9.06s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.75s
応答時間(最大)3.35s
応答時間(合計)5.49s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)48.27s
応答時間(最大)97.10s
応答時間(合計)144.81s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.85s
応答時間(最大)6.85s
応答時間(合計)6.85s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.83s
応答時間(最大)2.21s
応答時間(合計)3.65s
-
パズル解決
: 5.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)6.19s
応答時間(最大)12.51s
応答時間(合計)18.56s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.16s
応答時間(最大)4.16s
応答時間(合計)4.16s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)113.98s
応答時間(最大)113.98s
応答時間(合計)113.98s
|
| #4#4 |
Gemini 3.1 Pro Previewmedium
|
9.4… |
Google |
$1.054
…
|
20.14s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)20.14s
応答時間(最大)88.68s
応答時間(合計)281.92s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 2
- 試行ごとの合格率
- 90.5%
- 入力トークン
- 41,617
- 出力トークン
- 1,977
- 推論トークン
- 78,896
- 応答時間(平均)
- 20.14s
- 応答時間(合計)
- 281.92s
- 応答時間(最大)
- 88.68s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.90s
応答時間(最大)9.52s
応答時間(合計)15.80s
-
コーディング
: 7.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)40.17s
応答時間(最大)88.68s
応答時間(合計)120.52s
-
複合
: 9.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)40.61s
応答時間(最大)40.61s
応答時間(合計)40.61s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.72s
応答時間(最大)7.72s
応答時間(合計)7.72s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)32.73s
応答時間(最大)32.73s
応答時間(合計)32.73s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.77s
応答時間(最大)11.77s
応答時間(合計)11.77s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.56s
応答時間(最大)9.56s
応答時間(合計)9.56s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.90s
応答時間(最大)8.49s
応答時間(合計)13.79s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.15s
応答時間(最大)23.15s
応答時間(合計)23.15s
-
雑学
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.27s
応答時間(最大)6.27s
応答時間(合計)6.27s
|
| #64#64 |
MiMo-V2-Flashmedium
|
7.2… |
Xiaomi |
$0.043
↑
…
|
20.11s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 API エラー: 1 余分な書式: 1 指示に従っていない: 1 タイムアウト: 1
応答時間(平均)20.11s
応答時間(最大)96.01s
応答時間(合計)301.59s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 65.1%
- 入力トークン
- 40,111
- 出力トークン
- 12,476
- 推論トークン
- 125,039
- 応答時間(平均)
- 20.11s
- 応答時間(合計)
- 301.59s
- 応答時間(最大)
- 96.01s
-
反AIトリック
: 8.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)15.85s
応答時間(最大)20.83s
応答時間(合計)47.55s
-
コーディング
: 6.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)10.71s
応答時間(最大)17.72s
応答時間(合計)32.13s
-
複合
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)75.68s
応答時間(最大)75.68s
応答時間(合計)75.68s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)96.01s
応答時間(最大)96.01s
応答時間(合計)96.01s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.20s
応答時間(最大)4.20s
応答時間(合計)4.20s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.28s
応答時間(最大)7.37s
応答時間(合計)8.55s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.87s
応答時間(最大)5.26s
応答時間(合計)7.74s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)27.78s
応答時間(最大)27.78s
応答時間(合計)27.78s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.96s
応答時間(最大)1.96s
応答時間(合計)1.96s
|