| #114#114 |
Kimi K2.6none
|
5.8… |
Moonshot AI |
$0.078
↓
…
|
13.27s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 11 指示に従っていない: 3
応答時間(平均)13.27s
応答時間(最大)238.89s
応答時間(合計)278.57s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 14
- 試行ごとの合格率
- 36.5%
- 入力トークン
- 32,916
- 出力トークン
- 16,410
- 推論トークン
- 0
- 応答時間(平均)
- 13.27s
- 応答時間(合計)
- 278.57s
- 応答時間(最大)
- 238.89s
-
反AIトリック
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.39s
応答時間(最大)2.96s
応答時間(合計)5.56s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)82.57s
応答時間(最大)238.89s
応答時間(合計)247.72s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.38s
応答時間(最大)3.38s
応答時間(合計)3.38s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.32s
応答時間(最大)1.39s
応答時間(合計)2.64s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.48s
応答時間(最大)1.85s
応答時間(合計)4.45s
-
汎用知能
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.55s
応答時間(最大)1.55s
応答時間(合計)1.55s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.64s
応答時間(最大)1.80s
応答時間(合計)3.28s
-
パズル解決
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)1.40s
応答時間(最大)1.81s
応答時間(合計)4.19s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.46s
応答時間(最大)4.46s
応答時間(合計)4.46s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.36s
応答時間(最大)1.36s
応答時間(合計)1.36s
|
| #113#113 |
Owl Alphanoneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
5.8… |
Openrouter |
$0.000
…
|
9.88s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 10 指示に従っていない: 3 余分な書式: 1
応答時間(平均)9.88s
応答時間(最大)47.10s
応答時間(合計)207.38s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 14
- 試行ごとの合格率
- 36.5%
- 入力トークン
- 42,283
- 出力トークン
- 5,913
- 推論トークン
- 0
- 応答時間(平均)
- 9.88s
- 応答時間(合計)
- 207.38s
- 応答時間(最大)
- 47.10s
-
反AIトリック
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 1
応答時間(平均)2.78s
応答時間(最大)3.09s
応答時間(合計)11.10s
-
コーディング
: 5.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)36.89s
応答時間(最大)47.10s
応答時間(合計)110.66s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)21.74s
応答時間(最大)21.74s
応答時間(合計)21.74s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.60s
応答時間(最大)3.92s
応答時間(合計)7.19s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)3.00s
応答時間(最大)4.69s
応答時間(合計)8.99s
-
汎用知能
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.61s
応答時間(最大)4.61s
応答時間(合計)4.61s
-
指示追従
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.63s
応答時間(最大)2.77s
応答時間(合計)5.27s
-
パズル解決
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)4.18s
応答時間(最大)8.27s
応答時間(合計)12.54s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)22.78s
応答時間(最大)22.78s
応答時間(合計)22.78s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.50s
応答時間(最大)2.50s
応答時間(合計)2.50s
|
| #112#112 |
Mimo V2 PROnoneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
5.8… |
Xiaomi |
$0.045
↓
…
|
2.27s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 11 指示に従っていない: 2 API エラー: 1
応答時間(平均)2.27s
応答時間(最大)6.58s
応答時間(合計)45.50s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 14
- 試行ごとの合格率
- 41.3%
- 入力トークン
- 39,344
- 出力トークン
- 2,352
- 推論トークン
- 0
- 応答時間(平均)
- 2.27s
- 応答時間(合計)
- 45.50s
- 応答時間(最大)
- 6.58s
-
反AIトリック
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)1.80s
応答時間(最大)2.62s
応答時間(合計)7.19s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)2.65s
応答時間(最大)3.82s
応答時間(合計)5.30s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.58s
応答時間(最大)6.58s
応答時間(合計)6.58s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.39s
応答時間(最大)1.42s
応答時間(合計)2.78s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.78s
応答時間(最大)2.49s
応答時間(合計)5.34s
-
汎用知能
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.44s
応答時間(最大)2.44s
応答時間(合計)2.44s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.51s
応答時間(最大)2.95s
応答時間(合計)5.02s
-
パズル解決
: 6.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)1.61s
応答時間(最大)2.15s
応答時間(合計)4.83s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.39s
応答時間(最大)4.39s
応答時間(合計)4.39s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.63s
応答時間(最大)1.63s
応答時間(合計)1.63s
|
| #111#111 |
Owl Alphamediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
5.8… |
Openrouter |
$0.000
…
|
11.95s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 10 指示に従っていない: 2 API エラー: 1
応答時間(平均)11.95s
応答時間(最大)58.63s
応答時間(合計)250.88s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 13
- 試行ごとの合格率
- 39.7%
- 入力トークン
- 43,478
- 出力トークン
- 2,974
- 推論トークン
- 0
- 応答時間(平均)
- 11.95s
- 応答時間(合計)
- 250.88s
- 応答時間(最大)
- 58.63s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)3.97s
応答時間(最大)7.48s
応答時間(合計)15.89s
-
コーディング
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)18.74s
応答時間(最大)30.81s
応答時間(合計)56.21s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.01s
応答時間(最大)10.01s
応答時間(合計)10.01s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)21.64s
応答時間(最大)29.16s
応答時間(合計)43.28s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)8.58s
応答時間(最大)9.48s
応答時間(合計)25.74s
-
汎用知能
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)58.63s
応答時間(最大)58.63s
応答時間(合計)58.63s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.15s
応答時間(最大)15.94s
応答時間(合計)20.30s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)3.40s
応答時間(最大)4.60s
応答時間(合計)10.19s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.26s
応答時間(最大)8.26s
応答時間(合計)8.26s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.38s
応答時間(最大)2.38s
応答時間(合計)2.38s
|
| #110#110 |
North Mini Codemedium
|
5.8… |
Cohere |
$0.000
…
|
106.18s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9 余分な書式: 2 API エラー: 1
応答時間(平均)106.18s
応答時間(最大)357.05s
応答時間(合計)2229.70s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 12
- 試行ごとの合格率
- 50.8%
- 入力トークン
- 32,891
- 出力トークン
- 424,772
- 推論トークン
- 1,021,489
- 応答時間(平均)
- 106.18s
- 応答時間(合計)
- 2229.70s
- 応答時間(最大)
- 357.05s
-
反AIトリック
: 8.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)64.79s
応答時間(最大)230.24s
応答時間(合計)259.15s
-
コーディング
: 4.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)320.43s
応答時間(最大)357.05s
応答時間(合計)961.28s
-
複合
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)323.07s
応答時間(最大)323.07s
応答時間(合計)323.07s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)24.06s
応答時間(最大)26.90s
応答時間(合計)48.13s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)71.37s
応答時間(最大)195.94s
応答時間(合計)214.11s
-
汎用知能
: 5.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)25.08s
応答時間(最大)25.08s
応答時間(合計)25.08s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.43s
応答時間(最大)28.25s
応答時間(合計)30.85s
-
パズル解決
: 3.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)19.70s
応答時間(最大)36.03s
応答時間(合計)59.10s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.93s
応答時間(最大)3.93s
応答時間(合計)3.93s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)305.02s
応答時間(最大)305.02s
応答時間(合計)305.02s
|
| #109#109 |
Qwen3.5 Plus 2026-02-15none
|
5.8… |
Qwen |
$0.016
↓
…
|
2.31s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 12
応答時間(平均)2.31s
応答時間(最大)6.65s
応答時間(合計)34.63s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 12
- 試行ごとの合格率
- 46.0%
- 入力トークン
- 45,864
- 出力トークン
- 2,480
- 推論トークン
- 0
- 応答時間(平均)
- 2.31s
- 応答時間(合計)
- 34.63s
- 応答時間(最大)
- 6.65s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.91s
応答時間(最大)2.74s
応答時間(合計)3.82s
-
コーディング
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)2.05s
応答時間(最大)3.63s
応答時間(合計)6.15s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.65s
応答時間(最大)6.65s
応答時間(合計)6.65s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.89s
応答時間(最大)1.89s
応答時間(合計)1.89s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.17s
応答時間(最大)1.44s
応答時間(合計)2.33s
-
汎用知能
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.26s
応答時間(最大)2.26s
応答時間(合計)2.26s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.67s
応答時間(最大)1.67s
応答時間(合計)1.67s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.71s
応答時間(最大)3.29s
応答時間(合計)5.41s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.33s
応答時間(最大)3.33s
応答時間(合計)3.33s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.11s
応答時間(最大)1.11s
応答時間(合計)1.11s
|
| #108#108 |
GLM 5V Turbononeアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
5.9… |
Z.ai |
$0.052
…
|
2.99s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 11 指示に従っていない: 2
応答時間(平均)2.99s
応答時間(最大)6.51s
応答時間(合計)62.74s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 13
- 試行ごとの合格率
- 38.1%
- 入力トークン
- 37,100
- 出力トークン
- 1,766
- 推論トークン
- 0
- 応答時間(平均)
- 2.99s
- 応答時間(合計)
- 62.74s
- 応答時間(最大)
- 6.51s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)3.13s
応答時間(最大)5.90s
応答時間(合計)12.50s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)3.13s
応答時間(最大)5.30s
応答時間(合計)9.40s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.51s
応答時間(最大)6.51s
応答時間(合計)6.51s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.81s
応答時間(最大)5.69s
応答時間(合計)7.62s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)2.09s
応答時間(最大)2.39s
応答時間(合計)6.26s
-
汎用知能
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.22s
応答時間(最大)2.22s
応答時間(合計)2.22s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.97s
応答時間(最大)2.43s
応答時間(合計)3.93s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)2.40s
応答時間(最大)3.81s
応答時間(合計)7.21s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.86s
応答時間(最大)4.86s
応答時間(合計)4.86s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.23s
応答時間(最大)2.23s
応答時間(合計)2.23s
|
| #107#107 |
Qwen3.5-27Bnone
|
5.9… |
Qwen |
$0.015
↓
…
|
1.68s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 12 指示に従っていない: 2
応答時間(平均)1.68s
応答時間(最大)9.39s
応答時間(合計)35.25s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 14
- 試行ごとの合格率
- 38.1%
- 入力トークン
- 44,478
- 出力トークン
- 3,592
- 推論トークン
- 0
- 応答時間(平均)
- 1.68s
- 応答時間(合計)
- 35.25s
- 応答時間(最大)
- 9.39s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)788ms
応答時間(最大)1.34s
応答時間(合計)3.15s
-
コーディング
: 5.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.80s
応答時間(最大)2.51s
応答時間(合計)5.40s
-
複合
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)9.39s
応答時間(最大)9.39s
応答時間(合計)9.39s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.43s
応答時間(最大)1.45s
応答時間(合計)2.86s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)540ms
応答時間(最大)649ms
応答時間(合計)1.62s
-
汎用知能
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.51s
応答時間(最大)2.51s
応答時間(合計)2.51s
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.03s
応答時間(最大)1.40s
応答時間(合計)2.06s
-
パズル解決
: 6.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)1.38s
応答時間(最大)2.24s
応答時間(合計)4.13s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.54s
応答時間(最大)3.54s
応答時間(合計)3.54s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)599ms
応答時間(最大)599ms
応答時間(合計)599ms
|
| #106#106 |
Qwen3.5-35B-A3Bnone
|
5.9… |
Qwen |
$0.012
↓
…
|
3.37s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 12 指示に従っていない: 2
応答時間(平均)3.37s
応答時間(最大)47.43s
応答時間(合計)70.75s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 14
- 試行ごとの合格率
- 42.9%
- 入力トークン
- 48,194
- 出力トークン
- 4,343
- 推論トークン
- 0
- 応答時間(平均)
- 3.37s
- 応答時間(合計)
- 70.75s
- 応答時間(最大)
- 47.43s
-
反AIトリック
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)1.43s
応答時間(最大)4.39s
応答時間(合計)5.71s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.39s
応答時間(最大)2.67s
応答時間(合計)4.18s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)47.43s
応答時間(最大)47.43s
応答時間(合計)47.43s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.16s
応答時間(最大)1.42s
応答時間(合計)2.33s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)485ms
応答時間(最大)549ms
応答時間(合計)1.45s
-
汎用知能
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.19s
応答時間(最大)1.19s
応答時間(合計)1.19s
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)809ms
応答時間(最大)983ms
応答時間(合計)1.62s
-
パズル解決
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)1.35s
応答時間(最大)2.26s
応答時間(合計)4.05s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.30s
応答時間(最大)2.30s
応答時間(合計)2.30s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)493ms
応答時間(最大)493ms
応答時間(合計)493ms
|
| #105#105 |
Qwen3.6 Flashnone
|
6.0… |
Qwen |
$0.015
↓
…
|
1.60s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 12 指示に従っていない: 1 無効なツール呼び出し: 1
応答時間(平均)1.60s
応答時間(最大)4.60s
応答時間(合計)33.59s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 14
- 試行ごとの合格率
- 33.3%
- 入力トークン
- 50,810
- 出力トークン
- 4,164
- 推論トークン
- 0
- 応答時間(平均)
- 1.60s
- 応答時間(合計)
- 33.59s
- 応答時間(最大)
- 4.60s
-
反AIトリック
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)1.63s
応答時間(最大)4.60s
応答時間(合計)6.51s
-
コーディング
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.79s
応答時間(最大)2.46s
応答時間(合計)5.36s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)4.22s
応答時間(最大)4.22s
応答時間(合計)4.22s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.13s
応答時間(最大)3.35s
応答時間(合計)4.26s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.11s
応答時間(最大)1.89s
応答時間(合計)3.32s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)947ms
応答時間(最大)947ms
応答時間(合計)947ms
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.10s
応答時間(最大)1.36s
応答時間(合計)2.19s
-
パズル解決
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)1.21s
応答時間(最大)1.80s
応答時間(合計)3.64s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.49s
応答時間(最大)2.49s
応答時間(合計)2.49s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)649ms
応答時間(最大)649ms
応答時間(合計)649ms
|
| #104#104 |
GLM 5none
|
6.0… |
Z.ai |
$0.027
↑
…
|
4.03s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 12
応答時間(平均)4.03s
応答時間(最大)11.07s
応答時間(合計)56.37s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 12
- 試行ごとの合格率
- 44.4%
- 入力トークン
- 37,135
- 出力トークン
- 1,989
- 推論トークン
- 0
- 応答時間(平均)
- 4.03s
- 応答時間(合計)
- 56.37s
- 応答時間(最大)
- 11.07s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)2.37s
応答時間(最大)3.39s
応答時間(合計)4.75s
-
コーディング
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)5.12s
応答時間(最大)8.84s
応答時間(合計)15.36s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.98s
応答時間(最大)4.98s
応答時間(合計)4.98s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.78s
応答時間(最大)5.78s
応答時間(合計)5.78s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)2.24s
応答時間(最大)2.24s
応答時間(合計)2.24s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.27s
応答時間(最大)3.27s
応答時間(合計)3.27s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.48s
応答時間(最大)1.48s
応答時間(合計)1.48s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.91s
応答時間(最大)2.08s
応答時間(合計)3.82s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.07s
応答時間(最大)11.07s
応答時間(合計)11.07s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.62s
応答時間(最大)3.62s
応答時間(合計)3.62s
|
| #103#103 |
Qwen3.6 Max Previewnone
|
6.0… |
Qwen |
$0.075
↓
…
|
3.30s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 10
応答時間(平均)3.30s
応答時間(最大)20.51s
応答時間(合計)69.40s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 10
- 試行ごとの合格率
- 58.7%
- 入力トークン
- 42,509
- 出力トークン
- 4,779
- 推論トークン
- 0
- 応答時間(平均)
- 3.30s
- 応答時間(合計)
- 69.40s
- 応答時間(最大)
- 20.51s
-
反AIトリック
: 5.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)2.63s
応答時間(最大)5.57s
応答時間(合計)10.53s
-
コーディング
: 3.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)3.12s
応答時間(最大)3.45s
応答時間(合計)9.35s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)20.51s
応答時間(最大)20.51s
応答時間(合計)20.51s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.87s
応答時間(最大)3.54s
応答時間(合計)5.74s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.22s
応答時間(最大)1.25s
応答時間(合計)3.67s
-
汎用知能
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.62s
応答時間(最大)1.62s
応答時間(合計)1.62s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.40s
応答時間(最大)1.46s
応答時間(合計)2.79s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.65s
応答時間(最大)3.59s
応答時間(合計)7.94s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.27s
応答時間(最大)5.27s
応答時間(合計)5.27s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.97s
応答時間(最大)1.97s
応答時間(合計)1.97s
|
| #102#102 |
Nemotron 3 Ultra 550b A55bnone
|
6.1… |
NVIDIA |
$0.027
↕
…
|
2.27s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 12 指示に従っていない: 1
応答時間(平均)2.27s
応答時間(最大)13.49s
応答時間(合計)47.65s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 13
- 試行ごとの合格率
- 44.4%
- 入力トークン
- 43,326
- 出力トークン
- 2,138
- 推論トークン
- 0
- 応答時間(平均)
- 2.27s
- 応答時間(合計)
- 47.65s
- 応答時間(最大)
- 13.49s
-
反AIトリック
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)2.35s
応答時間(最大)6.55s
応答時間(合計)9.42s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.02s
応答時間(最大)1.83s
応答時間(合計)3.07s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.79s
応答時間(最大)4.79s
応答時間(合計)4.79s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.94s
応答時間(最大)2.86s
応答時間(合計)3.89s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)698ms
応答時間(最大)1.00s
応答時間(合計)2.09s
-
汎用知能
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)13.49s
応答時間(最大)13.49s
応答時間(合計)13.49s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.46s
応答時間(最大)1.72s
応答時間(合計)2.92s
-
パズル解決
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)1.06s
応答時間(最大)1.53s
応答時間(合計)3.17s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.99s
応答時間(最大)2.99s
応答時間(合計)2.99s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.83s
応答時間(最大)1.83s
応答時間(合計)1.83s
|
| #101#101 |
Gemma 4 31Bnone
|
6.1… |
Google |
$0.004
↓
…
|
4.05s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 8 API エラー: 2 指示に従っていない: 1
応答時間(平均)4.05s
応答時間(最大)26.13s
応答時間(合計)76.87s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 11
- 試行ごとの合格率
- 47.6%
- 入力トークン
- 20,911
- 出力トークン
- 1,407
- 推論トークン
- 0
- 応答時間(平均)
- 4.05s
- 応答時間(合計)
- 76.87s
- 応答時間(最大)
- 26.13s
-
反AIトリック
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.85s
応答時間(最大)4.45s
応答時間(合計)7.40s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)11.19s
応答時間(最大)26.13s
応答時間(合計)33.58s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.25s
応答時間(最大)3.02s
応答時間(合計)4.51s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.22s
応答時間(最大)4.68s
応答時間(合計)9.67s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.09s
応答時間(最大)2.09s
応答時間(合計)2.09s
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.84s
応答時間(最大)4.45s
応答時間(合計)5.68s
-
パズル解決
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)4.23s
応答時間(最大)7.63s
応答時間(合計)12.69s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.25s
応答時間(最大)1.25s
応答時間(合計)1.25s
|
| #100#100 |
Qwen3.5-Flashnone
|
6.1… |
Qwen |
$0.005
↓
…
|
3.58s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13
応答時間(平均)3.58s
応答時間(最大)27.18s
応答時間(合計)75.28s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 13
- 試行ごとの合格率
- 39.7%
- 入力トークン
- 46,439
- 出力トークン
- 4,276
- 推論トークン
- 0
- 応答時間(平均)
- 3.58s
- 応答時間(合計)
- 75.28s
- 応答時間(最大)
- 27.18s
-
反AIトリック
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)1.32s
応答時間(最大)3.89s
応答時間(合計)5.30s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)850ms
応答時間(最大)1.29s
応答時間(合計)2.55s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.22s
応答時間(最大)6.22s
応答時間(合計)6.22s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.57s
応答時間(最大)1.83s
応答時間(合計)3.14s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)905ms
応答時間(最大)1.10s
応答時間(合計)2.71s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)803ms
応答時間(最大)803ms
応答時間(合計)803ms
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)8.81s
応答時間(最大)13.73s
応答時間(合計)17.61s
-
パズル解決
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)10.89s
応答時間(最大)27.18s
応答時間(合計)32.68s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.67s
応答時間(最大)3.67s
応答時間(合計)3.67s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)588ms
応答時間(最大)588ms
応答時間(合計)588ms
|
| #99#99 |
Gemini 3.1 Flash Litenone
|
6.1… |
Google |
$0.013
…
|
1.06s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 11 指示に従っていない: 1
応答時間(平均)1.06s
応答時間(最大)2.97s
応答時間(合計)22.35s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 12
- 試行ごとの合格率
- 52.4%
- 入力トークン
- 36,710
- 出力トークン
- 2,484
- 推論トークン
- 0
- 応答時間(平均)
- 1.06s
- 応答時間(合計)
- 22.35s
- 応答時間(最大)
- 2.97s
-
反AIトリック
: 7.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.07s
応答時間(最大)1.91s
応答時間(合計)4.27s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)938ms
応答時間(最大)1.59s
応答時間(合計)2.81s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.73s
応答時間(最大)2.73s
応答時間(合計)2.73s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)843ms
応答時間(最大)907ms
応答時間(合計)1.69s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)762ms
応答時間(最大)814ms
応答時間(合計)2.29s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)992ms
応答時間(最大)992ms
応答時間(合計)992ms
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)859ms
応答時間(最大)975ms
応答時間(合計)1.72s
-
パズル解決
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)720ms
応答時間(最大)826ms
応答時間(合計)2.16s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.97s
応答時間(最大)2.97s
応答時間(合計)2.97s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)733ms
応答時間(最大)733ms
応答時間(合計)733ms
|
| #98#98 |
Gemini 3.1 Flash Lite Previewhighアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
6.1… |
Google |
$2.310
…
|
68.14s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)68.14s
応答時間(最大)280.52s
応答時間(合計)1090.28s
…
|
- 合計テスト数
- 16
- 誤答テスト数
- 3
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 61.9%
- 入力トークン
- 28,980
- 出力トークン
- 1,283
- 推論トークン
- 1,533,310
- 応答時間(平均)
- 68.14s
- 応答時間(合計)
- 1090.28s
- 応答時間(最大)
- 280.52s
-
反AIトリック
: 7.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)43.87s
応答時間(最大)121.88s
応答時間(合計)131.62s
-
コーディング
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)280.52s
応答時間(最大)280.52s
応答時間(合計)280.52s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.16s
応答時間(最大)8.54s
応答時間(合計)14.31s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)127.58s
応答時間(最大)133.93s
応答時間(合計)382.74s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.25s
応答時間(最大)5.25s
応答時間(合計)5.25s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)64.03s
応答時間(最大)124.45s
応答時間(合計)128.06s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)46.68s
応答時間(最大)134.22s
応答時間(合計)140.04s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.73s
応答時間(最大)7.73s
応答時間(合計)7.73s
-
雑学
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #97#97 |
Gemini 3.1 Flash Liteminimal
|
6.1… |
Google |
$0.013
…
|
1.33s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 8 指示に従っていない: 3
応答時間(平均)1.33s
応答時間(最大)4.49s
応答時間(合計)27.91s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 11
- 試行ごとの合格率
- 54.0%
- 入力トークン
- 36,973
- 出力トークン
- 2,487
- 推論トークン
- 0
- 応答時間(平均)
- 1.33s
- 応答時間(合計)
- 27.91s
- 応答時間(最大)
- 4.49s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.10s
応答時間(最大)1.65s
応答時間(合計)4.42s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)831ms
応答時間(最大)1.31s
応答時間(合計)2.49s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.53s
応答時間(最大)2.53s
応答時間(合計)2.53s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.04s
応答時間(最大)1.32s
応答時間(合計)2.07s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.02s
応答時間(最大)1.16s
応答時間(合計)3.06s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)791ms
応答時間(最大)791ms
応答時間(合計)791ms
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)932ms
応答時間(最大)1.00s
応答時間(合計)1.86s
-
パズル解決
: 6.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2
応答時間(平均)2.15s
応答時間(最大)4.49s
応答時間(合計)6.45s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.51s
応答時間(最大)3.51s
応答時間(合計)3.51s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)724ms
応答時間(最大)724ms
応答時間(合計)724ms
|
| #96#96 |
Gemini 2.5 Flashnone
|
6.2… |
Google |
$0.016
…
|
875ms… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 12
応答時間(平均)875ms
応答時間(最大)4.39s
応答時間(合計)18.37s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 12
- 試行ごとの合格率
- 46.0%
- 入力トークン
- 35,926
- 出力トークン
- 1,770
- 推論トークン
- 0
- 応答時間(平均)
- 875ms
- 応答時間(合計)
- 18.37s
- 応答時間(最大)
- 4.39s
-
反AIトリック
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)582ms
応答時間(最大)844ms
応答時間(合計)2.33s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)736ms
応答時間(最大)1.16s
応答時間(合計)2.21s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.39s
応答時間(最大)4.39s
応答時間(合計)4.39s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)652ms
応答時間(最大)660ms
応答時間(合計)1.30s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)495ms
応答時間(最大)642ms
応答時間(合計)1.49s
-
汎用知能
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)615ms
応答時間(最大)615ms
応答時間(合計)615ms
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)590ms
応答時間(最大)622ms
応答時間(合計)1.18s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)604ms
応答時間(最大)700ms
応答時間(合計)1.81s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.91s
応答時間(最大)1.91s
応答時間(合計)1.91s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.15s
応答時間(最大)1.15s
応答時間(合計)1.15s
|
| #95#95 |
Seed-2.0-Litenone
|
6.2… |
Bytedance Seed |
$0.019
…
|
2.49s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13
応答時間(平均)2.49s
応答時間(最大)6.70s
応答時間(合計)52.26s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 13
- 試行ごとの合格率
- 46.0%
- 入力トークン
- 46,573
- 出力トークン
- 3,259
- 推論トークン
- 0
- 応答時間(平均)
- 2.49s
- 応答時間(合計)
- 52.26s
- 応答時間(最大)
- 6.70s
-
反AIトリック
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)2.43s
応答時間(最大)6.70s
応答時間(合計)9.73s
-
コーディング
: 5.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)2.83s
応答時間(最大)4.61s
応答時間(合計)8.49s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.59s
応答時間(最大)6.59s
応答時間(合計)6.59s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.82s
応答時間(最大)1.97s
応答時間(合計)3.63s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.33s
応答時間(最大)1.53s
応答時間(合計)4.00s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.45s
応答時間(最大)3.45s
応答時間(合計)3.45s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.06s
応答時間(最大)1.09s
応答時間(合計)2.12s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)2.78s
応答時間(最大)5.20s
応答時間(合計)8.34s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.94s
応答時間(最大)3.94s
応答時間(合計)3.94s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.96s
応答時間(最大)1.96s
応答時間(合計)1.96s
|
| #94#94 |
Gemini 3 PRO Previewmediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
6.2… |
Google |
$0.385
↑
…
|
9.05s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 4 不正解: 3
応答時間(平均)9.05s
応答時間(最大)26.24s
応答時間(合計)90.53s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 66.7%
- 入力トークン
- 28,848
- 出力トークン
- 1,490
- 推論トークン
- 10,102
- 応答時間(平均)
- 9.05s
- 応答時間(合計)
- 90.53s
- 応答時間(最大)
- 26.24s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.99s
応答時間(最大)26.24s
応答時間(合計)29.99s
-
コーディング
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 3
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.37s
応答時間(最大)10.37s
応答時間(合計)10.37s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)10.84s
応答時間(最大)10.84s
応答時間(合計)10.84s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)7.01s
応答時間(最大)7.01s
応答時間(合計)7.01s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.34s
応答時間(最大)9.34s
応答時間(合計)9.34s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.26s
応答時間(最大)3.26s
応答時間(合計)3.26s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.88s
応答時間(最大)4.23s
応答時間(合計)7.77s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.96s
応答時間(最大)11.96s
応答時間(合計)11.96s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #93#93 |
GPT-5.5none
|
6.3… |
OpenAI |
$0.231
…
|
1.89s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 11
応答時間(平均)1.89s
応答時間(最大)5.56s
応答時間(合計)39.64s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 11
- 試行ごとの合格率
- 54.0%
- 入力トークン
- 34,212
- 出力トークン
- 1,971
- 推論トークン
- 0
- 応答時間(平均)
- 1.89s
- 応答時間(合計)
- 39.64s
- 応答時間(最大)
- 5.56s
-
反AIトリック
: 6.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.31s
応答時間(最大)2.08s
応答時間(合計)5.25s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.35s
応答時間(最大)2.05s
応答時間(合計)4.05s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)5.56s
応答時間(最大)5.56s
応答時間(合計)5.56s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.18s
応答時間(最大)1.24s
応答時間(合計)2.37s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.31s
応答時間(最大)1.39s
応答時間(合計)3.92s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.41s
応答時間(最大)3.41s
応答時間(合計)3.41s
-
指示追従
: 6.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.15s
応答時間(最大)1.19s
応答時間(合計)2.31s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.29s
応答時間(最大)1.56s
応答時間(合計)3.87s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.90s
応答時間(最大)3.90s
応答時間(合計)3.90s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)5.01s
応答時間(最大)5.01s
応答時間(合計)5.01s
|
| #92#92 |
Qwen3.5-35B-A3Bmedium
|
6.3… |
Qwen |
$0.401
↓
…
|
72.57s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 5 回答なし: 2 不正解: 2 API エラー: 1
応答時間(平均)72.57s
応答時間(最大)409.98s
応答時間(合計)1524.04s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 10
- 試行ごとの合格率
- 69.8%
- 入力トークン
- 42,196
- 出力トークン
- 40,630
- 推論トークン
- 353,577
- 応答時間(平均)
- 72.57s
- 応答時間(合計)
- 1524.04s
- 応答時間(最大)
- 409.98s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)21.13s
応答時間(最大)34.96s
応答時間(合計)84.53s
-
コーディング
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1 タイムアウト: 1
応答時間(平均)206.65s
応答時間(最大)409.98s
応答時間(合計)619.94s
-
複合
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)75.34s
応答時間(最大)75.34s
応答時間(合計)75.34s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)59.33s
応答時間(最大)97.12s
応答時間(合計)118.65s
-
ドメイン特化
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2 不正解: 1
応答時間(平均)88.34s
応答時間(最大)106.00s
応答時間(合計)265.01s
-
汎用知能
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)30.30s
応答時間(最大)30.30s
応答時間(合計)30.30s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)24.45s
応答時間(最大)43.36s
応答時間(合計)48.89s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)33.13s
応答時間(最大)64.81s
応答時間(合計)99.38s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.65s
応答時間(最大)4.65s
応答時間(合計)4.65s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)177.35s
応答時間(最大)177.35s
応答時間(合計)177.35s
|
| #91#91 |
Gemma 4 31Bmedium
|
6.3… |
Google |
$0.033
↓
…
|
56.55s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 2 タイムアウト: 2 不正解: 2 回答なし: 1
応答時間(平均)56.55s
応答時間(最大)437.40s
応答時間(合計)1074.41s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 69.8%
- 入力トークン
- 17,957
- 出力トークン
- 22,356
- 推論トークン
- 65,726
- 応答時間(平均)
- 56.55s
- 応答時間(合計)
- 1074.41s
- 応答時間(最大)
- 437.40s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.89s
応答時間(最大)26.66s
応答時間(合計)51.55s
-
コーディング
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2 回答なし: 1
応答時間(平均)219.76s
応答時間(最大)437.40s
応答時間(合計)659.27s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)21.11s
応答時間(最大)21.94s
応答時間(合計)42.21s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)38.48s
応答時間(最大)68.92s
応答時間(合計)115.43s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.57s
応答時間(最大)9.57s
応答時間(合計)9.57s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.76s
応答時間(最大)17.53s
応答時間(合計)25.52s
-
パズル解決
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)26.91s
応答時間(最大)61.08s
応答時間(合計)80.72s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)90.14s
応答時間(最大)90.14s
応答時間(合計)90.14s
|
| #90#90 |
Nemotron 3 Supermedium
|
6.3… |
NVIDIA |
$0.019
↑
…
|
32.00s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 API エラー: 3 指示に従っていない: 3 回答なし: 1 タイムアウト: 1
応答時間(平均)32.00s
応答時間(最大)232.25s
応答時間(合計)607.91s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 13
- 試行ごとの合格率
- 41.3%
- 入力トークン
- 37,527
- 出力トークン
- 14,850
- 推論トークン
- 33,754
- 応答時間(平均)
- 32.00s
- 応答時間(合計)
- 607.91s
- 応答時間(最大)
- 232.25s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)7.85s
応答時間(最大)22.30s
応答時間(合計)31.40s
-
コーディング
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 3
応答時間(平均)147.32s
応答時間(最大)232.25s
応答時間(合計)294.64s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)87.80s
応答時間(最大)87.80s
応答時間(合計)87.80s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)18.16s
応答時間(最大)20.65s
応答時間(合計)36.33s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 タイムアウト: 1
応答時間(平均)16.19s
応答時間(最大)21.56s
応答時間(合計)32.39s
-
汎用知能
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)6.91s
応答時間(最大)6.91s
応答時間(合計)6.91s
-
指示追従
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)6.97s
応答時間(最大)11.23s
応答時間(合計)13.95s
-
パズル解決
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)3.15s
応答時間(最大)4.52s
応答時間(合計)9.45s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)39.75s
応答時間(最大)39.75s
応答時間(合計)39.75s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)55.32s
応答時間(最大)55.32s
応答時間(合計)55.32s
|
| #89#89 |
Hy3 previewlowアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
6.4… |
Tencent |
$0.015
↕
…
|
24.56s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 7 不正解: 4
応答時間(平均)24.56s
応答時間(最大)78.74s
応答時間(合計)368.35s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 11
- 試行ごとの合格率
- 52.4%
- 入力トークン
- 21,045
- 出力トークン
- 63,460
- 推論トークン
- 0
- 応答時間(平均)
- 24.56s
- 応答時間(合計)
- 368.35s
- 応答時間(最大)
- 78.74s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)9.32s
応答時間(最大)12.36s
応答時間(合計)27.96s
-
コーディング
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 2
応答時間(平均)27.94s
応答時間(最大)27.94s
応答時間(合計)27.94s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)78.74s
応答時間(最大)78.74s
応答時間(合計)78.74s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)5.85s
応答時間(最大)5.85s
応答時間(合計)5.85s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)40.44s
応答時間(最大)46.32s
応答時間(合計)121.31s
-
汎用知能
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.98s
応答時間(最大)22.24s
応答時間(合計)31.97s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)7.51s
応答時間(最大)7.86s
応答時間(合計)15.02s
-
ツール呼び出し
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)17.84s
応答時間(最大)17.84s
応答時間(合計)17.84s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)41.74s
応答時間(最大)41.74s
応答時間(合計)41.74s
|
| #88#88 |
Gemini 3.1 Flash Litelow
|
6.4… |
Google |
$0.028
…
|
1.89s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9
応答時間(平均)1.89s
応答時間(最大)5.66s
応答時間(合計)39.62s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 61.9%
- 入力トークン
- 36,892
- 出力トークン
- 2,732
- 推論トークン
- 9,260
- 応答時間(平均)
- 1.89s
- 応答時間(合計)
- 39.62s
- 応答時間(最大)
- 5.66s
-
反AIトリック
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.84s
応答時間(最大)3.08s
応答時間(合計)7.37s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.53s
応答時間(最大)1.97s
応答時間(合計)4.58s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.48s
応答時間(最大)4.48s
応答時間(合計)4.48s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.44s
応答時間(最大)1.51s
応答時間(合計)2.89s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.52s
応答時間(最大)1.63s
応答時間(合計)4.57s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.37s
応答時間(最大)1.37s
応答時間(合計)1.37s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.52s
応答時間(最大)1.68s
応答時間(合計)3.04s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.40s
応答時間(最大)1.41s
応答時間(合計)4.20s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.66s
応答時間(最大)5.66s
応答時間(合計)5.66s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.46s
応答時間(最大)1.46s
応答時間(合計)1.46s
|
| #87#87 |
Gemini 3.1 Flash Lite Previewnone
|
6.4… |
Google |
$0.018
…
|
1.21s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 7 指示に従っていない: 2
応答時間(平均)1.21s
応答時間(最大)3.39s
応答時間(合計)25.45s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 60.3%
- 入力トークン
- 37,582
- 出力トークン
- 5,547
- 推論トークン
- 0
- 応答時間(平均)
- 1.21s
- 応答時間(合計)
- 25.45s
- 応答時間(最大)
- 3.39s
-
反AIトリック
: 7.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)1.04s
応答時間(最大)1.47s
応答時間(合計)4.17s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)967ms
応答時間(最大)1.47s
応答時間(合計)2.90s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.20s
応答時間(最大)3.20s
応答時間(合計)3.20s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.22s
応答時間(最大)1.33s
応答時間(合計)2.44s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)942ms
応答時間(最大)1.12s
応答時間(合計)2.83s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)741ms
応答時間(最大)741ms
応答時間(合計)741ms
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.13s
応答時間(最大)1.14s
応答時間(合計)2.27s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)900ms
応答時間(最大)962ms
応答時間(合計)2.70s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.39s
応答時間(最大)3.39s
応答時間(合計)3.39s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)814ms
応答時間(最大)814ms
応答時間(合計)814ms
|
| #86#86 |
Gemini 3.1 Flash Litehighアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
6.5… |
Google |
$2.044
…
|
61.96s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 3 回答なし: 1
応答時間(平均)61.96s
応答時間(最大)149.23s
応答時間(合計)1115.31s
…
|
- 合計テスト数
- 18
- 誤答テスト数
- 8
- 試行ごとの合格率
- 58.7%
- 入力トークン
- 29,134
- 出力トークン
- 1,984
- 推論トークン
- 1,355,583
- 応答時間(平均)
- 61.96s
- 応答時間(合計)
- 1115.31s
- 応答時間(最大)
- 149.23s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)37.16s
応答時間(最大)140.53s
応答時間(合計)148.65s
-
コーディング
: 3.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)137.63s
応答時間(最大)137.63s
応答時間(合計)137.63s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)149.23s
応答時間(最大)149.23s
応答時間(合計)149.23s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.49s
応答時間(最大)4.96s
応答時間(合計)8.98s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)139.90s
応答時間(最大)141.40s
応答時間(合計)419.69s
-
汎用知能
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)45.69s
応答時間(最大)45.69s
応答時間(合計)45.69s
-
指示追従
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)23.26s
応答時間(最大)43.87s
応答時間(合計)46.51s
-
パズル解決
: 5.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2
応答時間(平均)50.83s
応答時間(最大)144.85s
応答時間(合計)152.49s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.44s
応答時間(最大)6.44s
応答時間(合計)6.44s
-
雑学
: 0.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #85#85 |
Gemini 3.1 Flash Lite Previewlow
|
6.5… |
Google |
$0.026
…
|
2.77s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 7 指示に従っていない: 1
応答時間(平均)2.77s
応答時間(最大)11.91s
応答時間(合計)58.12s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 61.9%
- 入力トークン
- 32,715
- 出力トークン
- 2,286
- 推論トークン
- 9,166
- 応答時間(平均)
- 2.77s
- 応答時間(合計)
- 58.12s
- 応答時間(最大)
- 11.91s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.12s
応答時間(最大)3.18s
応答時間(合計)8.50s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.39s
応答時間(最大)2.20s
応答時間(合計)4.16s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)11.91s
応答時間(最大)11.91s
応答時間(合計)11.91s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.00s
応答時間(最大)3.74s
応答時間(合計)5.99s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)2.36s
応答時間(最大)3.51s
応答時間(合計)7.07s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.54s
応答時間(最大)1.54s
応答時間(合計)1.54s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.49s
応答時間(最大)1.66s
応答時間(合計)2.99s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.69s
応答時間(最大)1.89s
応答時間(合計)5.08s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.54s
応答時間(最大)9.54s
応答時間(合計)9.54s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.35s
応答時間(最大)1.35s
応答時間(合計)1.35s
|