| #13#13 |
Grok 4.20 Betamediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
8.5… |
X AI |
$0.750
↑
…
|
9.75s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 1
応答時間(平均)9.75s
応答時間(最大)31.36s
応答時間(合計)175.48s
…
|
- 合計テスト数
- 18
- 誤答テスト数
- 4
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 81.5%
- 入力トークン
- 35,955
- 出力トークン
- 1,647
- 推論トークン
- 91,565
- 応答時間(平均)
- 9.75s
- 応答時間(合計)
- 175.48s
- 応答時間(最大)
- 31.36s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.16s
応答時間(最大)3.44s
応答時間(合計)12.65s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)31.36s
応答時間(最大)31.36s
応答時間(合計)31.36s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)20.93s
応答時間(最大)20.93s
応答時間(合計)20.93s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.01s
応答時間(最大)4.27s
応答時間(合計)8.02s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)21.33s
応答時間(最大)24.21s
応答時間(合計)64.00s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.78s
応答時間(最大)5.78s
応答時間(合計)5.78s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.89s
応答時間(最大)5.89s
応答時間(合計)9.78s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.52s
応答時間(最大)4.53s
応答時間(合計)10.57s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)12.39s
応答時間(最大)12.39s
応答時間(合計)12.39s
|
| #9#9 |
GPT-5.5medium
|
8.8… |
OpenAI |
$3.679
…
|
37.98s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)37.98s
応答時間(最大)332.10s
応答時間(合計)797.60s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 4
- 試行ごとの合格率
- 87.3%
- 入力トークン
- 34,212
- 出力トークン
- 1,985
- 推論トークン
- 114,925
- 応答時間(平均)
- 37.98s
- 応答時間(合計)
- 797.60s
- 応答時間(最大)
- 332.10s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.66s
応答時間(最大)6.74s
応答時間(合計)18.65s
-
コーディング
: 8.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)59.77s
応答時間(最大)130.26s
応答時間(合計)179.30s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)19.29s
応答時間(最大)19.29s
応答時間(合計)19.29s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.18s
応答時間(最大)4.35s
応答時間(合計)8.36s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)164.14s
応答時間(最大)332.10s
応答時間(合計)492.41s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.16s
応答時間(最大)4.16s
応答時間(合計)4.16s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.36s
応答時間(最大)3.46s
応答時間(合計)6.73s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.76s
応答時間(最大)10.54s
応答時間(合計)20.28s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)10.57s
応答時間(最大)10.57s
応答時間(合計)10.57s
-
雑学
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)37.86s
応答時間(最大)37.86s
応答時間(合計)37.86s
|
| #10#10 |
Claude Opus 4.8medium
|
8.7… |
Anthropic |
$1.107
…
|
9.66s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 回答なし: 1
応答時間(平均)9.66s
応答時間(最大)38.03s
応答時間(合計)202.89s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 4
- 試行ごとの合格率
- 84.1%
- 入力トークン
- 61,007
- 出力トークン
- 26,495
- 推論トークン
- 5,901
- 応答時間(平均)
- 9.66s
- 応答時間(合計)
- 202.89s
- 応答時間(最大)
- 38.03s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.95s
応答時間(最大)5.76s
応答時間(合計)15.79s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.33s
応答時間(最大)22.27s
応答時間(合計)45.98s
-
複合
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)38.03s
応答時間(最大)38.03s
応答時間(合計)38.03s
-
データ解析と抽出
: 7.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)12.29s
応答時間(最大)19.64s
応答時間(合計)24.59s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)14.15s
応答時間(最大)28.41s
応答時間(合計)42.46s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.46s
応答時間(最大)2.46s
応答時間(合計)2.46s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.32s
応答時間(最大)5.07s
応答時間(合計)6.63s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.95s
応答時間(最大)4.33s
応答時間(合計)11.85s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.96s
応答時間(最大)8.96s
応答時間(合計)8.96s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)6.14s
応答時間(最大)6.14s
応答時間(合計)6.14s
|
| #11#11 |
Claude Opus 4.7medium
|
8.7… |
Anthropic |
$0.679
…
|
4.73s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 タイムアウト: 1
応答時間(平均)4.73s
応答時間(最大)23.18s
応答時間(合計)94.51s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 4
- 試行ごとの合格率
- 82.5%
- 入力トークン
- 65,406
- 出力トークン
- 11,858
- 推論トークン
- 2,198
- 応答時間(平均)
- 4.73s
- 応答時間(合計)
- 94.51s
- 応答時間(最大)
- 23.18s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.85s
応答時間(最大)2.71s
応答時間(合計)7.38s
-
コーディング
: 7.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)12.96s
応答時間(最大)23.18s
応答時間(合計)38.89s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)21.45s
応答時間(最大)21.45s
応答時間(合計)21.45s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.37s
応答時間(最大)3.30s
応答時間(合計)4.74s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)1.17s
応答時間(最大)1.40s
応答時間(合計)2.35s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.87s
応答時間(最大)2.87s
応答時間(合計)2.87s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.57s
応答時間(最大)1.66s
応答時間(合計)3.14s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.43s
応答時間(最大)2.89s
応答時間(合計)7.28s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.17s
応答時間(最大)4.17s
応答時間(合計)4.17s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.25s
応答時間(最大)2.25s
応答時間(合計)2.25s
|
| #12#12 |
Gemini 3.1 Flash Lite Previewhighアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
8.6… |
Google |
$2.310
…
|
68.14s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)68.14s
応答時間(最大)280.52s
応答時間(合計)1090.28s
…
|
- 合計テスト数
- 16
- 誤答テスト数
- 3
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 81.3%
- 入力トークン
- 28,980
- 出力トークン
- 1,283
- 推論トークン
- 1,533,310
- 応答時間(平均)
- 68.14s
- 応答時間(合計)
- 1090.28s
- 応答時間(最大)
- 280.52s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)43.87s
応答時間(最大)121.88s
応答時間(合計)131.62s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)280.52s
応答時間(最大)280.52s
応答時間(合計)280.52s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.16s
応答時間(最大)8.54s
応答時間(合計)14.31s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)127.58s
応答時間(最大)133.93s
応答時間(合計)382.74s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.25s
応答時間(最大)5.25s
応答時間(合計)5.25s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)64.03s
応答時間(最大)124.45s
応答時間(合計)128.06s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)46.68s
応答時間(最大)134.22s
応答時間(合計)140.04s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.73s
応答時間(最大)7.73s
応答時間(合計)7.73s
|
| #8#8 |
Claude Opus 4.7noneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
8.9… |
Anthropic |
$0.505
…
|
3.02s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)3.02s
応答時間(最大)18.27s
応答時間(合計)57.44s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 3
- 試行ごとの合格率
- 84.2%
- 入力トークン
- 69,576
- 出力トークン
- 6,265
- 推論トークン
- 0
- 応答時間(平均)
- 3.02s
- 応答時間(合計)
- 57.44s
- 応答時間(最大)
- 18.27s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.12s
応答時間(最大)3.75s
応答時間(合計)8.50s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.84s
応答時間(最大)2.84s
応答時間(合計)2.84s
-
複合
: 9.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)18.27s
応答時間(最大)18.27s
応答時間(合計)18.27s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.15s
応答時間(最大)2.33s
応答時間(合計)4.29s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.19s
応答時間(最大)1.40s
応答時間(合計)3.58s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.47s
応答時間(最大)3.47s
応答時間(合計)3.47s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.46s
応答時間(最大)1.68s
応答時間(合計)2.91s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.46s
応答時間(最大)3.72s
応答時間(合計)7.38s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.74s
応答時間(最大)4.74s
応答時間(合計)4.74s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.46s
応答時間(最大)1.46s
応答時間(合計)1.46s
|
| #5#5 |
Qwen3.7 Maxmedium
|
9.1… |
Qwen |
$0.523
↓
…
|
16.02s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)16.02s
応答時間(最大)59.98s
応答時間(合計)336.51s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 3
- 試行ごとの合格率
- 88.9%
- 入力トークン
- 42,360
- 出力トークン
- 2,129
- 推論トークン
- 122,959
- 応答時間(平均)
- 16.02s
- 応答時間(合計)
- 336.51s
- 応答時間(最大)
- 59.98s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.36s
応答時間(最大)8.75s
応答時間(合計)25.44s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)35.31s
応答時間(最大)59.98s
応答時間(合計)105.93s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)19.60s
応答時間(最大)19.60s
応答時間(合計)19.60s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.80s
応答時間(最大)10.25s
応答時間(合計)17.60s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)24.94s
応答時間(最大)29.00s
応答時間(合計)74.81s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.70s
応答時間(最大)11.70s
応答時間(合計)11.70s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.46s
応答時間(最大)10.17s
応答時間(合計)14.92s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.84s
応答時間(最大)11.71s
応答時間(合計)26.51s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.63s
応答時間(最大)6.63s
応答時間(合計)6.63s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)33.37s
応答時間(最大)33.37s
応答時間(合計)33.37s
|
| #6#6 |
GPT-5.5low
|
9.0… |
OpenAI |
$0.907
…
|
9.76s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)9.76s
応答時間(最大)56.19s
応答時間(合計)204.92s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 3
- 試行ごとの合格率
- 85.7%
- 入力トークン
- 34,209
- 出力トークン
- 2,046
- 推論トークン
- 22,460
- 応答時間(平均)
- 9.76s
- 応答時間(合計)
- 204.92s
- 応答時間(最大)
- 56.19s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.41s
応答時間(最大)6.32s
応答時間(合計)17.64s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.04s
応答時間(最大)21.06s
応答時間(合計)45.11s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.56s
応答時間(最大)9.56s
応答時間(合計)9.56s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.28s
応答時間(最大)5.13s
応答時間(合計)6.56s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)28.05s
応答時間(最大)56.19s
応答時間(合計)84.16s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.17s
応答時間(最大)5.17s
応答時間(合計)5.17s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.74s
応答時間(最大)3.99s
応答時間(合計)7.48s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.74s
応答時間(最大)5.61s
応答時間(合計)14.21s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.96s
応答時間(最大)4.96s
応答時間(合計)4.96s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.06s
応答時間(最大)10.06s
応答時間(合計)10.06s
|
| #7#7 |
Gemini 3.5 Flashmedium
|
9.0… |
Google |
$0.582
…
|
4.94s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)4.94s
応答時間(最大)18.07s
応答時間(合計)103.79s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 3
- 試行ごとの合格率
- 87.3%
- 入力トークン
- 36,936
- 出力トークン
- 2,001
- 推論トークン
- 56,408
- 応答時間(平均)
- 4.94s
- 応答時間(合計)
- 103.79s
- 応答時間(最大)
- 18.07s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.09s
応答時間(最大)2.56s
応答時間(合計)8.35s
-
コーディング
: 7.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)12.63s
応答時間(最大)18.07s
応答時間(合計)37.89s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.05s
応答時間(最大)12.05s
応答時間(合計)12.05s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.07s
応答時間(最大)5.60s
応答時間(合計)8.14s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)5.24s
応答時間(最大)6.43s
応答時間(合計)15.73s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.52s
応答時間(最大)2.52s
応答時間(合計)2.52s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.70s
応答時間(最大)3.07s
応答時間(合計)5.40s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.38s
応答時間(最大)2.55s
応答時間(合計)7.15s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.81s
応答時間(最大)3.81s
応答時間(合計)3.81s
-
雑学
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.75s
応答時間(最大)2.75s
応答時間(合計)2.75s
|
| #3🥉 #3 |
Gemini 3.5 Flashlow
|
9.4… |
Google |
$0.349
…
|
3.27s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)3.27s
応答時間(最大)9.05s
応答時間(合計)68.65s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 2
- 試行ごとの合格率
- 90.5%
- 入力トークン
- 36,938
- 出力トークン
- 2,033
- 推論トークン
- 30,519
- 応答時間(平均)
- 3.27s
- 応答時間(合計)
- 68.65s
- 応答時間(最大)
- 9.05s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.52s
応答時間(最大)5.40s
応答時間(合計)10.08s
-
コーディング
: 7.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.71s
応答時間(最大)9.05s
応答時間(合計)20.13s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.44s
応答時間(最大)6.44s
応答時間(合計)6.44s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.81s
応答時間(最大)2.32s
応答時間(合計)3.63s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.39s
応答時間(最大)4.44s
応答時間(合計)10.16s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.27s
応答時間(最大)2.27s
応答時間(合計)2.27s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.86s
応答時間(最大)2.10s
応答時間(合計)3.73s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.35s
応答時間(最大)3.25s
応答時間(合計)7.06s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.27s
応答時間(最大)3.27s
応答時間(合計)3.27s
-
雑学
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.88s
応答時間(最大)1.88s
応答時間(合計)1.88s
|
| #4#4 |
Gemini 3.1 Pro Previewmedium
|
9.4… |
Google |
$1.054
…
|
20.14s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)20.14s
応答時間(最大)88.68s
応答時間(合計)281.92s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 2
- 試行ごとの合格率
- 90.5%
- 入力トークン
- 41,617
- 出力トークン
- 1,977
- 推論トークン
- 78,896
- 応答時間(平均)
- 20.14s
- 応答時間(合計)
- 281.92s
- 応答時間(最大)
- 88.68s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.90s
応答時間(最大)9.52s
応答時間(合計)15.80s
-
コーディング
: 7.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)40.17s
応答時間(最大)88.68s
応答時間(合計)120.52s
-
複合
: 9.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)40.61s
応答時間(最大)40.61s
応答時間(合計)40.61s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.72s
応答時間(最大)7.72s
応答時間(合計)7.72s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)32.73s
応答時間(最大)32.73s
応答時間(合計)32.73s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.77s
応答時間(最大)11.77s
応答時間(合計)11.77s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.56s
応答時間(最大)9.56s
応答時間(合計)9.56s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.90s
応答時間(最大)8.49s
応答時間(合計)13.79s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.15s
応答時間(最大)23.15s
応答時間(合計)23.15s
-
雑学
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.27s
応答時間(最大)6.27s
応答時間(合計)6.27s
|
| #1🥇 #1 |
Gemini 3 Flash Previewmedium
|
9.8… |
Google |
$0.667
…
|
18.64s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)18.64s
応答時間(最大)117.26s
応答時間(合計)391.35s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 1
- 試行ごとの合格率
- 98.4%
- 入力トークン
- 37,017
- 出力トークン
- 2,006
- 推論トークン
- 214,153
- 応答時間(平均)
- 18.64s
- 応答時間(合計)
- 391.35s
- 応答時間(最大)
- 117.26s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.88s
応答時間(最大)5.73s
応答時間(合計)15.53s
-
コーディング
: 8.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)84.40s
応答時間(最大)117.26s
応答時間(合計)253.21s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)22.42s
応答時間(最大)22.42s
応答時間(合計)22.42s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.43s
応答時間(最大)6.18s
応答時間(合計)10.86s
-
ドメイン特化
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.27s
応答時間(最大)34.09s
応答時間(合計)45.80s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.19s
応答時間(最大)5.19s
応答時間(合計)5.19s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.04s
応答時間(最大)4.70s
応答時間(合計)8.08s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.05s
応答時間(最大)5.64s
応答時間(合計)12.15s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.60s
応答時間(最大)12.60s
応答時間(合計)12.60s
-
雑学
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.50s
応答時間(最大)5.50s
応答時間(合計)5.50s
|
| #2🥈 #2 |
Gemini 3.5 Flashhigh
|
9.6… |
Google |
$1.115
…
|
8.84s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)8.84s
応答時間(最大)34.82s
応答時間(合計)185.57s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 1
- 試行ごとの合格率
- 96.8%
- 入力トークン
- 37,594
- 出力トークン
- 1,975
- 推論トークン
- 115,638
- 応答時間(平均)
- 8.84s
- 応答時間(合計)
- 185.57s
- 応答時間(最大)
- 34.82s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.57s
応答時間(最大)3.60s
応答時間(合計)10.27s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)22.96s
応答時間(最大)34.82s
応答時間(合計)68.88s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)22.37s
応答時間(最大)22.37s
応答時間(合計)22.37s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.43s
応答時間(最大)8.51s
応答時間(合計)12.87s
-
ドメイン特化
: 7.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)14.09s
応答時間(最大)22.00s
応答時間(合計)42.27s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.63s
応答時間(最大)3.63s
応答時間(合計)3.63s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.35s
応答時間(最大)3.42s
応答時間(合計)6.69s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.23s
応答時間(最大)3.68s
応答時間(合計)9.69s
-
ツール呼び出し
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.96s
応答時間(最大)4.96s
応答時間(合計)4.96s
-
雑学
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.94s
応答時間(最大)3.94s
応答時間(合計)3.94s
|