| #84#84 |
Grok 4.20 Multi Agent Betamediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
6.6… |
X AI |
$5.599
↑
…
|
9.69s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 API エラー: 2 余分な書式: 2 指示に従っていない: 2
応答時間(平均)9.69s
応答時間(最大)35.28s
応答時間(合計)155.07s
…
|
- 合計テスト数
- 18
- 誤答テスト数
- 10
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 59.3%
- 入力トークン
- 721,952
- 出力トークン
- 294,668
- 推論トークン
- 305,374
- 応答時間(平均)
- 9.69s
- 応答時間(合計)
- 155.07s
- 応答時間(最大)
- 35.28s
-
反AIトリック
: 6.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)3.46s
応答時間(最大)4.38s
応答時間(合計)13.86s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)27.11s
応答時間(最大)27.11s
応答時間(合計)27.11s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.54s
応答時間(最大)7.51s
応答時間(合計)11.08s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 余分な書式: 1
応答時間(平均)24.67s
応答時間(最大)35.28s
応答時間(合計)74.02s
-
汎用知能
: 5.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)6.40s
応答時間(最大)6.40s
応答時間(合計)6.40s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.52s
応答時間(最大)3.80s
応答時間(合計)7.04s
-
パズル解決
: 6.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)5.19s
応答時間(最大)5.49s
応答時間(合計)15.57s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #9#9 |
GPT-5.5medium
|
8.8… |
OpenAI |
$3.679
…
|
37.98s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)37.98s
応答時間(最大)332.10s
応答時間(合計)797.60s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 4
- 試行ごとの合格率
- 87.3%
- 入力トークン
- 34,212
- 出力トークン
- 1,985
- 推論トークン
- 114,925
- 応答時間(平均)
- 37.98s
- 応答時間(合計)
- 797.60s
- 応答時間(最大)
- 332.10s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.66s
応答時間(最大)6.74s
応答時間(合計)18.65s
-
コーディング
: 8.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)59.77s
応答時間(最大)130.26s
応答時間(合計)179.30s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)19.29s
応答時間(最大)19.29s
応答時間(合計)19.29s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.18s
応答時間(最大)4.35s
応答時間(合計)8.36s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)164.14s
応答時間(最大)332.10s
応答時間(合計)492.41s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.16s
応答時間(最大)4.16s
応答時間(合計)4.16s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.36s
応答時間(最大)3.46s
応答時間(合計)6.73s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.76s
応答時間(最大)10.54s
応答時間(合計)20.28s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)10.57s
応答時間(最大)10.57s
応答時間(合計)10.57s
-
雑学
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)37.86s
応答時間(最大)37.86s
応答時間(合計)37.86s
|
| #12#12 |
Gemini 3.1 Flash Lite Previewhighアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
8.6… |
Google |
$2.310
…
|
68.14s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)68.14s
応答時間(最大)280.52s
応答時間(合計)1090.28s
…
|
- 合計テスト数
- 16
- 誤答テスト数
- 3
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 81.3%
- 入力トークン
- 28,980
- 出力トークン
- 1,283
- 推論トークン
- 1,533,310
- 応答時間(平均)
- 68.14s
- 応答時間(合計)
- 1090.28s
- 応答時間(最大)
- 280.52s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)43.87s
応答時間(最大)121.88s
応答時間(合計)131.62s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)280.52s
応答時間(最大)280.52s
応答時間(合計)280.52s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.16s
応答時間(最大)8.54s
応答時間(合計)14.31s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)127.58s
応答時間(最大)133.93s
応答時間(合計)382.74s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.25s
応答時間(最大)5.25s
応答時間(合計)5.25s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)64.03s
応答時間(最大)124.45s
応答時間(合計)128.06s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)46.68s
応答時間(最大)134.22s
応答時間(合計)140.04s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.73s
応答時間(最大)7.73s
応答時間(合計)7.73s
|
| #69#69 |
Claude Opus 4.6medium
|
7.0… |
Anthropic |
$2.053
…
|
25.89s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 5 不正解: 3 指示に従っていない: 1
応答時間(平均)25.89s
応答時間(最大)83.40s
応答時間(合計)362.49s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 61.9%
- 入力トークン
- 53,227
- 出力トークン
- 47,446
- 推論トークン
- 24,000
- 応答時間(平均)
- 25.89s
- 応答時間(合計)
- 362.49s
- 応答時間(最大)
- 83.40s
-
反AIトリック
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 2
応答時間(平均)7.45s
応答時間(最大)11.88s
応答時間(合計)14.90s
-
コーディング
: 5.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 指示に従っていない: 1
応答時間(平均)30.10s
応答時間(最大)35.63s
応答時間(合計)90.31s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)76.66s
応答時間(最大)76.66s
応答時間(合計)76.66s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.37s
応答時間(最大)7.37s
応答時間(合計)7.37s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 2 不正解: 1
応答時間(平均)83.40s
応答時間(最大)83.40s
応答時間(合計)83.40s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.04s
応答時間(最大)5.04s
応答時間(合計)5.04s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.43s
応答時間(最大)2.43s
応答時間(合計)2.43s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.71s
応答時間(最大)4.75s
応答時間(合計)9.41s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.73s
応答時間(最大)9.73s
応答時間(合計)9.73s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)63.24s
応答時間(最大)63.24s
応答時間(合計)63.24s
|
| #53#53 |
Gemini 3.1 Flash Litehighアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
7.3… |
Google |
$2.044
…
|
61.96s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 3 回答なし: 1
応答時間(平均)61.96s
応答時間(最大)149.23s
応答時間(合計)1115.31s
…
|
- 合計テスト数
- 18
- 誤答テスト数
- 8
- 試行ごとの合格率
- 68.5%
- 入力トークン
- 29,134
- 出力トークン
- 1,984
- 推論トークン
- 1,355,583
- 応答時間(平均)
- 61.96s
- 応答時間(合計)
- 1115.31s
- 応答時間(最大)
- 149.23s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)37.16s
応答時間(最大)140.53s
応答時間(合計)148.65s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)137.63s
応答時間(最大)137.63s
応答時間(合計)137.63s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)149.23s
応答時間(最大)149.23s
応答時間(合計)149.23s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.49s
応答時間(最大)4.96s
応答時間(合計)8.98s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)139.90s
応答時間(最大)141.40s
応答時間(合計)419.69s
-
汎用知能
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)45.69s
応答時間(最大)45.69s
応答時間(合計)45.69s
-
指示追従
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)23.26s
応答時間(最大)43.87s
応答時間(合計)46.51s
-
パズル解決
: 5.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 2
応答時間(平均)50.83s
応答時間(最大)144.85s
応答時間(合計)152.49s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.44s
応答時間(最大)6.44s
応答時間(合計)6.44s
|
| #52#52 |
Claude Sonnet 4.6medium
|
7.4… |
Anthropic |
$1.418
…
|
17.06s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 余分な書式: 3 タイムアウト: 1
応答時間(平均)17.06s
応答時間(最大)46.35s
応答時間(合計)221.83s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 65.1%
- 入力トークン
- 49,112
- 出力トークン
- 54,703
- 推論トークン
- 29,970
- 応答時間(平均)
- 17.06s
- 応答時間(合計)
- 221.83s
- 応答時間(最大)
- 46.35s
-
反AIトリック
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)2.98s
応答時間(最大)4.95s
応答時間(合計)5.97s
-
コーディング
: 5.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)33.29s
応答時間(最大)35.76s
応答時間(合計)99.86s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)46.35s
応答時間(最大)46.35s
応答時間(合計)46.35s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.90s
応答時間(最大)13.90s
応答時間(合計)13.90s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 タイムアウト: 1 不正解: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.94s
応答時間(最大)4.94s
応答時間(合計)4.94s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.61s
応答時間(最大)2.61s
応答時間(合計)2.61s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.31s
応答時間(最大)6.24s
応答時間(合計)10.62s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.48s
応答時間(最大)7.48s
応答時間(合計)7.48s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)30.09s
応答時間(最大)30.09s
応答時間(合計)30.09s
|
| #21#21 |
GPT-5.4medium
|
8.0… |
OpenAI |
$1.210
…
|
22.35s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 2
応答時間(平均)22.35s
応答時間(最大)100.41s
応答時間(合計)469.29s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 76.2%
- 入力トークン
- 34,108
- 出力トークン
- 2,242
- 推論トークン
- 72,707
- 応答時間(平均)
- 22.35s
- 応答時間(合計)
- 469.29s
- 応答時間(最大)
- 100.41s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.11s
応答時間(最大)6.42s
応答時間(合計)16.42s
-
コーディング
: 8.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)44.36s
応答時間(最大)96.94s
応答時間(合計)133.08s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)20.57s
応答時間(最大)20.57s
応答時間(合計)20.57s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.32s
応答時間(最大)5.40s
応答時間(合計)10.64s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)74.27s
応答時間(最大)100.41s
応答時間(合計)222.80s
-
汎用知能
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.92s
応答時間(最大)4.92s
応答時間(合計)4.92s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.11s
応答時間(最大)3.68s
応答時間(合計)6.22s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)9.14s
応答時間(最大)18.14s
応答時間(合計)27.41s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.28s
応答時間(最大)13.28s
応答時間(合計)13.28s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)13.95s
応答時間(最大)13.95s
応答時間(合計)13.95s
|
| #71#71 |
Step 3.7 Flashhigh
|
7.0… |
Stepfun |
$1.148
…
|
64.46s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 回答なし: 4
応答時間(平均)64.46s
応答時間(最大)364.99s
応答時間(合計)1353.57s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 10
- 試行ごとの合格率
- 63.5%
- 入力トークン
- 38,391
- 出力トークン
- 991,355
- 推論トークン
- 0
- 応答時間(平均)
- 64.46s
- 応答時間(合計)
- 1353.57s
- 応答時間(最大)
- 364.99s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.40s
応答時間(最大)45.73s
応答時間(合計)53.58s
-
コーディング
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 2 不正解: 1
応答時間(平均)206.21s
応答時間(最大)364.99s
応答時間(合計)618.64s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.01s
応答時間(最大)13.01s
応答時間(合計)13.01s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.72s
応答時間(最大)24.97s
応答時間(合計)29.43s
-
ドメイン特化
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 回答なし: 1
応答時間(平均)149.64s
応答時間(最大)163.21s
応答時間(合計)448.91s
-
汎用知能
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.17s
応答時間(最大)4.17s
応答時間(合計)4.17s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.52s
応答時間(最大)1.89s
応答時間(合計)3.03s
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)10.22s
応答時間(最大)23.65s
応答時間(合計)30.66s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.79s
応答時間(最大)2.79s
応答時間(合計)2.79s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)149.34s
応答時間(最大)149.34s
応答時間(合計)149.34s
|
| #2🥈 #2 |
Gemini 3.5 Flashhigh
|
9.6… |
Google |
$1.115
…
|
8.84s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)8.84s
応答時間(最大)34.82s
応答時間(合計)185.57s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 1
- 試行ごとの合格率
- 96.8%
- 入力トークン
- 37,594
- 出力トークン
- 1,975
- 推論トークン
- 115,638
- 応答時間(平均)
- 8.84s
- 応答時間(合計)
- 185.57s
- 応答時間(最大)
- 34.82s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.57s
応答時間(最大)3.60s
応答時間(合計)10.27s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)22.96s
応答時間(最大)34.82s
応答時間(合計)68.88s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)22.37s
応答時間(最大)22.37s
応答時間(合計)22.37s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.43s
応答時間(最大)8.51s
応答時間(合計)12.87s
-
ドメイン特化
: 7.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)14.09s
応答時間(最大)22.00s
応答時間(合計)42.27s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.63s
応答時間(最大)3.63s
応答時間(合計)3.63s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.35s
応答時間(最大)3.42s
応答時間(合計)6.69s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.23s
応答時間(最大)3.68s
応答時間(合計)9.69s
-
ツール呼び出し
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.96s
応答時間(最大)4.96s
応答時間(合計)4.96s
-
雑学
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.94s
応答時間(最大)3.94s
応答時間(合計)3.94s
|
| #10#10 |
Claude Opus 4.8medium
|
8.7… |
Anthropic |
$1.107
…
|
9.66s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 回答なし: 1
応答時間(平均)9.66s
応答時間(最大)38.03s
応答時間(合計)202.89s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 4
- 試行ごとの合格率
- 84.1%
- 入力トークン
- 61,007
- 出力トークン
- 26,495
- 推論トークン
- 5,901
- 応答時間(平均)
- 9.66s
- 応答時間(合計)
- 202.89s
- 応答時間(最大)
- 38.03s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.95s
応答時間(最大)5.76s
応答時間(合計)15.79s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.33s
応答時間(最大)22.27s
応答時間(合計)45.98s
-
複合
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)38.03s
応答時間(最大)38.03s
応答時間(合計)38.03s
-
データ解析と抽出
: 7.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)12.29s
応答時間(最大)19.64s
応答時間(合計)24.59s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)14.15s
応答時間(最大)28.41s
応答時間(合計)42.46s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.46s
応答時間(最大)2.46s
応答時間(合計)2.46s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.32s
応答時間(最大)5.07s
応答時間(合計)6.63s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.95s
応答時間(最大)4.33s
応答時間(合計)11.85s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.96s
応答時間(最大)8.96s
応答時間(合計)8.96s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)6.14s
応答時間(最大)6.14s
応答時間(合計)6.14s
|
| #20#20 |
Gemini 3.5 Flashnone
|
8.1… |
Google |
$1.079
…
|
9.93s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 3 不正解: 3
応答時間(平均)9.93s
応答時間(最大)64.36s
応答時間(合計)178.68s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 6
- 試行ごとの合格率
- 77.8%
- 入力トークン
- 13,843
- 出力トークン
- 117,518
- 推論トークン
- 0
- 応答時間(平均)
- 9.93s
- 応答時間(合計)
- 178.68s
- 応答時間(最大)
- 64.36s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.53s
応答時間(最大)3.43s
応答時間(合計)10.12s
-
コーディング
: 8.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)34.69s
応答時間(最大)64.36s
応答時間(合計)104.06s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)8.10s
応答時間(最大)8.10s
応答時間(合計)8.10s
-
ドメイン特化
: 7.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.64s
応答時間(最大)14.00s
応答時間(合計)31.92s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.46s
応答時間(最大)3.46s
応答時間(合計)3.46s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.38s
応答時間(最大)3.40s
応答時間(合計)6.76s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.13s
応答時間(最大)3.33s
応答時間(合計)9.39s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.87s
応答時間(最大)4.87s
応答時間(合計)4.87s
|
| #4#4 |
Gemini 3.1 Pro Previewmedium
|
9.4… |
Google |
$1.054
…
|
20.14s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)20.14s
応答時間(最大)88.68s
応答時間(合計)281.92s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 2
- 試行ごとの合格率
- 90.5%
- 入力トークン
- 41,617
- 出力トークン
- 1,977
- 推論トークン
- 78,896
- 応答時間(平均)
- 20.14s
- 応答時間(合計)
- 281.92s
- 応答時間(最大)
- 88.68s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.90s
応答時間(最大)9.52s
応答時間(合計)15.80s
-
コーディング
: 7.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)40.17s
応答時間(最大)88.68s
応答時間(合計)120.52s
-
複合
: 9.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)40.61s
応答時間(最大)40.61s
応答時間(合計)40.61s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.72s
応答時間(最大)7.72s
応答時間(合計)7.72s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)32.73s
応答時間(最大)32.73s
応答時間(合計)32.73s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)11.77s
応答時間(最大)11.77s
応答時間(合計)11.77s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.56s
応答時間(最大)9.56s
応答時間(合計)9.56s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.90s
応答時間(最大)8.49s
応答時間(合計)13.79s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.15s
応答時間(最大)23.15s
応答時間(合計)23.15s
-
雑学
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.27s
応答時間(最大)6.27s
応答時間(合計)6.27s
|
| #14#14 |
Qwen3.6 Max Previewmedium
|
8.5… |
Qwen |
$0.960
↓
…
|
59.63s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5
応答時間(平均)59.63s
応答時間(最大)238.07s
応答時間(合計)1252.17s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 5
- 試行ごとの合格率
- 81.0%
- 入力トークン
- 42,362
- 出力トークン
- 2,273
- 推論トークン
- 144,367
- 応答時間(平均)
- 59.63s
- 応答時間(合計)
- 1252.17s
- 応答時間(最大)
- 238.07s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)22.13s
応答時間(最大)28.70s
応答時間(合計)88.50s
-
コーディング
: 8.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)146.48s
応答時間(最大)238.07s
応答時間(合計)439.45s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)121.49s
応答時間(最大)121.49s
応答時間(合計)121.49s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)41.15s
応答時間(最大)48.02s
応答時間(合計)82.30s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)95.91s
応答時間(最大)186.74s
応答時間(合計)287.73s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)32.24s
応答時間(最大)32.24s
応答時間(合計)32.24s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)24.31s
応答時間(最大)27.94s
応答時間(合計)48.63s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)24.32s
応答時間(最大)37.68s
応答時間(合計)72.96s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)18.32s
応答時間(最大)18.32s
応答時間(合計)18.32s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)60.56s
応答時間(最大)60.56s
応答時間(合計)60.56s
|
| #47#47 |
Grok Build 0.1medium
|
7.4… |
X AI |
$0.927
…
|
49.90s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 余分な書式: 3
応答時間(平均)49.90s
応答時間(最大)252.69s
応答時間(合計)1047.92s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 61.9%
- 入力トークン
- 44,418
- 出力トークン
- 2,782
- 推論トークン
- 438,018
- 応答時間(平均)
- 49.90s
- 応答時間(合計)
- 1047.92s
- 応答時間(最大)
- 252.69s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)7.43s
応答時間(最大)10.89s
応答時間(合計)29.72s
-
コーディング
: 5.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)108.46s
応答時間(最大)200.16s
応答時間(合計)325.39s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)32.81s
応答時間(最大)32.81s
応答時間(合計)32.81s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)10.72s
応答時間(最大)12.13s
応答時間(合計)21.44s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)158.00s
応答時間(最大)252.69s
応答時間(合計)474.01s
-
汎用知能
: 4.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)18.41s
応答時間(最大)18.41s
応答時間(合計)18.41s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.36s
応答時間(最大)20.80s
応答時間(合計)24.73s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)18.26s
応答時間(最大)44.40s
応答時間(合計)54.79s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.12s
応答時間(最大)13.12s
応答時間(合計)13.12s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)53.51s
応答時間(最大)53.51s
応答時間(合計)53.51s
|
| #6#6 |
GPT-5.5low
|
9.0… |
OpenAI |
$0.907
…
|
9.76s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)9.76s
応答時間(最大)56.19s
応答時間(合計)204.92s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 3
- 試行ごとの合格率
- 85.7%
- 入力トークン
- 34,209
- 出力トークン
- 2,046
- 推論トークン
- 22,460
- 応答時間(平均)
- 9.76s
- 応答時間(合計)
- 204.92s
- 応答時間(最大)
- 56.19s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.41s
応答時間(最大)6.32s
応答時間(合計)17.64s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.04s
応答時間(最大)21.06s
応答時間(合計)45.11s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.56s
応答時間(最大)9.56s
応答時間(合計)9.56s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.28s
応答時間(最大)5.13s
応答時間(合計)6.56s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)28.05s
応答時間(最大)56.19s
応答時間(合計)84.16s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.17s
応答時間(最大)5.17s
応答時間(合計)5.17s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.74s
応答時間(最大)3.99s
応答時間(合計)7.48s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.74s
応答時間(最大)5.61s
応答時間(合計)14.21s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.96s
応答時間(最大)4.96s
応答時間(合計)4.96s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)10.06s
応答時間(最大)10.06s
応答時間(合計)10.06s
|
| #60#60 |
Kimi K2.6medium
|
7.2… |
Moonshot AI |
$0.891
↓
…
|
71.67s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 3 不正解: 3 指示に従っていない: 2 回答なし: 1
応答時間(平均)71.67s
応答時間(最大)406.78s
応答時間(合計)1433.36s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 65.1%
- 入力トークン
- 29,450
- 出力トークン
- 102,923
- 推論トークン
- 254,094
- 応答時間(平均)
- 71.67s
- 応答時間(合計)
- 1433.36s
- 応答時間(最大)
- 406.78s
-
反AIトリック
: 7.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)11.59s
応答時間(最大)23.94s
応答時間(合計)46.37s
-
コーディング
: 5.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1 タイムアウト: 1
応答時間(平均)214.42s
応答時間(最大)406.78s
応答時間(合計)643.25s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)40.96s
応答時間(最大)40.96s
応答時間(合計)40.96s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)20.38s
応答時間(最大)22.88s
応答時間(合計)40.76s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 2
応答時間(平均)202.38s
応答時間(最大)215.85s
応答時間(合計)404.76s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.83s
応答時間(最大)17.83s
応答時間(合計)17.83s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.53s
応答時間(最大)19.15s
応答時間(合計)25.06s
-
パズル解決
: 6.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)25.06s
応答時間(最大)56.89s
応答時間(合計)75.19s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.92s
応答時間(最大)8.92s
応答時間(合計)8.92s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)130.27s
応答時間(最大)130.27s
応答時間(合計)130.27s
|
| #13#13 |
Grok 4.20 Betamediumアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
8.5… |
X AI |
$0.750
↑
…
|
9.75s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 指示に従っていない: 1
応答時間(平均)9.75s
応答時間(最大)31.36s
応答時間(合計)175.48s
…
|
- 合計テスト数
- 18
- 誤答テスト数
- 4
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 81.5%
- 入力トークン
- 35,955
- 出力トークン
- 1,647
- 推論トークン
- 91,565
- 応答時間(平均)
- 9.75s
- 応答時間(合計)
- 175.48s
- 応答時間(最大)
- 31.36s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.16s
応答時間(最大)3.44s
応答時間(合計)12.65s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)31.36s
応答時間(最大)31.36s
応答時間(合計)31.36s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)20.93s
応答時間(最大)20.93s
応答時間(合計)20.93s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.01s
応答時間(最大)4.27s
応答時間(合計)8.02s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)21.33s
応答時間(最大)24.21s
応答時間(合計)64.00s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.78s
応答時間(最大)5.78s
応答時間(合計)5.78s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.89s
応答時間(最大)5.89s
応答時間(合計)9.78s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.52s
応答時間(最大)4.53s
応答時間(合計)10.57s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)12.39s
応答時間(最大)12.39s
応答時間(合計)12.39s
|
| #15#15 |
GPT-5.3-Codexmedium
|
8.4… |
OpenAI |
$0.740
…
|
16.22s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 2
応答時間(平均)16.22s
応答時間(最大)100.93s
応答時間(合計)340.67s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 6
- 試行ごとの合格率
- 82.5%
- 入力トークン
- 34,299
- 出力トークン
- 2,357
- 推論トークン
- 46,189
- 応答時間(平均)
- 16.22s
- 応答時間(合計)
- 340.67s
- 応答時間(最大)
- 100.93s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.16s
応答時間(最大)6.68s
応答時間(合計)16.63s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)19.50s
応答時間(最大)27.96s
応答時間(合計)58.49s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)19.56s
応答時間(最大)19.56s
応答時間(合計)19.56s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.07s
応答時間(最大)3.59s
応答時間(合計)6.15s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)64.31s
応答時間(最大)100.93s
応答時間(合計)192.94s
-
汎用知能
: 4.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.87s
応答時間(最大)4.87s
応答時間(合計)4.87s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.04s
応答時間(最大)3.44s
応答時間(合計)6.07s
-
パズル解決
: 9.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)5.05s
応答時間(最大)8.73s
応答時間(合計)15.15s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)6.37s
応答時間(最大)6.37s
応答時間(合計)6.37s
-
雑学
: 2.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)14.43s
応答時間(最大)14.43s
応答時間(合計)14.43s
|
| #80#80 |
Mimo V2 Omnimedium
|
6.7… |
Xiaomi |
$0.683
↓
…
|
41.16s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 2 回答なし: 2 API エラー: 1 余分な書式: 1
応答時間(平均)41.16s
応答時間(最大)299.23s
応答時間(合計)823.26s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 11
- 試行ごとの合格率
- 55.6%
- 入力トークン
- 37,007
- 出力トークン
- 1,952
- 推論トークン
- 357,306
- 応答時間(平均)
- 41.16s
- 応答時間(合計)
- 823.26s
- 応答時間(最大)
- 299.23s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.75s
応答時間(最大)4.59s
応答時間(合計)10.98s
-
コーディング
: 3.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 回答なし: 1 不正解: 1
応答時間(平均)183.89s
応答時間(最大)299.23s
応答時間(合計)367.78s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)25.87s
応答時間(最大)25.87s
応答時間(合計)25.87s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.04s
応答時間(最大)4.12s
応答時間(合計)6.07s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 回答なし: 1 不正解: 1
応答時間(平均)47.89s
応答時間(最大)134.52s
応答時間(合計)143.67s
-
汎用知能
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.61s
応答時間(最大)3.61s
応答時間(合計)3.61s
-
指示追従
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.99s
応答時間(最大)7.14s
応答時間(合計)9.99s
-
パズル解決
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)2.38s
応答時間(最大)3.69s
応答時間(合計)7.13s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)13.98s
応答時間(最大)13.98s
応答時間(合計)13.98s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)234.19s
応答時間(最大)234.19s
応答時間(合計)234.19s
|
| #11#11 |
Claude Opus 4.7medium
|
8.7… |
Anthropic |
$0.679
…
|
4.73s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3 タイムアウト: 1
応答時間(平均)4.73s
応答時間(最大)23.18s
応答時間(合計)94.51s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 4
- 試行ごとの合格率
- 82.5%
- 入力トークン
- 65,406
- 出力トークン
- 11,858
- 推論トークン
- 2,198
- 応答時間(平均)
- 4.73s
- 応答時間(合計)
- 94.51s
- 応答時間(最大)
- 23.18s
-
反AIトリック
: 8.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.85s
応答時間(最大)2.71s
応答時間(合計)7.38s
-
コーディング
: 7.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)12.96s
応答時間(最大)23.18s
応答時間(合計)38.89s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)21.45s
応答時間(最大)21.45s
応答時間(合計)21.45s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.37s
応答時間(最大)3.30s
応答時間(合計)4.74s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)1.17s
応答時間(最大)1.40s
応答時間(合計)2.35s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.87s
応答時間(最大)2.87s
応答時間(合計)2.87s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.57s
応答時間(最大)1.66s
応答時間(合計)3.14s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.43s
応答時間(最大)2.89s
応答時間(合計)7.28s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.17s
応答時間(最大)4.17s
応答時間(合計)4.17s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.25s
応答時間(最大)2.25s
応答時間(合計)2.25s
|
| #1🥇 #1 |
Gemini 3 Flash Previewmedium
|
9.8… |
Google |
$0.667
…
|
18.64s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)18.64s
応答時間(最大)117.26s
応答時間(合計)391.35s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 1
- 試行ごとの合格率
- 98.4%
- 入力トークン
- 37,017
- 出力トークン
- 2,006
- 推論トークン
- 214,153
- 応答時間(平均)
- 18.64s
- 応答時間(合計)
- 391.35s
- 応答時間(最大)
- 117.26s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.88s
応答時間(最大)5.73s
応答時間(合計)15.53s
-
コーディング
: 8.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)84.40s
応答時間(最大)117.26s
応答時間(合計)253.21s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)22.42s
応答時間(最大)22.42s
応答時間(合計)22.42s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.43s
応答時間(最大)6.18s
応答時間(合計)10.86s
-
ドメイン特化
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)15.27s
応答時間(最大)34.09s
応答時間(合計)45.80s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.19s
応答時間(最大)5.19s
応答時間(合計)5.19s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.04s
応答時間(最大)4.70s
応答時間(合計)8.08s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.05s
応答時間(最大)5.64s
応答時間(合計)12.15s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.60s
応答時間(最大)12.60s
応答時間(合計)12.60s
-
雑学
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.50s
応答時間(最大)5.50s
応答時間(合計)5.50s
|
| #38#38 |
Grok 4.3medium
|
7.6… |
X AI |
$0.614
…
|
47.51s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 指示に従っていない: 2 余分な書式: 1
応答時間(平均)47.51s
応答時間(最大)216.69s
応答時間(合計)997.68s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 71.4%
- 入力トークン
- 44,472
- 出力トークン
- 1,981
- 推論トークン
- 221,382
- 応答時間(平均)
- 47.51s
- 応答時間(合計)
- 997.68s
- 応答時間(最大)
- 216.69s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)8.83s
応答時間(最大)11.20s
応答時間(合計)35.31s
-
コーディング
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)41.23s
応答時間(最大)64.81s
応答時間(合計)123.69s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)63.99s
応答時間(最大)63.99s
応答時間(合計)63.99s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)18.97s
応答時間(最大)26.99s
応答時間(合計)37.93s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)181.74s
応答時間(最大)216.69s
応答時間(合計)545.21s
-
汎用知能
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)24.70s
応答時間(最大)24.70s
応答時間(合計)24.70s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)18.58s
応答時間(最大)31.48s
応答時間(合計)37.15s
-
パズル解決
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)22.52s
応答時間(最大)51.75s
応答時間(合計)67.57s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.66s
応答時間(最大)17.66s
応答時間(合計)17.66s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)44.47s
応答時間(最大)44.47s
応答時間(合計)44.47s
|
| #65#65 |
Grok 4.20medium
|
7.1… |
X AI |
$0.609
↓
…
|
27.68s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 指示に従っていない: 2 余分な書式: 1
応答時間(平均)27.68s
応答時間(最大)199.66s
応答時間(合計)581.26s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 63.5%
- 入力トークン
- 44,433
- 出力トークン
- 1,819
- 推論トークン
- 219,524
- 応答時間(平均)
- 27.68s
- 応答時間(合計)
- 581.26s
- 応答時間(最大)
- 199.66s
-
反AIトリック
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.95s
応答時間(最大)5.68s
応答時間(合計)15.80s
-
コーディング
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)109.93s
応答時間(最大)199.66s
応答時間(合計)329.79s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.40s
応答時間(最大)17.40s
応答時間(合計)17.40s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.17s
応答時間(最大)5.02s
応答時間(合計)8.34s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 不正解: 1
応答時間(平均)27.03s
応答時間(最大)29.87s
応答時間(合計)81.10s
-
汎用知能
: 3.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)24.48s
応答時間(最大)24.48s
応答時間(合計)24.48s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.26s
応答時間(最大)4.46s
応答時間(合計)8.52s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.22s
応答時間(最大)11.63s
応答時間(合計)18.66s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)13.68s
応答時間(最大)13.68s
応答時間(合計)13.68s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)63.48s
応答時間(最大)63.48s
応答時間(合計)63.48s
|
| #29#29 |
Qwen3.5-122B-A10Bmedium
|
7.8… |
Qwen |
$0.588
↓
…
|
42.49s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 5 タイムアウト: 2
応答時間(平均)42.49s
応答時間(最大)168.16s
応答時間(合計)892.30s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 7
- 試行ごとの合格率
- 73.0%
- 入力トークン
- 41,832
- 出力トークン
- 26,187
- 推論トークン
- 251,028
- 応答時間(平均)
- 42.49s
- 応答時間(合計)
- 892.30s
- 応答時間(最大)
- 168.16s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.75s
応答時間(最大)18.03s
応答時間(合計)39.01s
-
コーディング
: 6.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)114.48s
応答時間(最大)168.16s
応答時間(合計)343.44s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)107.79s
応答時間(最大)107.79s
応答時間(合計)107.79s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)23.41s
応答時間(最大)29.79s
応答時間(合計)46.83s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)63.40s
応答時間(最大)119.29s
応答時間(合計)190.20s
-
汎用知能
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1
応答時間(平均)34.11s
応答時間(最大)34.11s
応答時間(合計)34.11s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)9.88s
応答時間(最大)15.44s
応答時間(合計)19.76s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.89s
応答時間(最大)31.99s
応答時間(合計)53.68s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.60s
応答時間(最大)4.60s
応答時間(合計)4.60s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)52.87s
応答時間(最大)52.87s
応答時間(合計)52.87s
|
| #7#7 |
Gemini 3.5 Flashmedium
|
9.0… |
Google |
$0.582
…
|
4.94s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)4.94s
応答時間(最大)18.07s
応答時間(合計)103.79s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 3
- 試行ごとの合格率
- 87.3%
- 入力トークン
- 36,936
- 出力トークン
- 2,001
- 推論トークン
- 56,408
- 応答時間(平均)
- 4.94s
- 応答時間(合計)
- 103.79s
- 応答時間(最大)
- 18.07s
-
反AIトリック
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.09s
応答時間(最大)2.56s
応答時間(合計)8.35s
-
コーディング
: 7.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)12.63s
応答時間(最大)18.07s
応答時間(合計)37.89s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)12.05s
応答時間(最大)12.05s
応答時間(合計)12.05s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.07s
応答時間(最大)5.60s
応答時間(合計)8.14s
-
ドメイン特化
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)5.24s
応答時間(最大)6.43s
応答時間(合計)15.73s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.52s
応答時間(最大)2.52s
応答時間(合計)2.52s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.70s
応答時間(最大)3.07s
応答時間(合計)5.40s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.38s
応答時間(最大)2.55s
応答時間(合計)7.15s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.81s
応答時間(最大)3.81s
応答時間(合計)3.81s
-
雑学
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.75s
応答時間(最大)2.75s
応答時間(合計)2.75s
|
| #42#42 |
GPT-5.2medium
|
7.5… |
OpenAI |
$0.548
…
|
16.88s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 3 不正解: 3 回答なし: 1 タイムアウト: 1
応答時間(平均)16.88s
応答時間(最大)77.80s
応答時間(合計)236.34s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 71.4%
- 入力トークン
- 33,967
- 出力トークン
- 2,901
- 推論トークン
- 31,932
- 応答時間(平均)
- 16.88s
- 応答時間(合計)
- 236.34s
- 応答時間(最大)
- 77.80s
-
反AIトリック
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)7.81s
応答時間(最大)14.34s
応答時間(合計)15.62s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)22.73s
応答時間(最大)31.19s
応答時間(合計)68.20s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)14.06s
応答時間(最大)14.06s
応答時間(合計)14.06s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.15s
応答時間(最大)3.15s
応答時間(合計)3.15s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)77.80s
応答時間(最大)77.80s
応答時間(合計)77.80s
-
汎用知能
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.32s
応答時間(最大)4.32s
応答時間(合計)4.32s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.12s
応答時間(最大)3.12s
応答時間(合計)3.12s
-
パズル解決
: 7.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)5.80s
応答時間(最大)6.45s
応答時間(合計)11.61s
-
ツール呼び出し
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)10.30s
応答時間(最大)10.30s
応答時間(合計)10.30s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)28.18s
応答時間(最大)28.18s
応答時間(合計)28.18s
|
| #100#100 |
Grok Build 0.1noneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
6.0… |
X AI |
$0.547
…
|
28.69s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 7 API エラー: 3 指示に従っていない: 2
応答時間(平均)28.69s
応答時間(最大)138.35s
応答時間(合計)459.00s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 12
- 試行ごとの合格率
- 50.9%
- 入力トークン
- 11,793
- 出力トークン
- 267,275
- 推論トークン
- 0
- 応答時間(平均)
- 28.69s
- 応答時間(合計)
- 459.00s
- 応答時間(最大)
- 138.35s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)6.30s
応答時間(最大)9.80s
応答時間(合計)25.20s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)21.41s
応答時間(最大)21.41s
応答時間(合計)21.41s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 3.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)9.33s
応答時間(最大)9.33s
応答時間(合計)9.33s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)103.71s
応答時間(最大)138.35s
応答時間(合計)311.13s
-
汎用知能
: 4.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)12.47s
応答時間(最大)12.47s
応答時間(合計)12.47s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.36s
応答時間(最大)11.05s
応答時間(合計)14.73s
-
パズル解決
: 6.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)9.55s
応答時間(最大)18.18s
応答時間(合計)28.65s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)36.09s
応答時間(最大)36.09s
応答時間(合計)36.09s
|
| #68#68 |
Claude Opus 4.8none
|
7.0… |
Anthropic |
$0.539
…
|
3.47s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 余分な書式: 3 指示に従っていない: 1 回答なし: 1
応答時間(平均)3.47s
応答時間(最大)17.73s
応答時間(合計)72.90s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 61.9%
- 入力トークン
- 67,104
- 出力トークン
- 8,107
- 推論トークン
- 0
- 応答時間(平均)
- 3.47s
- 応答時間(合計)
- 72.90s
- 応答時間(最大)
- 17.73s
-
反AIトリック
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 2
応答時間(平均)3.40s
応答時間(最大)6.36s
応答時間(合計)13.58s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)3.29s
応答時間(最大)4.34s
応答時間(合計)9.88s
-
複合
: 9.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.73s
応答時間(最大)17.73s
応答時間(合計)17.73s
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.77s
応答時間(最大)1.93s
応答時間(合計)3.53s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.66s
応答時間(最大)2.16s
応答時間(合計)4.99s
-
汎用知能
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.48s
応答時間(最大)3.48s
応答時間(合計)3.48s
-
指示追従
: 9.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.37s
応答時間(最大)1.40s
応答時間(合計)2.73s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)2.74s
応答時間(最大)3.46s
応答時間(合計)8.22s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)5.35s
応答時間(最大)5.35s
応答時間(合計)5.35s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
回答なし: 1
応答時間(平均)3.41s
応答時間(最大)3.41s
応答時間(合計)3.41s
|
| #30#30 |
Qwen3.5-27Bmedium
|
7.8… |
Qwen |
$0.536
↓
…
|
68.39s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4 指示に従っていない: 2 余分な書式: 1 タイムアウト: 1
応答時間(平均)68.39s
応答時間(最大)234.36s
応答時間(合計)1436.24s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 8
- 試行ごとの合格率
- 73.0%
- 入力トークン
- 42,164
- 出力トークン
- 8,534
- 推論トークン
- 329,289
- 応答時間(平均)
- 68.39s
- 応答時間(合計)
- 1436.24s
- 応答時間(最大)
- 234.36s
-
反AIトリック
: 8.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1
応答時間(平均)19.75s
応答時間(最大)49.95s
応答時間(合計)79.01s
-
コーディング
: 6.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)160.69s
応答時間(最大)234.36s
応答時間(合計)482.07s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)163.96s
応答時間(最大)163.96s
応答時間(合計)163.96s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)30.26s
応答時間(最大)32.03s
応答時間(合計)60.52s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
タイムアウト: 1 不正解: 1
応答時間(平均)79.53s
応答時間(最大)95.52s
応答時間(合計)238.59s
-
汎用知能
: 6.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)101.41s
応答時間(最大)101.41s
応答時間(合計)101.41s
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)19.66s
応答時間(最大)32.25s
応答時間(合計)39.32s
-
パズル解決
: 8.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)59.60s
応答時間(最大)123.57s
応答時間(合計)178.80s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)7.45s
応答時間(最大)7.45s
応答時間(合計)7.45s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)85.11s
応答時間(最大)85.11s
応答時間(合計)85.11s
|
| #45#45 |
GPT-5.4 Minimedium
|
7.5… |
OpenAI |
$0.526
…
|
22.34s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 6 指示に従っていない: 3
応答時間(平均)22.34s
応答時間(最大)138.75s
応答時間(合計)469.20s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 73.0%
- 入力トークン
- 34,116
- 出力トークン
- 2,181
- 推論トークン
- 108,937
- 応答時間(平均)
- 22.34s
- 応答時間(合計)
- 469.20s
- 応答時間(最大)
- 138.75s
-
反AIトリック
: 8.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.05s
応答時間(最大)6.69s
応答時間(合計)16.20s
-
コーディング
: 8.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)57.87s
応答時間(最大)138.75s
応答時間(合計)173.61s
-
複合
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)17.81s
応答時間(最大)17.81s
応答時間(合計)17.81s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.43s
応答時間(最大)3.39s
応答時間(合計)4.87s
-
ドメイン特化
: 4.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)65.31s
応答時間(最大)102.91s
応答時間(合計)195.92s
-
汎用知能
: 4.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)3.72s
応答時間(最大)3.72s
応答時間(合計)3.72s
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.13s
応答時間(最大)2.45s
応答時間(合計)4.25s
-
パズル解決
: 7.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)4.37s
応答時間(最大)7.27s
応答時間(合計)13.11s
-
ツール呼び出し
: 4.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)9.62s
応答時間(最大)9.62s
応答時間(合計)9.62s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)30.10s
応答時間(最大)30.10s
応答時間(合計)30.10s
|