| #137#137 |
Elephant Alphanone
|
5.1… |
Openrouter |
$0.000
…
|
1.22s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9 API エラー: 3 指示に従っていない: 3 無効なツール呼び出し: 1
応答時間(平均)1.22s
応答時間(最大)3.81s
応答時間(合計)22.03s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 16
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 27.0%
- 入力トークン
- 33,743
- 出力トークン
- 2,573
- 推論トークン
- 0
- 応答時間(平均)
- 1.22s
- 応答時間(合計)
- 22.03s
- 応答時間(最大)
- 3.81s
-
反AIトリック
: 6.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)963ms
応答時間(最大)1.68s
応答時間(合計)3.85s
-
コーディング
: 4.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 2 不正解: 1
応答時間(平均)1.39s
応答時間(最大)1.39s
応答時間(合計)1.39s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.81s
応答時間(最大)3.81s
応答時間(合計)3.81s
-
データ解析と抽出
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.04s
応答時間(最大)1.05s
応答時間(合計)2.08s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)927ms
応答時間(最大)1.17s
応答時間(合計)2.78s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)854ms
応答時間(最大)854ms
応答時間(合計)854ms
-
指示追従
: 9.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.03s
応答時間(最大)1.17s
応答時間(合計)2.07s
-
パズル解決
: 4.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)807ms
応答時間(最大)925ms
応答時間(合計)2.42s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)2.79s
応答時間(最大)2.79s
応答時間(合計)2.79s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #58#58 |
Gemini 3.1 Flash Lite Previewnone
|
7.2… |
Google |
$0.018
…
|
1.21s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 7 指示に従っていない: 2
応答時間(平均)1.21s
応答時間(最大)3.39s
応答時間(合計)25.45s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 9
- 試行ごとの合格率
- 60.3%
- 入力トークン
- 37,582
- 出力トークン
- 5,547
- 推論トークン
- 0
- 応答時間(平均)
- 1.21s
- 応答時間(合計)
- 25.45s
- 応答時間(最大)
- 3.39s
-
反AIトリック
: 7.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)1.04s
応答時間(最大)1.47s
応答時間(合計)4.17s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)967ms
応答時間(最大)1.47s
応答時間(合計)2.90s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)3.20s
応答時間(最大)3.20s
応答時間(合計)3.20s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.22s
応答時間(最大)1.33s
応答時間(合計)2.44s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)942ms
応答時間(最大)1.12s
応答時間(合計)2.83s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)741ms
応答時間(最大)741ms
応答時間(合計)741ms
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.13s
応答時間(最大)1.14s
応答時間(合計)2.27s
-
パズル解決
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)900ms
応答時間(最大)962ms
応答時間(合計)2.70s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)3.39s
応答時間(最大)3.39s
応答時間(合計)3.39s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)814ms
応答時間(最大)814ms
応答時間(合計)814ms
|
| #106#106 |
Grok 4.20 Betanoneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
5.8… |
X AI |
$0.087
↓
…
|
1.19s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 10 指示に従っていない: 1 無効なツール呼び出し: 1
応答時間(平均)1.19s
応答時間(最大)6.48s
応答時間(合計)21.43s
…
|
- 合計テスト数
- 18
- 誤答テスト数
- 12
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 37.0%
- 入力トークン
- 40,597
- 出力トークン
- 1,657
- 推論トークン
- 0
- 応答時間(平均)
- 1.19s
- 応答時間(合計)
- 21.43s
- 応答時間(最大)
- 6.48s
-
反AIトリック
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)597ms
応答時間(最大)866ms
応答時間(合計)2.39s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.14s
応答時間(最大)1.14s
応答時間(合計)1.14s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)6.48s
応答時間(最大)6.48s
応答時間(合計)6.48s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)601ms
応答時間(最大)634ms
応答時間(合計)1.20s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)611ms
応答時間(最大)616ms
応答時間(合計)1.83s
-
汎用知能
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)541ms
応答時間(最大)541ms
応答時間(合計)541ms
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)649ms
応答時間(最大)952ms
応答時間(合計)1.30s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)586ms
応答時間(最大)813ms
応答時間(合計)1.76s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.79s
応答時間(最大)4.79s
応答時間(合計)4.79s
|
| #144#144 |
GPT-5.4 Mininone
|
4.9… |
OpenAI |
$0.038
…
|
1.13s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13 指示に従っていない: 3
応答時間(平均)1.13s
応答時間(最大)2.52s
応答時間(合計)23.82s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 16
- 試行ごとの合格率
- 30.2%
- 入力トークン
- 34,244
- 出力トークン
- 2,541
- 推論トークン
- 0
- 応答時間(平均)
- 1.13s
- 応答時間(合計)
- 23.82s
- 応答時間(最大)
- 2.52s
-
反AIトリック
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)929ms
応答時間(最大)1.55s
応答時間(合計)3.72s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)913ms
応答時間(最大)1.19s
応答時間(合計)2.74s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.52s
応答時間(最大)2.52s
応答時間(合計)2.52s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.30s
応答時間(最大)1.58s
応答時間(合計)2.61s
-
ドメイン特化
: 3.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)937ms
応答時間(最大)1.25s
応答時間(合計)2.81s
-
汎用知能
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)1.82s
応答時間(最大)1.82s
応答時間(合計)1.82s
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)728ms
応答時間(最大)731ms
応答時間(合計)1.46s
-
パズル解決
: 5.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)836ms
応答時間(最大)958ms
応答時間(合計)2.51s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)2.32s
応答時間(最大)2.32s
応答時間(合計)2.32s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.33s
応答時間(最大)1.33s
応答時間(合計)1.33s
|
| #127#127 |
Grok 4.20none
|
5.4… |
X AI |
$0.057
↓
…
|
1.11s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 10 余分な書式: 1 無効なツール呼び出し: 1
応答時間(平均)1.11s
応答時間(最大)6.04s
応答時間(合計)19.96s
…
|
- 合計テスト数
- 18
- 誤答テスト数
- 12
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 33.3%
- 入力トークン
- 41,313
- 出力トークン
- 1,923
- 推論トークン
- 0
- 応答時間(平均)
- 1.11s
- 応答時間(合計)
- 19.96s
- 応答時間(最大)
- 6.04s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)501ms
応答時間(最大)839ms
応答時間(合計)2.01s
-
コーディング
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.22s
応答時間(最大)1.22s
応答時間(合計)1.22s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)6.04s
応答時間(最大)6.04s
応答時間(合計)6.04s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)522ms
応答時間(最大)537ms
応答時間(合計)1.04s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 余分な書式: 1
応答時間(平均)687ms
応答時間(最大)821ms
応答時間(合計)2.06s
-
汎用知能
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)659ms
応答時間(最大)659ms
応答時間(合計)659ms
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)445ms
応答時間(最大)505ms
応答時間(合計)889ms
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)473ms
応答時間(最大)502ms
応答時間(合計)1.42s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)4.63s
応答時間(最大)4.63s
応答時間(合計)4.63s
|
| #90#90 |
Gemini 3.1 Flash Litenone
|
6.4… |
Google |
$0.013
…
|
1.06s… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 11 指示に従っていない: 1
応答時間(平均)1.06s
応答時間(最大)2.97s
応答時間(合計)22.35s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 12
- 試行ごとの合格率
- 52.4%
- 入力トークン
- 36,710
- 出力トークン
- 2,484
- 推論トークン
- 0
- 応答時間(平均)
- 1.06s
- 応答時間(合計)
- 22.35s
- 応答時間(最大)
- 2.97s
-
反AIトリック
: 7.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.07s
応答時間(最大)1.91s
応答時間(合計)4.27s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)938ms
応答時間(最大)1.59s
応答時間(合計)2.81s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.73s
応答時間(最大)2.73s
応答時間(合計)2.73s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)843ms
応答時間(最大)907ms
応答時間(合計)1.69s
-
ドメイン特化
: 2.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)762ms
応答時間(最大)814ms
応答時間(合計)2.29s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)992ms
応答時間(最大)992ms
応答時間(合計)992ms
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)859ms
応答時間(最大)975ms
応答時間(合計)1.72s
-
パズル解決
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)720ms
応答時間(最大)826ms
応答時間(合計)2.16s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.97s
応答時間(最大)2.97s
応答時間(合計)2.97s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)733ms
応答時間(最大)733ms
応答時間(合計)733ms
|
| #97#97 |
Gemini 2.5 Flashnone
|
6.2… |
Google |
$0.016
…
|
875ms… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 12
応答時間(平均)875ms
応答時間(最大)4.39s
応答時間(合計)18.37s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 12
- 試行ごとの合格率
- 46.0%
- 入力トークン
- 35,926
- 出力トークン
- 1,770
- 推論トークン
- 0
- 応答時間(平均)
- 875ms
- 応答時間(合計)
- 18.37s
- 応答時間(最大)
- 4.39s
-
反AIトリック
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)582ms
応答時間(最大)844ms
応答時間(合計)2.33s
-
コーディング
: 5.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)736ms
応答時間(最大)1.16s
応答時間(合計)2.21s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)4.39s
応答時間(最大)4.39s
応答時間(合計)4.39s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)652ms
応答時間(最大)660ms
応答時間(合計)1.30s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)495ms
応答時間(最大)642ms
応答時間(合計)1.49s
-
汎用知能
: 5.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)615ms
応答時間(最大)615ms
応答時間(合計)615ms
-
指示追従
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)590ms
応答時間(最大)622ms
応答時間(合計)1.18s
-
パズル解決
: 7.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)604ms
応答時間(最大)700ms
応答時間(合計)1.81s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.91s
応答時間(最大)1.91s
応答時間(合計)1.91s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.15s
応答時間(最大)1.15s
応答時間(合計)1.15s
|
| #146#146 |
Laguna Xs.2noneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
4.8… |
Poolside |
$0.000
…
|
806ms… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 8 API エラー: 4 指示に従っていない: 1 無効なツール呼び出し: 1
応答時間(平均)806ms
応答時間(最大)2.01s
応答時間(合計)12.09s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 14
- 試行ごとの合格率
- 26.3%
- 入力トークン
- 33,675
- 出力トークン
- 2,826
- 推論トークン
- 0
- 応答時間(平均)
- 806ms
- 応答時間(合計)
- 12.09s
- 応答時間(最大)
- 2.01s
-
反AIトリック
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 API エラー: 1 指示に従っていない: 1
応答時間(平均)534ms
応答時間(最大)906ms
応答時間(合計)1.60s
-
コーディング
: 2.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.96s
応答時間(最大)1.96s
応答時間(合計)1.96s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)2.01s
応答時間(最大)2.01s
応答時間(合計)2.01s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)646ms
応答時間(最大)658ms
応答時間(合計)1.29s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)371ms
応答時間(最大)419ms
応答時間(合計)1.11s
-
汎用知能
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)439ms
応答時間(最大)448ms
応答時間(合計)878ms
-
パズル解決
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)650ms
応答時間(最大)843ms
応答時間(合計)1.30s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)1.93s
応答時間(最大)1.93s
応答時間(合計)1.93s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #160#160 |
LFM2-24B-A2Bnoneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
4.2… |
Liquid |
$0.001
…
|
782ms… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9 API エラー: 4 指示に従っていない: 1
応答時間(平均)782ms
応答時間(最大)3.15s
応答時間(合計)10.94s
…
|
- 合計テスト数
- 16
- 誤答テスト数
- 14
- 信頼性
- 該当なしこのモデルの信頼性テレメトリは利用できません。
- 試行ごとの合格率
- 16.7%
- 入力トークン
- 10,771
- 出力トークン
- 1,173
- 推論トークン
- 0
- 応答時間(平均)
- 782ms
- 応答時間(合計)
- 10.94s
- 応答時間(最大)
- 3.15s
-
反AIトリック
: 3.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)471ms
応答時間(最大)872ms
応答時間(合計)1.41s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)714ms
応答時間(最大)987ms
応答時間(合計)1.43s
-
ドメイン特化
: 5.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 不正解: 1
応答時間(平均)287ms
応答時間(最大)334ms
応答時間(合計)860ms
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)395ms
応答時間(最大)395ms
応答時間(合計)395ms
-
指示追従
: 6.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)752ms
応答時間(最大)1.22s
応答時間(合計)1.50s
-
パズル解決
: 3.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 API エラー: 1
応答時間(平均)1.78s
応答時間(最大)3.15s
応答時間(合計)5.34s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #162#162 |
Nemotron 3 Nano Omni 30b A3b Reasoningnoneアーカイブ済みモデル: このモデルは今後更新されず、新しいテストでも評価されません。
|
4.1… |
NVIDIA |
$0.000
…
|
728ms… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 9 API エラー: 6 指示に従っていない: 2
応答時間(平均)728ms
応答時間(最大)2.21s
応答時間(合計)9.47s
…
|
- 合計テスト数
- 19
- 誤答テスト数
- 17
- 試行ごとの合格率
- 17.5%
- 入力トークン
- 11,661
- 出力トークン
- 1,302
- 推論トークン
- 0
- 応答時間(平均)
- 728ms
- 応答時間(合計)
- 9.47s
- 応答時間(最大)
- 2.21s
-
反AIトリック
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 API エラー: 1
応答時間(平均)584ms
応答時間(最大)772ms
応答時間(合計)1.75s
-
コーディング
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.27s
応答時間(最大)1.27s
応答時間(合計)1.27s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
データ解析と抽出
: 3.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)1.42s
応答時間(最大)2.21s
応答時間(合計)2.84s
-
ドメイン特化
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)489ms
応答時間(最大)513ms
応答時間(合計)1.47s
-
汎用知能
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
指示追従
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)541ms
応答時間(最大)542ms
応答時間(合計)1.08s
-
パズル解決
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1 指示に従っていない: 1 不正解: 1
応答時間(平均)532ms
応答時間(最大)580ms
応答時間(合計)1.06s
-
ツール呼び出し
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
API エラー: 1
応答時間(平均)0ms
応答時間(最大)0ms
応答時間(合計)0ms
|
| #163#163 |
Granite 4.1 8Bnone
|
4.0… |
IBM Granite |
$0.003
…
|
728ms… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 13 指示に従っていない: 4 余分な書式: 1 無効なツール呼び出し: 1
応答時間(平均)728ms
応答時間(最大)2.17s
応答時間(合計)15.29s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 19
- 試行ごとの合格率
- 9.5%
- 入力トークン
- 46,285
- 出力トークン
- 2,911
- 推論トークン
- 0
- 応答時間(平均)
- 728ms
- 応答時間(合計)
- 15.29s
- 応答時間(最大)
- 2.17s
-
反AIトリック
: 4.9
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)844ms
応答時間(最大)1.91s
応答時間(合計)3.38s
-
コーディング
: 4.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
余分な書式: 1 指示に従っていない: 1 不正解: 1
応答時間(平均)775ms
応答時間(最大)1.07s
応答時間(合計)2.33s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
無効なツール呼び出し: 1
応答時間(平均)1.88s
応答時間(最大)1.88s
応答時間(合計)1.88s
-
データ解析と抽出
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)575ms
応答時間(最大)583ms
応答時間(合計)1.15s
-
ドメイン特化
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)357ms
応答時間(最大)463ms
応答時間(合計)1.07s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)499ms
応答時間(最大)499ms
応答時間(合計)499ms
-
指示追従
: 3.6
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1 不正解: 1
応答時間(平均)344ms
応答時間(最大)358ms
応答時間(合計)687ms
-
パズル解決
: 3.2
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)608ms
応答時間(最大)960ms
応答時間(合計)1.82s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)2.17s
応答時間(最大)2.17s
応答時間(合計)2.17s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)306ms
応答時間(最大)306ms
応答時間(合計)306ms
|
| #155#155 |
Mercury 2none
|
4.5… |
Inception |
$0.011
…
|
653ms… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 16 指示に従っていない: 1
応答時間(平均)653ms
応答時間(最大)1.43s
応答時間(合計)13.72s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 17
- 試行ごとの合格率
- 23.8%
- 入力トークン
- 28,113
- 出力トークン
- 4,439
- 推論トークン
- 0
- 応答時間(平均)
- 653ms
- 応答時間(合計)
- 13.72s
- 応答時間(最大)
- 1.43s
-
反AIトリック
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)483ms
応答時間(最大)716ms
応答時間(合計)1.93s
-
コーディング
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)1.03s
応答時間(最大)1.43s
応答時間(合計)3.10s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)606ms
応答時間(最大)606ms
応答時間(合計)606ms
-
データ解析と抽出
: 7.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)667ms
応答時間(最大)819ms
応答時間(合計)1.33s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)534ms
応答時間(最大)733ms
応答時間(合計)1.60s
-
汎用知能
: 4.8
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
指示に従っていない: 1
応答時間(平均)628ms
応答時間(最大)628ms
応答時間(合計)628ms
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)551ms
応答時間(最大)622ms
応答時間(合計)1.10s
-
パズル解決
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)535ms
応答時間(最大)642ms
応答時間(合計)1.60s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.27s
応答時間(最大)1.27s
応答時間(合計)1.27s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)548ms
応答時間(最大)548ms
応答時間(合計)548ms
|
| #142#142 |
Mistral Small 4none
|
4.9… |
Mistral |
$0.007
…
|
630ms… |
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 15 指示に従っていない: 1
応答時間(平均)630ms
応答時間(最大)1.72s
応答時間(合計)13.22s
…
|
- 合計テスト数
- 21
- 誤答テスト数
- 16
- 試行ごとの合格率
- 27.0%
- 入力トークン
- 37,309
- 出力トークン
- 2,201
- 推論トークン
- 0
- 応答時間(平均)
- 630ms
- 応答時間(合計)
- 13.22s
- 応答時間(最大)
- 1.72s
-
反AIトリック
: 3.4
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 4
応答時間(平均)395ms
応答時間(最大)769ms
応答時間(合計)1.58s
-
コーディング
: 3.7
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 3
応答時間(平均)901ms
応答時間(最大)1.28s
応答時間(合計)2.70s
-
複合
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)1.72s
応答時間(最大)1.72s
応答時間(合計)1.72s
-
データ解析と抽出
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)822ms
応答時間(最大)1.08s
応答時間(合計)1.64s
-
ドメイン特化
: 5.3
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2
応答時間(平均)367ms
応答時間(最大)388ms
応答時間(合計)1.10s
-
汎用知能
: 4.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)729ms
応答時間(最大)729ms
応答時間(合計)729ms
-
指示追従
: 6.5
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)380ms
応答時間(最大)380ms
応答時間(合計)759ms
-
パズル解決
: 3.1
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 2 指示に従っていない: 1
応答時間(平均)399ms
応答時間(最大)570ms
応答時間(合計)1.20s
-
ツール呼び出し
: 10.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
失敗した回答はありません。
応答時間(平均)1.40s
応答時間(最大)1.40s
応答時間(合計)1.40s
-
雑学
: 3.0
テストは、その全実行が合格した場合にのみ完全合格とみなされます。
不正解: 1
応答時間(平均)397ms
応答時間(最大)397ms
応答時間(合計)397ms
|