エージェントタスク ランキング
エージェントタスク でどのAIモデルが最も強いか、どのモデルが安定しているか、差が大きいのはどこかを確認できます。 並び替え: 正解テスト ↑.
380/380
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | エージェントタスク スコア | スコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #172 | GPT-6 Sol none | OpenAI | 5.0 | 6.8 | $0.551 | 0/1 | 57.0s |
| #173 | Space Bunny Alpha max | Stealth | 6.1 | 6.7 | $0.000 | 0/1 | 90.6s |
| #174 | Solar Pro 4 xhigh | Upstage | 3.0 | 6.7 | $0.167 | 0/1 | 316.6s |
| #175 | Grok 4.7 xhigh | X AI | 3.0 | 6.7 | $4.054 | 0/1 | 304.8s |
| #176 | Grok Build 0.1 medium | X AI | 3.4 | 6.7 | $1.419 | 0/1 | 69.0s |
| #178 | Solar Pro 4 low | Upstage | 6.1 | 6.7 | $0.174 | 0/1 | 345.4s |
| #179 | Grok 4.7 high | X AI | 3.0 | 6.7 | $3.582 | 0/1 | 322.2s |
| #180 | MiniMax M3 medium | Minimax | 3.0 | 6.7 | $0.372 | 0/1 | 116.5s |
| #182 | GPT 5.3 Chat none | OpenAI | 3.0 | 6.7 | $0.533 | 0/1 | 955ms |
| #183 | GPT-5.6 Sol none | OpenAI | 5.0 | 6.7 | $0.472 | 0/1 | 58.3s |
| #185 | GPT-5.5 none | OpenAI | 5.0 | 6.6 | $1.212 | 0/1 | 57.5s |
| #186 | Qwen3.7 Flash medium | Qwen | 5.2 | 6.6 | $0.076 | 0/1 | 149.0s |
| #187 | LongCat 2.0 low | Meituan | 6.1 | 6.6 | $0.495 | 0/1 | 145.6s |
| #188 | Mercury 2 medium | Inception | 4.7 | 6.6 | $0.121 | 0/1 | 34.9s |
| #189 | Step 3.7 Flash high | Stepfun | 5.4 | 6.6 | $1.350 | 0/1 | 130.4s |