エージェントタスク ランキング
エージェントタスク でどのAIモデルが最も強いか、どのモデルが安定しているか、差が大きいのはどこかを確認できます。 並び替え: 合計コスト ↓.
380/380
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | エージェントタスク スコア | スコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #284 | Qwen3.6 35B A3B none | Qwen | 5.2 | 5.3 | $0.105 | 0/1 | 65.6s |
| #211 | LongCat 2.0 none | Meituan | 6.1 | 6.4 | $0.104 | 0/1 | 81.8s |
| #122 | GPT-5.6 Luna medium | OpenAI | 7.4 | 7.4 | $0.101 | 0/1 | 58.1s |
| #229 | Gemini 3.1 Flash Lite Preview none | 5.0 | 6.2 | $0.090 | 0/1 | 48.6s | |
| #177 | Qwen3.5-Flash none | Qwen | 10.0 | 6.7 | $0.089 | 1/1 | 53.8s |
| #117 | Qwen3.8 27B low | Qwen | 6.1 | 7.6 | ~$0.089 | 0/1 | 211.3s |
| #357 | Grok 4.20 Beta none | X AI | 0.0 | 3.6 | $0.087 | 0/0 | 0ms |
| #131 | Gemma 4 26B A4B medium | 10.0 | 7.3 | $0.086 | 1/1 | 107.1s | |
| #132 | GLM 5.3 Flash high | Z.ai | 7.4 | 7.3 | $0.084 | 0/1 | 111.5s |
| #200 | Laguna XS 2.1 medium | Poolside | 6.1 | 6.4 | $0.083 | 0/1 | 66.4s |
| #264 | Nemotron 3 Super medium | NVIDIA | 4.7 | 5.5 | $0.081 | 0/1 | 138.3s |
| #296 | Laguna S 2.1 medium | Poolside | 3.4 | 5.0 | $0.080 | 0/1 | 165.0s |
| #242 | Gemini 3.1 Flash Lite minimal | 5.0 | 5.9 | $0.080 | 0/1 | 50.0s | |
| #368 | Command A+ high | Cohere | 3.9 | 3.2 | $0.079 | 0/1 | 156.0s |
| #288 | KAT Coder AIR V2.5 high | Kwaipilot | 3.0 | 5.2 | $0.077 | 0/1 | 1.10s |