स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: कुल लागत ↓.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #198 | KAT-Coder-Pro V2.5 high | Kwaipilot | 3.0 | 6.5 | $0.506 | 0/1 | 1.52s |
| #271 | Claude Opus 4.7 none | Anthropic | 0.0 | 5.4 | $0.505 | 0/0 | 0ms |
| #208 | MiMo-V2.5-Pro medium | Xiaomi | 4.7 | 6.4 | $0.502 | 0/1 | 233.5s |
| #188 | LongCat 2.0 low | Meituan | 6.1 | 6.6 | $0.495 | 0/1 | 145.6s |
| #100 | Qwen3.7 Max none | Qwen | 10.0 | 7.9 | $0.492 | 1/1 | 80.3s |
| #113 | Qwen3.5 Plus 2026-04-20 medium | Qwen | 10.0 | 7.7 | $0.488 | 1/1 | 203.0s |
| #236 | KAT-Coder-Pro V2.5 none | Kwaipilot | 3.0 | 6.1 | $0.487 | 0/1 | 1.90s |
| #226 | KAT-Coder-Pro V2.5 medium | Kwaipilot | 3.0 | 6.2 | $0.478 | 0/1 | 3.38s |
| #58 | GPT-6 Sol low | OpenAI | 10.0 | 8.7 | $0.477 | 1/1 | 48.4s |
| #183 | GPT-5.6 Sol none | OpenAI | 5.0 | 6.7 | $0.472 | 0/1 | 58.3s |
| #196 | GLM 5.3 low | Z.ai | 5.2 | 6.5 | $0.471 | 0/1 | 48.8s |
| #110 | DeepSeek V4 Flash 0731 medium | DeepSeek | 10.0 | 7.8 | $0.462 | 1/1 | 303.3s |
| #16 | GPT-6.1 Sol low | OpenAI | 10.0 | 9.6 | $0.460 | 1/1 | 46.6s |
| #269 | GLM 5V Turbo medium | Z.ai | 0.0 | 5.5 | $0.457 | 0/0 | 0ms |
| #147 | Step 3.7 Flash low | Stepfun | 7.4 | 7.2 | $0.449 | 0/1 | 83.6s |