स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: सही परीक्षण ↓.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #300 | GPT-4o-mini none | OpenAI | 5.0 | 5.0 | $0.024 | 0/1 | 40.0s |
| #301 | KAT Coder AIR V2.5 low | Kwaipilot | 3.0 | 5.0 | $0.046 | 0/1 | 1.08s |
| #302 | Grok 4.20 Beta medium | X AI | 0.0 | 4.9 | $0.750 | 0/0 | 0ms |
| #303 | Inkling Small none | Thinkingmachines | 3.0 | 4.9 | $0.058 | 0/1 | 31ms |
| #304 | Qwen3 Coder Next none | Qwen | 3.9 | 4.9 | $0.065 | 0/1 | 208.4s |
| #305 | Laguna S 2.1 high | Poolside | 2.8 | 4.9 | $0.147 | 0/1 | 158.2s |
| #306 | Gemini 3 PRO Preview medium | 0.0 | 4.9 | $0.385 | 0/0 | 0ms | |
| #307 | Ling 2.6 1t none | Inclusionai | 3.0 | 4.9 | $0.012 | 0/1 | 38ms |
| #308 | MiMo-V2.5 none | Xiaomi | 3.9 | 4.9 | $0.063 | 0/1 | 124.2s |
| #309 | Qwen3.5-9B none | Qwen | 3.9 | 4.9 | $0.041 | 0/1 | 433.0s |
| #310 | Hy4 preview none | Tencent | 5.0 | 4.9 | $0.161 | 0/1 | 65.5s |
| #311 | Mimo V2 Omni medium | Xiaomi | 0.0 | 4.9 | $0.683 | 0/0 | 0ms |
| #312 | Hy3 preview high | Tencent | 0.0 | 4.8 | $0.135 | 0/0 | 0ms |
| #313 | GLM 4.7 Flash none | Z.ai | 5.0 | 4.8 | $0.027 | 0/1 | 80.7s |
| #314 | Mercury 2.5 Preview none | Inception | 3.9 | 4.7 | $0.023 | 0/1 | 85.0s |