स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: सही परीक्षण ↑.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #295 | MiMo-V2.5-Pro none | Xiaomi | 3.9 | 5.1 | $0.157 | 0/1 | 49.6s |
| #296 | Laguna S 2.1 medium | Poolside | 3.4 | 5.0 | $0.080 | 0/1 | 165.0s |
| #297 | Mercury 2.5 Preview low | Inception | 5.0 | 5.0 | $0.015 | 0/1 | 84.5s |
| #298 | MiniMax M2.7 medium | Minimax | 4.7 | 5.0 | $0.202 | 0/1 | 198.8s |
| #299 | Dots 3 Note Preview none | Dots Studio | 3.9 | 5.0 | $0.000 | 0/1 | 45.7s |
| #300 | GPT-4o-mini none | OpenAI | 5.0 | 5.0 | $0.024 | 0/1 | 40.0s |
| #301 | KAT Coder AIR V2.5 low | Kwaipilot | 3.0 | 5.0 | $0.046 | 0/1 | 1.08s |
| #302 | Grok 4.20 Beta medium | X AI | 0.0 | 4.9 | $0.750 | 0/0 | 0ms |
| #303 | Inkling Small none | Thinkingmachines | 3.0 | 4.9 | $0.058 | 0/1 | 31ms |
| #304 | Qwen3 Coder Next none | Qwen | 3.9 | 4.9 | $0.065 | 0/1 | 208.4s |
| #305 | Laguna S 2.1 high | Poolside | 2.8 | 4.9 | $0.147 | 0/1 | 158.2s |
| #306 | Gemini 3 PRO Preview medium | 0.0 | 4.9 | $0.385 | 0/0 | 0ms | |
| #307 | Ling 2.6 1t none | Inclusionai | 3.0 | 4.9 | $0.012 | 0/1 | 38ms |
| #308 | MiMo-V2.5 none | Xiaomi | 3.9 | 4.9 | $0.063 | 0/1 | 124.2s |
| #309 | Qwen3.5-9B none | Qwen | 3.9 | 4.9 | $0.041 | 0/1 | 433.0s |