स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: कुल लागत ↓.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #284 | Qwen3.6 35B A3B none | Qwen | 5.2 | 5.3 | $0.105 | 0/1 | 65.6s |
| #211 | LongCat 2.0 none | Meituan | 6.1 | 6.4 | $0.104 | 0/1 | 81.8s |
| #122 | GPT-5.6 Luna medium | OpenAI | 7.4 | 7.4 | $0.101 | 0/1 | 58.1s |
| #229 | Gemini 3.1 Flash Lite Preview none | 5.0 | 6.2 | $0.090 | 0/1 | 48.6s | |
| #177 | Qwen3.5-Flash none | Qwen | 10.0 | 6.7 | $0.089 | 1/1 | 53.8s |
| #117 | Qwen3.8 27B low | Qwen | 6.1 | 7.6 | ~$0.089 | 0/1 | 211.3s |
| #357 | Grok 4.20 Beta none | X AI | 0.0 | 3.6 | $0.087 | 0/0 | 0ms |
| #131 | Gemma 4 26B A4B medium | 10.0 | 7.3 | $0.086 | 1/1 | 107.1s | |
| #132 | GLM 5.3 Flash high | Z.ai | 7.4 | 7.3 | $0.084 | 0/1 | 111.5s |
| #200 | Laguna XS 2.1 medium | Poolside | 6.1 | 6.4 | $0.083 | 0/1 | 66.4s |
| #264 | Nemotron 3 Super medium | NVIDIA | 4.7 | 5.5 | $0.081 | 0/1 | 138.3s |
| #296 | Laguna S 2.1 medium | Poolside | 3.4 | 5.0 | $0.080 | 0/1 | 165.0s |
| #242 | Gemini 3.1 Flash Lite minimal | 5.0 | 5.9 | $0.080 | 0/1 | 50.0s | |
| #368 | Command A+ high | Cohere | 3.9 | 3.2 | $0.079 | 0/1 | 156.0s |
| #288 | KAT Coder AIR V2.5 high | Kwaipilot | 3.0 | 5.2 | $0.077 | 0/1 | 1.10s |