स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: कुल लागत ↑.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #237 | Claude Sonnet 4.6 none | Anthropic | 0.0 | 6.0 | $0.661 | 0/0 | 0ms |
| #311 | Mimo V2 Omni medium | Xiaomi | 0.0 | 4.9 | $0.683 | 0/0 | 0ms |
| #260 | GPT-5.4 none | OpenAI | 5.0 | 5.6 | $0.690 | 0/1 | 43.7s |
| #222 | Trinity Large Thinking low | Arcee AI | 7.4 | 6.3 | $0.700 | 0/1 | 63.2s |
| #18 | GPT-6 Sol medium | OpenAI | 10.0 | 9.5 | $0.703 | 1/1 | 51.5s |
| #21 | GPT-5.6 Sol high | OpenAI | 10.0 | 9.5 | $0.712 | 1/1 | 60.0s |
| #216 | Gemini 3.1 Flash Lite low | 5.0 | 6.3 | $0.717 | 0/1 | 80.0s | |
| #70 | Muse Glimmer 30B xhigh | Meta | 10.0 | 8.4 | $0.724 | 1/1 | 145.1s |
| #215 | Gemini 3.1 Flash Lite Preview low | 5.0 | 6.3 | $0.736 | 0/1 | 71.3s | |
| #84 | GPT-5.6 Terra medium | OpenAI | 10.0 | 8.2 | $0.744 | 1/1 | 54.7s |
| #302 | Grok 4.20 Beta medium | X AI | 0.0 | 4.9 | $0.750 | 0/0 | 0ms |
| #38 | Gemini 3.5 Flash low | 10.0 | 9.0 | $0.752 | 1/1 | 53.7s | |
| #12 | GPT-6.1 Sol high | OpenAI | 10.0 | 9.6 | $0.755 | 1/1 | 54.6s |
| #92 | Nemotron 3 Ultra medium | NVIDIA | 10.0 | 8.0 | $0.762 | 1/1 | 188.1s |
| #19 | GPT-5.6 Sol medium | OpenAI | 10.0 | 9.5 | $0.763 | 1/1 | 57.3s |