स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: कुल लागत ↓.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #232 | Trinity Large Thinking medium | Arcee AI | 6.1 | 6.1 | $0.820 | 0/1 | 52.5s |
| #193 | Qwen3.6 35B A3B medium | Qwen | 6.1 | 6.5 | $0.812 | 0/1 | 88.5s |
| #277 | Ember-1 none | Fireworks | 6.1 | 5.4 | $0.786 | 0/1 | 92.9s |
| #159 | Grok 4.6 low | X AI | 5.0 | 6.9 | $0.781 | 0/1 | 58.0s |
| #94 | Gemini 3.8 Flash medium | 2.8 | 8.0 | $0.769 | 0/1 | 63.7s | |
| #19 | GPT-5.6 Sol medium | OpenAI | 10.0 | 9.5 | $0.763 | 1/1 | 57.3s |
| #92 | Nemotron 3 Ultra medium | NVIDIA | 10.0 | 8.0 | $0.762 | 1/1 | 188.1s |
| #12 | GPT-6.1 Sol high | OpenAI | 10.0 | 9.6 | $0.755 | 1/1 | 54.6s |
| #38 | Gemini 3.5 Flash low | 10.0 | 9.0 | $0.752 | 1/1 | 53.7s | |
| #302 | Grok 4.20 Beta medium | X AI | 0.0 | 4.9 | $0.750 | 0/0 | 0ms |
| #84 | GPT-5.6 Terra medium | OpenAI | 10.0 | 8.2 | $0.744 | 1/1 | 54.7s |
| #215 | Gemini 3.1 Flash Lite Preview low | 5.0 | 6.3 | $0.736 | 0/1 | 71.3s | |
| #70 | Muse Glimmer 30B xhigh | Meta | 10.0 | 8.4 | $0.724 | 1/1 | 145.1s |
| #216 | Gemini 3.1 Flash Lite low | 5.0 | 6.3 | $0.717 | 0/1 | 80.0s | |
| #21 | GPT-5.6 Sol high | OpenAI | 10.0 | 9.5 | $0.712 | 1/1 | 60.0s |