Classement Tâches agentiques
Voyez quels modèles d'IA réussissent le mieux sur Tâches agentiques, lesquels restent fiables et où les écarts sont les plus marqués. Trier par: Coût total ↑.
380/380
Filtrer les modèles
Aucun modèle ne correspond à la recherche et aux filtres actuels.
| Rang | Modèle | Entreprise | Score Tâches agentiques | Score | Coût total | Tests corrects | Temps de réponse (moy.) |
|---|---|---|---|---|---|---|---|
| #157 | Ember-1 low | Fireworks | 4.7 | 7.0 | $1.488 | 0/1 | 121.3s |
| #1 | Gemini 3.6 Flash high | 10.0 | 9.9 | $1.512 | 1/1 | 65.6s | |
| #60 | Claude Sonnet 5.5 xhigh | Anthropic | 10.0 | 8.6 | $1.516 | 1/1 | 54.9s |
| #34 | Pareto none | Unbiased | 10.0 | 9.1 | $1.520 | 1/1 | 76.5s |
| #53 | GPT-5.2 medium | OpenAI | 10.0 | 8.7 | $1.540 | 1/1 | 75.9s |
| #224 | Grok 4.20 medium | X AI | 3.0 | 6.3 | $1.582 | 0/1 | 128.3s |
| #71 | Gemini 3.1 Pro Preview medium | 4.7 | 8.4 | $1.585 | 0/1 | 56.2s | |
| #43 | Muse Spark 1.2 medium | Meta | 10.0 | 8.9 | $1.590 | 1/1 | 56.7s |
| #75 | GLM 5.2 high | Z.ai | 10.0 | 8.4 | $1.620 | 1/1 | 52.4s |
| #26 | Seed 2.1 Turbo low | Bytedance Seed | 10.0 | 9.3 | $1.645 | 1/1 | 102.8s |
| #44 | Muse Spark 1.1 medium | Meta | 10.0 | 8.9 | $1.665 | 1/1 | 43.9s |
| #274 | Hy4 preview low | Tencent | 4.7 | 5.4 | $1.670 | 0/1 | 52.4s |
| #38 | Muse Spark 1.3 medium | Meta | 10.0 | 9.0 | $1.712 | 1/1 | 67.6s |
| #23 | Claude Opus 5.5 low | Anthropic | 10.0 | 9.4 | $1.733 | 1/1 | 68.9s |
| #225 | Gemini 3.5 Flash none | 3.5 | 6.3 | $1.778 | 0/1 | 89.3s |