Рейтинг Агентные задачи
Посмотрите, какие AI-модели лучше всего справляются с Агентные задачи, какие остаются надежными и где заметнее всего разница. Сортировать по: Общая стоимость ↑.
Показано моделей
15
Среднее значение Оценка Агентные задачи
5.8
Лучшая модель
Space Bunny Alpha 10.0
380/380
Фильтровать модели
Нет моделей, соответствующих текущему поиску и фильтрам.
| Ранг | Модель | Компания | Оценка Агентные задачи | Оценка | Общая стоимость | Тестов верно | Время ответа (среднее) |
|---|---|---|---|---|---|---|---|
| #177 | Qwen3.5-Flash none | Qwen | 10.0 | 6.7 | $0.089 | 1/1 | 53.8s |
| #229 | Gemini 3.1 Flash Lite Preview none | 5.0 | 6.2 | $0.090 | 0/1 | 48.6s | |
| #122 | GPT-5.6 Luna medium | OpenAI | 7.4 | 7.4 | $0.101 | 0/1 | 58.1s |
| #211 | LongCat 2.0 none | Meituan | 6.1 | 6.4 | $0.104 | 0/1 | 81.8s |
| #284 | Qwen3.6 35B A3B none | Qwen | 5.2 | 5.3 | $0.105 | 0/1 | 65.6s |
| #276 | Step 3.5 Flash medium | Stepfun | 2.8 | 5.4 | $0.105 | 0/1 | 172.2s |
| #378 | Gemini 3 Flash Preview high | 10.0 | 1.8 | $0.105 | 1/1 | 52.5s | |
| #346 | Qwen3.5-9B medium | Qwen | 5.2 | 4.0 | $0.106 | 0/1 | 152.9s |
| #324 | Laguna S 2.1 low | Poolside | 2.8 | 4.6 | $0.109 | 0/1 | 152.1s |
| #287 | Nemotron 3.5 Lightning high | NVIDIA | 3.5 | 5.2 | $0.111 | 0/1 | 491.0s |
| #150 | GLM 5.3 FlashX medium | Z.ai | 10.0 | 7.1 | $0.114 | 1/1 | 74.4s |
| #241 | Seed-2.0-Lite none | Bytedance Seed | 5.0 | 6.0 | $0.114 | 0/1 | 76.0s |
| #139 | Qwen3.5-27B none | Qwen | 10.0 | 7.2 | $0.116 | 1/1 | 124.5s |
| #325 | Nemotron 3.5 Lightning low | NVIDIA | 3.5 | 4.6 | $0.117 | 0/1 | 597.6s |
| #164 | Gemma 4 31B medium | 10.0 | 6.9 | $0.117 | 1/1 | 82.1s |