Категория AI BENCHY
Рейтинг Вызов инструментов
Посмотрите, какие AI-модели лучше всего справляются с Вызов инструментов, какие остаются надежными и где заметнее всего разница. Сортировать по: Тестов верно ↓.
Показано моделей
15
Среднее значение Оценка Вызов инструментов
8.7
Лучшая модель
Gemini 3 Flash Preview 10.0| Ранг | Модель | Компания | Оценка Вызов инструментов | Оценка | Тестов верно | Время ответа (среднее) |
|---|---|---|---|---|---|---|
| #93 | GLM 4.7 Flash medium | Z.ai | 10.0 | 4.6 | 1/1 | 15.9s |
| #94 | MiMo-V2-Flash none | Xiaomi | 10.0 | 4.5 | 1/1 | 2.28s |
| #96 | GPT-5.4 Nano none | OpenAI | 10.0 | 4.5 | 1/1 | 3.40s |
| #97 | Qwen3.5-9B medium | Qwen | 10.0 | 4.4 | 1/1 | 4.31s |
| #14 | Gemma 4 31B medium | 3.0 | 8.3 | 0/1 | 0ms | |
| #25 | Grok 4.20 Beta medium | X AI | 3.0 | 8.0 | 0/1 | 12.4s |
| #31 | GLM 5V Turbo medium | Z.ai | 7.0 | 7.8 | 0/1 | 12.5s |
| #33 | GLM 5.1 medium | Z.ai | 3.0 | 7.8 | 0/1 | 0ms |
| #40 | GPT-5.2 medium | OpenAI | 4.7 | 7.5 | 0/1 | 10.3s |
| #44 | GPT-5.4 Mini medium | OpenAI | 4.7 | 7.3 | 0/1 | 9.62s |
| #47 | Grok 4.20 medium | X AI | 3.0 | 7.0 | 0/1 | 13.7s |
| #48 | Gemma 4 31B none | 3.0 | 6.9 | 0/1 | 0ms | |
| #52 | Grok 4.1 Fast medium | X AI | 2.8 | 6.7 | 0/1 | 27.7s |
| #56 | Grok 4.20 Multi Agent Beta medium | X AI | 3.0 | 6.4 | 0/1 | 0ms |
| #74 | GLM 4.7 Flash none | Z.ai | 2.8 | 5.6 | 0/1 | 7.05s |