AI BENCHY Categorie
Toolaanroepen-ranglijst
Zie welke AI-modellen het best presteren op Toolaanroepen, welke betrouwbaar blijven en waar de grootste verschillen zitten. Sorteren op: Totale kosten โ.
169/169
Modellen filteren
Geen modellen komen overeen met de huidige zoekopdracht en filters.
| Rang | Model | Bedrijf | Toolaanroepen-score | Score | Totale kosten | Correcte tests | Responstijd (gem.) |
|---|---|---|---|---|---|---|---|
| #95 | Gemini 3.1 Flash Lite Preview high | 10.0 | 6.1 | $2.310 | 1/1 | 7.73s | |
| #6 | Claude Fable 5 medium | Anthropic | 10.0 | 9.2 | $3.165 | 1/1 | 17.0s |
| #9 | GPT-5.5 medium | OpenAI | 10.0 | 9.0 | $3.679 | 1/1 | 10.6s |
| #136 | Grok 4.20 Multi Agent Beta medium | X AI | 3.0 | 5.0 | $5.599 | 0/1 | 0ms |