AI Benchy Leaderboard
Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-09-02
Geëvalueerde modellen: 305
Aanbevolen modellen
305/305
Modellen filteren
Geen modellen komen overeen met de huidige zoekopdracht en filters.
| Rang | Model | Score Gemiddelde score over alle benchmarktests. | Bedrijf | Totale kosten | Responstijd (gem.) Responstijd (gem.) | Correcte tests Toont hoeveel tests volledig zijn geslaagd (alle runs geslaagd). |
|---|---|---|---|---|---|---|
| #227#227 | DeepSeek V4 Flash 0423none | 5.4… | DeepSeek | $0.040 ↓ … | 36.17s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 13 Extra opmaak: 2 Ongeldige toolaanroep: 2 Instructies niet gevolgd: 1 Responstijd (gem.)36.17s Responstijd (max)247.27s Responstijd (totaal)795.83s … |
|
||||||
| #228#228 | Laguna S 2.1medium | 5.4… | Poolside | $0.053 ↓ … | 58.42s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 13 Ongeldige toolaanroep: 2 Geen antwoord: 2 Instructies niet gevolgd: 1 Responstijd (gem.)58.42s Responstijd (max)560.31s Responstijd (totaal)1285.26s … |
|
||||||
| #233#233 | DeepSeek V4 Flash 0731none | 5.4… | DeepSeek | $0.011 ↓ … | 20.72s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 13 Instructies niet gevolgd: 2 Ongeldige toolaanroep: 2 Extra opmaak: 1 Responstijd (gem.)20.72s Responstijd (max)387.15s Responstijd (totaal)455.81s … |
|
||||||
| #234#234 | Laguna S 2.1high | 5.4… | Poolside | $0.114 ↓ … | 111.60s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 11 Ongeldige toolaanroep: 2 Geen antwoord: 2 API-fout: 1 Extra opmaak: 1 Instructies niet gevolgd: 1 Responstijd (gem.)111.60s Responstijd (max)1190.11s Responstijd (totaal)2455.24s … |
Verkeerd antwoord: 11 Ongeldige toolaanroep: 2 Geen antwoord: 2 API-fout: 1 Extra opmaak: 1 Instructies niet gevolgd: 1
|
||||||
| #238#238 | Ling-2.6-1Tnone | 5.3… | Inclusionai | $0.016 ↑ … | 8.59s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 12 API-fout: 3 Instructies niet gevolgd: 2 Ongeldige toolaanroep: 1 Responstijd (gem.)8.59s Responstijd (max)25.72s Responstijd (totaal)163.20s … |
|
||||||
| #240#240 | Qwen3.6 35B A3Bnone | 5.3… | Qwen | $0.051 ↓ … | 5.57s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 13 API-fout: 2 Instructies niet gevolgd: 2 Geen antwoord: 1 Responstijd (gem.)5.57s Responstijd (max)39.54s Responstijd (totaal)111.32s … |
|
||||||
| #250#250 | Qwen3.5-9Bnone | 5.1… | Qwen | $0.021 ↑ … | 19.19s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 14 Instructies niet gevolgd: 2 Ongeldige toolaanroep: 2 Responstijd (gem.)19.19s Responstijd (max)382.06s Responstijd (totaal)422.25s … |
|
||||||
| #252#252 | North Mini Codenone60/66 pogingen (Doel: 3 herhalingen per test) | 5.1… | Cohere | $0.000 … | 29.95s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 12 Extra opmaak: 2 Instructies niet gevolgd: 2 Ongeldige toolaanroep: 2 Responstijd (gem.)29.95s Responstijd (max)159.85s Responstijd (totaal)658.83s … |
|
||||||
| #259#259 | Mercury 2.5 Previewnone | 4.9… | Inception | $0.018 … | 3.51s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 16 Instructies niet gevolgd: 1 Ongeldige toolaanroep: 1 Responstijd (gem.)3.51s Responstijd (max)60.70s Responstijd (totaal)77.28s … |
|
||||||
| #265#265 | GPT-5.4 Nanonone | 4.8… | OpenAI | $0.041 … | 2.56s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 15 Instructies niet gevolgd: 2 Geen antwoord: 1 Responstijd (gem.)2.56s Responstijd (max)25.50s Responstijd (totaal)56.37s … |
|
||||||
| #275#275 | Mercury 2none | 4.7… | Inception | $0.030 … | 825ms… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 17 Instructies niet gevolgd: 1 Responstijd (gem.)825ms Responstijd (max)4.52s Responstijd (totaal)18.14s … |
|
||||||
| #276#276 | Granite 4.2 8Bhigh | 4.6… | IBM Granite | $0.084 … | 235.89s… | Een test is alleen volledig geslaagd als alle runs slagen. Time-out: 10 Verkeerd antwoord: 6 Ongeldige toolaanroep: 1 Geen antwoord: 1 Responstijd (gem.)235.89s Responstijd (max)685.87s Responstijd (totaal)5189.64s … |
|
||||||
| #283#283 | GLM 4.7 Flashmedium | 4.3… | Z.ai | $0.168 … | 134.34s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 9 Geen antwoord: 3 Instructies niet gevolgd: 2 Ongeldige toolaanroep: 2 Time-out: 2 Responstijd (gem.)134.34s Responstijd (max)1539.97s Responstijd (totaal)2015.13s … |
Verkeerd antwoord: 9 Geen antwoord: 3 Instructies niet gevolgd: 2 Ongeldige toolaanroep: 2 Time-out: 2
|
||||||
| #295#295 | Ling 3.0 Tinyhigh | 3.8… | Inclusionai | $0.000 … | 75.68s… | Een test is alleen volledig geslaagd als alle runs slagen. Geen antwoord: 7 Verkeerd antwoord: 6 Instructies niet gevolgd: 3 API-fout: 1 Ongeldige toolaanroep: 1 Responstijd (gem.)75.68s Responstijd (max)345.15s Responstijd (totaal)1589.20s … |
Geen antwoord: 7 Verkeerd antwoord: 6 Instructies niet gevolgd: 3 API-fout: 1 Ongeldige toolaanroep: 1
|
||||||
| #296#296 | Ling 3.0 Tinylow | 3.8… | Inclusionai | $0.000 … | 66.16s… | Een test is alleen volledig geslaagd als alle runs slagen. Geen antwoord: 7 Verkeerd antwoord: 5 Instructies niet gevolgd: 4 API-fout: 1 Ongeldige toolaanroep: 1 Responstijd (gem.)66.16s Responstijd (max)252.08s Responstijd (totaal)1389.33s … |
Geen antwoord: 7 Verkeerd antwoord: 5 Instructies niet gevolgd: 4 API-fout: 1 Ongeldige toolaanroep: 1
|
||||||
| #299#299 | Ling 3.0 Tinymedium | 3.8… | Inclusionai | $0.000 … | 68.08s… | Een test is alleen volledig geslaagd als alle runs slagen. Geen antwoord: 7 Verkeerd antwoord: 5 Instructies niet gevolgd: 4 API-fout: 1 Ongeldige toolaanroep: 1 Responstijd (gem.)68.08s Responstijd (max)262.20s Responstijd (totaal)1429.66s … |
Geen antwoord: 7 Verkeerd antwoord: 5 Instructies niet gevolgd: 4 API-fout: 1 Ongeldige toolaanroep: 1
|
||||||
| #297#297 | Grok 4.1 FastnoneGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests. | 3.8… | X AI | $0.008 ↓ … | 1.62s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 13 Instructies niet gevolgd: 3 Responstijd (gem.)1.62s Responstijd (max)5.51s Responstijd (totaal)19.48s … |
|
||||||
| #222#222 | Hy4 previewlow | 5.6… | Tencent | $1.745 … | 214.25s… | Een test is alleen volledig geslaagd als alle runs slagen. API-fout: 14 Verkeerd antwoord: 3 Instructies niet gevolgd: 1 Geen antwoord: 1 Responstijd (gem.)214.25s Responstijd (max)597.45s Responstijd (totaal)4713.56s … |
|
||||||
| #241#241 | Dots 3 Note Previewnone | 5.2… | Dots Studio | $0.000 … | 3.53s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 15 Instructies niet gevolgd: 2 Extra opmaak: 1 Ongeldige toolaanroep: 1 Responstijd (gem.)3.53s Responstijd (max)24.48s Responstijd (totaal)77.68s … |
|
||||||
| #255#255 | Laguna S 2.1low | 5.0… | Poolside | $0.082 ↓ … | 85.34s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 15 API-fout: 1 Extra opmaak: 1 Instructies niet gevolgd: 1 Ongeldige toolaanroep: 1 Responstijd (gem.)85.34s Responstijd (max)814.73s Responstijd (totaal)1877.49s … |
Verkeerd antwoord: 15 API-fout: 1 Extra opmaak: 1 Instructies niet gevolgd: 1 Ongeldige toolaanroep: 1
|
||||||
| #262#262 | Hy4 previewnone | 4.8… | Tencent | $0.041 … | 39.24s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 9 API-fout: 7 Instructies niet gevolgd: 2 Extra opmaak: 1 Responstijd (gem.)39.24s Responstijd (max)95.32s Responstijd (totaal)863.30s … |
|
||||||
| #277#277 | Qwen3 Coder Nextmedium | 4.6… | Qwen | $0.034 ↑ … | 9.07s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 14 Instructies niet gevolgd: 3 Geen antwoord: 1 Time-out: 1 Responstijd (gem.)9.07s Responstijd (max)81.80s Responstijd (totaal)154.19s … |
|
||||||
| #285#285 | Granite 4.2 8Bnone | 4.3… | IBM Granite | $0.026 … | 86.27s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 11 Extra opmaak: 4 Time-out: 3 Instructies niet gevolgd: 1 Responstijd (gem.)86.27s Responstijd (max)747.17s Responstijd (totaal)1897.96s … |
|
||||||
| #293#293 | Nemotron 3.5 Lightningnone | 4.0… | NVIDIA | $0.007 ↕ … | 1.21s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 16 Ongeldige toolaanroep: 2 Instructies niet gevolgd: 1 Responstijd (gem.)1.21s Responstijd (max)6.30s Responstijd (totaal)26.62s … |
|
||||||
| #298#298 | Qwen3.5-9Bmedium | 3.8… | Qwen | $0.062 ↑ … | 107.51s… | Een test is alleen volledig geslaagd als alle runs slagen. Time-out: 11 Geen antwoord: 3 Verkeerd antwoord: 2 API-fout: 1 Extra opmaak: 1 Instructies niet gevolgd: 1 Responstijd (gem.)107.51s Responstijd (max)569.97s Responstijd (totaal)1720.15s … |
Time-out: 11 Geen antwoord: 3 Verkeerd antwoord: 2 API-fout: 1 Extra opmaak: 1 Instructies niet gevolgd: 1
|
||||||
Wereldwijde benchmarktrends
Bekijk hoe huidige modellen score, kosten, snelheid, uitvoerlengte en prestaties per categorie afwegen.
Ontwikkeling van de beste score van toonaangevende bedrijven
Paretofront: intelligentie vs reactiesnelheid
Paretofront: score vs uitvoertokens
Moeilijkheid per categorie over alle modellen
Snelle vergelijking
Gemini 3.6 FlashhighvsGemini 3.7 FlashhighGemini 3.7 FlashhighvsGemini 3.6 FlashmediumGemini 3.6 FlashmediumvsGPT-5.6 SollowGPT-5.6 SollowvsGemini 3 Flash PreviewmediumGemini 3 Flash PreviewmediumvsGemini 3.5 FlashhighGemini 3.5 FlashhighvsGemini 3.7 FlashmediumGemini 3.7 FlashmediumvsGPT-5.6 SolmediumGPT-5.6 SolmediumvsGPT-5.6 SolhighGPT-5.6 SolhighvsGPT-5.5lowGPT-5.5lowvsGrok 4.6highGrok 4.6highvsGemini 3.1 Pro PreviewmediumGemini 3.1 Pro PreviewmediumvsGemini 3.7 Flashlow