AI Benchy Leaderboard
Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-09-18
Geëvalueerde modellen: 330
Aanbevolen modellen
330/330
Modellen filteren
Geen modellen komen overeen met de huidige zoekopdracht en filters.
| Rang | Model | Score Gemiddelde score over alle benchmarktests. | Bedrijf | Totale kosten | Responstijd (gem.) Responstijd (gem.) | Correcte tests Toont hoeveel tests volledig zijn geslaagd (alle runs geslaagd). |
|---|---|---|---|---|---|---|
| #301#301 | MiniMax M2.5medium | 4.6… | Minimax | $0.327 ↑ … | 69.08s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 7 Time-out: 4 Instructies niet gevolgd: 3 Geen antwoord: 2 Ongeldige toolaanroep: 1 Responstijd (gem.)69.08s Responstijd (max)251.36s Responstijd (totaal)1036.24s … |
Verkeerd antwoord: 7 Time-out: 4 Instructies niet gevolgd: 3 Geen antwoord: 2 Ongeldige toolaanroep: 1
|
||||||
| #302#302 | Laguna S 2.1none | 4.5… | Poolside | $0.022 ↓ … | 11.67s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 18 Instructies niet gevolgd: 1 Geen antwoord: 1 Responstijd (gem.)11.67s Responstijd (max)200.52s Responstijd (totaal)256.71s … |
|
||||||
| #303#303 | Grok 4.20 BetanoneGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests. | 4.4… | X AI | $0.087 ↓ … | 1.19s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 10 Instructies niet gevolgd: 1 Ongeldige toolaanroep: 1 Responstijd (gem.)1.19s Responstijd (max)6.48s Responstijd (totaal)21.43s … |
|
||||||
| #304#304 | Laguna M.1noneGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests. | 4.4… | Poolside | $0.009 ↕ … | 2.89s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 10 API-fout: 4 Ongeldige toolaanroep: 1 Responstijd (gem.)2.89s Responstijd (max)15.42s Responstijd (totaal)43.28s … |
|
||||||
| #305#305 | Elephant AlphanoneGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests. | 4.3… | Openrouter | $0.000 … | 1.22s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 9 API-fout: 3 Instructies niet gevolgd: 3 Ongeldige toolaanroep: 1 Responstijd (gem.)1.22s Responstijd (max)3.81s Responstijd (totaal)22.03s … |
|
||||||
| #306#306 | GLM 4.7 Flashmedium | 4.3… | Z.ai | $0.168 … | 134.34s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 9 Geen antwoord: 3 Instructies niet gevolgd: 2 Ongeldige toolaanroep: 2 Time-out: 2 Responstijd (gem.)134.34s Responstijd (max)1539.97s Responstijd (totaal)2015.13s … |
Verkeerd antwoord: 9 Geen antwoord: 3 Instructies niet gevolgd: 2 Ongeldige toolaanroep: 2 Time-out: 2
|
||||||
| #307#307 | Elephant AlphamediumGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests. | 4.3… | Openrouter | $0.000 … | 1.27s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 9 API-fout: 3 Instructies niet gevolgd: 2 Ongeldige toolaanroep: 1 Responstijd (gem.)1.27s Responstijd (max)3.70s Responstijd (totaal)22.82s … |
|
||||||
| #308#308 | Granite 4.2 8Bnone | 4.3… | IBM Granite | $0.037 ↑ … | 86.27s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 11 Extra opmaak: 4 Time-out: 3 Instructies niet gevolgd: 1 Responstijd (gem.)86.27s Responstijd (max)747.17s Responstijd (totaal)1897.96s … |
|
||||||
| #309#309 | Hunter AlphanoneGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests. | 4.2… | OpenRouter | $0.000 … | 4.70s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 9 Instructies niet gevolgd: 2 API-fout: 1 Responstijd (gem.)4.70s Responstijd (max)15.17s Responstijd (totaal)79.86s … |
|
||||||
| #310#310 | Grok 4.20none54/66 pogingen (Doel: 3 herhalingen per test) | 4.1… | X AI | $0.057 ↓ … | 1.11s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 10 Extra opmaak: 1 Ongeldige toolaanroep: 1 Responstijd (gem.)1.11s Responstijd (max)6.04s Responstijd (totaal)19.96s … |
|
||||||
| #311#311 | Laguna Xs.2mediumGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests. | 4.1… | Poolside | $0.015 ↕ … | 6.73s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 6 API-fout: 4 Geen antwoord: 2 Ongeldige toolaanroep: 1 Responstijd (gem.)6.73s Responstijd (max)29.11s Responstijd (totaal)100.98s … |
|
||||||
| #312#312 | Hy3 previewnoneGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests. | 4.0… | Tencent | $0.007 ↕ … | 12.92s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 8 API-fout: 4 Instructies niet gevolgd: 4 Extra opmaak: 1 Responstijd (gem.)12.92s Responstijd (max)35.84s Responstijd (totaal)232.64s … |
|
||||||
| #313#313 | MiMo-V2-FlashnoneGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests. | 4.0… | Xiaomi | $0.025 ↑ … | 2.76s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 13 Instructies niet gevolgd: 2 API-fout: 1 Extra opmaak: 1 Responstijd (gem.)2.76s Responstijd (max)19.68s Responstijd (totaal)46.99s … |
|
||||||
| #314#314 | Ling 3.0 Tinynone | 4.0… | Inclusionai | $0.000 … | 14.02s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 13 Instructies niet gevolgd: 4 API-fout: 1 Extra opmaak: 1 Ongeldige toolaanroep: 1 Responstijd (gem.)14.02s Responstijd (max)240.61s Responstijd (totaal)294.46s … |
Verkeerd antwoord: 13 Instructies niet gevolgd: 4 API-fout: 1 Extra opmaak: 1 Ongeldige toolaanroep: 1
|
||||||
| #315#315 | Granite 4.1 8Bnone | 4.0… | IBM Granite | $0.007 … | 1.44s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 13 Instructies niet gevolgd: 4 Ongeldige toolaanroep: 2 Extra opmaak: 1 Responstijd (gem.)1.44s Responstijd (max)16.67s Responstijd (totaal)31.75s … |
|
||||||
| #316#316 | Nemotron 3.5 Lightningnone | 4.0… | NVIDIA | $0.007 ↕ … | 1.21s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 16 Ongeldige toolaanroep: 2 Instructies niet gevolgd: 1 Responstijd (gem.)1.21s Responstijd (max)6.30s Responstijd (totaal)26.62s … |
|
||||||
| #317#317 | Grok Build 0.1noneGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests. | 4.0… | X AI | $0.547 … | 28.69s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 7 API-fout: 3 Instructies niet gevolgd: 2 Responstijd (gem.)28.69s Responstijd (max)138.35s Responstijd (totaal)459.00s … |
|
||||||
| #318#318 | Mercury 2.5none | 3.9… | Inception | $0.016 … | 2.45s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 14 Instructies niet gevolgd: 4 Extra opmaak: 1 Ongeldige toolaanroep: 1 Responstijd (gem.)2.45s Responstijd (max)36.48s Responstijd (totaal)53.83s … |
|
||||||
| #319#319 | Ling 3.0 Tinyhigh | 3.8… | Inclusionai | $0.000 … | 75.68s… | Een test is alleen volledig geslaagd als alle runs slagen. Geen antwoord: 7 Verkeerd antwoord: 6 Instructies niet gevolgd: 3 API-fout: 1 Ongeldige toolaanroep: 1 Responstijd (gem.)75.68s Responstijd (max)345.15s Responstijd (totaal)1589.20s … |
Geen antwoord: 7 Verkeerd antwoord: 6 Instructies niet gevolgd: 3 API-fout: 1 Ongeldige toolaanroep: 1
|
||||||
| #320#320 | Ling 3.0 Tinylow | 3.8… | Inclusionai | $0.000 … | 66.16s… | Een test is alleen volledig geslaagd als alle runs slagen. Geen antwoord: 7 Verkeerd antwoord: 5 Instructies niet gevolgd: 4 API-fout: 1 Ongeldige toolaanroep: 1 Responstijd (gem.)66.16s Responstijd (max)252.08s Responstijd (totaal)1389.33s … |
Geen antwoord: 7 Verkeerd antwoord: 5 Instructies niet gevolgd: 4 API-fout: 1 Ongeldige toolaanroep: 1
|
||||||
| #321#321 | Grok 4.1 FastnoneGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests. | 3.8… | X AI | $0.008 ↓ … | 1.62s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 13 Instructies niet gevolgd: 3 Responstijd (gem.)1.62s Responstijd (max)5.51s Responstijd (totaal)19.48s … |
|
||||||
| #322#322 | Qwen3.5-9Bmedium | 3.8… | Qwen | $0.062 ↑ … | 107.51s… | Een test is alleen volledig geslaagd als alle runs slagen. Time-out: 11 Geen antwoord: 3 Verkeerd antwoord: 2 API-fout: 1 Extra opmaak: 1 Instructies niet gevolgd: 1 Responstijd (gem.)107.51s Responstijd (max)569.97s Responstijd (totaal)1720.15s … |
Time-out: 11 Geen antwoord: 3 Verkeerd antwoord: 2 API-fout: 1 Extra opmaak: 1 Instructies niet gevolgd: 1
|
||||||
| #323#323 | Ling 3.0 Tinymedium | 3.8… | Inclusionai | $0.000 … | 68.08s… | Een test is alleen volledig geslaagd als alle runs slagen. Geen antwoord: 7 Verkeerd antwoord: 5 Instructies niet gevolgd: 4 API-fout: 1 Ongeldige toolaanroep: 1 Responstijd (gem.)68.08s Responstijd (max)262.20s Responstijd (totaal)1429.66s … |
Geen antwoord: 7 Verkeerd antwoord: 5 Instructies niet gevolgd: 4 API-fout: 1 Ongeldige toolaanroep: 1
|
||||||
| #324#324 | Laguna Xs.2noneGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests. | 3.8… | Poolside | $0.004 ↕ … | 806ms… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 8 API-fout: 4 Instructies niet gevolgd: 1 Ongeldige toolaanroep: 1 Responstijd (gem.)806ms Responstijd (max)2.01s Responstijd (totaal)12.09s … |
|
||||||
| #325#325 | gpt-oss-120bnone57/66 pogingen (Doel: 3 herhalingen per test) | 3.7… | OpenAI | $0.033 ↑ … | 21.61s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 8 API-fout: 3 Instructies niet gevolgd: 2 Responstijd (gem.)21.61s Responstijd (max)113.71s Responstijd (totaal)345.79s … |
|
||||||
Wereldwijde benchmarktrends
Bekijk hoe huidige modellen score, kosten, snelheid, uitvoerlengte en prestaties per categorie afwegen.
Ontwikkeling van de beste score van toonaangevende bedrijven
Paretofront: intelligentie vs reactiesnelheid
Paretofront: score vs uitvoertokens
Moeilijkheid per categorie over alle modellen
Snelle vergelijking
Gemini 3.6 FlashhighvsGemini 3.8 FlashhighGemini 3.8 FlashhighvsGPT-6 AstramaxGPT-6 AstramaxvsGPT-6 AstrahighGPT-6 AstrahighvsGPT-6 AstraxhighGPT-6 AstraxhighvsGemini 3.7 FlashhighGemini 3.7 FlashhighvsGemini 3.6 FlashmediumGemini 3.6 FlashmediumvsGPT-5.6 SollowGPT-5.6 SollowvsGPT-6 AstralowGPT-6 AstralowvsGemini 3 Flash PreviewmediumGemini 3 Flash PreviewmediumvsGemini 3.5 FlashhighGemini 3.5 FlashhighvsGemini 3.7 FlashmediumGemini 3.7 FlashmediumvsGPT-5.6 Solmedium