AI Benchy Leaderboard
Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-09-02
Geëvalueerde modellen: 305
Aanbevolen modellen
305/305
Modellen filteren
Geen modellen komen overeen met de huidige zoekopdracht en filters.
| Rang | Model | Score Gemiddelde score over alle benchmarktests. | Bedrijf | Totale kosten | Responstijd (gem.) Responstijd (gem.) | Correcte tests Toont hoeveel tests volledig zijn geslaagd (alle runs geslaagd). |
|---|---|---|---|---|---|---|
| #305#305 | LFM2-24B-A2BnoneGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests. | 2.2… | Liquid | $0.001 … | 782ms… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 9 API-fout: 4 Instructies niet gevolgd: 1 Responstijd (gem.)782ms Responstijd (max)3.15s Responstijd (totaal)10.94s … |
|
||||||
| #303#303 | Nemotron 3 Nano Omni 30b A3b ReasoningnoneGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests. | 3.2… | NVIDIA | $0.000 … | 728ms… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 9 API-fout: 6 Instructies niet gevolgd: 2 Responstijd (gem.)728ms Responstijd (max)2.21s Responstijd (totaal)9.47s … |
|
||||||
| #279#279 | Laguna S 2.1none | 4.5… | Poolside | $0.022 ↓ … | 11.67s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 18 Instructies niet gevolgd: 1 Geen antwoord: 1 Responstijd (gem.)11.67s Responstijd (max)200.52s Responstijd (totaal)256.71s … |
|
||||||
| #291#291 | Ling 3.0 Tinynone | 4.0… | Inclusionai | $0.000 … | 14.02s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 13 Instructies niet gevolgd: 4 API-fout: 1 Extra opmaak: 1 Ongeldige toolaanroep: 1 Responstijd (gem.)14.02s Responstijd (max)240.61s Responstijd (totaal)294.46s … |
Verkeerd antwoord: 13 Instructies niet gevolgd: 4 API-fout: 1 Extra opmaak: 1 Ongeldige toolaanroep: 1
|
||||||
| #292#292 | Granite 4.1 8Bnone | 4.0… | IBM Granite | $0.007 … | 1.44s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 13 Instructies niet gevolgd: 4 Ongeldige toolaanroep: 2 Extra opmaak: 1 Responstijd (gem.)1.44s Responstijd (max)16.67s Responstijd (totaal)31.75s … |
|
||||||
Wereldwijde benchmarktrends
Bekijk hoe huidige modellen score, kosten, snelheid, uitvoerlengte en prestaties per categorie afwegen.
Ontwikkeling van de beste score van toonaangevende bedrijven
Paretofront: intelligentie vs reactiesnelheid
Paretofront: score vs uitvoertokens
Moeilijkheid per categorie over alle modellen
Snelle vergelijking
Gemini 3.6 FlashhighvsGemini 3.7 FlashhighGemini 3.7 FlashhighvsGemini 3.6 FlashmediumGemini 3.6 FlashmediumvsGPT-5.6 SollowGPT-5.6 SollowvsGemini 3 Flash PreviewmediumGemini 3 Flash PreviewmediumvsGemini 3.5 FlashhighGemini 3.5 FlashhighvsGemini 3.7 FlashmediumGemini 3.7 FlashmediumvsGPT-5.6 SolmediumGPT-5.6 SolmediumvsGPT-5.6 SolhighGPT-5.6 SolhighvsGPT-5.5lowGPT-5.5lowvsGrok 4.6highGrok 4.6highvsGemini 3.1 Pro PreviewmediumGemini 3.1 Pro PreviewmediumvsGemini 3.7 Flashlow