AI Benchy Leaderboard
Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-08-15
Geëvalueerde modellen: 287
Aanbevolen modellen
287/287
Modellen filteren
Geen modellen komen overeen met de huidige zoekopdracht en filters.
| Rang | Model | Score Gemiddelde score over alle benchmarktests. | Bedrijf | Totale kosten | Responstijd (gem.) Responstijd (gem.) | Correcte tests Toont hoeveel tests volledig zijn geslaagd (alle runs geslaagd). |
|---|---|---|---|---|---|---|
| #271#271 | Hy3 previewnoneGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests. | 4.0… | Tencent | $0.007 ↕ … | 12.92s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 8 API-fout: 4 Instructies niet gevolgd: 4 Extra opmaak: 1 Responstijd (gem.)12.92s Responstijd (max)35.84s Responstijd (totaal)232.64s … |
|
||||||
| #272#272 | MiMo-V2-FlashnoneGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests. | 4.0… | Xiaomi | $0.025 ↑ … | 2.76s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 13 Instructies niet gevolgd: 2 API-fout: 1 Extra opmaak: 1 Responstijd (gem.)2.76s Responstijd (max)19.68s Responstijd (totaal)46.99s … |
|
||||||
| #273#273 | Ling 3.0 Tinynone | 4.0… | Inclusionai | $0.000 … | 14.02s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 13 Instructies niet gevolgd: 4 API-fout: 1 Extra opmaak: 1 Ongeldige toolaanroep: 1 Responstijd (gem.)14.02s Responstijd (max)240.61s Responstijd (totaal)294.46s … |
Verkeerd antwoord: 13 Instructies niet gevolgd: 4 API-fout: 1 Extra opmaak: 1 Ongeldige toolaanroep: 1
|
||||||
| #274#274 | Granite 4.1 8Bnone | 4.0… | IBM Granite | $0.007 … | 1.44s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 13 Instructies niet gevolgd: 4 Ongeldige toolaanroep: 2 Extra opmaak: 1 Responstijd (gem.)1.44s Responstijd (max)16.67s Responstijd (totaal)31.75s … |
|
||||||
| #275#275 | Nemotron 3.5 Lightningnone | 4.0… | NVIDIA | $0.009 ↕ … | 1.21s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 16 Ongeldige toolaanroep: 2 Instructies niet gevolgd: 1 Responstijd (gem.)1.21s Responstijd (max)6.30s Responstijd (totaal)26.62s … |
|
||||||
| #276#276 | Grok Build 0.1noneGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests. | 4.0… | X AI | $0.547 … | 28.69s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 7 API-fout: 3 Instructies niet gevolgd: 2 Responstijd (gem.)28.69s Responstijd (max)138.35s Responstijd (totaal)459.00s … |
|
||||||
| #277#277 | Ling 3.0 Tinyhigh | 3.8… | Inclusionai | $0.000 … | 75.68s… | Een test is alleen volledig geslaagd als alle runs slagen. Geen antwoord: 7 Verkeerd antwoord: 6 Instructies niet gevolgd: 3 API-fout: 1 Ongeldige toolaanroep: 1 Responstijd (gem.)75.68s Responstijd (max)345.15s Responstijd (totaal)1589.20s … |
Geen antwoord: 7 Verkeerd antwoord: 6 Instructies niet gevolgd: 3 API-fout: 1 Ongeldige toolaanroep: 1
|
||||||
| #278#278 | Ling 3.0 Tinylow | 3.8… | Inclusionai | $0.000 … | 66.16s… | Een test is alleen volledig geslaagd als alle runs slagen. Geen antwoord: 7 Verkeerd antwoord: 5 Instructies niet gevolgd: 4 API-fout: 1 Ongeldige toolaanroep: 1 Responstijd (gem.)66.16s Responstijd (max)252.08s Responstijd (totaal)1389.33s … |
Geen antwoord: 7 Verkeerd antwoord: 5 Instructies niet gevolgd: 4 API-fout: 1 Ongeldige toolaanroep: 1
|
||||||
| #279#279 | Grok 4.1 FastnoneGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests. | 3.8… | X AI | $0.008 ↓ … | 1.62s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 13 Instructies niet gevolgd: 3 Responstijd (gem.)1.62s Responstijd (max)5.51s Responstijd (totaal)19.48s … |
|
||||||
| #280#280 | Qwen3.5-9Bmedium | 3.8… | Qwen | $0.062 ↑ … | 107.51s… | Een test is alleen volledig geslaagd als alle runs slagen. Time-out: 11 Geen antwoord: 3 Verkeerd antwoord: 2 API-fout: 1 Extra opmaak: 1 Instructies niet gevolgd: 1 Responstijd (gem.)107.51s Responstijd (max)569.97s Responstijd (totaal)1720.15s … |
Time-out: 11 Geen antwoord: 3 Verkeerd antwoord: 2 API-fout: 1 Extra opmaak: 1 Instructies niet gevolgd: 1
|
||||||
| #281#281 | Ling 3.0 Tinymedium | 3.8… | Inclusionai | $0.000 … | 68.08s… | Een test is alleen volledig geslaagd als alle runs slagen. Geen antwoord: 7 Verkeerd antwoord: 5 Instructies niet gevolgd: 4 API-fout: 1 Ongeldige toolaanroep: 1 Responstijd (gem.)68.08s Responstijd (max)262.20s Responstijd (totaal)1429.66s … |
Geen antwoord: 7 Verkeerd antwoord: 5 Instructies niet gevolgd: 4 API-fout: 1 Ongeldige toolaanroep: 1
|
||||||
| #282#282 | Laguna Xs.2noneGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests. | 3.8… | Poolside | $0.004 ↕ … | 806ms… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 8 API-fout: 4 Instructies niet gevolgd: 1 Ongeldige toolaanroep: 1 Responstijd (gem.)806ms Responstijd (max)2.01s Responstijd (totaal)12.09s … |
|
||||||
| #283#283 | gpt-oss-120bnone57/66 pogingen (Doel: 3 herhalingen per test) | 3.7… | OpenAI | $0.010 ↓ … | 21.61s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 8 API-fout: 3 Instructies niet gevolgd: 2 Responstijd (gem.)21.61s Responstijd (max)113.71s Responstijd (totaal)345.79s … |
|
||||||
| #284#284 | Nemotron 3 Nano Omni 30b A3b ReasoningmediumGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests. | 3.4… | NVIDIA | $0.000 … | 17.13s… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 7 API-fout: 6 Instructies niet gevolgd: 1 Geen antwoord: 1 Responstijd (gem.)17.13s Responstijd (max)147.45s Responstijd (totaal)222.66s … |
|
||||||
| #285#285 | Nemotron 3 Nano Omni 30b A3b ReasoningnoneGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests. | 3.2… | NVIDIA | $0.000 … | 728ms… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 9 API-fout: 6 Instructies niet gevolgd: 2 Responstijd (gem.)728ms Responstijd (max)2.21s Responstijd (totaal)9.47s … |
|
||||||
| #286#286 | Step 3.5 FlashnoneGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests. | 2.3… | Stepfun | $0.020 … | 39.03s… | Een test is alleen volledig geslaagd als alle runs slagen. API-fout: 4 Instructies niet gevolgd: 1 Verkeerd antwoord: 1 Responstijd (gem.)39.03s Responstijd (max)114.12s Responstijd (totaal)312.26s … |
|
||||||
| #287#287 | LFM2-24B-A2BnoneGearchiveerd model: dit model wordt niet langer bijgewerkt of getest op nieuwe tests. | 2.2… | Liquid | $0.001 … | 782ms… | Een test is alleen volledig geslaagd als alle runs slagen. Verkeerd antwoord: 9 API-fout: 4 Instructies niet gevolgd: 1 Responstijd (gem.)782ms Responstijd (max)3.15s Responstijd (totaal)10.94s … |
|
||||||
Snelle vergelijking
Gemini 3.6 FlashhighvsGemini 3.7 FlashhighGemini 3.7 FlashhighvsGemini 3.6 FlashmediumGemini 3.6 FlashmediumvsGPT-5.6 SollowGPT-5.6 SollowvsGemini 3 Flash PreviewmediumGemini 3 Flash PreviewmediumvsGemini 3.5 FlashhighGemini 3.5 FlashhighvsGemini 3.7 FlashmediumGemini 3.7 FlashmediumvsGPT-5.6 SolmediumGPT-5.6 SolmediumvsGPT-5.6 SolhighGPT-5.6 SolhighvsGPT-5.5lowGPT-5.5lowvsGrok 4.6highGrok 4.6highvsGemini 3.1 Pro PreviewmediumGemini 3.1 Pro PreviewmediumvsGemini 3.7 Flashlow