AI BENCHY
AD
Track all your projects in one dashboard. Get ๐Ÿ“Šstats, ๐Ÿ”ฅheatmaps and ๐Ÿ‘€recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Categorie

Instructies opvolgen-ranglijst

Zie welke AI-modellen het best presteren op Instructies opvolgen, welke betrouwbaar blijven en waar de grootste verschillen zitten. Sorteren op: Correcte tests โ†“.

Getoonde modellen

15

Gemiddelde Instructies opvolgen-score

8.5

Rang Model Bedrijf Instructies opvolgen-score Score Correcte tests Responstijd (gem.)
#83 Step 3.5 Flash none Stepfun 10.0 6.6 1/1 9.30s
#84 Grok 4.20 Multi Agent Beta medium X AI 9.8 6.6 2/2 3.52s
#87 Gemini 3.1 Flash Lite minimal Google 10.0 6.4 2/2 932ms
#89 Hy3 preview low Tencent 10.0 6.4 2/2 16.0s
#90 Gemini 3.1 Flash Lite none Google 10.0 6.4 2/2 859ms
#92 Laguna M.1 medium Poolside 10.0 6.4 2/2 4.30s
#94 GPT-5 Nano medium OpenAI 9.8 6.3 2/2 15.6s
#95 Qwen3.5 Plus 2026-02-15 none Qwen 10.0 6.3 2/2 1.67s
#96 Ring-2.6-1T none Inclusionai 9.8 6.2 2/2 27.4s
#97 Gemini 2.5 Flash none Google 10.0 6.2 2/2 590ms
#98 GLM 5 none Z.ai 10.0 6.1 2/2 1.48s
#99 gpt-oss-120b medium OpenAI 9.9 6.1 2/2 7.63s
#100 Grok Build 0.1 none X AI 9.8 6.0 2/2 7.36s
#103 DeepSeek V4 Pro high DeepSeek 10.0 6.0 2/2 41.2s
#104 Nemotron 3 Ultra 550b A55b none NVIDIA 10.0 6.0 2/2 1.46s

Topmodellen op Instructies opvolgen-score

Instructies opvolgen-score vs totale kosten

Topmodellen op Responstijd (gem.)