Instructies opvolgen: Verkeerd antwoord
Instructies opvolgen
Verkeerd antwoord
Zie welke AI-modellen op Instructies opvolgen het meest kans hebben op Verkeerd antwoord, zodat je zwakke punten sneller ziet. Sorteren op: Correcte tests โ.
Foutredenen
61/61
Modellen filteren
Geen modellen komen overeen met de huidige zoekopdracht en filters.
| Rang | Model | Bedrijf | Verkeerd antwoord-aantal | Categoriescore | Totale kosten | Correcte tests | Responstijd (gem.) |
|---|---|---|---|---|---|---|---|
| #160 | Laguna XS 2.1 none | Poolside | 1 | 3.8 | $0.008 | 0/2 | 364ms |
| #172 | MiniMax M2.7 medium | Minimax | 1 | 3.8 | $0.163 | 0/2 | 12.8s |
| #183 | Trinity Large Preview none | Arcee AI | 1 | 3.5 | $0.008 | 0/2 | 822ms |
| #201 | Granite 4.1 8B none | IBM Granite | 1 | 3.6 | $0.007 | 0/2 | 344ms |
| #203 | Grok 4.1 Fast none | X AI | 1 | 3.0 | $0.008 | 0/2 | 685ms |
| #208 | Nemotron 3 Nano Omni 30b A3b Reasoning none | NVIDIA | 1 | 4.8 | $0.000 | 0/2 | 541ms |
| #60 | LongCat 2.0 medium | Meituan | 1 | 6.5 | $0.478 | 1/2 | 7.38s |
| #63 | Claude Sonnet 4.6 none | Anthropic | 1 | 6.5 | $0.661 | 1/2 | 1.96s |
| #71 | Qwen3.7 Plus none | Qwen | 1 | 6.3 | $0.106 | 1/2 | 929ms |
| #74 | GLM 5.1 medium | Z.ai | 1 | 6.4 | $0.535 | 1/2 | 7.47s |
| #82 | DeepSeek V4 Pro none | DeepSeek | 1 | 6.3 | $0.096 | 1/2 | 4.12s |
| #87 | GPT-5.5 none | OpenAI | 1 | 6.2 | $0.544 | 1/2 | 1.15s |
| #88 | Gemini 3.5 Flash minimal | 1 | 6.4 | $0.300 | 1/2 | 893ms | |
| #89 | Gemini 3 Flash Preview none | 1 | 6.4 | $0.085 | 1/2 | 1.58s | |
| #91 | LongCat 2.0 low | Meituan | 1 | 6.5 | $0.391 | 1/2 | 6.39s |