Programmierung-Ranking
Sieh, welche KI-Modelle bei Programmierung am besten abschneiden, welche zuverlässig bleiben und wo die größten Unterschiede liegen. Sortieren nach: Gesamtkosten ↓.
Angezeigte Modelle
15
Durchschnittlicher Wert für Programmierung-Score
0.6
Bestes Modell
Claude Sonnet 5.5 1.0
408/408
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Programmierung-Score | Punktzahl | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #31 | Claude Sonnet 5.5 max | Anthropic | 1.0 | 0.9 | $8.557 | 3/3 | 55.3s |
| #8 | GPT-6 Astra xhigh | OpenAI | 1.0 | 1.0 | $6.213 | 3/3 | 8.27s |
| #369 | Grok 4.20 Multi Agent Beta medium | X AI | 0.3 | 0.4 | $5.599 | 1/1 | 27.1s |
| #49 | Claude Fable 5 medium | Anthropic | 1.0 | 0.9 | $5.089 | 3/3 | 15.6s |
| #5 | GPT-6 Astra max | OpenAI | 1.0 | 1.0 | $5.044 | 3/3 | 14.6s |
| #30 | GPT-5.5 medium | OpenAI | 0.9 | 0.9 | $4.809 | 2/3 | 59.8s |
| #78 | GLM 5.2 high | Z.ai | 0.6 | 0.8 | $4.632 | 1/3 | 73.0s |
| #26 | Claude Opus 5 high | Anthropic | 1.0 | 0.9 | $4.524 | 3/3 | 12.7s |
| #169 | Step 5 Preview high | Stepfun | 0.3 | 0.7 | $4.513 | 0/3 | 421.7s |
| #7 | GPT-6 Astra high | OpenAI | 1.0 | 1.0 | $4.458 | 3/3 | 5.86s |
| #250 | Step 5 Preview medium | Stepfun | 0.3 | 0.6 | $4.136 | 0/3 | 363.9s |
| #281 | Step 5 Preview low | Stepfun | 0.3 | 0.6 | $4.110 | 0/3 | 378.2s |
| #71 | Qwen3.8 2.4T A95B low | Qwen | 0.8 | 0.8 | $4.016 | 2/3 | 172.5s |
| #153 | Claude Opus 4.8 low | Anthropic | 0.7 | 0.7 | $3.787 | 1/3 | 7.58s |
| #93 | Claude Opus 4.7 medium | Anthropic | 0.8 | 0.8 | $3.636 | 2/3 | 13.0s |