Navigatie
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Anthropic: Claude Opus 4.8 vs Xiaomi: MiMo-V2.5-Pro

Claude Opus 4.8 leidt in gemiddelde score met 7.3 vs 6.9. MiMo-V2.5-Pro (medium) heeft lagere benchmarkkosten met $0.187 vs $1.166. Claude Opus 4.8 is sneller met 4.91s vs 33.92s, met slagingspercentages van 63.6% vs 66.7%.

Aanbevolen modelClaude Opus 4.8Het heeft hier de beste score (7.3) en reageert ongeveer 6.9x sneller dan MiMo-V2.5-Pro (medium).

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-07-25

Metriek Claude Opus 4.8 Claude Opus 4.8 none Releasedatum: 2026-05-28 MiMo-V2.5-Pro MiMo-V2.5-Pro medium Releasedatum: 2026-04-22
Score 7.3 6.9
Rang #74 #92
Betrouwbaarheid 10.0 10.0
Consistentie 9.2 8.2
Correcte tests
Slaagpercentage per poging 63.6% 66.7%
Instabiele tests 2 5
Totaal runs 66 66
Kosten per resultaat 8.969 3.218
Totale kosten $1.166 $0.187
Invoerprijs $5.000 / 1M $0.435 / 1M
Uitvoerprijs $25.000 / 1M $0.870 / 1M
Totaal aantal invoer-tokens 149,206 139,883
Uitvoer-tokens 16,797 15,521
Redeneer-tokens 0 130,992
Responstijd (gem.) 4.91s 33.92s
Responstijd (max) 35.03s 197.54s
Responstijd (totaal) 108.03s 746.19s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#74 Claude Opus 4.8

none
Kosten
$0.053
Tijd
22.0s
Tokens
2,253 tok

#92 MiMo-V2.5-Pro

medium
Ongeldige SVG
Kosten
$0.000
Tijd
300.0s
Tokens
0 tok

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Claude Opus 4.8 5.5 10.0 33.3% 0 3.29s 10,590 1,332 0
MiMo-V2.5-Pro 6.2 4.7 66.7% 2 92.07s 6,543 780 51,218

Snelle vergelijking

Vergelijkingspaar wisselen