Navigatie
AI BENCHY
AD
Track all your projects in one dashboard. Get ๐Ÿ“Šstats, ๐Ÿ”ฅheatmaps and ๐Ÿ‘€recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Vergeleken modellen

Samenvatting

Benchmarkvergelijking GPT-5.5 vs GPT-5.4 vs Gemini 3.1 Pro Preview vs Claude Opus 4.7Gemini 3.1 Pro Preview leidt op Score met 9.2. GPT-5.5 leidt op Betrouwbaarheid met 10.0. Claude Opus 4.7 heeft de laagste Totale kosten met $0.679. Claude Opus 4.7 is het snelst met 4.73s.

Aanbevolen model: Claude Opus 4.7 - De score blijft dicht bij de beste score hier (8.7 vs 9.2) en het kost ongeveer 2.9x minder dan de andere modellen in deze vergelijking.

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-06-18

Metriek GPT-5.5 GPT-5.5 medium Releasedatum: 2026-04-24 GPT-5.4 GPT-5.4 medium Releasedatum: 2026-03-05 Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Releasedatum: 2026-02-19 Claude Opus 4.7 Claude Opus 4.7 medium Releasedatum: 2026-04-16
Score 9.0 8.5 9.2 8.7
Rang #9 #17 #7 #13
Betrouwbaarheid 10.0 10.0 10.0 10.0
Consistentie 8.9 8.6 10.0 9.6
Correcte tests
Slaagpercentage per poging 87.3% 76.2% 90.5% 82.5%
Instabiele tests 3 4 0 1
Totaal runs 63 63 63 63
Kosten per resultaat 21.638 8.640 5.546 3.991
Totale kosten $3.679 $1.210 $1.054 $0.679
Invoerprijs $5.000 / 1M $2.500 / 1M $2.000 / 1M $5.000 / 1M
Uitvoerprijs $30.000 / 1M $15.000 / 1M $12.000 / 1M $25.000 / 1M
Totaal aantal invoer-tokens 34,212 34,108 41,617 65,406
Uitvoer-tokens 1,985 2,242 1,977 11,858
Redeneer-tokens 114,925 72,707 78,896 2,198
Responstijd (gem.) 37.98s 22.35s 20.14s 4.73s
Responstijd (max) 332.10s 100.41s 88.68s 23.18s
Responstijd (totaal) 797.60s 469.29s 281.92s 94.51s

Generatie-showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#9 GPT-5.5

medium
Kosten
$0.112
Tijd
71.9s
Tokens
3,807 tok

#17 GPT-5.4

medium
Kosten
$0.214
Tijd
199.6s
Tokens
14,349 tok

#7 Gemini 3.1 Pro Preview

medium
Kosten
$0.115
Tijd
87.2s
Tokens
9,629 tok

#13 Claude Opus 4.7

medium
Kosten
$0.059
Tijd
26.8s
Tokens
2,475 tok

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Anti-AI-trucs Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.5 10.0 10.0 100.0% 0 4.66s 606 250 1,335
GPT-5.4 8.3 10.0 75.0% 0 4.11s 606 240 1,511
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 7.90s 498 112 3,218
Claude Opus 4.7 8.3 10.0 75.0% 0 1.85s 894 348 0
Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.5 8.8 7.8 88.9% 1 59.77s 7,305 362 24,959
GPT-5.4 8.8 7.8 88.9% 1 44.36s 7,305 433 24,216
Gemini 3.1 Pro Preview 7.9 9.9 66.7% 0 40.17s 8,124 435 41,247
Claude Opus 4.7 7.6 7.2 77.8% 1 12.96s 10,635 7,629 1,114
Gecombineerd Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.5 10.0 10.0 100.0% 0 19.29s 11,019 312 2,841
GPT-5.4 10.0 10.0 100.0% 0 20.57s 11,019 301 3,543
Gemini 3.1 Pro Preview 9.5 10.0 100.0% 0 40.61s 17,240 432 9,281
Claude Opus 4.7 10.0 10.0 100.0% 0 21.45s 24,501 2,369 1,084
Gegevensparsering en extractie Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.5 10.0 10.0 100.0% 0 4.18s 7,140 234 593
GPT-5.4 10.0 10.0 100.0% 0 5.32s 7,140 234 804
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 7.72s 7,265 279 3,904
Claude Opus 4.7 10.0 10.0 100.0% 0 2.37s 10,533 324 0
Domeinspecifiek Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.5 5.3 7.2 44.4% 1 164.14s 723 67 79,625
GPT-5.4 5.3 7.2 44.4% 1 74.27s 619 61 34,748
Gemini 3.1 Pro Preview 7.7 10.0 66.7% 0 32.73s 635 18 12,424
Claude Opus 4.7 7.7 10.0 66.7% 0 1.17s 630 51 0
Algemene intelligentie Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.5 10.0 10.0 100.0% 0 4.16s 477 138 223
GPT-5.4 4.7 3.1 33.3% 1 4.92s 477 145 321
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 11.77s 490 108 1,179
Claude Opus 4.7 10.0 10.0 100.0% 0 2.87s 723 256 0
Instructies opvolgen Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.5 10.0 10.0 100.0% 0 3.36s 660 93 538
GPT-5.4 10.0 10.0 100.0% 0 3.11s 660 93 897
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 9.56s 621 72 2,236
Claude Opus 4.7 10.0 10.0 100.0% 0 1.57s 939 114 0
Puzzeloplossing Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.5 10.0 10.0 100.0% 0 6.76s 642 241 2,225
GPT-5.4 8.2 7.2 88.9% 1 9.14s 642 441 3,815
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 6.90s 570 235 3,128
Claude Opus 4.7 10.0 10.0 100.0% 0 2.43s 939 370 0
Toolaanroepen Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.5 10.0 10.0 100.0% 0 10.57s 5,445 258 832
GPT-5.4 10.0 10.0 100.0% 0 13.28s 5,445 264 1,031
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 23.15s 6,018 274 982
Claude Opus 4.7 10.0 10.0 100.0% 0 4.17s 15,339 373 0
Algemene kennis Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
GPT-5.5 2.8 1.6 33.3% 1 37.86s 195 30 1,754
GPT-5.4 3.0 10.0 0.0% 0 13.95s 195 30 1,821
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 6.27s 156 12 1,297
Claude Opus 4.7 3.0 10.0 0.0% 0 2.25s 273 24 0

Snelle vergelijking

Vergelijkingspaar wisselen