Navigatie
AI BENCHY
Advertise here

AI BENCHY Compare

Inception: Mercury 2 vs OpenAI: gpt-oss-120b

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-06-03

Metriek Mercury 2 Mercury 2 none Releasedatum: 2026-02-24 gpt-oss-120b gpt-oss-120b medium Releasedatum: 2025-08-05 Gratis beschikbaar
Score 4.6 5.9
Rang #153 #103
Betrouwbaarheid 10.0 10.0
Consistentie 9.1 7.9
Correcte tests
Slaagpercentage per poging 25.0% 50.0%
Instabiele tests 2 5
Totaal runs 60 60
Kosten per resultaat 0.216 0.151
Totale kosten $0.009 $0.012
Invoerprijs $0.250 / 1M $0.039 / 1M
Uitvoerprijs $0.750 / 1M $0.180 / 1M
Totaal aantal invoer-tokens 25,515 36,355
Uitvoer-tokens 3,001 17,495
Redeneer-tokens 0 46,878
Responstijd (gem.) 614ms 22.41s
Responstijd (max) 1.27s 68.16s
Responstijd (totaal) 12.28s 291.35s

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Anti-AI-trucs Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Mercury 2 3.0 10.0 0.0% 0 483ms 631 286 0
gpt-oss-120b 6.7 9.9 50.0% 0 10.21s 1,314 3,518 2,177
Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Mercury 2 3.5 9.4 0.0% 0 831ms 4,631 1,650 0
gpt-oss-120b 3.9 5.6 33.3% 1 47.24s 5,053 847 8,618
Gecombineerd Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Mercury 2 3.0 10.0 0.0% 0 606ms 4,821 131 0
gpt-oss-120b 10.0 10.0 100.0% 0 31.18s 11,535 694 5,072
Gegevensparsering en extractie Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Mercury 2 7.3 5.9 83.3% 1 667ms 6,362 180 0
gpt-oss-120b 6.4 5.9 66.7% 1 1.98s 7,476 241 1,114
Domeinspecifiek Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Mercury 2 5.3 7.2 44.4% 1 534ms 784 46 0
gpt-oss-120b 2.9 4.4 22.2% 2 50.92s 1,266 6,784 20,606
Algemene intelligentie Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Mercury 2 4.8 10.0 0.0% 0 628ms 495 159 0
gpt-oss-120b 4.3 10.0 0.0% 0 7.90s 659 107 387
Instructies opvolgen Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Mercury 2 6.5 10.0 50.0% 0 551ms 691 82 0
gpt-oss-120b 9.9 10.0 100.0% 0 7.63s 1,036 126 1,799
Puzzeloplossing Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Mercury 2 3.1 10.0 0.0% 0 535ms 694 251 0
gpt-oss-120b 5.3 7.2 44.4% 1 21.71s 1,190 1,790 2,264
Toolaanroepen Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Mercury 2 10.0 10.0 100.0% 0 1.27s 6,193 197 0
gpt-oss-120b 9.8 10.0 100.0% 0 6.91s 6,514 287 1,083
Algemene kennis Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Mercury 2 3.0 10.0 0.0% 0 548ms 213 19 0
gpt-oss-120b 3.0 10.0 0.0% 0 26.51s 312 3,101 3,758

Snelle vergelijking

Vergelijkingspaar wisselen