Navigare
Advertise here

Mercury 2 vs gpt-oss-120b

Mercury 2 conduce la scorul mediu cu 4.4 vs 4.2. gpt-oss-120b are costul de benchmark mai mic, $0.016 vs $0.033. Mercury 2 este mai rapid cu 1.18s vs 28.63s, cu rate de reușită de 23.2% vs 34.8%.

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-10-07

Modele comparate

Rang
#357
Total tokenuri de ieșire
9,709
Timp de răspuns (mediu)
1.18s
Cost total
$0.033
Rang
#361
Total tokenuri de ieșire
62,213
Timp de răspuns (mediu)
28.63s
Cost total
$0.016
Model recomandat Mercury 2

Are cel mai bun scor aici (4.4) și răspunde de aproximativ 24.3x mai rapid decât gpt-oss-120b.

Comparație detaliată

Metrică Mercury 2 Mercury 2 none Lansare: 2026-02-24 gpt-oss-120b gpt-oss-120b none Lansare: 2025-08-05
Scor 4.4 4.2
Rang #357 #361
Fiabilitate 10.0 10.0
Consistență 9.2 7.6
Încercări 69/69 60/69
Teste corecte
Rată de trecere pe încercare 23.2% 34.8%
Teste instabile 2 3
Rulări totale 69 60
Cost per rezultat 0.812 0.274
Cost total $0.033 $0.016
Preț de intrare $0.250 / 1M $0.037 / 1M
Preț de ieșire $0.750 / 1M $0.170 / 1M
Preț citire cache $0.025 / 1M N/D
Preț scriere cache N/D N/D
Total tokenuri de intrare 100,634 131,652
Tokenuri de ieșire 9,609 16,869
Tokenuri de raționament 100 53,081
Timp de răspuns (mediu) 1.18s 28.63s
Timp de răspuns (maxim) 9.00s 140.90s
Timp de răspuns (total) 27.14s 486.69s
Parametri ~100B 117B în total (5.1B activi)
Disponibilitate Închis Sursă deschisă

Prețurile de cache se aplică tokenurilor de intrare. Citirea reutilizează prompturi salvate; scrierea le stochează și poate costa în plus. Tokenurile de ieșire folosesc prețul de ieșire.

Prezentare generare modele

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#357 Mercury 2

none
Cost
$0.002
Timp
1.8s
Tokenuri
1,514 tok

#361 gpt-oss-120b

none
Nu s-a generat încă niciun rezultat de prezentare pentru acest model.
Cost
N/D
Timp
-
Tokenuri
0 tok

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Programare Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 3.4 9.6 0.0% 0 1.03s 7,229 3,088 0
gpt-oss-120b 1.5 0.4 22.2% 1 9.57s 901 204 3,028

Schimbă perechea de comparație