Navigatie
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Trinity Large Thinking (low) vs gpt-oss-120b (medium)

gpt-oss-120b (medium) leidt in gemiddelde score met 6.1 vs 6.0. gpt-oss-120b (medium) heeft lagere benchmarkkosten met $0.020 vs $0.625. gpt-oss-120b (medium) is sneller met 20.81s vs 96.61s, met slagingspercentages van 47.0% vs 50.0%.

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-09-10

Vergeleken modellen

Rang
#208
Totaal aantal uitvoer-tokens
818,359
Responstijd (gem.)
96.61s
Totale kosten
$0.625
Rang
#198
Totaal aantal uitvoer-tokens
98,282
Responstijd (gem.)
20.81s
Totale kosten
$0.020
Aanbevolen model gpt-oss-120b (medium)

Het heeft hier de beste score (6.1) en kost ongeveer 32.8x minder dan Trinity Large Thinking (low).

Gedetailleerde vergelijking

Metriek Trinity Large Thinking Trinity Large Thinking low Releasedatum: 2026-07-28 gpt-oss-120b gpt-oss-120b medium Releasedatum: 2025-08-05
Score 6.0 6.1
Rang #208 #198
Betrouwbaarheid 10.0 10.0
Consistentie 8.3 8.0
Pogingen 66/66 66/66
Correcte tests
Slaagpercentage per poging 47.0% 50.0%
Instabiele tests 5 5
Totaal runs 66 66
Kosten per resultaat 8.221 0.224
Totale kosten $0.625 $0.020
Invoerprijs $0.250 / 1M $0.037 / 1M
Uitvoerprijs $0.800 / 1M $0.170 / 1M
Totaal aantal invoer-tokens 122,854 108,767
Uitvoer-tokens 119,810 29,378
Redeneer-tokens 698,549 68,904
Responstijd (gem.) 96.61s 20.81s
Responstijd (max) 540.96s 68.16s
Responstijd (totaal) 2125.51s 332.88s
Parameters 398B totaal (13B actief) 117B totaal (5.1B actief)
Beschikbaarheid Gewichten beschikbaar Open-source

Model generatie-showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#208 Trinity Large Thinking

low
Kosten
$0.021
Tijd
173.2s
Tokens
24,586 tok

#198 gpt-oss-120b

medium
Kosten
$0.001
Tijd
26.7s
Tokens
555 tok

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Trinity Large Thinking 5.3 10.0 33.3% 0 344.45s 5,441 27,039 217,241
gpt-oss-120b 5.9 7.0 55.6% 1 38.37s 7,782 3,365 11,973

Snelle vergelijking

Vergelijkingspaar wisselen