Navigatie
Advertise here

Trinity Large Thinking (low) vs Granite 4.2 8B (medium)

Trinity Large Thinking (low) leidt in gemiddelde score met 6.3 vs 6.1. Granite 4.2 8B (medium) heeft lagere benchmarkkosten met $0.029 vs $0.700. Granite 4.2 8B (medium) is sneller met 50.47s vs 95.16s, met slagingspercentages van 47.8% vs 37.7%.

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-10-01

Vergeleken modellen

Rang
#222
Totaal aantal uitvoer-tokens
842,200
Responstijd (gem.)
95.16s
Totale kosten
$0.700
Rang
#235
Totaal aantal uitvoer-tokens
50,147
Responstijd (gem.)
50.47s
Totale kosten
$0.029
Aanbevolen model Granite 4.2 8B (medium)

De score blijft dicht bij de beste score hier (6.1 vs 6.3) en het kost ongeveer 24.9x minder dan Trinity Large Thinking (low).

Gedetailleerde vergelijking

Metriek Trinity Large Thinking Trinity Large Thinking low Releasedatum: 2026-07-28 Granite 4.2 8B Granite 4.2 8B medium Releasedatum: 2026-09-02
Score 6.3 6.1
Rang #222 #235
Betrouwbaarheid 10.0 8.9
Consistentie 8.1 9.7
Pogingen 69/69 69/69
Correcte tests
Slaagpercentage per poging 47.8% 37.7%
Instabiele tests 6 1
Totaal runs 69 69
Kosten per resultaat 9.163 0.354
Totale kosten $0.700 $0.029
Invoerprijs $0.250 / 1M $0.060 / 1M
Uitvoerprijs $0.800 / 1M $0.250 / 1M
Totaal aantal invoer-tokens 347,980 259,708
Uitvoer-tokens 121,898 16,567
Redeneer-tokens 720,302 33,580
Responstijd (gem.) 95.16s 50.47s
Responstijd (max) 540.96s 557.96s
Responstijd (totaal) 2188.74s 1160.91s
Parameters 398B totaal (13B actief) 8B
Beschikbaarheid Gewichten beschikbaar Open-source

Model generatie-showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#222 Trinity Large Thinking

low
Kosten
$0.021
Tijd
173.2s
Tokens
24,586 tok

#235 IBM: Granite 4.2 8B

medium
Provider returned error
Kosten
$0.000
Tijd
0.2s
Tokens
0 tok

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Trinity Large Thinking 5.3 10.0 33.3% 0 344.45s 5,441 27,039 217,241
Granite 4.2 8B 5.5 10.0 33.3% 0 12.09s 8,439 2,445 3,900

Snelle vergelijking

Vergelijkingspaar wisselen