Navigatie
Advertise here

Trinity Large Thinking (high) vs GPT-5.4

Trinity Large Thinking (high) leidt in gemiddelde score met 5.7 vs 5.6. Trinity Large Thinking (high) heeft lagere benchmarkkosten met $0.645 vs $0.690. GPT-5.4 is sneller met 3.89s vs 74.52s, met slagingspercentages van 42.0% vs 33.3%.

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-10-01

Vergeleken modellen

Rang
#253
Totaal aantal uitvoer-tokens
943,044
Responstijd (gem.)
74.52s
Totale kosten
$0.645
Rang
#260
Totaal aantal uitvoer-tokens
9,372
Responstijd (gem.)
3.89s
Totale kosten
$0.690
Aanbevolen model GPT-5.4

De score blijft dicht bij de beste score hier (5.6 vs 5.7) en het reageert ongeveer 19.2x sneller dan Trinity Large Thinking (high).

Gedetailleerde vergelijking

Metriek Trinity Large Thinking Trinity Large Thinking high Releasedatum: 2026-07-28 GPT-5.4 GPT-5.4 none Releasedatum: 2026-03-05
Score 5.7 5.6
Rang #253 #260
Betrouwbaarheid 10.0 10.0
Consistentie 7.3 9.3
Pogingen 69/69 69/69
Correcte tests
Slaagpercentage per poging 42.0% 33.3%
Instabiele tests 8 2
Totaal runs 69 69
Kosten per resultaat 11.289 9.845
Totale kosten $0.645 $0.690
Invoerprijs $0.250 / 1M $2.500 / 1M
Uitvoerprijs $0.800 / 1M $15.000 / 1M
Totaal aantal invoer-tokens 283,116 219,404
Uitvoer-tokens 277,920 9,372
Redeneer-tokens 665,124 0
Responstijd (gem.) 74.52s 3.89s
Responstijd (max) 510.21s 43.73s
Responstijd (totaal) 1713.90s 89.48s
Parameters 398B totaal (13B actief) ~1.5T totaal (~100B actief)
Beschikbaarheid Gewichten beschikbaar Gesloten broncode

Model generatie-showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#253 Trinity Large Thinking

high
Kosten
$0.028
Tijd
130.1s
Tokens
34,387 tok

#260 GPT-5.4

none
Kosten
$0.026
Tijd
18.1s
Tokens
1,792 tok

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Trinity Large Thinking 3.7 4.7 33.3% 2 245.04s 7,204 83,616 266,836
GPT-5.4 5.5 10.0 33.3% 0 1.62s 7,305 516 0

Snelle vergelijking

Vergelijkingspaar wisselen