Navigatie
Advertise here

Trinity Large Thinking (high) vs Mistral Large 4

De gemiddelde score is vrijwel gelijk met 5.7 vs 5.7. Mistral Large 4 heeft lagere benchmarkkosten met $0.290 vs $0.794. Mistral Large 4 is sneller met 20.43s vs 74.52s, met slagingspercentages van 42.0% vs 31.9%.

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-10-07

Vergeleken modellen

Rang
#269
Totaal aantal uitvoer-tokens
717,762
Responstijd (gem.)
74.52s
Totale kosten
$0.794
Rang
#272
Totaal aantal uitvoer-tokens
54,388
Responstijd (gem.)
20.43s
Totale kosten
$0.290
Aanbevolen model Mistral Large 4

Het heeft hier de beste score (5.7) en kost ongeveer 2.7x minder dan Trinity Large Thinking (high).

Gedetailleerde vergelijking

Metriek Trinity Large Thinking Trinity Large Thinking high Releasedatum: 2026-07-28 Mistral Large 4 Mistral Large 4 none Releasedatum: 2026-10-06
Score 5.7 5.7
Rang #269 #272
Betrouwbaarheid 10.0 9.7
Consistentie 7.3 9.3
Pogingen 69/69 69/69
Correcte tests
Slaagpercentage per poging 42.0% 31.9%
Instabiele tests 8 2
Totaal runs 69 69
Kosten per resultaat 11.289 4.818
Totale kosten $0.794 $0.290
Invoerprijs $0.250 / 1M $0.680 / 1M
Uitvoerprijs $0.800 / 1M $2.090 / 1M
Prijs voor cachelezen $0.060 / 1M $0.070 / 1M
Prijs voor cacheschrijven n.v.t. n.v.t.
Totaal aantal invoer-tokens 283,116 257,872
Uitvoer-tokens 277,920 54,388
Redeneer-tokens 665,124 0
Responstijd (gem.) 74.52s 20.43s
Responstijd (max) 510.21s 192.80s
Responstijd (totaal) 1713.90s 469.88s
Parameters 398B totaal (13B actief) 1.05T totaal (49B actief)
Beschikbaarheid Gewichten beschikbaar Gesloten broncode

Cacheprijzen gelden voor invoertokens. Lezen hergebruikt opgeslagen prompts; schrijven slaat ze op en kan extra kosten. Voor uitvoertokens geldt de uitvoerprijs.

Model generatie-showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#269 Trinity Large Thinking

high
Kosten
$0.028
Tijd
130.1s
Tokens
34,387 tok

#272 Mistral Large 4

none
Kosten
$0.005
Tijd
33.0s
Tokens
2,461 tok

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Trinity Large Thinking 3.7 4.7 33.3% 2 245.04s 7,204 83,616 266,836
Mistral Large 4 4.7 7.5 22.2% 1 85.04s 7,431 39,805 0

Vergelijkingspaar wisselen