Navigatie
Advertise here

Trinity Large Thinking (high) vs Qwen3.7 Flash

Qwen3.7 Flash leidt in gemiddelde score met 5.9 vs 5.7. Qwen3.7 Flash heeft lagere benchmarkkosten met $0.028 vs $0.794. Qwen3.7 Flash is sneller met 14.70s vs 74.52s, met slagingspercentages van 42.0% vs 36.2%.

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-10-05

Vergeleken modellen

Rang
#263
Totaal aantal uitvoer-tokens
943,044
Responstijd (gem.)
74.52s
Totale kosten
$0.794
Rang
#257
Totaal aantal uitvoer-tokens
117,742
Responstijd (gem.)
14.70s
Totale kosten
$0.028
Aanbevolen model Qwen3.7 Flash

Het heeft hier de beste score (5.9) en kost ongeveer 28.7x minder dan Trinity Large Thinking (high).

Gedetailleerde vergelijking

Metriek Trinity Large Thinking Trinity Large Thinking high Releasedatum: 2026-07-28 Qwen3.7 Flash Qwen3.7 Flash none Releasedatum: 2026-07-28
Score 5.7 5.9
Rang #263 #257
Betrouwbaarheid 10.0 10.0
Consistentie 7.3 9.0
Pogingen 69/69 69/69
Correcte tests
Slaagpercentage per poging 42.0% 36.2%
Instabiele tests 8 3
Totaal runs 69 69
Kosten per resultaat 11.289 0.395
Totale kosten $0.794 $0.028
Invoerprijs $0.250 / 1M $0.030 / 1M
Uitvoerprijs $0.800 / 1M $0.130 / 1M
Prijs voor cachelezen $0.060 / 1M $0.006 / 1M
Prijs voor cacheschrijven n.v.t. $0.039 / 1M
Totaal aantal invoer-tokens 283,116 410,787
Uitvoer-tokens 277,920 117,742
Redeneer-tokens 665,124 0
Responstijd (gem.) 74.52s 14.70s
Responstijd (max) 510.21s 186.24s
Responstijd (totaal) 1713.90s 338.13s
Parameters 398B totaal (13B actief) ~35B totaal (~3B actief)
Beschikbaarheid Gewichten beschikbaar Gesloten broncode

Cacheprijzen gelden voor invoertokens. Lezen hergebruikt opgeslagen prompts; schrijven slaat ze op en kan extra kosten. Voor uitvoertokens geldt de uitvoerprijs.

Model generatie-showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#263 Trinity Large Thinking

high
Kosten
$0.028
Tijd
130.1s
Tokens
34,387 tok

#257 Qwen3.7 Flash

none
Kosten
$0.001
Tijd
34.0s
Tokens
4,814 tok

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Trinity Large Thinking 3.7 4.7 33.3% 2 245.04s 7,204 83,616 266,836
Qwen3.7 Flash 5.5 10.0 33.3% 0 1.55s 7,911 855 0

Snelle vergelijking

Vergelijkingspaar wisselen