Navigatie
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Trinity Large Thinking (medium) vs Kimi K2.6

Trinity Large Thinking (medium) leidt in gemiddelde score met 6.0 vs 5.8. Kimi K2.6 heeft lagere benchmarkkosten met $0.158 vs $0.792. Kimi K2.6 is sneller met 19.58s vs 84.96s, met slagingspercentages van 45.5% vs 34.9%.

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-07-28

Rang
#150
Totaal aantal uitvoer-tokens
1,002,646
Responstijd (gem.)
84.96s
Totale kosten
$0.792
Rang
#155
Totaal aantal uitvoer-tokens
30,253
Responstijd (gem.)
19.58s
Totale kosten
$0.158
Aanbevolen model Kimi K2.6

De score blijft dicht bij de beste score hier (5.8 vs 6.0) en het kost ongeveer 5.0x minder dan Trinity Large Thinking (medium).

Gedetailleerde vergelijking

Metriek Trinity Large Thinking Trinity Large Thinking medium Releasedatum: 2026-07-28 Kimi K2.6 Kimi K2.6 none Releasedatum: 2026-04-20
Score 6.0 5.8
Rang #150 #155
Betrouwbaarheid 10.0 10.0
Consistentie 7.6 9.3
Correcte tests
Slaagpercentage per poging 45.5% 34.9%
Instabiele tests 7 2
Totaal runs 66 66
Kosten per resultaat 11.308 3.199
Totale kosten $0.792 $0.158
Invoerprijs $0.220 / 1M $0.646 / 1M
Uitvoerprijs $0.850 / 1M $2.720 / 1M
Totaal aantal invoer-tokens 118,477 116,970
Uitvoer-tokens 148,823 30,253
Redeneer-tokens 853,823 0
Responstijd (gem.) 84.96s 19.58s
Responstijd (max) 525.14s 238.89s
Responstijd (totaal) 1869.16s 430.85s

Model generatie-showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#150 Trinity Large Thinking

medium
Kosten
$0.016
Tijd
75.9s
Tokens
19,401 tok

#155 MoonshotAI: Kimi K2.6

none
Kosten
$0.020
Tijd
127.4s
Tokens
4,429 tok

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
Trinity Large Thinking 7.5 10.0 66.7% 0 179.02s 7,248 7,413 351,155
Kimi K2.6 5.5 9.8 33.3% 0 82.57s 5,986 14,754 0

Snelle vergelijking

Vergelijkingspaar wisselen