Navigatie
Advertise here

KAT Coder AIR V2.5 (medium) vs GPT-4o-mini

KAT Coder AIR V2.5 (medium) leidt in gemiddelde score met 5.1 vs 5.0. GPT-4o-mini heeft lagere benchmarkkosten met $0.024 vs $0.048. GPT-4o-mini is sneller met 4.16s vs 8.32s, met slagingspercentages van 43.5% vs 21.7%.

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-10-02

Vergeleken modellen

Rang
#297
Totaal aantal uitvoer-tokens
66,576
Responstijd (gem.)
8.32s
Totale kosten
$0.048
Rang
#304
Totaal aantal uitvoer-tokens
3,627
Responstijd (gem.)
4.16s
Totale kosten
$0.024
Aanbevolen model GPT-4o-mini

De score blijft dicht bij de beste score hier (5.0 vs 5.1) en het kost ongeveer 2.0x minder dan KAT Coder AIR V2.5 (medium).

Gedetailleerde vergelijking

Metriek KAT Coder AIR V2.5 KAT Coder AIR V2.5 medium Releasedatum: 2026-07-14 GPT-4o-mini GPT-4o-mini none Releasedatum: 2024-07-18
Score 5.1 5.0
Rang #297 #304
Betrouwbaarheid 9.6 10.0
Consistentie 8.9 9.9
Pogingen 69/69 69/69
Correcte tests
Slaagpercentage per poging 43.5% 21.7%
Instabiele tests 3 0
Totaal runs 69 69
Kosten per resultaat 0.596 0.480
Totale kosten $0.048 $0.024
Invoerprijs $0.150 / 1M $0.150 / 1M
Uitvoerprijs $0.600 / 1M $0.600 / 1M
Prijs voor cachelezen n.v.t. $0.075 / 1M
Prijs voor cacheschrijven n.v.t. n.v.t.
Totaal aantal invoer-tokens 51,369 145,180
Uitvoer-tokens 8,008 3,627
Redeneer-tokens 58,568 0
Responstijd (gem.) 8.32s 4.16s
Responstijd (max) 48.19s 39.99s
Responstijd (totaal) 191.40s 70.70s
Parameters ~35B totaal (~3B actief) ~8B
Beschikbaarheid Gesloten broncode Gesloten broncode

Cacheprijzen gelden voor invoertokens. Lezen hergebruikt opgeslagen prompts; schrijven slaat ze op en kan extra kosten. Voor uitvoertokens geldt de uitvoerprijs.

Model generatie-showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#297 KAT Coder AIR V2.5

medium
Kosten
$0.003
Tijd
23.7s
Tokens
4,924 tok

#304 GPT-4o-mini

none
Kosten
$0.001
Tijd
6.6s
Tokens
742 tok

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
KAT Coder AIR V2.5 3.6 7.0 22.2% 1 23.37s 7,893 5,199 29,973
GPT-4o-mini 3.2 9.6 0.0% 0 1.63s 7,314 367 0

Snelle vergelijking

Vergelijkingspaar wisselen