Navigatie
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

LongCat 2.0 (medium) vs Grok Build 0.1 (medium)

De gemiddelde score is vrijwel gelijk met 7.4 vs 7.5. LongCat 2.0 (medium) heeft lagere benchmarkkosten met $0.499 vs $1.130. Grok Build 0.1 (medium) is sneller met 54.50s vs 143.55s, met slagingspercentages van 59.1% vs 60.6%.

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-08-15

Rang
#94
Totaal aantal uitvoer-tokens
390,873
Responstijd (gem.)
143.55s
Totale kosten
$0.499
Rang
#89
Totaal aantal uitvoer-tokens
511,406
Responstijd (gem.)
54.50s
Totale kosten
$1.130
Aanbevolen model LongCat 2.0 (medium)

Het heeft hier de beste score (7.4) en kost ongeveer 2.3x minder dan Grok Build 0.1 (medium).

Gedetailleerde vergelijking

Metriek LongCat 2.0 LongCat 2.0 medium Releasedatum: 2026-07-20 Grok Build 0.1 Grok Build 0.1 medium Releasedatum: 2026-05-21
Score 7.4 7.5
Rang #94 #89
Betrouwbaarheid 10.0 10.0
Consistentie 9.3 9.6
Pogingen 66/66 66/66
Correcte tests
Slaagpercentage per poging 59.1% 60.6%
Instabiele tests 2 1
Totaal runs 66 66
Kosten per resultaat 4.153 8.691
Totale kosten $0.499 $1.130
Invoerprijs $0.300 / 1M $1.000 / 1M
Uitvoerprijs $1.200 / 1M $2.000 / 1M
Totaal aantal invoer-tokens 97,324 106,946
Uitvoer-tokens 44,383 7,993
Redeneer-tokens 346,490 503,413
Responstijd (gem.) 143.55s 54.50s
Responstijd (max) 939.52s 252.69s
Responstijd (totaal) 3158.11s 1199.07s
Parameters 1.6T totaal (48B actief) ~300B totaal (~30B actief)
Beschikbaarheid Open-source Gesloten broncode

Model generatie-showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#94 LongCat 2.0

medium
Kosten
$0.016
Tijd
285.1s
Tokens
13,057 tok

#89 SpaceXAI: Grok Build 0.1

medium
Kosten
$0.028
Tijd
81.3s
Tokens
14,009 tok

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Score vs Responstijd (gem.)

Totaal aantal uitvoer-tokens

Score vs Totaal aantal uitvoer-tokens

Categorie-uitsplitsing

Programmeren Score Consistentie Slaagpercentage per poging Instabiele tests Correcte tests Responstijd (gem.) Invoer-tokens Uitvoer-tokens Redeneer-tokens
LongCat 2.0 10.0 10.0 100.0% 0 455.00s 7,419 533 214,143
Grok Build 0.1 5.7 9.7 33.3% 0 108.46s 8,304 1,138 161,452

Snelle vergelijking

Vergelijkingspaar wisselen