Navigation
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

LongCat 2.0 (medium) vs Grok 4.6 (low)

Le score moyen est pratiquement à égalité avec 7.4 vs 7.4. Grok 4.6 (low) a le coût de benchmark le plus bas avec $0.441 vs $0.478. Grok 4.6 (low) est plus rapide avec 14.20s vs 136.64s, avec des taux de réussite de 60.6% vs 71.2%.

Benchmarks générés à partir des suites de tests AI BENCHY le: 2026-08-12

Rang
#88
Total des jetons de sortie
373,396
Temps de réponse (moy.)
136.64s
Coût total
$0.478
Rang
#90
Total des jetons de sortie
36,792
Temps de réponse (moy.)
14.20s
Coût total
$0.441
Modèle recommandé Grok 4.6 (low)

Il obtient le meilleur score ici (7.4) et répond environ 9.6x plus vite que LongCat 2.0 (medium).

Comparaison détaillée

Métrique LongCat 2.0 LongCat 2.0 medium Sortie: 2026-07-20 Grok 4.6 Grok 4.6 low Sortie: 2026-08-12
Score 7.4 7.4
Rang #88 #90
Fiabilité 9.8 10.0
Cohérence 8.9 9.2
Tentatives 66/66 66/66
Tests corrects
Taux de réussite par tentative 60.6% 71.2%
Tests instables 3 2
Exécutions totales 66 66
Coût par résultat 3.978 2.938
Coût total $0.478 $0.441
Prix d'entrée $0.300 / 1M $2.000 / 1M
Prix de sortie $1.200 / 1M $6.000 / 1M
Total des jetons d'entrée 97,315 109,951
Jetons de sortie 44,384 5,124
Jetons de raisonnement 329,012 31,668
Temps de réponse (moy.) 136.64s 14.20s
Temps de réponse (max) 939.52s 26.46s
Temps de réponse (total) 3006.01s 312.33s
Paramètres 1.6T au total (48B actifs) ~1.7T au total (~170B actifs)
Disponibilité Open source Source fermée

Génération showcase de modèles

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#88 LongCat 2.0

medium
Coût
$0.016
Temps
285.1s
Tokens
13,057 tok

#90 SpaceXAI: Grok 4.6

low
Coût
$0.011
Temps
26.0s
Tokens
1,941 tok

Meilleurs modèles par score

Score vs coût total

Temps de réponse (moy.)

Score vs Temps de réponse (moy.)

Total des jetons de sortie

Score vs Total des jetons de sortie

Répartition par catégorie

Programmation Score Cohérence Taux de réussite par tentative Tests instables Tests corrects Temps de réponse (moy.) Jetons d'entrée Jetons de sortie Jetons de raisonnement
LongCat 2.0 10.0 10.0 100.0% 0 455.00s 7,419 533 214,143
Grok 4.6 5.5 7.1 44.4% 1 21.69s 9,579 349 7,740

Comparaison rapide

Changer la paire de comparaison