नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Kwaipilot: KAT-Coder-Air V2.5 vs Mistral: Mistral Small 4

KAT-Coder-Air V2.5 (medium) average score में आगे है: 5.6 vs 5.1. Mistral Small 4 की benchmark लागत कम है: $0.022 vs $0.048. Mistral Small 4 तेज है: 1.20s vs 8.42s, pass rates 45.5% vs 25.8%.

अनुशंसित मॉडलMistral Small 4Its score stays close to the best score here (5.1 vs 5.6), while costing about 2.2x less than KAT-Coder-Air V2.5 (medium).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-18

मेट्रिक KAT-Coder-Air V2.5 KAT-Coder-Air V2.5 medium रिलीज़: 2026-07-14 Mistral Small 4 Mistral Small 4 none रिलीज़: 2026-03-16
स्कोर 5.6 5.1
रैंक #145 #161
विश्वसनीयता 9.9 10.0
संगति 8.9 9.6
सही परीक्षण
प्रति प्रयास पास दर 45.5% 25.8%
अस्थिर टेस्ट 3 1
कुल रन 66 66
प्रति परिणाम लागत 0.593 0.432
कुल लागत $0.048 $0.022
इनपुट कीमत $0.150 / 1M $0.150 / 1M
आउटपुट कीमत $0.600 / 1M $0.600 / 1M
कुल इनपुट टोकन 51,472 104,708
आउटपुट टोकन 7,822 9,812
रीजनिंग टोकन 58,352 0
प्रतिक्रिया समय (औसत) 8.42s 1.20s
प्रतिक्रिया समय (अधिकतम) 48.19s 13.16s
प्रतिक्रिया समय (कुल) 185.24s 26.38s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#145 KAT-Coder-Air V2.5

medium
लागत
$0.003
समय
23.7s
टोकन
4,924 tok

#161 Mistral Small 4

none
लागत
$0.002
समय
10.4s
टोकन
2,370 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
KAT-Coder-Air V2.5 3.6 7.0 22.2% 1 23.37s 7,893 5,199 29,973
Mistral Small 4 3.7 9.7 0.0% 0 901ms 7,636 619 0

त्वरित तुलना

तुलना जोड़ी बदलें