AI BENCHY
Advertise here
#173

KAT-Coder-Air V2.5

Kwaipilot रिलीज़: 2026-07-14 परीक्षण किया गया: 2026-07-16 23:35 kwaipilot/kat-coder-air-v2.5::high

सारांश

KAT-Coder-Air V2.5 AI BENCHY पर 5.6 स्कोर करता है और #173 पर है। इसकी reliability 9.9, pass rate 43.9%, कुल लागत $0.077, और औसत response time 15.90s है।

KAT-Coder-Air V2.5 को अलग क्या बनाता है: यह संयुक्त में सबसे अलग दिखता है, जहाँ इसकी रैंक #1 है; जबकि डेटा पार्सिंग और निष्कर्षण इसकी सबसे कमजोर जगह है, जहाँ यह #11 पर है। यह असामान्य रूप से अधिक reasoning tokens इस्तेमाल करता है, जिससे धीमे या महंगे runs समझ में आ सकते हैं।

संगति

7.7

कुल आउटपुट टोकन

115,331

कुल इनपुट टोकन

50,470

इनपुट कीमत

$0.150 / 1M

आउटपुट कीमत

$0.600 / 1M

सही परीक्षण

गलत टेस्ट: 15

प्रति प्रयास पास दर: 43.9%

अस्थिर टेस्ट

6

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

15.90s

प्रतिक्रिया समय (अधिकतम): 118.35s

प्रतिक्रिया समय (कुल): 349.71s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#173 KAT-Coder-Air V2.5

high
अमान्य SVG
लागत
$0.000
समय
300.0s
टोकन
0 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-07-16 23:35 नया टेस्ट जोड़ा गया 5.6 9.9 $0.077 वर्तमान रन
2026-07-14 11:05 पहला रन 6.2 9.7 $0.064 तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

कीमत का इतिहास

OpenRouter से इस मॉडल का ऐतिहासिक मूल्य डेटा।

तारीख इनपुट कीमत आउटपुट कीमत
2026-07-14 11:25 $0.150 / 1M $0.600 / 1M

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
एंटी-एआई ट्रिक्स 6.9 5.8
कोडिंग 4.3 7.3
संयुक्त 6.5 10.0
डेटा पार्सिंग और निष्कर्षण 6.5 10.0
डोमेन-विशिष्ट 2.9 7.2
Samanya Buddhimatta 5.1 10.0
निर्देश पालन 9.8 10.0
पहेली समाधान 3.5 4.4
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल