नेविगेशन
Advertise here

KAT-Coder-Air V2.5 (high) vs GPT-5.4

GPT-5.4 average score में आगे है: 5.8 vs 5.6. KAT-Coder-Air V2.5 (high) की benchmark लागत कम है: $0.077 vs $0.397. GPT-5.4 तेज है: 2.08s vs 15.87s, pass rates 42.4% vs 34.9%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-10

तुलना किए गए मॉडल

रैंक
#234
कुल आउटपुट टोकन
114,654
प्रतिक्रिया समय (औसत)
15.87s
कुल लागत
$0.077
रैंक
#223
कुल आउटपुट टोकन
8,339
प्रतिक्रिया समय (औसत)
2.08s
कुल लागत
$0.397
अनुशंसित मॉडल GPT-5.4

It has the best score here (5.8), while responding about 7.6x faster than KAT-Coder-Air V2.5 (high).

विस्तृत तुलना

मेट्रिक KAT-Coder-Air V2.5 KAT-Coder-Air V2.5 high रिलीज़: 2026-07-14 GPT-5.4 GPT-5.4 none रिलीज़: 2026-03-05
स्कोर 5.6 5.8
रैंक #234 #223
विश्वसनीयता 9.8 10.0
संगति 8.1 9.2
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 42.4% 34.9%
अस्थिर टेस्ट 5 2
कुल रन 66 66
प्रति परिणाम लागत 1.091 5.667
कुल लागत $0.077 $0.397
इनपुट कीमत $0.150 / 1M $2.500 / 1M
आउटपुट कीमत $0.600 / 1M $15.000 / 1M
कुल इनपुट टोकन 50,423 108,641
आउटपुट टोकन 4,144 8,339
रीजनिंग टोकन 110,510 0
प्रतिक्रिया समय (औसत) 15.87s 2.08s
प्रतिक्रिया समय (अधिकतम) 118.35s 15.63s
प्रतिक्रिया समय (कुल) 349.16s 45.75s
पैरामीटर ~35B कुल (~3B सक्रिय) ~1.5T कुल (~100B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#234 KAT-Coder-Air V2.5

high
Reached the allocated time limit (300 seconds) without receiving showcase output.
लागत
$0.000
समय
300.0s
टोकन
0 tok

#223 GPT-5.4

none
लागत
$0.026
समय
18.1s
टोकन
1,792 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
KAT-Coder-Air V2.5 4.3 7.3 11.1% 1 39.07s 6,948 1,166 55,883
GPT-5.4 5.5 10.0 33.3% 0 1.62s 7,305 516 0

त्वरित तुलना

तुलना जोड़ी बदलें