नेविगेशन
Advertise here

Claude Opus 4.8 (medium) vs Kimi K3 (max)

Claude Opus 4.8 (medium) average score में आगे है: 8.8 vs 7.9. Claude Opus 4.8 (medium) की benchmark लागत कम है: $1.983 vs $3.467. Claude Opus 4.8 (medium) तेज है: 12.97s vs 142.84s, pass rates 83.3% vs 77.3%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-10

तुलना किए गए मॉडल

रैंक
#39
कुल आउटपुट टोकन
51,927
प्रतिक्रिया समय (औसत)
12.97s
कुल लागत
$1.983
रैंक
#78
कुल आउटपुट टोकन
224,128
प्रतिक्रिया समय (औसत)
142.84s
कुल लागत
$3.467
अनुशंसित मॉडल Claude Opus 4.8 (medium)

It has the best score here (8.8), while costing about 1.7x less than Kimi K3 (max).

विस्तृत तुलना

मेट्रिक Claude Opus 4.8 Claude Opus 4.8 medium रिलीज़: 2026-05-28 Kimi K3 Kimi K3 max रिलीज़: 2026-07-16
स्कोर 8.8 7.9
रैंक #39 #78
विश्वसनीयता 10.0 9.0
संगति 9.2 9.2
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 83.3% 77.3%
अस्थिर टेस्ट 2 2
कुल रन 66 66
प्रति परिणाम लागत 11.662 21.668
कुल लागत $1.983 $3.467
इनपुट कीमत $5.000 / 1M $3.000 / 1M
आउटपुट कीमत $25.000 / 1M $15.000 / 1M
कुल इनपुट टोकन 138,448 34,960
आउटपुट टोकन 40,765 2,887
रीजनिंग टोकन 11,162 221,241
प्रतिक्रिया समय (औसत) 12.97s 142.84s
प्रतिक्रिया समय (अधिकतम) 70.54s 766.58s
प्रतिक्रिया समय (कुल) 285.29s 2714.02s
पैरामीटर ~5T कुल (~500B सक्रिय) 2.8T कुल (104B सक्रिय)
उपलब्धता बंद स्रोत वेट उपलब्ध

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#39 Claude Opus 4.8

medium
लागत
$0.057
समय
23.1s
टोकन
2,412 tok

#78 MoonshotAI: Kimi K3

max
लागत
$0.281
समय
506.9s
टोकन
18,863 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.8 10.0 10.0 100.0% 0 15.33s 10,590 9,945 1,381
Kimi K3 10.0 10.0 100.0% 0 325.79s 8,061 460 84,012

त्वरित तुलना

तुलना जोड़ी बदलें