नेव्हिगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

तुलना केलेली मॉडेल्स

Kimi K2.6 (medium) vs Kimi K2.5 (medium) vs GLM 5 (medium) vs Claude Opus 4.7 (medium) benchmark तुलना: Claude Opus 4.7 (medium) स्कोअर मध्ये 8.7 सह आघाडीवर आहे. Kimi K2.5 (medium) विश्वसनीयता मध्ये 10.0 सह आघाडीवर आहे. GLM 5 (medium) चे एकूण खर्च सर्वात कमी आहे: $0.307. Claude Opus 4.7 (medium) 7.61s वर सर्वात जलद आहे.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-07-28

क्रमांक
#78
एकूण आउटपुट टोकन्स
391,540
प्रतिसाद वेळ (सरासरी)
109.98s
एकूण खर्च
$0.831
क्रमांक
#87
एकूण आउटपुट टोकन्स
227,367
प्रतिसाद वेळ (सरासरी)
99.00s
एकूण खर्च
$0.600
क्रमांक
#50
एकूण आउटपुट टोकन्स
124,566
प्रतिसाद वेळ (सरासरी)
33.54s
एकूण खर्च
$0.307
क्रमांक
#20
एकूण आउटपुट टोकन्स
29,990
प्रतिसाद वेळ (सरासरी)
7.61s
एकूण खर्च
$1.477
शिफारस केलेले मॉडेल Claude Opus 4.7 (medium)

It has the best score here (8.7), while responding about 10.6x faster than या तुलनेतील इतर मॉडेल.

तपशीलवार तुलना

मेट्रिक Kimi K2.6 Kimi K2.6 medium प्रकाशन: 2026-04-20 Kimi K2.5 Kimi K2.5 medium प्रकाशन: 2026-01-27 GLM 5 GLM 5 medium प्रकाशन: 2026-02-12 Claude Opus 4.7 Claude Opus 4.7 medium प्रकाशन: 2026-04-16
स्कोअर 7.2 7.0 7.7 8.7
क्रमांक #78 #87 #50 #20
विश्वसनीयता 9.4 10.0 10.0 10.0
सुसंगतता 8.3 7.0 8.1 9.6
बरोबर चाचण्या
प्रति प्रयत्न पास दर 63.6% 65.2% 78.8% 83.3%
अस्थिर चाचण्या 4 8 4 1
एकूण रन 66 66 63 66
प्रति निकाल खर्च 9.821 4.789 1.668 8.201
एकूण खर्च $0.831 $0.600 $0.307 $1.477
इनपुट किंमत $0.646 / 1M $0.571 / 1M $0.950 / 1M $5.000 / 1M
आउटपुट किंमत $2.720 / 1M $2.850 / 1M $2.551 / 1M $25.000 / 1M
एकूण इनपुट टोकन्स 68,902 118,448 35,224 145,252
आउटपुट टोकन्स 111,680 62,124 21,570 24,948
रिझनिंग टोकन्स 279,860 165,243 102,996 5,042
प्रतिसाद वेळ (सरासरी) 109.98s 99.00s 33.54s 7.61s
प्रतिसाद वेळ (कमाल) 876.20s 281.00s 99.85s 65.40s
प्रतिसाद वेळ (एकूण) 2309.56s 1485.04s 435.99s 159.91s

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#78 MoonshotAI: Kimi K2.6

medium
खर्च
$0.013
वेळ
103.4s
टोकन्स
3,620 tok

#87 MoonshotAI: Kimi K2.5

medium
खर्च
$0.030
वेळ
58.6s
टोकन्स
8,683 tok

#50 GLM 5

medium
खर्च
$0.005
वेळ
20.7s
टोकन्स
2,068 tok

#20 Claude Opus 4.7

medium
खर्च
$0.059
वेळ
26.8s
टोकन्स
2,475 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Kimi K2.6 5.7 8.6 33.3% 0 214.42s 2,925 9,970 77,189
Kimi K2.5 6.1 4.6 66.7% 2 217.49s 6,935 5,705 74,693
GLM 5 10.0 10.0 100.0% 0 74.30s 7,254 2,997 52,930
Claude Opus 4.7 7.6 7.2 77.8% 1 12.96s 10,635 7,629 1,114

झटपट तुलना

तुलना जोडी बदला