नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Anthropic: Claude Opus 4.8 vs Xiaomi: MiMo-V2.5-Pro

Claude Opus 4.8 average score में आगे है: 7.3 vs 6.9. MiMo-V2.5-Pro (medium) की benchmark लागत कम है: $0.187 vs $1.166. Claude Opus 4.8 तेज है: 4.91s vs 33.92s, pass rates 63.6% vs 66.7%.

अनुशंसित मॉडलClaude Opus 4.8It has the best score here (7.3), while responding about 6.9x faster than MiMo-V2.5-Pro (medium).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-25

मेट्रिक Claude Opus 4.8 Claude Opus 4.8 none रिलीज़: 2026-05-28 MiMo-V2.5-Pro MiMo-V2.5-Pro medium रिलीज़: 2026-04-22
स्कोर 7.3 6.9
रैंक #74 #92
विश्वसनीयता 10.0 10.0
संगति 9.2 8.2
सही परीक्षण
प्रति प्रयास पास दर 63.6% 66.7%
अस्थिर टेस्ट 2 5
कुल रन 66 66
प्रति परिणाम लागत 8.969 3.218
कुल लागत $1.166 $0.187
इनपुट कीमत $5.000 / 1M $0.435 / 1M
आउटपुट कीमत $25.000 / 1M $0.870 / 1M
कुल इनपुट टोकन 149,206 139,883
आउटपुट टोकन 16,797 15,521
रीजनिंग टोकन 0 130,992
प्रतिक्रिया समय (औसत) 4.91s 33.92s
प्रतिक्रिया समय (अधिकतम) 35.03s 197.54s
प्रतिक्रिया समय (कुल) 108.03s 746.19s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#74 Claude Opus 4.8

none
लागत
$0.053
समय
22.0s
टोकन
2,253 tok

#92 MiMo-V2.5-Pro

medium
अमान्य SVG
लागत
$0.000
समय
300.0s
टोकन
0 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.8 5.5 10.0 33.3% 0 3.29s 10,590 1,332 0
MiMo-V2.5-Pro 6.2 4.7 66.7% 2 92.07s 6,543 780 51,218

त्वरित तुलना

तुलना जोड़ी बदलें