नेविगेशन
AI BENCHY
Advertise here

Claude Opus 4.8 (low) vs Seed-2.0-Lite (medium)

average score लगभग बराबर है: 7.8 vs 7.8. Seed-2.0-Lite (medium) की benchmark लागत कम है: $0.236 vs $2.089. Claude Opus 4.8 (low) तेज है: 12.88s vs 47.94s, pass rates 80.3% vs 69.7%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-15

रैंक
#70
कुल आउटपुट टोकन
52,237
प्रतिक्रिया समय (औसत)
12.88s
कुल लागत
$2.089
रैंक
#69
कुल आउटपुट टोकन
101,296
प्रतिक्रिया समय (औसत)
47.94s
कुल लागत
$0.236
अनुशंसित मॉडल Seed-2.0-Lite (medium)

It has the best score here (7.8), while costing about 8.9x less than Claude Opus 4.8 (low).

विस्तृत तुलना

मेट्रिक Claude Opus 4.8 Claude Opus 4.8 low रिलीज़: 2026-05-28 Seed-2.0-Lite Seed-2.0-Lite medium रिलीज़: 2026-02-14
स्कोर 7.8 7.8
रैंक #70 #69
विश्वसनीयता 10.0 10.0
संगति 8.9 8.6
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 80.3% 69.7%
अस्थिर टेस्ट 3 4
कुल रन 66 66
प्रति परिणाम लागत 13.054 1.809
कुल लागत $2.089 $0.236
इनपुट कीमत $5.000 / 1M $0.250 / 1M
आउटपुट कीमत $25.000 / 1M $2.000 / 1M
कुल इनपुट टोकन 156,522 129,906
आउटपुट टोकन 43,056 12,530
रीजनिंग टोकन 9,181 88,766
प्रतिक्रिया समय (औसत) 12.88s 47.94s
प्रतिक्रिया समय (अधिकतम) 127.97s 254.92s
प्रतिक्रिया समय (कुल) 283.32s 1054.57s
पैरामीटर ~5T कुल (~500B सक्रिय) ~200B कुल (~20B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#70 Claude Opus 4.8

low
लागत
$0.031
समय
14.1s
टोकन
1,345 tok

#69 Seed-2.0-Lite

medium
लागत
$0.005
समय
86.7s
टोकन
2,354 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.8 6.6 4.6 77.8% 2 7.58s 10,590 3,637 809
Seed-2.0-Lite 8.0 9.8 66.7% 0 156.74s 8,247 458 31,890

त्वरित तुलना

तुलना जोड़ी बदलें