नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Anthropic: Claude Opus 4.8 vs Google: Gemini 3.6 Flash

Gemini 3.6 Flash (high) average score में आगे है: 9.7 vs 8.8. Gemini 3.6 Flash (high) की benchmark लागत कम है: $1.785 vs $1.931. Claude Opus 4.8 (medium) तेज है: 12.49s vs 14.88s, pass rates 84.9% vs 98.5%.

अनुशंसित मॉडलGemini 3.6 Flash (high)It has the strongest score in this comparison (9.7) and the best overall balance of cost and response time across all 2 models.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-21

मेट्रिक Claude Opus 4.8 Claude Opus 4.8 medium रिलीज़: 2026-05-28 Gemini 3.6 Flash Gemini 3.6 Flash high रिलीज़: 2026-07-21
स्कोर 8.8 9.7
रैंक #17 #2
विश्वसनीयता 10.0 10.0
संगति 9.6 9.6
सही परीक्षण
प्रति प्रयास पास दर 84.9% 98.5%
अस्थिर टेस्ट 1 1
कुल रन 66 66
प्रति परिणाम लागत 10.724 8.497
कुल लागत $1.931 $1.785
इनपुट कीमत $5.000 / 1M $1.500 / 1M
आउटपुट कीमत $25.000 / 1M $7.500 / 1M
कुल इनपुट टोकन 138,451 87,819
आउटपुट टोकन 40,766 5,750
रीजनिंग टोकन 9,075 214,596
प्रतिक्रिया समय (औसत) 12.49s 14.88s
प्रतिक्रिया समय (अधिकतम) 70.54s 88.00s
प्रतिक्रिया समय (कुल) 274.72s 327.37s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#17 Claude Opus 4.8

medium
लागत
$0.057
समय
23.1s
टोकन
2,412 tok

#2 Gemini 3.6 Flash

high
लागत
$0.069
समय
44.0s
टोकन
9,251 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.8 10.0 10.0 100.0% 0 15.33s 10,590 9,945 1,381
Gemini 3.6 Flash 10.0 10.0 100.0% 0 26.73s 8,136 448 60,606

त्वरित तुलना

तुलना जोड़ी बदलें