नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

तुलना किए गए मॉडल

GPT-6 Astra (high) vs Gemini 3.8 Flash (high) vs Claude Fable 5.1 (high) benchmark तुलना: Gemini 3.8 Flash (high) स्कोर में 9.9 के साथ आगे है। Gemini 3.8 Flash (high) विश्वसनीयता में 10.0 के साथ आगे है। Gemini 3.8 Flash (high) का कुल लागत सबसे कम है: $1.595. Claude Fable 5.1 (high) 13.59s पर सबसे तेज है।

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-04

रैंक
#4
कुल आउटपुट टोकन
53,622
प्रतिक्रिया समय (औसत)
18.65s
कुल लागत
$3.474
रैंक
#2
कुल आउटपुट टोकन
408,188
प्रतिक्रिया समय (औसत)
37.19s
कुल लागत
$1.595
रैंक
#25
कुल आउटपुट टोकन
40,071
प्रतिक्रिया समय (औसत)
13.59s
कुल लागत
$3.364
अनुशंसित मॉडल Gemini 3.8 Flash (high)

It has the best score here (9.9), while costing about 2.1x less than इस तुलना के बाकी मॉडल.

विस्तृत तुलना

मेट्रिक GPT-6 Astra GPT-6 Astra high रिलीज़: 2026-09-04 Gemini 3.8 Flash Gemini 3.8 Flash high रिलीज़: 2026-09-02 Claude Fable 5.1 Claude Fable 5.1 high रिलीज़: 2026-09-02
स्कोर 9.9 9.9 9.0
रैंक #4 #2 #25
विश्वसनीयता 9.9 10.0 10.0
संगति 9.6 9.6 9.6
प्रयास 66/66 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 97.0% 98.5% 89.4%
अस्थिर टेस्ट 1 1 1
कुल रन 66 66 66
प्रति परिणाम लागत 16.543 7.592 17.701
कुल लागत $3.474 $1.595 $3.364
इनपुट कीमत $10.000 / 1M $0.750 / 1M $10.000 / 1M
आउटपुट कीमत $50.000 / 1M $3.750 / 1M $50.000 / 1M
कुल इनपुट टोकन 79,290 84,593 135,958
आउटपुट टोकन 4,847 10,517 7,930
रीजनिंग टोकन 48,775 397,671 32,141
प्रतिक्रिया समय (औसत) 18.65s 37.19s 13.59s
प्रतिक्रिया समय (अधिकतम) 254.93s 177.08s 40.17s
प्रतिक्रिया समय (कुल) 410.28s 818.19s 298.90s
पैरामीटर ~2T कुल (~150B सक्रिय) ~500B कुल (~20B सक्रिय) ~9.5T कुल (~878B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#4 GPT-6 Astra

high
लागत
$0.457
समय
176.7s
टोकन
9,218 tok

#2 Gemini 3.8 Flash

high
लागत
$0.077
समय
129.1s
टोकन
20,373 tok

#25 Claude Fable 5.1

high
लागत
$0.384
समय
102.5s
टोकन
7,824 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
GPT-6 Astra 10.0 10.0 100.0% 0 5.86s 7,302 392 2,387
Gemini 3.8 Flash 10.0 10.0 100.0% 0 29.30s 8,118 462 50,196
Claude Fable 5.1 8.4 7.4 88.9% 1 13.91s 10,608 520 6,503

त्वरित तुलना

तुलना जोड़ी बदलें