नेव्हिगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

तुलना केलेली मॉडेल्स

GPT-5.5 (medium) vs GPT-5.4 (medium) vs Gemini 3.1 Pro Preview (medium) vs Claude Opus 4.7 (medium) benchmark तुलना: Gemini 3.1 Pro Preview (medium) स्कोअर मध्ये 9.2 सह आघाडीवर आहे. GPT-5.5 (medium) विश्वसनीयता मध्ये 10.0 सह आघाडीवर आहे. Gemini 3.1 Pro Preview (medium) चे एकूण खर्च सर्वात कमी आहे: $1.361. Claude Opus 4.7 (medium) 7.61s वर सर्वात जलद आहे.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-08-07

क्रमांक
#15
एकूण आउटपुट टोकन्स
124,436
प्रतिसाद वेळ (सरासरी)
38.42s
एकूण खर्च
$4.137
क्रमांक
#29
एकूण आउटपुट टोकन्स
88,670
प्रतिसाद वेळ (सरासरी)
23.10s
एकूण खर्च
$1.533
क्रमांक
#9
एकूण आउटपुट टोकन्स
97,958
प्रतिसाद वेळ (सरासरी)
21.47s
एकूण खर्च
$1.361
क्रमांक
#23
एकूण आउटपुट टोकन्स
29,990
प्रतिसाद वेळ (सरासरी)
7.61s
एकूण खर्च
$1.477
शिफारस केलेले मॉडेल Gemini 3.1 Pro Preview (medium)

It has the best score here (9.2), while costing about 1.8x less than या तुलनेतील इतर मॉडेल.

तपशीलवार तुलना

मेट्रिक GPT-5.5 GPT-5.5 medium प्रकाशन: 2026-04-24 GPT-5.4 GPT-5.4 medium प्रकाशन: 2026-03-05 Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium प्रकाशन: 2026-02-19 Claude Opus 4.7 Claude Opus 4.7 medium प्रकाशन: 2026-04-16
स्कोअर 9.0 8.5 9.2 8.7
क्रमांक #15 #29 #9 #23
विश्वसनीयता 10.0 10.0 10.0 10.0
सुसंगतता 8.9 8.6 10.0 9.6
बेंचमार्क कव्हरेज 22/22 चाचण्या · 66/66 प्रयत्न 22/22 चाचण्या · 66/66 प्रयत्न 22/22 चाचण्या · 66/66 प्रयत्न 22/22 चाचण्या · 66/66 प्रयत्न
बरोबर चाचण्या
प्रति प्रयत्न पास दर 87.9% 77.3% 90.9% 83.3%
अस्थिर चाचण्या 3 4 0 1
एकूण रन 66 66 66 66
प्रति निकाल खर्च 22.980 10.220 6.801 8.201
एकूण खर्च $4.137 $1.533 $1.361 $1.477
इनपुट किंमत $5.000 / 1M $2.500 / 1M $2.000 / 1M $5.000 / 1M
आउटपुट किंमत $30.000 / 1M $15.000 / 1M $12.000 / 1M $25.000 / 1M
एकूण इनपुट टोकन्स 80,659 81,127 92,287 145,252
आउटपुट टोकन्स 5,617 6,155 5,232 24,948
रिझनिंग टोकन्स 118,819 82,515 92,726 5,042
प्रतिसाद वेळ (सरासरी) 38.42s 23.10s 21.47s 7.61s
प्रतिसाद वेळ (कमाल) 332.10s 100.41s 88.68s 65.40s
प्रतिसाद वेळ (एकूण) 845.35s 508.26s 322.08s 159.91s

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#15 GPT-5.5

medium
खर्च
$0.112
वेळ
71.9s
टोकन्स
3,807 tok

#29 GPT-5.4

medium
खर्च
$0.214
वेळ
199.6s
टोकन्स
14,349 tok

#9 Gemini 3.1 Pro Preview

medium
खर्च
$0.115
वेळ
87.2s
टोकन्स
9,629 tok

#23 Claude Opus 4.7

medium
खर्च
$0.059
वेळ
26.8s
टोकन्स
2,475 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
GPT-5.5 8.8 7.8 88.9% 1 59.77s 7,305 362 24,959
GPT-5.4 8.8 7.8 88.9% 1 44.36s 7,305 433 24,216
Gemini 3.1 Pro Preview 7.9 9.9 66.7% 0 40.17s 8,124 435 41,247
Claude Opus 4.7 7.6 7.2 77.8% 1 12.96s 10,635 7,629 1,114

झटपट तुलना

तुलना जोडी बदला