Gemini 3 Flash Preview

Google रिलीज़: 2025-12-17 परीक्षण किया गया: 2026-05-06 13:38 google/gemini-3-flash-preview::medium

(medium) (low) (none)

सारांश

Gemini 3 Flash Preview AI BENCHY पर 9.8 स्कोर करता है और #1 पर है। इसकी reliability 10.0, pass rate 98.2%, कुल लागत $0.320, और औसत response time 11.53s है।

Gemini 3 Flash Preview को अलग क्या बनाता है: यह डोमेन-विशिष्ट में सबसे अलग दिखता है, जहाँ इसकी रैंक #1 है; जबकि पहेली समाधान इसकी सबसे कमजोर जगह है, जहाँ यह #8 पर है। यह कुल मिलाकर सबसे ऊँची रैंक वाले मॉडलों में से एक है। इस score range के लिए इसकी कुल benchmark लागत असामान्य रूप से कम है।

स्कोर

9.8

संगति

9.6

विश्वसनीयता

10.0

कुल लागत (वर्तमान कीमत)

$0.320

कुल आउटपुट टोकन

101,480

कुल इनपुट टोकन

इनपुट कीमत

$0.500 / 1M

आउटपुट कीमत

$3.000 / 1M

सही परीक्षण

गलत टेस्ट: 1

प्रति प्रयास पास दर: 98.2%

अस्थिर टेस्ट

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

11.53s

प्रतिक्रिया समय (अधिकतम): 74.66s

प्रतिक्रिया समय (कुल): 207.46s

निर्देशों का पालन नहीं किया: 1

जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#1 Gemini 3 Flash Preview

medium

लागत: $0.010
समय: 17.9s
टोकन: 3,236 tok

रन इतिहास

परीक्षण किया गया	स्कोर	विश्वसनीयता	कुल लागत	तुलना करें
2026-06-04 13:59 नया टेस्ट जोड़ा गया	9.8	10.0	$0.667	तुलना करें
2026-05-22 00:28 सूट बदला गया	9.8	10.0	$0.567	तुलना करें
2026-05-06 13:52 सूट बदला गया	10.0	10.0	$0.321	तुलना करें
2026-05-06 13:38 सूट बदला गया	9.8	10.0	$0.320	वर्तमान रन
2026-04-23 15:25 दोबारा परीक्षण	10.0	लागू नहीं	$0.108	तुलना करें
2026-04-11 01:44 पहला दर्ज रन	10.0	लागू नहीं	$0.314	तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

रन तुलना

रन	स्कोर	संगति	विश्वसनीयता	सही परीक्षण	अस्थिर टेस्ट	कुल आउटपुट टोकन	कुल लागत	प्रतिक्रिया समय (औसत)
2026-05-06 13:38 · सूट बदला गया	9.8	9.6	10.0	17/18	1	101,480	$0.320	11.53s
2026-05-06 13:52 · सूट बदला गया	10.0	10.0	10.0	18/18	0	101,771	$0.321	11.76s
अंतर	-0.2	-0.4	0.0	-1	+1	-291	-$0.001	-230ms

इन दो रन में अलग-अलग बेंचमार्क सूट इस्तेमाल हुए थे, इसलिए अंतर मॉडल बदलाव और सूट बदलाव दोनों को दर्शाते हैं।

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

Gemini 3 Flash PreviewmediumvsGemini 3.5 Flashhigh Gemini 3 Flash PreviewmediumvsQwen3.7 Maxmedium Gemini 3 Flash PreviewmediumvsGPT-5.5low Gemini 3 Flash PreviewmediumvsGemini 3.5 Flashlow Gemini 3 Flash PreviewmediumvsNemotron 3 Ultra 550b A55bmediumनिःशुल्क उपलब्ध

श्रेणी विवरण

श्रेणी	स्कोर	संगति
एंटी-एआई ट्रिक्स	10.0	10.0
कोडिंग	10.0	10.0
संयुक्त	10.0	10.0
डेटा पार्सिंग और निष्कर्षण	10.0	10.0
डोमेन-विशिष्ट	10.0	10.0
Samanya Buddhimatta	10.0	10.0
निर्देश पालन	10.0	10.0
पहेली समाधान	9.0	7.9
टूल कॉलिंग	10.0	10.0

Gemini 3 Flash Preview

Hamster playing table tennis

#1 Gemini 3 Flash Preview

चार्ट

स्कोर के अनुसार शीर्ष मॉडल

स्कोर vs कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

तुलना किए गए मॉडल