AI BENCHY
Advertise here
#31

GPT-5.6 Terra

OpenAI रिलीज़: 2026-07-09 परीक्षण किया गया: 2026-07-16 22:40 openai/gpt-5.6-terra::high
~1T कुल (~60B सक्रिय)MoEबंद स्रोतअनुमानित

सारांश

GPT-5.6 Terra AI BENCHY पर 8.0 स्कोर करता है और #31 पर है। इसकी reliability 10.0, pass rate 68.2%, कुल लागत $1.055, और औसत response time 11.32s है।

GPT-5.6 Terra को अलग क्या बनाता है: यह डोमेन-विशिष्ट में सबसे अलग दिखता है, जहाँ इसकी रैंक #3 है; जबकि पहेली समाधान इसकी सबसे कमजोर जगह है, जहाँ यह #17 पर है।

मॉडल विवरण

शोध की तारीख: 2026-08-12

अनुमानित
पैरामीटर
~1T कुल (~60B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
बंद स्रोत
लाइसेंस
-

सार्वजनिक साक्ष्यों पर आधारित सर्वोत्तम अनुमान; प्रदाता ने सभी मान जारी नहीं किए हैं।

संगति

9.3

कुल आउटपुट टोकन

56,791

कुल इनपुट टोकन

81,047

इनपुट कीमत

$2.500 / 1M

आउटपुट कीमत

$15.000 / 1M

सही परीक्षण

गलत टेस्ट: 8

प्रति प्रयास पास दर: 68.2%

अस्थिर टेस्ट

2

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

11.32s

प्रतिक्रिया समय (अधिकतम): 91.49s

प्रतिक्रिया समय (कुल): 249.14s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#31 GPT-5.6 Terra

high
लागत
$0.055
समय
30.2s
टोकन
3,748 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-08-14 02:25 दोबारा परीक्षण 8.0 10.0 $0.418 तुलना करें
2026-07-16 22:40 नया टेस्ट जोड़ा गया 8.0 10.0 $1.055 वर्तमान रन
2026-07-09 21:31 पहला रन 8.2 10.0 $0.852 तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

कीमत का इतिहास

OpenRouter से इस मॉडल का ऐतिहासिक मूल्य डेटा।

तारीख इनपुट कीमत आउटपुट कीमत
2026-07-09 21:33 $2.500 / 1M $15.000 / 1M

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
एंटी-एआई ट्रिक्स 8.3 10.0
कोडिंग 7.6 7.2
संयुक्त 8.7 6.9
डेटा पार्सिंग और निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 5.3 10.0
Samanya Buddhimatta 5.1 10.0
निर्देश पालन 10.0 10.0
पहेली समाधान 7.7 10.0
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल