नेव्हिगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Trinity Large Thinking (medium) vs GPT-5.6 Luna (low)

GPT-5.6 Luna (low) average score मध्ये पुढे आहे: 6.2 vs 6.1. GPT-5.6 Luna (low) चा benchmark खर्च कमी आहे: $0.026 vs $0.798. GPT-5.6 Luna (low) वेगवान आहे: 5.20s vs 85.44s, pass rates 48.5% vs 54.5%.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-08-14

क्रमांक
#169
एकूण आउटपुट टोकन्स
1,016,785
प्रतिसाद वेळ (सरासरी)
85.44s
एकूण खर्च
$0.798
क्रमांक
#160
एकूण आउटपुट टोकन्स
26,286
प्रतिसाद वेळ (सरासरी)
5.20s
एकूण खर्च
$0.026
शिफारस केलेले मॉडेल GPT-5.6 Luna (low)

It has the best score here (6.2), while costing about 31.4x less than Trinity Large Thinking (medium).

तपशीलवार तुलना

मेट्रिक Trinity Large Thinking Trinity Large Thinking medium प्रकाशन: 2026-07-28 GPT-5.6 Luna GPT-5.6 Luna low प्रकाशन: 2026-07-09
स्कोअर 6.1 6.2
क्रमांक #169 #160
विश्वसनीयता 10.0 10.0
सुसंगतता 7.9 8.2
प्रयत्न 66/66 66/66
बरोबर चाचण्या
प्रति प्रयत्न पास दर 48.5% 54.5%
अस्थिर चाचण्या 6 5
एकूण रन 66 66
प्रति निकाल खर्च 9.972 2.437
एकूण खर्च $0.798 $0.026
इनपुट किंमत $0.220 / 1M $0.100 / 1M
आउटपुट किंमत $0.850 / 1M $0.600 / 1M
एकूण इनपुट टोकन्स 118,486 96,355
आउटपुट टोकन्स 156,166 8,213
रिझनिंग टोकन्स 860,619 18,073
प्रतिसाद वेळ (सरासरी) 85.44s 5.20s
प्रतिसाद वेळ (कमाल) 525.14s 19.44s
प्रतिसाद वेळ (एकूण) 1879.75s 114.46s
पॅरामीटर्स 398B एकूण (13B सक्रिय) ~400B एकूण (~17B सक्रिय)
उपलब्धता वेट्स उपलब्ध बंद स्रोत

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#169 Trinity Large Thinking

medium
खर्च
$0.016
वेळ
75.9s
टोकन्स
19,401 tok

#160 GPT-5.6 Luna

low
खर्च
$0.011
वेळ
10.2s
टोकन्स
1,897 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Trinity Large Thinking 7.5 10.0 66.7% 0 179.02s 7,248 7,413 351,155
GPT-5.6 Luna 5.5 10.0 33.3% 0 4.61s 7,302 557 3,535

झटपट तुलना

तुलना जोडी बदला