AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#159

North Mini Code

Cohere रिलीज़: 2026-06-18 परीक्षण किया गया: 2026-07-16 23:46 cohere/north-mini-code::medium
(medium) (none)

सारांश

North Mini Code AI BENCHY पर 5.9 स्कोर करता है और #159 पर है। इसकी reliability 8.6, pass rate 48.5%, कुल लागत $0.000, और औसत response time 137.11s है।

North Mini Code को अलग क्या बनाता है: यह एंटी-एआई ट्रिक्स में सबसे अलग दिखता है, जहाँ इसकी रैंक #3 है; जबकि पहेली समाधान इसकी सबसे कमजोर जगह है, जहाँ यह #10 पर है। इस score range के लिए इसकी कुल benchmark लागत असामान्य रूप से कम है। यह असामान्य रूप से अधिक reasoning tokens इस्तेमाल करता है, जिससे धीमे या महंगे runs समझ में आ सकते हैं।

संगति

8.5

कुल आउटपुट टोकन

1,766,801

कुल इनपुट टोकन

81,813

इनपुट कीमत

$0.000 / 1M

आउटपुट कीमत

$0.000 / 1M

सही परीक्षण

गलत टेस्ट: 13

प्रति प्रयास पास दर: 48.5%

बेंचमार्क कवरेज: 22/22 टेस्ट · 58/66 प्रयास

अस्थिर टेस्ट

4

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

137.11s

प्रतिक्रिया समय (अधिकतम): 786.72s

प्रतिक्रिया समय (कुल): 3016.42s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#159 North Mini Code

medium
लागत
$0.000
समय
51.8s
टोकन
12,460 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-07-16 23:46 नया टेस्ट जोड़ा गया 5.9 8.6 $0.000 वर्तमान रन
2026-06-18 09:44 पहला रन 5.8 8.5 $0.000 तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

रन तुलना

रनबेंचमार्क कवरेजस्कोरसंगतिविश्वसनीयतासही परीक्षणअस्थिर टेस्टकुल आउटपुट टोकनकुल इनपुट टोकनकुल लागतप्रतिक्रिया समय (औसत)
2026-07-16 23:46 · वर्तमान रन22/22 टेस्ट · 58/66 प्रयास5.98.58.69/2241,766,80181,813$0.000137.11s
2026-06-18 09:44 · पहला रन21/21 टेस्ट · 55/63 प्रयास5.88.58.59/2141,446,26132,891$0.000106.18s
अंतर0.00.0+0.100+320540+48922$0.000+30934ms

बेंचमार्क कवरेज अलग है: 22/22 टेस्ट · 58/66 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव) बनाम 21/21 टेस्ट · 55/63 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव)। कुल और दोहराव-संवेदनशील मेट्रिक सीधे तुलना योग्य नहीं हैं।

इन दो रन में अलग-अलग बेंचमार्क सूट इस्तेमाल हुए थे, इसलिए अंतर मॉडल बदलाव और सूट बदलाव दोनों को दर्शाते हैं।

कीमत का इतिहास

OpenRouter से इस मॉडल का ऐतिहासिक मूल्य डेटा।

तारीख इनपुट कीमत आउटपुट कीमत
2026-06-18 09:34 $0.000 / 1M $0.000 / 1M

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
एंटी-एआई ट्रिक्स 8.4 10.0
कोडिंग 4.5 4.9
संयुक्त 2.9 5.8
डेटा पार्सिंग और निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 5.3 7.2
Samanya Buddhimatta 5.1 10.0
निर्देश पालन 9.8 10.0
पहेली समाधान 3.3 10.0
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल