التنقل
AI BENCHY
Advertise here

AI BENCHY Compare

Inception: Mercury 2 vs Qwen: Qwen3.6 Flash

الملخص

مقارنة benchmark بين Mercury 2 و Qwen3.6 Flash: يتقدم Qwen3.6 Flash في متوسط النتيجة بـ 6.0 مقابل 4.6. لدى Mercury 2 تكلفة benchmark أقل عند $0.011 مقابل $0.015. Mercury 2 أسرع عند 653ms مقابل 1.60s، مع معدلات نجاح 23.8% مقابل 33.3%.

النموذج الموصى به: Mercury 2 - It offers the best overall trade-off: a competitive score (4.6), lower cost than Qwen3.6 Flash, and balanced response time.

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-06-18

المقياس Mercury 2 Mercury 2 none الإصدار: 2026-02-24 Qwen3.6 Flash Qwen3.6 Flash none الإصدار: 2026-04-20
النتيجة 4.6 6.0
الترتيب #151 #102
الموثوقية 10.0 10.0
الاتساق 9.2 10.0
اختبارات صحيحة
معدل النجاح لكل محاولة 23.8% 33.3%
اختبارات غير مستقرة 2 0
إجمالي مرات التشغيل 63 63
التكلفة لكل نتيجة 0.259 0.266
إجمالي التكلفة $0.011 $0.015
سعر الإدخال $0.250 / 1M $0.188 / 1M
سعر الإخراج $0.750 / 1M $1.125 / 1M
إجمالي رموز الإدخال 28,113 50,810
رموز الإخراج 4,439 4,164
رموز الاستدلال 0 0
زمن الاستجابة (المتوسط) 653ms 1.60s
زمن الاستجابة (الحد الأقصى) 1.43s 4.60s
زمن الاستجابة (الإجمالي) 13.72s 33.59s

عرض إنشاء

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#151 Mercury 2

none
التكلفة
$0.002
الوقت
1.8s
الرموز
1,514 tok

#102 Qwen3.6 Flash

none
التكلفة
$0.005
الوقت
20.1s
الرموز
4,211 tok

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Mercury 2 3.0 10.0 0.0% 0 483ms 631 286 0
Qwen3.6 Flash 3.1 10.0 0.0% 0 1.63s 696 1,554 0
البرمجة النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Mercury 2 3.4 9.6 0.0% 0 1.03s 7,229 3,088 0
Qwen3.6 Flash 5.4 10.0 33.3% 0 1.79s 6,488 889 0
مجمّع النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Mercury 2 3.0 10.0 0.0% 0 606ms 4,821 131 0
Qwen3.6 Flash 3.0 10.0 0.0% 0 4.22s 24,675 315 0
تحليل البيانات واستخراجها النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Mercury 2 7.3 5.9 83.3% 1 667ms 6,362 180 0
Qwen3.6 Flash 10.0 10.0 100.0% 0 2.13s 7,794 243 0
خاص بالمجال النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Mercury 2 5.3 7.2 44.4% 1 534ms 784 46 0
Qwen3.6 Flash 5.3 10.0 33.3% 0 1.11s 789 15 0
الذكاء العام النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Mercury 2 4.8 10.0 0.0% 0 628ms 495 159 0
Qwen3.6 Flash 10.0 10.0 100.0% 0 947ms 522 132 0
اتباع التعليمات النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Mercury 2 6.5 10.0 50.0% 0 551ms 691 82 0
Qwen3.6 Flash 6.3 10.0 50.0% 0 1.10s 711 66 0
حل الألغاز النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Mercury 2 3.1 10.0 0.0% 0 535ms 694 251 0
Qwen3.6 Flash 3.5 10.0 0.0% 0 1.21s 714 669 0
استدعاء الأدوات النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Mercury 2 10.0 10.0 100.0% 0 1.27s 6,193 197 0
Qwen3.6 Flash 10.0 10.0 100.0% 0 2.49s 8,211 272 0
معلومات عامة النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Mercury 2 3.0 10.0 0.0% 0 548ms 213 19 0
Qwen3.6 Flash 3.0 10.0 0.0% 0 649ms 210 9 0

مقارنة سريعة

تبديل زوج المقارنة