قارن الرسوم البيانية

اللغة:

❤️ Made by XCS

AI BENCHY Compare

النماذج المقارنة

قارن:

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-03-03

المقياس	OpenAI: GPT-5.2 Chat none الإصدار: 2025-12-11	OpenAI: GPT-5.3 Chat none الإصدار: 2026-03-03	Google: Gemini 3.1 Flash Lite Preview low الإصدار: 2026-03-03
الترتيب	#12	#14	#8
متوسط الدرجة	7.41	7.27	7.84
الاتساق	9.45	8.26	10.00
التكلفة لكل نتيجة	2.261	2.835	0.151
إجمالي التكلفة	$0.227	$0.256	$0.016
اختبارات صحيحة
معدل النجاح لكل محاولة	73.8%	73.8%	71.4%
اختبارات غير مستقرة	1	3	0
رموز الإخراج	14,267	16,339	1,317
رموز الاستدلال	0	0	6,126

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	رموز الإخراج	رموز الاستدلال
OpenAI: GPT-5.2 Chat	10.00	10.00	100.0%	0		1,651	0
OpenAI: GPT-5.3 Chat	7.33	7.49	77.8%	1		3,091	0
Google: Gemini 3.1 Flash Lite Preview	7.00	10.00	66.7%	0		456	1,224

تحليل البيانات واستخراجها	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	رموز الإخراج	رموز الاستدلال
OpenAI: GPT-5.2 Chat	9.88	10.00	100.0%	0		980	0
OpenAI: GPT-5.3 Chat	9.88	10.00	100.0%	0		942	0
Google: Gemini 3.1 Flash Lite Preview	9.88	10.00	100.0%	0		291	696

خاص بالمجال	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	رموز الإخراج	رموز الاستدلال
OpenAI: GPT-5.2 Chat	4.00	10.00	33.3%	0		7,810	0
OpenAI: GPT-5.3 Chat	1.00	4.41	33.3%	2		8,264	0
Google: Gemini 3.1 Flash Lite Preview	4.00	10.00	33.3%	0		18	1,212

اتباع التعليمات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	رموز الإخراج	رموز الاستدلال
OpenAI: GPT-5.2 Chat	5.50	6.13	66.7%	1		1,528	0
OpenAI: GPT-5.3 Chat	8.50	9.99	50.0%	0		1,455	0
Google: Gemini 3.1 Flash Lite Preview	8.50	10.00	50.0%	0		72	753

Puzzle Solving	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	رموز الإخراج	رموز الاستدلال
OpenAI: GPT-5.2 Chat	7.00	10.00	66.7%	0		1,743	0
OpenAI: GPT-5.3 Chat	10.00	10.00	100.0%	0		1,726	0
Google: Gemini 3.1 Flash Lite Preview	10.00	10.00	100.0%	0		243	1,248

استدعاء الأدوات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	رموز الإخراج	رموز الاستدلال
OpenAI: GPT-5.2 Chat	10.00	10.00	100.0%	0		555	0
OpenAI: GPT-5.3 Chat	10.00	10.00	100.0%	0		861	0
Google: Gemini 3.1 Flash Lite Preview	10.00	10.00	100.0%	0		237	993

مقارنة سريعة

تبديل زوج المقارنة

GPT-5.3 ChatnonevsGLM 5medium Claude Sonnet 4.6mediumvsGPT-5.2 Chatnone Gemini 3.1 Flash Lite PreviewlowvsGPT-5.3-Codexmedium GPT-5.2 ChatnonevsGLM 5medium Claude Sonnet 4.6mediumvsGPT-5.3 Chatnone Gemini 2.5 FlashmediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsStep 3.5 Flashmediumمتاح مجانًا DeepSeek V3.2mediumvsGPT-5.3 Chatnone Gemini 2.5 FlashmediumvsGPT-5.2 Chatnone Gemini 3.1 Flash Lite PreviewhighvsGPT-5.2 Chatnone Gemini 3.1 Flash Lite PreviewmediumvsGPT-5.3 Chatnone Claude Sonnet 4.6mediumvsGemini 3.1 Flash Lite Previewlow