Clasament al eșecurilor pentru Răspuns greșit

Vezi ce modele AI se lovesc cel mai des de Răspuns greșit, ca să identifici riscurile de fiabilitate înainte să alegi. Sortează după: Scor ↑.

Modele afișate

Eșecuri totale

1585

Modelul cel mai afectat

LFM2-24B-A2B 9

Categorii

În categoria Specific domeniului421 În categoria Trucuri anti-AI293 În categoria Programare259 În categoria Rezolvare de puzzle-uri204 În categoria Cultură generală172 În categoria Combinat69 În categoria Inteligență generală62 În categoria Respectarea instrucțiunilor61 În categoria Parsare și extragere de date41 În categoria Apelare instrumente3

215/215

Rang	Model	Companie	Număr de Răspuns greșit	Scor	Cost total	Teste corecte	Timp de răspuns (mediu)
#141	Hy3 preview high	Tencent	3	5.9	$0.048	11/21	56.6s
Total teste 21 Teste greșite 10 Cost total $0.048 Timp de răspuns (mediu) 56.6s
#140	Mimo V2 Omni medium	Xiaomi	5	5.9	$0.683	10/21	41.2s
Total teste 21 Teste greșite 11 Cost total $0.683 Timp de răspuns (mediu) 41.2s
#139	Gemini 3 PRO Preview medium	Google	3	6.0	$0.385	14/21	9.05s
Total teste 21 Teste greșite 7 Cost total $0.385 Timp de răspuns (mediu) 9.05s
#138	GPT-5.6 Terra none	OpenAI	11	6.0	$0.349	8/22	1.65s
Total teste 22 Teste greșite 14 Cost total $0.349 Timp de răspuns (mediu) 1.65s
#137	Grok 4.20 Beta medium	X AI	3	6.0	$0.750	14/18	9.75s
Total teste 18 Teste greșite 4 Cost total $0.750 Timp de răspuns (mediu) 9.75s
#136	Step 3.5 Flash medium	Stepfun	4	6.0	$0.108	11/21	174.2s
Total teste 21 Teste greșite 10 Cost total $0.108 Timp de răspuns (mediu) 174.2s
#135	Nemotron 3 Ultra none	NVIDIA	12	6.1	$0.095	8/22	3.87s
Total teste 22 Teste greșite 14 Cost total $0.095 Timp de răspuns (mediu) 3.87s
#134	GPT-5 Nano medium	OpenAI	9	6.1	$0.114	9/22	54.9s
Total teste 22 Teste greșite 13 Cost total $0.114 Timp de răspuns (mediu) 54.9s
#133	Qwen3.5-35B-A3B none	Qwen	12	6.1	$0.106	7/22	12.7s
Total teste 22 Teste greșite 15 Cost total $0.106 Timp de răspuns (mediu) 12.7s
#132	Qwen3.5 Plus 2026-04-20 none	Qwen	12	6.1	$0.122	8/22	13.6s
Total teste 22 Teste greșite 14 Cost total $0.122 Timp de răspuns (mediu) 13.6s
#131	Qwen3.5-Flash none	Qwen	13	6.1	$0.073	8/22	25.3s
Total teste 22 Teste greșite 14 Cost total $0.073 Timp de răspuns (mediu) 25.3s
#130	Qwen3.6 Flash none	Qwen	12	6.1	$0.062	7/22	3.74s
Total teste 22 Teste greșite 15 Cost total $0.062 Timp de răspuns (mediu) 3.74s
#129	Inkling low	Thinkingmachines	8	6.1	$0.187	10/22	5.15s
Total teste 22 Teste greșite 12 Cost total $0.187 Timp de răspuns (mediu) 5.15s
#128	Gemini 3.1 Flash Lite none	Google	11	6.1	$0.046	9/22	1.75s
Total teste 22 Teste greșite 13 Cost total $0.046 Timp de răspuns (mediu) 1.75s
#127	gpt-oss-120b medium	OpenAI	9	6.1	$0.019	9/22	21.9s
Total teste 22 Teste greșite 13 Cost total $0.019 Timp de răspuns (mediu) 21.9s

Eșecuri Răspuns greșit

Filtrează modelele

Top modele după Număr de Răspuns greșit

Număr de Răspuns greșit vs Scor

Top modele după Timp de răspuns (mediu)