Clasament al eșecurilor pentru Răspuns greșit

Vezi ce modele AI se lovesc cel mai des de Răspuns greșit, ca să identifici riscurile de fiabilitate înainte să alegi.

Modele afișate

Eșecuri totale

1585

Modelul cel mai afectat

Categorii

În categoria Specific domeniului421 În categoria Trucuri anti-AI293 În categoria Programare259 În categoria Rezolvare de puzzle-uri204 În categoria Cultură generală172 În categoria Combinat69 În categoria Inteligență generală62 În categoria Respectarea instrucțiunilor61 În categoria Parsare și extragere de date41 În categoria Apelare instrumente3

215/215

Rang	Model	Companie	Număr de Răspuns greșit	Scor	Cost total	Teste corecte	Timp de răspuns (mediu)
#163	Mimo V2 Omni none	Xiaomi	10	5.5	$0.021	8/21	2.44s
Total teste 21 Teste greșite 13 Cost total $0.021 Timp de răspuns (mediu) 2.44s
#197	Grok 4.20 Beta none	X AI	10	4.4	$0.087	6/18	1.19s
Total teste 18 Teste greșite 12 Cost total $0.087 Timp de răspuns (mediu) 1.19s
#198	Laguna M.1 none	Poolside	10	4.4	$0.009	4/19	2.89s
Total teste 19 Teste greșite 15 Cost total $0.009 Timp de răspuns (mediu) 2.89s
#203	Grok 4.20 none	X AI	10	4.1	$0.057	6/18	1.11s
Total teste 18 Teste greșite 12 Cost total $0.057 Timp de răspuns (mediu) 1.11s
#85	KAT-Coder-Pro V2.5 medium	Kwaipilot	9	6.9	$0.467	11/22	24.0s
Total teste 22 Teste greșite 11 Cost total $0.467 Timp de răspuns (mediu) 24.0s
#95	Gemini 3.5 Flash-Lite low	Google	9	6.7	$0.145	12/22	2.25s
Total teste 22 Teste greșite 10 Cost total $0.145 Timp de răspuns (mediu) 2.25s
#104	Gemini 3.5 Flash-Lite medium	Google	9	6.5	$0.369	12/22	6.01s
Total teste 22 Teste greșite 10 Cost total $0.369 Timp de răspuns (mediu) 6.01s
#111	Gemini 3.1 Flash Lite low	Google	9	6.5	$0.621	12/22	16.3s
Total teste 22 Teste greșite 10 Cost total $0.621 Timp de răspuns (mediu) 16.3s
#121	Gemma 4 31B none	Google	9	6.2	$0.021	10/22	5.34s
Total teste 22 Teste greșite 12 Cost total $0.021 Timp de răspuns (mediu) 5.34s
#127	gpt-oss-120b medium	OpenAI	9	6.1	$0.019	9/22	21.9s
Total teste 22 Teste greșite 13 Cost total $0.019 Timp de răspuns (mediu) 21.9s
#134	GPT-5 Nano medium	OpenAI	9	6.1	$0.114	9/22	54.9s
Total teste 22 Teste greșite 13 Cost total $0.114 Timp de răspuns (mediu) 54.9s
#143	North Mini Code medium	Cohere	9	5.9	$0.000	9/22	137.1s
Total teste 22 Teste greșite 13 Cost total $0.000 Timp de răspuns (mediu) 137.1s
#150	KAT-Coder-Air V2.5 high	Kwaipilot	9	5.6	$0.077	7/22	15.9s
Total teste 22 Teste greșite 15 Cost total $0.077 Timp de răspuns (mediu) 15.9s
#184	Ling-2.6-flash none	Inclusionai	9	4.9	$0.002	6/22	10.7s
Total teste 22 Teste greșite 16 Cost total $0.002 Timp de răspuns (mediu) 10.7s
#194	Cobuddy medium	Baidu	9	4.7	$0.000	7/21	39.9s
Total teste 21 Teste greșite 14 Cost total $0.000 Timp de răspuns (mediu) 39.9s

Eșecuri Răspuns greșit

Filtrează modelele

Top modele după Număr de Răspuns greșit

Număr de Răspuns greșit vs Scor

Top modele după Timp de răspuns (mediu)