Clasament al eșecurilor pentru Răspuns greșit

Vezi ce modele AI se lovesc cel mai des de Răspuns greșit, ca să identifici riscurile de fiabilitate înainte să alegi. Sortează după: Teste corecte ↑.

Modele afișate

Eșecuri totale

1585

Modelul cel mai afectat

Granite 4.1 8B 13

Categorii

În categoria Specific domeniului421 În categoria Trucuri anti-AI293 În categoria Programare259 În categoria Rezolvare de puzzle-uri204 În categoria Cultură generală172 În categoria Combinat69 În categoria Inteligență generală62 În categoria Respectarea instrucțiunilor61 În categoria Parsare și extragere de date41 În categoria Apelare instrumente3

215/215

Rang	Model	Companie	Număr de Răspuns greșit	Scor	Cost total	Teste corecte	Timp de răspuns (mediu)
#124	Gemini 2.5 Flash none	Google	12	6.2	$0.017	9/22	6.20s
Total teste 22 Teste greșite 13 Cost total $0.017 Timp de răspuns (mediu) 6.20s
#127	gpt-oss-120b medium	OpenAI	9	6.1	$0.019	9/22	21.9s
Total teste 22 Teste greșite 13 Cost total $0.019 Timp de răspuns (mediu) 21.9s
#128	Gemini 3.1 Flash Lite none	Google	11	6.1	$0.046	9/22	1.75s
Total teste 22 Teste greșite 13 Cost total $0.046 Timp de răspuns (mediu) 1.75s
#134	GPT-5 Nano medium	OpenAI	9	6.1	$0.114	9/22	54.9s
Total teste 22 Teste greșite 13 Cost total $0.114 Timp de răspuns (mediu) 54.9s
#143	North Mini Code medium	Cohere	9	5.9	$0.000	9/22	137.1s
Total teste 22 Teste greșite 13 Cost total $0.000 Timp de răspuns (mediu) 137.1s
#185	Ring-2.6-1T none	Inclusionai	5	4.8	$0.026	9/22	55.1s
Total teste 22 Teste greșite 13 Cost total $0.026 Timp de răspuns (mediu) 55.1s
#147	GLM 5 none	Z.ai	12	5.7	$0.041	9/21	4.03s
Total teste 21 Teste greșite 12 Cost total $0.041 Timp de răspuns (mediu) 4.03s
#187	Grok 4.20 Multi Agent Beta medium	X AI	4	4.8	$5.599	8/18	9.69s
Total teste 18 Teste greșite 10 Cost total $5.599 Timp de răspuns (mediu) 9.69s
#190	Hunter Alpha medium	OpenRouter	4	4.7	$0.000	8/18	10.3s
Total teste 18 Teste greșite 10 Cost total $0.000 Timp de răspuns (mediu) 10.3s
#50	DeepSeek V4 Pro high	DeepSeek	6	7.7	$0.200	10/22	79.1s
Total teste 22 Teste greșite 12 Cost total $0.200 Timp de răspuns (mediu) 79.1s
#81	Kimi K2.5 medium	Moonshot AI	5	7.0	$0.600	10/22	99.0s
Total teste 22 Teste greșite 12 Cost total $0.600 Timp de răspuns (mediu) 99.0s
#82	Mercury 2 medium	Inception	8	7.0	$0.093	10/22	2.72s
Total teste 22 Teste greșite 12 Cost total $0.093 Timp de răspuns (mediu) 2.72s
#86	DeepSeek V4 Pro none	DeepSeek	8	6.9	$0.096	10/22	11.6s
Total teste 22 Teste greșite 12 Cost total $0.096 Timp de răspuns (mediu) 11.6s
#96	LongCat 2.0 low	Meituan	8	6.7	$0.391	10/22	100.3s
Total teste 22 Teste greșite 12 Cost total $0.391 Timp de răspuns (mediu) 100.3s
#105	Qwen3.6 27B medium	Qwen	6	6.5	$0.779	10/22	106.3s
Total teste 22 Teste greșite 12 Cost total $0.779 Timp de răspuns (mediu) 106.3s

Eșecuri Răspuns greșit

Filtrează modelele

Top modele după Număr de Răspuns greșit

Număr de Răspuns greșit vs Scor

Top modele după Timp de răspuns (mediu)