Clasament al eșecurilor pentru Formatare suplimentară

Vezi ce modele AI se lovesc cel mai des de Formatare suplimentară, ca să identifici riscurile de fiabilitate înainte să alegi. Sortează după: Timp de răspuns (mediu) ↑.

Modele afișate

Eșecuri totale

Modelul cel mai afectat

Grok 4.20 1

Categorii

În categoria Trucuri anti-AI20 În categoria Programare18 În categoria Specific domeniului17 În categoria Rezolvare de puzzle-uri8 În categoria Parsare și extragere de date6 În categoria Respectarea instrucțiunilor3 În categoria Combinat1

42/42

Rang	Model	Companie	Număr de Formatare suplimentară	Scor	Cost total	Teste corecte	Timp de răspuns (mediu)
#197	Grok 4.20 none	X AI	1	4.1	$0.057	6/18	1.11s
Total teste 18 Teste greșite 12 Cost total $0.057 Timp de răspuns (mediu) 1.11s
#201	Granite 4.1 8B none	IBM Granite	1	4.0	$0.007	2/22	1.45s
Total teste 22 Teste greșite 20 Cost total $0.007 Timp de răspuns (mediu) 1.45s
#159	GPT-5.6 Luna none	OpenAI	1	5.4	$0.142	6/22	1.50s
Total teste 22 Teste greșite 16 Cost total $0.142 Timp de răspuns (mediu) 1.50s
#157	Mimo V2 Omni none	Xiaomi	1	5.5	$0.021	8/21	2.44s
Total teste 21 Teste greșite 13 Cost total $0.021 Timp de răspuns (mediu) 2.44s
#200	MiMo-V2-Flash none	Xiaomi	1	4.0	$0.025	4/21	2.76s
Total teste 21 Teste greșite 17 Cost total $0.025 Timp de răspuns (mediu) 2.76s
#164	Inkling none	Thinkingmachines	1	5.2	$0.147	6/22	3.50s
Total teste 22 Teste greșite 16 Cost total $0.147 Timp de răspuns (mediu) 3.50s
#168	MiMo-V2.5 none	Xiaomi	1	5.1	$0.025	5/22	4.62s
Total teste 22 Teste greșite 17 Cost total $0.025 Timp de răspuns (mediu) 4.62s
#66	Claude Opus 4.8 none	Anthropic	3	7.3	$1.166	13/22	4.91s
Total teste 22 Teste greșite 9 Cost total $1.166 Timp de răspuns (mediu) 4.91s
#111	LongCat 2.0 none	Meituan	1	6.3	$0.044	7/22	5.18s
Total teste 22 Teste greșite 15 Cost total $0.044 Timp de răspuns (mediu) 5.18s
#112	Claude Sonnet 5 none	Anthropic	4	6.3	$0.548	8/22	6.04s
Total teste 22 Teste greșite 14 Cost total $0.548 Timp de răspuns (mediu) 6.04s
#63	Claude Sonnet 4.6 none	Anthropic	4	7.3	$0.661	12/22	8.12s
Total teste 22 Teste greșite 10 Cost total $0.661 Timp de răspuns (mediu) 8.12s
#149	KAT-Coder-Air V2.5 medium	Kwaipilot	1	5.6	$0.048	8/22	8.42s
Total teste 22 Teste greșite 14 Cost total $0.048 Timp de răspuns (mediu) 8.42s
#166	Qwen3 Coder Next none	Qwen	1	5.1	$0.025	5/22	9.12s
Total teste 22 Teste greșite 17 Cost total $0.025 Timp de răspuns (mediu) 9.12s
#181	Grok 4.20 Multi Agent Beta medium	X AI	2	4.8	$5.599	8/18	9.69s
Total teste 18 Teste greșite 10 Cost total $5.599 Timp de răspuns (mediu) 9.69s
#148	Owl Alpha none	Openrouter	1	5.6	$0.000	7/21	9.88s
Total teste 21 Teste greșite 14 Cost total $0.000 Timp de răspuns (mediu) 9.88s

Eșecuri Formatare suplimentară

Filtrează modelele

Top modele după Număr de Formatare suplimentară

Număr de Formatare suplimentară vs Scor

Top modele după Timp de răspuns (mediu)