AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Orodha ya mabadiliko

Kumbukumbu rahisi ya masasisho ya bidhaa na benchmark, yaliyopangwa kwa tarehe. Tunaitumia kurekodi modeli mpya zilizojaribiwa, majaribio ya kurudia, mabadiliko ya benchmark, na kazi ya UX/bidhaa iliyotolewa.

2026-09-08

  • Kipengele kipya: Mwonekano angavu unaofanana na karatasi na mwonekano wa giza wenye rangi ya grafiti, pamoja na vichwa vifupi vya ulinganisho, vidhibiti vya modeli vilivyo wazi na mapendekezo yanayookoa nafasi kwenye simu.
  • Marekebisho ya hitilafu: Imerekebisha maandishi ya menyu yanayopishana na menyu kunjuzi zinazokatwa.

2026-09-07

  • Kipengele kipya: Tumeboresha mwonekano wa tovuti kwa maandishi yanayosomeka zaidi, vidhibiti vinavyofanana, na rangi tulivu katika mandhari angavu na nyeusi. Utafutaji wa modeli, vidhibiti vya kulinganisha, na kadi za vipimo kwenye simu bado vinapatikana.
  • Modeli mpya zilizojaribiwa: Qwen3.8 Max (0902)

2026-09-05

  • Kipengele kipya: Nakili mifano ya SVG kama picha au pakua PNG zenye alama ya tovuti. Hakikisho sasa linaonyesha nafasi ya modeli.
  • Marekebisho ya hitilafu: Mifano halali ya SVG imerejeshwa na ujumbe wa kuisha kwa muda umefafanuliwa.

2026-08-20

  • Modeli mpya zilizojaribiwa: GLM 5.3

2026-08-15

  • Kipengele kipya: dots-studio/dots-3-note-preview:free Dots3-Note Preview (bila malipo) imeongezwa kwa majaribio mafupi ya upatikanaji na hali za kufikiri.
  • Kipengele kipya: Uendeshaji wa ndani sasa hutumia makadirio ya gharama ya umeme ya RTX 3090 katika ulinganisho wa gharama na thamani.

2026-08-14

  • Modeli mpya zilizojaribiwa: Gemini 3.7 Flash, Qwen3.8 27B
  • Kipengele kipya: Uendeshaji wa ndani wa benchmark kupitia Ollama, chanzo cha mtoa huduma, ushughulikiaji sahihi wa kompyuta ya ndani isiyo na bei na lebo wazi za Uendeshaji wa ndani vimeongezwa.

2026-08-12

  • Modeli mpya zilizojaribiwa: Seed 2.1 Turbo, Qwen3.8 2.4T A95B, Seed-2.0-Code, Grok 4.6
  • Kipengele kipya: Idadi za vigezo zenye vyanzo, vigezo hai vya MoE, upatikanaji na muundo wa modeli vimeongezwa kwenye kurasa za modeli na ulinganisho, pamoja na vichujio vipya vya jedwali la viwango.

2026-08-02

  • Kipengele kipya: Model pages now show benchmark-suite coverage so incomplete results are clear at a glance.

2026-07-28

  • Modeli mpya zilizojaribiwa: Trinity Large Thinking, Qwen3.7 Flash
  • Kipengele kipya: Added site-wide Spotlight Search with keyboard navigation and a shortcut for finding pages, models, and comparisons.

2026-07-26

  • Kipengele kipya: Added editorial model recommendations for affordable, intelligent, and fast choices.
  • UX: Comparison pages now use draggable model summary cards with clearer model selection and ordering.

2026-07-18

  • Modeli mpya zilizojaribiwa: Inkling

2026-07-17

  • Majaribio mapya yameongezwa: Added an executable JavaScript tool-calling benchmark with reference-case validation.

2026-07-16

  • Modeli mpya zilizojaribiwa: Muse Spark 1.1, Kimi K3
  • Kipengele kipya: The benchmark runner now supports executable tools with validated tool-call schemas and sandboxed execution.

2026-07-03

  • Kipengele kipya: Launched AI World Cup, where benchmarked models generate football strategies and compete in simulated matches.

2026-06-17

  • Modeli mpya zilizojaribiwa: GLM 5.2
  • Marekebisho ya hitilafu: Adjusted missing-test handling so models are not scored as if unavailable tests were valid wrong answers.
  • UX: Leaderboard search now supports comma-separated model queries, so searches like "deepseek, glm" show matches for either model family.

2026-06-16

  • Kipengele kipya: Added cost sorting and filtering across leaderboard and category views.

2026-06-12

  • Modeli mpya zilizojaribiwa: Kimi K2.7 Code
  • Kipengele kipya: Updated scoring to use per-category bias adjustments, so category-level differences are normalized before they roll into leaderboard results.

2026-06-06

  • Kipengele kipya: Model showcases now support shareable lightbox views, filtering, and score details.

2026-06-05

  • Kipengele kipya: Added model-generated visual showcases to model and comparison pages.
  • Kipengele kipya: Added multi-model comparison pages with model recommendations and category-based ranking.

2026-06-04

  • Modeli mpya zilizojaribiwa: Nemotron 3 Ultra
  • Majaribio mapya yameongezwa: Added a coding benchmark with executable reference cases.

2026-06-01

2026-05-27

  • Kipengele kipya: Added current-price cost calculations while preserving original tested-at pricing for auditability.

2026-05-22

  • Modeli mpya zilizojaribiwa: Qwen3.7 Max
  • Majaribio mapya yameongezwa: Imeongezwa kategoria mpya ya majaribio ya Coding inayolenga kutafuta hitilafu katika suluhisho za C++.

2026-05-21

  • Modeli mpya zilizojaribiwa: Grok Build 0.1
  • Majaribio mapya yameongezwa: Added a new benchmark test and improved answer judging.
  • Marekebisho ya hitilafu: Imeondoa toleo la xAI Grok Build 0.1 lisilo na reasoning ambalo halitumiki baada ya uthibitishaji wa mtoa huduma kuhitaji reasoning.

2026-05-08

  • Majaribio mapya yameongezwa: Added a new benchmark test to expand suite coverage.
  • Marekebisho ya hitilafu: Reasoning chips and compare labels now recognize the minimal reasoning variant instead of falling back to auto.
  • UX: Model pages now order sibling reasoning-variant chips from highest effort to lowest.

2026-05-06

  • Modeli mpya zilizojaribiwa: Cobuddy

2026-04-30

2026-04-26

  • UX: Tumeboresha nafasi ya menyu ya kulinganisha kwenye simu, tukabana mpangilio wa kurasa za modeli, na kugawa historia ya majaribio katika vipande vya kila modeli ili kurasa zipakie data chache za kihistoria.
  • Marekebisho ya hitilafu: Historia ya uendeshaji sasa huunganisha marudio ya jaribio yanayokaribia kurudiwa ya suite ileile na huonyesha uendeshaji wote wa umma katika jedwali la kulinganisha kwenye kurasa za modeli.

2026-04-25

  • Kipengele kipya: Tumeongeza telemetry ya uaminifu ili hitilafu za API lengwa na kikomo cha kasi zifuatiliwe tofauti na majibu yasiyo sahihi.

2026-04-24

  • Modeli mpya zilizojaribiwa: DeepSeek V4 Flash 0423, DeepSeek V4 Pro, GPT-5.5
  • Marekebisho ya hitilafu: Viungo vya modeli kwenye changelog sasa vinaelekeza kwenye kurasa za modeli hai za msingi, na kurasa za modeli sasa pia zinaunganisha kati ya reasoning variants.

2026-04-23

  • Modeli mpya zilizojaribiwa: Ling-2.6-1T, Hy3 preview
  • Kipengele kipya: Historia ya run - Kurasa za modeli sasa zinaonyesha run za umma za zamani pamoja na jedwali la kulinganisha run kwa upande mbili. (Ukurasa wa mfano wa modeli)
  • UX: Leaderboard sasa inaunga mkono pagination na filters zinazotegemea URL pamoja na hatua za compare moja kwa moja kutoka kwenye orodha ya viwango.
  • Marekebisho ya hitilafu: Utafutaji wa homepage, hesabu za filters, na hali ya pagination sasa vinaendelea kuwa thabiti katika dataset nzima.
  • Jaribio la kurudia: GLM 5.1 Benchmark suite kamili iliendeshwa tena na snapshot ya umma ya historia ya run ya modeli hii ikasafishwa.
  • Marekebisho ya hitilafu: Modeli ambazo hazikufanyiwa retest halisi sasa hazipewi tena timestamp mpya ya tested_at.

2026-04-20

2026-04-11

  • Modeli mpya zilizojaribiwa: GLM 5.1

2026-03-18

  • Modeli mpya zilizojaribiwa: MiniMax M2.7
  • Kipengele kipya: Added input and output pricing metrics to model and comparison pages.

2026-03-06

  • Kipengele kipya: Added the Methodology section and expanded charts with latency, cost, token, and model-switching views.

2026-03-04

  • Modeli mpya zilizojaribiwa: GPT-5.2 Chat, GPT 5.3 Chat
  • Kipengele kipya: Added interactive comparison charts for direct model analysis.
  • Majaribio mapya yameongezwa: Added a VAT compliance micro-audit benchmark with structured tool requirements.

2026-03-02

  • Kipengele kipya: Added share actions with copyable links across model and comparison pages.

2026-02-27

  • Modeli mpya zilizojaribiwa: Seed-2.0-Mini
  • Kipengele kipya: Added reasoning-quality and consistency charts to model comparisons.

Ukurasa wa changelog umeundwa

Changelog hii ilianza baada ya uzinduzi, kwa hivyo masasisho ya zamani hayapo hapa.