Două cuvinte decid forma unui server AI privat: dens, sau mixture of experts. Cumpărătorul le întâlnește pe o fișă tehnică, fără niciun mijloc de a afla ce costă fiecare. Răspunsul onest stă în fișierul de configurare al modelului, pe care îl publică orice furnizor de modele cu greutăți deschise, și se citește în zece minute.
Începem cu partea care este adevărată. Un model mixture of experts este un câștig real de memorie, iar pentru muncă de volum mare și complexitate mică este alegerea mai bună. Întrebarea este cât de mare este câștigul și unde se oprește.
Ce înseamnă cele două cuvinte
Un model dens citește toate greutățile pe care le are ca să producă un token. Un model mixture of experts își împarte cea mai mare parte a greutăților în experți și citește doar câțiva per token. Qwen3.6-35B-A3B publică 256 de experți și 8 experți per token. Deci poartă 36 de miliarde de parametri și citește circa 3 miliarde odată.
Aceasta este promisiunea: costul de bandă de memorie al unui model mic, cu cunoștințele unuia mare.
Cele două fișiere de configurare, citite în aceeași zi
Ambele fișiere au fost citite pe 2026-09-23. Sunt ale furnizorului, lizibile de mașină, și conțin fiecare număr care decide capacitatea.
| Câmp | Qwen3.8-27B, dens | Qwen3.6-35B-A3B, MoE |
|---|---|---|
| Straturi ascunse | 64 | 40 |
| Dintre care atenție completă | 16 | 10 |
| Capete cheie-valoare | 4 | 2 |
| Dimensiunea capului | 256 | 256 |
| Experți, activi per token | niciunul | 256, 8 |
Trei din patru straturi, la ambele modele, țin o stare recurentă fixă în loc de un cache care crește. Doar straturile de atenție completă plătesc per token. De aceea numărul de straturi, singur, nu vă spune nimic.
Aritmetica cache-ului, din aceste numere
Fiecare strat de atenție completă stochează o cheie și o valoare pentru fiecare token. Costul unui token este 2, pentru cheie și valoare, înmulțit cu straturile de atenție completă, cu capetele cheie-valoare, cu dimensiunea capului și cu octeții per număr.
| Dens 27B | MoE 35B-A3B | |
|---|---|---|
| Octeți per token, fp8 | 32.768 | 10.240 |
| Octeți per token, bfloat16 | 65.536 | 20.480 |
| O conversație de 8k, fp8 | 268 MB | 84 MB |
| O conversație de 8k, bfloat16 | 537 MB | 168 MB |
Modelul MoE ține sub o treime din cache per conversație. Câștigă de două ori: are 10 straturi de atenție completă față de 16 și 2 capete cheie-valoare față de 4. Memoria este constrângerea numărului de locuri pe o singură placă, deci aceasta este partea promisiunii care rezistă.
Unde începe promisiunea să cedeze
Economia de greutăți este cealaltă jumătate a promisiunii și este jumătatea care nu supraviețuiește unei mulțimi.
Opt experți per token este adevărat pentru un token. Un server răspunde mai multor oameni într-un singur lot, iar lotul trebuie să citească fiecare expert către care a fost trimis oricare dintre tokenii lui. Cu 256 de experți și 8 per token, 32 de tokeni pot atinge deja toți cei 256. Peste această dimensiune de lot, modelul citește la fiecare pas aproape tot setul de experți, iar economia care a justificat arhitectura dispare.
De aceea o cifră de debit pentru un model MoE, luată din cazul cu un singur token, nu este o cifră de capacitate. Ea descrie o persoană care folosește mașina.
Partea de calitate a schimbului
Fiecare furnizor publică scorurile modelului său pe propria fișă de model. Ambele fișe au fost citite pe 2026-09-23, iar două teste apar pe amândouă.
| Test | Dens 27B | MoE 35B-A3B |
|---|---|---|
| LiveCodeBench v6 | 90,3 | 80,4 |
| SWE-bench Pro | 61,7 | 49,5 |
Cele două fișe se compară cu seturi diferite de modele rivale, deci citiți fiecare număr ca pe afirmația furnizorului despre propriul model, nu ca pe o confruntare controlată. Chiar citită așa, diferența pe ambele teste de programare este de circa zece puncte.
Ce înseamnă asta pentru un cumpărător
Alegerea nu este care arhitectură este mai bună. Este care dintre cele două constrângeri se aplică în clădirea dumneavoastră.
- Mulți oameni, muncă simplă: clasificare, rezumare, întrebări pe documente, rulări de noapte. Modelul MoE câștigă la memorie, iar diferența de calitate vă costă puțin.
- Mai puțini oameni, muncă grea: redactare, analiză, cod, cercetare. Modelul dens câștigă, iar numărul de locuri este rareori lucrul pe care departamentul îl resimte.
- Cereți oricărui furnizor o cifră de capacitate cu patru termeni alături: câți utilizatori simultani, la ce lungime de context, la câți tokeni pe secundă fiecare, cu ce precizie de cache. Un număr căruia îi lipsește oricare dintre cei patru nu poate fi verificat.
- Pentru o ofertă MoE, mai cereți un lucru: la ce dimensiune de lot a fost măsurată. O cifră luată la o singură cerere nu vă spune nimic despre treizeci.
Cu Bastion
Ce schimbă Bastion
Bastion este un sistem AI privat, livrat ca un singur echipament sigilat care funcționează în clădirea ta. Un singur abonament lunar acoperă echipamentul, modelul, sistemul de operare securizat și suportul, iar nimic din ce scrie echipa ta nu părăsește clădirea.
Bastion vinde modelul dens ca opțiune implicită, pentru că un echipament sigilat care rulează al doilea cel mai bun model deschis este echipamentul greșit pentru muncă de raționament.
Cifra de capacitate publicată este nodul Reasoning: 35 de utilizatori simultani, la 8.000 de tokeni de context, la 30 de tokeni pe secundă fiecare, cu cache cheie-valoare fp8. Este calculată dintr-o aritmetică exact de acest tip, nu măsurată pe un echipament.
Nu publicăm nicio cifră de capacitate pentru un nod mixture of experts. Primul nostru calcul a ignorat efectul de reuniune a experților descris mai sus, așa că a fost retras, nu corectat în tăcere. Rămâne retras până când primul echipament este construit și măsurat.
Întrebări la care răspunde articolul
- Care este diferența dintre un model dens și unul MoE?
- Un model dens citește toate greutățile pentru fiecare token. Un model mixture of experts citește doar câțiva experți per token: Qwen3.6-35B-A3B publică 256 de experți, cu 8 activi per token, citit 2026-09-23. Modelul MoE citește deci mai puțină memorie per token, cu preț la calitate pe munca grea.
- Un model MoE susține mai mulți utilizatori simultani?
- La memorie, da. Citit pe 2026-09-23, modelul MoE ține 10.240 de octeți de cache fp8 per token față de 32.768 la modelul dens, deci o conversație de 8k costă 84 MB față de 268 MB. La calcul, câștigul scade cu lotul: la 8 experți din 256 per token, 32 de tokeni pot atinge deja toți experții.
- Ce arhitectură să aleagă o companie pentru un server AI privat?
- Depinde ce constrângere se aplică. Munca de volum mare și complexitate mică se potrivește modelului MoE. Munca de raționament se potrivește modelului dens: pe propria fișă de model, citită 2026-09-23, Qwen3.8-27B dens obține 90,3 la LiveCodeBench v6 față de 80,4 al modelului MoE, și 61,7 la SWE-bench Pro față de 49,5.
Sursele
- 1
- 2
- 3
- 4
- 5
Citește mai departe
- Ce hardware rulează un LLM local și ce lipsește din lista de componenteCalculul de memorie, pornit de la o configurație de model publicată și de la o specificație de placă publicată. De ce un model de 32 de miliarde de parametri nu încape pe o placă de 32 GB, cât costă în memorie o conversație și cele cinci lucruri care nu apar în nicio listă de componente.Citește articolul
- Câți oameni poate susține de fapt un singur server AI?Utilizatorii concurenți nu sunt angajații. Capacitatea este decisă de model, de lungimea contextului, de cache-ul KV și de motorul de servire, iar proiectul vLLM a măsurat un caz în care doar motorul schimba memoria utilizabilă de două până la cinci ori.Citește articolul