Căutarea după hardware pentru AI local dă liste de componente. O placă, o sursă, o carcasă. Listele nu sunt greșite, iar pentru o persoană la un birou funcționează. Sunt incomplete într-un fel care se vede abia când a doua persoană începe să folosească mașina.
Ordinea onestă este calculul întâi, apoi lista lucrurilor pe care calculul nu le acoperă.
Calculul este public și este scurt
Fiecare model open-weight își publică configurația. Qwen3-32B publică un fișier cu numerele care decid memoria. Citit pe 2026-09-23, el indică 64 de straturi ascunse, 8 capete key-value, o dimensiune de cap de 128 și tipul de tensor bfloat16.
Aceste patru numere dau costul în cache al unui token. Fiecare strat stochează o cheie și o valoare, fiecare de 8 capete și 128 în adâncime. Înseamnă 2 x 64 x 8 x 128 = 131.072 de numere per token, iar la doi octeți fiecare rezultă 262.144 de octeți. 256 KiB de memorie, pentru un token, într-o singură conversație.
| Context păstrat | La cache bfloat16 | La cache fp8 |
|---|---|---|
| 1.000 de tokeni | 0,24 GiB | 0,12 GiB |
| 8.000 de tokeni | 1,95 GiB | 0,98 GiB |
| 40.960 de tokeni, maximul publicat | 10,0 GiB | 5,0 GiB |
Acesta este costul pentru o conversație. Zece persoane care țin în același moment o conversație de 8k au nevoie de circa 20 GiB de cache la bfloat16 sau de circa 10 GiB la fp8. Tipul de date al cache-ului nu este un detaliu. El înjumătățește cifra.
Acum pune calculul pe o placă reală
Greutățile vin primele și nu sunt negociabile. Un model de 32 de miliarde de parametri, la doi octeți per parametru, cere circa 64 GB înainte să existe vreo conversație.
NVIDIA publică memoria plăcii sale de vârf pentru consumatori. Pagina GeForce RTX 5090, citită pe 2026-09-23, dă configurația standard de memorie:
Standard Memory Config 32 GB GDDR7
NVIDIA, GeForce RTX 5090, citit 2026-09-23
Deci cea mai scumpă placă de consum de pe acea pagină are 32 GB, iar greutățile singure cer circa 64 GB. Modelul nu încape. Cuantizarea la 8 biți aduce greutățile la circa 32 GB, adică exact toată placa, fără nimic rămas pentru cache-ul din tabelul de mai sus.
Acesta nu este un argument împotriva AI-ului local. Este motivul pentru care listele de componente folosesc discret modele mai mici. Un model de 7 sau 8 miliarde de parametri încape confortabil, iar pentru multe sarcini este suficient. Întrebarea este dacă este suficient pentru sarcina pe care o are efectiv organizația.
Ce face motorul de servire în privința asta
vLLM, unul dintre motoarele care servesc aceste modele, documentează problema în propriile cuvinte și enumeră pârghiile.
Large models might cause your machine to run out of memory (OOM). Here are some options that help alleviate this problem.
vLLM, Conserving Memory, citit 2026-09-23
Opțiunile pe care le numește sunt paralelismul pe tensori peste mai multe plăci, cuantizarea și limitarea lungimii contextului și a dimensiunii lotului. Ultima merită recitită. Două dintre cele patru numere ale unei oferte oneste de capacitate, lungimea contextului și numărul de utilizatori simultani, sunt exact cele două butoane pe care documentația motorului spune să le dai mai jos când memoria se termină.
Cele cinci lucruri care nu apar în nicio listă
- Consumul și căldura. O placă de stație de lucru sub inferență continuă nu este o sarcină de tip foaie de calcul. Camera în care stă trebuie să preia căldura, toată ziua, în august.
- Sistemul de operare și actualizările lui. Cineva le aplică, verifică dacă motorul mai pornește și răspunde de dimineața în care nu pornește.
- Licența modelului. Un model open-weight nu este automat liber pentru uz comercial, iar termenii diferă de la o familie la alta. Se citește fișierul de licență, nu articolul de blog.
- Backup și restaurare. Modelul se poate descărca din nou. Configurația, prompturile, indexul de căutare și regulile de acces nu.
- Cine răspunde la telefon. O mașină de care depinde acum toată compania are un responsabil, altfel are o întrerupere fără responsabil.
Niciunul dintre aceste puncte nu este exotic. Toate cinci fac diferența între o mașină care merge la un birou și un sistem pe care o companie se poate baza.
Ce se întreabă înainte de orice achiziție
Cere cele patru numere împreună și întreabă care dintre ele au fost măsurate. Câte persoane în același moment, cu cât context fiecare, la câți tokeni pe secundă și cu ce tip de date pentru cache. Un furnizor care răspunde cu un singur număr îl dă pe cel ușor.
Apoi pune cele cinci întrebări de mai sus. Răspunsurile decid costul de operare, iar costul de operare este locul în care o listă de componente greșește de obicei.
Cu Bastion
Ce schimbă Bastion
Bastion este un sistem AI privat, livrat ca un singur echipament sigilat care funcționează în clădirea ta. Un singur abonament lunar acoperă echipamentul, modelul, sistemul de operare securizat și suportul, iar nimic din ce scrie echipa ta nu părăsește clădirea.
Bastion nu vinde nimic din toate acestea ca listă de componente. Hardware-ul, modelul open-weight, sistemul de operare securizat, actualizările și suportul vin ca un singur sistem închiriat, cu un singur tarif lunar.
Cifra noastră de capacitate este calculată dintr-un raționament exact de acest tip, nu măsurată pe un echipament. Primul echipament nu este construit. Când va fi măsurat, măsurătoarea înlocuiește calculul, iar pagina spune pe care dintre ele o arată.
Întrebări la care răspunde articolul
- De cât VRAM este nevoie pentru un model AI local?
- Întâi greutățile, apoi cache-ul. Un model de 32 de miliarde de parametri, la doi octeți per parametru, cere circa 64 GB de greutăți, care nu încap pe o placă de 32 GB. Peste asta, Qwen3-32B costă 256 KiB de cache per token la bfloat16, deci o conversație de 8.000 de tokeni adaugă circa 1,95 GiB.
- Poate o singură placă video să susțină un server AI local pentru o echipă?
- Pentru o persoană, deseori da. Pentru o echipă, cache-ul este constrângerea: zece persoane care țin fiecare 8.000 de tokeni au nevoie de circa 20 GiB de cache la bfloat16 sau de circa 10 GiB la fp8, peste greutăți. Configurația de memorie publicată pentru NVIDIA GeForce RTX 5090 este de 32 GB în total.
- Ce lipsește dintr-o listă de hardware pentru AI local?
- Cinci lucruri: consumul și căldura susținute, actualizările sistemului de operare și cine le testează, termenii licenței modelului, backupul configurației și al indexului de căutare, nu al modelului, și un responsabil numit pentru momentul în care mașina cedează.
Sursele
- 1
- 2
- 3
Citește mai departe
- Pentru AI local, memoria GPU decide mai mult decât viteza GPUUnde se duce memoria, de ce lungimea contextului o multiplică, ce aduce și ce costă quantizarea și întrebarea care înlocuiește „cât de rapid este GPU-ul?” atunci când cumperi pentru inferență locală.Citește articolul
- Câți oameni poate susține de fapt un singur server AI?Utilizatorii concurenți nu sunt angajații. Capacitatea este decisă de model, de lungimea contextului, de cache-ul KV și de motorul de servire, iar proiectul vLLM a măsurat un caz în care doar motorul schimba memoria utilizabilă de două până la cinci ori.Citește articolul