Scrii o întrebare, primești un răspuns. Interfața este simplă în mod deliberat și ascunde un stack cu cinci straturi distincte, fiecare putând fi motivul pentru care sistemul este lent, scump sau nesigur.
1. Modelul
Parametrii învățați. Modelele mai mari au nevoie în general de mai multă procesare și memorie, dar dimensiunea singură nu decide utilitatea: contează arhitectura, quantizarea, lungimea contextului, datele de antrenare și activitatea.
Pentru un cumpărător din business, licența contează la fel de mult ca benchmark-ul. Un model open-weight cu licență care permite utilizarea comercială este altceva decât unul care nu permite, indiferent ce spune clasamentul.
2. Procesarea
Generarea token-urilor înseamnă aritmetică, iar acceleratoarele fac multă aritmetică în paralel. Acesta este stratul pe care îl compară furnizorii, pentru că produce cele mai mari numere.
3. Memoria
Greutățile trebuie să fie rezidente, iar fiecare conversație în desfășurare are nevoie de memorie de lucru în plus. Proiectul vLLM a măsurat cache-ul cheie-valoare la „up to 1.7GB for a single sequence in LLaMA-13B”.
Înmulțit cu numărul de oameni care folosesc sistemul simultan, limita devine memoria, nu aritmetica. De aceea cea mai rapidă placă nu este automat placa potrivită.
4. Motorul de servire
Software-ul care execută modelul eficient: grupează cererile, le programează, gestionează cache-ul, încarcă greutățile, tratează concurența. Este stratul cel mai puțin vizibil și unul dintre cele mai importante.
Aceeași publicare vLLM a consemnat diferența pe care o face: sistemele dinaintea PagedAttention risipeau „60% – 80% of memory due to fragmentation and over-reservation”, față de „near-optimal memory usage, with a mere waste of under 4%” după.
5. Aplicația
Nimeni nu vorbește direct cu modelul. Oamenii folosesc o aplicație care oferă chat, căutare în documente, încărcare de fișiere, un API, autentificare, permisiuni și jurnalizare.
Aici stau întrebările de securitate. Lista OWASP Top 10 pentru aplicații LLM, ediția 2025, numește prompt injection, dezvăluirea informațiilor sensibile și tratarea necorespunzătoare a rezultatelor, iar fiecare dintre ele este o proprietate a acestui strat, nu a hardware-ului de dedesubt.
Un sistem AI de producție este un model îmbrăcat în alte patru straturi. Cumpărarea doar a stratului din mijloc este modul în care proiectele rămân neterminate.
De ce „avem nevoie de un server AI” nu este o specificație
Răspunsul corect la acea propoziție este o întrebare: pentru ce activitate? Zece oameni care pun întrebări scurte și zece oameni care analizează documente de o sută de pagini produc profiluri de memorie complet diferite pe hardware identic.
Infrastructura trebuie dimensionată din utilizarea observată: câți oameni simultan, cât de lungi sunt documentele, cât de lungi trebuie să fie răspunsurile și cum arată ora de vârf. Restul este o presupunere cu un preț atașat.
Cu Bastion
Ce schimbă Bastion
Bastion este un sistem AI privat, livrat ca un singur echipament sigilat care funcționează în clădirea ta. Un singur abonament lunar acoperă echipamentul, modelul, sistemul de operare securizat și suportul, iar nimic din ce scrie echipa ta nu părăsește clădirea.
Bastion livrează toate cele cinci straturi ca o singură unitate susținută, iar acesta este rostul unui appliance: deciziile de integrare sunt luate o dată și întreținute de furnizor.
Stratul aplicației rămâne locul unde stau permisiunile și regulile de date ale clientului, iar niciun appliance nu le decide în locul lui.
Întrebări la care răspunde articolul
- Din ce este format un sistem AI local?
- Din cinci straturi: modelul și licența lui, procesarea, memoria care ține greutățile și cache-ul de lucru, motorul de servire care grupează și programează cererile și aplicația care oferă chat, căutare, autentificare, permisiuni și jurnalizare.
- Care strat decide performanța?
- Deseori motorul de servire. vLLM a măsurat că sistemele de inferență dinaintea PagedAttention risipeau 60–80 % din memorie prin fragmentare și supra-rezervare, față de sub 4 % după, pe același hardware.
- De ce „avem nevoie de un server AI” nu este o specificație?
- Pentru că zece oameni care pun întrebări scurte și zece oameni care analizează documente de o sută de pagini produc profiluri de memorie complet diferite pe hardware identic. Infrastructura se dimensionează din utilizarea observată, nu din numărul de angajați.
Sursele
- 1
- 2
Citește mai departe
- Ce este un AI appliance on-premise și de ce muncă te scuteșteUn AI appliance este decizia de a nu deveni o companie de infrastructură AI. Cele unsprezece componente ale unei implementări locale, singurul exemplu măsurat al costului unei alegeri greșite și la ce se renunță în schimbul eliminării muncii de asamblare.Citește articolul
- Ce este inferența LLM și de ce este singura parte pe care o cumperiAntrenare față de inferență, cele două faze dintr-o singură cerere, variabilele care decid cât de rapid pare sistemul și lista de opt puncte care transformă „AI rapid” în ceva verificabil.Citește articolul