Cele mai multe afirmații de capacitate pentru un server AI dau un număr de utilizatori. Unele adaugă o lungime de context. Aproape niciuna nu dă precizia cache-ului cheie-valoare, iar această omisiune singură poate muta răspunsul cu aproape dublu.
Ce este cache-ul cheie-valoare și de ce se termină primul
Un model de limbaj recitește tot ce s-a spus deja într-o conversație înainte de a scrie următorul cuvânt. În loc să refacă munca de fiecare dată, serverul stochează o cheie și o valoare pentru fiecare token văzut. Acea stocare este cache-ul cheie-valoare.
Greutățile sunt un cost fix. Le plătiți o dată, fie că sunt conectate una sau cincizeci de persoane. Cache-ul este altceva: fiecare conversație deschisă îl are pe al ei și crește cu fiecare token din ea. Pe o singură placă, greutățile sunt taxa de intrare, iar cache-ul decide câți oameni încap.
Ce îi face fp8
Cache-ul nu trebuie stocat la precizia în care a fost antrenat modelul. Un format în virgulă mobilă pe 8 biți ține fiecare număr într-un octet în loc de doi. Proiectul vLLM, a cărui documentație a fost citită pe 2026-09-23, descrie efectul simplu:
Quantizing the KV (Key-Value) cache to FP8 format can significantly reduce its memory footprint.
vLLM, Quantized KV Cache, citit 2026-09-23
Este o singură setare de server. Fără echipament nou, fără alt model, fără nicio modificare a greutăților.
Aritmetica pe o placă reală
Luați un accelerator de 96 GB. Pagina NVIDIA pentru RTX PRO 6000, citită pe 2026-09-23, dă 96 GB de GDDR7 cu cod corector de erori. Rezervați o zecime pentru spațiul de lucru de care are nevoie orice motor de inferență și rămân 86,4 GB.
Acum luați un model real. Qwen3.8-27B publică 64 de straturi, dintre care 16 folosesc atenție completă, cu 4 capete cheie-valoare și o dimensiune de cap de 256, citit pe 2026-09-23. Checkpointul lui publicat ocupă circa 21,9 GB. Rămân deci 64,5 GB liberi pentru conversații.
| cache fp8 | cache bfloat16 | |
|---|---|---|
| Cache de atenție per conversație | 0,268 GB | 0,537 GB |
| Stare recurentă fixă per conversație | 0,079 GB | 0,079 GB |
| Total per conversație | 0,347 GB | 0,616 GB |
| Conversații care încap în 64,5 GB | 185 | 104 |
O singură setare, de 1,78 ori mai multe locuri. Aceeași placă, aceleași greutăți, același model.
Al doilea efect, cel legat de viteză
Memoria este doar prima constrângere. Ca să scrie un token pentru toată lumea deodată, serverul trebuie să citească greutățile active plus cache-ul fiecărei conversații deschise. La 35 de conversații simultane, pasul pe fp8 citește circa 29,8 GB. Aceleași 35 la bfloat16 citesc circa 39,2 GB, adică cu 32 la sută mai mult trafic pentru același răspuns.
Precizia cache-ului mută deci ambele constrângeri în aceeași direcție. De aceea doi furnizori onești pot da numere de utilizatori care diferă cu jumătate, fără ca vreunul să mintă. Au ales alt tip de date pentru cache.
Ce costă fp8, pentru că nu este gratis
Înjumătățirea preciziei numerelor stocate este o aproximare, iar documentația motorului o spune chiar în opțiunile lui de configurare. Trei lucruri merită știute înainte ca cineva să trateze fp8 ca implicit.
- Din cutie, nimic nu este calibrat. Documentația vLLM spune că, fără calibrare, toate scalele de cuantizare sunt puse pe 1,0. Calea recomandată le estimează dintr-un set de date de calibrare.
- Nu orice strat suportă la fel. Aceeași documentație notează că unele tipuri de straturi de atenție sunt mai sensibile la cuantizarea cache-ului cheie-valoare și oferă un parametru care lasă straturile numite la precizia proprie a modelului.
- Există mai mult de un format pe 8 biți și mai mult de o strategie. vLLM listează fp8_e4m3 și fp8_e5m2, plus cuantizare per tensor sau per cap de atenție. Nu sunt interschimbabile, iar strategia per cap cere calea de calibrare.
Poziția onestă este că fp8 este un schimb foarte bun pentru majoritatea muncii, făcut deliberat, cu calitatea verificată pe documentele dumneavoastră. Nu este o dublare gratuită a capacității.
Ce să cereți unui furnizor
O afirmație de capacitate poate fi verificată când poartă patru termeni: câți utilizatori simultani, la ce lungime de context, la câți tokeni pe secundă fiecare și cu ce precizie de cache. Mai puneți o a cincea întrebare oricui vă oferă fp8: a fost cache-ul calibrat sau scalele au rămas la valoarea implicită.
Cu Bastion
Ce schimbă Bastion
Bastion este un sistem AI privat, livrat ca un singur echipament sigilat care funcționează în clădirea ta. Un singur abonament lunar acoperă echipamentul, modelul, sistemul de operare securizat și suportul, iar nimic din ce scrie echipa ta nu părăsește clădirea.
Bastion scrie precizia cache-ului în fiecare cifră de capacitate pe care o publică, pentru că un număr de utilizatori fără ea nu poate fi verificat de cumpărător.
Oferta pentru nodul Reasoning este 35 de utilizatori simultani, la 8.000 de tokeni de context, la 30 de tokeni pe secundă fiecare, cu cache cheie-valoare fp8. Cei patru termeni circulă împreună, în ofertă și pe această pagină.
Cifra este calculată, nu măsurată. Primul echipament nu este construit. Când va fi măsurat, măsurătoarea înlocuiește calculul, iar pagina spune pe care dintre ele o arată.
Întrebări la care răspunde articolul
- Ce este un KV cache pe fp8?
- Stochează fiecare număr din cache-ul cheie-valoare al modelului într-un octet în loc de doi. Calculat dintr-o configurație publicată, pe o placă de 96 GB, asta ridică numărul conversațiilor simultane de 8.000 de tokeni de la 104 la 185, cu aceleași greutăți și același model.
- Scade fp8 calitatea răspunsurilor?
- Este o aproximare, deci poate. Documentația vLLM, citită 2026-09-23, spune că fără calibrare toate scalele de cuantizare sunt puse pe 1,0 și recomandă estimarea lor dintr-un set de date de calibrare. Notează și că unele tipuri de straturi de atenție sunt mai sensibile și pot fi lăsate la precizie completă.
- De câtă memorie are nevoie cache-ul per utilizator?
- Urmează configurația modelului. Qwen3.8-27B are 16 straturi de atenție completă, 4 capete cheie-valoare și dimensiunea capului 256, citit 2026-09-23, ceea ce dă 0,268 GB de cache de atenție per conversație de 8.000 de tokeni la fp8 și 0,537 GB la bfloat16, plus 0,079 GB de stare recurentă fixă.
Sursele
- 1
- 2
- 3
- 4
Citește mai departe
- Dens sau mixture of experts: ce costă arhitectura pe cumpărătorDouă configurații de model, citite în aceeași zi, pun cifre reale pe această alegere. Modelul MoE ține un sfert din cache-ul cheie-valoare per conversație. Tot el trimite fiecare token către 8 din 256 de experți, iar un lot citește reuniunea lor, acolo unde promisiunea de debit începe să cedeze.Citește articolul
- Ce hardware rulează un LLM local și ce lipsește din lista de componenteCalculul de memorie, pornit de la o configurație de model publicată și de la o specificație de placă publicată. De ce un model de 32 de miliarde de parametri nu încape pe o placă de 32 GB, cât costă în memorie o conversație și cele cinci lucruri care nu apar în nicio listă de componente.Citește articolul