Sari la conținut
Toate articolele
Infrastructură AI

Ce schimbă de fapt un KV cache pe fp8, calculat

Înjumătățirea preciziei cache-ului cheie-valoare este cea mai ieftină decizie de capacitate dintr-un server AI privat. Mută plafonul de locuri de 1,78 ori pe aceeași placă. Este și termenul pe care majoritatea afirmațiilor de capacitate îl omit.

De Bastion, Cluj-NapocaPublicat 7 min de citit

Cele mai multe afirmații de capacitate pentru un server AI dau un număr de utilizatori. Unele adaugă o lungime de context. Aproape niciuna nu dă precizia cache-ului cheie-valoare, iar această omisiune singură poate muta răspunsul cu aproape dublu.

Ce este cache-ul cheie-valoare și de ce se termină primul

Un model de limbaj recitește tot ce s-a spus deja într-o conversație înainte de a scrie următorul cuvânt. În loc să refacă munca de fiecare dată, serverul stochează o cheie și o valoare pentru fiecare token văzut. Acea stocare este cache-ul cheie-valoare.

Greutățile sunt un cost fix. Le plătiți o dată, fie că sunt conectate una sau cincizeci de persoane. Cache-ul este altceva: fiecare conversație deschisă îl are pe al ei și crește cu fiecare token din ea. Pe o singură placă, greutățile sunt taxa de intrare, iar cache-ul decide câți oameni încap.

Ce îi face fp8

Cache-ul nu trebuie stocat la precizia în care a fost antrenat modelul. Un format în virgulă mobilă pe 8 biți ține fiecare număr într-un octet în loc de doi. Proiectul vLLM, a cărui documentație a fost citită pe 2026-09-23, descrie efectul simplu:

Quantizing the KV (Key-Value) cache to FP8 format can significantly reduce its memory footprint.

vLLM, Quantized KV Cache, citit 2026-09-23

Este o singură setare de server. Fără echipament nou, fără alt model, fără nicio modificare a greutăților.

Aritmetica pe o placă reală

Luați un accelerator de 96 GB. Pagina NVIDIA pentru RTX PRO 6000, citită pe 2026-09-23, dă 96 GB de GDDR7 cu cod corector de erori. Rezervați o zecime pentru spațiul de lucru de care are nevoie orice motor de inferență și rămân 86,4 GB.

Acum luați un model real. Qwen3.8-27B publică 64 de straturi, dintre care 16 folosesc atenție completă, cu 4 capete cheie-valoare și o dimensiune de cap de 256, citit pe 2026-09-23. Checkpointul lui publicat ocupă circa 21,9 GB. Rămân deci 64,5 GB liberi pentru conversații.

Calculat din configurația publicată, pe o placă de 96 GB, context de 8k
cache fp8cache bfloat16
Cache de atenție per conversație0,268 GB0,537 GB
Stare recurentă fixă per conversație0,079 GB0,079 GB
Total per conversație0,347 GB0,616 GB
Conversații care încap în 64,5 GB185104
Calculat din configurația publicată, pe o placă de 96 GB, context de 8k

O singură setare, de 1,78 ori mai multe locuri. Aceeași placă, aceleași greutăți, același model.

Al doilea efect, cel legat de viteză

Memoria este doar prima constrângere. Ca să scrie un token pentru toată lumea deodată, serverul trebuie să citească greutățile active plus cache-ul fiecărei conversații deschise. La 35 de conversații simultane, pasul pe fp8 citește circa 29,8 GB. Aceleași 35 la bfloat16 citesc circa 39,2 GB, adică cu 32 la sută mai mult trafic pentru același răspuns.

Precizia cache-ului mută deci ambele constrângeri în aceeași direcție. De aceea doi furnizori onești pot da numere de utilizatori care diferă cu jumătate, fără ca vreunul să mintă. Au ales alt tip de date pentru cache.

Ce costă fp8, pentru că nu este gratis

Înjumătățirea preciziei numerelor stocate este o aproximare, iar documentația motorului o spune chiar în opțiunile lui de configurare. Trei lucruri merită știute înainte ca cineva să trateze fp8 ca implicit.

  • Din cutie, nimic nu este calibrat. Documentația vLLM spune că, fără calibrare, toate scalele de cuantizare sunt puse pe 1,0. Calea recomandată le estimează dintr-un set de date de calibrare.
  • Nu orice strat suportă la fel. Aceeași documentație notează că unele tipuri de straturi de atenție sunt mai sensibile la cuantizarea cache-ului cheie-valoare și oferă un parametru care lasă straturile numite la precizia proprie a modelului.
  • Există mai mult de un format pe 8 biți și mai mult de o strategie. vLLM listează fp8_e4m3 și fp8_e5m2, plus cuantizare per tensor sau per cap de atenție. Nu sunt interschimbabile, iar strategia per cap cere calea de calibrare.

Poziția onestă este că fp8 este un schimb foarte bun pentru majoritatea muncii, făcut deliberat, cu calitatea verificată pe documentele dumneavoastră. Nu este o dublare gratuită a capacității.

Ce să cereți unui furnizor

O afirmație de capacitate poate fi verificată când poartă patru termeni: câți utilizatori simultani, la ce lungime de context, la câți tokeni pe secundă fiecare și cu ce precizie de cache. Mai puneți o a cincea întrebare oricui vă oferă fp8: a fost cache-ul calibrat sau scalele au rămas la valoarea implicită.

Cu Bastion

Ce schimbă Bastion

Bastion este un sistem AI privat, livrat ca un singur echipament sigilat care funcționează în clădirea ta. Un singur abonament lunar acoperă echipamentul, modelul, sistemul de operare securizat și suportul, iar nimic din ce scrie echipa ta nu părăsește clădirea.

Bastion scrie precizia cache-ului în fiecare cifră de capacitate pe care o publică, pentru că un număr de utilizatori fără ea nu poate fi verificat de cumpărător.

Oferta pentru nodul Reasoning este 35 de utilizatori simultani, la 8.000 de tokeni de context, la 30 de tokeni pe secundă fiecare, cu cache cheie-valoare fp8. Cei patru termeni circulă împreună, în ofertă și pe această pagină.

Cifra este calculată, nu măsurată. Primul echipament nu este construit. Când va fi măsurat, măsurătoarea înlocuiește calculul, iar pagina spune pe care dintre ele o arată.

Întrebări la care răspunde articolul

Ce este un KV cache pe fp8?
Stochează fiecare număr din cache-ul cheie-valoare al modelului într-un octet în loc de doi. Calculat dintr-o configurație publicată, pe o placă de 96 GB, asta ridică numărul conversațiilor simultane de 8.000 de tokeni de la 104 la 185, cu aceleași greutăți și același model.
Scade fp8 calitatea răspunsurilor?
Este o aproximare, deci poate. Documentația vLLM, citită 2026-09-23, spune că fără calibrare toate scalele de cuantizare sunt puse pe 1,0 și recomandă estimarea lor dintr-un set de date de calibrare. Notează și că unele tipuri de straturi de atenție sunt mai sensibile și pot fi lăsate la precizie completă.
De câtă memorie are nevoie cache-ul per utilizator?
Urmează configurația modelului. Qwen3.8-27B are 16 straturi de atenție completă, 4 capete cheie-valoare și dimensiunea capului 256, citit 2026-09-23, ceea ce dă 0,268 GB de cache de atenție per conversație de 8.000 de tokeni la fp8 și 0,537 GB la bfloat16, plus 0,079 GB de stare recurentă fixă.

Sursele

  1. 1

    vLLM

    Quantized KV Cache

    citit 2026-09-23

  2. 2

    Hugging Face

    Qwen/Qwen3.8-27B, config.json

    citit 2026-09-23

  3. 3
  4. 4

    vLLM

    Conserving Memory

    citit 2026-09-23