Antrenarea creează sau modifică un model. Se face o singură dată, cu costuri mari, pe infrastructură foarte mare. Inferența este ce se întâmplă de fiecare dată când cineva pune o întrebare modelului finalizat.
Organizațiile care cumpără un appliance nu antrenează aproape niciodată ceva. Vor ca angajații să pună întrebări, să rezume documente, să extragă clauze și să redacteze răspunsuri. Aceasta este inferență, iar infrastructura trebuie proiectată pentru ea, nu pentru activitatea pe care nu o face nimeni.
Două faze într-o singură cerere
O cerere are o fază de prefill, în care modelul procesează tot ce i-ai dat, și o fază de decodare, în care generează răspunsul, token cu token.
Prefill-ul crește cu cât ai trimis. Decodarea crește cu cât scrie modelul. Un document de o sută de pagini cu o întrebare de un rând este aproape numai prefill. Un prompt scurt care cere un raport lung este aproape numai decodare. Cele două solicită mașina diferit, motiv pentru care un singur număr de benchmark nu descrie niciuna.
Ce decide efectiv viteza
- Dimensiunea modelului și precizia în care sunt stocate greutățile
- Memoria disponibilă, pentru că cache-ul cheie-valoare crește cu contextul și cu concurența
- Lungimea contextului și cât din el este folosit cu adevărat
- Lungimea promptului și lungimea așteptată a răspunsului
- Câte cereri sunt în desfășurare simultan
- Batching-ul și gestionarea memoriei din motorul de servire
- Hardware-ul de sub toate acestea
Motorul de servire merită mai multă atenție decât primește. Proiectul vLLM a măsurat că sistemele de inferență dinaintea PagedAttention risipeau „60% – 80% of memory due to fragmentation and over-reservation”, față de „near-optimal memory usage, with a mere waste of under 4%” după. Aceeași placă, alt software, altă capacitate.
Utilizatorii simt două numere, nu unul
Timpul până la primul token este cât rămâne ecranul gol. Token-urile pe secundă arată cât de repede apare apoi textul. Un sistem cu debit excelent și pornire lentă pare greoi, iar unul care pornește instantaneu și apoi se târăște pare și mai rău.
30 de token-uri pe secundă pentru un utilizator și 30 de token-uri pe secundă fiecare pentru treizeci de utilizatori sunt afirmații diferite despre mașini diferite.
Ce trebuie cerut furnizorului
- Ce model și sub ce licență
- La ce precizie, pentru greutăți și pentru cache-ul KV
- La ce lungime a contextului
- Pentru câți utilizatori concurenți
- Cu ce lungimi presupuse de intrare și de ieșire
- La câte token-uri pe secundă, per utilizator
- La ce timp până la primul token
- Pe ce configurație hardware
Opt răspunsuri transformă un adjectiv de marketing într-o măsurătoare pe care cineva o poate reproduce. Un furnizor care nu le poate da nu a măsurat lucrul pe care îl vinde.
Cu Bastion
Ce schimbă Bastion
Bastion este un sistem AI privat, livrat ca un singur echipament sigilat care funcționează în clădirea ta. Un singur abonament lunar acoperă echipamentul, modelul, sistemul de operare securizat și suportul, iar nimic din ce scrie echipa ta nu părăsește clădirea.
Bastion este un appliance de inferență și nimic altceva. Nu este o platformă de antrenare și este dimensionat și ofertat în termeni de inferență.
Un nod Reasoning susține 35 de utilizatori concurenți, la 8k tokens de context, la 30 de tokens pe secundă fiecare, cu cache KV în fp8. Celelalte puncte din listă țin de discuția de dimensionare, pe documentele cumpărătorului.
Sursele
- 1
Citește mai departe
- Ce rulează de fapt un model AI: cele cinci straturi din spatele ferestrei de chatUn ghid simplu de infrastructură AI pentru oamenii care trebuie să aprobe achiziția și motivul pentru care „avem nevoie de un server AI” nu este niciodată o propoziție completă.Citește articolul
- Ce înseamnă „tokens per second” și de ce textul în română schimbă calcululCum se citește o cifră de debit, de ce nu este timpul de răspuns, ce face concurența cu ea și efectul de limbă despre care un cumpărător român ar trebui să întrebe înainte să accepte un benchmark în engleză.Citește articolul