Afirmațiile de performanță pentru sistemele AI sunt de obicei un singur număr, fără unități în jurul lui. „30 de token-uri pe secundă” nu este o specificație până nu se știe pentru cine, la ce lungime a contextului și sub ce încărcare.
Ce este un token
Un model nu citește cuvinte. Citește token-uri, adică fragmente de text produse de un tokenizator. Un cuvânt englezesc frecvent este adesea un singur token. Un cuvânt rar, un nume propriu sau o formă flexionată pot fi mai multe.
O cerere are token-uri de intrare, promptul și orice document recuperat. Răspunsul are token-uri de ieșire. Ambele contează și costă lucruri diferite.
Efectul de limbă, măsurat
Tokenizatoarele nu sunt neutre între limbi. Un studiu publicat la 17 mai 2023 a constatat că „The same text translated into different languages can have drastically different tokenization lengths, with differences up to 15 times in some cases.”
Aceeași lucrare identifică cele trei consecințe: cost inegal pentru serviciile lingvistice comerciale, timp de procesare și latență variabile și o cantitate mai mică de conținut care încape în fereastra de context pentru limbile afectate.
A treia este capcana pentru un cumpărător român. Un context de 8k nu înseamnă 8.000 de cuvinte și încape mai puțină română decât engleză dacă tokenizatorul tratează româna mai puțin eficient. Un benchmark făcut pe text în engleză poate, prin urmare, să supraestimeze ce face aceeași cutie cu contracte în română.
Cere cifra de debit pe propriile documente, în propria limbă. Este singura variantă a numărului care îți prezice experiența.
Debitul nu este timpul de răspuns
Token-urile pe secundă descriu de obicei viteza de generare. La 30 de token-uri pe secundă, un răspuns de 300 de token-uri se scrie în aproximativ zece secunde.
Însă, înainte să apară primul token de ieșire, modelul trebuie să proceseze intrarea. Un document de zece mii de token-uri și o întrebare de o sută de token-uri nu sunt aceeași muncă. Timpul până la primul token și token-urile pe secundă sunt măsurători diferite, iar utilizatorul le simte pe amândouă.
Concurența este locul unde numărul se mișcă cel mai mult
30 de token-uri pe secundă pentru un singur utilizator, singur pe mașină, este altă afirmație decât 30 de token-uri pe secundă fiecare, pentru treizeci de utilizatori simultan. A doua este mai grea aproximativ cu factorul la care te aștepți și depinde de batching-ul și de gestionarea memoriei din motorul de servire.
Proiectul vLLM a măsurat cât contează acel strat: înainte de PagedAttention, sistemele de inferență risipeau „60% – 80% of memory due to fragmentation and over-reservation”, față de „near-optimal memory usage, with a mere waste of under 4%” după.
Cei patru termeni care fac o ofertă reală
- Pentru câți utilizatori concurenți este valabilă cifra
- La ce lungime a contextului
- La câte token-uri pe secundă, per utilizator
- Cu ce tip de date pentru cache-ul KV
Orice furnizor poate produce un număr impresionant schimbând discret unul dintre cei patru termeni. Un număr cu toți patru atașați poate fi verificat, iar acesta este întregul rost al comunicării lui.
Cu Bastion
Ce schimbă Bastion
Bastion este un sistem AI privat, livrat ca un singur echipament sigilat care funcționează în clădirea ta. Un singur abonament lunar acoperă echipamentul, modelul, sistemul de operare securizat și suportul, iar nimic din ce scrie echipa ta nu părăsește clădirea.
Bastion îi declară pe toți patru împreună. Un nod Reasoning susține 35 de utilizatori concurenți, la 8k tokens de context, la 30 de tokens pe secundă fiecare, cu cache KV în fp8.
Efectul de limbă este real și se aplică și aici, motiv pentru care dimensionarea pornește de la documentele cumpărătorului, nu de la un corpus de benchmark.
Sursele
- 1
- 2
Citește mai departe
- Pentru AI local, memoria GPU decide mai mult decât viteza GPUUnde se duce memoria, de ce lungimea contextului o multiplică, ce aduce și ce costă quantizarea și întrebarea care înlocuiește „cât de rapid este GPU-ul?” atunci când cumperi pentru inferență locală.Citește articolul
- Ce este inferența LLM și de ce este singura parte pe care o cumperiAntrenare față de inferență, cele două faze dintr-o singură cerere, variabilele care decid cât de rapid pare sistemul și lista de opt puncte care transformă „AI rapid” în ceva verificabil.Citește articolul