Sari la conținut
Toate articolele
Infrastructură AI

Ce înseamnă „tokens per second” și de ce textul în română schimbă calculul

Un token nu este un cuvânt și nu are aceeași dimensiune în toate limbile. Cercetarea a măsurat că același text tradus în limbi diferite poate avea lungimi de tokenizare care diferă „up to 15 times in some cases”, ceea ce se reflectă direct în cost, latență și context utilizabil.

De Bastion, Cluj-NapocaPublicat 6 min de citit

Afirmațiile de performanță pentru sistemele AI sunt de obicei un singur număr, fără unități în jurul lui. „30 de token-uri pe secundă” nu este o specificație până nu se știe pentru cine, la ce lungime a contextului și sub ce încărcare.

Ce este un token

Un model nu citește cuvinte. Citește token-uri, adică fragmente de text produse de un tokenizator. Un cuvânt englezesc frecvent este adesea un singur token. Un cuvânt rar, un nume propriu sau o formă flexionată pot fi mai multe.

O cerere are token-uri de intrare, promptul și orice document recuperat. Răspunsul are token-uri de ieșire. Ambele contează și costă lucruri diferite.

Efectul de limbă, măsurat

Tokenizatoarele nu sunt neutre între limbi. Un studiu publicat la 17 mai 2023 a constatat că „The same text translated into different languages can have drastically different tokenization lengths, with differences up to 15 times in some cases.”

Aceeași lucrare identifică cele trei consecințe: cost inegal pentru serviciile lingvistice comerciale, timp de procesare și latență variabile și o cantitate mai mică de conținut care încape în fereastra de context pentru limbile afectate.

A treia este capcana pentru un cumpărător român. Un context de 8k nu înseamnă 8.000 de cuvinte și încape mai puțină română decât engleză dacă tokenizatorul tratează româna mai puțin eficient. Un benchmark făcut pe text în engleză poate, prin urmare, să supraestimeze ce face aceeași cutie cu contracte în română.

Cere cifra de debit pe propriile documente, în propria limbă. Este singura variantă a numărului care îți prezice experiența.

Debitul nu este timpul de răspuns

Token-urile pe secundă descriu de obicei viteza de generare. La 30 de token-uri pe secundă, un răspuns de 300 de token-uri se scrie în aproximativ zece secunde.

Însă, înainte să apară primul token de ieșire, modelul trebuie să proceseze intrarea. Un document de zece mii de token-uri și o întrebare de o sută de token-uri nu sunt aceeași muncă. Timpul până la primul token și token-urile pe secundă sunt măsurători diferite, iar utilizatorul le simte pe amândouă.

Concurența este locul unde numărul se mișcă cel mai mult

30 de token-uri pe secundă pentru un singur utilizator, singur pe mașină, este altă afirmație decât 30 de token-uri pe secundă fiecare, pentru treizeci de utilizatori simultan. A doua este mai grea aproximativ cu factorul la care te aștepți și depinde de batching-ul și de gestionarea memoriei din motorul de servire.

Proiectul vLLM a măsurat cât contează acel strat: înainte de PagedAttention, sistemele de inferență risipeau „60% – 80% of memory due to fragmentation and over-reservation”, față de „near-optimal memory usage, with a mere waste of under 4%” după.

Cei patru termeni care fac o ofertă reală

  • Pentru câți utilizatori concurenți este valabilă cifra
  • La ce lungime a contextului
  • La câte token-uri pe secundă, per utilizator
  • Cu ce tip de date pentru cache-ul KV

Orice furnizor poate produce un număr impresionant schimbând discret unul dintre cei patru termeni. Un număr cu toți patru atașați poate fi verificat, iar acesta este întregul rost al comunicării lui.

Cu Bastion

Ce schimbă Bastion

Bastion este un sistem AI privat, livrat ca un singur echipament sigilat care funcționează în clădirea ta. Un singur abonament lunar acoperă echipamentul, modelul, sistemul de operare securizat și suportul, iar nimic din ce scrie echipa ta nu părăsește clădirea.

Bastion îi declară pe toți patru împreună. Un nod Reasoning susține 35 de utilizatori concurenți, la 8k tokens de context, la 30 de tokens pe secundă fiecare, cu cache KV în fp8.

Efectul de limbă este real și se aplică și aici, motiv pentru care dimensionarea pornește de la documentele cumpărătorului, nu de la un corpus de benchmark.

Sursele

  1. 1
  2. 2