Sari la conținut
Toate articolele
Cu AI în cloud

Un test pentru AI local a publicat ambele numere. Numai unul a circulat.

Un motor, un Mac, un set de întrebări. Rata de scriere publicată este de 54 de tokeni pe secundă. Așteptarea publicată până la primul cuvânt este de 96 de secunde. Ambele numere vin din același tabel, și numai primul a ajuns în titluri.

De Bastion, Cluj-NapocaPublicat 6 min de citit

Un tabel de test pentru un motor de AI local este o măsurătoare reală. Motorul există, numerele sunt publicate, iar furnizorul a pus cifrele incomode în același tabel cu cele avantajoase. Acest articol nu contestă niciuna dintre ele.

El urmărește un set de numere publicate prin calculul care decide cât așteaptă un om. Concluzia nu este că testul greșește. Este că numărul pe care îl citează industria măsoară partea din așteptare care de obicei este cea mai mică.

Un tabel, două numere, un titlu

Inco AI publică un test pentru Splash, motorul său de inferență pentru Apple silicon. Metoda este scrisă clar: „All engines ran on the same 48 GB M5 Pro, serving Qwen3.6-35B-A3B and Qwen3.8-27B over HTTP at their recommended settings. The prompts are a fixed set of coding tasks from NVIDIA’s SPEED-Bench, up to 32K tokens, with a 1,024-token output limit.”

Pe modelul dens de 27B, rata de scriere publicată scade cu contextul: 74 de tokeni pe secundă la întrebări scurte, 55 la 8K, 55 la 16K și 54 la 32K. Acesta este numărul pe care l-a dus mai departe presa.

Aceeași pagină publică și celălalt număr. La o întrebare de 32K cu memoria cache rece, Splash întoarce primul token după 96 de secunde. Motorul de comparație, oMLX, are nevoie de 317 secunde. Cu memoria cache caldă, Splash întoarce primul token după 282 de milisecunde, iar oMLX după 2.049 de milisecunde.

Calculul pe care tabelul nu îl tipărește

Testul limitează răspunsul la 1.024 de tokeni. La 54 de tokeni pe secundă, scrierea acelui răspuns durează 19,0 secunde. Aceasta este partea pe care o descrie titlul.

  • Cache rece: 96 de secunde de tăcere, apoi 19,0 secunde de scris. Total 115,0 secunde pentru 1.024 de tokeni, adică 8,9 tokeni pe secundă cap la cap.
  • Cache cald: 0,3 secunde de tăcere, apoi 19,0 secunde de scris. Total 19,3 secunde pentru 1.024 de tokeni, adică 53,1 tokeni pe secundă cap la cap.
  • Aceeași mașină, același motor, același model, aceeași întrebare. Diferența dintre cele două este de circa șase ori, și memoria cache a produs-o în întregime.

Niciuna dintre cele două cifre cap la cap nu apare în vreun titlu. Cifra citată, 54, rămâne aceeași în ambele cazuri, pentru că viteza de scriere nu se schimbă când memoria cache este rece. Pur și simplu încetează să descrie experiența.

Ce compară o afirmație de tipul „de două ori mai rapid”

LM Studio a rezumat rezultatul astfel: „In Inco’s tests on a 48 GB M5 Pro, Splash delivered roughly twice the decode speed of the next-fastest engine they measured on Qwen3.8-27B: 74 tokens per second on short prompts and 54 at 32K context.”

Inco scrie condiția pe propria pagină: „Because each engine ran at its own recommended settings, these are end-to-end comparisons.” Fiecare model Splash vine cu un model de schiță pentru decodare speculativă. Dintre motoarele comparate, Inco consemnează despre un pachet, cel al lui uzu, că „has no draft”. Deci comparația pune o configurație față în față cu altă configurație, exact cum spune propoziția.

Este un mod legitim de a testa, iar furnizorul a scris condiția. Eșecul este în aval. Un raport circulă; propoziția care îl nuanțează nu circulă.

Cerințele din spatele numărului rapid

Motorul este open source, sub licența Apache-2.0. Cerințele lui publicate sunt înguste: „Apple M3 or newer, macOS 26.4 or later, Homebrew, and 36 GB of unified memory (48 GB or more recommended).” Suportă două pachete de model, iar depozitul precizează că „Plain MLX or Transformers checkpoints do not work.”

O organizație care citește titlul ca pe o proprietate a echipamentelor pe care le are deja îl citește greșit. Este o proprietate a unei generații de cip, a unei versiuni de sistem de operare, a unei clase de memorie și a unui format de model.

Ce cumpără motorul este o altă întrebare

Același tabel arată unde se plătește ingineria. Pe modelul de 27B, Splash a dus la capăt toate cele 16 cereri simultane de 32K pe mașina de 48 GB, în timp ce oMLX a acceptat nouă. La o întrebare de 32K cu cache cald, întoarce primul token în 282 de milisecunde, față de 2.049. Acestea sunt numerele pe care o echipă cu mai multe sesiuni deodată le simte, la fiecare tur.

Sunt și numerele pe care nu le-a pus nimeni pe o miniatură.

Ce înseamnă asta pentru o organizație reglementată

O întrebare de achiziție despre un sistem AI care citează o singură cifră de viteză este incompletă. Patru termeni descriu capacitatea unei mașini: câți oameni lucrează în același timp, la ce lungime de context, la câți tokeni pe secundă fiecare și cu ce precizie a memoriei cache cheie-valoare. O cifră fără celelalte trei nu poate fi comparată cu nimic.

Alți doi termeni descriu așteptarea: timpul până la primul token cu memoria cache rece și cu ea caldă, la lungimea de context pe care munca o va folosi efectiv. Un furnizor care poate spune toți cei șase termeni a măsurat sistemul. Un furnizor care spune unul a măsurat partea cel mai ușor de citat.

Cu Bastion

Ce schimbă Bastion

Bastion este un sistem AI privat, livrat ca un singur echipament sigilat care funcționează în clădirea ta. Un singur abonament lunar acoperă echipamentul, modelul, sistemul de operare securizat și suportul, iar nimic din ce scrie echipa ta nu părăsește clădirea.

Bastion se cotează la fel de fiecare dată, pe echipament și niciodată pe utilizator: 35 de utilizatori simultan, la 8k tokeni de context, la 30 de tokeni pe secundă fiecare, cu cache KV fp8. Aceiași patru termeni apar în documentul de ofertă, pe acest site și în contract, deci cifra pe care o compară cumpărătorul este cifra care se livrează.

Limita vine prima. Acești patru termeni descriu scrierea, care, susține acest articol, este de obicei jumătatea mai mică a așteptării. Timpul până la primul token se măsoară pe primul echipament, nu se calculează, și se publică atunci când măsurătoarea există. Un echipament local sigilat elimină și variabila care face greu de refolosit un test din cloud: mașina din spatele cotației este mașina din clădire, și nu este împărțită cu traficul nimănui altcuiva.

Întrebări la care răspunde articolul

Ce viteză are un LLM local?
Depinde de două numere, nu de unul. În testul Inco pe un Mac M5 Pro de 48 GB, modelul scrie 54 de tokeni pe secundă, dar la un prompt de 32K cu cache-ul rece primul cuvânt apare după 96 de secunde.
LLM local sau în cloud: ce contează la viteză?
Timpul până la primul token, la lungimea de context folosită în lucru. Un sistem local nu își împarte mașina cu traficul altcuiva, deci cifra măsurată este cifra livrată.
Ce trebuie să ceară o firmă de la furnizorul unui sistem AI local?
Patru termeni de capacitate: utilizatori simultani, lungimea contextului, tokeni pe secundă pentru fiecare și precizia cache-ului KV. Plus timpul până la primul token, cu cache-ul rece și cu cel cald.

Sursele

  1. 1
  2. 2
  3. 3
  4. 4

    Inco AI

    DFlash 2: Keep Drafting Parallel

    citit 2026-09-22