„Este cu totul o confuzie de idei să presupunem că folosirea economică a combustibilului echivalează cu un consum redus. Tocmai contrariul este adevărat.”William Stanley Jevons · The Coal Question · 1865 · The Coal Question (1865), cap. VII «Of the Economy of Fuel»
On-prem se justifică prin utilizare susținută sau prin date care nu pot pleca, nu prin prețul tokenului.
Paradoxul lui Jevons la agenți: pe măsură ce prețul per token a scăzut, consumul per sarcină a crescut — un agent arde de 10–100 de ori tokenii unui chat. Economia on-prem în 2026: un sistem cu opt plăci de clasă H100 costă 250–320 mii de dolari; închirierea unei plăci, mediană ~2,5 dolari pe oră; pragul de rentabilitate pe trei ani e tipic la 70–80% utilizare susținută, în timp ce majoritatea flotelor rulează la 40–65%; regula practică: evaluezi on-prem peste ~1 miliard de tokeni pe lună. Motivele care nu țin de preț: rezidența datelor, transferurile sub GDPR și Schrems II, reguli sectoriale; ghidul EDPB din 2025 numește inferența on-prem cea mai puternică atenuare a riscului de protecție a datelor la modelele de limbaj. Tiparul hibrid: cloud public în regiune UE pentru ce nu e sensibil, cloud suveran pentru ce e reglementat, on-prem pentru ce nu are voie să plece. Servirea se face cu motoare de clasa vLLM sau SGLang, unde cache-ul de prefix avantajează agenții. Costurile ascunse: echipa de operare, schimbările de model, evaluările la fiecare schimbare.
Pasajul 1. Dacă tokenii ieftini încurajează consumul, atunci planificarea trebuie să pornească de la consumul viitor, nu de la factura de azi. Un agent care rezolvă o sarcină astăzi va rezolva zece mâine, pentru că devine ieșire din buzunar să o lase să încerce mai mult. Deci întrebarea corectă nu e cât plătesc acum, ci cât voi arde când utilizarea se va fi umflat. Exemplu concret: o echipă care automatizează suportul clienților vede că fiecare reducere de preț o împinge să lase agentul să facă mai multe pași de verificare, nu mai puțini. Bugetul de capacitate trebuie dimensionat pentru acel agent mai vorbăciot, nu pentru cel de azi. Iar asta mută greutatea deciziei de la preț spre două întrebări: cât de constant e consumul și unde au voie să stea datele.
Pasajul 2. Constanta consumului decide cine merită o mașinie proprie. Un sistem dedicat plătește la fel zi și noapte, deci doar o utilizare susținută, ridicată, îl acoperă în câțiva ani. Majoritatea flotelor reale stau sub acel prag, pentru că cererea e inegală: vârfuri dimineața, goluri noaptea. Exemplu concret: o firmă de contabilitate arde toți tokenii în sezonul declarațiilor, iar vara plăcile stau moarte. Pentru ea, închirierea la cerere rămâne rațională, chiar dacă lunar consumul pare mare. Regula practică e să numeri tokenii pe lună și să comperi cu pragul de rentabilitate, nu cu factura de ieri. Dar există sarcini pe care nu le poți muta în cloud indiferent de preț, pentru că datele nu au voie să părăsească clădirea. Următorul pas e tocmai acel frâu care nu ține de bani: unde au voie să stea datele.
De ce contează Cine cumpără plăci pe prețul de azi al tokenului plătește de două ori: mașina și tokenii pe care mașina îi va încuraja.