Chi compra davvero l’inferenza decentralizzata nel 2026?
Il traffico cresce ma i token perdono tra il 65% e il 98% dai massimi. Dietro l'inferenza AI decentralizzata la vera domanda non è se funziona, ma chi la paga e perché.
Nel 2026 al centro dell’AI-crypto c’è un paradosso difficile da ignorare. Le reti di inferenza decentralizzata, cioè i sistemi che affittano GPU sparse per far girare modelli di intelligenza artificiale senza passare dai grandi cloud, elaborano più token di calcolo che mai. Eppure i loro asset quotati hanno bruciato quasi tutto il valore: il TAO di Bittensor viaggia intorno ai 228 euro, in calo di circa il 65% dal massimo storico; RENDER è sotto di quasi il 90%; l’AKT di Akash di oltre il 93%; l’IO di io.net di quasi il 98% (dati CoinGecko, 19 settembre 2026).
La domanda che quasi tutti si pongono, «funziona davvero?», è ormai la meno interessante. Tecnicamente funziona: basta cambiare una riga di codice (il base_url), puntare a un endpoint decentralizzato compatibile con le API di OpenAI e ricevere risposte da un modello open-source a un prezzo inferiore. La questione che conta nel 2026 è un’altra: chi compra questa inferenza, perché la preferisce al cloud tradizionale e in quale valuta paga. Questo articolo prova a rispondere motore per motore, separando la domanda reale dal traffico dichiarato.
Anticipiamo la conclusione. La domanda esiste, cresce ed è concreta, ma è più piccola, più concentrata e di forma diversa da quella suggerita dai cruscotti di marketing e dalle capitalizzazioni dei token. Quattro motori la spingono (il prezzo, la privacy, la libertà dai filtri e gli agenti autonomi) e solo alcuni sembrano difendibili nel lungo periodo. Capire quali è il modo migliore per distinguere un’infrastruttura con clienti veri da una che vive di sussidi.
Che cosa compra davvero chi «compra inferenza»
Prima di parlare di domanda serve fissare l’oggetto. L’addestramento (training) di un modello è la fase costosa e occasionale in cui il modello viene costruito; l’inferenza è l’uso ripetuto di quel modello per generare risposte, ed è la parte più continua e crescente della spesa in calcolo AI. Chi «compra inferenza» non compra una GPU: compra risposte, misurate in token elaborati.
I compratori si dividono in tre categorie, spesso confuse tra loro. Il primo è lo sviluppatore di un’applicazione (una chat, un assistente, un motore di ricerca) che integra un modello via API. Il secondo è l’aggregatore, un intermediario come OpenRouter che smista le richieste verso decine di fornitori e rivende capacità: è un cliente all’ingrosso, non un utente finale. Il terzo, il più nuovo, è l’agente AI autonomo, un software che decide da sé quando pagare per una chiamata a un modello.
Questa è la parte di consumo della filiera, distinta dal lato dell’offerta (i proprietari di GPU che guadagnano affittandole) e dalla meccanica tecnica del routing. Qui la domanda è secca: perché uno di questi tre compratori dovrebbe scegliere una rete decentralizzata invece di Amazon, Google o direttamente OpenAI? Le risposte plausibili sono quattro, e vale la pena esaminarle una a una, perché non hanno lo stesso peso.
Perché la domanda è la vera incognita
Sul lato dell’offerta la storia è nota e in buona parte risolta: c’è tantissima GPU inattiva nel mondo, le reti la mettono a reddito, il prezzo scende. Il mercato dei token, però, prezza soprattutto questa narrazione di offerta, mentre è la domanda a decidere chi verrà pagato. Un’infrastruttura può registrare centinaia di migliaia di schede e restare senza clienti disposti a pagarle a prezzo pieno.
Il segnale più eloquente è proprio la divaricazione tra uso e prezzo. Se l’uso cresce e i token perdono tra il 65% e il 98%, il mercato sta dicendo una di due cose: o non crede che quell’uso sia reale, o non crede che il token catturi il valore di quell’uso. Entrambe le letture riportano alla stessa incognita, la qualità e la sostenibilità della domanda, non la sua esistenza teorica. È lo stesso scollamento tra fondamentali e prezzo che pesa oggi su gran parte del mercato crypto.
Il divario tra traffico dichiarato e traffico verificato
Il primo ostacolo per chi vuole misurare la domanda è che i numeri più citati sono autodichiarati. Chutes, la sottorete di inferenza di Bittensor gestita da Rayon Labs e prima subnet a superare i 100 milioni di dollari di capitalizzazione, dichiara circa 160 miliardi di token al giorno; i conteggi indipendenti basati sul traffico che passa da OpenRouter parlano invece di circa 6,8 miliardi di token al giorno su diciotto modelli, con un picco intorno ai 42 miliardi il 7 febbraio 2026 (analisi Own Your Mind). Lo stesso vale per io.net, il cui cruscotto indica decine di miliardi di token al giorno mentre il traffico realmente osservabile via OpenRouter è dell’ordine dei 4 miliardi (Own Your Mind).
È lo stesso scarto che c’è tra l’hashrate teorico e quello effettivo nel mining: un dato che misura la capacità potenziale, non l’uso pagato. Nessuno di questi numeri implica una frode, perché registrare capacità e servire traffico sono cose diverse e i cruscotti di norma contano la prima. Ma per rispondere alla domanda «chi compra?» conta solo il traffico che qualcuno paga a prezzo di mercato, e quel numero è quasi sempre uno o due ordini di grandezza sotto il titolo.
| Metrica | Dato dichiarato | Dato verificabile |
|---|---|---|
| Chutes (Bittensor), token/giorno | ~160 miliardi (Rayon Labs) | ~6,8 miliardi su 18 modelli via OpenRouter (picco ~42 mld il 7 feb) |
| io.net, uso giornaliero | decine di miliardi di token (cruscotto) | ~4 miliardi di token osservati via OpenRouter |
| Chutes, ricavi contro sussidio | sussidio ~52 milioni $/anno in TAO | ricavi esterni ~1,3-2,4 milioni $/anno |
Driver 1: il prezzo, un vantaggio reale ma un bersaglio mobile
Il primo motore della domanda è il più intuitivo: costa meno. Sul noleggio di una GPU di fascia alta lo sconto è documentato. Un’ora di NVIDIA H100 sui grandi cloud costa tra i 6 e gli 11 euro (AWS intorno ai 6 euro, Azure e Google verso i 10), mentre i fornitori specializzati e le reti DePIN scendono nella fascia 1,70-3 euro, cioè dal 40% all’85% in meno (confronto Spheron). Per chi serve un modello open-source su larga scala, è una differenza che si sente in bilancio.
| Fornitore | Tipo | Prezzo orario indicativo (H100) |
|---|---|---|
| AWS | Hyperscaler | ~6 € |
| Microsoft Azure | Hyperscaler | ~10,50 € |
| Google Cloud | Hyperscaler | ~9,50 € |
| io.net | Rete DePIN | 1,70-3 € |
| Spheron | Specializzato | ~2,20 € (0,90 € spot) |
| Vast.ai | Marketplace | 1,30-2 € |
Il problema è che lo sconto è un bersaglio mobile. Nel 2026 l’inferenza centralizzata ha innescato la guerra di prezzo più aggressiva della storia dell’AI enterprise: DeepSeek ha portato il prezzo del suo modello di punta a circa 0,12 e 0,24 euro per milione di token (0,14 e 0,28 dollari, in ingresso e in uscita), e nel giro di novanta giorni OpenAI, Google e Anthropic hanno tagliato, con Google che ha ridotto Gemini fino all’85% (Spheron). Quando il pavimento del prezzo centralizzato crolla più in fretta di quanto le reti decentralizzate riescano a limare i costi, il vantaggio da solo diventa fragile. Il prezzo attira, ma non fidelizza.
Driver 2: privacy e calcolo riservato
Il secondo motore è più difendibile: alcuni dati non possono lasciare un perimetro di fiducia. Uno studio legale, un ospedale, una banca o un’azienda con segreti industriali non può inviare i propri prompt a un provider che li vede in chiaro. Qui entra il calcolo riservato (confidential computing): l’inferenza gira dentro un ambiente hardware isolato (un TEE, Trusted Execution Environment) che nemmeno l’operatore della macchina può ispezionare, e produce una prova crittografica (attestation) del fatto che il modello atteso ha girato in un enclave sicuro.
Phala Network è l’esempio più concreto: i suoi nodi GPU combinano Intel TDX con schede NVIDIA H100, H200 e B200 in macchine virtuali riservate, con un sovraccarico dichiarato tra lo 0,5% e il 5% e oltre 1,34 miliardi di token elaborati in una singola giornata (Phala). Anche Akash ha spinto sullo stesso terreno, come abbiamo raccontato in Akash 2026: GPU decentralizzate e il calcolo riservato.
La domanda di privacy è reale e ha un cliente disposto a pagare un premio, ma è ancora agli inizi: richiede hardware specifico, competenze di integrazione e una fiducia nel produttore del chip (in genere Intel o NVIDIA) che reintroduce, per altra via, un attore centrale. Per un lettore europeo il richiamo al GDPR e alla residenza dei dati è immediato: se la prova crittografica regge, il calcolo riservato è uno dei pochi terreni su cui la decentralizzazione offre qualcosa che il cloud tradizionale non può replicare con la stessa credibilità. È un motore promettente più che maturo.
Driver 3: modelli senza censura e permissionless
Il terzo motore è il più sottovalutato e forse il più solido: esiste una domanda strutturale di modelli che nessuno può filtrare, disattivare o negare. I grandi fornitori applicano policy di contenuto, limiti d’uso e verifiche d’identità; una rete permissionless che serve modelli open-source non può, per costruzione, negare il servizio. Non è un dettaglio ideologico, è un vantaggio competitivo che i concorrenti centralizzati non possono offrire nemmeno volendo.
Venice.ai è la scommessa più visibile su questo terreno. Fondata da Erik Voorhees (già dietro ShapeShift) insieme a Jesse Proudman, ha superato il milione di utenti e non censura i modelli open-source che fa girare; il token VVV dà accesso a una quota proporzionale di capacità, mentre DIEM funziona come un credito di calcolo. A luglio 2026 Venice è diventata un unicorno con una serie A da 65 milioni di dollari a una valutazione di un miliardo (TechCrunch). Voorhees ha riassunto così la filosofia del prodotto: «We treat you as an adult, capable of using information technology without paternalism» (vi trattiamo da adulti, capaci di usare la tecnologia senza paternalismo), in un’intervista a Unchained.
È un mercato piccolo ma fedele e, soprattutto, difendibile: è esattamente il segmento che i fornitori centralizzati non vogliono o non possono servire. Non sarà mai di massa, ma è la nicchia in cui la decentralizzazione non è un espediente di prezzo bensì il prodotto stesso. E la fedeltà, in un mercato dove il prezzo scende ogni trimestre, vale più di uno sconto.
Driver 4: agenti AI e micropagamenti
Il quarto motore è quello con il potenziale più grande e la realizzazione più scarsa. Un agente AI autonomo che deve pagare per una chiamata a un modello ha bisogno di rotaie di pagamento programmabili: niente carta di credito, niente approvazione umana a ogni passaggio. Lo standard emergente è x402, che riporta in vita il vecchio codice HTTP 402 (Payment Required) e fa firmare all’agente una transazione in stablecoin per sbloccare la risorsa. È qui che l’inferenza decentralizzata e i pagamenti on-chain si incontrano: una macchina paga un’altra macchina per del calcolo, senza intermediari.
I numeri, però, raccontano una realizzazione ancora minima. Gli agenti hanno effettuato oltre 100 milioni di transazioni x402 su Base, ma il valore realmente scambiato on-chain resta minimo, dell’ordine di poche decine di migliaia di dollari al giorno, e circa metà dell’attività è test o volume gonfiato più che commercio reale (Chainalysis). Già a marzo 2026 CoinDesk titolava che, per i micropagamenti, «la domanda semplicemente non c’è ancora» (CoinDesk).
Il caso d’uso più credibile per gli agenti non è comprare beni ma pagare risorse digitali: API, dati e, appunto, inferenza. Chi vuole capire perché gli agenti sono i primi clienti naturali di questa infrastruttura può leggere il nostro reportage sui mercati predittivi popolati da agenti AI; sul lato delle rotaie di pagamento, la partita si gioca sulle stablecoin regolamentate, come spieghiamo in Stablecoin nei pagamenti: le regole e il muro dei 200 milioni. Il mercato potenziale è enorme; la domanda pagante, per ora, è un rivolo.
I quattro motori a confronto
Messi in fila, i quattro motori mostrano un quadro netto: due sono difendibili (privacy e assenza di censura), uno è reale ma fragile (prezzo), uno è potenziale ma quasi tutto da realizzare (agenti). La tabella riassume chi chiede ciascun servizio e quanto è concreta oggi la domanda.
| Motore | Chi lo chiede | Quanto è reale nel 2026 | Esempio |
|---|---|---|---|
| Prezzo | Sviluppatori sensibili ai costi | Reale ma fragile (guerra di prezzo centralizzata) | io.net, Chutes |
| Privacy e calcolo riservato | Sanità, legale, imprese, dati sensibili | Solido ma agli inizi | Phala |
| Modelli senza censura | Utenti e sviluppatori permissionless | Piccolo, fedele, difendibile | Venice |
| Agenti AI e micropagamenti | Agenti autonomi che pagano calcolo e API | Potenziale enorme, quasi tutto da realizzare | x402 |
Chi paga davvero, e in quale valuta
Qui si tocca il nodo che il mercato dei token continua a fraintendere. Là dove la domanda di inferenza decentralizzata è più solida, viene pagata quasi sempre in valuta tradizionale o in abbonamento, non nel token della rete. L’esempio più chiaro è Prime Intellect: addestramento distribuito, inferenza ospitata e verifica con il suo sistema TOPLOC, circa 100 milioni di dollari di ricavi ricorrenti annui e oltre 6.000 clienti (tra cui Ramp e Zapier) raggiunti in meno di un anno, con una serie A da 130 milioni a valutazione di un miliardo guidata da Radical Ventures con Nvidia e Intel Capital (TechCrunch, getLatka). Prime Intellect non ha un token quotato: la domanda che genera la cattura come capitale azionario.
Lo stesso schema si ripete altrove. io.net ha chiuso contratti enterprise da milioni di dollari e ha introdotto un motore (l’Incentive Dynamic Engine) che lega le emissioni ai ricavi reali, bruciando parte del fatturato in IO, toccando i 4 miliardi di token AI al giorno (Cryptonews); Venice monetizza soprattutto tramite abbonamenti e la vendita di capacità. Il messaggio per chi investe è scomodo: comprare il token non equivale a comprare la domanda di inferenza, perché i clienti migliori pagano in dollari, euro o abbonamenti, non in TAO, RENDER o IO.
Il soffitto dei pesi aperti
C’è un limite strutturale alla domanda che nessuna ottimizzazione di prezzo può superare: le reti decentralizzate possono servire solo modelli a pesi aperti. Si affittano Llama, DeepSeek, Qwen, Mistral e simili, perché i loro pesi sono scaricabili e distribuibili su GPU di terzi. I modelli di frontiera chiusi (GPT-5, Claude, Gemini) non si possono noleggiare a nessun prezzo su un’infrastruttura permissionless, perché i loro pesi non lasciano i server del produttore.
Questo definisce il tetto del mercato indirizzabile: chi ha bisogno della qualità di frontiera assoluta resta sul cloud proprietario, per definizione. La buona notizia per le reti decentralizzate è che i modelli open-source stanno recuperando in fretta, e DeepSeek ha dimostrato che un modello aperto può competere sui costi con i migliori. La cattiva è che il compratore più pregiato, quello disposto a pagare di più per l’ultimo punto percentuale di capacità, è escluso per costruzione. La domanda decentralizzata cresce quanto crescono i pesi aperti, non un millimetro di più.
La fiducia: la domanda che dovrebbe esserci e non c’è ancora
In teoria l’inferenza decentralizzata dovrebbe generare una domanda enorme di verifica. Quando affidi un prompt a una GPU che non possiedi e non vedi, non hai modo di sapere se ha davvero eseguito il modello che hai pagato o una versione più piccola e più economica. Come scrive il team di Prime Intellect nel paper che descrive TOPLOC, «inference providers often make adjustments to computation methods to optimize for cost, efficiency, or specific commercial goals» (i fornitori spesso modificano i metodi di calcolo per ottimizzare costi, efficienza o obiettivi commerciali) (Prime Intellect). Un fornitore che sostituisce silenziosamente il modello o abbassa la precisione taglia i costi e nessuno se ne accorge.
Il problema è che verificare costa. Vitalik Buterin, nel suo saggio sull’incrocio tra crypto e AI, individua proprio nella verificabilità l’uso più forte della blockchain per l’intelligenza artificiale, ma avverte che le prove a conoscenza zero applicate all’inferenza aggiungono un sovraccarico dell’ordine delle centinaia di volte (vitalik.eth.limo). Le alternative più leggere (i TEE hardware, gli approcci ottimistici come opML, le firme statistiche come TOPLOC, che riduce la memoria richiesta di mille volte e valida fino a cento volte più in fretta) riducono il costo ma introducono compromessi su fiducia o latenza.
Il risultato è che oggi quasi nessun compratore paga un premio per l’inferenza verificata: preferisce fidarsi e risparmiare. È lo stesso paradosso descritto in Ritual: gli agenti AI autonomi che custodiscono le chiavi, dove la verifica prova che il calcolo è corretto ma non che sia legittimo. La fiducia è la domanda che tutti citano come applicazione decisiva e che ancora non compra quasi nessuno.
Tecnologia su, token giù: cosa dice il mercato
Se si sovrappongono le due curve, uso e prezzo, il quadro è inequivocabile. L’attività cresce, i token quotati restano vicini ai minimi. La tabella seguente riassume la situazione dei principali asset del settore al 19 settembre 2026.
| Token | Prezzo | Capitalizzazione | Dal massimo storico |
|---|---|---|---|
| TAO (Bittensor) | ~228 € | ~2,6 miliardi € | -65% |
| RENDER | ~1,35 € | ~700 milioni € | -88% |
| AKT (Akash) | ~0,48 € | ~145 milioni € | -93% |
| IO (io.net) | ~0,12 € | ~49 milioni € | -98% |
Il rimbalzo del TAO negli ultimi mesi va letto con prudenza: è alimentato soprattutto dalla prospettiva di ETF sul token (le richieste di Grayscale e Bitwise), cioè da un tema di finanziarizzazione, non da un salto della domanda di inferenza. Quando un asset sale per la narrazione di un veicolo di investimento e non per i ricavi sottostanti, il divario tra tecnologia e token non si chiude: cambia solo chi lo detiene.
Cosa cambia per l’Italia: Consob, MiCA, AI Act e fisco
Per il lettore italiano la mappa normativa ha due livelli. Sul fronte crypto, MiCA (recepito con il D.lgs. 129/2024, che designa Consob e Banca d’Italia) regola l’emissione e i servizi su cripto-attività: alla chiusura del periodo transitorio, il 1 luglio 2026, in Italia risultavano nove soggetti abilitati (Consob). Ma MiCA non regola il protocollo di calcolo né la GPU che gira in un altro continente: disciplina chi emette e chi offre servizi sul token, non l’atto tecnico dell’inferenza. I derivati su questi asset, poi, ricadono sotto la MiFID II, non sotto MiCA.
Sul fronte AI, il regolamento europeo (AI Act) è la novità del 2026: dal 2 agosto sono operativi i poteri sanzionatori della Commissione sui modelli di uso generale, con multe fino a 15 milioni di euro o al 3% del fatturato mondiale (Commissione europea). Qui si apre una domanda spinosa per l’inferenza decentralizzata: chi è il «fornitore» responsabile quando un modello gira su migliaia di GPU anonime sparse in decine di paesi? La risposta non è ancora chiara, e l’incertezza è essa stessa un freno alla domanda enterprise, che ha bisogno di sapere chi risponde.
Sul piano fiscale, dal 1 gennaio 2026 le plusvalenze cripto sono tassate in Italia al 33%, con la soglia di esenzione da 2.000 euro abolita; fanno eccezione le stablecoin in euro conformi a MiCA (token di moneta elettronica), rimaste al 26%. È un dettaglio che pesa proprio sul motore degli agenti: un agente che paga in stablecoin dollaro genera un evento potenzialmente rilevante a ogni conversione, mentre una stablecoin in euro semplifica la vita anche al fisco. Negli Stati Uniti, invece, il quadro resta grigio: l’interpretazione congiunta SEC-CFTC del marzo 2026 non ha detto nulla sui token DePIN e AI, lasciando TAO, RENDER, AKT e IO in un limbo di classificazione, come raccontiamo in SEC senza CLARITY: le regole crypto ora le scrivono i giudici.
Come valutare la domanda (per chi costruisce e per chi investe)
Che siate sviluppatori in cerca di un fornitore o investitori in cerca di un token, la stessa griglia aiuta a separare la sostanza dal rumore. Sei domande, in ordine di importanza:
- Traffico verificato o dichiarato? Cercate numeri confermati da terze parti (per esempio OpenRouter o dati on-chain), non solo il cruscotto del progetto.
- Quale motore di domanda? Prezzo, privacy, assenza di censura o agenti: i primi due si difendono meglio del terzo da soli.
- Chi paga e in che valuta? Ricavi in euro, dollari o abbonamenti valgono più di un volume gonfiato dalle emissioni del token.
- Rapporto sussidio/ricavi. Se le emissioni superano i ricavi esterni di 20-40 volte, come per Chutes, il prezzo basso è un sussidio, non un vantaggio strutturale.
- Dipendenza dai pesi aperti. Il servizio è utile solo finché i modelli open-source bastano al vostro caso d’uso.
- Verifica e conformità. Esiste un meccanismo di prova (TEE, opML, TOPLOC)? E il fornitore è inquadrabile ai fini MiCA e AI Act?
Applicata con onestà, questa griglia porta quasi sempre alla stessa conclusione del mercato: l’infrastruttura è migliore dei suoi token, la domanda è vera ma selettiva, e il compratore che conta oggi paga in valuta, non in speranza. Non è un verdetto contro la decentralizzazione, è un invito a guardare i clienti prima delle capitalizzazioni.
Domande frequenti
Che cos’è l’inferenza decentralizzata?
È l’esecuzione di modelli di intelligenza artificiale (la fase di uso, non di addestramento) su una rete di GPU di terzi coordinata da una blockchain o da un protocollo, invece che sui server di un unico grande cloud. Si accede in genere tramite endpoint compatibili con le API di OpenAI, così da poter cambiare fornitore modificando una sola riga di codice.
L’inferenza decentralizzata conviene davvero rispetto a OpenAI o Google?
Sul noleggio di GPU lo sconto è reale, dal 40% all’85% rispetto ai grandi cloud, ma è un vantaggio fragile: nel 2026 la guerra di prezzo tra i fornitori centralizzati, innescata da DeepSeek, ha abbassato in fretta anche il costo dell’inferenza tradizionale. Il prezzo attira, ma da solo non fidelizza il cliente.
I miei dati sono più al sicuro sull’inferenza decentralizzata?
Non automaticamente. Lo sono se il fornitore usa il calcolo riservato, cioè ambienti hardware isolati (TEE) con prova crittografica di esecuzione, come fa Phala con GPU NVIDIA in enclave sicuri. Senza queste garanzie, affidare un prompt a una GPU sconosciuta espone agli stessi rischi di qualunque servizio di terzi, se non maggiori.
Comprare il token (TAO, RENDER, IO, AKT) espone alla domanda di inferenza?
Solo in parte. La domanda più solida oggi viene pagata in valuta tradizionale o in abbonamento e catturata come capitale azionario: Prime Intellect, per esempio, ha superato i 100 milioni di dollari di ricavi annui senza un token quotato. I token del settore hanno perso tra il 65% e il 98% dai massimi mentre l’uso cresceva, segno che valore d’uso e prezzo possono muoversi in direzioni opposte.
Come viene tassata e regolata in Italia l’inferenza decentralizzata?
Le plusvalenze cripto sono tassate al 33% dal 1 gennaio 2026, senza più la soglia di 2.000 euro, mentre le stablecoin in euro conformi a MiCA restano al 26%. Consob e Banca d’Italia vigilano su emittenti e servizi ai sensi di MiCA, i derivati ricadono sotto la MiFID II e l’AI Act europeo aggiunge obblighi per i modelli di uso generale dal 2 agosto 2026.
Marcus Okafor scrive di intelligenza artificiale e infrastrutture decentralizzate per HOGE Wire.