Le AI miniaturizzate stanno portando inferenza, visione, voce, rilevamento di anomalie ed ormai perfino capacità generative direttamente dentro microcontrollori, sensori, automobili, wearable e dispositivi che lavorano con pochi megabyte o addirittura kilobyte di memoria. Non sono ChatGPT rimpiccioliti: sono modelli progettati o compressi per fare molto bene compiti specifici, consumando pochissimo, senza cloud e con latenze quasi immediate.
L'AI che non vive nel datacenter
Se avete seguito l'Intelligenza Artificiale negli ultimi anni saprete certamente che siamo stati educati quasi senza accorgercene ad associare la parola AI a qualche cosa di gigantesco, rack pieni di GPU, centinaia di gigabyte di memoria, datacenter da centinaia di megawatt ed un modello che per risponderci deve essere raggiunto attraverso Internet. È comprensibile, perché ChatGPT, Claude, Gemini e tutti i grandi modelli generativi hanno reso visibile proprio quella faccia dell'AI. Ma mentre guardavamo i modelli crescere fino a decine e centinaia di miliardi di parametri è successo anche il movimento opposto, molto meno spettacolare ma secondo me altrettanto importante: L'INTELLIGENZA ARTIFICIALE HA COMINCIATO A RIMPICCIOLIRSI.
Ed in questo caso rimpicciolirsi non significa soltanto prendere un LLM da datacenter e comprimerlo abbastanza da farlo stare sul telefono. Significa spingersi molto più in basso, dentro microcontrollori da pochi euro, memorie misurate in megabyte o perfino in kilobyte, chip alimentati da una batteria per mesi, sensori che non possiedono nemmeno un sistema operativo ed apparecchi che fino a ieri avremmo definito troppo semplici per poter usare la parola intelligenza. MLCommons nel 2026 descrive TinyML come il campo dei modelli abbastanza piccoli, tipicamente sotto i due milioni di pesi, da poter girare su microcontrollori e piattaforme fortemente vincolate nei consumi, ed i benchmark ormai misurano non soltanto quanto tempo impiega una inferenza ma QUANTI MICROJOULE COSTA.
Questa secondo me è una rivoluzione più profonda di quanto sembri, perché un modello enorme può rendere più intelligente un computer, mentre un modello minuscolo può rendere intelligente QUALSIASI COSA.
Prima precisazione: una AI da 10 MB non è un piccolo ChatGPT
Qui bisogna togliere subito di mezzo un equivoco. Se metto una rete neurale da 500 KB dentro un microcontrollore non ho costruito un ChatGPT molto piccolo che sa un po' meno cose, perché quasi sempre sto parlando di un tipo di modello completamente diverso, specializzato per riconoscere un suono, classificare una vibrazione, capire una parola, distinguere una persona da uno sfondo, riconoscere un gesto oppure accorgersi che una macchina sta lavorando in maniera anomala.
Ed è proprio questa specializzazione a renderlo così potente dal punto di vista industriale. Una lavatrice non ha bisogno di conoscere Shakespeare, un interruttore automatico non deve risolvere un integrale ed un sensore montato su un cuscinetto non deve scrivere Python, devono invece eseguire UNA DECISIONE MOLTO PRECISA con pochissima energia, in pochissimo tempo e possibilmente senza chiedere ad un server dall'altra parte del mondo cosa stia succedendo.
Il TinyML nasce esattamente da qui. Prendo il segnale di un microfono, di un accelerometro, di una telecamera o di un sensore analogico, estraggo o preparo le caratteristiche utili, faccio girare una rete quantizzata ed ottengo una classificazione oppure una stima direttamente sul posto. Il controller può quindi capire che qualcuno ha pronunciato una wake word, che il motore vibra in modo diverso dal normale, che davanti alla telecamera è comparsa una persona oppure che il pattern elettrico di un carico sta diventando sospetto ed eseguire immediatamente l'azione prevista.
Quanto può diventare piccola davvero
Per capire la scala basta guardare gli strumenti attuali. LiteRT for Microcontrollers di Google è progettato per microcontrollori con pochi kilobyte di memoria ed il runtime base può occupare circa 16 KB su un Arm Cortex-M3, non richiede un sistema operativo, non usa allocazione dinamica ed è pensato proprio per infilare inferenza neurale dove normalmente penseremmo soltanto a timer, GPIO ed interrupt.
Edge Impulse con FOMO, una architettura di object detection progettata per MCU, mostra un caso ancora più divertente: un progetto di riconoscimento di oggetti può stare in circa 77 KB di flash ed usare intorno a 244 KB di RAM su una configurazione quantizzata, mentre la variante più piccola della famiglia è stata progettata per lavorare sotto i 100 KB di RAM. Stiamo parlando di VISIONE ARTIFICIALE, non del lampeggio di un LED.
Poi c'è un gradino leggermente più grande ma ugualmente impressionante. Arduino Nicla Voice misura appena 22,86 millimetri per lato, ha 512 KB di flash e 64 KB di SRAM sul microcontrollore, 16 MB di SPI Flash per lo storage ed un Syntiant NDP120 dedicato alle reti neurali. Il processore neurale può gestire reti CNN, RNN, LSTM, GRU e fully connected ed arriva a milioni di parametri quando i pesi vengono spinti a 4 bit oppure 1 bit. Una scheda del genere può rimanere sempre in ascolto, riconoscere wake word, comandi vocali, persone dalla voce, rumori particolari, vibrazioni ed eventi acustici senza mandare continuamente l'audio nel cloud.
Quindi quando parlo di AI da poche decine di megabyte sto già parlando di una categoria relativamente comoda. Sotto esiste ormai un mondo intero di AI da pochi megabyte, centinaia di kilobyte ed in casi specifici perfino decine di kilobyte.
Il trucco numero uno è togliere precisione dove non serve
Se un modello conserva ogni peso in FP32 usa quattro byte per parametro, quindi un milione di pesi richiede già circa quattro megabyte solo per i pesi, senza contare attivazioni, buffer, runtime ed altro. Passando ad INT8 scendo teoricamente ad un byte per peso, quindi a circa un quarto, ed arrivando a 4 bit dimezzo ancora. Se posso usare rappresentazioni ad 1 bit il peso puro diventa teoricamente otto volte più piccolo rispetto ad INT8 e trentadue volte più piccolo rispetto a FP32, anche se nella pratica bisogna aggiungere scale, metadati, allineamenti e tutta la memoria temporanea necessaria durante l'inferenza.
La parola chiave è QUANTIZZAZIONE. Non sto necessariamente rendendo la rete meno intelligente nello stesso modo in cui toglierei pagine ad un libro, sto rappresentando i suoi numeri con meno precisione cercando di mantenere la decisione finale sufficientemente accurata. In molti compiti di classificazione il passaggio da float ad INT8 può costare pochissimo in termini di accuratezza ma cambiare completamente il tipo di processore sul quale il modello può girare.
Poi arrivano pruning, distillation, architetture costruite apposta per il target, operator fusion, compressione dei pesi e compilatori che conoscono l'hardware reale. Un modello piccolo non nasce quindi soltanto perché qualcuno prende una rete grossa e la schiaccia, molto spesso viene progettato fin dall'inizio sapendo che dovrà vivere con poca SRAM, flash limitata, bus stretti ed una batteria minuscola.
Nel 2026 perfino il microcontrollore da meno di un dollaro ha una NPU
La notizia che secondo me rende definitivamente evidente il cambio di epoca è arrivata da Texas Instruments nel marzo 2026. TI ha presentato MSPM0G5187, un microcontrollore Arm Cortex-M0+ che integra TinyEngine NPU e che, in quantità da mille pezzi, viene indicato sotto il dollaro. Non un processore da smartphone, non un modulo Linux, UN MICROCONTROLLER GENERAL PURPOSE DA MENO DI UN DOLLARO con accelerazione neurale.
Secondo i dati TI la TinyEngine NPU può ridurre fino a 90 volte la latenza dell'inferenza ed oltre 120 volte l'energia necessaria rispetto ad MCU simili privi dell'acceleratore. È un confronto del produttore e va letto come tale, ma il dato industriale secondo me è ancora più importante del moltiplicatore: la NPU sta facendo lo stesso viaggio che fecero anni fa FPU, DSP, acceleratori crittografici ed USB, cioè sta smettendo di essere un componente esotico e sta diventando UNA PERIFERICA DEL MICROCONTROLLER.
TI la sta portando anche nei nuovi AM13Ex per il controllo real-time dei motori, dove lo stesso chip può mantenere loop di controllo deterministici ed usare in parallelo l'acceleratore AI per riconoscere carico, ottimizzare energia oppure anticipare condizioni anomale. E qui la differenza rispetto alla AI del datacenter diventa quasi filosofica: non chiedo più alla rete neurale di descrivermi il mondo, la metto DENTRO IL LOOP CHE CONTROLLA FISICAMENTE IL MONDO.
Il motore che impara ad ascoltare se stesso
Se avete mai fatto manutenzione su una macchina saprete certamente che un cuscinetto spesso comincia a raccontare di essere malato molto prima di rompersi, cambia leggermente rumore, spettro delle vibrazioni, assorbimento oppure temperatura. Fino a pochi anni fa una diagnostica sofisticata significava acquisire i segnali, inviarli ad un computer o ad un server e fare lì l'analisi, mentre oggi posso montare un sensore con una piccola rete neurale direttamente sul motore e fargli imparare ciò che per quella macchina è normale.
Arduino propone proprio Nicla Voice anche per ascoltare cuscinetti, riconoscere vibrazioni anomale su bracci robotici oppure lavorare in siti remoti come turbine eoliche. MLPerf Tiny usa fra i suoi benchmark ufficiali una anomaly detection basata sui suoni di macchinari industriali, segno che non siamo più davanti ad un giocattolo dimostrativo ma ad un'intera categoria di applicazioni abbastanza matura da avere benchmark standardizzati.
E la cosa interessante è il costo del dato. Se il sensore decide localmente che tutto è normale non deve trasmettere continuamente ore di audio e vibrazioni, può dormire, svegliarsi, inferire e mandare un pacchetto soltanto quando trova qualche cosa di sospetto. Risparmio banda, cloud, energia ed infrastruttura e guadagno una latenza praticamente locale. In certi impianti è il passaggio che rende economicamente possibile mettere intelligenza non su dieci macchine critiche ma SU DIECIMILA PUNTI DELLA FABBRICA.
Domotica: la casa intelligente smette di dover spedire tutto fuori casa
La stessa cosa sta succedendo nella domotica, ed è forse il settore nel quale il vantaggio è più facile da capire. Un dispositivo che deve riconoscere la frase "accendi la luce" non ha bisogno di caricare continuamente il microfono verso Internet, può mantenere un modello always-on locale che riconosce la wake word e pochi comandi, poi eventualmente svegliare un sistema più potente soltanto quando serve.
Questo cambia consumi e privacy. Il microfono può restare acceso ventiquattro ore al giorno usando potenze nell'ordine dei milliwatt oppure inferiori sul processore neurale dedicato, ma il flusso audio non deve lasciare la stanza. Lo stesso modello vale per vetri infranti, allarmi acustici, presenza, gesture, serrature intelligenti ed elettrodomestici che capiscono comandi senza dover dipendere dalla connessione.
Syntiant NDP120 è emblematico perché può eseguire contemporaneamente più reti neurali, supportare wake word, speaker identification, acoustic event classification, noise suppression e sensor fusion, ed è disponibile anche in una variante qualificata AEC-Q100 per l'automotive. Nei benchmark MLPerf Tiny 2026 lo streaming wake word è ormai misurato includendo perfino il consumo mentre il dispositivo è semplicemente in ascolto, perché in questi sistemi il grosso del lavoro reale non è riconoscere la parola, è RIMANERE VIVO ABBASTANZA A LUNGO DA SENTIRLA.
L'AI che vive dentro il sensore fotografico
Uno dei panorami che trovo più sorprendenti è quello inaugurato da Sony con IMX500. Siamo abituati a pensare che la telecamera produca un'immagine, la mandi ad un processore e soltanto dopo entri in scena l'AI. IMX500 invece mette DSP, SRAM ed elaborazione neurale direttamente nel sensore CMOS, quindi il componente che cattura i fotoni può anche interpretare ciò che ha appena visto.
La memoria disponibile per firmware, pesi della rete e working memory è circa 8,39 MB. OTTO MEGABYTE e dentro quel budget il sensore può effettuare object detection e classification, produrre regioni di interesse oppure addirittura inviare soltanto metadata. Questa è una delle trasformazioni più profonde dell'edge AI perché posso installare una telecamera che vede una persona ma non ha alcuna necessità tecnica di trasmettere l'immagine della persona, può comunicare semplicemente "una persona è entrata", "ci sono sette persone in coda" oppure "quel parcheggio è occupato".
Sony ha già mostrato applicazioni reali in negozi per misurare attenzione alla cartellonistica senza mandare al backend immagini identificabili, ed il suo ecosistema AITRIOS propone scenari di smart factory, smart retail, smart city e facility management. La AI in questo caso non è più una scatola collegata alla telecamera. LA TELECAMERA È GIÀ LA AI.
E quando la telecamera smette di spedire immagini cambia anche Internet
Questo dettaglio potrebbe sembrare secondario ma secondo me è enorme. Se una telecamera tradizionale produce video 24 ore al giorno ed io voglio analizzarlo nel cloud devo pagare sensore, compressione, rete, storage, server ed inferenza. Se invece il sensore produce localmente il risultato semantico, posso trasformare megabit continui di video in pochi byte di metadata.
Pensiamo ad un magazzino con mille telecamere che devono soltanto verificare la presenza dei DPI, contare pallet oppure segnalare una corsia occupata. La differenza fra inviare mille stream e mandare soltanto eventi strutturati non è una piccola ottimizzazione, cambia la rete necessaria, il costo cloud, la superficie di attacco e perfino il problema della privacy.
E questa è una regola generale delle AI miniaturizzate: NON PORTO PIÙ IL DATO ALL'INTELLIGENZA, PORTO L'INTELLIGENZA AL DATO. Più mi avvicino al sensore e meno informazioni grezze devo spostare.
Automotive: il posto perfetto per intelligenze piccole e specializzate
L'automobile moderna è praticamente una rete di computer con le ruote ed è uno dei luoghi nei quali l'AI piccola ha più senso. Non posso permettermi di chiedere al cloud se il conducente si sta addormentando, se un occupante è presente sul sedile oppure se una batteria sta mostrando un comportamento anomalo, perché connessione e latenza non possono far parte del requisito di sicurezza.
NXP integra la propria eIQ Neutron NPU da microcontrollori MCX fino agli application processor i.MX ed indica fra le applicazioni driver monitoring, occupant monitoring, infotainment, factory automation, healthcare e building automation, mentre il proprio ecosistema automotive porta l'AI anche verso ADAS, Battery Management System e traction inverter. Infineon segue la stessa direzione con AURIX TC4x per applicazioni automotive real-time e safety-critical e con PSoC Edge per consumer ed IoT.
Il punto non è mettere un enorme modello linguistico dentro ogni centralina, sarebbe assurdo. Il punto è distribuire DECINE DI PICCOLE INTELLIGENZE dove servono, ognuna molto vicina al proprio sensore ed al proprio attuatore. Una riconosce il volto o l'attenzione del guidatore, un'altra classifica vibrazioni, un'altra stima lo stato della batteria, un'altra controlla la voce ed un'altra ancora individua pattern anomali sulla rete elettrica del veicolo.
Il microcontrollore non deve più scegliere fra controllo deterministico ed AI
Questa è una differenza importante per chi progetta elettronica. Storicamente, quando mettevo un algoritmo pesante dentro una MCU rischiavo di rubare tempo alla parte deterministica, e nel controllo real-time questa cosa non mi piace per niente. Una NPU integrata cambia il problema perché il core principale continua ad occuparsi di interrupt, PID, protocolli e sicurezza mentre l'acceleratore neurale lavora in parallelo sulle matrici.
TI con AM13Ex lo sta facendo esplicitamente per il multimotor control, NXP costruisce eIQ Neutron come IP scalabile fra MCU e processori più grandi, Arm ha spinto Ethos-U proprio per permettere inferenza AI accanto ai Cortex-M ed ST sta inserendo acceleratori e HSP nelle famiglie STM32. La AI smette quindi di essere un'applicazione che consuma tutto il microcontrollore e diventa un blocco hardware che può essere chiamato come oggi chiamiamo un acceleratore AES oppure una periferica DMA.
È un cambiamento apparentemente piccolo ma commercialmente mostruoso, perché significa che un produttore di una pompa, di un termostato oppure di un attuatore non deve più aggiungere necessariamente un secondo processore costoso per ottenere una funzione intelligente.
Il benchmark che misura perfino i microjoule
Nel mondo dei grandi modelli ci impressioniamo con TFLOPS, token al secondo e terabyte di HBM, nel TinyML invece la domanda diventa QUANTO MI COSTA UNA SINGOLA DECISIONE IN ENERGIA. MLPerf Tiny v1.4 del luglio 2026 misura accuratezza, latenza ed energia per inferenza su compiti comuni come keyword spotting, visual wake words, image classification, anomaly detection e streaming wake word.
Uno dei risultati citati da MLCommons è ASYGN ColibriNPU, che nel Visual Wake Words arriva a 22,2 microjoule per inferenza; MLCommons osserva che, facendo una inferenza al secondo, l'ordine di grandezza energetico consentirebbe teoricamente ad una CR2032 di durare oltre tre anni. È chiaramente una estrapolazione del benchmark e non la durata garantita di un prodotto completo con radio, sensori e tutto il resto, ma rende benissimo l'idea della scala alla quale stiamo lavorando.
Nello stesso round ST mostra che l'accelerazione hardware sull'STM32U3 può ridurre sensibilmente tempo ed energia rispetto allo stesso core usato da solo, mentre la preview STM32H7P con Neural-ART NPU arriva su uno dei workload fino ad una riduzione del tempo di inferenza del 96% rispetto alla baseline Cortex-M7. Qualcomm porta i workload Tiny nel Sensing Hub dello Snapdragon 8 Elite Gen 5 con latenze sotto i tre decimi di millisecondo nei test citati da MLCommons, cioè un pezzo del SoC che può continuare a percepire il mondo senza svegliare necessariamente l'intero processore applicativo.
E qui compare la parola che cambia tutto: always-on
La AI grande la chiamiamo quando ci serve. Le AI minuscole invece possono diventare INTERFACCE SEMPRE ACCESE fra il mondo fisico ed il resto dell'elettronica. Un sensore di movimento può capire il gesto, un microfono può riconoscere la parola, un accelerometro può diagnosticare la macchina, un wearable può classificare attività oppure segnali fisiologici, ed il dispositivo principale rimane addormentato finché quella piccola rete non decide che c'è qualche cosa che merita attenzione.
Questo significa che un modello da 100 KB può in certi prodotti avere più impatto economico di un LLM da cento miliardi di parametri. Se mi permette di ridurre la batteria, eliminare un processore, evitare una connessione cloud oppure togliere un abbonamento server da milioni di dispositivi, ha creato un vantaggio industriale enorme pur non sapendo scrivere nemmeno una frase.
Ed è per questo che io starei molto attento a confondere la CAPACITÀ GENERALE con il VALORE dell'AI. Un modello minuscolo e stupido nel senso più affettuoso del termine può essere esattamente intelligente quanto serve nel punto in cui viene installato.
Atomiq e la prossima generazione: centinaia di GOPS a tensioni ridicole
Nel 2026 anche Ambiq ha mostrato quanto lontano stia andando questo settore con Atomiq, una piattaforma edge AI che integra Arm Ethos-U85 e supera i 200 GOPS dichiarati, mantenendo la filosofia ultra-low-power SPOT dell'azienda. La parte che trovo quasi più interessante della potenza è che Ambiq sta progettando modalità di funzionamento vicine ai 300 millivolt, cercando di far vivere workload neurali seri in budget energetici che fino a poco tempo fa avremmo associato a semplici sensori.
Atomiq punta ad audio avanzato, NLP, computer vision ed on-device reasoning, con applicazioni che l'azienda immagina dagli smart ring alle telecamere fino agli occhiali AR conversazionali. Il primo Atomiq110 è indicato nella roadmap 2027, quindi non sto parlando di un prodotto che possiamo comprare oggi e saldare domani mattina, ma il fatto che il silicio sia già stato validato mostra molto bene la direzione: IL PROCESSORE EDGE DEL FUTURO È PROGETTATO INTORNO ALL'AI, non la aggiunge alla fine come una libreria.
Ma le piccole AI stanno diventando anche generative
Fin qui potremmo dire che è tutta AI classica, classificatori, anomaly detector, wake word, computer vision. Ma nel 2026 il confine ha iniziato a muoversi anche sul lato generativo, ed è qui che la parola bonsai diventa letterale.
PrismML, società nata da ricerca sviluppata a Caltech, ha costruito la famiglia Bonsai usando pesi estremamente low-bit. Il suo 1-bit Bonsai 8B ha 8,2 miliardi di parametri ma secondo i dati pubblicati dall'azienda occupa soltanto 1,15 GB, contro circa sedici gigabyte delle versioni FP16 di modelli della stessa classe. Non è piccolo nel senso TinyML, non entrerà mai in un Cortex-M0 da 64 KB di RAM, però è minuscolo RISPETTO ALLA CAPACITÀ che cerca di conservare.
Ed a luglio PrismML ha spinto il concetto ancora più in là con Bonsai 27B, un modello multimodale da 27,8 miliardi di parametri che nella variante 1-bit occupa circa 3,9 GB e che la società ha mostrato in esecuzione su iPhone 17 Pro, dichiarando capacità di reasoning, coding, tool use, visione ed agentic workflow. Il confronto non è con TinyML ma con un modello FP16 della stessa classe che richiederebbe circa 54 GB soltanto per i pesi. È un ordine di grandezza completamente diverso e dimostra che la miniaturizzazione non sta succedendo soltanto in basso, STA STRINGENDO L'INTERA PIRAMIDE.
L'ultima Bonsai è già cambiata ancora
Il 17 settembre 2026 PrismML ha presentato Bonsai 2 27B, basato su Qwen3.8 27B, questa volta in rappresentazione ternaria con pesi {-1, 0, +1} ed una precisione effettiva dichiarata di 1,76 bit per peso. Il modello occupa 5,9 GB, supporta testo ed immagini, una finestra di contesto da 262K token e, secondo i benchmark pubblicati dalla società, conserva il 98,2% della prestazione aggregata del modello full precision di riferimento.
È importante scriverlo bene: sono risultati e metriche del produttore e non trasformerei il 98,2% in una legge universale secondo la quale qualsiasi modello può essere ridotto a meno di due bit senza conseguenze. Ma il fatto stesso che un modello da 27B possa lavorare in pochi gigabyte mantenendo capacità serie di coding, vision e tool use mostra una direzione difficilissima da ignorare.
Ancora più curioso è quello che PrismML ha mostrato il 23 settembre sugli smart glasses Snapdragon AR1 Gen 1, cioè un modello vision-language da 2 miliardi di parametri derivato dalla linea Bonsai che gira localmente sugli occhiali e permette, nello stesso envelope di memoria, di usare un modello con circa quattro volte i parametri rispetto ad alcune configurazioni precedenti. L'idea è che gli occhiali possano capire ciò che il portatore sta guardando, ragionare sul contesto e rispondere senza dover necessariamente spedire ogni immagine al cloud.
Ecco uno dei panorami inaspettati: NON SOLO IL TERMOSTATO CHE RICONOSCE UNA PAROLA, MA GLI OCCHIALI CHE VEDONO E RAGIONANO LOCALMENTE.
Un bit sembra impossibile finché non ricordiamo cosa pesa davvero
Per capire Bonsai bisogna separare ancora una volta numero di parametri e memoria. Un modello da 8 miliardi di parametri in FP16 richiede circa sedici gigabyte soltanto per i pesi perché ogni parametro occupa due byte, mentre se riuscissi davvero a rappresentare lo stesso peso con un singolo bit la parte teorica scenderebbe vicino ad un gigabyte. La matematica non ha nulla di magico.
La difficoltà è mantenere capacità e qualità dopo avere distrutto quasi tutta la precisione numerica. PrismML usa un'architettura e procedure di addestramento pensate per lavorare end-to-end con pesi binari oppure ternari, invece di prendere semplicemente un modello normale alla fine e schiacciarlo brutalmente. Nella versione ternaria ogni gruppo condivide fattori di scala FP16, quindi la memoria effettiva non è esattamente 1,58 bit nudi per parametro ma rimane enormemente inferiore al FP16 tradizionale.
La cosa ancora più interessante è che questo apre anche una domanda hardware. Se i pesi sono +1 e -1, molte moltiplicazioni possono diventare operazioni molto più semplici, ma l'hardware di oggi è progettato soprattutto per FP16, BF16, INT8, FP8 ed ormai INT4. PrismML stessa osserva che una parte dei vantaggi attuali deriva semplicemente dal minor movimento di memoria e che hardware realmente costruito per 1-bit potrebbe spostare ancora parecchio il rapporto fra energia e capacità.
Dal kilobyte al miliardo di parametri non esiste più un solo bordo
Ed a questo punto secondo me diventa utile smettere di dividere il mondo in cloud ed edge come se fossero due scatole. Esiste ormai una scala continua. In fondo ho il sensore oppure il microcontrollore con una rete da qualche decina o centinaio di kilobyte, poco sopra trovo MCU con pochi megabyte e NPU integrate, poi SoC capaci di computer vision e NLP, smartphone ed occhiali con modelli da centinaia di milioni oppure miliardi di parametri ed infine workstation e datacenter.
La decisione industriale diventa quindi DOVE DEVE VIVERE QUELLA INFERENZA. Se il task è riconoscere un cuscinetto guasto, portarlo in cloud è quasi sempre uno spreco. Se devo riassumere cinquanta PDF potrei usare un modello locale sul notebook. Se devo fare reasoning molto complesso posso salire verso un modello più grande in cloud. Ed il sistema può diventare ibrido, usando il piccolo modello come filtro, guardiano oppure primo livello e chiamando quello grande soltanto quando il problema lo richiede.
Questa è una delle conseguenze che secondo me cambierà maggiormente i costi dell'AI, perché non ogni inferenza dovrà più essere pagata con GPU remote, banda e datacenter. Una parte enorme potrà essere assorbita dai miliardi di processori che già esistono nei dispositivi.
Anche gli agenti stanno scendendo verso l'edge
NXP nel gennaio 2026 ha presentato eIQ Agentic AI Framework con un obiettivo esplicito: portare decisioni agentiche autonome direttamente sui dispositivi edge. Non significa infilare un enorme Claude in un microcontrollore, significa costruire una architettura nella quale modelli locali, sensori, regole, strumenti ed eventualmente modelli generativi possano coordinarsi sul dispositivo senza che ogni singola decisione dipenda dal cloud.
Questo apre scenari parecchio interessanti. Un sistema industriale può osservare vibrazioni, temperatura e corrente, riconoscere una anomalia, raccogliere soltanto i dati utili e decidere quale azione locale intraprendere oppure quando chiedere aiuto ad un modello remoto. Una automobile può combinare sensori di abitacolo, voce ed informazioni del veicolo per costruire un assistente contestuale che continua a funzionare anche senza rete. Una casa può mantenere localmente conoscenza degli eventi e delle abitudini senza inviare al cloud ogni rumore ed ogni movimento.
A quel punto il termine Edge AI non indica più soltanto una rete che classifica input. Può diventare un piccolo SISTEMA DECISIONALE DISTRIBUITO.
Il wearable è forse il mercato più naturale di tutti
Un orologio, un auricolare, un apparecchio acustico, una fascia ECG oppure uno smart ring hanno tre problemi contemporaneamente: batteria piccolissima, dati estremamente personali e necessità di reagire immediatamente. Sono praticamente il caso d'uso perfetto per l'AI miniaturizzata.
MLPerf Tiny cita esplicitamente patch wearable che analizzano ECG senza caricare continuamente il segnale grezzo, hearing aid che sopprimono rumore localmente ed earbuds con keyword spotting always-on. Ambiq progetta i propri SoC proprio per wearable ed hearable, Qualcomm spinge l'intelligenza nel sensing hub e Syntiant ha costruito NDP120 attorno ad audio e sensori a bassissimo consumo.
Qui la privacy non è un accessorio. Se posso classificare localmente il battito, il sonno, la voce oppure il movimento ed inviare soltanto un risultato, ho ridotto enormemente la quantità di informazione personale che deve attraversare la rete. E nello stesso momento posso offrire la funzione anche quando il telefono non c'è oppure la connessione manca.
L'agricoltura sembra banale finché non moltiplichiamo per un milione
Un sensore agricolo che riconosce localmente un pattern di umidità, vibrazione, suono oppure immagine può sembrare meno affascinante di un modello che scrive codice, ma se quel sensore deve vivere per mesi con una batteria oppure con energy harvesting la differenza fra inviare continuamente dati ed inviare soltanto eventi diventa decisiva.
MLCommons usa proprio sensori agricoli a lunga autonomia fra gli esempi di TinyML, perché il punto non è solo la capacità di classificazione ma eliminare il costo energetico della radio, spesso molto superiore a quello di una piccola inferenza locale. In certi dispositivi COMUNICARE COSTA PIÙ CHE PENSARE.
Questa frase da sola secondo me spiega metà del mercato TinyML. Se posso spendere pochi microjoule per capire che il dato non è interessante, ho evitato di accendere una radio, aprire una connessione, autenticarmi, trasmettere pacchetti e farli processare da un server. L'AI non sta soltanto aggiungendo una funzione, sta diventando un COMPRESSORE SEMANTICO DEL MONDO REALE.
Sicurezza e privacy cambiano, ma non diventano automaticamente migliori
Portare l'AI sul dispositivo elimina parecchi problemi ma ne crea altri. Se il dato non lascia il sensore riduco l'esposizione della privacy ed il traffico di rete, però il modello è adesso distribuito su migliaia oppure milioni di oggetti fisici che qualcuno può rubare, aprire, analizzare o manipolare. Devo proteggere pesi, firmware, aggiornamenti, boot, chiavi e pipeline di deployment.
Inoltre una AI piccola non è immune da input avversari, drift, dati fuori distribuzione oppure classificazioni sbagliate. Anzi, quando la metto dentro un dispositivo che comanda un motore oppure prende una decisione di sicurezza devo ricordarmi la lezione più vecchia dell'ingegneria embedded: L'AI NON DEVE ESSERE L'ULTIMO DISPOSITIVO DI SICUREZZA. Una rete può suggerire che il cuscinetto sta cedendo, ma un limite di temperatura hardware ed un controllo di corrente continuano ad avere tutto il diritto di esistere.
Il vantaggio del TinyML è precisamente che possiamo integrarlo nella macchina senza trasformarlo nella macchina intera.
Il mercato cambia perché cambia il conto economico
Quando una funzione AI richiede un Raspberry Pi, una connessione permanente e qualche euro al mese di cloud posso metterla soltanto dentro prodotti che abbiano abbastanza margine per pagarla. Quando la stessa funzione gira su un microcontrollore da uno o due dollari senza abbonamento, il mercato potenziale cambia di tre ordini di grandezza.
Un produttore di interruttori, serrature, ventilatori, pompe, giocattoli, termostati, sensori industriali, elettrodomestici e dispositivi medici può cominciare a trattare una piccola inferenza come oggi tratta un ADC oppure un protocollo seriale, cioè come una capacità incorporabile nel costo del prodotto.
Ed è questo che secondo me renderà le AI miniaturizzate più pervasive delle grandi AI. Un utente userà forse un grande modello per qualche ora al giorno, ma potrà essere circondato da CENTINAIA DI PICCOLE AI che ascoltano, vedono, misurano e decidono continuamente senza che lui nemmeno sappia che esistono.
Non servirà sempre più memoria, a volte servirà semplicemente una AI più densa
Per anni l'evoluzione dell'AI è stata raccontata quasi soltanto come crescita, più parametri, più GPU, più RAM, più energia. La linea TinyML e la linea Bonsai mostrano l'altra metà della storia: migliorare la DENSITÀ DI INTELLIGENZA, cioè quanta capacità utile riesco a ottenere per byte, joule e millimetro quadrato.
A livello MCU lo facciamo con modelli più piccoli, INT8, operatori specializzati, NPU e compilatori capaci di spremere SRAM e flash. A livello LLM lo facciamo sempre più con quantizzazione estrema, pesi ternari o binari e hardware pensato per precisioni ridotte. In entrambi i casi il vero nemico è spesso il movimento dei dati, perché leggere pesi dalla memoria costa energia e tempo, quindi un modello più compatto può diventare più veloce anche quando il numero di parametri non cambia.
È la stessa lezione che stiamo vedendo nei grandi datacenter con HBM, CXL e chip dedicati, soltanto capovolta di scala: LA MEMORIA È COMPUTE.
Quello che mi aspetto adesso
Secondo me la prossima fase non sarà una gara fra AI grande ed AI piccola, ma una collaborazione gerarchica. Il sensore farà la prima inferenza, il microcontrollore deciderà se l'evento è interessante, un modello locale più capace sul gateway oppure sul telefono ragionerà sul contesto ed il cloud verrà chiamato soltanto quando serve davvero molta conoscenza oppure molto calcolo.
Un paio di occhiali potrebbe quindi riconoscere localmente persone ed oggetti con un modello molto compatto, mantenere un VLM locale da qualche miliardo di parametri per ragionare sulla scena e chiedere ad un modello remoto più grande soltanto una domanda particolarmente complessa. Una macchina industriale potrebbe diagnosticare da sola il proprio stato normale, coinvolgere un agente locale quando compare una anomalia ed inviare al datacenter soltanto il caso che richiede una analisi profonda.
Questo modello ibrido ha un vantaggio economico enorme perché il cloud smette di essere il percorso obbligatorio di ogni singolo segnale. Diventa IL LIVELLO PIÙ ALTO DELLA GERARCHIA, non l'unico cervello.
La cosa più sorprendente è che probabilmente non ce ne accorgeremo
Quando una tecnologia diventa davvero pervasiva tende a sparire. Nessuno oggi si stupisce che dentro una lavatrice ci siano microcontrollori, ADC, PWM, bus seriali e software, semplicemente pretende che funzioni. Credo che alle piccole AI succederà la stessa cosa.
Non diremo più che una serratura "ha l'AI" perché riconosce un pattern, che una pompa "usa machine learning" perché prevede una anomalia oppure che le cuffie "hanno una rete neurale" perché eliminano il rumore. Saranno funzioni normali dell'elettronica, come oggi lo è la regolazione digitale.
Ed è forse questa la vera rivoluzione delle AI bonsai. Non quella di costruire una versione minuscola di ChatGPT, ma di portare una quantità sufficiente di intelligenza esattamente DOVE SERVE, dentro un sensore da otto megabyte, una scheda da sedici megabyte, un microcontrollore da meno di un dollaro oppure, salendo di scala, dentro un paio di occhiali che può vedere e ragionare senza mandare ogni cosa su Internet.
I grandi modelli continueranno a crescere ed i datacenter continueranno a diventare più enormi, ma contemporaneamente l'AI sta facendo il viaggio opposto, entra nei cuscinetti, nelle serrature, nei motori, nei sensori fotografici, negli auricolari, nelle automobili e nei wearable, consumando sempre meno memoria ed energia. Ed a quel punto forse capiremo che il futuro dell'Intelligenza Artificiale non è soltanto costruire un cervello gigantesco da qualche parte nel cloud, ma DISTRIBUIRE MILIARDI DI PICCOLISSIMI CERVELLI DAPPERTUTTO!
Commenti
Nessun commento, per ora.
Per commentare serve un accesso. Qui siamo tutti tecnici e colleghi!
Accedi per commentare