Una bolletta cloud mensile da $400 per quello che è essenzialmente un chatbot personale sembrava ragionevole. Poi ti rendi conto che lo stesso carico di lavoro gira su una scheda grafica usata che possiedi già, su hardware che costa pochi centesimi di elettricità al giorno. Lo stack dei costi dell’IA locale non è più teorico. È un modello economico diverso per chi considera l’IA come infrastruttura quotidiana e non come una rara commissione, e una volta che vedi i livelli, la strada da seguire diventa sorprendentemente semplice.
Il primo livello è il pavimento hardware, ed è più basso di quanto la maggior parte delle persone pensi. Una RTX 3090 ricondizionata, vecchia di due o tre anni e fuori moda per il gaming, esegue modelli quantizzati da 70 miliardi di parametri a una velocità utilizzabile. Un Mac Studio con memoria unificata gestisce carichi simili con meno complicazioni. La spesa in conto capitale è un costo una tantum che si ammortizza rapidamente, e la curva di deprezzamento è dolce perché queste schede continuano a servire lo stesso scopo per un decennio.
Il secondo livello è il modello stesso. I modelli a pesi aperti hanno recuperato rapidamente terreno nelle attività che la maggior parte delle persone svolge davvero: stesura, riassunto, classificazione, estrazione di dati strutturati da testo disordinato. Non ti stai accontentando. Stai scegliendo un modello che si adatta al tuo budget hardware invece di affittare tempo sul silicio di qualcun altro. Le varianti quantizzate scambiano una piccola quantità di qualità con una grande riduzione della memoria, che è quasi sempre lo scambio giusto per uno stack personale.
Il terzo livello è il runtime e il software di orchestrazione. llama.cpp, Ollama, vLLM e progetti simili hanno trasformato l’erogazione dei modelli in un comando a riga singola. Una volta che un modello è in esecuzione localmente, esporlo ai tuoi strumenti è la parte facile. Le competenze personalizzate, quelle piccole automazioni che trasformano "riassumi questo PDF" in una singola pressione di tasto, si collegano a un endpoint locale nello stesso modo in cui si collegherebbero a uno ospitato. Il costo di integrazione è essenzialmente zero.
Il quarto livello è la progettazione del flusso di lavoro. L’errore che si commette è trattare l’IA locale come un sostituto del cloud e replicare ogni inefficienza. Il vantaggio arriva dal memorizzare nella cache prompt ripetuti, raggruppare attività simili ed eseguire i lavori più pesanti durante la notte, quando nessuno aspetta la GPU. Uno stack locale premia un po’ di attenzione ingegneristica in modi che il cloud non ha mai fatto.
Il quinto livello, e quello che la maggior parte delle persone salta, è la misurazione. Tieni traccia del tuo utilizzo reale. La maggior parte degli utenti personali di IA usa solo una piccola frazione della compute disponibile. Una volta che vedi i numeri reali, l’economia diventa impossibile da ignorare.
Se sei curioso, inizia in piccolo. Scarica un modello a pesi aperti, eseguilo sulla macchina che possiedi già e indirizza verso di esso un flusso di lavoro personale. Le spiegazioni della community e i benchmark sono utili, ma l’unica metrica che conta è se svolge il tuo lavoro. Il cloud sarà ancora lì se ne avrai bisogno. Per la maggior parte di ciò che uno stack personale fa davvero, non servirà.
