Il motivo più concreto per provare un'inferenza locale non è ideologico, è operativo: se stai prototipando una funzione che usa un modello linguistico, ogni chiamata a un'API in cloud ha un costo e una latenza di rete, e i dati che invii escono dal tuo computer. Con un modello locale puoi iterare quanto vuoi senza pensare al costo per token, lavorare anche offline, e tenere tutto — richieste comprese — sulla tua macchina. Per un progetto personale, uno strumento interno o una demo da mostrare a un cliente senza dipendere da una connessione stabile, è una differenza che si sente.
C'è anche un motivo didattico, spesso sottovalutato: far girare un modello in locale ti costringe a capire cosa succede davvero sotto un'API — quanta RAM o VRAM serve, come viene caricato un file GGUF, cosa cambia tra un modello da 3 miliardi di parametri e uno più grande. È lo stesso tipo di comprensione che distingue chi sa solo chiamare uno strumento da chi sa anche dire perché, in un certo caso, quello strumento non basta.