Programmare con un agente AI senza cloud: Ollama e MLX sul Mac

Gli assistenti AI per programmare mandano il tuo codice su server altrui e chiedono un abbonamento o una chiave API. Con un Mac Apple Silicon puoi far girare un modello in locale: niente cloud, niente costi a consumo, funziona anche offline. Ecco cosa serve e cosa aspettarsi.

· 4 min di lettura · Enrico Fanucchi

In breve: ti servono un Mac con chip Apple (M1 o successivo) e almeno 16 GB di memoria, Ollama per scaricare ed eseguire i modelli, e un modello adatto alla tua memoria. Una chat locale risponde e basta; per farti scrivere, eseguire e verificare il codice serve un agente come Ollocode, che lavora solo con modelli locali.

Perché in locale

  • Il codice resta tuo: niente viene inviato fuori dal Mac. Conta per i progetti dei clienti, per il codice sotto accordo di riservatezza e per chi semplicemente preferisce così.
  • Nessun costo a consumo e nessuna chiave API da gestire.
  • Funziona offline, in treno o con una connessione scarsa.

Il prezzo da pagare è la potenza: un modello che sta nella memoria di un portatile è meno capace dei modelli più grandi in cloud, ed è più lento. Per molti compiti però basta, se è usato nel modo giusto.

Quale modello per quale Mac

La regola principale è la memoria: il modello deve starci tutto, insieme al contesto della conversazione. Questi sono i modelli che Ollocode usa come agente in base al Mac, misurati su 14 progetti reali da costruire o correggere (Go, Python, Node.js, TypeScript, Rust, web), superati solo quando passano i test automatici:

MacModelloProgetti superatiNote
16 GB (es. Mac mini M4)qwen3.5:9b7 su 14compiti piccoli e medi
24 GBgpt-oss:20b5-6 su 14molto veloce, meno costante
32 GB o piùqwen3.8:27b-mlx13 su 14il più affidabile, più lento

Un dato utile: modelli specializzati nel codice ma pensati per completare, come qwen2.5-coder 7B e 14B, in questi test si sono rivelati inaffidabili come agenti, perché sbagliano l'uso degli strumenti. Per il completamento in linea nell'editor invece un modello minuscolo come qwen2.5-coder:1.5b (1 GB) va benissimo.

MLX è il framework di Apple per eseguire modelli sul chip del Mac: le versioni MLX dei modelli sfruttano meglio l'hardware Apple, ed è quella usata sui Mac con più memoria.

Installare Ollama e un modello

  1. Scarica Ollama da ollama.com, installalo e aprilo.
  2. Dal Terminale scarica il modello adatto al tuo Mac e provalo:
ollama pull qwen3.5:9b    # per un Mac con 16 GB
ollama run qwen3.5:9b     # una chat nel Terminale, per provarlo
ollama list               # i modelli scaricati e quanto pesano

A questo punto hai un modello che risponde. Ma una chat non basta per programmare: ti dà un pezzo di codice e tocca a te incollarlo, eseguirlo, leggere l'errore e tornare a chiedere.

Dalla chat all'agente

Un agente fa quel giro da solo: legge il progetto, scrive nei file, esegue test e programmi, legge gli errori e corregge finché il lavoro non funziona davvero. Con i modelli locali è ancora più importante, perché sbagliano più spesso: un agente che verifica ogni passo trova e corregge i propri errori.

Ollocode è un ambiente di sviluppo gratuito per macOS costruito intorno a questa idea, con modelli solo locali (Ollama o MLX):

Ollocode: l'agente scrive il codice, lo esegue e legge il risultato
Ollocode: l'agente scrive il codice, lo esegue e legge il risultato
  • non si accontenta: non considera finito un lavoro se i test falliscono o se l'ultima modifica non è mai stata eseguita;
  • si adatta al tuo Mac: legge chip e memoria, sceglie modello e contesto misurati per quella classe di Mac e, se manca, propone di scaricarlo;
  • modalità Piano: prima di toccare un file propone i passi, e li correggi finché ti convincono;
  • progetti remoti via SSH: lavora direttamente su un server Linux, per esempio con PHP e MySQL;
  • editor, differenze, Git e terminale integrati, con il completamento in linea da un modello locale.
Ollocode sceglie il modello in base al chip e alla memoria del Mac
Ollocode sceglie il modello in base al chip e alla memoria del Mac

Sicurezza: un agente che esegue comandi

Un agente che esegue programmi va tenuto sotto controllo. In Ollocode i comandi girano in una sandbox di macOS che permette di scrivere solo nella cartella del progetto, nelle cartelle temporanee e nelle cache degli strumenti; prima di ogni turno che modifica file crea un punto di ripristino; e i comandi di sistema, come installare un programma o usare sudo, partono solo quando premi Esegui. Anche l'accesso al web per leggere documentazione aggiornata chiede ogni volta il permesso.

Ogni comando di sistema viene mostrato per intero e parte solo con la tua conferma
Ogni comando di sistema viene mostrato per intero e parte solo con la tua conferma

Cosa aspettarsi, onestamente

Con 16 GB un agente locale gestisce bene compiti piccoli e medi: una funzione, un endpoint, un bug circoscritto, un progetto nuovo semplice. Con 32 GB o più il modello più grande completa quasi tutti i progetti di prova, ma è lento (circa 10 token al secondo su un M1 Max). Non sostituisce i modelli più grandi in cloud sui lavori più ampi; in cambio il tuo codice non lascia mai il Mac. Ollocode richiede un Mac Apple Silicon con almeno 16 GB e si scarica dalla sua pagina.

Domande frequenti

Funziona senza connessione a internet?

Sì. Una volta scaricati i modelli, sia Ollama sia Ollocode lavorano offline. La connessione serve solo per scaricare i modelli e, se lo autorizzi, per far leggere all'agente una pagina web.

Funziona su Windows o Linux?

Ollama sì, Ollocode no: Ollocode è un'app per macOS e richiede un chip Apple (M1 o successivo). I progetti remoti però possono stare su un server Linux, raggiunto via SSH.

Posso usare un modello diverso da quello consigliato?

Sì, qualsiasi modello di Ollama o MLX. Quelli consigliati sono i più affidabili tra quelli misurati per ogni quantità di memoria.