Ultimamente mi sono davvero appassionato all'esecuzione di Large Language Models (LLM) localmente e, dopo aver visto tutto Cose interessanti che puoi fare con gli strumenti MCPHo capito che era giunto il momento di aggiornare un po' le mie impostazioni.

Inizialmente, ho seguito l'ondata di entusiasmo suscitata dal lancio di DeepSeek R1, ma da allora sono emersi molti nuovi modelli. Data la rapidità con cui tutto cambia, ho pensato che fosse sensato ottimizzare anche il mio flusso di lavoro.
Link veloci
LM Studio è la migliore app LLM locale che abbia mai utilizzato (finora).
Ollama è buono, ma io preferisco questo.
Ho iniziato a sperimentare con i Local Large Language Models (LLM) l'anno scorso utilizzando OllamaFunzionava abbastanza bene, ma il mio povero MacBook Air con soli 8 GB di RAM non era certo progettato per gestire quel tipo di carico di lavoro. Volevo comunque provare qualcosa di diverso, in parte per curiosità e in parte per vedere se potevo ottenere prestazioni ancora maggiori.
Ecco perché ho deciso di provare LM Studio. È un'applicazione che consente di scaricare ed eseguire Large Language Model (LLM) localmente sul computer e ha anche un'interfaccia utente pulita. Dato che uso un Mac, il supporto MLX è stato fondamentale per me. Se non lo conoscete, MLX è il framework di apprendimento automatico di Apple progettato specificamente per Apple Silicon.
In sostanza, consente ai modelli di funzionare in modo più efficiente utilizzando l'unità di elaborazione grafica (GPU). Tuttavia, volevo tradurre queste parole in numeri, quindi ho confrontato Ollama e LMStudio testa a testa, utilizzando lo stesso modello.

Con LM Studio ottenevo un numero maggiore di simboli al secondo, ma la differenza era abbastanza piccola da non modificare in modo significativo l'esperienza complessiva. Tuttavia, accetterei volentieri qualsiasi prestazione extra possibile.
Tuttavia, non credo che faccia molta differenza scegliere Ollama o LM Studio, soprattutto perché entrambi si basano su framework di base simili per l'esecuzione locale dei modelli.
La mia principale lamentela all'inizio era la mancanza di supporto multimediale. Ma ora non è più un vero problema. Sia Ollama che LM Studio ora supportano i template multimediali e ci sono alcune potenti opzioni in grado di gestire bene testo e immagini sui dispositivi locali.
Scegliere il modello giusto può essere un po' difficile
Può essere un hobby costoso

Quando installi LM Studio per la prima volta, la prima cosa che devi fare è scegliere un modello. Questo potrebbe sembrare un po' complicato se sei alle prime armi, poiché non esiste una risposta univoca e univoca alla domanda "usa questo modello". La scelta giusta dipende in realtà dall'hardware in uso.
Se apri il menu "Ricerca modelli" in LM Studio, vedrai un elenco dei modelli più popolari. Un modo semplice per capire quanto sia richiesta una modella è guardare il numero immediatamente prima della lettera "B" nel suo nome.
La "B" sta per miliardi di parametri. In genere, più alto è questo numero, più potente è il modello. Ciò significa anche che richiederà più risorse. Su un Mac con 8 GB di VRAM, ritengo che un intervallo compreso tra 3 e 4 miliardi di parametri sia adeguato. Su un PC le cose possono diventare un po' più complicate. Invece della normale RAM del sistema, ciò che conta di più è la quantità di VRAM disponibile.
Con 8 GB di VRAM, è possibile sperimentare comodamente modelli che utilizzano parametri da 7 miliardi di bit, soprattutto in configurazioni quantistiche più leggere. Nella mia esperienza, l'approccio migliore è iniziare con un modello più piccolo e aumentare gradualmente le dimensioni fino a trovare la soluzione più adatta.
Personalmente, mi ha colpito di più il modello Gemma 3 4B, che si basa sulle stesse basi dei modelli Gemini di Google. Tuttavia, consiglierei comunque di provare anche i modelli Qwen. A seconda di cosa state facendo, potrebbero essere molto più adatti a voi.
Puoi anche aggiungere la ricerca web al tuo LLM locale
DuckDuckGo viene in soccorso

Una delle principali lamentele che ho letto sui Large Language Model (LLM) nativi è quanto siano limitati rispetto ai modelli basati su cloud come ChatGPT quando si tratta di ricerca web. Non è molto utile chiedere informazioni sull'ultimo iPhone, e per l'LLM iniziare a parlare dell'iPhone 14. Questo è un ambito in cui i modelli basati su cloud si sono dimostrati superiori.
LM Studio ha un sistema di plugin integrato e aggiungere la ricerca web è incredibilmente semplice. Basta andare su Pagina del componente aggiuntivo DuckDuckGoE specificare Esegui in LM Studio.
Una volta abilitata, quando esegui un modulo, vedrai un'opzione sotto la casella di chat che ti chiederà se desideri richiamare DuckDuckGo per la tua query. Se attivi questa opzione, LM Studio recupererà i risultati della ricerca in tempo reale e li inserirà nel modulo prima di generare una risposta.

Ma non è tutto ciò che si può fare con i plugin. Il team di LM Studio ne ha sviluppati alcuni molto utili. Ad esempio, hanno un plugin per Wikipedia che permette al vostro modello linguistico di leggere e cercare articoli da Wikipedia (ovviamente).
Esiste anche il plugin JavaScript Sandbox, che può essere molto utile se sei interessato al vibe-coding e vuoi farti un'idea di massima di cosa sviluppare. Ma non direi che valga la pena impegnarsi per creare qualcosa di pronto per la produzione.
Sbarazzatevi delle grandi aziende
Puoi configurare LM Studio in modo da poter accedere al tuo ampio modello linguistico dal tuo telefono, ma è anche possibile trasferire tutte le inferenze direttamente sul tuo telefono. Esecuzione di modelli linguistici più piccoli e più grandi su un telefono AndroidAnche se non sarà potente quanto quello che troverai su un Mac.
Il miglioramento di questi modelli leggeri continua a un ritmo rapido e impressionante. Con i costi hardware destinati ad aumentare, non mi sorprenderei se aziende come OpenAI o Google aumentassero i prezzi dei loro abbonamenti. È rassicurante avere una configurazione che non subisce alcun impatto.










