LM Studio è un'applicazione desktop gratuita che permette di scaricare, gestire ed eseguire modelli linguistici open-weight direttamente sul proprio computer, tramite un'interfaccia grafica pensata per chi non vuole (o non può, per ragioni di privacy o costi) dipendere da un'API cloud. È disponibile per Windows, macOS e Linux, e non richiede alcuna competenza di programmazione per essere usato nella sua forma base.
Cosa permette di fare
- Sfogliare e scaricare modelli — un catalogo integrato di modelli open-weight (Llama, Mistral, Qwen, e molti altri), con indicazione dei requisiti hardware stimati prima del download
- Chat locale — un'interfaccia di conversazione simile a quella di un servizio cloud, ma con il modello in esecuzione interamente sul proprio hardware
- Server API locale — espone un endpoint compatibile con il formato API di OpenAI sulla propria rete locale, permettendo di collegare LM Studio a qualunque applicazione o script già pensato per parlare con quel formato di API, semplicemente puntandolo all'indirizzo locale invece che al servizio cloud
- Controllo dei parametri — regolazione di temperatura, lunghezza del contesto, e altri parametri di generazione tramite interfaccia grafica, senza editare file di configurazione a mano
Perché eseguire un modello in locale, invece di usare un'API cloud
| Motivazione | Perché conta |
|---|---|
| Privacy dei dati | Niente lascia mai il proprio computer: rilevante per documenti aziendali sensibili o dati personali di clienti |
| Nessun costo per token | Dopo il download del modello, ogni utilizzo è gratuito, indipendentemente dal volume |
| Funziona offline | Nessuna dipendenza da connessione internet una volta scaricato il modello |
| Sperimentazione libera | Provare modelli diversi senza vincoli contrattuali o limiti di utilizzo imposti da un fornitore |
Il compromesso è altrettanto reale: i modelli eseguibili in locale su hardware consumer sono generalmente meno capaci dei modelli di punta disponibili solo via cloud (che girano su infrastrutture con potenza di calcolo di ordini di grandezza superiore), e le prestazioni dipendono direttamente dall'hardware disponibile — in particolare RAM e, se presente, memoria della scheda video.
Cosa serve per farlo girare bene
Il fattore che più influenza sia la possibilità di eseguire un modello sia la sua velocità è la quantità di memoria disponibile (RAM di sistema, o memoria video se si sfrutta l'accelerazione GPU): modelli più grandi richiedono più memoria e restituiscono generalmente risposte di qualità superiore, ma sono anche più lenti su hardware modesto. LM Studio mostra, per ogni modello nel catalogo, una stima di compatibilità con l'hardware rilevato sul proprio computer, aiutando a scegliere una taglia di modello ragionevole prima ancora di scaricarlo.
Il rapporto con Ollama e llama.cpp
LM Studio non è l'unico modo per eseguire modelli in locale: si affianca a strumenti come Ollama (più orientato alla riga di comando) e si appoggia, come gran parte dell'ecosistema di inferenza locale, su tecnologie di ottimizzazione derivate o simili a quelle di llama.cpp — di entrambi parliamo in articoli dedicati sul nostro blog. La scelta tra un'interfaccia grafica come LM Studio e uno strumento da terminale come Ollama dipende principalmente da come si preferisce lavorare: LM Studio è la scelta più immediata per chi vuole iniziare senza aprire un terminale.