memory AI

LlamaCpp Manager: modelli AI in locale su Windows, senza complicazioni

calendar_today personTeam EGSOFT schedule6 min di lettura
info

Disclaimer: le informazioni pubblicate in questa sezione hanno finalità di pura divulgazione tecnica. EG Software S.r.l. non si assume alcuna responsabilità per un utilizzo improprio dei contenuti, né per eventuali danni diretti o indiretti derivanti dalla loro applicazione, e non garantisce l'aggiornamento, l'accuratezza o la completezza delle informazioni riportate. Prima di utilizzare in produzione codice o procedure qui descritte, verificane sempre l'adeguatezza al proprio contesto.

Un piccolo pannello di controllo nativo, scritto in Delphi, che scarica, configura e avvia llama.cpp per far girare modelli linguistici direttamente sul proprio PC: niente cloud, niente installazioni pesanti, niente riga di comando.

Perché è nato questo progetto

Far girare un modello linguistico (LLM) in locale oggi è alla portata di qualunque PC recente. Il motore più efficiente e diffuso per farlo è llama.cpp: un progetto open source in C/C++ che esegue i modelli in formato GGUF sfruttando la CPU oppure la scheda video tramite CUDA (NVIDIA) o Vulkan.

llama.cpp, però, è pensato per chi ha dimestichezza con la riga di comando. Per usarlo bisogna:

  • capire quale delle tante build pubblicate su GitHub è quella giusta per il proprio hardware;
  • scaricare e scompattare i binari (e, per CUDA, anche il runtime separato);
  • trovare su Hugging Face un modello GGUF e scegliere la quantizzazione adatta alla propria memoria;
  • comporre a mano una riga di comando con percorso del modello, contesto, thread, layer GPU, porta…

Esistono applicazioni desktop che nascondono tutta questa complessità, ma spesso sono pesanti: occupano centinaia di megabyte, si portano dietro runtime completi, installano servizi che restano in esecuzione in background o introducono formati e cartelle proprietarie.

L'idea di LlamaCpp Manager è stare nel mezzo: usare i binari ufficiali di llama.cpp, senza modificarli né nasconderli, e aggiungere solo un sottile strato grafico che automatizza le operazioni noiose. Uno strumento leggero, facile da installare e trasparente su ciò che fa.

Gli obiettivi

  • Leggero — un unico eseguibile nativo Windows di pochi megabyte (circa 4 MB a 32 bit, 6 MB a 64 bit). Nessun runtime .NET, Java, Python o Electron da installare.
  • Facile da installare — nessun setup: si copia la cartella e si avvia l'exe. Configurazione, binari e modelli restano accanto al programma, che quindi è anche portabile (può stare su un disco esterno).
  • Trasparente — usa i binari ufficiali di llama.cpp scaricati da GitHub e mostra nel log la riga di comando esatta con cui avvia il server: nulla di nascosto, tutto riproducibile a mano.
  • Guidato dall'hardware — rileva CPU, GPU NVIDIA e supporto Vulkan e consiglia automaticamente il backend più adatto.
  • Nessun servizio in background — il server parte solo quando lo chiedi e si ferma quando premi "Ferma Server" o chiudi il programma.
  • Offline e privato — dopo aver scaricato binari e modello, tutto gira in locale: i testi non lasciano il computer.

Come funziona

LlamaCpp Manager è un pannello di controllo: non contiene un proprio motore di inferenza e non incorpora una finestra di chat. Si occupa di preparare l'ambiente e di avviare llama-server.exe, il server HTTP incluso in llama.cpp, che offre già una comoda interfaccia web di chat e un'API compatibile con quella di OpenAI.

┌──────────────────────┐   avvia →   ┌──────────────────────┐   carica →   ┌ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ┐
│  LlamaCpp Manager    │             │  llama-server.exe    │              │   Modello .gguf     │
│ configura, avvia,    │   ← log     │ binario ufficiale    │              │ scaricato da        │
│ monitora             │             │ llama.cpp            │              │ Hugging Face        │
└──────────────────────┘             └──────────────────────┘              └ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ┘

Una volta avviato il server, basta un clic su Apri nel Browser per usare la chat all'indirizzo http://127.0.0.1:8080/. Lo stesso indirizzo può essere usato da qualunque programma che sappia dialogare con un'API in stile OpenAI.

Il flusso tipico, dal primo avvio alla chat

  1. Rilevamento dell'hardware. All'avvio il programma legge il numero di thread della CPU, interroga WMI per l'elenco delle schede video, usa nvidia-smi (se presente) per nome e memoria della GPU NVIDIA e verifica la presenza di vulkan-1.dll. In base al risultato consiglia il backend: CUDA se c'è una GPU NVIDIA, altrimenti Vulkan se disponibile, altrimenti CPU.
  2. Download dei binari llama.cpp. Dalla finestra Scarica Moduli il programma interroga le release GitHub di ggml-org/llama.cpp, individua lo zip Windows corrispondente al backend scelto, lo scarica e lo estrae in bin\cpu, bin\cuda o bin\vulkan. Per CUDA scarica automaticamente anche il pacchetto del runtime (cudart), senza il quale il server non partirebbe.
  3. Scelta e download del modello. La ricerca interroga direttamente Hugging Face filtrando i soli modelli GGUF, ordinati per numero di download. Il risultato è una tabella con repository, dimensione in parametri (es. 7B, 12B), download e like. Un doppio clic elenca i file .gguf del repository con quantizzazione (Q4_K_M, Q8_0…) e dimensione, così è facile scegliere il file adatto alla memoria disponibile.
  4. Configurazione dei parametri. Dimensione del contesto, thread, layer da scaricare sulla GPU, batch, temperatura, top-k, top-p, host e porta si impostano da campi numerici, senza ricordare la sintassi delle opzioni.
  5. Avvio e monitoraggio. Il server viene lanciato come processo nascosto; il suo output compare in tempo reale nel log. Il programma interroga periodicamente l'endpoint /health e abilita Apri nel Browser solo quando il modello è caricato e pronto. Se il server si arresta da solo (per esempio per memoria video insufficiente) l'interfaccia se ne accorge e lo segnala.

La riga di comando generata

Tutti i parametri vengono tradotti in una normale invocazione di llama-server, visibile nel log. Ad esempio:

"...\bin\cuda\llama-server.exe" -m "D:\models\modello-Q4_K_M.gguf"
  -c 4096 -t 20 -ngl 99 -b 512 --temp 0.8 --top-k 40 --top-p 0.95
  --host 127.0.0.1 --port 8080

Questo significa che nulla è "magico": ciò che fa il programma si può riprodurre, studiare o personalizzare a mano in qualsiasi momento.

I parametri principali

ParametroOpzioneA cosa serve
Context Size-cQuanti token di conversazione il modello "ricorda". Più è alto, più memoria serve (default 4096).
Threads-tThread CPU usati per il calcolo; di default il numero di processori logici rilevati.
GPU Layers-nglQuanti strati del modello spostare sulla GPU. 0 = solo CPU; un valore alto porta tutto in VRAM, se c'è spazio.
Batch Size-bToken elaborati insieme durante la lettura del prompt: influisce su velocità e memoria.
Temperature--tempCreatività delle risposte: valori bassi più prevedibili, valori alti più varie.
Top-K / Top-P--top-k / --top-pLimitano la scelta delle parole ai candidati più probabili, per risposte più coerenti.
Host / Porta--host / --portIndirizzo su cui il server resta in ascolto (default 127.0.0.1:8080, solo il PC locale).

Nota sulla sicurezza: con host 127.0.0.1 il server è raggiungibile solo dal computer su cui gira. Impostando 0.0.0.0 diventa accessibile da tutta la rete locale: utile per usarlo da un altro dispositivo, ma da fare solo su reti fidate.

Struttura delle cartelle

LlamaCppManager\
├── LlamaCppManager.exe     eseguibile (unico file del programma)
├── config.ini              impostazioni, creato al primo avvio
├── bin\
│   ├── cpu\                binari llama.cpp per CPU
│   ├── cuda\               binari per GPU NVIDIA + runtime CUDA
│   └── vulkan\             binari per GPU con supporto Vulkan
└── models\                 modelli .gguf (cartella predefinita, modificabile)

Requisiti e installazione

  • Sistema operativo: Windows 10 o 11 (versione a 32 o 64 bit del programma).
  • Hardware: qualsiasi CPU x64 moderna; una GPU NVIDIA o compatibile Vulkan accelera molto l'esecuzione.
  • Memoria: dipende dal modello; indicativamente un modello da 7–8 miliardi di parametri quantizzato a 4 bit richiede 5–6 GB tra RAM e VRAM.
  • Connessione internet: solo per scaricare binari e modelli; dopo, tutto funziona offline.

L'installazione si riduce a pochi passi:

  1. copiare la cartella del programma dove si preferisce e avviare LlamaCppManager.exe;
  2. aprire Scarica Moduli…, premere Cerca ultima release e poi Scarica e installa per il backend consigliato;
  3. cercare un modello GGUF, scegliere il file con la quantizzazione desiderata e scaricarlo;
  4. tornare alla finestra principale, selezionare il modello e premere Avvia Server;
  5. quando il pulsante si abilita, premere Apri nel Browser e iniziare a chattare.

Download

LlamaCpp Manager è gratuito per uso privato. Ogni pacchetto contiene solo l'eseguibile e un file LEGGIMI.txt: niente installer, basta estrarre la cartella e avviare LlamaCppManager.exe.

Scarica per Windows 64 bit (1,8 MB) Versione 32 bit (1,4 MB)

La versione a 64 bit è quella consigliata per qualunque PC recente; quella a 32 bit serve solo su installazioni di Windows a 32 bit. Per verificare l'integrità del file scaricato, questi sono gli hash SHA-256 (in PowerShell: Get-FileHash nomefile.zip):

  • LlamaCppManager-win64.zip
    562f8fe12b6896af92d6b607999b641ee1aa96c6197d929422cf0f99a7a98d34
  • LlamaCppManager-win32.zip
    8b938b7b9d7d04381ebcc136364188e4a5ad96e9b52dbc676c05046ee568dae6

Da sapere prima di avviarlo: il programma non è firmato digitalmente, quindi al primo avvio Windows SmartScreen potrebbe mostrare un avviso (Ulteriori informazioni → Esegui comunque). Il software è distribuito solo in forma eseguibile, gratuitamente per uso privato e "così com'è", senza garanzie; il codice sorgente non è distribuito.

In conclusione

LlamaCpp Manager non cerca di sostituire llama.cpp né di diventare l'ennesima piattaforma tuttofare per l'intelligenza artificiale. È uno strumento pratico, nato per togliere di mezzo gli ostacoli che separano un utente Windows da un modello linguistico che gira sul proprio computer: trovare i binari giusti, scegliere il modello, ricordare le opzioni. Il risultato è un programma di pochi megabyte, senza installazione e senza dipendenze, che lascia al motore ufficiale il lavoro pesante e all'utente il controllo completo.

LlamaCpp Manager è sviluppato in Delphi da EGSoft e si basa sul progetto open source llama.cpp. I modelli sono scaricati da Hugging Face e sono soggetti alle rispettive licenze.

memoryAltri articoli su AI grid_viewTutti gli articoli
Scrivici su WhatsApp