Un piccolo pannello di controllo nativo, scritto in Delphi, che scarica, configura e avvia llama.cpp per far girare modelli linguistici direttamente sul proprio PC: niente cloud, niente installazioni pesanti, niente riga di comando.
Perché è nato questo progetto
Far girare un modello linguistico (LLM) in locale oggi è alla portata di qualunque PC recente. Il motore più efficiente e diffuso per farlo è llama.cpp: un progetto open source in C/C++ che esegue i modelli in formato GGUF sfruttando la CPU oppure la scheda video tramite CUDA (NVIDIA) o Vulkan.
llama.cpp, però, è pensato per chi ha dimestichezza con la riga di comando. Per usarlo bisogna:
- capire quale delle tante build pubblicate su GitHub è quella giusta per il proprio hardware;
- scaricare e scompattare i binari (e, per CUDA, anche il runtime separato);
- trovare su Hugging Face un modello GGUF e scegliere la quantizzazione adatta alla propria memoria;
- comporre a mano una riga di comando con percorso del modello, contesto, thread, layer GPU, porta…
Esistono applicazioni desktop che nascondono tutta questa complessità, ma spesso sono pesanti: occupano centinaia di megabyte, si portano dietro runtime completi, installano servizi che restano in esecuzione in background o introducono formati e cartelle proprietarie.
L'idea di LlamaCpp Manager è stare nel mezzo: usare i binari ufficiali di llama.cpp, senza modificarli né nasconderli, e aggiungere solo un sottile strato grafico che automatizza le operazioni noiose. Uno strumento leggero, facile da installare e trasparente su ciò che fa.
Gli obiettivi
- Leggero — un unico eseguibile nativo Windows di pochi megabyte (circa 4 MB a 32 bit, 6 MB a 64 bit). Nessun runtime .NET, Java, Python o Electron da installare.
- Facile da installare — nessun setup: si copia la cartella e si avvia l'exe. Configurazione, binari e modelli restano accanto al programma, che quindi è anche portabile (può stare su un disco esterno).
- Trasparente — usa i binari ufficiali di llama.cpp scaricati da GitHub e mostra nel log la riga di comando esatta con cui avvia il server: nulla di nascosto, tutto riproducibile a mano.
- Guidato dall'hardware — rileva CPU, GPU NVIDIA e supporto Vulkan e consiglia automaticamente il backend più adatto.
- Nessun servizio in background — il server parte solo quando lo chiedi e si ferma quando premi "Ferma Server" o chiudi il programma.
- Offline e privato — dopo aver scaricato binari e modello, tutto gira in locale: i testi non lasciano il computer.
Come funziona
LlamaCpp Manager è un pannello di controllo: non contiene un proprio motore di inferenza e non incorpora una finestra di chat. Si occupa di preparare l'ambiente e di avviare llama-server.exe, il server HTTP incluso in llama.cpp, che offre già una comoda interfaccia web di chat e un'API compatibile con quella di OpenAI.
┌──────────────────────┐ avvia → ┌──────────────────────┐ carica → ┌ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ┐
│ LlamaCpp Manager │ │ llama-server.exe │ │ Modello .gguf │
│ configura, avvia, │ ← log │ binario ufficiale │ │ scaricato da │
│ monitora │ │ llama.cpp │ │ Hugging Face │
└──────────────────────┘ └──────────────────────┘ └ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ┘
Una volta avviato il server, basta un clic su Apri nel Browser per usare la chat all'indirizzo http://127.0.0.1:8080/. Lo stesso indirizzo può essere usato da qualunque programma che sappia dialogare con un'API in stile OpenAI.
Il flusso tipico, dal primo avvio alla chat
- Rilevamento dell'hardware. All'avvio il programma legge il numero di thread della CPU, interroga WMI per l'elenco delle schede video, usa
nvidia-smi(se presente) per nome e memoria della GPU NVIDIA e verifica la presenza divulkan-1.dll. In base al risultato consiglia il backend: CUDA se c'è una GPU NVIDIA, altrimenti Vulkan se disponibile, altrimenti CPU. - Download dei binari llama.cpp. Dalla finestra Scarica Moduli il programma interroga le release GitHub di
ggml-org/llama.cpp, individua lo zip Windows corrispondente al backend scelto, lo scarica e lo estrae inbin\cpu,bin\cudaobin\vulkan. Per CUDA scarica automaticamente anche il pacchetto del runtime (cudart), senza il quale il server non partirebbe. - Scelta e download del modello. La ricerca interroga direttamente Hugging Face filtrando i soli modelli GGUF, ordinati per numero di download. Il risultato è una tabella con repository, dimensione in parametri (es. 7B, 12B), download e like. Un doppio clic elenca i file
.ggufdel repository con quantizzazione (Q4_K_M, Q8_0…) e dimensione, così è facile scegliere il file adatto alla memoria disponibile. - Configurazione dei parametri. Dimensione del contesto, thread, layer da scaricare sulla GPU, batch, temperatura, top-k, top-p, host e porta si impostano da campi numerici, senza ricordare la sintassi delle opzioni.
- Avvio e monitoraggio. Il server viene lanciato come processo nascosto; il suo output compare in tempo reale nel log. Il programma interroga periodicamente l'endpoint
/healthe abilita Apri nel Browser solo quando il modello è caricato e pronto. Se il server si arresta da solo (per esempio per memoria video insufficiente) l'interfaccia se ne accorge e lo segnala.
La riga di comando generata
Tutti i parametri vengono tradotti in una normale invocazione di llama-server, visibile nel log. Ad esempio:
"...\bin\cuda\llama-server.exe" -m "D:\models\modello-Q4_K_M.gguf"
-c 4096 -t 20 -ngl 99 -b 512 --temp 0.8 --top-k 40 --top-p 0.95
--host 127.0.0.1 --port 8080
Questo significa che nulla è "magico": ciò che fa il programma si può riprodurre, studiare o personalizzare a mano in qualsiasi momento.
I parametri principali
| Parametro | Opzione | A cosa serve |
|---|---|---|
| Context Size | -c | Quanti token di conversazione il modello "ricorda". Più è alto, più memoria serve (default 4096). |
| Threads | -t | Thread CPU usati per il calcolo; di default il numero di processori logici rilevati. |
| GPU Layers | -ngl | Quanti strati del modello spostare sulla GPU. 0 = solo CPU; un valore alto porta tutto in VRAM, se c'è spazio. |
| Batch Size | -b | Token elaborati insieme durante la lettura del prompt: influisce su velocità e memoria. |
| Temperature | --temp | Creatività delle risposte: valori bassi più prevedibili, valori alti più varie. |
| Top-K / Top-P | --top-k / --top-p | Limitano la scelta delle parole ai candidati più probabili, per risposte più coerenti. |
| Host / Porta | --host / --port | Indirizzo su cui il server resta in ascolto (default 127.0.0.1:8080, solo il PC locale). |
Nota sulla sicurezza: con host
127.0.0.1il server è raggiungibile solo dal computer su cui gira. Impostando0.0.0.0diventa accessibile da tutta la rete locale: utile per usarlo da un altro dispositivo, ma da fare solo su reti fidate.
Struttura delle cartelle
LlamaCppManager\
├── LlamaCppManager.exe eseguibile (unico file del programma)
├── config.ini impostazioni, creato al primo avvio
├── bin\
│ ├── cpu\ binari llama.cpp per CPU
│ ├── cuda\ binari per GPU NVIDIA + runtime CUDA
│ └── vulkan\ binari per GPU con supporto Vulkan
└── models\ modelli .gguf (cartella predefinita, modificabile)
Requisiti e installazione
- Sistema operativo: Windows 10 o 11 (versione a 32 o 64 bit del programma).
- Hardware: qualsiasi CPU x64 moderna; una GPU NVIDIA o compatibile Vulkan accelera molto l'esecuzione.
- Memoria: dipende dal modello; indicativamente un modello da 7–8 miliardi di parametri quantizzato a 4 bit richiede 5–6 GB tra RAM e VRAM.
- Connessione internet: solo per scaricare binari e modelli; dopo, tutto funziona offline.
L'installazione si riduce a pochi passi:
- copiare la cartella del programma dove si preferisce e avviare
LlamaCppManager.exe; - aprire Scarica Moduli…, premere Cerca ultima release e poi Scarica e installa per il backend consigliato;
- cercare un modello GGUF, scegliere il file con la quantizzazione desiderata e scaricarlo;
- tornare alla finestra principale, selezionare il modello e premere Avvia Server;
- quando il pulsante si abilita, premere Apri nel Browser e iniziare a chattare.
Download
LlamaCpp Manager è gratuito per uso privato. Ogni pacchetto contiene solo l'eseguibile e un file LEGGIMI.txt: niente installer, basta estrarre la cartella e avviare LlamaCppManager.exe.
Scarica per Windows 64 bit (1,8 MB) Versione 32 bit (1,4 MB)
La versione a 64 bit è quella consigliata per qualunque PC recente; quella a 32 bit serve solo su installazioni di Windows a 32 bit. Per verificare l'integrità del file scaricato, questi sono gli hash SHA-256 (in PowerShell: Get-FileHash nomefile.zip):
- LlamaCppManager-win64.zip
562f8fe12b6896af92d6b607999b641ee1aa96c6197d929422cf0f99a7a98d34 - LlamaCppManager-win32.zip
8b938b7b9d7d04381ebcc136364188e4a5ad96e9b52dbc676c05046ee568dae6
Da sapere prima di avviarlo: il programma non è firmato digitalmente, quindi al primo avvio Windows SmartScreen potrebbe mostrare un avviso (Ulteriori informazioni → Esegui comunque). Il software è distribuito solo in forma eseguibile, gratuitamente per uso privato e "così com'è", senza garanzie; il codice sorgente non è distribuito.
In conclusione
LlamaCpp Manager non cerca di sostituire llama.cpp né di diventare l'ennesima piattaforma tuttofare per l'intelligenza artificiale. È uno strumento pratico, nato per togliere di mezzo gli ostacoli che separano un utente Windows da un modello linguistico che gira sul proprio computer: trovare i binari giusti, scegliere il modello, ricordare le opzioni. Il risultato è un programma di pochi megabyte, senza installazione e senza dipendenze, che lascia al motore ufficiale il lavoro pesante e all'utente il controllo completo.
LlamaCpp Manager è sviluppato in Delphi da EGSoft e si basa sul progetto open source llama.cpp. I modelli sono scaricati da Hugging Face e sono soggetti alle rispettive licenze.