---
title: "whichllm: Trova il Miglior Modello IA per il Tuo Hardware Locale"
date: "2026-06-06"
category: "Intelligenza Artificiale"
tags: ["hardware", "huggingface", "intelligenza artificiale", "llm", "python"]
author: "Giuseppe Carruezzo"
description: "Scopri whichllm, lo strumento da riga di comando che analizza il tuo PC per consigliarti i migliori LLM da eseguire localmente in base alla tua GPU e RAM."
source: "https://ainsights.it/blog/whichllm-guida-scelta-modelli-ia-locali"
---

# whichllm: Trova il Miglior Modello IA per il Tuo Hardware Locale

![whichllm: Trova il Miglior Modello IA per il Tuo Hardware Locale](/blogai/backend/uploads/6a248d2ad0dd4.webp)

Individuare il modello linguistico locale ideale per il proprio computer non è solo una questione di memoria disponibile, ma di equilibrio tra prestazioni, precisione e capacità hardware. **whichllm** è uno strumento da riga di comando che automatizza questa analisi, scansionando CPU, GPU e RAM per suggerire e classificare i migliori modelli di HuggingFace pronti all'uso sul sistema in uso.

-   **40 t/s** — Velocità Qwen3.6-27B (Su hardware RTX 5090 (32 GB VRAM))
-   **27 t/s** — Velocità Qwen3.6-27B (Su hardware RTX 4090 (24 GB VRAM))
-   **94,7** — Punteggio Max (Raggiunto da Qwen3.6-27B su sistemi high-end)

L'ecosistema dei Large Language Models (LLM) — i modelli di intelligenza artificiale addestrati su enormi quantità di testo — si evolve con una rapidità tale da rendere obsolete le classifiche statiche in poche settimane. whichllm risolve il problema interfacciandosi direttamente con le API di HuggingFace (la principale piattaforma di condivisione di modelli AI) per fornire raccomandazioni basate su dati aggiornati in tempo reale.

![demo](/blogai/backend/uploads/6a248dedb30f5.webp)

Dimostrazione del funzionamento di whichllm nel terminale.

## Installazione e avvio rapido

Lo strumento è progettato per essere eseguito immediatamente senza configurazioni complesse. Il metodo consigliato utilizza `uvx`, un esecutore di pacchetti Python estremamente veloce.

```bash
# Installazione tramite pip (alternativa)
pip install whichllm
```

## Flussi di lavoro principali

Una volta installato, `whichllm` offre diversi comandi per gestire l'intero ciclo di vita di un modello locale, dalla scelta alla programmazione.

-   **Analisi hardware:** Il comando base rileva i componenti e stila la classifica dei modelli migliori.
    
-   **Pianificazione upgrade:** Permette di confrontare come cambierebbero le prestazioni passando a GPU (Graphics Processing Unit) diverse.
    
-   **Generazione di codice:** Crea frammenti di codice Python pronti all'uso per integrare il modello nelle proprie applicazioni.
    
-   **Chat interattiva:** Avvia una sessione di conversazione diretta con il modello scelto.
    

```bash
# Trova i modelli migliori per questa macchina
whichllm

# Confronta candidati per un aggiornamento hardware
whichllm upgrade "RTX 4090" "RTX 5090" "H100"

# Identifica la GPU necessaria per un modello specifico
whichllm plan "llama 3 70b"

# Avvia una chat con un modello specifico (formato GGUF)
whichllm run "qwen 2.5 1.5b gguf"
```

## Analisi delle prestazioni hardware (maggio 2026)

I risultati variano in base ai dati live di HuggingFace. Di seguito una panoramica delle prestazioni stimate per diverse configurazioni hardware tipiche, basata su snapshot recenti. La velocità è espressa in "t/s" (token al secondo), dove un token corrisponde approssimativamente a una parola o parte di essa.

> _\[Grafico interattivo — visibile nella versione web dell'articolo\]_

<table style="min-width: 100px;"><colgroup><col style="min-width: 25px;"><col style="min-width: 25px;"><col style="min-width: 25px;"><col style="min-width: 25px;"></colgroup><tbody><tr><th colspan="1" rowspan="1"><p>Hardware</p></th><th colspan="1" rowspan="1"><p>VRAM</p></th><th colspan="1" rowspan="1"><p>Scelta Top</p></th><th colspan="1" rowspan="1"><p>Velocità</p></th></tr><tr><td colspan="1" rowspan="1"><p>RTX 5090</p></td><td colspan="1" rowspan="1"><p>32 GB</p></td><td colspan="1" rowspan="1"><p><code>Qwen3.6-27B</code> (Q6_K)</p></td><td colspan="1" rowspan="1"><p>~40 t/s</p></td></tr><tr><td colspan="1" rowspan="1"><p>RTX 4090 / 3090</p></td><td colspan="1" rowspan="1"><p>24 GB</p></td><td colspan="1" rowspan="1"><p><code>Qwen3.6-27B</code> (Q5_K_M)</p></td><td colspan="1" rowspan="1"><p>~27 t/s</p></td></tr><tr><td colspan="1" rowspan="1"><p>RTX 4060</p></td><td colspan="1" rowspan="1"><p>8 GB</p></td><td colspan="1" rowspan="1"><p><code>Qwen3-14B</code> (Q3_K_M)</p></td><td colspan="1" rowspan="1"><p>~22 t/s</p></td></tr><tr><td colspan="1" rowspan="1"><p>Apple M3 Max</p></td><td colspan="1" rowspan="1"><p>36 GB</p></td><td colspan="1" rowspan="1"><p><code>Qwen3.6-27B</code> (Q5_K_M)</p></td><td colspan="1" rowspan="1"><p>~9 t/s</p></td></tr><tr><td colspan="1" rowspan="1"><p>Solo CPU</p></td><td colspan="1" rowspan="1"><p>—</p></td><td colspan="1" rowspan="1"><p><code>gpt-oss-20b</code> (MoE)</p></td><td colspan="1" rowspan="1"><p>~6 t/s</p></td></tr></tbody></table>

**Nota sui modelli MoE:** I modelli Mixture of Experts (come quello indicato per il solo uso CPU) utilizzano molti parametri totali per la qualità, ma ne attivano solo una frazione per ogni calcolo, garantendo un'elevata velocità di esecuzione anche su hardware limitato.

## L'algoritmo di scoring: oltre la dimensione

Far entrare un modello nella VRAM (Video RAM) è l'aspetto più semplice. La sfida è capire quale, tra i modelli compatibili, sia effettivamente il migliore in termini di intelligenza e velocità. whichllm utilizza un sistema di punteggio da 0 a 100 che aggrega diversi fattori:

-   **Qualità del benchmark:** Integra dati da LiveBench, Artificial Analysis, Chatbot Arena ELO e Open LLM Leaderboard.
    
-   **Recency-aware:** Le vecchie classifiche vengono penalizzate rispetto alle nuove generazioni di modelli.
    
-   **Affidabilità delle prove:** Ogni punteggio è pesato in base alla fonte (diretta, variante, base o auto-dichiarata).
    
-   **Stima dell'architettura:** Calcola lo spazio occupato non solo dai pesi del modello, ma anche dalla cache KV (Key-Value) e dai costi fissi del framework (circa 500 MB).
    

### Pro

-   Classifiche basate su benchmark reali e non solo sulla dimensione dei parametri.
-   Rilevamento automatico preciso di GPU NVIDIA, AMD e Apple Silicon.
-   Supporto per il caricamento parziale (offload) tra GPU e CPU.
-   Output in formato JSON per integrazione in script personali.

### Contro

-   Alcuni stime di velocità hanno confidenza bassa per backend meno comuni.
-   La precisione dipende dalla disponibilità di benchmark aggiornati su HuggingFace.

## Esecuzione e integrazione

Il comando `run` è una delle funzionalità più potenti: crea un ambiente isolato, scarica il modello e avvia la chat senza sporcare il sistema globale.

![run demo](/blogai/backend/uploads/6a248dee12bb6.webp)

Esempio di avvio immediato di una sessione di chat.

Per gli sviluppatori, `whichllm snippet` fornisce il codice Python necessario per caricare il modello tramite librerie come `llama-cpp-python` o `transformers`.

```python
from llama_cpp import Llama

# Snippet generato automaticamente per Qwen 7B
llm = Llama.from_pretrained(
    repo_id="Qwen/Qwen2.5-7B-Instruct-GGUF",
    filename="qwen2.5-7b-instruct-q4_k_m.gguf",
    n_ctx=4096,
    n_gpu_layers=-1,
    verbose=False,
)

output = llm.create_chat_completion(
    messages=[{"role": "user", "content": "Ciao!"}],
)
print(output["choices"][0]["message"]["content"])
```

### Integrazione con Ollama

È possibile utilizzare whichllm per alimentare script che gestiscono **Ollama** (un altro popolare gestore di LLM locali). Ad esempio, si può creare un alias nel terminale per eseguire sempre il miglior modello disponibile:

```bash
alias bestllm='whichllm --top 1 --json | jq -r ".models[0].model_id"'
# Utilizzo: ollama run $(bestllm)
```

## Architettura del sistema

La pipeline dei dati di whichllm assicura che le informazioni siano sempre fresche ma accessibili anche offline tramite cache locale.

```mermaid
flowchart TD
  A[Rilevamento Hardware] --> B[Fetch Modelli HuggingFace]
  B --> C[Integrazione Benchmark Live]
  C --> D[Calcolo VRAM e Compatibilità]
  D --> E[Ranking Engine Scoring]
  E --> F[Visualizzazione Risultati/JSON]
  F --> G[Esecuzione Chat o Snippet]
```

## Punti chiave

-   whichllm automatizza la scelta del modello AI locale analizzando le specifiche reali di GPU, CPU e RAM.
-   Il sistema di scoring 0-100 privilegia i benchmark aggiornati rispetto alla semplice dimensione del modello.
-   Supporta nativamente la simulazione di hardware non ancora in possesso per pianificare acquisti futuri.
-   Include strumenti per avviare chat istantanee o generare codice Python pronto per la produzione.

### Verdetto

## Fonti e riferimenti

1.  [Repository GitHub whichllm](https://github.com/Andyyyy64/whichllm)
2.  [Pagina Progetto PyPI](https://pypi.org/project/whichllm/)
3.  [HuggingFace Model Hub](https://huggingface.co/models)

---

*Fonte: [https://ainsights.it/blog/whichllm-guida-scelta-modelli-ia-locali](https://ainsights.it/blog/whichllm-guida-scelta-modelli-ia-locali)*
