Dopo il successo del lancio di Holo3 a marzo 2026, H Company introduce la famiglia Holo3.1, una serie di modelli ottimizzati per l'automazione dei dispositivi (Computer Use) che punta su robustezza cross-platform, integrazione flessibile ed esecuzione locale ultra-rapida su hardware consumer.
Automazione universale tra ambienti e framework
Il passaggio di Holo3 dalla fase di valutazione a quella di produzione ha evidenziato una sfida comune: le ottime prestazioni in un singolo scenario non garantiscono affidabilità in contesti diversi. I dispositivi mobili, i vari framework (strutture software che gestiscono il comportamento degli agenti) e i diversi sistemi di esecuzione introducono variazioni che possono degradare l'efficacia dell'intelligenza artificiale.
Holo3.1, basato sulla famiglia Qwen, è stato progettato per superare questi limiti di adattabilità, mantenendo performance allo stato dell'arte in ogni condizione di deployment.

Automazione Mobile avanzata
Holo3.1 estende significativamente le capacità di controllo oltre il browser e il desktop, ottenendo risultati rilevanti in ambienti mobile. Sul benchmark AndroidWorld (un test standardizzato per misurare la capacità di un'AI di completare compiti su Android), il modello ammiraglio da 35B-A3B è passato dal 67% al 79,3% di successo. Anche le varianti più leggere da 4B e 9B hanno registrato un balzo in avanti, salendo dal 58% al 72%.
Supporto nativo e integrazione nei framework
Per facilitare l'integrazione in stack di terze parti, Holo3.1 introduce il supporto nativo per i protocolli di function-calling. Si tratta della capacità del modello di identificare quando è necessario richiamare uno strumento o una funzione esterna e generare la richiesta corretta in modo autonomo.
I test condotti su OSWorld e sulle suite interne di H Company (che coprono e-commerce, software aziendali e flussi di collaborazione) mostrano che l'esecuzione nativa ha ormai raggiunto la parità di prestazioni con gli output JSON strutturati. Inoltre, Holo3.1 offre un miglioramento superiore al 25% rispetto alla versione precedente quando utilizzato all'interno di Holotab.
- ✓Supporto nativo per function-calling
- ✓Prestazioni elevate su AndroidWorld (fino a 79,3%)
- ✓Esecuzione locale privata e veloce
- ✓Quattro taglie per ogni esigenza di budget e potenza
- ✗I modelli più piccoli richiedono ottimizzazioni specifiche per compiti complessi
- ✗La quantizzazione spinta può causare lievi cali di precisione (circa 2 punti)
Taglie del modello e compromessi costo-prestazioni
La famiglia Holo3.1 è stata pensata per offrire flessibilità totale: dai modelli ultra-leggeri per l'uso su smartphone a soluzioni ad alta potenza per server aziendali.
| Modello | Target di Deployment |
|---|---|
| Holo3.1-0.8B | Agenti locali ultra-leggeri (es. mobile o IoT) |
| Holo3.1-4B | Deployment economico con buon bilanciamento |
| Holo3.1-9B | Equilibrio ottimale tra prestazioni e latenza |
| Holo3.1-35B-A3B | Prestazioni allo stato dell'arte (SOTA) |


Inferenza locale e quantizzazione
Per la prima volta, vengono rilasciati pesi ottimizzati tramite quantizzazione, una tecnica che riduce la precisione numerica dei parametri del modello per diminuire l'occupazione di memoria e velocizzare i calcoli. I nuovi formati includono FP8, Q4 GGUF e NVFP4.
I guadagni di velocità (throughput, ovvero la quantità di token elaborati al secondo) sono netti: su sistemi DGX Spark, NVFP4 garantisce una velocità 1,41 volte superiore a FP8 e 1,74 volte superiore a BF16.

Agenti locali su hardware consumer
L'introduzione dei checkpoint Q4 GGUF punta direttamente al mercato consumer. Questi modelli permettono di eseguire agenti AI localmente su macchine Windows o Mac (Apple Silicon) garantendo la massima privacy: nessun dato lascia la rete dell'utente.
Le ottimizzazioni sviluppate in collaborazione con NVIDIA hanno permesso di dimezzare i tempi di attesa. Su sistemi Spark, il tempo medio per ogni azione (step) dell'agente è sceso da 6,8 a 3,3 secondi, segnando un raddoppio effettivo della velocità operativa end-to-end.
Un nuovo standard per gli agenti locali
Holo3.1 non è solo un incremento incrementale di potenza, ma un cambio di paradigma verso l accessibilità. La capacità di far girare agenti complessi su hardware locale con latenze ridotte apre la strada a automazioni desktop realmente private e reattive.
Cosa si intende per Computer Use Model?
I modelli Holo3.1 sono gratuiti?
Posso eseguire Holo3.1 sul mio laptop?
Qual è la differenza principale tra Holo3 e Holo3.1?
Fonti e riferimenti




