Alibaba ha ufficialmente rilasciato Qwen3.7-Plus, un modello linguistico multimodale avanzato ora disponibile sulla piattaforma Bailian di Alibaba Cloud. Questa nuova iterazione non si limita a elaborare testo, ma integra capacità di visione e funzioni agentiche progettate per l'esecuzione di compiti complessi in totale autonomia.
Le caratteristiche tecniche di Qwen3.7-Plus
Qwen3.7-Plus è un modello di grandi dimensioni multimodale, ovvero capace di elaborare e comprendere diversi tipi di dati contemporaneamente, come immagini, video e prompt testuali. A differenza del suo "fratello" Qwen3.7-Max, che è limitato alla sola modalità testuale, la versione Plus è in grado di interpretare contenuti visivi complessi.
È fondamentale specificare che si tratta di un modello di comprensione visiva e non di generazione: il sistema può "leggere" e analizzare un video o un'immagine per estrarne informazioni, ma non può creare nuovi contenuti multimediali da zero. Per la generazione di immagini e video, Alibaba si affida ad altre famiglie di modelli specifici.

Cinque pilastri per l'autonomia operativa
Il team di Qwen descrive questo rilascio come un'evoluzione fondamentale nella tecnologia degli agenti ibridi multimodali. Un agente AI è un modello capace di pianificare ed eseguire azioni attraverso più passaggi per raggiungere un obiettivo. Qwen3.7-Plus introduce cinque abilità chiave:
- Ragionamento profondo (Deep reasoning): la capacità di analizzare problemi complessi passo dopo passo.
- Auto-programmazione (Self-programming): il modello può scrivere, testare e correggere il proprio codice sorgente.
- Invocazione di strumenti (Tool invocation): la capacità di richiamare funzioni esterne o API (interfacce di programmazione che permettono a due software di comunicare).
- Verifica e testing: il sistema esegue i propri output e ne controlla i risultati per validarne la correttezza.
- Iterazione autonoma: il modello opera in un ciclo continuo finché il compito assegnato non è completato con successo.
Prestazioni e benchmark di visione
I risultati ottenuti da Qwen3.7-Plus nei test indipendenti confermano la solidità dell'architettura. Nella Vision Arena, una classifica neutrale gestita da LM Arena dove gli utenti votano le migliori risposte fornite dai modelli in test "ciechi", l'anteprima di Qwen3.7-Plus si è posizionata al 16° posto globale.
Questo risultato colloca Alibaba come il quinto laboratorio al mondo per capacità di visione artificiale. Le applicazioni pratiche di questi punteggi si traducono in un'eccellenza in ambiti quali:
- OCR su larga scala: il riconoscimento ottico dei caratteri per digitalizzare documenti complessi.
- Lettura di grafici: l'analisi di dati statistici rappresentati visivamente.
- Analisi di frame video: la comprensione di sequenze temporali all'interno di filmati.
Parallelamente, la variante Max (solo testo) ha registrato un punteggio di 56,6 sull'Artificial Analysis Intelligence Index, segnando il posizionamento più alto per un modello cinese al momento del rilascio.
Il ciclo agentico e la piattaforma Bailian
Il focus di Alibaba è chiaramente orientato ai "long-running tasks", ovvero compiti che richiedono tempo e molteplici operazioni coordinate. La piattaforma Bailian (nota a livello internazionale come Model Studio) supporta questa visione attraverso due componenti infrastrutturali:
- Agentic RL (Reinforcement Learning): un meccanismo di apprendimento per rinforzo che utilizza il feedback derivante dall'esecuzione reale dei compiti per affinare la precisione del modello nel tempo.
- Guardrail di sicurezza: sistemi di controllo integrati che limitano le azioni degli strumenti autonomi entro confini operativi prestabiliti, essenziali quando un agente ha il permesso di modificare file o inviare comandi di sistema.
Un ecosistema maturo per l automazione
Qwen3.7-Plus rappresenta un eccellente equilibrio tra visione e azione. La capacità di correggere il proprio codice e interagire con strumenti esterni lo rende uno dei backend più promettenti per lo sviluppo di agenti AI aziendali.
Qual è la differenza tra Qwen3.7-Plus e Qwen3.7-Max?
Qwen3.7-Plus può generare video?
Come possono gli sviluppatori italiani accedere al modello?
Cosa si intende per iterazione autonoma?
Fonti e riferimenti
