Alibaba ha ufficialmente rilasciato Qwen3.7-Plus, un modello linguistico multimodale avanzato ora disponibile sulla piattaforma Bailian di Alibaba Cloud. Questa nuova iterazione non si limita a elaborare testo, ma integra capacità di visione e funzioni agentiche progettate per l'esecuzione di compiti complessi in totale autonomia.

#16
Vision Arena
Posizionamento globale del modello nelle prove di comprensione visiva
#5
Ranking Lab
Posizione di Alibaba tra i laboratori mondiali per la visione artificiale
56,6
Indice AI
Punteggio ottenuto dal modello text-only Qwen3.7-Max

Le caratteristiche tecniche di Qwen3.7-Plus

Qwen3.7-Plus è un modello di grandi dimensioni multimodale, ovvero capace di elaborare e comprendere diversi tipi di dati contemporaneamente, come immagini, video e prompt testuali. A differenza del suo "fratello" Qwen3.7-Max, che è limitato alla sola modalità testuale, la versione Plus è in grado di interpretare contenuti visivi complessi.

È fondamentale specificare che si tratta di un modello di comprensione visiva e non di generazione: il sistema può "leggere" e analizzare un video o un'immagine per estrarne informazioni, ma non può creare nuovi contenuti multimediali da zero. Per la generazione di immagini e video, Alibaba si affida ad altre famiglie di modelli specifici.

Panoramica delle capacità agentiche di Qwen3.7-Plus
Schema delle funzionalità multimodali e agentiche integrate nell'ecosistema Qwen.

Cinque pilastri per l'autonomia operativa

Il team di Qwen descrive questo rilascio come un'evoluzione fondamentale nella tecnologia degli agenti ibridi multimodali. Un agente AI è un modello capace di pianificare ed eseguire azioni attraverso più passaggi per raggiungere un obiettivo. Qwen3.7-Plus introduce cinque abilità chiave:

  • Ragionamento profondo (Deep reasoning): la capacità di analizzare problemi complessi passo dopo passo.
  • Auto-programmazione (Self-programming): il modello può scrivere, testare e correggere il proprio codice sorgente.
  • Invocazione di strumenti (Tool invocation): la capacità di richiamare funzioni esterne o API (interfacce di programmazione che permettono a due software di comunicare).
  • Verifica e testing: il sistema esegue i propri output e ne controlla i risultati per validarne la correttezza.
  • Iterazione autonoma: il modello opera in un ciclo continuo finché il compito assegnato non è completato con successo.

Prestazioni e benchmark di visione

I risultati ottenuti da Qwen3.7-Plus nei test indipendenti confermano la solidità dell'architettura. Nella Vision Arena, una classifica neutrale gestita da LM Arena dove gli utenti votano le migliori risposte fornite dai modelli in test "ciechi", l'anteprima di Qwen3.7-Plus si è posizionata al 16° posto globale.

Questo risultato colloca Alibaba come il quinto laboratorio al mondo per capacità di visione artificiale. Le applicazioni pratiche di questi punteggi si traducono in un'eccellenza in ambiti quali:

  • OCR su larga scala: il riconoscimento ottico dei caratteri per digitalizzare documenti complessi.
  • Lettura di grafici: l'analisi di dati statistici rappresentati visivamente.
  • Analisi di frame video: la comprensione di sequenze temporali all'interno di filmati.

Parallelamente, la variante Max (solo testo) ha registrato un punteggio di 56,6 sull'Artificial Analysis Intelligence Index, segnando il posizionamento più alto per un modello cinese al momento del rilascio.

Il ciclo agentico e la piattaforma Bailian

Il focus di Alibaba è chiaramente orientato ai "long-running tasks", ovvero compiti che richiedono tempo e molteplici operazioni coordinate. La piattaforma Bailian (nota a livello internazionale come Model Studio) supporta questa visione attraverso due componenti infrastrutturali:

  1. Agentic RL (Reinforcement Learning): un meccanismo di apprendimento per rinforzo che utilizza il feedback derivante dall'esecuzione reale dei compiti per affinare la precisione del modello nel tempo.
  2. Guardrail di sicurezza: sistemi di controllo integrati che limitano le azioni degli strumenti autonomi entro confini operativi prestabiliti, essenziali quando un agente ha il permesso di modificare file o inviare comandi di sistema.
Il nostro verdetto
4.5/ 5

Un ecosistema maturo per l automazione

Qwen3.7-Plus rappresenta un eccellente equilibrio tra visione e azione. La capacità di correggere il proprio codice e interagire con strumenti esterni lo rende uno dei backend più promettenti per lo sviluppo di agenti AI aziendali.

Qual è la differenza tra Qwen3.7-Plus e Qwen3.7-Max?
La versione Plus è multimodale e supporta input di immagini e video, mentre la versione Max è ottimizzata esclusivamente per il testo e il ragionamento logico puro.
Qwen3.7-Plus può generare video?
No, il modello è progettato per la comprensione visiva (analisi e descrizione). La generazione di contenuti multimediali è affidata ad altri modelli specializzati di Alibaba.
Come possono gli sviluppatori italiani accedere al modello?
Il modello è accessibile tramite la piattaforma Bailian di Alibaba Cloud, disponibile a livello internazionale con il nome di Model Studio tramite servizi API.
Cosa si intende per iterazione autonoma?
Significa che il modello può ripetere un processo, analizzando i propri errori e riprovando diverse soluzioni, finché il compito assegnato non viene risolto senza intervento umano.

Fonti e riferimenti

  1. Alibaba Qwen Team - Qwen3.7-Plus Blog
  2. Model Studio API Documentation