---
title: "Alibaba lancia Qwen3.7-Plus: il nuovo modello AI multimodale e agentico"
date: "2026-06-02"
category: "Tecnologia"
tags: ["agenti ai", "alibaba", "intelligenza artificiale", "modelli multimodali", "qwen"]
author: "Giuseppe Carruezzo"
description: "Scopri Qwen3.7-Plus, il nuovo modello AI di Alibaba con capacità multimodali e funzioni agentiche avanzate per l'esecuzione autonoma di compiti complessi."
source: "https://ainsights.it/blog/alibaba-qwen3-7-plus-nuovo-modello-ai-multimodale"
---

# Alibaba lancia Qwen3.7-Plus: il nuovo modello AI multimodale e agentico

![Alibaba lancia Qwen3.7-Plus: il nuovo modello AI multimodale e agentico](/blogai/backend/uploads/6a1f06a9591b2.webp)

Alibaba ha ufficialmente rilasciato Qwen3.7-Plus, un modello linguistico multimodale avanzato ora disponibile sulla piattaforma Bailian di Alibaba Cloud. Questa nuova iterazione non si limita a elaborare testo, ma integra capacità di visione e funzioni agentiche progettate per l'esecuzione di compiti complessi in totale autonomia.

-   **#16** — Vision Arena (Posizionamento globale del modello nelle prove di comprensione visiva)
-   **#5** — Ranking Lab (Posizione di Alibaba tra i laboratori mondiali per la visione artificiale)
-   **56,6** — Indice AI (Punteggio ottenuto dal modello text-only Qwen3.7-Max)

## Le caratteristiche tecniche di Qwen3.7-Plus

Qwen3.7-Plus è un modello di grandi dimensioni multimodale, ovvero capace di elaborare e comprendere diversi tipi di dati contemporaneamente, come immagini, video e prompt testuali. A differenza del suo "fratello" Qwen3.7-Max, che è limitato alla sola modalità testuale, la versione Plus è in grado di interpretare contenuti visivi complessi.

È fondamentale specificare che si tratta di un modello di **comprensione visiva** e non di generazione: il sistema può "leggere" e analizzare un video o un'immagine per estrarne informazioni, ma non può creare nuovi contenuti multimediali da zero. Per la generazione di immagini e video, Alibaba si affida ad altre famiglie di modelli specifici.

![Panoramica delle capacità agentiche di Qwen3.7-Plus](/blogai/backend/uploads/6a1f06a9591b2.webp)

Schema delle funzionalità multimodali e agentiche integrate nell'ecosistema Qwen.

## Cinque pilastri per l'autonomia operativa

Il team di Qwen descrive questo rilascio come un'evoluzione fondamentale nella tecnologia degli agenti ibridi multimodali. Un **agente AI** è un modello capace di pianificare ed eseguire azioni attraverso più passaggi per raggiungere un obiettivo. Qwen3.7-Plus introduce cinque abilità chiave:

-   **Ragionamento profondo (Deep reasoning):** la capacità di analizzare problemi complessi passo dopo passo.
-   **Auto-programmazione (Self-programming):** il modello può scrivere, testare e correggere il proprio codice sorgente.
-   **Invocazione di strumenti (Tool invocation):** la capacità di richiamare funzioni esterne o API (interfacce di programmazione che permettono a due software di comunicare).
-   **Verifica e testing:** il sistema esegue i propri output e ne controlla i risultati per validarne la correttezza.
-   **Iterazione autonoma:** il modello opera in un ciclo continuo finché il compito assegnato non è completato con successo.

L'unione di queste capacità trasforma il modello da un semplice risponditore a un operatore attivo capace di agire su file, database o servizi web.

## Prestazioni e benchmark di visione

I risultati ottenuti da Qwen3.7-Plus nei test indipendenti confermano la solidità dell'architettura. Nella **Vision Arena**, una classifica neutrale gestita da LM Arena dove gli utenti votano le migliori risposte fornite dai modelli in test "ciechi", l'anteprima di Qwen3.7-Plus si è posizionata al 16° posto globale.

Questo risultato colloca Alibaba come il quinto laboratorio al mondo per capacità di visione artificiale. Le applicazioni pratiche di questi punteggi si traducono in un'eccellenza in ambiti quali:

-   **OCR su larga scala:** il riconoscimento ottico dei caratteri per digitalizzare documenti complessi.
-   **Lettura di grafici:** l'analisi di dati statistici rappresentati visivamente.
-   **Analisi di frame video:** la comprensione di sequenze temporali all'interno di filmati.

Parallelamente, la variante Max (solo testo) ha registrato un punteggio di 56,6 sull'Artificial Analysis Intelligence Index, segnando il posizionamento più alto per un modello cinese al momento del rilascio.

## Il ciclo agentico e la piattaforma Bailian

Il focus di Alibaba è chiaramente orientato ai "long-running tasks", ovvero compiti che richiedono tempo e molteplici operazioni coordinate. La piattaforma Bailian (nota a livello internazionale come **Model Studio**) supporta questa visione attraverso due componenti infrastrutturali:

1.  **Agentic RL (Reinforcement Learning):** un meccanismo di apprendimento per rinforzo che utilizza il feedback derivante dall'esecuzione reale dei compiti per affinare la precisione del modello nel tempo.
2.  **Guardrail di sicurezza:** sistemi di controllo integrati che limitano le azioni degli strumenti autonomi entro confini operativi prestabiliti, essenziali quando un agente ha il permesso di modificare file o inviare comandi di sistema.

## Punti chiave

-   Qwen3.7-Plus è un modello multimodale che comprende immagini e video, disponibile via API su Alibaba Cloud.
-   Il modello integra cinque funzioni core per l operatività autonoma, inclusa l auto-programmazione e l iterazione.
-   Alibaba è ora il 5° laboratorio al mondo per capacità di visione artificiale secondo i dati di Vision Arena.
-   Il sistema utilizza l apprendimento per rinforzo basato sui risultati reali per migliorare costantemente le proprie prestazioni.

### Un ecosistema maturo per l automazione — 4.5/5

Qwen3.7-Plus rappresenta un eccellente equilibrio tra visione e azione. La capacità di correggere il proprio codice e interagire con strumenti esterni lo rende uno dei backend più promettenti per lo sviluppo di agenti AI aziendali.

## FAQ

### Qual è la differenza tra Qwen3.7-Plus e Qwen3.7-Max?

La versione Plus è multimodale e supporta input di immagini e video, mentre la versione Max è ottimizzata esclusivamente per il testo e il ragionamento logico puro.

### Qwen3.7-Plus può generare video?

No, il modello è progettato per la comprensione visiva (analisi e descrizione). La generazione di contenuti multimediali è affidata ad altri modelli specializzati di Alibaba.

### Come possono gli sviluppatori italiani accedere al modello?

Il modello è accessibile tramite la piattaforma Bailian di Alibaba Cloud, disponibile a livello internazionale con il nome di Model Studio tramite servizi API.

### Cosa si intende per iterazione autonoma?

Significa che il modello può ripetere un processo, analizzando i propri errori e riprovando diverse soluzioni, finché il compito assegnato non viene risolto senza intervento umano.

## Fonti e riferimenti

1.  [Alibaba Qwen Team - Qwen3.7-Plus Blog](https://qwen.ai/blog?id=qwen3.7-plus)
2.  [Model Studio API Documentation](https://modelstudio.console.alibabacloud.com/ap-southeast-1?tab=doc#/doc/?type=model&url=2840914_2&modelId=qwen3.7-plus&serviceSite=international)

---

*Fonte: [https://ainsights.it/blog/alibaba-qwen3-7-plus-nuovo-modello-ai-multimodale](https://ainsights.it/blog/alibaba-qwen3-7-plus-nuovo-modello-ai-multimodale)*
