Anthropic segna un nuovo traguardo nell'intelligenza artificiale con il lancio di Claude Opus 4.8. Questo aggiornamento non si limita a superare i benchmark del suo predecessore, l'Opus 4.7, ma introduce una maggiore capacità di collaborazione e nuove funzionalità di controllo dell'impegno, il tutto mantenendo invariata la struttura dei costi per gli utenti.

2.5x
Velocità Fast Mode
Incremento rispetto ai modelli precedenti
3x
Efficienza Economica
Riduzione dei costi per la modalità veloce
84%
Online-Mind2Web
Punteggio record per l’uso di browser e computer
4x
Onestà del Modello
Minore probabilità di ignorare errori nel codice
Introducing Claude Opus 4.8
Presentazione ufficiale di Claude Opus 4.8, il modello di punta di Anthropic per la collaborazione avanzata.

Le Capacità di Opus 4.8

L'aggiornamento a Claude Opus 4.8 rappresenta un'evoluzione mirata a migliorare le prestazioni nei benchmark di programmazione, nelle abilità agentiche e nel ragionamento logico. Rispetto ai modelli precedenti, Opus 4.8 dimostra una superiorità tangibile nei compiti di "knowledge work" pratico. I dettagli completi sulle valutazioni di capacità sono disponibili nella documentazione tecnica ufficiale (Claude Opus 4.8 System Card).

Performance Agentic e Reasoning
Mostra dati
Performance Agentic e Reasoning
VoceValore
Opus 4.8 (Mind2Web)84
Opus 4.7 (OSWorld-V)82,3
Gemini 3.5 Flash (Finance)57,9

Collaborare con Opus 4.8: Il Feedback dei Partner

I primi tester hanno descritto Claude Opus 4.8 come un modello più affidabile e dotato di un giudizio più affilato durante l'esecuzione di compiti agentici. Ecco alcune delle testimonianze chiave dalle aziende che stanno già integrando questa tecnologia:

  • Claude Code: Il modello mostra un giudizio notevolmente migliore, ponendo le domande giuste e correggendo i propri errori prima di apportare modifiche complesse a sistemi multi-servizio.
  • Super-Agent Benchmark: Opus 4.8 è l'unico modello ad aver completato ogni caso end-to-end, superando i modelli Opus precedenti e pareggiando i costi con GPT-5.5.
  • CursorBench: Il "tool calling" (richiamo degli strumenti) è ora più efficiente, richiedendo meno passaggi per raggiungere lo stesso livello di intelligenza.
  • Legal Agent Benchmark: Ha registrato il punteggio più alto mai visto, superando la soglia del 10% nello standard "all-pass" per il lavoro legale sostanziale.
  • Devin (Cognition): Gli ingegneri hanno notato una risoluzione dei problemi di verbosità nei commenti e una maggiore coerenza nell'esecuzione autonoma.
  • Databricks (Genie): Il ragionamento agentico ha sbloccato un cambio di passo, permettendo di analizzare PDF e diagrammi con un costo dei token inferiore del 61% rispetto a Opus 4.7.

Nuove Funzionalità Lanciate Oggi

Oltre al miglioramento del modello di base, Anthropic ha introdotto tre aggiornamenti fondamentali per ecosistema Claude:

Workflow Dinamici (Dynamic Workflows)

Disponibile in anteprima di ricerca, questa funzione permette a Claude di gestire compiti di scala enorme all'interno di Claude Code. Il sistema può pianificare il lavoro e lanciare centinaia di sub-agenti paralleli in una singola sessione. Un esempio pratico è la migrazione di interi codebase che comprendono centinaia di migliaia di righe di codice, gestite autonomamente dall'inizio alla fusione dei rami (merge).

Controllo dell'Impegno (Effort Control)

Gli utenti di claude.ai e Cowork possono ora decidere quanto "impegno" il modello debba dedicare a una risposta.

  • Impegno Elevato: Claude riflette più profondamente e frequentemente per fornire risposte di alta qualità.
  • Impegno Ridotto: Risposte più rapide e consumo più lento dei limiti di utilizzo.

Aggiornamenti alla Messages API

Gli sviluppatori possono ora inserire voci di sistema direttamente nell'array dei messaggi. Questo permette di aggiornare le istruzioni (come budget di token o permessi) a metà dell'attività senza interrompere la cache dei prompt.

Pro
  • Maggiore precisione nelle citazioni per documenti finanziari
  • Riduzione drastica dei costi in modalità veloce
  • Capacità di gestire migrazioni di codice su larga scala
  • Migliore allineamento e tratti prosociali
Contro
  • Richiede impostazioni di sforzo elevato per i compiti più complessi
  • I modelli di classe Mythos non sono ancora disponibili per il rilascio generale

Il Futuro: Project Glasswing e Claude Mythos

Nonostante Opus 4.8 sia un passo avanti tangibile, Anthropic sta già lavorando a una nuova classe di modelli con intelligenza superiore. Attraverso il Project Glasswing, un numero limitato di organizzazioni sta testando Claude Mythos Preview per scopi di cybersicurezza. Questi modelli richiedono salvaguardie più rigide prima del rilascio pubblico, previsto nelle prossime settimane.

Disponibilità e Prezzi

Claude Opus 4.8 è disponibile da oggi tramite l'API di Claude con il nome identificativo claude-opus-4-8. I prezzi per l'utilizzo standard rimangono invariati rispetto alla versione 4.7:

  • Utilizzo Standard: $5 per milione di token in input / $25 per milione di token in output.
  • Fast Mode: $10 per milione di token in input / $50 per milione di token in output.
Il nostro verdetto
4.8/ 5

L’eccellenza nell’affidabilità

Claude Opus 4.8 non è solo un aggiornamento incrementale, ma una ridefinizione dell’affidabilità dei modelli AI. Con il controllo dell’impegno e i workflow paralleli, Anthropic consolida la sua posizione nel mercato enterprise.

Cosa cambia tra Opus 4.7 e Opus 4.8?
Opus 4.8 offre un giudizio più affilato, una maggiore onestà nel riconoscere i propri limiti e nuove funzioni come i workflow dinamici e il controllo dell’impegno.
Quanto costa Claude Opus 4.8?
Il prezzo standard rimane di $5/milione di token in input e $25/milione in output, mentre la modalità veloce costa il doppio.
Cos’è il Project Glasswing?
È un’iniziativa di ricerca per sviluppare modelli di classe superiore (come Mythos) con salvaguardie specifiche per la cybersicurezza.

Fonti e riferimenti

  1. Claude Opus 4.8 System Card
  2. Introducing Dynamic Workflows in Claude Code
  3. Project Glasswing: Initial Update