Article GPT-6 e Microsoft Foundry: guida agli agenti AI in produzione

 

Articolo:

GPT-6 su Microsoft Foundry: portare gli agenti AI in produzione con una governance e un ROI che puoi misurare

 

 

By  Phil Hawkshaw / 8 Oct 2026  / Argomenti: Artificial Intelligence (AI)

Punti chiave
  • Porta l'AI di frontiera in produzione: i modelli GPT-6 Sol e Luna sono ora disponibili su Microsoft Foundry, consentendo alle aziende di creare e distribuire agenti AI autonomi e specializzati, progettati per compiti complessi.
  • Controlla i tuoi costi e la governance: passa da una spesa speculativa per l'AI a una chiara disciplina finanziaria. Usa le funzionalità integrate di Microsoft Foundry come il Model Router, i limiti di token e gli interruttori di sicurezza per evitare costi fuori controllo dovuti alla proliferazione degli agenti ("agent sprawl").
  • Misura il reale valore aziendale: usa il nuovo framework ROI per gli agenti per collegare direttamente i costi degli agenti ai risultati aziendali. In questo modo l'attenzione si sposta dal "costo per token" al più significativo "costo per attività".
  • Costruisci su fondamenta enterprise-ready: distribuisci questi modelli di AI avanzati in zone dati sicure dell'UE per soddisfare i requisiti del GDPR e di residenza dei dati su fondamenta di Azure robuste e gestite da esperti.

All’inizio di quest'anno un CxO mi ha detto che la spesa per l'AI ha superato il cloud come voce in più rapida crescita nel suo budget tecnologico. Quasi nulla era stato pianificato. Erano token: centinaia di milioni di chiamate a modelli di frontiera, in esecuzione in flussi di lavoro che nessuno stava davvero monitorando.

Il 22 settembre, Microsoft ha reso GPT-6 Sol e GPT-6 Luna generalmente disponibili in Microsoft Foundry, affiancandoli a GPT-6 Astra. Si tratta di un rilascio importante, che rende quella conversazione più facile da affrontare e più facile da sbagliare. Più facile, perché la fascia di prezzo tra i tre modelli è abbastanza ampia da modificare la maggior parte delle fatture. Più facile da sbagliare, perché il listino prezzi è solo una piccola parte di ciò che determina se un agente raggiunge la produzione e vi rimane.

Panoramica dell'insight

Cos'è Microsoft Foundry?

Foundry Agent Service è una piattaforma gestita per creare, connettere e scalare agenti intelligenti in modo aperto, integrato ed enterprise-ready. Ti consente di portare il tuo framework e modello preferiti, distribuendoli con un singolo comando su un runtime gestito con isolamento delle sessioni, identità nativa e osservabilità integrata.

I modelli Direct from Azure, come GPT-6 Astra, vengono acquistati e gestiti direttamente tramite Azure con un'unica licenza, un supporto coerente e nessuna dipendenza da terze parti. Includono fatturazione unificata, governance e portabilità della PTU tra i modelli, il tutto all'interno di Microsoft Foundry.

Il rilascio: tre modelli, un divario di prezzo di cento volte

Microsoft posiziona Astra per il ragionamento complesso, l'ingegneria del software e l'uso del computer, Sol per attività di produzione generali e Luna per l'estrazione, la sintesi e l'instradamento di grandi volumi. Tutti e tre sono disponibili come distribuzioni Standard nelle Data Zone dell'UE e degli Stati Uniti, oltre che a livello globale. Questi sono i prezzi per la Data Zone dell'UE:

Confronto prezzi

GPT-6 Astra vs. Sol vs. Luna

Metrica GPT-6 Astra GPT-6 Sol GPT-6 Luna
Input, per milione di token $12.00 $2.40 $0.12
Output, per milione di token $60.00 $12.00 $0.60

Astra costa 100 volte rispetto a Luna, sia in input che in output. Sol si attesta a un quinto di Astra. A titolo illustrativo, considera un passaggio che legge 2.000 token e ne scrive 300. A questi prezzi, costa circa 0,042 \$ con Astra, 0,0084 \$ con Sol e 0,0004 \$ con Luna. Eseguilo 100.000 volte al mese e la fattura sarà di circa 4.200 \$, 840 \$ o 42 \$.

Ho visto questo stesso principio all'opera nella nostra divisione di ingegneria. Abbiamo analizzato circa 90.000 documenti contrattuali del governo del Regno Unito su quattro GPU on-premise. Un agente di codifica di frontiera ha scritto la pipeline. Modelli più piccoli in esecuzione sul nostro hardware si sono occupati di tutta la lettura. Questa architettura è stata dettata da restrizioni sui dati piuttosto che dal costo, ma presenta la stessa struttura: il modello costoso si occupa del ragionamento laddove necessario, mentre quelli più economici gestiscono il volume.

Costo per attività: la misura giusta, ma incompleta

Le indicazioni di Microsoft invitano a guardare oltre il prezzo per token e a comprendere il costo per attività. Concordo con questa visione e farei un ulteriore passo avanti, perché il costo di un'attività è composto da tre parti: token, elaborazione (compute) e la supervisione umana circostante. I token compaiono in fattura. La supervisione di solito no.

Un modello più economico che invia una parte maggiore del suo output a una persona per la correzione può costare di più per attività completata rispetto a uno più costoso, una volta calcolato il tempo di quella persona. Allo stesso modo, un'attività eseguita a basso costo e in modo corretto può comunque essere un'attività di cui nessuno aveva bisogno. Il costo per attività ti dice quanto costa un'attività. Non ti dice se il risultato per il cliente sia migliorato, ed è questa la domanda che un CFO finirà per porsi.

Rispondere a questa domanda richiede molto più di un buon router di modelli. Richiede una struttura attorno agli agenti.

La struttura: quattro parti, e il modello risiede in una di esse

Al centro dell'AI Centric Enterprise Architecture Framework di Insight c'è un'immagine semplice, un portale di pietra simile a quelli di Stonehenge: due pilastri verticali, un architrave appoggiato sopra e il terreno su cui poggiano tutti e tre gli elementi. Ogni parte sostiene un peso e ognuna ha un compito diverso.

Insight AI Centric Enterprise Architecture Framework

Un pilastro è la tecnologia: l'ambiente tecnologico su cui operano gli agenti, dall'infrastruttura fino all'esperienza utente. Foundry, Azure e Agent 365 si trovano qui, e sono solidi montanti. L'altro pilastro è il business: i ruoli e il processo, ovvero chi esegue il lavoro, chi ne è responsabile e come cambia il lavoro man mano che l'AI ne assume una parte maggiore. La governance è l'architrave che unisce entrambi, determinando cosa viene creato, chi ne è il proprietario e ciò che ciascuna funzionalità è autorizzata a fare. Le fondamenta sono la conoscenza: una descrizione formale di ciò che l'organizzazione sa, a cui ogni agente accede per arrivare ai dati sottostanti.

In molte delle conversazioni che ho, l'impegno si è concentrato innanzitutto sul pilastro tecnologico. Questo è comprensibile, perché è lì che si concentrano le dimostrazioni. Ma la maggior parte di ciò che determina un risultato in produzione risiede negli altri tre. Quattro domande ti mostrano dove.

01

Chi risponde di ciascun agente?

+

Un agente ricopre un ruolo, non è semplicemente un elemento tecnologico. Ha una descrizione delle mansioni, una posizione all'interno dell'organizzazione e una serie di responsabilità, sia che operi in modalità headless all'interno di un processo, sia che affianchi una persona come copilot. La domanda è se l'azienda abbia definito chiaramente questi aspetti o se abbia lasciato che chi ha creato l'agente li deducesse. Un piano di controllo (control plane) ti permette di vedere quali agenti esistono e a cosa possono accedere. Indicare la persona responsabile di ciascuno di essi è una decisione di business, e tale responsabilità deve rimanere umana a qualsiasi livello di autonomia.

02

Quanta autonomia ha guadagnato ogni passaggio?

+

Può essere utile collocare ogni passaggio che coinvolge l'AI su una scala a cinque punti. A un estremo, l'AI non interviene. Al livello successivo, la persona esegue il lavoro e usa l'AI come strumento. Al centro, l'AI esegue autonomamente alcuni passaggi, mentre una persona continua a coordinare e a risolvere i problemi. Più avanti, l'AI coordina un mix di risorse umane e di AI. All'altro estremo, le persone intervengono solo in caso di guasto o errore. Questi livelli si differenziano per i compiti gestiti dall'AI, non per il soggetto responsabile.

Un passaggio avanza di un livello solo quando la prontezza aziendale e quella tecnologica sono dimostrate congiuntamente: qualità comprovata, una modalità di gestione degli errori accettabile, una pista di controllo (audit trail), regole di escalation testate e l'approvazione del team responsabile del risultato finale. Il tempo trascorso non costituisce una condizione. Un passaggio può anche tornare indietro, e questo dimostra il corretto funzionamento del sistema, non un suo fallimento. Le funzionalità di valutazione e tracciamento di Foundry forniscono gran parte delle prove necessarie. Decidere se tali prove siano sufficienti rimane una scelta di business, e gran parte del "purgatorio dei progetti pilota" deriva dal fatto che nessuno ha definito cosa significhi essere pronti.

03

Cosa sa l'agente?

+

Qualsiasi concorrente può acquistare GPT-6 lo stesso giorno e allo stesso prezzo rispetto a te. Ciò che non può comprare è una descrizione formale di cosa significhi "cliente" per la tua azienda, quali regole disciplinino un contratto e quale fonte sia autorevole per stabilire un prezzo. Un agente agisce in base a qualunque informazione recuperi. Laddove non sia stata designata una fonte autorevole, l'agente potrebbe recuperare una definizione superata e agire di conseguenza con la stessa identica sicurezza che mostrerebbe se la definizione fosse corretta. I modelli si comprano. La comprensione si costruisce.

04

Dove risiedono i dati e chi lo ha stabilito?

+

La residenza dei dati (data residency) è un ottimo esempio di decisione che ha un prezzo. I prezzi della Data Zone UE sopra indicati sono superiori del 20% rispetto allo Standard Globale per tutti e tre i modelli. Laddove normative come GDPR, NIS2 o DORA richiedano l'elaborazione all'interno dell'UE, si tratta di un costo che vale la pena sostenere. Quando invece la scelta è dettata da una preferenza piuttosto che da una regola, merita una motivazione chiara e un responsabile designato. Trattare ogni carico di lavoro come obbligatorio significa pagare un sovrapprezzo non necessario. Non considerarne nessuno come obbligatorio significa scoprire un requisito di residenza dei dati solo dopo lo sviluppo del progetto. Il nostro articolo su sovranità del cloud e conformità in Europa approfondisce l'aspetto normativo.

Cosa fa Insight: partire da ciò che è già in esecuzione

La prima conversazione riguarda raramente un nuovo modello. Riguarda ciò che è già in esecuzione: agenti che un team ha creato lo scorso trimestre, funzionalità AI attivate all'interno di software acquistati dall'organizzazione anni fa, strumenti adottati senza che a nessuno venisse chiesto nulla. Iniziamo individuandoli, collocando ogni passaggio su quella scala e nominando un responsabile.

Da qui, Insight supporta il percorso dalla sperimentazione alla produzione a tappe, partendo dal nostro AI Centric Enterprise Architecture Framework e attingendo ai nostri Agentic Enterprise Accelerators. La prontezza aziendale e tecnologica vengono verificate insieme prima di qualsiasi avanzamento:

  • Scegliere i modelli in base alle prove. Valutiamo Astra, Sol e Luna rispetto alle attività specifiche dell'organizzazione in Foundry e creiamo una proiezione dei costi per ciascun caso d'uso che includa la supervisione umana.
  • Dimostrare l'efficacia prima di scalare. Le nuove funzionalità vengono inizialmente eseguite in parallelo al processo esistente, in modo che il confronto venga effettuato sui casi reali dell'organizzazione prima di qualsiasi passaggio di consegne.
  • Concordare su cosa gli agenti possano fare affidamento. Prima di indirizzare gli agenti verso i dati, collaboriamo con il business per stabilire quali fonti siano autorevoli e come vengano definiti i termini specifici dell'organizzazione. I nostri Agentic Enterprise Accelerators aiutano a costruire quella descrizione condivisa dell'organizzazione, in modo che gli agenti vi siano ancorati.
  • Scegliere cosa sviluppare per primo. Aiutiamo la leadership a classificare i casi d'uso in base a valore, fattibilità e riutilizzabilità, poiché la stessa funzionalità viene spesso richiesta da tre funzioni diverse con tre vocabolari differenti, finendo per essere sviluppata tre volte. Gli acceleratori supportano tale prioritizzazione e il rilascio regolamentato che ne consegue.
  • Gestire la governance dell'ambiente Microsoft. In qualità di Microsoft Day 1 Launch Partner per Agent 365, Insight aiuta le organizzazioni a configurare e gestire le fondamenta di Azure, Foundry e Agent 365 su cui si basa tutto questo, incluse le scelte relative a region e residenza dei dati.

Nulla di tutto questo sostituisce ciò che Microsoft ha creato. Il Model Router, i limiti di token e i guardrail di Foundry sono i controlli corretti per il pilastro tecnologico, e noi li configuriamo come tali. Il resto della struttura è ciò che conferisce un reale significato a questi controlli per il business. Se stai ancora decidendo da dove iniziare, la nostra guida su come colmare il divario di implementazione dell'AI è un ottimo punto di partenza.

Cambio di prospettiva: stesso modello, risultato diverso

GPT-6 sarà disponibile per i tuoi concorrenti lo stesso giorno, tramite la stessa piattaforma e allo stesso prezzo. Non sarà il modello a differenziare gli agenti di un'organizzazione da quelli di un'altra. A farlo saranno il responsabile, le prove, l'ancoraggio e le decisioni su dove risiedono i dati.

Se i tuoi agenti sono ancora fermi alle sole potenzialità mostrate in fase di demo, questo è il punto di partenza ideale per parlarne insieme.

Headshot of Stream Author

Phil Hawkshaw

CTO EMEA, Insight