Il contesto è la parte della spesa che cresce di più senza che nessuno lo decida. Nessuno approva “paghiamo il triplo”: si aggiunge un documento al prompt, poi un altro, e la fattura sale. Ogni token di contesto si paga a ogni richiesta, ed è questo che trasforma una finestra lunga in un problema di costo.

Perché costa caro

Un modello non ricorda nulla tra una richiesta e l’altra. Tutto ciò che vuoi che sappia —istruzioni, esempi, cronologia, documenti— viaggia di nuovo a ogni richiesta e viene fatturato di nuovo. Se il tuo prompt porta 20.000 token di contesto e fai 50.000 richieste al mese, paghi un miliardo di token di ingresso solo per il contesto, qualunque sia la risposta.

Le tre perdite tipiche

PerditaChe cosa la causaCome si corregge
Cronologia completaSi rinvia tutta la conversazione a ogni turnoRiassumere i turni vecchi e inviare solo i recenti
Documenti interiSi allega il PDF completo “per sicurezza”Recuperare solo i frammenti rilevanti
Prompt di sistema gonfioIstruzioni che si accumulano e non si potano maiRiscriverlo e misurare se la qualità cala

Recuperare invece di allegare

La correzione strutturale è non mettere il corpus nel prompt. Si indicizzano i documenti, si recuperano i tre o quattro frammenti che rispondono alla domanda e si inviano solo quelli. La qualità di solito sale —meno rumore— e il contesto scende di un ordine di grandezza. Lo sviluppiamo in RAG, fine-tuning e contesto.

Che cosa conviene tenere lungo

Non ogni taglio è buono. Le istruzioni stabili e gli esempi che fissano il formato sono cari da togliere ed economici da mantenere se usi il prompt caching: il blocco fisso va in cache e si paga a una frazione. La regola pratica è contesto fisso e in cache in alto, contesto variabile e minimo in basso.

Mettici un numero

Prima di ridisegnare qualsiasi cosa, misura. Inserisci i tuoi token di ingresso attuali e il tuo volume nel calcolatore di costo dei token e confronta lo stesso lavoro con metà contesto: vedrai la differenza mensile di colpo. E segui il costo per attività prima e dopo per confermare che la qualità non è calata.

Domande frequenti

Perché il contesto lungo aumenta tanto il costo? Perché il contesto viene inviato e fatturato a ogni richiesta. Un prompt grande non si paga una volta: si paga tante volte quante richieste fai.

Quanto contesto è troppo? Non c’è un numero assoluto. Il segnale è la proporzione: se i token di ingresso superano di molto quelli di uscita e buona parte sono documenti o cronologia, hai margine.

Ridurre il contesto peggiora le risposte? Spesso le migliora, perché il modello smette di competere con informazione irrilevante. Quello che non si può fare è tagliare senza misurare il costo per attività e la qualità prima e dopo.


In e-ficient misuriamo il costo per attività di aziende che hanno già l’IA in produzione e ti diciamo quanto risparmieresti con ogni leva al tuo volume reale. Il primo audit è gratuito se attivi un piano con impegno di tre mesi e restituisce una diagnosi in 72 ore.