cobrain
Blog · 10 ottobre 2026 · 7 min

Come ridurre i token in Claude Code (con le misure)

Cosa entra nel contesto di Claude Code a ogni turno, i comandi che lo riducono (/context, /clear, /compact), tool search MCP, CLAUDE.md e le nostre misure.

«Limite di utilizzo raggiunto» a metà di un refactoring la prima volta dà fastidio, alla terza costa. La maggior parte dei token che spende Claude Code non sono parole tue. Sono quello che viaggia insieme a loro: istruzioni, cronologia, file, risultati degli strumenti. Per spendere meno bisogna sapere cosa c'è dentro.

Qui vediamo cosa entra nel contesto di Claude Code a ogni turno, i comandi e le impostazioni ufficiali che lo tengono piccolo, e poi quello che abbiamo misurato sul nostro lavoro, con un metodo che puoi rifare. Tutto quello che diciamo su Claude Code viene da code.claude.com e support.claude.com, letti il 10 ottobre 2026.

Cosa manda Claude Code a ogni turno

Prima ancora che tu scriva, nel contesto ci sono già il system prompt, i dati dell'ambiente (cartella di lavoro, sistema, stato di git), i tuoi CLAUDE.md con quello che importano con @percorso, le prime 200 righe o 25 KB della memoria automatica, una riga di descrizione per ogni skill, e i nomi degli strumenti MCP con le istruzioni di ogni server.

Poi la sessione cresce. Ogni file che Claude legge, ogni output di un comando e ogni risultato di uno strumento resta nella conversazione, e Claude Code manda la conversazione intera a ogni richiesta. Quando Claude usa uno strumento parte un'altra richiesta, che si porta dietro di nuovo tutto. La pagina di assistenza di Anthropic elenca cosa si rimanda a ogni turno: la conversazione fatta fin lì, il CLAUDE.md, i file che Claude ha letto e il tuo nuovo messaggio.

La cache dei prompt rende tutto questo più economico: Claude Code rilegge la cronologia alla tariffa dei token in cache, non a quella piena. Però la cache scade: dopo un'ora con un abbonamento, dopo cinque minuti quando consumi crediti di utilizzo o usi una chiave API. Il primo messaggio dopo una pausa lunga rielabora tutto. Così una domanda di una riga, in una sessione aperta da stamattina, paga per tutta la giornata.

I comandi che tengono piccolo il contesto

/context mostra cosa occupa spazio in quel momento, come una griglia divisa per categorie, con dei suggerimenti. Si parte da qui.

/usage (alias /cost) mostra le barre dei limiti del piano. Su Pro, Max, Team ed Enterprise dice anche cosa ha pesato: skill, subagent, plugin e ogni singolo server MCP, in percentuale sul totale.

/clear apre una conversazione nuova con il contesto vuoto. Usalo fra un lavoro e l'altro, perché la cronologia vecchia costa token a ogni messaggio successivo. Non costa niente. Se vuoi ritrovare la sessione con /resume, prima dalle un nome con /rename.

/compact riassume la conversazione e va avanti, e puoi dirgli cosa tenere: /compact concentrati sul bug di autenticazione. Però per riassumere legge tutta la conversazione: su un contesto grande è una richiesta grande. Se la continuità non ti serve, /clear costa meno.

/model cambia modello. Il consiglio di Anthropic: Sonnet per la maggior parte del codice, Opus per l'architettura difficile e i ragionamenti in più passaggi, Haiku per i compiti semplici dei subagent. Cambiare a metà sessione ha un prezzo: ogni modello ha la sua cache, e la richiesta dopo rilegge tutta la cronologia senza cache.

/effort abbassa lo sforzo di ragionamento per i lavori semplici (i token di ragionamento si pagano come output). Sulla maggior parte dei modelli cambiarlo a metà sessione invalida la cache, ma non sui 5.5 e su Fable 5.1, dove però il ragionamento non si spegne.

Due abitudini dalle stesse pagine: affida i lavori verbosi, come far girare i test o scavare nei log, a un subagent, così torna indietro solo il suo riassunto; e indica i file per percorso invece di incollarli.

Ogni strumento MCP ha una definizione: nome, descrizione, schema dei parametri. Senza tool search si caricano tutte all'inizio di ogni sessione. Claude Code invece di default le rimanda: nel contesto entrano solo i nomi degli strumenti e le istruzioni dei server, e Claude carica la definizione completa di uno strumento quando gli serve.

Si cambia con ENABLE_TOOL_SEARCH. Con auto le definizioni si caricano subito finché in tutto restano sotto il 10% della finestra di contesto, e vengono rimandate quando arrivano al 10%. auto:N fissa una percentuale tua, false carica tutto subito. Claude Code inoltre taglia di default a 2.048 caratteri la descrizione di ogni strumento e le istruzioni di ogni server.

Un connettore comunque non è gratis. Nomi e istruzioni stanno nel contesto dal primo turno, e ogni definizione che Claude carica, insieme a ogni risultato che riceve, finisce nella cronologia che si rimanda. In /mcp spegni i server che non usi. Dove c'è un buon strumento da riga di comando (gh, aws), la documentazione dice che la CLI occupa meno contesto.

Quando il CLAUDE.md è troppo lungo

Il CLAUDE.md si carica per intero all'inizio di ogni sessione, e di nuovo dopo /clear o /compact. Anthropic consiglia di restare sotto le 200 righe per file, perché i file più lunghi occupano più contesto e vengono seguiti peggio. Le istruzioni per un solo flusso di lavoro, come le revisioni delle PR o le migrazioni del database, vanno in una skill, che si carica solo quando serve.

Le righe però sono una misura sbagliata. Quando abbiamo scritto CLAUDE.md e AGENTS.md, a settembre, il CLAUDE.md del repository di Cobrain aveva 51 righe e pesava 43 KB, perché ogni riga è un paragrafo. Il 10 ottobre ha 75 righe e pesa 65 KB. Sotto le 200 righe, e tutto nel contesto a ogni turno. Noi non l'abbiamo ancora sistemato. Guarda i byte, non le righe.

Cosa abbiamo misurato

Volevamo i numeri di Claude, non stime. Claude Code tiene il transcript di ogni sessione in ~/.claude/projects/<progetto>/*.jsonl. Ogni risposta dell'assistente registra il suo usage: input_tokens, cache_creation_input_tokens e cache_read_input_tokens, che sommati danno l'input completo di quella richiesta. Quando fra due risposte consecutive c'è un solo risultato di uno strumento, i suoi token sono circa l'input della seconda, meno l'input della prima, meno l'output della prima. Lo metti accanto alla lunghezza del testo del risultato e ottieni quanti caratteri conta Claude per token, gratis. L'errore che resta sono pochi token di involucro attorno al risultato. L'abbiamo fatto su 258 conversazioni vere, con la controprova del contatore di OpenAI.

Sulle nostre note, in italiano e Markdown, Claude conta circa 2 caratteri per token, circa 1,58 volte i token che dà il contatore di OpenAI sugli stessi testi.

Poi abbiamo preso un progetto vero del nostro brain: Cobrain stesso, 134 note. Dare a Claude Code per intero, all'inizio di ogni chat, i file che quel progetto dichiara sempre necessari (scheda, indice, decisioni) fa circa 69.400 token. Il riepilogo di apertura di Cobrain sullo stesso progetto è di 4.700 token. Collegare Cobrain aggiunge anche un peso fisso di circa 5.200 token, le definizioni dei suoi strumenti. Questo l'abbiamo misurato con /context, con il tool search spento perché entrino tutte le definizioni, confrontando il totale con Cobrain acceso e spento. Con il tool search all'inizio ne entra meno, ma noi lo contiamo tutto.

Quindi il primo messaggio è 69.400 token contro circa 9.900, cioè 7 volte meno. Su una chat di lavoro intera (35 chat vere dello stesso progetto, con tutte le note lette) la mediana è 2,9 volte meno. Se conti che il modello rilegge il contesto a ogni risposta, è 3,6 volte meno.

In 4 chat su 35 Cobrain ha portato più del caso «senza». Erano chat che aprivano molte note, note che a Claude Code sarebbero servite lo stesso. I dettagli sono nei costi di contesto.

Dove entra Cobrain

Cobrain è una memoria in Markdown, in cartelle vere, che Claude Code legge e scrive via MCP. Invece di un CLAUDE.md che cresce a ogni decisione, ci tieni due righe: carica il progetto con start_session, scrivi le decisioni nuove nel brain. Claude Code poi cerca e apre solo le note che gli servono, e le stesse note funzionano dall'app di Claude, da ChatGPT e da Codex. La guida per Claude Code richiede pochi minuti, e per provarlo basta il piano gratuito.

Domande rapide

Come si risparmiano token in Claude Code? Con /context vedi cosa è caricato, con /clear riparti fra lavori diversi, in /mcp spegni i server che non usi. Tieni corto il CLAUDE.md, scegli il modello adatto al compito e affida i lavori verbosi ai subagent.

Per risparmiare token è meglio /compact o /clear? /clear non costa niente e svuota il contesto. /compact tiene un riassunto, ma per scriverlo legge tutta la conversazione, e su una sessione lunga è una richiesta grande.

Quanto deve essere lungo il CLAUDE.md? Anthropic consiglia meno di 200 righe. Guarda anche il peso in byte: il file si carica per intero a ogni sessione, e le righe lunghe si sommano.

I server MCP consumano token in Claude Code? Sì. Con il tool search, attivo di default, nomi degli strumenti e istruzioni dei server si caricano all'inizio e le definizioni complete quando servono. I loro risultati restano nella conversazione.

Cosa vuol dire «limite di utilizzo raggiunto» in Claude Code? Hai raggiunto il limite di sessione di 5 ore o il limite settimanale, che dividi con l'app di Claude. Cambiare modello lì non aiuta. Il messaggio dice quando si azzera.

Gratis, senza carta

Comincia da una nota sola.

È gratis e non serve la carta. Entri con un link via email, colleghi la tua AI e inizi a costruire una memoria che non resta chiusa in una chat.

Crea il tuo brain, è gratisEntra nel tuo brainMille note, tutte le AI che vuoi collegare.