Il cervello non basta: perché l'harness fa la differenza nell'AI

Spesso si sente dire "usa Claude Code" oppure "usa Codex". Come se il nome dello strumento fosse la variabile decisiva. In realta` il risultato dipende da due fattori che lavorano insieme: il modello (il cervello) e l'harness (l'ecosistema che lo circonda). Ship Harness Bench mostra come lo stesso modello LLM può avere output molto diversi a seconda dell'harness usato.

L'harness e l'insieme di tool, permessi, gestione della memoria, strategie di compaction del contesto e loop di esecuzione che permettono al modello di ragionare nel modo migliore possibile. Il modello e la mente. L'harness e` il laboratorio.

Cosa si intende per harness

Harness engineering e un termine nato nel 2026 per descrivere la progettazione dell'infrastruttura completa che circonda un agente LLM. Non e solo il prompt. E il sistema che decide cosa vede il modello, quali tool puo usare, come gestisce gli errori e quando fermarsi.

Uno studio recente di Atlan lo mette cosi: "Nel 2026 la performance dei modelli si e stabilizzata. I modelli di frontiera sono cosi vicini tra loro che la scelta del modello raramente e il collo di bottiglia. La differenza si sposta sul layer che avvolge il modello: l'harness."

La differenza non e teorica. E misurabile.

Il caso DeepSeek V4 Flash 0731

DeepSeek V4 Flash 0731 e` un modello Mixture-of-Experts con 284 miliardi di parametri totali (13 miliardi attivi). Costo: circa 0.14 dollari per milione di token in input. Un cervello economico e sorprendentemente potente.

Lo stesso modello, testato in harness diversi come jcode, Codex e OpenCode, produce risultati profondamente diversi. Perche`?

Perche l'harness cambia tutto: quanti tool il modello puo invocare, come vengono gestiti i permessi, come viene compresso il contesto quando la finestra si riempie, come vengono concatenati i passaggi multipli. Il modello e` identico. Il sistema attorno no.

Le quattro layer dell'ingegneria agente

Un articolo di ExplainX chiarisce bene la gerarchia. Ci sono quattro layer, non uno solo.

Prompt engineering e il livello piu semplice. Come formuli il messaggio. Una singola chiamata.

Context engineering e il pacchetto completo che il modello vede ad ogni chiamata: prompt, documenti recuperati, storia della conversazione, definizioni degli tool. [Andrej Karpathy](https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents) ha reso popolare il termine nel 2025: la parte difficile non e il messaggio intelligente, e` curare cosa riempie la finestra di contesto.

Loop engineering e il flusso autonomo: cosa avvia l'esecuzione, qual e l'obiettivo verificabile, come si sa che il task e` completato.

Harness engineering e` il livello che implementa tutto il resto: il sandbox dove gira il codice, i retry, i checkpoint, i controlli di sicurezza, la gestione dei permessi.

"Il cervello dell'AI dovrebbe essere considerato come l'intero sistema cibernetico di loop di feedback che unisce il LLM al suo harness, perche l'harness puo fare tanta differenza quanto i miglioramenti al modello stesso." — discussione su Hacker News, citata da Atlan

Perche` lo stesso modello performa diversamente

Un paper di Meta del marzo 2026 introduce il concetto di Meta-Harness: un sistema che cerca automaticamente il miglior codice harness per un dato task. I risultati sono eloquenti.

Su classificazione del testo, il Meta-Harness migliora di 7.7 punti rispetto a un sistema di gestione del contesto all'avanguardia, usando 4 volte meno token. Su problemi matematici di livello IMO, un singolo harness trovato migliora l'accuratezza di 4.7 punti in media su cinque modelli diversi.

Stesso modello. Diverso harness. Risultati completamente diversi.

Cosa cambia nella pratica

Quando usi Claude Code, stai usando un harness ottimizzato da Anthropic per i suoi modelli. 40 strumenti danno al modello le mani per interagire con il filesystem, eseguire comandi, leggere e scrivere file. Il sistema di permessi lo impedisce di rompere cose. Le strategie di compaction gli impediscono di dimenticare cosa stava facendo.

Codex, dal canto suo, integra nativamente con GitHub, Slack e l'ecosistema ChatGPT. Il codice e` in Rust, ha sandbox cloud per lavoro asincrono, e si appoggia su GPT-5.4.

OpenCode e [open source, model-agnostic, zero vendor lock-in](https://opencode.ai/). 150.000+ stelle su GitHub, supporto per 75+ provider. Ma paghi la flessibilita con overhead di configurazione e velocita piu bassa.

Il problema del context rot

C'e un fenomeno che rende l'harness ancora piu critico. Chroma Research lo chiama "context rot": la degradazione della qualita` dell'output man mano che la lunghezza dell'input cresce. Tutti i modelli testati degradano. Nessuna eccezione.

Il risultato piu` controintuitivo: i modelli performano meglio su testo mescolato che su testo coerente. Il testo coerente crea pattern posizionali forti, e il modello sviluppa un bias di recentezza, sovrappesando i passaggi finali e trascurando quelli iniziali.

Un buon harness gestisce questo problema. Ordina il contesto in modo intelligente, comprime le parti vecchie, mantiene solo il segnale rilevante.

La lezione

Non ha senso cercare il modello "migliore" in astratto. Ha senso costruire o scegliere un harness che permetta al modello di esprimersi al meglio.

Il futuro dell'AI coding non e scegliere tra Claude, GPT o DeepSeek. E capire che il cervello conta, ma il laboratorio conta altrettanto.