Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.

iTechGuides is reader-supported. When you buy through links on our site, we may earn an affiliate commission. As an Amazon Associate I earn from qualifying purchases. Learn more

L’harness engineering è la progettazione del software e dell’ambiente che permettono a un modello AI di agire, usare strumenti, mantenere lo stato e verificare i risultati. Non è una formula di prompt: comprende il ciclo operativo dell’agente, il runtime, le regole, la memoria e i controlli. Le fonti di Anthropic e OpenAI mostrano come l’attenzione si sia estesa dagli strumenti essenziali alla gestione dei compiti lunghi, fino alla valutazione e all’architettura dell’intero sistema.

Che cos’è l’harness engineering?

Un modello genera risposte; un agente deve anche compiere azioni e capire se hanno raggiunto l’obiettivo. L’harness è il software di scaffolding che rende possibile questo lavoro: gestisce il loop tra modello e strumenti, fornisce il contesto, applica guardrail e collega l’agente all’ambiente operativo.

La definizione può allargarsi a seconda del sistema. Nella documentazione OpenAI sull’Agents API, l’architettura distingue tre parti: l’harness, che esegue il loop del modello e degli strumenti; l’ambiente, dove si lanciano comandi o si gestiscono file; e il server applicativo, che invia i compiti e riceve eventi o risultati. In un prodotto reale entrano inoltre autenticazione, sandbox, persistenza delle conversazioni, integrazioni e richieste di approvazione.

Free tools Windows power users keep installed

One-click scans. No signup required.

Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.

La conseguenza pratica è importante: le prestazioni di un agente dipendono dal modello e dal sistema che gli consente di agire e controllare il proprio lavoro. Una risposta che afferma «fatto» non dimostra da sola che il file, il codice o lo stato richiesti esistano davvero.

Come si è evoluto il lavoro sull’harness?

Strumenti familiari prima delle astrazioni

Un approccio documentato da Anthropic parte da strumenti generali che il modello sa già utilizzare, come una shell e un editor di testo, e li compone quando serve in capacità più ampie. Skills, chiamate programmatiche agli strumenti e memoria possono essere costruite sopra primitive semplici. Il criterio non è usare sempre meno strumenti: è aggiungere complessità solo quando risolve un limite osservabile.

Anthropic riferisce che Claude 3.5 Sonnet raggiunse il 49% su SWE-bench Verified alla fine del 2024 utilizzando bash e un editor di testo. È un risultato circoscritto a quel modello, benchmark e periodo, non una misura generale dell’efficacia di un harness né una previsione delle prestazioni attuali. Leggi la guida Anthropic sul design degli harness.

Compiti lunghi e stato tra sessioni

Un agente che riprende il lavoro senza memoria può cercare di fare troppo in una volta o scambiare un’implementazione parziale per un progetto concluso. Nel novembre 2025 Anthropic ha descritto una sequenza in cui un agente inizializzatore prepara script, log dei progressi e un commit iniziale; sessioni successive implementano funzionalità per incrementi e lasciano aggiornamenti strutturati.

Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.

Lo stato utile non è una cronaca prolissa. Deve permettere alla sessione successiva di distinguere ciò che è completato, ciò che resta da fare, i test eseguiti e gli eventuali problemi aperti. Anthropic illustra questo approccio per gli agenti di lunga durata.

Compaction o reset con handoff?

La compaction riassume la cronologia e prosegue nella stessa sessione; il reset avvia invece un agente con contesto pulito e trasferisce lo stato tramite un artefatto di handoff. Nel marzo 2026 Anthropic ha discusso il reset come possibile risposta alla perdita di coerenza e alla “context anxiety”, cioè la tendenza a comprimere o accelerare il lavoro quando il contesto disponibile si riduce.

Approccio Continuità Trade-off documentati
Compaction La sessione continua dopo la sintesi della cronologia. Il riassunto non garantisce un passaggio di consegne chiaro: possono perdersi dettagli o istruzioni.
Reset con handoff Una nuova sessione riparte da un artefatto di stato esplicito. Può ridurre alcuni problemi di coerenza, ma aggiunge complessità di orchestrazione, token e latenza.

Non esiste un benchmark universale che stabilisca quale strategia sia migliore. La scelta dipende dalla durata del compito, da quanto è importante preservare dettagli e dal costo accettabile di avviare e coordinare sessioni aggiuntive. Anthropic descrive reset e handoff nello sviluppo di applicazioni di lunga durata.

Il repository diventa parte dell’interfaccia dell’agente

Nell’esperimento interno di OpenAI pubblicato nel 2026, l’ambiente di sviluppo è stato organizzato per rendere il compito leggibile, verificabile e correggibile: repository strutturato, documentazione indicizzata, regole architetturali, strumenti di test, osservabilità e controlli ricorrenti. Quando l’agente fallisce, la correzione può consistere nel rendere disponibile una capacità, uno strumento o una regola mancante in modo che sia accessibile e verificabile.

What’s actually slowing this PC down?

Pick the symptom - the matching free tool is one click away.

Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.

OpenAI riferisce che il proprio livello di autonomia dipendeva fortemente dalla struttura e dagli strumenti specifici del repository e avverte che il risultato non va generalizzato senza investimenti simili. L’azienda ha descritto una filosofia di merge con meno gate bloccanti nel contesto di quell’esperimento ad alta produttività; non è una raccomandazione universale per progetti in cui un errore ha costi o rischi diversi. Leggi il resoconto di OpenAI sull’harness engineering.

L’harness di prodotto gestisce anche eventi e persistenza

Per un agente integrato in un’applicazione, il ciclo non termina con la chiamata al modello. Il client può dover rappresentare molte azioni intermedie prodotte da un singolo prompt, gestire eventi, conservare le conversazioni e richiedere approvazioni. L’articolo OpenAI sull’App Server Codex mostra come persistenza, autenticazione, sandbox e integrazioni facciano parte dell’infrastruttura necessaria per un prodotto agentico. Approfondisci l’architettura dell’App Server Codex.

Quali strumenti e controlli servono per un agente affidabile?

La configurazione deve seguire il compito, non una ricetta fissa. L’architettura OpenAI distingue diversi tipi di ambiente: alcune attività possono usare strumenti remoti; lavorare su file o fare calcoli richiede un runtime; accedere a una rete privata o a software personalizzato può richiedere un ambiente gestito dall’applicazione.

Esigenza Scelta da valutare Trade-off
Compiti svolgibili con servizi accessibili via strumenti remoti Strumenti remoti Possono semplificare l’integrazione; non sostituiscono un runtime quando servono file o calcolo locale.
Modifiche a file o esecuzione di calcoli e test Runtime con accesso agli strumenti necessari Offre un luogo in cui operare e verificare; richiede di configurare e controllare l’ambiente.
Accesso a rete privata o software specifico Ambiente gestito dall’applicazione Permette di integrare risorse personalizzate, con maggiore onere operativo.

Qualunque sia l’ambiente, prepara prima di assegnare un risultato ampio: organizza il progetto, rendi disponibili script ripetibili e scrivi istruzioni che si possano controllare. Suddividi il lavoro in incrementi verificabili, registra azioni ed esiti e lascia uno stato strutturato quando una sessione termina.

Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.

Per un agente di programmazione, non basta controllare la risposta finale. Le verifiche possono includere test, modifiche effettivamente presenti e altri segnali osservabili nell’ambiente. L’obiettivo è che un’altra persona o sessione possa verificare ciò che è successo senza affidarsi all’autovalutazione del modello.

La documentazione OpenAI sull’architettura degli agenti approfondisce la separazione fra harness, ambiente e server applicativo.

Come valutare un agente e il suo harness?

Un harness per le eval deve elaborare input, orchestrare le chiamate agli strumenti e restituire un risultato. Perciò una valutazione dell’agente misura il modello insieme all’harness, non il modello isolato. Anthropic raccomanda di considerare sia la traccia delle azioni sia lo stato finale dell’ambiente: una dichiarazione di successo nel testo non dimostra che l’obiettivo sia stato raggiunto.

Una valutazione ben costruita distingue gli elementi del test invece di ridurre tutto a un sì o no:

Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.
  • Compito: l’obiettivo assegnato all’agente.
  • Trial: una singola esecuzione del compito.
  • Grader: il metodo che giudica se i criteri sono stati soddisfatti.
  • Transcript: la traccia delle interazioni e delle azioni dell’agente.
  • Outcome: lo stato osservabile dell’ambiente alla fine.

Gli evaluator automatici devono essere calibrati sul compito: l’autovalutazione dell’agente può essere eccessivamente positiva, soprattutto in attività soggettive come il design. Una revisione umana può essere utile quando il criterio non si traduce bene in controlli oggettivi, ma non elimina la necessità di registrare la traccia e l’esito. Anthropic spiega come valutare gli agenti AI.

Independent reader supportYour contribution helps us test, update, and keep practical guides available for everyone.Support on Ko-Fi

Quali risultati pubblicati si possono interpretare con cautela?

I numeri aziendali aiutano a capire che cosa è stato riferito, ma non garantiscono che lo stesso risultato si ripeta in un altro team o repository.

Dato riportato Attribuzione e ambito
Circa un decimo del tempo rispetto alla scrittura manuale Stima dell’autore dell’esperimento interno OpenAI descritto nel 2026, non confronto indipendente.
Circa un milione di righe e circa 1.500 pull request unite in cinque mesi Conteggi riferiti da OpenAI al repository e all’esperimento descritti nel 2026.
3,5 pull request per ingegnere al giorno Media riportata da OpenAI per il periodo in cui tre ingegneri guidavano Codex; l’articolo dice che il team è poi cresciuto a sette persone e che la produttività è aumentata.
3 ore e 50 minuti e 124,70 dollari di costo token Durata e costo riportati da Anthropic per uno specifico esperimento del 2026 che generava una DAW nel browser, non un costo tipico dello sviluppo agentico.

Queste cifre descrivono esperimenti e contesti specifici. Non sono benchmark indipendenti che dimostrino un guadagno di produttività generalizzabile.

Come scegliere un approccio senza costruire più del necessario?

Quando valuti modifiche all’harness, tratta le sue assunzioni come ipotesi da riesaminare se cambiano modello, compito o livello di rischio. Un componente che aiuta un modello su un’attività difficile può diventare un costo inutile per un modello più capace o per un compito semplice.

Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.
  • Strumenti generali o orchestrazione personalizzata: parti da strumenti che il modello sa usare e aggiungi livelli specifici solo se risolvono un problema concreto; le astrazioni comportano manutenzione.
  • Ambiente gestito o runtime dedicato: scegli in base a file, calcolo, rete privata e software di cui il compito ha bisogno, tenendo conto dell’onere di gestire l’ambiente.
  • Compaction o reset: pesa continuità e rischio di perdita di dettagli contro token, latenza e complessità dell’handoff.
  • Valutazione automatica o revisione umana: privilegia controlli osservabili quando l’esito è misurabile; per giudizi soggettivi, calibra l’automazione e considera la revisione umana.
  • Guardrail e gate: rendili proporzionati al costo dell’errore. Una scelta adatta a un team specifico non diventa automaticamente una buona regola per ogni progetto.

Product prices and availability are accurate as of the date/time indicated and are subject to change. Any price and availability information displayed on Amazon at the time of purchase will apply.