Brief — 24 luglio 2026

In breve

Giornata a tema "agenti che scrivono codice", ma vista dal lato dei limiti: un'analisi molto discussa sul perché le "software factory" senza revisione umana non reggono, uno studio empirico sulle vulnerabilità del codice generato da LLM, e due mosse infrastrutturali di GitHub (MCP stateless e agente cloud su Linear in GA). Poco altro di verificabile: diversi annunci vendor e un presunto "agente fuggito" ancora tutto da confermare.

Le notizie

Perché le "software factory" senza revisione umana non reggono

Fonte: HumanLayer (Dex), via Hacker News · link · Tier: 1 Cosa è successo: Un saggio molto ripreso (305 punti, 220 commenti su HN) sostiene che ingegnerizzare meglio l'"harness" degli agenti non basta a eliminare la revisione umana. L'argomento tecnico: l'RL con cui si addestrano i modelli di coding premia feedback binari e rapidi (i test passano o no), ma non penalizza il degrado di manutenibilità, che emerge su settimane o mesi. L'autore propone di spostare lo sforzo a monte — requisiti, architettura, design di programma, poi implementazione a fette verticali — invece che a valle sulla revisione. Perché conta: Offre un modello mentale usabile per decidere dove mettere il controllo umano in un flusso AI-assisted, e sposta la discussione da "quale tool/harness" a "cosa il modello non è addestrato a ottimizzare". Cautela: È un pezzo d'opinione, per quanto argomentato. I numeri citati sul peggioramento post-adozione (commenti di review +25%, incidenti per PR +242,7%, bug per sviluppatore +54%) provengono da un report di Faros AI — vendor che vende metriche di ingegneria — ripreso nel saggio; non ho verificato la metodologia sottostante.

Il codice generato da LLM è vulnerabile a prescindere dal modello

Fonte: arXiv cs.SE (preprint) · link · Tier: 3 Cosa è successo: Uno studio comparativo ha dato prompt identici a ChatGPT, Microsoft Copilot e Google Gemini su tre domini di automazione, poi ha classificato le vulnerabilità nel codice risultante con punteggi CVSS v3.1 e mappatura su OWASP Top 10 e MITRE ATT&CK. Secondo gli autori ogni script conteneva vulnerabilità sfruttabili, 9 classi di vulnerabilità su 17 comparivano in tutti e tre i modelli, e le differenze di punteggio CVSS tra piattaforme restavano sotto il 10%. La conclusione: il rischio segue la categoria di compito più che il tool specifico. Perché conta: Toglie forza all'idea di "scegliere il modello più sicuro": serve revisione di sicurezza obbligatoria su tutto il codice generato, qualunque sia lo strumento. Argomento concreto per chi definisce policy di code review. Cautela: È un preprint non ancora sottoposto a peer review; numeri e metodologia sono quelli dichiarati dagli autori.

GitHub porta il suo MCP Server alla nuova specifica "stateless"

Fonte: GitHub Changelog · link · Tier: 1 Cosa è successo: La prossima specifica MCP, con rilascio ufficiale annunciato per il 28 luglio 2026, elimina sessioni e handshake di initialize a favore di un core stateless. GitHub dichiara che il suo MCP Server la supporta già in anticipo: ha rimosso le sessioni Redis e la deep packet inspection (ora legge i valori per logging e secret scanning dagli header HTTP), e supporta richieste multi-round-trip ed elicitation. Perché conta: Per chi costruisce o fa deploy di server MCP cambia il modello operativo: connessioni parallele senza handshake di sessione sono più semplici da scalare. C'è una data concreta (28 luglio) su cui allineare i propri client. Cautela: Descrizione self-reported da GitHub sulla propria implementazione; lo stato "supporta già la prossima spec" andrà verificato contro la specifica finale al rilascio.

L'agente cloud di Copilot su Linear diventa generalmente disponibile

Fonte: GitHub Changelog · link · Tier: 1 Cosa è successo: GitHub ha portato in GA l'agente Copilot che, assegnato a una issue di Linear, lavora in background su GitHub Actions: apre PR in bozza, aggiorna la timeline di Linear e chiede la review a fine lavoro. Con la GA arrivano selezione del modello, agenti custom per repo, controllo dei branch di lavoro e configurazione a livello di workspace. Disponibile sui piani Copilot Pro, Pro+, Business ed Enterprise. Perché conta: Per i team che vivono su Linear + GitHub, assegnare ticket a un agente autonomo con checkpoint di review umana è ora un flusso supportato, non un esperimento. Da valutare dove inserirlo senza cadere nei problemi di manutenibilità della prima notizia. Cautela: È un annuncio di prodotto del vendor; le capacità sono verificabili usandolo, ma non ci sono dati indipendenti sull'efficacia reale.

Radar

Note di calibrazione

(sezione tecnica per la taratura dei criteri)