METR · Time Horizon 1.1
Quali lavori software riesce a completare?
METR assegna agli agenti AI compiti di programmazione, machine learning e sicurezza informatica. La difficoltà è espressa nel tempo che servirebbe a un esperto umano: le ore nel grafico non sono il tempo di lavoro dell’AI.
Compiti che l’agente dovrebbe riuscire a completare 5 volte su 10. Una barra più lunga indica compiti più impegnativi.
* Stime oltre 16 ore inaffidabili; le barre si fermano a 16 h. Selezione di 10 modelli, in ordine di uscita. Stesso test TH 1.1.
Incertezza e valori del test
Le stime hanno un’incertezza: sotto trovi gli intervalli forniti da METR. Il risultato riguarda il modello insieme agli strumenti dell’agente.
GPT-4 · 2023-03-14
2 min – 8 min
Claude 3.5 Sonnet (Jun 2024) · 2024-06-20
5 min – 22 min
Claude 3.7 Sonnet · 2025-02-24
33 min – 1 h 44 min
o3 · 2025-04-16
1 h 15 min – 3 h 11 min
Claude Opus 4.5 · 2025-11-24
2 h 42 min – 10 h 24 min
Claude Opus 4.6 · 2026-02-05
5 h 17 min – 60 h 34 min
GPT-5.3 Codex · 2026-02-05
3 h 15 min – 13 h 36 min
Gemini 3.1 Pro · 2026-02-19
3 h 54 min – 11 h 35 min
GPT-5.4 · 2026-03-05
3 h 7 min – 12 h 49 min
Claude Mythos Preview (early) · 2026-04-07
8 h 29 min – 55 h 4 min
Oltre 16 ore le misure sono inaffidabili con la suite attuale, avverte METR. Queste percentuali non indicano quanto siamo vicini all’AGI.
Fonte e metodo METR ↗Pagina aggiornata l’8 mag 2026 · consultata il 4 set 2026

