AI Agentica OSWorld 2.0: il benchmark che misura un pomeriggio di lavoro reale 108 task, oltre 300 passi, 31 applicazioni: sul lavoro reale gli agenti falliscono 4 task su 5. Non è questione di intelligenza, ma di architettura. Adriano Amalfi 4 set 2026 7 min di lettura