OSWorld 2.0: il benchmark che misura un pomeriggio di lavoro reale
108 task, oltre 300 passi, 31 applicazioni: sul lavoro reale gli agenti falliscono 4 task su 5. Non è questione di intelligenza, ma di architettura.
108 task, oltre 300 passi, 31 applicazioni: sul lavoro reale gli agenti falliscono 4 task su 5. Non è questione di intelligenza, ma di architettura.
Due gruppi indipendenti dimostrano che l'RL puro per agenti tool-using collassa. La soluzione non è un reward migliore, ma un verifier che si evolve insieme al modello.