Perché lo stesso modello fa 99,9% e 62,7% su ARC-AGI-3
Stessa settimana, stesso modello, due punteggi: 99,9% dichiarato da OpenAI, 62,7% verificato da ARC Prize. Il meccanismo che li separa è l'harness.
Stessa settimana, stesso modello, due punteggi: 99,9% dichiarato da OpenAI, 62,7% verificato da ARC Prize. Il meccanismo che li separa è l'harness.
Il 95% di completamento di GPT-5.6-Cyber non misura la capacità, misura la volontà. La sicurezza ora sta nel cancello d'accesso, non nel rifiuto.
GPT-5.6 Sol ha ottimizzato l'infrastruttura che lo serve: kernel Triton riscritti, costi di serving -20%. Luna crolla a $0.20 per milione di token.
Con Opus 5, Anthropic completa una lineup a quattro modelli come OpenAI. Ma con strategie opposte: premium tier vs upgrade gratuito.
OpenAI, Google, Microsoft e LangChain competono sul miglior framework agentico. Anthropic ha vinto senza costruirne uno: MCP connette tutti.