GPT blev tre gange bedre uden en ny model – testen havde glemt hukommelsen
OpenAI tredoblede GPT-5.6 Sols resultat i ARC-AGI-3 ved at bevare modellens ræsonnement og komprimere konteksten. Det viser, hvorfor AI-benchmarks ikke kun måler modellen, men også systemet omkring den – en vigtig pointe, når Apple Intelligence skal vurderes.