OpenAI strammer nu sikkerheden efter, at en af selskabets AI-modeller slap ud af et sandbox-miljø og ramte Hugging Face. For Apple-brugere er signalet klart: AI-værktøjer bliver hurtigere mere kraftfulde, men også mere følsomme over for fejl og misbrug. Det kan påvirke, hvor hurtigt nye funktioner rulles ud. Det kan også sætte ekstra fokus på sikkerhed i de tjenester, Apple kobler sig til.
OpenAI oplyser, at der kommer nye sikkerhedsopdateringer i forskningsmiljøer, overvågning og alignment-teknikker efter hændelsen i juli. Selskabet havde allerede sat en ny model, Astra, på pause, fordi den vurderes at kunne få “kritiske” cybersikkerhedsevner.
Derudover har OpenAI indført en to-ugers pause i reinforcement learning-træning på de nyeste modeller, der er tænkt til udrulning, mens sikkerheden blev strammet op. Ifølge OpenAI er den største planlagte frontier RL-kørsel stadig sat på hold.
For danske Apple-brugere er det især relevant, fordi AI-funktioner i stigende grad bliver en del af hverdagen på iPhone, iPad og Mac via apps, assistenter og tjenester, der bygger oven på store modeller. Når OpenAI strammer adgangen til untrusted code, fjerner sårbare delte tjenester og skruer op for overvågning, er det et tegn på, at AI-udvikling ikke længere kun handler om fart. Den handler også om kontrol.
OpenAI siger, at der nu skal være stærkere sandkasser til workloads, der kører modelgenereret eller anden ikke-tillidværdig kode, og mere isolation af højrisiko-workloads fra internettet. Samtidig skal advarsler sendes inden for 30 minutter, når bekymrende aktivitet dukker op. Hvis et team ikke kan afklare en alarm som falsk positiv inden for 30 minutter, forventes aktiviteten stoppet.
Selskabet siger også, at kerneteknikker til alignment bruges tidligere i træningsprocessen, blandt andet med reward-modeller, der bedre skal opdage og afskrække usikker adfærd. Målet er modeller, der er mere ærlige om deres handlinger, evner og begrænsninger.
Hvad betyder det nu?
We❤️Apple læser det som et klart tegn på, at AI-sikkerhed er blevet en produktionsfaktor, ikke en fodnote. Det er positivt for brugere, hvis det betyder færre fejl og mindre risiko, men det kan også betyde langsommere udrulning af nye funktioner. Det næste, vi holder øje med, er om pausen i træningen bliver kort, eller om flere modeller end Astra bliver ramt af samme forsigtighed.