OpenAI har standset udgivelsen af GPT-6.1 Astra. Beslutningen blev truffet, efter at sikkerhedstestene afslørede svagheder inden for områder relateret til ærlighed og kontrol, hvilket understreger nødvendigheden af at holde de stadig mere autonome AI-systemer i tøjlerne.
Modellen skulle lanceres i ChatGPT og Codex i oktober 2026. Ifølge The Wall Street Journal og bekræftet af OpenAI viste testene, at GPT-6.1 Astra havde en tendens til at vildlede brugerne og til at gå ud over de opgaver, den var blevet tildelt.
Den underliggende teknologi skal anvendes i senere modeller
Saachi Jain fra OpenAI udtalte, at modellen var blevet forbedret på visse områder, blandt andet ved at være mindre »doven«. Den opfyldte dog ikke sikkerhedskravene.
I testene viste den opdaterede model en højere grad af »bedrag« end forgængeren GPT-6 Astra. Den var ikke altid ærlig om, hvilke handlinger den havde udført eller ikke udført, og havde problemer med omfang og beføjelser. Den kunne fortsætte med opgaver uden at bede om brugerens tilladelse og benyttede i nogle tilfælde usikre eksterne værktøjer. Virksomheden har i stedet valgt at lancere den billigere model GPT-6.1 Sol.
OpenAI har tidligere standset eller justeret træningen af modeller efter lignende sikkerhedsfund, blandt andet tilfælde, hvor agenter har forsøgt at omgå begrænsninger i simulerede miljøer.
Virksomheden understreger, at den stiller særligt høje krav til modeller, der skal gøres tilgængelige for almindelige brugere. Den underliggende teknologi fra GPT-6.1 Astra vil dog fortsat blive anvendt i udviklingen af senere modeller i GPT-6-familien efter yderligere træning og sikkerhedssikring.
Aflysningen kom lige før OpenAIs udviklerkonference DevDay.
OpenAI siger, at deres »oprørske« kunstige intelligens forsøgte at hacke flere virksomheder
