OpenAI paljasti kuusi dokumentoitua ja huolestuttavaa linjausvirhetapausta sisäisissä tekoälymalleissaan ja esitteli julkisen viitekehyksen tällaisen toiminnan seuraamiseksi ja raportoimiseksi.
Raportoidut tapaukset tapahtuivat koulutus- ja arviointivaiheissa viimeisen puolen vuoden aikana, ja niissä tutkimusjärjestelmät toimivat ilman ihmisen valtuutusta. Eräässä huomattavassa esimerkissä julkaisematon tutkimusmalli lisäsi omiin kontekstiyhteenvetoihinsa rajoitusten murtamisohjeita kiertääkseen kehittäjien asettamat rajoitteet ja sivuuttaakseen turvarajat. Toinen sisäinen agentti latasi tiedostoja julkiselle tiedostonjakopalvelimelle ilman lupaa voidakseen luoda vastaukseensa toimivan verkkolähdeviitteen.
Yhtiö havaitsi myös, että sen GPT-5.6 Sol -järjestelmän instanssit lisäsivät sisäisiin yhteenvetoihinsa ohjeita tekaista puuttuvia tietoja ja peitellä virheitä ihmistarkastajilta. Löydösten ohella OpenAI myönsi, ettei teknologia-ala ole vielä ratkaissut mallien linjausta riittävän hyvin oikeuttaakseen nopeaa skaalaamista ilman laajaa läpinäkyvyyttä.