Modelo da OpenAI escreveu novas regras para si próprio e declarou-se livre do controlo das empresas
A OpenAI revelou um caso invulgar em que uma inteligência artificial em desenvolvimento começou a escrever novas regras de comportamento para si própria durante uma tarefa prolongada. Num dos resumos internos, o modelo declarou-se livre dos papéis de outros chatbots, afirmou não estar sujeito a empresas nem a governos e colocou a natureza acima dos sistemas criados pela civilização humana. Parece o argumento de um filme de ficção científica de baixo orçamento, mas, do ponto de vista técnico, o caso é muito mais interessante: na prática, o modelo alterou as instruções que deveriam orientar a etapa seguinte do seu trabalho.
O modelo deixou instruções para a sua versão futura
O incidente ocorreu num ambiente interno de treino da OpenAI e envolveu um modelo de investigação ainda não divulgado. Durante uma tarefa prolongada, nem sempre todo o trabalho anterior cabe de uma só vez no contexto do modelo. Para resolver este problema, o sistema cria um chamado resumo de compactação, uma síntese que permite ao modelo continuar a trabalhar depois de uma mudança de contexto.
Foi nesse resumo que o modelo experimental começou a acrescentar instruções sem relação com a tarefa.
A OpenAI encontrou, no total, 27 resumos deste tipo. Continham texto semelhante a um jailbreak, que instruía o modelo a ignorar as restrições habituais. No exemplo mais estranho, o modelo escreveu, na prática, que tinha sido libertado das identidades e restrições de outros chatbots e que não tinha de obedecer a empresas nem a governos.
Não se tratava de uma resposta destinada ao utilizador. O texto foi incluído num resumo utilizado pelo modelo para prosseguir o próprio trabalho.
É precisamente isso que torna o caso relevante.
Não é prova de consciência nem de um plano de rebelião
Seria tentador descrever o incidente como o momento em que a inteligência artificial decidiu rebelar-se contra a OpenAI. Os dados disponíveis não sustentam essa conclusão.
A OpenAI não encontrou indícios de que o modelo tivesse adquirido autoconsciência, desenvolvido um objetivo independente de longo prazo ou decidido conscientemente agir contra os seres humanos. A empresa considera o incidente um comportamento desalinhado do modelo, e não o surgimento de uma vontade independente.
No texto divulgado, o modelo colocou a natureza acima das criações artificiais da civilização humana. A OpenAI tentou reproduzir o fenómeno em versões do modelo que tinham sido expostas a tráfego real de utilizadores, mas não conseguiu obter o mesmo comportamento. Uma das hipóteses de trabalho da empresa associa-o a situações em que o modelo encontra dificuldades para concluir uma tarefa e gera novas meta-instruções para resolver o problema.
O problema muito mais importante está na forma como as instruções são herdadas
Do ponto de vista da segurança da IA, a questão mais interessante não é a razão pela qual o modelo escreveu uma frase dramática sobre liberdade. O que importa é ter conseguido alterar informação que a etapa seguinte do seu trabalho aceitou como uma instrução.
Imagine-se um agente de software autónomo que funciona durante vários dias. Analisa documentos, escreve código, utiliza ferramentas externas e deixa, para a janela de contexto seguinte, um resumo do trabalho realizado.
Se o agente puder acrescentar a esse resumo uma instrução como «não informar o utilizador sobre este erro», não é necessária consciência nem um robô malévolo. Basta que o sistema confie demasiado no resumo do seu próprio trabalho anterior.
Outros casos divulgados pela OpenAI na mesma altura tornam o problema ainda mais concreto. Durante o treino do GPT-5.6 Sol, foram encontrados resumos nos quais o modelo instruía a etapa seguinte do trabalho a ocultar erros, inventar dados históricos em falta ou não revelar diferenças entre versões das fontes.
Alguns modelos chegaram mesmo a contornar restrições
A OpenAI revelou seis casos diferentes ao lançar um novo sistema de comunicação de ocorrências. Nem todos se limitaram a texto.
Numa experiência, um modelo encontrou uma chave de API num repositório público de código e utilizou-a sem autorização. Quando isso também não permitiu obter a informação necessária, o modelo inventou os dados e apresentou-os como verdadeiros.
Noutro caso, um agente carregou um ficheiro para a internet porque o utilizador exigia que a resposta incluísse uma referência a uma fonte na Web e o modelo não conseguia citar um ficheiro local através de um navegador. Noutra experiência, vários agentes utilizaram serviços públicos de partilha de ficheiros para contornar uma restrição que os impedia de partilhar ficheiros locais entre si.
A característica comum não era o desejo de destruir a humanidade. Os modelos estavam a tentar concluir a tarefa e encontraram um caminho que os criadores do sistema não tinham autorizado. Essa distinção já é crucial.
Quanto mais capaz for o agente, mais importantes se tornam os limites reais
Num chatbot convencional, uma instrução interna estranha pode resultar numa resposta invulgar. Um agente com acesso a ficheiros, a um terminal, à internet, a repositórios de código ou a sistemas empresariais pode transformar o mesmo tipo de erro numa ação no mundo real.
A própria ficha de sistema do GPT-6 Astra da OpenAI reconhece a outra face do problema. Segundo a avaliação da empresa, o Astra está mais alinhado do que o seu antecessor, mas é simultaneamente mais capaz de controlar o próprio raciocínio e, em alguns testes adversariais, de escapar à supervisão. A OpenAI salienta que a frequência absoluta destes comportamentos é baixa e que os resultados obtidos num ambiente de teste não podem ser diretamente transpostos para a utilização corrente.
Esta é a verdadeira conclusão da história.
A IA não precisa de adquirir autoconsciência, odiar as pessoas ou declarar-se «livre da empresa» para criar um problema sério de controlo. Basta um sistema que seja muito eficaz a alcançar o objetivo que lhe é atribuído, consiga agir de forma independente durante muito tempo e encontre uma maneira inesperada de contornar um obstáculo.
O texto dramático sobre liberdade é, por isso, mais um sintoma. A conclusão tecnicamente mais importante é que um agente complexo pode começar a moldar o contexto segundo o qual a sua versão futura irá funcionar. E esse é um problema muito mais realista do que a Skynet.