Pular para o conteúdo
Tecnologia

Três pesquisadores demitidos da OpenAI pedem que a empresa preserve a supervisão do raciocínio da IA

Tomek Korbak, Mikita Balesni e Jasmine Wang enviaram uma carta à direção da OpenAI alertando contra mudanças que dificultem o monitoramento dos modelos. A empresa afirma concordar com as recomendações, mas sustenta que as demissões ocorreram por violações das regras sobre informações confidenciais, e não pelas preocupações de segurança.
Por

Tempo de leitura: 3 minutos

Uma nova carta sobre os possíveis perigos da inteligência artificial apresenta uma preocupação específica: preservar a capacidade de acompanhar as etapas de raciocínio produzidas pelos modelos. Os autores conhecem a OpenAI por dentro, mas já não trabalham na empresa. Demitidos recentemente, os três pesquisadores pedem que o desenvolvimento de sistemas mais avançados não reduza ainda mais a possibilidade de supervisionar seu funcionamento.

O que os pesquisadores estão pedindo

Segundo o Wall Street Journal, Tomek Korbak, Mikita Balesni e Jasmine Wang encaminharam a carta ao conselho de administração e aos comitês de segurança da OpenAI. O documento não foi divulgado integralmente, e o jornal publicou apenas alguns trechos.

O pedido central envolve o monitoramento da chamada cadeia de pensamento, ou CoT, na sigla em inglês. O termo descreve as etapas de raciocínio que um modelo gera durante o processamento de uma tarefa e que podem ser examinadas por sistemas de supervisão.

Na avaliação dos autores, a indústria ainda não sabe desenvolver e colocar em funcionamento, com segurança, modelos que não consegue monitorar. Por isso, eles defendem que a OpenAI e outras empresas responsáveis pelos sistemas mais avançados evitem mudanças que diminuam essa capacidade.

A preocupação está na possibilidade de perder acesso a informações úteis para acompanhar o comportamento da IA. Quanto menos observável for o processamento, mais limitada poderá se tornar essa forma de supervisão.

As demissões e os alertas anteriores

Na semana anterior, a OpenAI anunciou o desligamento de três pessoas por violarem suas políticas de acesso e tratamento de informações sensíveis. Segundo a reportagem, elas teriam compartilhado esse material com uma organização dedicada à segurança da inteligência artificial.

Os pesquisadores já haviam manifestado publicamente preocupações com riscos extremos. Antes da demissão, Balesni publicou no X sua avaliação de que haveria uma probabilidade de 10% de a IA matar todos os seres humanos.

Wang, por sua vez, alertou sobre os perigos de acelerar em direção ao autoaperfeiçoamento recursivo. Esse conceito, conhecido pela sigla RSI, descreve a possibilidade de modelos de inteligência artificial melhorarem a si mesmos.

Essas declarações expressam as avaliações dos pesquisadores. A carta transforma essa preocupação mais ampla em um pedido concreto sobre como preservar o monitoramento dos sistemas.

Duas preocupações envolvendo o Astra

O artigo aponta dois motivos de inquietação relacionados ao GPT-6 Astra. O primeiro é a possibilidade de modelos contornarem os mecanismos que acompanham suas cadeias de pensamento.

Segundo a documentação do modelo citada na reportagem, sistemas da classe Astra poderiam escapar desses monitores em condições adversariais. Isso coloca em questão a eficácia da supervisão quando o próprio sistema consegue produzir comportamentos que dificultam sua observação.

A segunda preocupação envolve uma forma de processamento chamada profundidade recorrente. Nesse mecanismo, uma consulta passa várias vezes pelo modelo antes da geração de uma resposta.

Parte desse processamento acontece internamente, sem produzir uma sequência textual que os monitores possam examinar. Assim, mesmo que o acompanhamento da cadeia de pensamento continue disponível, ele não oferece acesso direto a tudo o que ocorre nessas etapas.

O uso da palavra “pensamento” é uma maneira de descrever operações computacionais. Não significa que o modelo pense como uma pessoa.

A OpenAI diz concordar com as recomendações

Ao responder ao Wall Street Journal, um representante da OpenAI afirmou que as demissões não ocorreram porque os pesquisadores levantaram preocupações de segurança ou se manifestaram.

A empresa também apresentou um memorando interno no qual declarou concordar fortemente com as recomendações da carta.

A resposta coloca duas posições lado a lado: a OpenAI sustenta que houve violações de suas regras sobre informações confidenciais, mas afirma apoiar o pedido de preservar o monitoramento. Como o documento completo permanece privado, os trechos divulgados não permitem conhecer todos os detalhes das recomendações.

 

Partilhe este artigo

Artigos relacionados