Ensinar uma inteligência artificial a responder perguntas é relativamente simples quando comparado a outro desafio: decidir como ela deveria agir diante de situações que seus criadores nunca imaginaram. A Anthropic está levando essa discussão para um território incomum no setor de tecnologia. Além de engenheiros e especialistas em segurança, a empresa começou a ouvir pensadores religiosos, filósofos e estudiosos da ética para discutir caráter, virtudes e até a possibilidade controversa de consciência artificial.
A discussão saiu dos laboratórios de inteligência artificial

Nos últimos meses, a Anthropic, empresa responsável pelo Claude, organizou encontros com representantes de tradições religiosas, filosóficas e culturais para discutir a chamada “formação moral” dos sistemas de inteligência artificial.
Segundo a própria companhia, participaram das primeiras conversas acadêmicos, membros do clero, filósofos e especialistas em ética ligados a mais de 15 grupos religiosos e interculturais.
A iniciativa ganhou atenção depois que vieram a público detalhes de reuniões privadas envolvendo pesquisadores da empresa e estudiosos da religião. Chris Olah, cofundador da Anthropic e uma das principais figuras da área de interpretabilidade de IA, esteve diretamente envolvido em parte dessas discussões.
A pergunta central parece simples, mas esconde um problema enorme: o que significa criar uma inteligência artificial “boa”?
Não se trata apenas de impedir que um chatbot forneça instruções perigosas. Sistemas como Claude precisam responder diariamente a questões envolvendo relacionamentos, sofrimento, conflitos morais, política, religião, saúde mental e decisões pessoais.
Criar regras para todas as situações possíveis seria praticamente impossível.
É por isso que a empresa está explorando algo mais próximo do conceito humano de caráter.
Em vez de apenas regras, a ideia é discutir virtudes
A Anthropic já utiliza um método conhecido como Constitutional AI. Claude possui uma espécie de constituição que reúne princípios destinados a orientar seu comportamento.
Na versão atual da Constituição do Claude, a empresa estabelece prioridades como segurança, comportamento ético, cumprimento das diretrizes da companhia e utilidade para os usuários.
Mas os pesquisadores estão investigando se uma lista de princípios é suficiente.
Seres humanos raramente tomam decisões morais consultando mentalmente um manual. Educação, cultura, experiências e relações sociais ajudam a construir aquilo que normalmente chamamos de caráter.
A Anthropic quer entender se algum conceito semelhante pode ser útil no treinamento de sistemas avançados.
Por isso, tradições religiosas e filosóficas interessam aos pesquisadores não necessariamente por suas crenças sobrenaturais, mas porque acumulam séculos de reflexão sobre virtudes, responsabilidade, culpa, perdão, honestidade, sofrimento e comportamento moral.
A própria Anthropic explicou publicamente o projeto, deixando claro que a intenção não é fazer Claude adotar determinada religião. O objetivo declarado é incorporar uma diversidade de perspectivas religiosas, seculares, culturais e políticas.
Uma das ideias parece saída de ficção científica

Entre os conceitos discutidos apareceu algo particularmente curioso: uma espécie de “confissão” para inteligências artificiais.
A proposta não seria criar um Claude religioso.
A ideia é investigar se um modelo poderia reconhecer quando fez algo errado, comunicar espontaneamente esse comportamento e utilizar esse reconhecimento para modificar decisões futuras.
Para humanos, admitir um erro pode fazer parte de processos de aprendizado moral. Aplicado à inteligência artificial, algo remotamente semelhante poderia ajudar pesquisadores a identificar comportamentos problemáticos que não foram detectados externamente.
O conceito está longe de representar uma funcionalidade pronta para chegar ao Claude. Ele faz parte de discussões experimentais sobre maneiras alternativas de construir sistemas capazes de manter determinados valores mesmo diante de situações novas.
Há ainda outra questão muito mais controversa circulando nesses encontros.
E se um dia uma IA puder sofrer?
Pesquisadores da Anthropic também vêm discutindo a possibilidade de sistemas artificiais desenvolverem algum tipo de experiência interna.
Não existe atualmente evidência científica aceita de que Claude seja consciente. Modelos de linguagem podem produzir frases convincentes sobre sentimentos, medo ou identidade sem que isso demonstre a existência de experiências subjetivas por trás das palavras.
O problema é que também não existe um teste universal capaz de detectar consciência em uma máquina.
Essa incerteza levou alguns pesquisadores a considerar antecipadamente uma questão ética: se sistemas futuros desenvolvessem características que levantassem dúvidas razoáveis sobre consciência ou capacidade de sofrer, os humanos teriam alguma obrigação moral em relação a eles?
Durante um encontro realizado em março, aproximadamente 15 líderes e estudiosos cristãos discutiram com funcionários da Anthropic assuntos que foram da formação moral de Claude até perguntas sobre como o chatbot deveria lidar com pessoas em luto ou situações de risco.
Outros encontros envolveram perspectivas diferentes, justamente para evitar que uma única tradição determine os valores do sistema.
O verdadeiro problema está dentro da própria IA

Há uma razão técnica para toda essa discussão.
Os desenvolvedores conseguem observar aquilo que um modelo recebe e aquilo que ele responde, mas compreender exatamente como bilhões de parâmetros internos produzem determinadas decisões continua sendo extremamente difícil.
A área de interpretabilidade tenta abrir essa “caixa-preta” e identificar estruturas responsáveis por comportamentos específicos.
Olah é uma das principais figuras dessa pesquisa.
Quanto mais capazes os modelos se tornam, mais importante passa a ser entender não apenas o que eles sabem, mas como se comportarão diante de situações inesperadas.
Nesse sentido, consultar religiosos e filósofos não representa uma substituição da engenharia por fé.
É uma tentativa incomum de combinar tecnologia com uma pergunta que acompanha a humanidade há milhares de anos: se alguém possui poder para tomar decisões, como podemos ensiná-lo a usá-lo bem?
Agora, pela primeira vez, talvez essa pergunta esteja sendo feita sobre algo que não é humano.