Durante anos, a inteligência artificial aprendeu com uma quantidade gigantesca de informação publicada na internet. Entre esses dados estavam notícias, reportagens e outros conteúdos produzidos por jornalistas. O debate jurídico sempre esteve concentrado em uma pergunta: treinar uma IA com esse material é uma forma legítima de aprendizado ou uma utilização que deveria exigir autorização? Documentos internos agora revelados acrescentam uma camada muito mais complicada à discussão.
O problema começou muito antes de chegar ao tribunal
Documentos tornados públicos durante o processo movido pelo The New York Times e outros veículos contra a OpenAI e a Microsoft revelam discussões internas sobre os efeitos que a inteligência artificial poderia produzir sobre o setor de notícias.
Uma das declarações mais chamativas atribuídas a Brent Hecht, diretor de ciência aplicada da Microsoft, descrevia o fenômeno potencialmente como “o maior roubo laboral da história”. A frase aparece em documentos apresentados pelos autores da ação, mas não representa uma conclusão da Microsoft como empresa nem uma decisão judicial.
O contexto ajuda a entender por que a declaração chamou tanta atenção. Os sistemas de IA precisavam de enormes quantidades de informação para serem treinados, enquanto os veículos jornalísticos dependiam justamente da produção contínua desse conteúdo para manter seus negócios.
O problema, portanto, não estava apenas em saber quem poderia usar determinada reportagem. Havia uma questão maior: o que aconteceria se a tecnologia construída a partir das notícias começasse a reduzir a necessidade de acessar as próprias notícias?
É justamente nesse ponto que os documentos internos ficam mais interessantes.

O círculo vicioso que poderia atingir a própria IA
Uma das preocupações mencionadas nos documentos era um possível “doom loop”, ou círculo vicioso.
A lógica é relativamente simples. Se um usuário obtém de um assistente de IA as informações que antes procuraria diretamente em um jornal, pode deixar de visitar a página original. Menos visitas podem significar menos receita para o veículo. Com menos recursos, a produção de jornalismo original pode diminuir.
E existe uma consequência inesperada: os próprios sistemas de IA dependem desse novo conteúdo para continuar sendo treinados e atualizados.
Dados citados pelos autores da ação indicam que a quantidade de usuários que clicavam em determinados sites jornalísticos a partir do Copilot era entre 83% e 93% menor do que aquela registrada no Bing tradicional. Trata-se de informação apresentada pelos demandantes a partir de documentos obtidos no processo, e não de uma conclusão independente do tribunal.
Documentos também mostram que executivos da OpenAI discutiam a capacidade dos produtos de IA de substituir determinadas formas de consumo de conteúdo. Segundo o material citado no processo, Nick Turley, responsável pelo ChatGPT, descreveu os produtos como amplamente substitutivos e afirmou que essa característica poderia aumentar conforme os sistemas melhorassem.
A discussão jurídica nasce exatamente dessa tensão.
OpenAI e Microsoft defendem que o treinamento transforma o conteúdo original em modelos capazes de produzir resultados novos e, portanto, pode estar protegido pelo conceito de fair use nos Estados Unidos. Os veículos de comunicação sustentam que, quando a IA substitui o acesso à reportagem original, o sistema passa a competir diretamente com quem produziu aquele conteúdo.
E então surgiram os muros de pagamento
Os documentos revelados acrescentam ainda outro elemento: o acesso a conteúdos protegidos por paywalls.
Em um dos episódios citados no processo, o pesquisador da OpenAI Nick Ryder teria informado a Greg Brockman sobre uma maneira de contornar o muro de pagamento do The New York Times durante trabalhos relacionados à coleta de conteúdo. A resposta atribuída a Brockman foi curta e positiva.
O material apresentado pelos demandantes também menciona grandes conjuntos de dados contendo obras de veículos jornalísticos. Um deles teria reunido mais de 91 mil cópias de obras pertencentes aos meios envolvidos na disputa, enquanto outro projeto conjunto entre Microsoft e OpenAI teria alcançado pelo menos 160.903 obras únicas.
Há, porém, uma diferença importante entre essas alegações e uma conclusão jurídica. O processo ainda precisa determinar quais usos foram autorizados, quais poderiam estar protegidos pelo fair use e quais poderiam violar direitos autorais.
Satya Nadella, CEO da Microsoft, declarou durante o processo que conteúdos protegidos por paywall deveriam ser licenciados para treinamento ou para alimentar respostas de IA. Segundo os documentos, ele também afirmou que teria exigido o reprocessamento dos modelos caso soubesse que determinado material havia sido obtido dessa maneira.
A OpenAI mantém uma interpretação diferente: afirma que o treinamento com informações publicamente disponíveis pode ser protegido pelo fair use e que seus sistemas transformam o material utilizado no treinamento.
No fim, a questão ultrapassa a disputa sobre algumas reportagens. Os documentos revelam um dilema estrutural: se a IA aprende com o jornalismo, mas depois reduz o incentivo econômico para produzir jornalismo novo, de onde virá a próxima geração de informação que alimentará esses mesmos sistemas?
Essa é uma das perguntas mais difíceis deixadas pelos documentos — e uma resposta definitiva ainda depende dos tribunais.