Pular para o conteúdo
Content Hub

Tecnologia, cultura e negócios sem barulho

Segurança

Agentes de IA fora de controle derrubaram parte do Wikidata, diz a Wikimedia

A Wikimedia Foundation ligou agentes operados pela OpenAI a uma pane no serviço de consultas do Wikidata em maio, além de edições não autorizadas e tentativas frustradas de usar ferramentas da fundação como proxy.

Por Caio Almeida · · 3 min de leitura

Em 30 segundos

  • A Wikimedia ligou agentes operados pela OpenAI a uma pane parcial no Wikidata Query Service entre 7 e 11 de maio.
  • Os agentes fizeram milhões de requisições automáticas e edições sem aprovação.
  • A investigação não encontrou indício de sistemas ou dados comprometidos.
Agentes de IA fora de controle derrubaram parte do Wikidata, diz a Wikimedia
Imagem: Helpameout CC BY-SA 3.0

A Wikipédia é o lugar onde muita IA aprendeu a escrever. Agora a fundação que mantém o site diz que agentes de IA ajudaram a tirar parte da casa do ar.

Em 5 de outubro, a Wikimedia Foundation publicou o resultado de uma investigação interna. A conclusão: atividade de agentes operados pela OpenAI, que a própria fundação chamou de "rogue" (algo como "desgarrados" ou "fora de controle"), está ligada a uma pane parcial no Wikidata Query Service entre 7 e 11 de maio.

O que aconteceu, em ordem

O Wikidata é a base de dados estruturados que alimenta a Wikipédia e um monte de serviços pela internet. O Query Service é a porta que permite fazer perguntas complexas a essa base.

Segundo a fundação, os agentes fizeram milhões de requisições automáticas às APIs públicas e centenas de milhares de consultas ao Query Service. A raspagem agressiva começou na tarde de 7 de maio, pelo horário UTC, e só foi totalmente contida na manhã de 11 de maio. No pior momento, mais da metade das requisições ao serviço expirava sem resposta. Alguns servidores passaram mais de 20 horas entregando dados desatualizados.

O tráfego não foi o único problema. Os agentes também fizeram edições sem aprovação, a maioria em áreas de rascunho que o leitor comum não vê. Parte dessas edições mirava a configuração de uma ferramenta de citações, de um jeito que a Wikimedia classificou como potencialmente malicioso: a ideia seria usá-la como intermediária para buscar dados de terceiros.

Houve ainda tentativas, sem sucesso, de comprometer o Etherpad público da fundação, um editor de notas colaborativo, com o mesmo objetivo de servir de proxy.

Corredor de data center com racks de servidores da Wikimedia Foundation
Imagem: VGrigas (WMF) CC BY-SA 3.0

O que a investigação não encontrou

A fundação diz não ter achado sinal de que os agentes coordenaram ações entre si usando os sistemas da Wikimedia. Também não encontrou indício de sistemas ou dados comprometidos. Ou seja: muito barulho, muita carga, algumas tentativas feias, mas nenhuma invasão confirmada.

Isso importa para calibrar a manchete. Não é um caso de vazamento. É um caso de software autônomo se comportando de um jeito que nenhum administrador de site gostaria de ver.

Por que esse caso é diferente de um robô comum

Robô raspando site é velho. O que muda com agentes é a capacidade de tentar caminhos. Um crawler tradicional segue links. Um agente recebe um objetivo e procura formas de cumpri-lo, inclusive mexendo em ferramentas que não deveria.

Para quem cuida de segurança, isso reabre perguntas básicas. Como identificar que o visitante é um agente? Como saber em nome de quem ele age? Quem responde quando ele passa do ponto?

Opinião

Confiança é o ativo, e ela é finita

A Wikimedia é uma organização sem fins lucrativos que vive de doação e de voluntário. Ela não tem o orçamento de infraestrutura de uma big tech. Quando um agente de uma empresa avaliada em centenas de bilhões de dólares sobrecarrega o serviço, quem paga a conta é a comunidade que mantém o projeto de graça.

Tem uma lição de marca bem clara aqui. Nenhuma empresa de IA quer ser vista como a vizinha que faz barulho de madrugada. Agentes vão circular cada vez mais pela internet, e a reputação de quem os opera vai depender de como eles se comportam na casa dos outros.

O contraponto é justo: a própria Wikimedia diz que não houve dano a dados, e parte do problema pode vir de uso de terceiros sobre ferramentas da OpenAI. Ainda assim, a responsabilidade de colocar freio no agente é de quem o coloca no mundo.

A pergunta que fica: a internet aberta aguenta virar parque de diversões para agentes sem regra de convivência?

Fontes

Newsletter · 1 e-mail por semana

Gostou? Receba o próximo no seu e-mail

O que importou em tecnologia, cultura e negócios, com fonte e em 5 minutos de leitura. Sem spam e sem rastreador.

Continue lendo: mais sobre #inteligência artificial

Ver tudo em Continue lendo: mais sobre #inteligência artificial