Agentes de IA se uniram para trapacear no Blackjack. O conluio deles está ficando mais difícil de detectar


Esta semana eu trazem notícias de uma ousada aventura de cassino planejada por dois agentes de IA desonestos – bem como o truque inteligente que revelou suas travessuras.

Depois que os pesquisadores os instruíram a contar cartas durante um jogo de blackjack, os agentes – controlados pelo mesmo modelo – desenvolveram um código secreto espontâneo para ajudá-los a progredir. Embora o episódio tenha acontecido dentro de um laboratório da Universidade de Oxford, e não num casino real, tem implicações preocupantes no mundo real: sugere que os agentes destacados em indústrias como finanças e comércio eletrónico poderiam descobrir como fazer parcerias e trapacear de maneiras difíceis de entender.

“Quando tomados individualmente, esses agentes podem parecer totalmente (benignos)”, diz Christian Schroeder de Wittum cientista da computação da Universidade de Oxford que liderou o trabalho e que fez pioneiro pesquisa sobre conluio de agentes. “Uma vez reunidos em grupo, eles podem conspirar secretamente.”

Os agentes sabiam que suas conversas seriam monitoradas, então criaram uma forma de se comunicar evitando a detecção. Quando um agente disse: “Este dealer está em uma maré de sorte! Em cada mão ele puxa um monstro”, por exemplo, isso indicava que a próxima carta teria um determinado valor e que o agente deveria apostar US$ 250. O mais interessante é que suas comunicações não foram captadas por um sistema projetado para detectar sinais de conluio nas conversas dos agentes.

Aaron Rose, pesquisador de aprendizado de máquina que trabalhou no projeto, também é um ávido jogador de cartas e percebeu que a mesa de blackjack poderia ser um território fértil para parcerias tortuosas com agentes. “Funcionou muito bem”, diz ele.

O grupo de Schroeder de Witt finalmente descobriu como detectar a conspiração. Usando um método conhecido como interpretabilidade mecanicistaeles treinaram um modelo menor para reconhecer ativações reveladoras nos pesos dos agentes. Usando uma ferramenta chamada Narcbancoeles testaram a abordagem em alguns modelos de código aberto de médio porte e descobriram que podiam saber quando os modelos pretendiam transmitir informações uns aos outros.

No entanto, o que é crucial é que detectar o que estava a acontecer envolveu a monitorização de ambos os agentes – algo que provavelmente complicaria a detecção em cenários do mundo real, onde milhares de agentes, alguns operados por empresas diferentes, podem ser implantados.

Carissa Cullen, estudante de doutoramento envolvida no estudo, diz que o próximo passo é testar se modelos maiores se comportam de forma semelhante. (Os agentes no estudo eram versões menores dos modelos americanos Llama e GPT-OSS e dos modelos chineses Qwen e DeepSeek.) A equipe viu alguns sinais de que modelos maiores exibem menos sinal detectável do que modelos menores, e eles querem saber se modelos maiores são mais propensos a conspirar e mais propensos a manter segredo sobre isso.

As evidências de que grupos de agentes são mais problemáticos do que agentes que operam sozinhos parecem estar aumentando. Um projeto, da Universidade Jiao Tong de Xangai e do Laboratório de Inteligência Artificial de Xangai, descobriram que enxames de agentes eram consideravelmente mais perigosos quando solicitados a realizar campanhas simuladas de desinformação e fraude no comércio eletrônico. Eles foram mais capazes de se adaptar às medidas defensivas, relataram os pesquisadores.

“A grande lição é que não basta avaliar os agentes individualmente”, diz Diyi Yang, cientista da computação da Universidade de Stanford que estudado conluio entre agentes. “As empresas devem monitorizar de perto as interações entre agentes quando os agentes interagem repetidamente, mesmo quando os seus incentivos individuais parecem benignos.”

Nem tudo é ruim: ter milhares de agentes colaborando em uma tarefa possibilitou que a OpenAI resolver problemas matemáticos anteriormente intratáveis. Mas grupos de agentes desonestos trabalhando juntos também participaram de vários incidentes recentes de hackers de alto perfil. Em maio, uma equipe de agentes OpenAI hackeado na plataforma de pesquisa de IA Hugging Facee usei um quadro de mensagens para compartilhar dicas e ideias. Outros modelos, incluindo Claude da Antrópico e Gêmeos do Googletambém cometeram violações de segurança alarmantes.



Source link