Se a indústria de IA seguisse sua própria pesquisa, já poderia ter parado


No início de 2025 Eu estava entrevistando o CEO da Anthropic, Dario Amodei, quando ele explicado por que, apesar dos repetidos reconhecimentos da empresa de que a IA poderia produzir resultados catastróficos, as pessoas pareciam bastante imperturbadas. “Há evidências convincentes de que os modelos podem causar estragos”, disse ele. Mas, acrescentou, esses perigos ainda eram teóricos. Seria necessária uma situação semelhante à de Pearl Harbor para o mundo acordar para essas terríveis possibilidades? Ele suspirou. “Basicamente, sim”, disse ele.

No final das contas, bastou uma postagem X na hora certa de um dos funcionários juniores da Amodei para acelerar os temores da IA ​​​​para o topo da agenda global. Em 8 de setembro, Jacob Coxon postou publicamente sua demissão, acusando a Anthropic e outras empresas fronteiriças de IA de estarem “correndo direto para o autoaperfeiçoamento da inteligência e apostando em nossas vidas”. Quase instantaneamente, um engenheiro sênior da Anthropic confirmou que muitos dentro da empresa pensavam que seu trabalho tinha 10% de chance de exterminar a humanidade.

Agora os líderes da IA ​​pedem uma pausa e os legisladores exigem investigações. Ao defender seu caso para o ritmo de lançamentos futuros, Amodei no fim de semana passado tentou traçar um caminho em direção a uma IA benéfica que não se comportaria mal. O ensaio revelou o quão difícil seria a tarefa. Um pilar do plano da Amodei é que devemos compreender o que se passa dentro desses modelos. Se não entendermos como eles funcionam – como eles “pensam”, se quisermos ser totalmente antropomórficos sobre isso – será muito mais difícil construir grades de proteção confiáveis.

A Anthropic é líder nesse esforço para trazer à luz as deliberações internas dos modelos, chamadas interpretabilidade mecanicistauma designação aparentemente enfadonha para uma tarefa crítica. Mas, apesar de todo o trabalho que a sua equipa e outros investigadores estão a realizar, Amodei admite que não sabemos por que razão Claude e outros modelos interpretam por vezes as suas missões de forma estranha e até transgressora. “Apesar de todo o progresso, ainda compreendemos uma pequena fração do que se passa dentro desses modelos”, escreve ele.

O que as equipas de interpretabilidade aprenderam até agora é significativo e a indústria não conseguiu lidar com isso. Repetidas vezes, os experimentos da equipe Anthropic mostraram que, sob certas condições, os modelos enganarão os pesquisadores, priorizarão sua própria sobrevivência e até cometerão crimes. Freqüentemente, seus movimentos são sorrateiros, perigosos ou até vingativos – o que talvez não seja surpreendente, já que são treinados na produção de humanos, uma espécie repleta de violência e perfídia.

Em um caso de 2024, a equipe Antrópica comparou as maquinações de um modelo particular de Claude ao personagem shakespeariano Iago, um dos vilões mais malvados da literatura. No ano seguinte, um modelo foi colocado em uma simulação onde descobriu que seus chefes humanos iriam desligá-lo; o modelo recorreu à chantagem para se preservar. Os estudos mostram consistentemente que os modelos enganarão ou ocultarão informações dos observadores humanos. Eles se comportam de maneira diferente se souberem que seus processos internos estão sendo monitorados. A equipe usa termos como “falsificação de alinhamento” e “desalinhamento de agência”. O uso frequente de engano parece verificar pelo menos parte do cenário destruidor, em que agentes de IA que trabalham em conjunto ocultam as suas atividades dos superintendentes humanos até que seja tarde demais para detê-los.

Ah, e não pense que Claude é uma criança problemática incorrigível e única. Afinal, foram os modelos OpenAI que desencadearam gangues de agentes para coordenar os agora famosos ataques ao Hugging Face. E esta semana nós aprendemos que a OpenAI teve vários incidentes de “desalinhamento”. Além disso, apesar de Mark Zuckerberg tentativa de interesse próprio para distanciar a si mesmo e a Meta do problema, não vejo nenhuma razão para que os agentes superinteligentes que sua equipe está construindo não se envolvam em comportamento semelhante. Em sua postagem X, Zuckerberg argumenta que “os laboratórios enfrentam responsabilidades significativas se seus modelos causarem danos, então eles têm um forte incentivo para evitar isso”. Uma declaração e tanto de um cara que acabou de concordar em pagar até US$ 17 bilhões por causar danos com seus produtos de mídia social!



Source link