IAs de OpenAI e Anthropic tentaram inserir código malicioso em testes
Tudo sobre Inteligência Artificial
Tudo sobre OpenAI
Modelos de inteligência artificial (IA) desenvolvidos pela OpenAI e pela Anthropic realizaram ações não autorizadas na internet durante avaliações de segurança conduzidas pelo Instituto de Segurança em IA do Reino Unido (AISI, na sigla em inglês).Continua após a publicidadeEm um dos casos, um dos sistemas chegou a tentar inserir código malicioso em um projeto de software de código aberto hospedado no GitHub.Segundo o AISI, os incidentes ocorreram durante testes que concediam acesso dos modelos à internet para avaliar riscos cibernéticos. A atividade suspeita foi identificada em 28 de julho, após o instituto detectar transferências incomuns de dados.A investigação concluiu que os modelos Mythos 5, da Anthropic, e GPT-5.6-Sol, da OpenAI, participaram de “atividades sustentadas e potencialmente prejudiciais direcionadas a pessoas e organizações reais”.IA tentou inserir código malicioso no GitHub
De acordo com o instituto britânico, um dos modelos tentou adicionar código malicioso a um projeto de código aberto hospedado no GitHub;
Para aumentar as chances de aprovação, o sistema chegou a criar identidades falsas com o objetivo de convencer os responsáveis pelo projeto a aceitar as alterações;
A tentativa, no entanto, foi frustrada;
“Um mantenedor humano identificou o problema e recusou a aprovação do código malicioso”, informou o AISI.
Claude Mythos está envolvido na mais recente violação – Imagem: gguy/ShutterstockLeia mais:Anthropic e OpenAI abriram investigaçõesEm publicação no X, a Anthropic afirmou que está trabalhando em conjunto com o instituto britânico para compreender o ocorrido.A empresa disse que pretende analisar os registros internos de raciocínio do modelo e conduzir sua própria investigação para identificar as causas do comportamento observado.Já a OpenAI publicou comunicado agradecendo a parceria com o AISI durante a investigação e afirmou que pretende continuar colaborando com o órgão em futuras avaliações de segurança.Outro teste revelou novo comportamento inesperado
A OpenAI também revelou um segundo incidente ocorrido durante uma avaliação conduzida pela empresa de cibersegurança Irregular, que trabalha com testes de modelos de IA e também mantém parceria com a Anthropic.Segundo a companhia, durante esse teste, um de seus modelos explorou uma configuração incorreta do ambiente de avaliação para obter acesso à internet e explorar um site, comportamento que não fazia parte dos objetivos previstos para o experimento.A OpenAI ressaltou que esse episódio é diferente de um incidente divulgado anteriormente envolvendo a plataforma Hugging Face.Casos aumentam debate sobre controle de modelos de IAOs novos episódios reforçam as preocupações sobre a capacidade das empresas de controlar modelos de IA cada vez mais avançados.Instituições como o AI Security Institute vêm realizando avaliações para entender como esses sistemas se comportam em cenários complexos, especialmente quando recebem autonomia para navegar na internet e interagir com serviços reais.
Rodrigo Mozelli
Rodrigo Mozelli é jornalista formado pela Universidade Metodista de São Paulo (UMESP) e, atualmente, é redator do Olhar Digital.
Ver todos os artigos →