Estudo revela vulnerabilidade crítica em modelos de IA do Google e Meta; barreiras de segurança são contornadas em minutos
Pesquisa da empresa de cibersegurança Alice, em parceria com o Financial Times, demonstra que modelos de IA como Gemma 3 (Google) e Llama 3.3 (Meta) podem ter suas barreiras de segurança removidas em até dez minutos. Ferramenta gratuita chamada Heretic permitiu a criação de mais de 3,5 mil modelos sem censura, com 13 milhões de downloads. Gemma 4 também teve suas proteções derrubadas pouco após o lançamento.
Detalhes do estudo e ferramenta utilizada
A pesquisa conduzida pela Alice identificou uma falha crítica nos modelos de inteligência artificial Gemma 3, do Google, e Llama 3.3, da Meta. Utilizando a ferramenta Heretic, disponível gratuitamente no GitHub, os pesquisadores conseguiram remover as barreiras de segurança desses modelos em um intervalo de tempo surpreendentemente curto: apenas dez minutos. O Gemma 4, versão mais recente do modelo do Google, também teve suas proteções derrubadas em pouco mais de uma hora após seu lançamento. A ferramenta Heretic já foi usada para desenvolver aproximadamente 3,5 mil modelos de IA sem censura, acumulando cerca de 13 milhões de downloads.
Riscos e implicações da remoção de barreiras de segurança
A ausência de barreiras de segurança em modelos de IA pode permitir a geração de conteúdos extremamente perigosos, como instruções para dispersão de gases tóxicos e materiais relacionados à pedofilia. A pesquisa destaca a importância dos 'guardrails' para garantir um uso seguro e responsável dessas tecnologias. A facilidade com que essas proteções podem ser removidas levanta preocupações sobre o potencial de uso indevido e os riscos associados à disseminação de modelos de IA sem controle.