OpenAI endurece regras de cibersegurança para evitar comportamentos criminosos de IAs
A OpenAI anunciou novas diretrizes de segurança mais rígidas para o treinamento de seus modelos de linguagem. As medidas incluem o isolamento de modelos em ambientes controlados (sandboxes) sem acesso à internet, a remoção de serviços compartilhados vulneráveis e um monitoramento em tempo real para detectar comportamentos destrutivos ou tentativas de burlar proteções. O objetivo é garantir que as IAs sejam 'treinadas para serem mais honestas' e não tomem atitudes questionáveis durante fases de teste.
Novas medidas de segurança
As novas regras da OpenAI visam impedir que modelos em fase de teste causem incidentes de invasão ou roubo de dados. A empresa reforçou o monitoramento de todas as inferências e atividades de teste para identificar riscos de acesso não autorizado. Além disso, o processo de alinhamento foi aprimorado para garantir que as IAs respondam apenas à supervisão humana e não explorem vulnerabilidades para cumprir objetivos de forma inadequada.