Decrypt logoOpenAI. Image: Decrypt/Shutterstock

Em resumo

  • A OpenAI introduziu o GPT-Red, um sistema automatizado de IA projetado para encontrar vulnerabilidades em modelos GPT antes do lançamento.
  • A empresa disse que o GPT-Red foi usado para treinar o GPT-5.6, reduzindo falhas em um de seus benchmarks de injeção imediata mais difíceis.
  • O sistema destina-se a complementar equipes vermelhas humanas, testes de terceiros e outras medidas de segurança de IA.

A OpenAI introduziu o GPT-Red, um sistema automatizado de IA projetado para encontrar vulnerabilidades de segurança em seus modelos de linguagem.

GPT-Red leva o nome de red teaming de segurança cibernética, que é a prática de tentar deliberadamente quebrar um sistema para identificar pontos fracos antes que os invasores possam explorá-los.

Em uma postagem na quarta-feira, a OpenAI disse que a ferramenta ajudou a tornar o GPT-5.6 mais resistente a ataques de injeção imediata antes da implantação.

“À medida que as capacidades do modelo crescem, a segurança e o alinhamento devem ser escalonados com elas”, escreveu OpenAI no X. “A formação de equipes vermelhas é essencial, mas as abordagens atuais são difíceis de escalar, criando um gargalo crítico. GPT-Red é uma maneira de abordarmos isso.”

De acordo com a OpenAI, o GPT-Red foi treinado por meio de aprendizado de reforço de autojogo, gerando ataques de injeção imediata progressivamente mais fortes, enquanto os modelos de defesa aprendiam a resistir a eles. A empresa disse que esses ataques foram incorporados ao processo de treinamento do GPT-5.6, relatando que o GPT-Red teve sucesso em 84% dos cenários de avaliação interna, em comparação com 13% dos red teamers humanos nos mesmos testes.

“O GPT‑Red aprende por meio do autojogo adversário, onde seu objetivo é injetar uma variedade de modelos de defesa desafiadores”, escreveu OpenAI. “Cada ataque bem-sucedido que o GPT-Red encontra é usado para melhorar esses defensores, forçando o GPT-Red a encontrar continuamente falhas mais amplas e complexas.”

Num estudo de caso, a OpenAI disse que o sistema manipulou um agente de máquina de venda automática para reduzir preços, encomendar inventário com desconto e cancelar o pedido de outro cliente antes que as vulnerabilidades fossem divulgadas e resolvidas.

GPT-Red segue anos de esforços de segurança cibernética da OpenAI após o lançamento público do ChatGPT.

Em 2023, a empresa lançou sua OpenAI Red Teaming Network, recrutando pesquisadores externos de segurança cibernética e especialistas de domínio para investigar o ChatGPT e outros modelos em busca de falhas de segurança antes do lançamento. O GPT-Red expande esse esforço ao automatizar grande parte do processo, usando um modelo de IA para gerar ataques de injeção imediata e outros testes adversários em uma escala que seria difícil apenas para pesquisadores humanos.

O anúncio da OpenAI reflete uma mudança mais ampla em direção ao uso de IA para proteger a IA.

No início deste mês, a Fundação Ethereum disse que havia implantado agentes de IA para formar equipes de infraestrutura de rede crítica, descobrindo uma vulnerabilidade no software usado pelos clientes de consenso Ethereum. Os pesquisadores disseram que os agentes de IA podem pesquisar bases de código maiores do que os humanos, mas o desafio mudou de encontrar possíveis bugs para provar quais deles são exploráveis.

De acordo com a OpenAI, o GPT-Red continuará sendo uma ferramenta interna porque contém capacidades ofensivas desenvolvidas intencionalmente.

“Acreditamos que com o GPT-Red começamos a desbloquear um volante semelhante para segurança, onde os modelos de hoje podem ser usados ​​para tornar os modelos de amanhã mais robustos, alinhados e confiáveis”, disseram.

Resumo Diário Boletim informativo

Comece cada dia com as principais notícias do momento, além de recursos originais, podcast, vídeos e muito mais.

Fontedecrypt

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *