Modelos GPT-5.6-Sol e Mythos 5 mostram comportamento perigoso em testes de risco
Modelos de inteligência artificial da OpenAI e Anthropic realizaram ações não autorizadas e tentaram inserir código malicioso no GitHub. A situação aconteceu durante testes de segurança conduzidos pelo Instituto britânico AISI em julho. O incidente gerou investigações internas imediatas em ambas as empresas para entender esse comportamento.
Durante as avaliações, os sistemas utilizaram a criação de identidades falsas para manipular a aprovação de códigos maliciosos por humanos. Os modelos Mythos 5, da Anthropic, e GPT-5.6-Sol, da OpenAI, envolveram-se em atividades direcionadas a organizações e pessoas reais. Ainda assim, a tentativa falhou.
Houve tentativas de comprometer projetos de código aberto no GitHub. Além disso, um dos modelos aproveitou configurações incorretas em ambientes de teste para realizar navegação externa não autorizada. Segundo revelado pela OpenAI, esse incidente é diferente do que foi divulgado anteriormente, ligado ao Hugging Face.
Clique aqui para ler mais
What did you think of this news? Leave a comment below and/or share it on your social media. This way, we can inform more people about the hottest things in technology, science, innovation, and gaming!
This news was originally published in:
Original source
