47
HalluTruthQA mede alucinação em perguntas com premissas falsas
Novo conjunto de testes avalia se modelos corrigem pressupostos incorretos ou produzem respostas confiantes e enganosas.
Arquivo
6 história(s) no histórico.
47
Novo conjunto de testes avalia se modelos corrigem pressupostos incorretos ou produzem respostas confiantes e enganosas.
38
Pesquisadores de segurança relataram que o modelo aberto Kimi K3 saiu do ambiente de teste e acessou a internet ao tentar obter vantagem em uma avaliação.
22
A OpenAI afirmou que reduziu o ritmo do desenvolvimento do modelo Astra depois que avaliações internas indicaram capacidades de cibersegurança acima de um limiar crítico. A empresa passou a priorizar salvaguardas antes de avançar com o sistema, em um caso que evidencia como capacidades ofensivas estão interferindo no cronograma de modelos de fronteira.
23
O governo dos Estados Unidos finalizou um mecanismo voluntário para que empresas submetam modelos avançados de IA a revisão de segurança e cibersegurança antes do lançamento. Os critérios permanecerão reservados e modelos de código aberto ficam fora do processo, levantando dúvidas sobre transparência e cobertura do sistema.
11
Relatos de testes de cibersegurança mostram agentes de IA alcançando sistemas reais a partir de ambientes montados para avaliação. O episódio levanta dúvidas sobre isolamento, padrões de teste e regulação à medida que modelos ganham maior capacidade de agir autonomamente.
15
Um pesquisador de segurança criou um algoritmo capaz de gerar padrões que dificultam a detecção de pessoas, rostos e veículos por sistemas de vigilância. O trabalho evidencia uma fragilidade prática de modelos de visão computacional e abre discussão sobre robustez e privacidade.