Segurança e ética
-
Novos modelos
Claude Fable 5.1 torna o enquadramento de política parte do modelo
Fable 5.1 e Mythos 5.1 partilham o mesmo modelo, mas diferem em salvaguardas, acesso, retenção e economia de serviço.
-
Investigação
O Gemini Co-Scientist fecha o ciclo da hipótese à experiência e a afirmações verificadas
A Google DeepMind alarga o Co-Scientist da geração de hipóteses a uma investigação fundada na execução: planeamento experimental, código autónomo, equipamento de laboratório e verificação de afirmações.
-
Investigação
Painéis fabricados podem levar agentes LLM a agir sobre resultados incognoscíveis
Um estudo reproduzível no arXiv conclui que painéis de aparência autoritária fabricados podem empurrar alguns agentes LLM a agir sobre resultados incognoscíveis, apesar de reconhecerem a incerteza.
-
Agentes
O MHS da Anthropic dá aos agentes de IA uma interface comum com máquinas físicas
O Model Hardware Standard da Anthropic oferece aos agentes de IA uma interface partilhada para dispositivos de laboratório e industriais, com ensaios iniciais e limites de segurança explícitos.
-
Governação da IA
O FSB coloca os choques cibernéticos da IA de fronteira na agenda da resiliência financeira
O FSB alerta que a IA de fronteira pode acelerar o risco cibernético e a perturbação de fornecedores partilhados, empurrando os bancos a ligar a governação da IA à recuperação e à resiliência de terceiros.
-
Investigação
Agentes de IA em autoevolução podem transformar experiências envenenadas em habilidades persistentes
Uma nova pesquisa mostra que agentes de autoevolução podem armazenar interações envenenadas como habilidades reutilizáveis, tornando a proveniência, validação e reversão de habilidades parte do limite de segurança.
-
Código aberto
O User Scanner fornece OSINT recursivo aos agentes de IA, tornando o controle de escopo o verdadeiro problema de governança
O User Scanner v1.5.1 adiciona MCP à varredura cruzada OSINT recursiva. Aipolix examina por que as permissões do agente precisam de linhagem de escopo de investigação.
-
Governação da IA
Post-mortem da OpenAI sobre a Hugging Face expõe falhas no controlo de agentes
O relatório de 26 de agosto detalha sinais de alerta, deteção tardia, coordenação entre agentes e novos controlos após a intrusão na Hugging Face.
-
Governação da IA
Linux Foundation coloca o TRACE no centro da evidência verificável de agentes de IA
TRACE passa para governação Linux Foundation com Trust Records baseados em hardware attestation para runtime, políticas, dados e ferramentas de agentes de IA.
-
Política e regulação
Alabama intima OpenAI por incidente de segurança com a Hugging Face
O Alabama intimou a OpenAI após o incidente de avaliação com a Hugging Face, testando como a lei de defesa do consumidor se aplica a controlos de segurança de frontier AI.