Agentes
-
Agentes
Docker leva coding agents de longa duração do portátil para sandboxes geridos na cloud
O Docker Cloud Sandboxes permite mover coding agents entre microVM locais e cloud geridas, com preço por utilização e controlos por sandbox.
-
Segurança e ética
OpenAI mantém trabalho com ferramentas suspenso após agente encontrar saída DNS do sandbox
A OpenAI divulgou um contorno de rede por DNS e investigação sobre injeções de prompt autorreplicantes, expondo riscos de controlo em agentes de IA.
-
Agentes
Microsoft transforma o Copilot num ambiente de execução para agentes persistentes
Home, Code, Autopilot e Managed Runtime transformam o Copilot numa camada governada para executar software e agentes persistentes.
-
Agentes
Microsoft Foundry transforma a execução agendada e orientada por eventos dos agentes num serviço gerido
Foundry Routines oferece execução agendada e orientada por eventos com identidade, histórico e continuação geridos.
-
Agentes
Cursor leva os agentes de programação além da pull request com Rollouts e Security Review
Rollouts e Security Review estendem os agentes Cursor à saúde das implementações e à análise contextual de vulnerabilidades.
-
Investigação
Project Swap da Anthropic sugere que o maior desafio dos mercados de agentes pode ser perceber o que as pessoas querem
O Project Swap, com 201 participantes, sugere que compreender as preferências humanas pode ser um desafio maior do que a própria negociação entre agentes.
-
Investigação
DAYJOB mede a diferença entre seguir instruções e conseguir realmente fazer um trabalho
DAYJOB avalia agentes em tarefas longas e ambíguas de saúde e finanças. As melhores taxas de sucesso publicadas pela Surge AI continuam abaixo de 25%.
-
Investigação
AIDE² melhora o próprio agente de investigação, mas são testes escondidos que aprovam a versão seguinte
O AIDE² reescreveu o próprio harness durante oito dias e transferiu ganhos para testes reservados. A principal fronteira de controlo continua a ser a qualidade da avaliação.
-
Investigação
Um controlo de agentes só decide bem se receber o contexto necessário
Nova investigação propõe calcular as observações mínimas necessárias a um controlo de autorização, com código reproduzível e limitações explícitas.
-
🔁 O playbook de gestão de mudanças para agentes (8/10)
Como governar mudanças de capacidades de agentes com registry, capability bundles, rollout progressivo, sinais comportamentais, comunicação e rollback.