Agents
-
Agents
Docker déplace les agents de programmation de longue durée vers des sandboxes cloud gérés
Docker Cloud Sandboxes permet de déplacer des agents de programmation entre microVM locales et cloud gérées, avec tarification à l'usage et contrÎles par sandbox.
-
Sûreté et éthique
OpenAI suspend les usages dâoutils aprĂšs quâun agent a trouvĂ© une sortie DNS du sandbox
OpenAI révÚle un contournement réseau par DNS et des injections de prompt auto-répliquantes, deux signaux sur les limites de contrÎle des agents.
-
Agents
Microsoft transforme Copilot en environnement dâexĂ©cution pour agents persistants
Home, Code, Autopilot et Managed Runtime font Ă©voluer Copilot vers une couche dâexĂ©cution gouvernĂ©e pour agents persistants.
-
Agents
Microsoft Foundry transforme lâexĂ©cution planifiĂ©e et Ă©vĂ©nementielle des agents en service managĂ©
Foundry Routines apporte aux agents des dĂ©clenchements planifiĂ©s ou Ă©vĂ©nementiels, un choix dâidentitĂ© et un historique dâexĂ©cution managĂ©s.
-
Agents
Cursor pousse ses agents de code au-delĂ de la pull request avec Rollouts et Security Review
Rollouts et Security Review prolongent les agents Cursor vers la santĂ© des dĂ©ploiements et lâanalyse des chemins dâattaque.
-
Recherche
Project Swap d'Anthropic montre que le vrai dĂ©fi des marchĂ©s d'agents peut ĂȘtre de comprendre les prĂ©fĂ©rences humaines
L'expĂ©rience Project Swap menĂ©e auprĂšs de 201 personnes suggĂšre que comprendre les prĂ©fĂ©rences humaines peut ĂȘtre un dĂ©fi plus important que la nĂ©gociation elle-mĂȘme.
-
Recherche
DAYJOB mesure lâĂ©cart entre suivre des instructions et rĂ©ellement faire un mĂ©tier
DAYJOB évalue des agents sur des tùches longues et ambiguës en santé et finance. Les meilleurs taux de réussite publiés par Surge AI restent sous 25 %.
-
Recherche
AIDEÂČ réécrit son agent de recherche, mais des Ă©valuations cachĂ©es choisissent la version suivante
AIDEÂČ a réécrit son propre harness pendant huit jours et transfĂ©rĂ© des gains vers des tests rĂ©servĂ©s. Lâenjeu central reste la qualitĂ© de la barriĂšre dâĂ©valuation.
-
Recherche
Un contrĂŽle dâagent ne vaut que par les informations quâil peut rĂ©ellement voir
Une recherche rĂ©cente propose de calculer les observations minimales nĂ©cessaires Ă un contrĂŽle dâautorisation, avec code reproductible et limites explicites.
-
đ Le playbook de gestion du changement pour les agents (8/10)
Registry, capability bundles, staged rollout, signaux comportementaux, communication et rollback pour gouverner les changements de capacités des agents.