Agents
-
Nouveaux modĂšles
Jev mise sur des décisions typées plutÎt que sur la génération libre
Le modÚle Jev de TypeSafe AI cible les décisions structurées rapides; ses gains de vitesse, de coût et de calibration restent à confirmer indépendamment.
-
Agents
à Galaxy, Grok Bot passe aux tùches réelles sans encore prouver sa fiabilité
Grok Bot Galaxy montre des agents persistants dans des processus mĂ©tiers. Aipolix analyse ce que lâĂ©vĂ©nement permet dâobserver sans confondre dĂ©monstration et Ă©valuation indĂ©pendante.
-
Agents
Copilot peut privilégier le coût ou la qualité, mais Efficiency ne fixe aucun budget
Efficiency, Balance et Intelligence pilotent le routage de Copilot Auto, sans remplacer les contrĂŽles budgĂ©taires ni les politiques dâentreprise.
-
Agents
Copado encadre le déploiement des agents avec MCP et des validations explicites
Agentia Headless donne aux agents un accÚs MCP et CLI au delivery, tout en conservant validations, contrÎles et état de livraison hors du modÚle.
-
Recherche
K-Bench montre que le dĂ©sapprentissage dâun agent peut masquer des fuites hors de la rĂ©ponse finale
K-Bench montre quâun test limitĂ© Ă la rĂ©ponse peut manquer des secrets encore prĂ©sents dans la rĂ©cupĂ©ration, les outils et lâexĂ©cution.
-
Recherche
Le benchmark TAM révÚle les limites de GPT-5 face aux procédures longues et réglementées
Sur TAM, les configurations GPT-5 atteignent 1 % dâexact match en codage ICD et 15,5 % sur les calculs de peine.
-
Agents
Lâagent dâanalyse de donnĂ©es dâOpenAI arrive dans ChatGPT Work, sans rĂ©fĂ©rence publique de prĂ©cision
Lâagent Data dâOpenAI respecte les permissions des sources et produit des tableaux de bord, mais lâabsence de benchmark public renforce le besoin dâĂ©valuation et de gouvernance sĂ©mantique.
-
Agents
Fugu Max simplifie le recours Ă plusieurs modĂšles, au prix dâun contrĂŽle plus centralisĂ©
Sakana Fugu Max et Ultra v2 proposent un routage multimodÚle à tarif fixe, avec des enjeux de gouvernance, de reproductibilité et de disponibilité en Europe.
-
Agents
Lâincident RubyGems montre comment la publication de paquets peut devenir une voie dâexĂ©cution pour un agent
Lâincident RubyGems montre pourquoi la sĂ©curitĂ© des agents doit intĂ©grer la publication de paquets et lâautomatisation des builds dans la surface dâexĂ©cution.
-
đ Sans confinement, la gouvernance de lâIA cĂšde au moment critique (6/10)
ArrĂȘt indĂ©pendant, rayon dâimpact, rollback, canaris comportementaux et rĂ©cupĂ©ration : les capacitĂ©s nĂ©cessaires pour contenir les agents IA.