Recherche
-
Recherche
Un audit dâexperts rĂ©vĂšle que des dĂ©fauts de benchmark gonflent fortement les erreurs attribuĂ©es aux modĂšles
Six benchmarks de physique réévalués par des experts montrent que les défauts des tests et des évaluateurs peuvent modifier fortement les scores des modÚles.
-
Recherche
YuE2 associe génération musicale et partition éditable dans un modÚle aux poids publics
YuE2-3B combine planification symbolique, génération locale de morceaux complets et édition par agent, avec des limites de benchmark et de licence.
-
Recherche
K-Bench montre que le dĂ©sapprentissage dâun agent peut masquer des fuites hors de la rĂ©ponse finale
K-Bench montre quâun test limitĂ© Ă la rĂ©ponse peut manquer des secrets encore prĂ©sents dans la rĂ©cupĂ©ration, les outils et lâexĂ©cution.
-
Recherche
Le benchmark TAM révÚle les limites de GPT-5 face aux procédures longues et réglementées
Sur TAM, les configurations GPT-5 atteignent 1 % dâexact match en codage ICD et 15,5 % sur les calculs de peine.
-
Recherche
GuardedAct sĂ©pare la proposition de lâIA du droit dâagir en production
GuardedAct Ă©value une architecture oĂč les corrections gĂ©nĂ©rĂ©es par un LLM passent par simulation et contrĂŽle de risque avant toute exĂ©cution.
-
Recherche
NASA et IBM ouvrent leur modÚle lunaire, sans livrer toute la chaßne de préentraßnement
NASA et IBM publient leur modÚle lunaire, ses données et ses outils d'adaptation, mais le code de préentraßnement reste absent du dépÎt public.
-
Recherche
RAG-Safety-Bench montre que la sĂ©curitĂ© dâun modĂšle ne se transfĂšre pas automatiquement au RAG
RAG-Safety-Bench montre que la sécurité du modÚle de base ne suffit pas pour valider un systÚme RAG et propose quatre conditions de test contrÎlées.
-
Recherche
Réduire uniformément la puissance des entraßnements IA peut gaspiller du débit
L'étude PFI d'Emerald AI mesure des réponses trÚs différentes aux plafonds de puissance GPU et simule un ordonnancement ciblé des réductions.
-
Recherche
DeFiFlowBench montre quâun flux dâagent correct peut encore autoriser une transaction dangereuse
DeFiFlowBench montre quâun flux DeFi apparemment valide peut autoriser une transaction dangereuse et plaide pour des limites externes Ă lâexĂ©cution.
-
Recherche
EBL-Core distingue lâapprobation dâun agent de son droit effectif dâexĂ©cuter
EBL-Core propose de revĂ©rifier action, politiques, preuves et contexte quand un agent IA exerce une autoritĂ© Ă haut risque, et pas seulement lors de lâapprobation.