Recherche

AdaptRubric crée des critères de réussite propres à chaque tâche des agents GUI

Les agents GUI deviennent plus performants pour naviguer dans des applications, cliquer sur des contrôles et exécuter des workflows en plusieurs étapes. Leur entraînement dépend pourtant toujours d'une question difficile : comment déterminer si l'agent a réellement fait ce que l'utilisateur demandait ?

Un nouvel article, Task-Adaptive Rubrics for GUI Reward Modeling, présente AdaptRubric, un framework qui construit des critères d'évaluation spécifiques à chaque tâche pour les reward models d'agents GUI. Les chercheurs estiment que les verifiers actuels reposent trop souvent sur des rubriques génériques ou sur un raisonnement implicite qui ne s'adapte pas suffisamment à chaque instruction. Ils peuvent ainsi transférer des contrôles d'une tâche à une autre, ignorer une contrainte concrète de la requête ou imposer une exigence jamais formulée par l'utilisateur.

Une rubrique coarse-to-fine pour chaque tâche

AdaptRubric construit ses critères en deux étapes. L'étape coarse associe d'abord l'instruction à une famille de tâches GUI et récupère des critères réutilisables pour cette catégorie. L'étape fine extrait ensuite les éléments propres à l'instance actuelle, notamment les valeurs, la portée et les contraintes explicitement demandées.

Le verifier reçoit ainsi une rubrique compacte adaptée à la tâche plutôt qu'une checklist universelle appliquée à toutes les trajectoires.

Cette distinction est importante parce que les outcome reward models ne servent pas uniquement à évaluer des exécutions terminées. Ils peuvent également produire le signal de récompense utilisé pendant le reinforcement learning. Une mauvaise définition du succès peut donc amener la politique à optimiser précisément cette mauvaise définition.

Des gains rapportés en évaluation et en entraînement

Selon les auteurs, AdaptRubric améliore le F1 de 3,6 points par rapport à la moyenne des baselines en évaluation offline avec un budget d'images comparable. Lorsqu'il est utilisé pour l'optimisation par reinforcement learning en ligne, le système produit un gain de 4,23 points du taux de réussite des tâches.

Le résultat met en évidence une leçon plus générale pour l'architecture des agents : améliorer un agent ne signifie pas nécessairement remplacer le modèle sous-jacent. La qualité du verifier, du reward model et de la définition du succès peut modifier à la fois l'évaluation de l'agent et ce qu'il apprend pendant l'entraînement.

Pour les agents GUI, de petits détails de l'instruction peuvent suffire à déterminer si le workflow est correct. Un verifier peut comprendre l'objectif général tout en manquant une valeur, une portée ou une contrainte précise, et donc attribuer une récompense incorrecte.

Pourquoi cela compte pour l'ingénierie des agents

AdaptRubric déplace l'attention de la question « le modèle peut-il effectuer la tâche ? » vers une seconde question tout aussi importante : « le système peut-il reconnaître de manière fiable que la tâche a été correctement effectuée ? »

Cette distinction devient plus importante à mesure que les agents opèrent de manière autonome dans les navigateurs, les logiciels de bureau et les applications d'entreprise, où le succès dépend souvent du respect de plusieurs contraintes explicites plutôt que d'un écran final simplement plausible.

Le travail s'inscrit également dans une tendance plus large de l'ingénierie des agents : renforcer l'infrastructure d'évaluation autour du modèle avec des verifiers spécifiques aux tâches, des politiques explicites, l'analyse des trajectoires et des systèmes de récompense capables de distinguer un comportement plausible d'un véritable respect de l'instruction.

Les résultats doivent cependant rester considérés comme ceux d'un nouveau preprint. Les améliorations sont rapportées par les auteurs et devront être reproduites et testées indépendamment sur d'autres environnements GUI et architectures d'agents.

Le signal principal reste important : de meilleurs critères de récompense peuvent améliorer à la fois la mesure et l'entraînement des agents GUI. À mesure que les agents gagnent en autonomie, définir précisément le succès peut devenir aussi important qu'augmenter les capacités du modèle.

Source
- Task-Adaptive Rubrics for GUI Reward Modeling

Publié: