Recherche

Inherent entraîne Faraday 27B à répliquer la recherche

Inherent a présenté Faraday, un agent scientifique de 27 milliards de paramètres entraîné à reproduire des résultats de recherche plutôt qu’à simplement résumer des articles. L’article scientifique et le billet de recherche d’Inherent introduisent Replica, un benchmark et un espace d’entraînement par renforcement centré sur une compétence difficile : reconstruire une expérience lorsque des détails d’implémentation importants manquent dans la publication.

Replica rassemble 310 tâches tirées de 100 articles de machine learning et d’AI for science. Pour chaque tâche, une figure de résultats est retirée et l’agent doit la reproduire avec un budget limité en temps et en calcul. Il ne suffit donc pas d’écrire du code. Le système doit interpréter une méthode sous-spécifiée, choisir des expériences, diagnostiquer les échecs et juger si le résultat reste fidèle aux conclusions de l’article original.

Faraday repose sur un modèle 27B et est post-entraîné avec du reinforcement learning à long horizon. Surtout, il peut utiliser des coding agents comme outils. Inherent explique que cette configuration apprend au modèle plus petit à diriger un système de codage plus puissant tout en ajoutant un niveau de jugement scientifique sur la prochaine expérience à tenter et sur la manière d’évaluer le résultat. Selon l’entreprise, Faraday obtient un score supérieur à Claude Opus 4.8 et GPT-5.5 sur les tâches de réplication held-out de Replica.

Cette affirmation demande toutefois une nuance importante. Faraday n’est pas un modèle autonome de 27B qui bat des systèmes frontier dans une comparaison simple modèle contre modèle. Inherent indique explicitement qu’il peut employer GPT-5.5 Codex comme outil. L’avantage annoncé porte donc sur l’orchestration et la prise de décision scientifique apprise dans le cadre de Replica, et non sur une supériorité générale du modèle de base 27B face à GPT-5.5 ou Claude Opus 4.8.

L’évaluation dépend aussi d’un juge automatisé fondé sur des rubriques. Reproduire une figure scientifique n’est pas une tâche parfaitement vérifiable avec une seule réponse numérique. Les chercheurs génèrent donc des critères propres à chaque tâche et utilisent un juge qui évalue la conception expérimentale, les bonnes pratiques scientifiques et la fidélité à l’article source. Ils rapportent que ce système est plus cohérent et mieux aligné avec les évaluations humaines qu’un LLM-judge plus simple. Le benchmark et le cadre d’entraînement restent néanmoins produits par les auteurs, ce qui rend la reproduction indépendante importante.

L’intérêt plus large vient du choix de la réplication comme objectif d’apprentissage. Les publications scientifiques omettent souvent les essais négatifs, les décisions intermédiaires et des détails techniques. Un système capable de retrouver ces étapes doit explorer des hypothèses plutôt que suivre une procédure explicite. Inherent considère donc la réplication comme un curriculum potentiel pour des agents capables, à terme, de recherche plus ouverte.

Faraday est ainsi intéressant moins comme un renversement de benchmark que comme un schéma de système pour l’AI for science : un contrôleur appris relativement compact, du reinforcement learning à long horizon, des coding agents comme outils et une évaluation qui récompense le jugement scientifique. Si cette approche se généralise au-delà de Replica, elle pourrait déplacer une partie du développement de l’IA scientifique des modèles monolithiques toujours plus grands vers des couches d’orchestration entraînées à utiliser rigoureusement des outils puissants.

## Sources

- Inherent: Training AI Scientists to Replicate Research
- arXiv: Training AI Scientists to Replicate Research

Publié: