Google DeepMind a présenté SynthID Bio, une famille de méthodes de filigranage destinée à rendre plus traçables les séquences protéiques et les structures biomoléculaires prédites générées par l’IA. Au lieu d’attacher la provenance uniquement sous forme de métadonnées externes, ces méthodes incorporent un signal détectable dans l’objet biologique généré lui-même. DeepMind présente le travail comme une preuve de concept, et non comme un système complet de biosécurité, mais la publication est notable parce qu’elle combine des essais en laboratoire sur des protéines fonctionnelles filigranées avec une méthode distincte pour les structures produites par AlphaFold 3.

La méthode appliquée aux séquences est intégrée à ProteinMPNN, un modèle largement utilisé pour la conception de séquences protéiques. DeepMind indique avoir utilisé des squelettes de protéines de liaison connus issus d’AlphaProteo et généré, pour comparaison, des séquences filigranées et non filigranées. Lors d’essais en laboratoire portant sur VEGF-A, le domaine de liaison au récepteur du SARS-CoV-2 et PD-L1, les conceptions filigranées ont obtenu des taux de liaison, des affinités et une diversité de séquences comparables aux versions non filigranées. L’article publié dans Nature rapporte également des protéines de liaison à faible concentration nanomolaire pour la cible SARS-CoV-2 et à concentration subnanomolaire pour VEGF-A et PD-L1.

Le signal de provenance accompagne la conception biologique

L’idée architecturale importante est que le signal de provenance est porté par la séquence elle-même et ne dépend pas uniquement d’un enregistrement de base de données ou d’une enveloppe de fichier. Pour une protéine effectivement synthétisée, cela signifie que le filigrane peut encore être recherché après le passage de la conception d’une chaîne de traitement logicielle à un objet biologique physique. C’est une différence importante par rapport aux systèmes de provenance qui reposent sur la conservation d’un enregistrement annexe, d’une signature séparée ou d’une piste d’audit propre à une plateforme.

SynthID Bio n’est pas censé rendre la séquence visiblement ou fonctionnellement particulière pour le chercheur. La détection dépend de la connaissance de la méthode de génération du filigrane et de l’utilisation du détecteur correspondant. Dans l’implémentation de séquence publiée par DeepMind, le filigranage intervient pendant le décodage autorégressif de ProteinMPNN. Le dépôt officiel expose les paramètres utilisés pour intégrer le signal ainsi que des outils permettant de calculer des valeurs de détection sur des séquences FASTA existantes.

Cela crée une conséquence concrète pour la gouvernance : une organisation qui déploierait ce type de filigrane devrait gérer les versions de détecteurs, les paramètres de filigranage et le matériel de vérification comme des éléments de son infrastructure de provenance. Un signal n’est utile que si l’organisation qui reçoit l’artefact peut déterminer quel détecteur et quelle configuration font autorité.

Les structures AlphaFold 3 utilisent un mécanisme distinct

DeepMind a également développé SynthID Bio-structure pour les structures biomoléculaires prédites. Au lieu de modifier un fichier de coordonnées après la prédiction, l’approche ajuste une petite partie du réseau de diffusion d’AlphaFold 3 afin que les coordonnées générées transportent directement un signal détectable. Dans les conditions testées, DeepMind rapporte une détection presque parfaite tout en maintenant la précision de prédiction d’AlphaFold 3 et les principales distributions structurelles. Le signal résiste également au bruit numérique et à de petites modifications des coordonnées dans les expériences rapportées.

Ce point compte parce que les bases de données structurelles rassemblent de plus en plus de structures déterminées expérimentalement, de prédictions et d’objets conçus par calcul. Un filigrane intégré au modèle pourrait devenir un signal supplémentaire pour identifier les structures générées par l’IA, à condition de survivre aux transformations habituelles liées au stockage, au changement de format et aux analyses ultérieures.

Les éléments actuels ne démontrent cependant pas une robustesse universelle. DeepMind présente explicitement la résistance à la suppression délibérée du filigrane comme un problème encore ouvert. Un acteur déterminé pourrait optimiser une conception contre un détecteur connu, modifier une séquence ou une structure, ou régénérer l’artefact avec un autre modèle. L’article démontre donc la faisabilité dans les contextes testés, pas une garantie de provenance impossible à contourner.

La provenance peut compléter le filtrage sans le remplacer

L’interprétation la plus utile consiste à voir SynthID Bio comme un contrôle de provenance supplémentaire, et non comme un remplacement des mesures de biosécurité existantes. Le filtrage des commandes de synthèse d’ADN, les contrôles d’accès, les procédures de laboratoire, les garde-fous des modèles et les métadonnées de provenance couvrent des modes de défaillance différents. Un filigrane biologique peut aider à déterminer si une séquence ou une structure provient d’un pipeline d’IA participant au dispositif, mais il ne détermine pas si l’objet biologique est sûr, bénin ou approprié à synthétiser.

Pour les fournisseurs de synthèse et les gestionnaires de bases de données biologiques, ce type de signal pourrait à terme alimenter des processus d’examen automatisés. La détection d’un filigrane pourrait déclencher des vérifications supplémentaires de provenance, identifier le système de génération concerné ou aider à distinguer une sortie synthétique de matériel naturel ou expérimental. Ces usages nécessiteraient toutefois des règles claires concernant les faux positifs, les faux négatifs, l’accès aux détecteurs et l’interopérabilité entre acteurs.

DeepMind évoque également l’association de SynthID Bio avec des approches de métadonnées comparables à C2PA ou avec des référentiels dédiés aux objets biologiques générés par l’IA. Cette architecture en couches est plus crédible qu’un contrôle unique, car chaque couche peut préserver une catégorie différente d’éléments de preuve.

La publication reste une preuve de concept

La portée des résultats doit rester précise. Les expériences publiées concernent des contextes déterminés de conception de protéines de liaison et de prédiction structurelle. Elles ne montrent pas que le filigrane résiste à toutes les transformations biologiques ultérieures, à toutes les stratégies d’édition de séquence ou à toutes les familles de modèles. DeepMind indique que l’amélioration de la résistance à la falsification volontaire reste un chantier majeur.

L’équipe explore aussi le filigranage d’objets biologiques plus complexes. DeepMind décrit un travail en cours avec le laboratoire de Hie à Stanford University et Arc Institute autour d’Evo 2 pour filigraner le génome d’un bactériophage conçu par IA, tout en précisant que le manuscrit technique correspondant n’est pas encore publié.

Pour les équipes d’ingénierie, la conclusion immédiate n’est donc pas que le problème de provenance biologique est résolu. Le point nouveau est qu’une information de provenance peut potentiellement être conçue directement dans un modèle de biologie générative puis transportée par la séquence ou la structure produite. Si la technique mûrit, son déploiement exigera les mêmes disciplines que les autres contrôles de sécurité : gestion des détecteurs et des clés, versionnage, interopérabilité, tests adverses et règles explicites sur la manière dont la présence ou l’absence d’un filigrane doit modifier une décision opérationnelle.

Sources

https://deepmind.google/blog/introducing-synthid-bio/

https://www.nature.com/articles/s41586-026-10965-y

https://github.com/google-deepmind/synthidbio