A Google DeepMind apresentou o SynthID Bio, uma família de métodos de marcação concebida para tornar mais rastreáveis as sequências de proteínas e as estruturas biomoleculares previstas que são geradas por IA. Em vez de associar a proveniência apenas através de metadados externos, os métodos incorporam um sinal detetável no próprio artefacto biológico produzido. A DeepMind descreve o trabalho como uma prova de conceito, e não como um sistema completo de biossegurança, mas a publicação é relevante porque combina testes laboratoriais de proteínas funcionais marcadas com uma abordagem separada para estruturas geradas pelo AlphaFold 3.

O método aplicado a sequências é integrado no ProteinMPNN, um modelo amplamente utilizado para conceção de sequências de proteínas. A DeepMind afirma ter usado estruturas de base conhecidas do AlphaProteo e gerado versões marcadas e não marcadas para comparação. Em testes laboratoriais com VEGF-A, o domínio de ligação ao recetor do SARS-CoV-2 e PD-L1, os desenhos marcados apresentaram taxas de ligação, afinidades e diversidade de sequência comparáveis às versões sem marca. O artigo publicado na Nature refere também ligantes na gama nanomolar baixa para o alvo do SARS-CoV-2 e subnanomolar para VEGF-A e PD-L1.

O sinal de proveniência acompanha o desenho biológico

A ideia arquitetural mais importante é que o sinal de proveniência é transportado pela própria sequência e não depende apenas de um registo numa base de dados ou de um invólucro de ficheiro. Numa proteína que seja efetivamente sintetizada, isso significa que a marca pode continuar a ser verificada depois de o desenho sair da cadeia de processamento de software e passar a existir como objeto biológico físico. É uma diferença relevante face a sistemas de proveniência que dependem da preservação de um registo lateral, de uma assinatura separada ou de uma pista de auditoria específica de uma plataforma.

O SynthID Bio não pretende tornar a sequência visivelmente ou funcionalmente distinta para um investigador. A deteção depende do conhecimento da forma como a marca foi gerada e da utilização do detetor correspondente. Na implementação para sequências publicada pela DeepMind, a marcação é aplicada durante a descodificação autorregressiva no ProteinMPNN. O repositório oficial disponibiliza parâmetros para incorporar o sinal e ferramentas para calcular valores de deteção em sequências FASTA existentes.

Isto cria uma consequência operacional para a governação: uma organização que utilize este tipo de marca terá de gerir versões de detetores, parâmetros de marcação e material de verificação como parte da sua infraestrutura de proveniência. Uma marca só é útil se a organização que recebe o artefacto conseguir determinar qual é o detetor e a configuração considerados autoritativos.

As estruturas do AlphaFold 3 usam um mecanismo separado

A DeepMind desenvolveu também o SynthID Bio-structure para estruturas biomoleculares previstas. Em vez de alterar um ficheiro de coordenadas depois da previsão, a abordagem ajusta uma pequena parte da rede de difusão do AlphaFold 3 para que as coordenadas geradas transportem diretamente um sinal detetável. Nos cenários testados, a DeepMind reporta deteção quase perfeita, mantendo a precisão de previsão do AlphaFold 3 e as principais distribuições estruturais. O sinal manteve-se igualmente perante ruído digital e pequenas alterações de coordenadas nos testes publicados.

Isto pode tornar-se importante porque as bases de dados estruturais incluem cada vez mais uma mistura de estruturas determinadas experimentalmente, previsões e artefactos concebidos computacionalmente. Uma marca incorporada ao nível do modelo poderia fornecer mais um sinal para identificar estruturas geradas por IA, desde que sobreviva às transformações que ocorrem durante o armazenamento, a conversão de formatos e a análise posterior.

As provas atuais não demonstram, contudo, robustez universal. A própria DeepMind identifica a resistência à remoção deliberada da marca como um problema em aberto. Um interveniente determinado pode otimizar contra um detetor conhecido, transformar uma sequência ou estrutura ou regenerar o artefacto com outro modelo. O artigo demonstra, por isso, viabilidade nos cenários testados, não uma garantia de proveniência impossível de contornar.

A proveniência pode complementar a triagem, não substituí-la

A interpretação mais útil é considerar o SynthID Bio um controlo adicional de proveniência, e não um substituto das medidas de biossegurança existentes. A triagem de encomendas de síntese de ADN, os controlos de acesso, os procedimentos laboratoriais, as salvaguardas dos modelos e os metadados de proveniência tratam riscos diferentes. Uma marca biológica pode ajudar a indicar se uma sequência ou estrutura foi produzida por um pipeline de geração por IA participante, mas não determina por si só se o objeto biológico é seguro, benigno ou apropriado para síntese.

Para fornecedores de síntese e gestores de bases de dados biológicas, este tipo de sinal poderá no futuro alimentar fluxos de revisão automatizados. A deteção de uma marca pode desencadear verificações adicionais de proveniência, identificar o sistema de geração envolvido ou ajudar a separar resultados sintéticos de material natural ou de dados experimentais. Para isso seriam necessárias regras claras sobre falsos positivos, falsos negativos, acesso aos detetores e interoperabilidade entre organizações.

A DeepMind sugere também combinar o SynthID Bio com abordagens de metadados semelhantes ao C2PA ou com repositórios de material biológico gerado por IA. Uma arquitetura em camadas é mais credível do que tratar a marcação como um único ponto de controlo, porque cada camada pode preservar um tipo diferente de evidência.

A publicação continua a ser uma prova de conceito

O âmbito dos resultados é importante. As experiências publicadas abrangem cenários específicos de conceção de proteínas ligantes e de previsão estrutural. Não demonstram que a marca sobreviva a todas as transformações biológicas posteriores, a todas as estratégias de edição de sequência ou a todas as famílias de modelos. A DeepMind afirma explicitamente que aumentar a robustez contra adulteração deliberada continua a ser um desafio importante.

A equipa está também a explorar a marcação de objetos biológicos mais complexos. A DeepMind descreve trabalho em curso com o laboratório de Hie na Stanford University e o Arc Institute para usar o Evo 2 na marcação do genoma de um bacteriófago concebido por IA, mas indica que o manuscrito técnico desse trabalho ainda será publicado.

Para equipas de engenharia, a conclusão imediata não é que a proveniência biológica esteja resolvida. A novidade é que a informação de proveniência pode potencialmente ser incorporada no próprio modelo de biologia generativa e transportada pela sequência ou estrutura produzida. Se a técnica amadurecer, a implementação exigirá as mesmas disciplinas que outros controlos de segurança: gestão de detetores e chaves, controlo de versões, interoperabilidade, testes adversariais e políticas explícitas sobre a forma como a presença ou ausência de uma marca deve alterar uma decisão operacional.

Fontes

https://deepmind.google/blog/introducing-synthid-bio/

https://www.nature.com/articles/s41586-026-10965-y

https://github.com/google-deepmind/synthidbio