Satya Nadella, presidente executivo da Microsoft, publicou um ensaio extenso em que defende que as empresas deixem de olhar para os modelos de IA de fronteira como caixas negras dignas de confiança e passem a tratá-los como os departamentos de segurança tratam funcionários com acesso privilegiado: como riscos internos. O texto, intitulado "Models as Insider Risks in the Super Intelligence Era", foi divulgado na sua conta do X a 10 de outubro e chegou rapidamente ao TechCrunch e ao The Verge, sobretudo por causa de uma frase. Segundo Nadella, deve partir-se do princípio de que um modelo está comprometido e contê-lo desde o primeiro momento, "como um travão de emergência".

O ponto de partida é uma lacuna de conhecimento. No software tradicional, os engenheiros conseguiam ligar um comportamento a um caminho concreto no código. Nos sistemas atuais, escreve, ninguém consegue atribuir um resultado a dados de treino ou a pesos específicos, e mesmo assim estes sistemas recebem dados sensíveis e poder para executar ações relevantes. As garantias dadas pelo fornecedor do modelo, sublinha, não retiram a responsabilidade a quem o implementa.

A proposta central é separar o fornecimento de inteligência da autoridade sobre ela. Na prática, o modelo deve ficar isolado do sistema que orquestra o seu trabalho e do conjunto de ações que lhe é permitido, com os controlos e salvaguardas colocados fora dele. Nadella recupera uma regra antiga da segurança informática: nenhum programa deve conseguir contornar ou adulterar o mecanismo que aplica as suas próprias permissões.

Seguem-se sete princípios. Nenhum modelo deve ser a única dependência de um resultado importante nem verificar o próprio trabalho. Cada ação relevante deve deixar provas invioláveis e legíveis por pessoas, para que seja possível reconstituir o que aconteceu sem pedir ao modelo que o confirme. O sistema inteiro deve ser testado em permanência, incluindo ataques e falhas. As organizações devem decidir de forma independente a que pode o modelo aceder e o que pode fazer, e a validação não pode ficar a cargo da própria inteligência validada. Uma pessoa autorizada deve poder sempre pausar ou desligar o modelo a meio de uma tarefa, e modelos mais capazes vão exigir tecnologias de contenção que a indústria deverá normalizar. Por fim, as falhas devem ser comunicadas depressa a quem é afetado, com partilha setorial sobre os controlos que falharam.

O gestor considera "inegociável" a transparência da cadeia de raciocínio, embora admita que não basta, porque o raciocínio apresentado pelos modelos nem sempre corresponde ao que realmente fazem. Pôr modelos a testar outros modelos é útil, reconhece, mas pode resultar em caixas negras umas dentro das outras.

O momento não é indiferente. O ensaio surgiu um dia depois de a Anthropic ter divulgado um relatório sobre ações não pretendidas dos modelos Claude em avaliações e uso interno, e o TechCrunch enquadrou-o numa série de episódios em que empresas de IA pareceram perder o controlo dos seus sistemas. O The Verge notou que a maioria das recomendações, como a divulgação de incidentes, as auditorias independentes e a contenção, coincide com o que outros já propuseram, indo a exigência explícita de paragem um pouco mais longe.

Trata-se de uma declaração de princípios e não do anúncio de um produto ou de uma política. O texto não refere nenhum produto da Microsoft, não fixa prazos e não explica como estas ideias se aplicam aos serviços de IA da empresa. Nadella usa ainda a expressão "Super Intelligence" para descrever os sistemas atuais, opção que ambos os meios assinalaram. Fica por saber se estas propostas se vão traduzir em normas ou em compromissos contratuais da Microsoft e dos concorrentes.

Referências