O Institute of Foundation Models publicou o Uno, uma abordagem de inferência que combina um modelo autorregressivo com pesos de difusão leves para propor vários tokens em paralelo sem abandonar a distribuição definida pelo modelo original. O artigo foi submetido a 3 de setembro de 2026 e o repositório, sob licença Apache-2.0, disponibiliza código de inferência, treino e avaliação, além de pesos públicos.
A ideia central é separar os parâmetros responsáveis pela qualidade dos parâmetros usados para acelerar a geração. Os pesos autorregressivos mantêm-se como referência. Depois de serem congelados, são treinados adaptadores de difusão que propõem vários tokens em simultâneo. O amostrador Ψ-Spec verifica essas propostas contra a distribuição autorregressiva e aceita apenas o prefixo válido mais longo.
O que “sem perda” significa neste contexto
No Uno, lossless tem um significado probabilístico específico. O Ψ-Spec usa amostragem por rejeição para garantir que os tokens aceites seguem a mesma distribuição-alvo do modelo autorregressivo. Isto não quer dizer que duas execuções tenham de produzir exatamente o mesmo texto, nem que sejam impossíveis diferenças numéricas de implementação. Significa que a aceleração não troca deliberadamente a distribuição do modelo de referência por mais velocidade.
A distinção separa o Uno de duas abordagens comuns. A descodificação especulativa precisa normalmente de um modelo de rascunho separado, cujas propostas são verificadas pelo modelo principal. Os modelos de linguagem por difusão conseguem gerar blocos em paralelo, mas ainda enfrentam frequentemente um compromisso entre velocidade e qualidade. O Uno acrescenta a capacidade de difusão ao modelo autorregressivo e mantém este último como autoridade durante a validação.
O comportamento com concorrência é mais importante do que o pico de 3×
O artigo refere acelerações até 3× em algumas configurações, mas o resultado mais relevante para produção é o que acontece com várias requisições em simultâneo. Os autores mediram tanto o lote de tamanho 1 como o maior lote suportado por uma única GPU NVIDIA H200. No modelo Uno treinado de ponta a ponta, o maior lote suportado pelo modelo base foi 64 e o Uno foi cerca de 1,5× mais rápido nesse ponto. Com uma única requisição, a aceleração reportada foi de aproximadamente 2,2×.
Na variante baseada no Qwen3, o artigo reporta mais de 5 700 tokens por segundo no maior lote suportado e uma melhoria de cerca de 1,6× face ao modelo base. Nos testes dos autores, o Uno também superou EAGLE-3 e DFlash nas configurações comparadas.
Isto é particularmente relevante para sistemas com agentes. Um único pedido pode originar várias chamadas paralelas ao modelo, novas tentativas e ramos que utilizam ferramentas diferentes. Por isso, medir apenas a latência de uma requisição pode exagerar a utilidade prática de uma otimização. Uma melhoria que se mantém quando a GPU já está ocupada tem mais impacto no custo de serviço e na geração de trajetórias.
O lançamento inclui material suficiente para uma verificação séria
O repositório público inclui um motor de inferência baseado em Nano-vLLM, amostradores Ψ-Spec lineares e em árvore, código de treino dos adaptadores de difusão, carregadores de dados e avaliadores para benchmarks e receitas executáveis para Uno Qwen3 8B, Uno 8B e Uno 1B. Existem pesos públicos e estão documentados os passos para repetir treino, inferência e avaliação.
Esta abertura é importante porque os números de desempenho continuam a ser, essencialmente, resultados dos próprios autores. O artigo reporta 5 255 tokens por segundo para o Uno 8B numa comparação de débito do sistema em H200 e um resultado de 68,4 no SWE-bench Verified. Também apresenta resultados superiores aos modelos de difusão comparados em várias tarefas de agentes, programação e raciocínio com contexto longo. Até existir reprodução independente, estes valores devem ser tratados como medições do ambiente experimental da equipa.
A consequência arquitetural é mais interessante do que mais uma técnica de descodificação
A principal leitura da Aipolix é a separação entre a autoridade que define a qualidade e a maquinaria usada para acelerar a execução. No Uno, os pesos autorregressivos continuam a definir a distribuição-alvo. Os adaptadores de difusão funcionam como uma camada de otimização, e a verificação impede que essa camada altere silenciosamente o comportamento de referência.
É um padrão útil para além deste projeto. Sistemas de IA em produção precisam de componentes que possam ser substituídos ou ajustados sem mudar implicitamente o contrato comportamental do sistema. O Uno mostra uma forma concreta de aplicar essa ideia na inferência: gerar propostas de forma agressivamente paralela, mas submetê-las a uma verificação ligada à distribuição que continua a ser a referência.
Para equipas que operam agentes em grande volume, a pergunta prática é se os ganhos se mantêm no seu modelo, hardware, comprimento de contexto e nível de concorrência. O código aberto permite fazer esse teste. Uma avaliação adequada deve comparar latência de ponta a ponta, débito total, memória da GPU, taxa de aceitação, distribuição das respostas e custo das trajetórias geradas com a solução atual da organização.
O que está verificado e o que ainda precisa de confirmação
O artigo, o código, o pipeline de treino, os instrumentos de avaliação e os pesos públicos estão disponíveis. A licença Apache-2.0 permite inspecionar e executar a implementação. A designação “sem perda” também está ligada a um mecanismo técnico de verificação, e não apenas a uma afirmação genérica de que a qualidade se mantém.
O que ainda não foi confirmado de forma independente é toda a amplitude dos ganhos de desempenho. O pico de 3×, os resultados em H200 e as comparações de benchmarks vêm das experiências dos autores. Kernels, política de agrupamento em lotes, modelo base e parâmetros do amostrador podem alterar significativamente os resultados. O Uno é, por isso, uma abordagem nova, credível e reproduzível para acelerar inferência, mas ainda não demonstra que qualquer instalação autorregressiva obterá o mesmo ganho.