Novos modelos

Tencent abre Hy4 preview para programação e agentes com contexto de um milhão de tokens

A Tencent lançou o Hy4 preview a 28 de agosto como um grande modelo de linguagem aberto orientado para engenharia de software, trabalho de escritório e investigação científica. A relevância do lançamento não está apenas no facto de a Tencent o posicionar entre os modelos de topo. O ponto mais concreto é a entrega de uma superfície completa para developers: pesos descarregáveis sob licença Apache 2.0, uma janela de contexto de um milhão de tokens, caminhos documentados de deployment com vLLM e SGLang, ferramentas de finetuning e quantização e acesso pago por API.

Esta combinação torna o Hy4 preview uma opção prática para equipas que estão a avaliar grandes modelos abertos para trabalho agentic de contexto longo. Segundo o anúncio da Tencent, o modelo tem 770 mil milhões de parâmetros no total, mas ativa 49 mil milhões por token. O repositório oficial descreve uma arquitetura Mixture-of-Experts com 256 experts encaminhados, oito experts encaminhados ativos por token, um expert partilhado, sparse attention e uma camada nativa para speculative decoding. A Reuters confirmou de forma independente o lançamento de 28 de agosto e o foco em programação, investigação e trabalho analítico.

Um modelo muito grande com uma pegada ativa menor

O Hy4 preview é grande mesmo pelos padrões atuais dos modelos abertos. A Tencent indica 770 mil milhões de parâmetros no backbone, 49 mil milhões de parâmetros ativos e um comprimento de contexto de um milhão de tokens. O desenho Mixture-of-Experts significa que a maioria dos parâmetros não é ativada para cada token. Isso não torna o deployment leve, mas altera o perfil computacional face a um modelo dense com dimensão total semelhante.

O repositório expõe detalhes de arquitetura úteis para equipas de infraestrutura, em vez de disponibilizar apenas um endpoint alojado. O backbone tem 78 camadas. A Tencent afirma que o caminho de attention usa Gated DeepSeek Sparse Attention com um mecanismo IndexCache para reutilizar índices sparse entre camadas. Inclui ainda uma camada nativa de multi-token prediction destinada a suportar speculative decoding. O repositório fornece documentação para deployment com vLLM e SGLang, bem como percursos de finetuning e quantização.

Para arquitetos, isto significa que o Hy4 preview pode ser avaliado como um modelo que uma organização consegue operar e modificar, e não apenas consumir através de uma interface alojada. A licença Apache 2.0 é especialmente relevante para empresas que precisam de direitos mais claros para adaptação interna e redistribuição do que os oferecidos por licenças específicas e mais restritivas. Cada equipa continua a ter de rever a licença completa e os seus requisitos de conformidade, mas esta escolha reduz uma barreira comum à adoção.

A Tencent está focada em produtos de trabalho, não apenas em chat

A Tencent posiciona o Hy4 preview para workloads de produtividade, e não apenas para benchmarks conversacionais. A empresa afirma ter criado dados de treino com engenheiros de software, developers de jogos, analistas financeiros e especialistas de segurança internos. O objetivo declarado são tarefas de longa duração que incluem planeamento, debugging, validação, análise entre vários documentos e criação de artefactos como documentos, folhas de cálculo e apresentações.

O modelo também está integrado em produtos como CodeBuddy e WorkBuddy, e a Tencent afirma que está disponível através do Tencent Cloud TokenHub e do OpenRouter. O preview pode, por isso, ser avaliado por vários caminhos: self-hosting dos pesos, utilização de uma API gerida ou teste em produtos que encapsulam workflows agentic em torno do modelo.

A Tencent reporta uma avaliação interna cega com 163 especialistas e 203 tarefas de engenharia, na qual o Hy4 preview obteve 2,99 em 4, ligeiramente acima dos modelos de comparação citados pela empresa. Estes números devem ser tratados como evidência reportada pelo fornecedor e não como um ranking independente. O desenho das tarefas, a população de avaliadores e as condições de comparação são relevantes, e ainda não existe reprodução independente estabelecida.

A alegação de auto-otimização é interessante, mas exige contenção

Uma das afirmações mais invulgares da Tencent é que o Hy4 preview participou em partes do seu próprio processo de desenvolvimento. A empresa diz que o modelo propôs abordagens, executou experiências e iterou sobre métodos de treino, estratégias de dados, frameworks de avaliação e operadores de baixo nível. A Tencent afirma ainda que o modelo analisou bottlenecks de inferência e ajudou a produzir otimizações de operator fusion e comunicação que aumentaram o throughput end-to-end em 31,8% relativamente ao seu baseline.

Este padrão pode ser importante para equipas que estão a construir model engineering automatizado ou infraestrutura agentic. Nesse ciclo, o modelo não é apenas o workload a otimizar, mas também um participante ativo no diagnóstico e na alteração do sistema em que corre.

No entanto, a evidência disponível vem da própria Tencent. O lançamento não demonstra que o mesmo processo se generaliza a outras stacks de modelos, ambientes de hardware ou equipas de engenharia, e o ganho de throughput depende do baseline e das condições de implementação da Tencent. É mais rigoroso tratá-lo como um caso interno concreto que merece replicação do que como prova de autoaperfeiçoamento recursivo generalizado.

O que os developers devem avaliar a seguir

Para engenharia de software, as perguntas práticas são mais importantes do que a contagem de parâmetros. As equipas devem medir conclusão de tarefas à escala de repositório, fiabilidade de ferramentas, qualidade de patches, disciplina de testes, retenção de contexto e custo nos seus próprios harnesses. Uma janela de contexto de um milhão de tokens pode reduzir alguma pressão de retrieval, mas contexto longo não produz automaticamente melhores decisões nem menor custo total de inferência.

As equipas de infraestrutura também devem testar o serving sob concorrência realista. Um caminho ativo de 49 mil milhões de parâmetros continua a ser substancial, enquanto a pegada total de 770 mil milhões cria considerações de armazenamento, colocação em memória e routing de experts. Quantização e speculative decoding podem ajudar, mas a economia de produção dependerá da topologia do hardware, do comprimento dos pedidos e da utilização.

A Tencent lista preços de API de 0,834 dólares por milhão de tokens de input, 2,501 dólares por milhão de tokens de output e 0,042 dólares por milhão de tokens em cache hits. Estes preços alojados oferecem um baseline útil para comparar self-hosting com acesso gerido, embora não determinem por si só o custo total de uma aplicação com agentes de longa duração.

O Hy4 preview é, por isso, relevante porque junta três elementos que muitas vezes aparecem separados: um modelo aberto de grande escala, uma stack de deployment operável por developers e um foco explícito na produção de artefactos de trabalho. As afirmações de desempenho continuam a precisar de validação externa e o produto é explicitamente um preview. Ainda assim, para equipas que avaliam modelos abertos para programação e sistemas agentic de contexto longo, o lançamento já é suficientemente concreto para ser testado agora.

Sources
- Tencent Releases and Open-Sources Tencent Hy4 preview
- Tencent-Hunyuan/Hy4-preview
- Reuters: China's Tencent releases new open-source AI model for coding, research tasks

Publicado: