O Hy4 preview transforma uma comparação de modelo aberto em uma decisão de implantação. A página oficial de pesquisa Hy da Tencent está datada de 28 de agosto de 2026, e a ficha do modelo apresenta o Hy4 preview como um grande modelo de mistura de especialistas com pesos abertos, com um caminho documentado via vLLM ou SGLang. Isso torna o lançamento relevante para quem escolhe modelos e pode avaliar capacidade de implantação, não só qualidade de saída. Ainda é um preview, então a pergunta útil é se ele cabe em uma carga de trabalho medida.
Os detalhes confirmados da ficha do modelo são incomumente específicos. O Hy4 preview tem 770B parâmetros totais e 49B ativados por token. A arquitetura principal tem 78 camadas, 256 especialistas roteados mais 1 especialista compartilhado, com top-8 especialistas roteados mais o especialista compartilhado usados por token. Inclui uma camada nativa MTP com 10B totais e 0.7B parâmetros ativados para decodificação especulativa. A Tencent descreve a atenção como Gated DeepSeek Sparse Attention com IndexCache e iHC. O comprimento de contexto é 1M, e o tamanho do vocabulário é 120832.
O lançamento também fornece um caminho operacional. A ficha do modelo mostra um selo Apache License 2.0, links para Hugging Face, ModelScope, GitCode e CNB, e inclui uma variante FP8. A Tencent recomenda vLLM ou SGLang. O exemplo de vLLM usa tencent/Hy4-preview-FP8, --tensor-parallel-size 8, decodificação especulativa MTP, um mecanismo de atenção esparsa, --tool-call-parser hy_v4, --reasoning-parser hy_v4 e --enable-auto-tool-choice; o exemplo de SGLang usa --tp-size 8. Essas instruções não garantem implantação fácil.
A Tencent diz ter co-projetado o Hy4 para engenharia de software, trabalho de escritório/análise, desenvolvimento de jogos e pesquisa científica. Relata uma avaliação cega lado a lado por 163 especialistas internos em 203 tarefas de engenharia: o Hy4 preview marcou 2.99 em média versus 2.92 do GLM 5.3, com 46.8% de vitórias, 12.8% de empates e 40.4% de derrotas. Contra o Kimi K3, a Tencent relata 2.94, com 51.2% de vitórias, 7.9% de empates e 40.9% de derrotas. Esses números são resultados internos da Tencent, não avaliações comparativas independentes.
O que não está comprovado é um ranking geral. As evidências fornecidas não estabelecem resultados independentes de avaliação comparativa, latência, uso de memória, vazão, custo ou qualidade além dessas 203 tarefas. Os detalhes do lançamento também não provam implantação em notebook, uma configuração de hardware específica, um preço ou disponibilidade. O selo Apache License 2.0 é um rótulo documentado da ficha do modelo; não é base aqui para conclusões jurídicas extras.
Isso muda a escolha porque o comportamento do modelo e o ônus operacional agora chegam juntos. O contexto de 1M, o desenho MoE, a variante FP8 e o MTP nativo podem justificar um teste onde contexto longo ou implantação controlada importam. Ao mesmo tempo, 770B parâmetros totais e exemplos com tensor parallel size 8 tornam capacidade e complexidade de execução parte da decisão. Isso é uma inferência da configuração publicada, não uma afirmação de desempenho. Trate pesos abertos como um candidato a operar, não como capacidade sem atrito.
A verificação deve ser reproduzível. Fixe o modelo e a revisão, siga um caminho documentado de vLLM ou SGLang e rode tarefas fixas de código e análise. Compare qualidade, latência, memória, vazão e esforço do operador contra um modelo existente, preservando casos de falha e a configuração exata de implantação. Inclua tarefas de raciocínio complexo em vez de manter só exemplos favoráveis. A Tencent chama o Hy4 de versão inicial e observa que pode demorar mais do que o necessário em raciocínio complexo e tende a verificar demais o próprio trabalho. Acompanhe futuras revisões da ficha do modelo ou da implantação e testes independentes, mas não presuma melhoria até que esteja documentada. Por ora, o Hy4 preview é um candidato cuja escolha de modelo não pode ser separada do caminho de implantação.

