List of Best

Hy4 rende la scelta del modello aperto una decisione di distribuzione

L’anteprima Hy4 trasforma il confronto tra modelli aperti in una decisione di serving. La pagina ufficiale Hy research di Tencent è datata 28 agosto 2026 e la scheda del modello presenta Hy4 preview come un grande modello a miscela di esperti (Mixture-of-Experts) con un percorso documentato attraverso vLLM o SGLang. Questo rende il rilascio rilevante per chi sceglie i modelli e può valutare la capacità di deployment, non solo la qualità dell’output. È ancora un’anteprima, quindi la domanda utile è se si adatta a un carico di lavoro misurato.

I dettagli confermati nella scheda del modello sono insolitamente specifici. Hy4 preview ha 770B parametri totali e 49B attivati per token. Il corpo principale ha 78 strati, 256 esperti instradati più 1 esperto condiviso, con top-8 esperti instradati più l’esperto condiviso utilizzati per token. Include uno strato MTP nativo con 10B parametri totali e 0.7B attivati per la decodifica speculativa. Tencent descrive il meccanismo di attenzione come Gated DeepSeek Sparse Attention con IndexCache e iHC. La lunghezza del contesto è 1M e la dimensione del vocabolario è 120832.

Il rilascio fornisce anche un percorso operativo. La scheda del modello mostra un contrassegno Apache License 2.0, collega Hugging Face, ModelScope, GitCode e CNB e include una variante FP8. Tencent raccomanda vLLM o SGLang. L’esempio vLLM usa tencent/Hy4-preview-FP8, --tensor-parallel-size 8, la decodifica speculativa MTP, un backend di attenzione sparsa, --tool-call-parser hy_v4, --reasoning-parser hy_v4 e --enable-auto-tool-choice; l’esempio SGLang usa --tp-size 8. Queste istruzioni non garantiscono un serving semplice.

Tencent afferma di aver co-progettato Hy4 per l’ingegneria del software, il lavoro d’ufficio e l’analisi, lo sviluppo di giochi e la ricerca scientifica. Riporta un confronto cieco testa a testa condotto da 163 esperti interni su 203 attività di ingegneria: Hy4 preview ha ottenuto una media di 2.99 contro 2.92 per GLM 5.3, con il 46.8% di vittorie, il 12.8% di pareggi e il 40.4% di sconfitte. Contro Kimi K3, Tencent riporta 2.94, con il 51.2% di vittorie, il 7.9% di pareggi e il 40.9% di sconfitte. Queste cifre sono risultati interni di Tencent, non benchmark indipendenti.

Ciò che non è dimostrato è una classifica generale. Le evidenze fornite non stabiliscono risultati di benchmark indipendenti, latenza, uso della memoria, throughput, costo o qualità oltre quelle 203 attività. Né i dettagli del rilascio dimostrano il deployment su un portatile, una specifica configurazione hardware, un prezzo o la disponibilità. Il contrassegno Apache License 2.0 è un’etichetta documentata nella scheda del modello; qui non costituisce una base per ulteriori conclusioni legali.

Questo cambia la scelta perché il comportamento del modello e l’onere operativo arrivano insieme. Il contesto da 1M, l’architettura MoE, la variante FP8 e l’MTP nativo possono giustificare una prova quando contano il contesto lungo o un serving controllato. Allo stesso tempo, 770B parametri totali ed esempi con una parallelizzazione dei tensori pari a 8 rendono la capacità e la complessità di esecuzione parte della decisione. È un’inferenza dalla configurazione pubblicata, non un’affermazione sulle prestazioni. Occorre considerare i pesi aperti come un candidato da gestire, non come una capacità priva di attriti.

La verifica dovrebbe essere riproducibile. Occorre fissare il modello e la revisione, seguire un percorso documentato con vLLM o SGLang ed eseguire attività fisse di programmazione e analisi. Bisogna confrontare qualità, latenza, memoria, throughput e impegno dell’operatore rispetto a un modello esistente, conservando i casi di fallimento e la configurazione esatta di serving. Vanno incluse attività di ragionamento complesso, invece di conservare solo gli esempi favorevoli. Tencent definisce Hy4 una versione iniziale e osserva che può impiegare più tempo del necessario nel ragionamento complesso e tende a verificare eccessivamente il proprio lavoro. Occorre osservare le future revisioni della scheda del modello o del serving e i test indipendenti, senza presumere alcun miglioramento finché non sarà documentato. Per ora Hy4 preview è un candidato la cui scelta non può essere separata dal suo percorso di serving.

More in ai

La mappa dei modelli di Cursor cambia dopo l’accordo con SpaceX

OpenAI afferma di voler chiudere il contratto diretto sui modelli con Cursor dopo l’acquisizione da parte di SpaceX, con un’interruzione proposta per il 12 novembre 2026. L’esito del contratto e un eventuale percorso di migrazione restano non confermati.

ai

← Tutte le notizie