Le géant technologique Tencent vient de bousculer le secteur de l'intelligence artificielle en annonçant une prouesse technique majeure : la compression de son modèle phare, Hy4-preview. Initialement doté d'une empreinte massive de 1,5 téraoctet, le modèle a été réduit à environ 200 gigaoctets grâce à une technique de quantification agressive baptisée Sherry, intégrée à la suite d'outils open-source AngelSlim. Cette réduction drastique, équivalente à une diminution de 87 % de la taille du fichier, permettrait théoriquement de faire fonctionner ce modèle sur du matériel moins onéreux, comme des stations de travail haut de gamme, là où une grappe de serveurs était autrefois indispensable.

Au cœur de cette innovation, le modèle Hy4-preview impressionne par ses mensurations, totalisant 770 milliards de paramètres. Son architecture, basée sur un mélange d'experts (MoE), explique en partie la faisabilité de cette compression. En n'activant qu'une fraction des paramètres par jeton (token), le système bénéficie d'une redondance naturelle qui le rend plus résilient face à la perte de précision induite par la quantification. Tencent affirme que la version compressée conserve 98 % des capacités du modèle original, un chiffre qui soulève toutefois des interrogations au sein de la communauté scientifique.

La crédibilité de cette performance reste en effet au centre des débats. Si la taille réduite du fichier est un fait technique vérifiable, la qualité réelle des sorties après compression demeure sujette à caution. Les experts rappellent que les scores de référence publiés par l'entreprise concernent la version en précision complète, non la version allégée. Historiquement, une perte de 2 % sur des tests standardisés peut, dans la pratique, se traduire par des capacités de raisonnement ou de planification moins fluides. La transparence de Tencent, qui publie ses outils de compression en libre accès, permettra néanmoins aux chercheurs indépendants de confronter rapidement ces données aux usages réels.

Les enjeux économiques derrière cette avancée sont considérables. En permettant l'auto-hébergement de modèles de très grande taille à des coûts opérationnels réduits, Tencent menace directement le monopole des facturations au token imposé par les services cloud actuels. Le rapport de coût, estimé jusqu'à douze fois inférieur à celui des solutions concurrentes les plus onéreuses pour les contextes étendus, pourrait accélérer l'adoption de l'IA locale au sein des entreprises soucieuses de maîtriser leurs dépenses. Cette stratégie positionne Tencent comme un acteur incontournable du paysage des poids ouverts, marquant une étape décisive dans la démocratisation de l'IA souveraine et performante.