Der Technologiegigant Tencent hat den Sektor der künstlichen Intelligenz mit einer technologischen Meisterleistung aufgerüttelt: der Komprimierung seines Flaggschiff-Modells Hy4-preview. Das ursprünglich 1,5 Terabyte große Modell wurde dank einer aggressiven Quantisierungstechnik namens Sherry, die in die Open-Source-Toolsuite AngelSlim integriert ist, auf rund 200 Gigabyte geschrumpft. Diese drastische Reduzierung um 87 % ermöglicht es theoretisch, das Modell auf günstigerer Hardware wie High-End-Workstations auszuführen, für die zuvor noch ganze Server-Cluster erforderlich waren.
Im Zentrum dieser Innovation beeindruckt das Modell Hy4-preview mit einer schieren Größe von 770 Milliarden Parametern. Seine Architektur, die auf einem Mixture-of-Experts-Ansatz (MoE) basiert, erklärt teilweise die Machbarkeit dieser Komprimierung. Da pro Token nur ein Bruchteil der Parameter aktiviert wird, profitiert das System von einer natürlichen Redundanz, die es widerstandsfähiger gegenüber dem durch die Quantisierung bedingten Präzisionsverlust macht. Tencent gibt an, dass die komprimierte Version 98 % der Fähigkeiten des Originalmodells beibehält – ein Wert, der in der wissenschaftlichen Gemeinschaft jedoch Fragen aufwirft.
Die Glaubwürdigkeit dieser Leistung bleibt Gegenstand von Debatten. Während die reduzierte Dateigröße ein überprüfbarer technischer Fakt ist, bleibt die tatsächliche Qualität der Ergebnisse nach der Komprimierung fragwürdig. Experten geben zu bedenken, dass sich die vom Unternehmen veröffentlichten Benchmarks auf die Vollpräzisionsversion beziehen, nicht auf die abgespeckte Variante. Historisch gesehen kann ein Verlust von 2 % bei standardisierten Tests in der Praxis zu weniger flüssigen Argumentations- oder Planungsfähigkeiten führen. Die Transparenz von Tencent, das seine Komprimierungstools als Open Source zur Verfügung stellt, wird es unabhängigen Forschern jedoch ermöglichen, diese Daten zeitnah mit der realen Nutzung abzugleichen.
Die wirtschaftlichen Auswirkungen dieses Fortschritts sind beträchtlich. Indem Tencent das Self-Hosting von sehr großen Modellen zu deutlich geringeren Betriebskosten ermöglicht, bedroht das Unternehmen direkt das Monopol der Token-basierten Abrechnungsmodelle aktueller Cloud-Dienste. Das Kostenverhältnis, das bei umfangreichen Kontexten bis zu zwölfmal niedriger geschätzt wird als bei teuren Konkurrenzlösungen, könnte die Einführung lokaler KI in Unternehmen beschleunigen, die ihre Ausgaben kontrollieren müssen. Diese Strategie positioniert Tencent als unverzichtbaren Akteur in der Welt der Open Weights und markiert einen entscheidenden Schritt in Richtung der Demokratisierung souveräner und leistungsfähiger KI.