4 bites modell verte a 16 bites eredetit, új módszer a tömörítéshez

A Quantization-Aware Healing (QAH) nevű új technika lehetővé teszi, hogy egy tömörített, 4 bites modell teljesítménye meghaladja eredeti, 16 bites verzióját. A GPT-OSS 120B modell 60 milliárd paraméterre tömörített, MXFP4-re kvantált verziója 7/9 teljesítményteszten múlta felül a bfloat16 alapértékű modellt.

4 bites modell verte a 16 bites eredetit, új módszer a tömörítéshez

Hamarosan átirányítunk a teljes cikkhez → AI forradalom