À mesure que les LLM évoluent vers des contextes de millions de tokens, la mémoire du cache KV devient le principal goulot d'étranglement. Les méthodes d'élagage existantes telles que l'éviction Top-K éliminent les tokens sur la base des scores d'attention actuels — une hypothèse qui entraîne des échecs de reconstruction imprévisibles à des positions structurellement importantes. Cet article propose le pipeline SRC (Selection-Reconstruction-Compression), qui résume plutôt que d'éliminer les tokens. Les tokens de faible saillance et de haute entropie sont acheminés vers une corbeille (Recycle Bin), reconstruits via OLS par rapport à la matrice de requête actuelle, et compressés en tokens centroïdes compacts à l'aide de la SVD. Les expériences montrent que HAE atteint une erreur de reconstruction jusqu'à 3× inférieure à celle de Top-K avec un taux de conservation de 30 % tout en utilisant moins de mémoire totale.
Jayanth Chandra (Sun,) a étudié cette question.