Обрезка токенов — это способ повысить эффективность Vision-Language Models (VLM) за счёт удаления избыточных токенов на основе карт внимания.

В блоге Overshoot опубликовано введение в технику обрезки токенов (token pruning) для Vision-Language Models (VLM). Метод основан на анализе карт внимания (attention heatmaps) и позволяет удалять избыточные токены, снижая вычислительные затраты и ускоряя инференс без существенной потери качества.

Источники 1