Современные большие языковые модели (LLM) часто используют адаптивные методы вывода для сокращения вычислительных затрат – например, досрочный выход из сети или пропуск «избыточных» слоёв. Однако существующие подходы опираются на наблюдательные эвристики: схожесть скрытых состояний или величину активаций. Эти корреляционные метрики плохо улавливают нелинейные и структурные вычисления, критически важные для семантической точности. В новой работе на arXiv представлен CausalGate – фреймворк, основанный на вмешательствах, который использует каузальное сжатие важности для обрезки модулей трансформера.
Что произошло
Исследователи опубликовали препринт «CausalGate: Causal Importance Distillation for Transformer Module Pruning» (arXiv:2607.22720v1). В нём предлагается метод, который вместо пассивного наблюдения за активациями активно вмешивается в работу модели, чтобы оценить причинно-следственный вклад каждого модуля в итоговый выход. CausalGate учит лёгкий «гейт» (gate) предсказывать, какие модули можно отключить без потери качества, минимизируя каузальное воздействие на результат.
Почему это важно
Корреляционные признаки, такие как норма активации или сходство скрытых состояний, могут быть обманчивы: модуль может иметь высокую активацию, но не влиять на семантику, и наоборот. CausalGate решает эту проблему, напрямую измеряя, как изменение выхода модуля меняет итоговое предсказание. Это позволяет точнее отсекать избыточные компоненты, ускоряя инференс LLM на 30–50% без заметного снижения точности на сложных задачах, таких как ответы на вопросы и генерация текста.
Ключевые особенности CausalGate
Метод состоит из двух этапов: сначала на небольшом наборе данных проводятся структурные вмешательства (отключение отдельных модулей) и собираются метки важности. Затем эти метки дистиллируются в лёгкую модель-гейт, которая для каждого входного примера динамически решает, какие модули можно пропустить. Такой подход не требует полного перебора и работает на уровне отдельных токенов, адаптируясь к контексту.
«CausalGate — это первый шаг к тому, чтобы адаптивные вычисления в LLM опирались не на корреляции, а на причинно-следственные связи, что принципиально повышает надёжность обрезки модулей», — отмечают авторы работы.
Что дальше
Хотя эксперименты на моделях размером до 7B параметров показывают многообещающие результаты, до внедрения в продуктивные системы ещё предстоит решить вопросы масштабирования метода на модели с сотнями миллиардов параметров, а также снизить накладные расходы на этапе сбора каузальных меток. В будущем авторы планируют интегрировать CausalGate с другими методами сжатия, такими как квантизация и дистилляция, а также исследовать автоматическое определение оптимального порога важности для каждого модуля.