Machinelearning
🐠Sakana AI представила PC-ALM - метод обучения глубоких нейросетей без классического обратного распространения ошибки.
Главный результат: PC-ALM смог обучать нейросети глубиной до 1000 слоёв, используя только локальные взаимодействия между соседними слоями.
Обычное глубокое обучение почти полностью опирается на backpropagation: ошибка считается на выходе сети, после чего градиенты передаются назад через все слои.
PC-ALM работает иначе.
Каждый слой рассматривается как локальная динамическая система, которая пытается уменьшить собственную ошибку предсказания. Вместо глобального прохода градиента используются:
- локальные ошибки предсказания
- множители Лагранжа
- расширенный лагранжиан
- локальная динамика состояний
- PI-регуляция внутри каждого слоя
Метод вырос из predictive coding — подхода, популярного в NeuroAI. В predictive coding каждый слой постепенно корректирует своё состояние так, чтобы уменьшать рассогласование с соседними слоями.
Проблема в том, что в очень глубоких сетях такие сигналы плохо распространяются: информация об ошибке с выхода сети затухает раньше, чем достигает внутренних слоёв.
PC-ALM добавляет специальные двойственные переменные — по сути дополнительные нейроны, представляющие множители Лагранжа. Они помогают передавать сигнал ошибки через большое число слоёв.
Авторы связывают этот подход с классической работой Яна Лекуна 1988 года, где множители Лагранжа для многослойной сети можно связать с градиентами функции потерь.
В результате получается обучение, где глобальная задача оптимизации раскладывается на множество локальных динамических процессов.
Особенно хорошо PC-ALM показал себя на очень глубоких и узких сетях, где обычный predictive coding начинает ломаться.
Помимо NeuroAI, подход может быть интересен для нейроморфного железа: там локальные вычисления и физическая динамика потенциально дешевле классического backpropagation на GPU.
Блог: pub.sakana.ai/pc-alm
Статья: arxiv.org/abs/2605.31022
Код: github.com/SakanaAI/pc-alm
- 25.2KViews
- 492Forwards
- 5Comments
- 212Reactions
- Copy link
Views grew: 12.6K → 25.2K
1 channel from our catalog forwarded this post.
Comments from Telegram
The discussion under the post on Telegram — shown as is. Showing 3 of 5 — that is all we collected.
Денис
А что там JEPA, уже stable (панчлайн для шутеек готов, кстати) ? Она же тоже на концепции прогнозирующего кодирования основана. Кажется, это самое интересное направление из нейробиологии для ИИ в ближайшем будущем, как и принцип свободной энергии/активный вывод, особенно для роботеха.BAAl
ООООООО!! Классический back propagation подвинули! Будем наблюдать!Michael Monashev
Читать подобное весьма смешно, ибо 2 года назад мы с друзьями обучили модель глубиной 1млн. слоёв. t.me/chivinya/34