Machinelearning

🐠Sakana AI представила PC-ALM - метод обучения глубоких нейросетей без классического обратного распространения ошибки. Главный результат: PC-ALM смог обучать нейросети глубиной до 1000 слоёв, используя только локальные взаимодействия между соседними слоями. Обычное глубокое обучение почти полностью опирается на backpropagation: ошибка считается на выходе сети, после чего градиенты передаются назад через все слои. PC-ALM работает иначе. Каждый слой рассматривается как локальная динамическая система, которая пытается уменьшить собственную ошибку предсказания. Вместо глобального прохода градиента используются: - локальные ошибки предсказания - множители Лагранжа - расширенный лагранжиан - локальная динамика состояний - PI-регуляция внутри каждого слоя Метод вырос из predictive coding — подхода, популярного в NeuroAI. В predictive coding каждый слой постепенно корректирует своё состояние так, чтобы уменьшать рассогласование с соседними слоями. Проблема в том, что в очень глубоких сетях такие сигналы плохо распространяются: информация об ошибке с выхода сети затухает раньше, чем достигает внутренних слоёв. PC-ALM добавляет специальные двойственные переменные — по сути дополнительные нейроны, представляющие множители Лагранжа. Они помогают передавать сигнал ошибки через большое число слоёв. Авторы связывают этот подход с классической работой Яна Лекуна 1988 года, где множители Лагранжа для многослойной сети можно связать с градиентами функции потерь. В результате получается обучение, где глобальная задача оптимизации раскладывается на множество локальных динамических процессов. Особенно хорошо PC-ALM показал себя на очень глубоких и узких сетях, где обычный predictive coding начинает ломаться. Помимо NeuroAI, подход может быть интересен для нейроморфного железа: там локальные вычисления и физическая динамика потенциально дешевле классического backpropagation на GPU. Блог: pub.sakana.ai/pc-alm Статья: arxiv.org/abs/2605.31022 Код: github.com/SakanaAI/pc-alm
Пост из Machinelearning

Просмотры выросли: 12,6 тыс. → 25,2 тыс.

Пост переслал 1 канал из нашего каталога.

Комментарии из Telegram

Обсуждение под постом в Telegram — показываем как есть. Показаны 3 из 5 — это всё, что собрано.

  • Денис

    А что там JEPA, уже stable (панчлайн для шутеек готов, кстати) ? Она же тоже на концепции прогнозирующего кодирования основана. Кажется, это самое интересное направление из нейробиологии для ИИ в ближайшем будущем, как и принцип свободной энергии/активный вывод, особенно для роботеха.
  • BAAl

    ООООООО!! Классический back propagation подвинули! Будем наблюдать!
  • Michael Monashev

    Читать подобное весьма смешно, ибо 2 года назад мы с друзьями обучили модель глубиной 1млн. слоёв. t.me/chivinya/34