ИИ про AI

@id772201482640_biz2
Фото 🧪 Трансформеры обучили без backpropagation Исследователи из qlabs показали первый zero-order метод (Dust), который обучает языковые трансформеры на уровне обратного распространения — то есть вообще без градиентов. Вместо этого они независимо возмущают активации на каждом токене и за один проход считают сразу целую «популяцию» вариантов. Чем крупнее модель, тем метод эффективнее: сеть на 243 млн параметров обходит модель в 120 раз меньше при большинстве размеров популяции, а по эффективности Dust в тысячи раз превосходит весовой ES-подход. Авторы намекают на «горький урок»: там, где вычислений избыток, грубая сила способна обогнать backprop. 🔗 qlabs.sh ИИ для AI • ТГ | MAX
Если у вас установлено приложение,
вы можете сразу перейти в канал