В КУРСЕ?

Разбираемся в теме

Архитектура та же, ответ другой: что в нейросети меняют веса

Две нейросети могут иметь одинаковую схему, но выдавать разные результаты на одном входе. Чтобы понять причину, полезно различать архитектуру и параметры. Архитектура определяет устройство вычислений, а параметры задают конкретные числовые значения внутри этого устройства. Начать можно с одного вычислительного блока: такой пример не описывает все современные модели, зато делает различие проверяемым вручную.

Сначала задаём устройство

Пусть блок принимает два числа, умножает каждое на свой вес, складывает результаты и добавляет смещение. Затем применяется ReLU: положительное значение сохраняется, а отрицательное заменяется нулём; ноль остаётся нулём. В нашем примере схема всегда содержит два входа, взвешенную сумму, смещение и эту функцию активации. Веса и смещение являются параметрами. Добавление ещё одного слоя или изменение количества входов затронуло бы устройство блока. Простая замена одного веса сохраняет описанную последовательность действий. Это различие важно, когда сравнивают модели одного семейства или разные сохранённые состояния одной модели.

Меняем одно число и следим за ответом

Возьмём входы 3 и 2, веса 2 и минус 1, смещение 1. До активации получаем: 3 умножить на 2, прибавить 2 умножить на минус 1, затем прибавить 1. Результат равен 5, и ReLU оставляет его без изменения. Теперь поменяем только первый вес с 2 на 1. Сумма станет равна 2, и итог блока тоже будет 2. Входы и схема остались прежними, но значение параметра изменило ответ. Рассмотрим также исходные веса при входах 0 и 3: сумма равна минус 2, поэтому после ReLU получается 0. Здесь различаются промежуточное и окончательное значения.

Что пример говорит об обучении

Во многих распространённых схемах обучения веса и смещения подбираются так, чтобы уменьшать выбранную ошибку на данных. Однако наши ручные замены не были обучением: мы не задавали правильные ответы, функцию потерь и процедуру обновления. Маленький блок также нельзя автоматически считать системой, понимающей речь или изображения. Для применения нужны подходящие данные, способ представить вход, критерий качества и проверка на примерах, не использованных для настройки. Одинаковая архитектура не гарантирует одинакового качества, а большое число параметров само по себе не доказывает пригодность к конкретной задаче. Даже когда итоговое число выглядит убедительно, смысл ему задаёт постановка задачи. Без неё результат 5 остаётся числом, а не готовым прогнозом или решением.

Попробуйте на практике

Проведите три вычисления и подпишите, что именно менялось между ними.

  1. Нарисуйте два входа, блок взвешенной суммы со смещением и следующий за ним блок ReLU. Оставьте схему одинаковой для всех расчётов.
  2. Для входов 3 и 2 используйте веса 2 и минус 1, смещение 1. Отдельно запишите сумму до активации и результат после неё.
  3. Оставьте входы прежними, замените первый вес на 1 и пересчитайте оба значения. Подпишите изменение как замену параметра.
  4. Верните исходные веса, возьмите входы 0 и 3 и повторите расчёт. Объясните, почему отрицательная сумма не сохранилась в итоговом ответе.

Как проверить результат. В первом случае получились 5 и 5, во втором 2 и 2, в третьем минус 2 и 0. Архитектура во всех случаях одинакова. Во втором расчёте изменился параметр, а в третьем относительно первого изменились входные данные.

Частые вопросы

Любая ли нейросеть использует ReLU?

Нет. Это одна из функций активации. Выбор операций зависит от архитектуры и задачи; пример нужен для понимания конкретной последовательности вычислений, а не для описания всех моделей.

Можно ли по одному удачному ответу считать модель обученной?

Нет. Один пример не показывает поведение на других входах. Нужна оценка по заранее определённым критериям и на подходящих данных, отделённых от настройки параметров.

Самостоятельный разбор темы. Содержание конкретной обучающей программы здесь не представлено.

Зарегистрируйтесь, чтобы уточнить возможность доступа к этому материалу

Зарегистрироваться
← К списку материалов