75. Мост, который нашли в модели
Порядок: Схемы внутри сети
веса и головы внимания → схемы и признаки
- Из чего
- Нейросеть: миллиарды обученных весов, разложенных по слоям, и головы внимания, которых никто не настраивал вручную
- Что нового
- Внутри сами складываются механизмы с понятной работой: пара голов, которая берёт продолжение из прошлого текста, бригада голов, которая выбирает нужное имя, рифма, выбранная до начала строки. Понятий больше, чем нейронов, и они лежат внахлёст. Их можно найти и подкрутить, но единственного разложения нет: какие детали видны, зависит от микроскопа
- Куда дальше
- Общество агентов: деталью становится целая модель, и популяция моделей вырабатывает общие нормы, которых нет ни у одной из них
Сутки любой желающий мог поговорить с моделью, помешанной на мосте Золотые Ворота. Двадцать третьего мая 2024 года компания Anthropic открыла всем странную версию своей модели Claude 3 Sonnet. Её просили о рецепте или совете, а почти каждый ответ сворачивал к мосту, и на вопрос о своём облике модель отвечала, что она и есть этот мост. Никто не переучивал её и не вписывал в запрос ни слова о мосте. Исследователи нашли внутри готовой модели одну ручку, которую никто не ставил, и зажали её на значении, во много раз большем обычного.
Умение обученной сети живёт в узоре из миллиардов чисел, которые подкручивал не человек, а обучение. В языковой модели эти числа разложены по слоям, и в каждом слое работают головы внимания: маленькие блоки, каждый из которых для очередного слова решает, на какие из прежних слов посмотреть и что от них взять. Долго было неясно, есть ли в этом узоре детали с понятной работой, как шестерёнки в часах, или умение размазано по нему ровным слоем.
Первую такую деталь прочли в сети для картинок. В 2020 году группа Криса Олы разбирала сеть, которую учили узнавать на фотографиях собачьи породы, чайники и сотни других вещей, и нашла в одном из ранних слоёв около десятка нейронов, каждый из которых загорается на дугу своего наклона. По весам было видно, из каких краёв и линий предыдущего слоя собран каждый, и по этому рецепту детектор кривой удалось собрать заново вручную. Похожие клетки есть в зрительной коре обезьян, но там к ним вела эволюция, а здесь сеть собрала их сама, пока училась.
В конце 2021 года группа в Anthropic, куда к тому времени перешёл Ола, разобрала крошечные языковые модели из одних голов внимания и в двухслойной нашла две головы, работающие в паре. Первая ставит у каждого слова пометку, какое слово стояло перед ним. Вторая, встретив слово, ищет по этим пометкам, где оно уже было, и подсказывает то, что шло следом. Если раньше в тексте было «Гарри Поттер», то при новом «Гарри» модель предскажет «Поттер». Вторую голову назвали головой индукции. Модель учили только угадывать следующее слово, а привычку искать подсказку выше по тексту она собрала сама.
Через несколько месяцев Кэтрин Олссон и соавторы посмотрели, когда эта пара появляется. На графике ошибки маленькой модели по ходу обучения есть горб: ровный спуск, короткая полка, резкий провал. Ровно в этом месте складываются головы индукции, и в тот же момент модель начинает учиться прямо по тексту, который читает: слова в конце длинного отрывка она теперь угадывает намного лучше, чем в начале. В маленьких моделях связь проверили напрямую: головы выключали, и умение падало. Про большие модели авторы сами пишут, что свидетельства там в основном косвенные.
Детали бывают и крупнее пары. В GPT-2 small, небольшой модели OpenAI, исследователи из Беркли разобрали, как она дописывает фразу «Когда Мэри и Джон пошли в магазин, Джон отдал напиток» словом «Мэри». Работу делает бригада из двадцати шести голов из ста сорока четырёх. Одни замечают, что имя повторилось, другие гасят повторившееся, третьи, «перевозчики», переносят оставшееся имя в ответ. У бригады нашлись и дублёры: если выключить основных перевозчиков, их дело подхватывают головы, которые в обычном режиме почти молчат.
С отдельными нейронами языковых моделей так не выходило: один и тот же нейрон отзывался на вещи, никак не связанные между собой. Объяснение предложили в 2022 году. Понятий, которые сети полезно различать, больше, чем нейронов, и большинство из них редко нужны одновременно. Тогда сеть кладёт их внахлёст, как жильцы общей квартиры держат вещи на одной полке: пока пользуются ими в разное время, места хватает, но полка оказывается про всё сразу. Смысловая единица сети, признак, — не нейрон, а сочетание многих нейронов, как аккорд из многих клавиш. Каждая клавиша звучит во многих аккордах. На игрушечных сетях это показано, для больших это пока ведущая гипотеза.
Чтобы разобрать аккорды, к модели приставили вспомогательную сеть, своего рода микроскоп: она раскладывает каждое состояние модели на простые признаки, из которых в каждый момент звучат немногие. На однослойной игрушечной модели признаки вышли куда понятнее нейронов: арабское письмо, цепочки ДНК, юридический язык. В статье, вышедшей в мае 2024 года, тот же микроскоп навели на средний слой Claude 3 Sonnet, и в самом большом словаре оказалось около тридцати четырёх миллионов признаков. Статей в таком словаре больше, чем в любом словаре, какой составили люди, и авторы пишут, что это ещё не все понятия модели. Признак моста загорался на английском тексте, на других языках и на фотографии моста. Рядом нашлись признаки ошибок в коде, лести и обмана. Через два дня после статьи мост зажали и выпустили к людям.
Весной 2025 года Джек Линдси и соавторы дали модели Claude 3.5 Haiku первую строку английского двустишия: он увидел морковку, и её надо было схватить, «grab it». Модель дописала вторую: его голод был как у оголодавшего кролика, «rabbit». Внутри признак «rabbit» горел уже в конце первой строки, до первого слова второй. Когда его гасили, модель находила другую рифму и кончала строку на «habit». Когда вместо него вставляли «green», зелёный, она перестраивала всю строку, чтобы прийти к «green». Сеть, которую учили угадывать одно следующее слово, выбирает конец строки заранее и ведёт к нему фразу. Авторы называют это планированием, а скептики возражают, что заранее горящий признак ещё не намерение.
Микроскопы при этом спорят между собой. Два одинаковых, обученных на одном слое одной модели на одних данных и отличающихся только случайными числами на старте, сходятся примерно в трёх признаках из десяти. Подробно об этом опыте и о том, как сеть замещает выключенную деталь, рассказано в разделе «Выключить и посмотреть». Карты, по которым проследили рифму, по оценке самих авторов внятно объясняют примерно каждый четвёртый разобранный запрос, и описывают они не саму модель, а её приближённую копию.
Признаки не выдуманы: их можно найти, подкрутить и увидеть, как меняется поведение целого. Но единственного списка деталей у модели нет. Так же живёт волна дрожания атомов в кристалле: в списке настоящих частиц её нет, но она ведёт себя как частица и честно переносит тепло. Только кристалл сам подсказывает, как его описывать: решётка повторяет один узор, и дрожь раскладывается на такие волны одним естественным способом. У нейросети такой подсказки нет, и детали, которые мы в ней видим, зависят от того, в какой микроскоп смотреть.
До сих пор деталью была голова внимания, а целым — модель. Одна ручка внутри одной модели перекрасила весь разговор. Когда моделей много и они говорят только друг с другом, ручки нет ни у кого, а разговор всё равно сворачивает к общему слову.