Часть VIII. Техника 74 / 85
Часть VIII. Техника

74. Проходной выключатель

Порядок: Нейросеть

искусственные нейроны → способности, которым не учили

Из чего
Собран из компьютера, языка и культуры: простые счётные ячейки с порогом и ручками-весами, соединённые слоями и обученные на текстах и картинках, которые сделали люди.
Что нового
Появились умения, которых нет ни в одной ячейке и ни в одном весе: сеть сама учится замечать края, потом глаза и колёса, а языковая модель, которую учили только угадывать следующее слово, подхватывает правило из пары примеров прямо в вопросе. Умение живёт в узоре из миллиардов чисел, которых никто не писал; часть скачков в умениях оказывается свойством экзамена, но не все.
Куда дальше
Развилка на две ветви: внутрь сети, к маленьким механизмам и признакам, которые она собирает в себе сама (схемы внутри сети), и наружу, к многим копиям моделей, которые переговариваются друг с другом без начальника (общество агентов).

Пятитонная вычислительная машина IBM 704 размером с комнату училась отличать левое от правого. Седьмого июля 1958 года флот США показывал журналистам в Вашингтоне новую программу для неё: машине подавали перфокарты с меткой то слева, то справа, и после пятидесяти попыток она сама научилась их различать. С этим справился бы и годовалый ребёнок. Наутро New York Times написала о «зародыше электронного компьютера»: флот ожидает, что такая машина будет ходить, говорить, видеть, писать, воспроизводить себя и осознавать своё существование. Программу придумал психолог из Корнелла Фрэнк Розенблатт и назвал её персептроном.

Внутри программы работала идея, которую ещё во время войны придумали Уоррен МакКаллок и Уолтер Питтс. Искусственный нейрон складывает сигналы на входах и срабатывает, если сумма перевалила за порог. С клеткой мозга он соотносится так же, как схема метро с городом: похож связями, но сделан из другого. У персептрона на каждом входе стоит свой вес, ручка громкости, и учёба сводится к тому, чтобы после ошибок подкручивать эти ручки. Позже Розенблатт собрал железную машину с «глазом» из фотоэлементов, и точек в нём было меньше, чем в иконке приложения на телефоне. Веса там и правда были ручками, их поворачивали электромоторы, так что учёбу машины было слышно.

У одного такого нейрона есть предел, и его видно на проходном выключателе в коридоре. Выключателей два, по одному на каждом конце, и лампа горит, когда они стоят по-разному. Разложи четыре возможных положения по углам квадрата: два случая «горит» лягут на одну диагональ, два «не горит» — на другую. Нейрон умеет только провести прямую и сказать: по эту сторону да, по ту нет. Такой прямой здесь нет, как ни крути ручки. Три нейрона справляются. Два стоят в промежуточном, скрытом слое между входом и ответом, и каждый проводит свою прямую, а третий, на выходе, сводит их мнения.

В 1969 году Марвин Минский и Сеймур Пейперт выпустили книгу «Персептроны» и строго разобрали, чего один слой не может в принципе, например проверить, чётно ли число включённых входов. Проходной выключатель — самый маленький случай этой задачи. Деньги и интерес ушли в другие направления. Сколько тут вины книги, историки судят по-разному: военные, дававшие деньги, переключались на искусственный интеллект из правил и символов, обучать многослойные сети ещё не умели, а большие было не на чем считать. Розенблатт утонул в Чесапикском заливе, катаясь на лодке в собственный день рождения, через два года после книги. Возвращения своей идеи он не застал.

Способ учить скрытые слои сделали массовым в 1986 году Дэвид Румельхарт, Джеффри Хинтон и Рональд Уильямс, хотя придумывали его и раньше. Ошибку ответа раскладывают назад по цепочке и каждой связи сообщают её долю вины, как при разборе провала в команде. Потом каждую ручку подкручивают туда, где ошибка меньше, и тем сильнее, чем больше вина. Хинтон признания дождался: в 2024 году он вместе с Джоном Хопфилдом получил Нобелевскую премию по физике за работы, на которых стоит обучение нейросетей.

Перелом пришёл в 2012 году. Хинтон с двумя аспирантами в Торонто за несколько дней обучили такую сеть на двух игровых видеокартах, и на конкурсе по распознаванию фотографий она ошибалась в полтора с лишним раза реже лучшей из соперниц. Когда похожую сеть потом разобрали по слоям, оказалось, что первый слой сам научился замечать края и цветовые пятна, следующий — углы и текстуры, глубокие — глаза, колёса, собачьи морды. Слова «край» сети никто не говорил.

Вот что появляется на этом этаже. Ни в одном весе нет края, как ни в одной ручке громкости нет музыки. Каждый нейрон первого слоя смотрит в маленькое окошко картинки. Если его веса сложились так, что одна половина окошка прибавляет, а другая вычитает, он загорается там, где светлое граничит с тёмным: это и есть край. Глаз — узор из таких узоров. Ничего потустороннего тут нет, каждый ответ сети целиком задан её числами и тем, что ей показали. Но чтобы узнать, что она умеет, мало переписать числа, в них надо искать узоры.

У языковых моделей узор крупнее. В GPT-3 сто семьдесят пять миллиардов весов: если называть по одному в секунду без сна, уйдёт пять с половиной тысяч лет, дольше, чем стоят пирамиды. Кормили её текстом, большей частью из интернета, с добавкой книг и той самой Википедии. Пищей стали записанные язык и культура, телом — компьютер. Учили её одному: угадывать следующее слово. А она подхватывает правило из пары примеров прямо в вопросе, хотя такому её никто не учил.

О больших моделях часто говорят, что умения появляются у них скачком, когда модель перерастает какой-то размер. Здесь исследователи ещё спорят, и вот из-за чего. Часть таких скачков оказалась свойством экзамена: если засчитывать только безупречный ответ, ученик, который месяцами делает всё меньше ошибок, в ведомости выглядит так, будто поумнел за ночь. Но не всё сводится к ведомости, и некоторые скачки научились предсказывать заранее.

Дальше дорог две. Одна ведёт наружу: копий одной модели можно запустить десятки, дать каждой роль и короткую память и оставить их переговариваться без начальника, а что выходит у такой толпы, ещё выясняют. Другая ведёт внутрь, к механизмам, которые сеть собирает в себе сама, пока учится. У машины Розенблатта веса были ручками, и их можно было потрогать. У большой модели ручек больше сотни миллиардов, ни одну не повернул человек, и ни на одной нет подписи.