Десять лет после AlphaGo: что осталось от той победы
В марте 2016 года AlphaGo обыграла Ли Седоля со счётом 4:1. За десять лет тот же подход из настольной игры перебрался в биологию, математику и энергетику.

В марте 2016 года программа AlphaGo от DeepMind обыграла корейского профессионала Ли Седоля в матче из пяти партий со счётом 4:1. Го считалось игрой, которую компьютеры не возьмут ещё десятилетие: число возможных позиций на доске 19×19 превышает количество атомов в наблюдаемой Вселенной, и перебор здесь бесполезен. Знаменитый 37-й ход во второй партии эксперты сначала сочли ошибкой, а потом признали его тем, до чего человек за 2500 лет истории игры не додумался. С того матча прошло десять лет, и главный след AlphaGo — не в го, а в том, что метод оказался переносимым на задачи, где нет ни доски, ни правил.
Почему это была не просто победа в игре
До AlphaGo сильные игровые программы строились на переборе вариантов и рукописных оценочных функциях. Так работал Deep Blue, обыгравший Каспарова в 1997 году. В го такой подход упирался в стену: ветвление слишком велико, а оценить, кто выигрывает в середине партии, формально почти невозможно.
DeepMind соединила две нейросети с методом поиска по дереву Монте-Карло1. Одна сеть подсказывала перспективные ходы, вторая оценивала позицию, а поиск отбирал лучшее направление, не разбирая все ветки. Сначала модель училась на партиях людей, потом играла сама с собой миллионы раз.
Ключевой сдвиг случился со следующей версией — AlphaGo Zero (2017). Она вообще не видела человеческих партий: стартовала со случайных ходов и за несколько дней обучения с нуля превзошла версию, победившую Ли Седоля. Это был сигнал: система способна находить сильные стратегии без человеческих подсказок, опираясь только на правила и результат.
Значение AlphaGo не в том, что машина обыграла человека в го. А в том, что один и тот же приём — самообучение через игру с собой — оказалось можно оторвать от доски и приложить к задаче, где заранее не знаешь ответа.
Как один метод разошёлся по разным задачам
После го DeepMind последовательно обобщала подход. AlphaZero (2017) одной архитектурой освоила го, шахматы и сёги, обыграв сильнейшие специализированные движки. MuZero (2019) пошла дальше: она обучалась без знания правил игры вообще, выстраивая внутреннюю модель того, как устроен мир, — это уже ближе к реальным задачам, где правила никто не выдаёт списком.
Дальше линия ушла из игр. Самый громкий результат — AlphaFold, предсказание трёхмерной структуры белков по их аминокислотной последовательности. Задача сворачивания белка десятилетиями считалась одной из главных в биологии. AlphaFold2 показала прорывной результат на соревновании CASP в 2020 году, а в 2024-м Демис Хассабис и Джон Джампер получили за эту работу Нобелевскую премию по химии совместно с Дэвидом Бейкером.
Смежные проекты продолжают ту же идею — искать хорошее решение в огромном пространстве вариантов:
- AlphaFold — структуры белков; открытая база предсказанных структур доступна исследователям бесплатно.
- AlphaTensor — поиск более быстрых алгоритмов умножения матриц.
- AlphaDev — оптимизация низкоуровневых алгоритмов сортировки, часть найденных решений попала в стандартную библиотеку C++ LLVM.
- AlphaGeometry — решение олимпиадных задач по геометрии на уровне, близком к призёрам международной олимпиады.
- Управление плазмой в термоядерном реакторе и оптимизация охлаждения дата-центров — приложения того же обучения с подкреплением2.
Что общего у этих задач
Во всех случаях есть огромное пространство вариантов, где перебор невозможен, но есть способ проверить, насколько хорош конкретный кандидат. У белка — насколько предсказанная структура согласуется с физикой и известными данными. У алгоритма умножения — сколько операций он требует. Там, где такую проверку можно формализовать, метод AlphaGo работает. Там, где критерий успеха размыт и субъективен, он буксует.
Чем это отличается от ChatGPT
Публика запомнила ИИ по большим языковым моделям, которые пишут тексты и код. Но AlphaGo и её потомки — про другое. Языковые модели учатся предсказывать следующее слово по гигантскому корпусу текстов. Системы линейки AlphaGo учатся действовать: пробуют ходы, получают сигнал об успехе и улучшают стратегию.
| Признак | Линейка AlphaGo | Языковые модели (LLM) |
|---|---|---|
| Основной метод | Обучение с подкреплением, поиск | Предсказание следующего токена |
| Источник данных | Игра с собой, симуляция | Корпус текстов и кода |
| Что умеет | Находить оптимальные ходы и решения | Генерировать текст, вести диалог |
| Где сильна | Задачи с чётким критерием успеха | Задачи с языком и знаниями |
Сегодня эти две линии сближаются. Обучение с подкреплением, выросшее из игровых экспериментов, применяют для дообучения языковых моделей — как на человеческой обратной связи, так и на автоматических проверках решений в математике и программировании. Идея «пробуй, проверяй результат, улучшайся» из AlphaGo стала частью того, как настраивают современные чат-модели.
Что не сбылось
Через десять лет видно и границы. AlphaGo не привела к «общему интеллекту», о котором заговорили после матча. Каждая громкая система — узкий специалист: AlphaFold не играет в го, AlphaGo не сворачивает белки. Перенос метода требует, чтобы задачу удалось описать как поиск в пространстве с проверяемым результатом, а таких задач в реальном мире меньше, чем хотелось бы.
Отдельная тема — деньги и доступ. Обучение таких систем требует вычислительных ресурсов, которые есть у единиц компаний. Зато результаты вроде базы структур AlphaFold выложены в открытый доступ, и ими пользуются лаборатории по всему миру — здесь эффект оказался куда шире, чем сам исходный алгоритм.
Что стоит запомнить
AlphaGo важна не победой над человеком. Она показала, что связка «нейросеть плюс поиск плюс самообучение» — это не трюк для настольной игры, а метод, который переносится на задачи науки и инженерии, если у них есть измеримый критерий успеха. Нобелевская премия за AlphaFold — прямое подтверждение: дорога от доски го до сворачивания белков заняла восемь лет.
1 Поиск по дереву Монте-Карло (MCTS) — метод, который вместо полного перебора многократно «проигрывает» случайные продолжения из текущей позиции и по их итогам оценивает, какой ход перспективнее.
2 Обучение с подкреплением — подход, при котором система учится действовать методом проб: за удачные действия получает вознаграждение и постепенно выстраивает стратегию, максимизирующую его.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: DeepMind — AlphaGo, The Nobel Prize in Chemistry 2024
Частые вопросы
AlphaGo и AlphaFold — это одна и та же программа?
Может ли обычный человек воспользоваться результатами этих проектов?
Правда, что AlphaGo училась без единой человеческой партии?
Связана ли AlphaGo с ChatGPT?
Значит ли всё это, что ИИ вот-вот заменит учёных?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.