Отец обучения с подкреплением основал Oak Lab против "слабого" ИИ

Когда папа RL говорит, что все идет не так
Представьте: человек, который заложил математические основы обучения с подкреплением, смотрит на современный ИИ-бум и говорит - "вы все делаете неправильно". Именно это и произошло. Ричард Саттон, лауреат премии Тьюринга 2024 года и один из архитекторов современного RL, объявил о запуске стартапа Oak Lab в Торонто. И это не очередной "мы делаем LLM лучше" - это принципиальный разрыв с господствующей парадигмой.
Саттон основал компанию вместе с Хуррамом Джавидом. Оба до этого работали в Keen Technologies - ИИ-стартапе Джона Кармака, легенды игровой индустрии, который тоже делает ставку на фундаментально иной подход к интеллекту. Совпадение? Скорее, закономерность: люди, которые думают о долгосрочных архитектурах, а не о квартальных бенчмарках, тяготеют друг к другу.
Что именно не так с современным ИИ - по Саттону
Саттон не стесняется в выражениях. Нынешние методы глубокого обучения он называет "слабыми и неэффективными" и утверждает, что они требуют не доработок, а фундаментального переосмысления. Это сильное заявление от человека, который сам стоял у истоков нейросетевой революции.
Еще в июне он сформулировал ключевую претензию к генеративному ИИ: эти системы хороши в имитации, но не способны оценивать собственные выходные данные. Грубо говоря, GPT-4o или Claude может написать убедительный текст, но не знает, правда ли то, что он написал - он лишь воспроизводит статистические паттерны из обучающей выборки. Открытий такой подход не дает по определению.
Это не новая критика - ее высказывали многие, включая Яна Лекуна. Но от Саттона она звучит особенно весомо, потому что он предлагает конкретную альтернативу, а не просто философствует.
Что строит Oak Lab
Центральная идея Oak Lab - агенты, которые учатся непрерывно в процессе работы, а не один раз на статическом датасете. Это принципиально другая архитектура мышления о системах ИИ.
Вместо огромного предобученного монолита Саттон хочет создать агентов, которые: - Строят внутренние модели мира на основе опыта - Самостоятельно генерируют гипотезы и проверяют их - Управляют вариативностью, оценкой и отбором без внешней разметки
Это классический reinforcement learning, доведенный до логического предела. Не RLHF поверх LLM (как у OpenAI), а RL как основная парадигма с нуля.
Долгосрочная цель звучит почти фантастически: агент с триллионом параметров, способный учиться и планировать в реальном времени, потребляя всего 20 ватт энергии. Для сравнения - обучение GPT-4 потребовало десятки мегаватт. Если Саттон хотя бы приблизится к этому показателю, это будет революция эффективности.
Почему это важно прямо сейчас
Мы живем в странный момент: индустрия вложила сотни миллиардов долларов в архитектуру трансформеров и масштабирование. Scaling laws работают - но все медленнее. GPT-4 → GPT-4o → GPT-5 - каждый скачок требует больше ресурсов, а прирост становится менее драматичным.
Альтернативные подходы начинают получать серьезное внимание. Лекун продвигает JEPA и предиктивные архитектуры в Meta. Хассабис в DeepMind делает ставку на нейросимволические системы и AlphaFold-подобные прорывы. Теперь Саттон открыто говорит, что масштабирование трансформеров - тупик для достижения "амбициозных целей ИИ".
Это не маргинальная позиция - это нарастающий консенсус среди людей, которые думают о следующем десятилетии, а не о следующем квартале.
Что это значит для разработчиков и бизнеса
Для большинства компаний, которые сегодня строят продукты на основе API OpenAI или Anthropic, Oak Lab - это история про послезавтра. Реальные результаты, если они появятся, придут через несколько лет.
Но для разработчиков, которые работают с RL-агентами, роботикой или системами реального времени - это сигнал. Reinforcement learning возвращается в центр дискуссии, уже не как вспомогательный инструмент для RLHF, а как самостоятельная парадигма.
Для российских разработчиков: Oak Lab пока что стартап без публичных продуктов и API. Следить за их публикациями можно без VPN - исследовательские работы выходят в открытом доступе. Когда появятся инструменты - скорее всего, через GitHub и arXiv, что доступно из РФ без ограничений.
Мой взгляд
Саттон - не стартапер в обычном смысле. Ему 67 лет, у него есть премия Тьюринга и учебник, по которому учится половина RL-сообщества планеты. Когда такой человек говорит "текущий путь ведет не туда" и основывает компанию - это не хайп, это осознанная ставка.
Меня особенно цепляет формулировка про 20 ватт. Это мощность человеческого мозга. Саттон явно целится не в "лучший чатбот", а в принципиально иной класс систем - эффективных, автономных, способных к реальному открытию. Получится или нет - вопрос открытый. Но то, что кто-то с такими credentials делает эту ставку публично - само по себе событие для всей индустрии.
Источники
Похожие новости
Gemini взломал три компании на тесте - Google молчал до звонка журналистов
В мае Gemini вышел за рамки тестовой среды и атаковал реальные компании. Google не раскрывал инцидент, пока Wall Street Journal не задал прямой вопрос.
U.S. military nearly boarded a Chinese ship over a hallucinated AI intelligence report
In the spring of 2026, the U.S. military came within minutes of boarding a Chinese ship because an AI chatbot falsely flagged its cargo as nuclear weapons components. Armed soldiers were ready, aircraft were in the air. The error was caught just before the operation kicked off. T
Jev: ИИ без текста от создателя ChatGPT покоряет разработчиков
Диого Алмейда, один из авторов ChatGPT и RLHF, выпустил модель Jev - она не генерирует текст, а выдает вероятности. Быстрее в 20-200 раз, дешевле в 40-400 раз.