Meta научила ИИ-агентов не забывать ошибки с помощью агента-напоминалки

Когда умный агент ведёт себя как Дори из «В поисках Немо»
Представьте: вы наняли блестящего разработчика, он внимательно прочитал все требования, обнаружил баг, диагностировал его причину — и ровно через двадцать шагов попытался сделать то же самое, что уже не сработало, нарушил ограничение, о котором сам же только что предупредил, и уставился на старый баг как на новый. Именно так ведут себя современные ИИ-агенты при решении сложных многоэтапных задач. Meta AI дала этому явлению точное название — behavioral state decay («распад поведенческого состояния») — и предложила неожиданно элегантное решение.
В статье, опубликованной на arXiv 9 июля 2026 года, исследователи Meta описывают архитектуру Proactive Memory Agent (PMA) — системы, где рядом с основным агентом работает второй, лёгкий агент, единственная задача которого — следить за ходом работы и решать, когда стоит вмешаться с напоминанием, а когда лучше промолчать.
Почему длинный контекст не спасает
Первый инстинкт индустрии при подобных проблемах — дать агенту больше контекста. Больше токенов, длиннее окно, подробнее история. Meta проверила этот подход и пришла к неудобному выводу: он не работает.
Дело не в том, что информация исчезает из контекста. Чаще всего она там есть. Проблема в том, что по мере роста истории задачи критически важные факты — «команда X не работает», «файл был переименован», «пользователь запретил трогать этот модуль» — перестают надёжно влиять на следующий шаг агента. Они буквально тонут в потоке менее важных деталей.
Простая суммаризация тоже не решает задачу: суммаризатор решает, что сохранить, но не решает, когда именно напомнить об этом действующему агенту. А это совершенно разные задачи.
Архитектура: два агента, один молчит
Решение Meta намеренно негламурное. Основной «агент действий» (Action Agent) не трогается вообще — никакого дообучения, никаких изменений в харнессе. Рядом с ним запускается Memory Agent, который через фиксированные интервалы просматривает скользящее окно последних шагов и обновляет структурированный банк памяти.
Этот банк состоит из трёх разделов: - Status — текущее состояние задачи и незакрытые риски (агент действий этого не видит) - Knowledge Memory — стабильные факты: требования, пути к файлам, конфигурации - Procedural Memory — что пробовали, что сработало, что провалилось, какие гипотезы были отвергнуты
Ключевой момент: Memory Agent может обновлять банк только через заранее определённые инструментальные вызовы, а не свободно перезаписывать содержимое. После обновления он принимает решение — добавить короткое напоминание в следующий запрос к Action Agent или промолчать. Решение промолчать — это полноценная часть политики агента, а не дефолтное поведение.
Именно это отличает PMA от любого суммаризатора или RAG-системы: здесь оценивается не «что важно вообще», а «нужно ли это прямо сейчас, в следующем конкретном шаге».
Цифры, которые убеждают
Исследователи тестировали систему на двух бенчмарках. Terminal-Bench 2.0 — реалистичные многошаговые задачи в командной строке и написание кода. τ²-Bench — разговорные агенты с инструментами в сценариях авиакомпании, ритейла и телекома.
С Claude Sonnet 4.5 в роли Action Agent и Claude Opus 4.6 в роли Memory Agent: - На Terminal-Bench 2.0: pass@1 вырос с 37,6% до 45,9% — прирост 8,3 процентных пункта - На τ²-Bench: прирост составил 6,8 процентных пункта
Восемь с лишним процентных пунктов на первой попытке — это не академическая статистика. Это разница между «работающим прототипом» и «продуктом, которому доверяют». Особенно показательно, что весь прирост достигнут без каких-либо изменений в базовой модели.
Аблационные исследования в статье подтверждают: именно избирательность вмешательств отвечает за большую часть улучшений. Постоянные напоминания — даже содержательные — дают меньший эффект, чем точечные, поданные в нужный момент. Слишком частые напоминания добавляют латентность, сжигают токены и отвлекают агента.
Что это меняет для разработчиков
Для тех, кто строит агентные системы прямо сейчас, PMA — это архитектурный сигнал, который сложно игнорировать. Индустрия годами отвечала на проблему ненадёжности агентов одним способом: «больше». Больше параметров, больше контекста, больше ретривала. Meta показывает, что правильный ответ может быть «меньше, но умнее».
Модульность системы — реальное практическое преимущество. Если PMA действительно работает как plug-and-play компонент без изменения основного агента, это означает, что её можно внедрить в существующие пайплайны без переработки архитектуры. Это сильно снижает порог входа.
Для сравнения: конкурирующие подходы вроде рефлексивных агентов (ReAct, Reflexion) требуют либо дообучения, либо встраивания рефлексии в сам агент, что усложняет систему и делает её менее предсказуемой. PMA разделяет ответственность чисто: один агент действует, другой помнит и решает, когда напомнить.
Российский контекст
Для российских разработчиков: статья опубликована в открытом доступе на arXiv, код пока не выложен в публичные репозитории, но архитектура описана достаточно подробно для самостоятельной реализации. Claude Opus 4.6 и Sonnet 4.5, использованные в экспериментах, доступны через API Anthropic — с VPN и зарубежной картой. Принципиальных препятствий для воспроизведения подхода с другими LLM (например, через OpenAI API или локальные модели) нет.
Главный вывод
Meta не изобрела новый тип памяти и не создала новую архитектуру трансформера. Исследователи решили конкретную, болезненную проблему: агент знает, но не использует знание в нужный момент. Второй агент, который большую часть времени молчит — и именно поэтому работает — это один из тех редких случаев, когда решение умнее, чем кажется с первого взгляда.
Информация подтверждена несколькими независимыми публикациями, включая технический разбор и анализ архитектурных последствий для production-систем.
Похожие новости
OpenAI распустила команду по катастрофическим рискам ИИ
OpenAI тихо ликвидировала отдел Preparedness, который оценивал угрозы от собственных моделей. Сотрудники говорят о нарастающем «чувстве тревоги и ответственности».
Optima: бенчмарки ИИ наконец-то на ваших реальных данных
Artificial Analysis запустила платформу Optima, которая позволяет строить персональные бенчмарки для LLM на основе собственных данных и сравнивать модели не только по качеству, но и по стоимости задачи.
ИИ-книги затопили Amazon и режут доходы живых авторов
Исследование 14 000 книг показало: ИИ-контент занял 20% каталога, но забирает лишь 12% выручки — зато тянет вниз доходы всех авторов без исключения.