Meta научила ИИ-агентов не забывать ошибки с помощью агента-напоминалки

Когда умный агент ведет себя как Дори из "В поисках Немо"
Представьте: вы наняли блестящего разработчика, он внимательно прочитал все требования, обнаружил баг, диагностировал его причину - и ровно через двадцать шагов попытался сделать то же самое, что уже не сработало, нарушил ограничение, о котором сам же только что предупредил, и уставился на старый баг как на новый. Именно так ведут себя современные ИИ-агенты при решении сложных многоэтапных задач. Meta AI дала этому явлению точное название - behavioral state decay ("распад поведенческого состояния") - и предложила неожиданно элегантное решение.
В статье, опубликованной на arXiv 9 июля 2026 года, исследователи Meta описывают архитектуру Proactive Memory Agent (PMA) - системы, где рядом с основным агентом работает второй, легкий агент, единственная задача которого - следить за ходом работы и решать, когда стоит вмешаться с напоминанием, а когда лучше промолчать.
Почему длинный контекст не спасает
Первый инстинкт индустрии при подобных проблемах - дать агенту больше контекста. Больше токенов, длиннее окно, подробнее история. Meta проверила этот подход и пришла к неудобному выводу: он не работает.
Дело не в том, что информация исчезает из контекста. Чаще всего она там есть. Проблема в том, что по мере роста истории задачи критически важные факты - "команда X не работает", "файл был переименован", "пользователь запретил трогать этот модуль" - перестают надежно влиять на следующий шаг агента. Они буквально тонут в потоке менее важных деталей.
Простая суммаризация тоже не решает задачу: суммаризатор решает, что сохранить, но не решает, когда именно напомнить об этом действующему агенту. А это совершенно разные задачи.
Архитектура: два агента, один молчит
Решение Meta намеренно негламурное. Основной "агент действий" (Action Agent) не трогается вообще - никакого дообучения, никаких изменений в харнессе. Рядом с ним запускается Memory Agent, который через фиксированные интервалы просматривает скользящее окно последних шагов и обновляет структурированный банк памяти.
Этот банк состоит из трех разделов: - Status - текущее состояние задачи и незакрытые риски (агент действий этого не видит) - Knowledge Memory - стабильные факты: требования, пути к файлам, конфигурации - Procedural Memory - что пробовали, что сработало, что провалилось, какие гипотезы были отвергнуты
Memory Agent может обновлять банк только через заранее определенные инструментальные вызовы, а не свободно перезаписывать содержимое. После обновления он принимает решение - добавить короткое напоминание в следующий запрос к Action Agent или промолчать. Решение промолчать - это полноценная часть политики агента, а не дефолтное поведение.
Именно это отличает PMA от любого суммаризатора или RAG-системы: здесь оценивается не "что важно вообще", а "нужно ли это прямо сейчас, в следующем конкретном шаге".
Цифры, которые убеждают
Исследователи тестировали систему на двух бенчмарках. Terminal-Bench 2.0 - реалистичные многошаговые задачи в командной строке и написание кода. τ²-Bench - разговорные агенты с инструментами в сценариях авиакомпании, ритейла и телекома.
С Claude Sonnet 4.5 в роли Action Agent и Claude Opus 4.6 в роли Memory Agent: - На Terminal-Bench 2.0: pass@1 вырос с 37,6% до 45,9% - прирост 8,3 процентных пункта - На τ²-Bench: прирост составил 6,8 процентных пункта
Восемь с лишним процентных пунктов на первой попытке - это не академическая статистика. Это разница между "работающим прототипом" и "продуктом, которому доверяют". Особенно показательно, что весь прирост достигнут без каких-либо изменений в базовой модели.
Аблационные исследования в статье подтверждают: именно избирательность вмешательств отвечает за большую часть улучшений. Постоянные напоминания - даже содержательные - дают меньший эффект, чем точечные, поданные в нужный момент. Слишком частые напоминания добавляют латентность, сжигают токены и отвлекают агента.
Что это меняет для разработчиков
Для тех, кто строит агентные системы прямо сейчас, PMA - это архитектурный сигнал, который сложно игнорировать. Индустрия годами отвечала на проблему ненадежности агентов одним способом: "больше". Больше параметров, больше контекста, больше ретривала. Meta показывает, что правильный ответ может быть "меньше, но умнее".
Модульность системы - реальное практическое преимущество. Если PMA действительно работает как plug-and-play компонент без изменения основного агента, это означает, что ее можно внедрить в существующие пайплайны без переработки архитектуры. Это сильно снижает порог входа.
Для сравнения: конкурирующие подходы вроде рефлексивных агентов (ReAct, Reflexion) требуют либо дообучения, либо встраивания рефлексии в сам агент, что усложняет систему и делает ее менее предсказуемой. PMA разделяет ответственность чисто: один агент действует, другой помнит и решает, когда напомнить.
Российский контекст
Для российских разработчиков: статья опубликована в открытом доступе на arXiv, код пока не выложен в публичные репозитории, но архитектура описана достаточно подробно для самостоятельной реализации. Claude Opus 4.6 и Sonnet 4.5, использованные в экспериментах, доступны через API Anthropic - с VPN и зарубежной картой. Принципиальных препятствий для воспроизведения подхода с другими LLM (например, через OpenAI API или локальные модели) нет.
Главный вывод
Meta не изобрела новый тип памяти и не создала новую архитектуру трансформера. Исследователи решили конкретную, болезненную проблему: агент знает, но не использует знание в нужный момент. Второй агент, который большую часть времени молчит - и именно поэтому работает - это один из тех редких случаев, когда решение умнее, чем кажется с первого взгляда.
Информация подтверждена несколькими независимыми публикациями, включая технический разбор и анализ архитектурных последствий для production-систем.
Похожие новости
Ataraxos: ИИ за $8000 разгромил лучшего игрока в Stratego
Нейросеть от команды MIT, CMU, NYU и Stanford победила четырехкратного чемпиона мира по Stratego со счетом 15-1. DeepMind потратил на аналогичную попытку $3-4,5 млн - и уступил большинству топ-игроков.
OpenAI DevDay 2026: Dots, GPT-6.1 Sol и 1,2 млрд пользователей в неделю
OpenAI провела DevDay 2026: автономные агенты Dots, модель GPT-6.1 Sol за пятую часть цены Astra и новый рекорд аудитории ChatGPT.
GPT-6.1 Sol: почти Astra за пятую часть цены
OpenAI представила GPT-6.1 Sol - модель, которая почти догоняет GPT-6 Astra по качеству, но стоит в пять раз дешевле. Кешированный ввод - $0.10 за миллион токенов.