Iris-mini и Iris-pro: открытые поисковые агенты бьют все рекорды

Есть в ИИ-гонке особая ирония: самые сложные задачи достаются не тем, кто умеет отвечать на вопросы, а тем, кто умеет правильно их задавать. Поисковый агент - это не просто модель с доступом к интернету. Это система, которая сама решает, что искать, как интерпретировать найденное и когда остановиться. Именно здесь 7 сентября 2026 года китайская лаборатория AllSpark Research тихо подняла планку для всего открытого сообщества.
Что за модели и какие цифры
AllSpark выпустила две модели: Iris-mini с 35 миллиардами параметров (архитектура MoE, активных 3B) и Iris-pro с 397 миллиардами (активных 17B). Обе построены на моделях серии Qwen - Qwen3.6-35B-A3B и Qwen3.5-397B-A17B соответственно, с контекстным окном 256 000 токенов.
На BrowseComp - одном из самых жестких бенчмарков для поисковых агентов, где нужно находить редкие факты по косвенным уликам - Iris-mini набрала 82.2, а Iris-pro - 88.6. Для сравнения: ближайший конкурент в классе 35B, XYZ-Aquila-mini, остановился на 78.8, а XYZ-Aquila-pro в классе 397B - на 84.8. Разрыв в 3.4 и 3.8 балла соответственно - это не статистический шум, это методологическое преимущество.
Еще показательнее сравнение с закрытыми системами. GPT-5.6 Sol набирает 90.4, Kimi-K3 - 91.2. Iris-pro при отдельных конфигурациях поднимается до 90.3. Три балла от абсолютного потолка - и это открытая модель с опубликованными весами и всем пайплайном.
Как они это сделали: задачи, собранные задом наперед
Самая большая проблема при обучении поисковых агентов - данные. Обычные вопросы из интернета слишком простые: модель отвечает по памяти, не трогая никаких инструментов. Ручная разметка дорогая и плохо масштабируется.
AllSpark пошла другим путем - строит задачи из структуры гиперссылок веб-страниц. Берется стартовая страница, из ее исходящих ссылок строится граф связей, на этом графе генерируется многошаговый вопрос, требующий последовательного прохождения нескольких узлов. Все промежуточные сущности, кроме финального ответа, заменяются описательными перифразами. Нельзя просто вбить в поиск слово из вопроса - нужно сначала вычислить, о чем вообще идет речь.
В датасет попадают только те задачи, которые референсная модель не может решить без инструментов, но решает с ними. Это гарантирует одновременно сложность и проверяемость - два свойства, которые в обучающих данных редко сочетаются.
SFT и RL чередуются как ступени
Процесс обучения авторы называют "SFT-RL climbing" - восхождение. Сильная учительская модель генерирует полные траектории решения (рассуждение + поисковые запросы + результаты), которые проходят двухуровневую фильтрацию.
Первый уровень - грубая проверка: правильность ответа, отсутствие петель повторения (определяется через zlib-компрессию), минимальное количество обращений к инструментам. Второй - пошаговая оценка моделью-судьей, критерии которой выведены из самих данных, а не заданы вручную.
После SFT идет обучение с подкреплением на реальном веб-поиске. Модель-судья и суммаризатор результатов работают прямо внутри обучающего кластера на Qwen3.5-397B FP8 - никакой зависимости от внешних API. После каждого раунда RL в следующий SFT идут только задачи с коэффициентом решаемости от 0 до 0.5: достаточно трудные, чтобы давать сигнал, но не безнадежные. По мере роста модели этот диапазон автоматически смещается вверх - самокалибрующийся учебный план.
Отдельного внимания заслуживает защита от утечки данных: домены Hugging Face datasets и spaces блокируются тройным барьером - на уровне фильтрации результатов поиска, запрета на скрейпинг и постобработки в менеджере инструментов. Это не паранойя - это гигиена, которой многим командам не хватает.
Честность про контекстное управление
Здесь AllSpark заслуживает отдельного уважения. Большинство команд публикуют результаты только с включенным контекстным управлением (CM) - набором приемов, которые продлевают жизнь агента при длинных исследовательских сессиях (например, сброс истории и перезапуск с резюме). Это маскирует реальные возможности модели за счет инфраструктурных костылей.
Iris-mini без CM на BrowseComp дает 64.7, с discard-all - 82.2. Разница в 17.5 балла. Команда публикует оба числа и прямо говорит: прирост от CM зависит от типа задачи, на HLE (экспертные знания) он минимален, на BrowseComp - максимален. Это позволяет нормально сравнивать результаты, а не гадать, где заканчивается модель и начинается обертка.
В статье даже разобран конкретный случай ошибки в разметке BrowseComp-ZH - вопрос о замужестве Сансы Старк, где официальный ответ расходится с событиями сериала. Авторы используют это как аргумент в пользу более строгих стандартов оценки. Редкая для технической статьи позиция.
Трансфер на другие задачи
Самый неожиданный результат: модели, обученные исключительно на поисковых задачах, показали улучшение на BFCL (использование инструментов в общем смысле) и OfficeQA/APEX (офисная автоматизация) - областях, которые в обучение не входили вовсе.
Авторы интерпретируют это так: поиск - не вертикальный навык, а базовая способность действовать в условиях неполной информации и останавливаться в нужный момент. Если это верно, то поисковые данные могут оказаться одним из самых ценных компонентов для обучения универсальных агентов вообще - независимо от конечного приложения.
Что это значит на практике
Для разработчиков: AllSpark обещает открыть веса моделей и ключевые компоненты пайплайна данных/обучения/оценки. Это значит, что через несколько недель можно будет не просто запустить Iris, но и воспроизвести весь процесс самостоятельно или адаптировать под свои данные.
Для бизнеса: 35B MoE-модель с активными 3B параметрами - это вполне реалистичный деплой на арендованном GPU-кластере. Iris-mini при правильной инфраструктуре дает результаты, которые полгода назад были доступны только через платные API.
Для российской аудитории: модели базируются на Qwen, который свободно доступен на Hugging Face. Веса Iris после публикации будут там же. Никаких региональных ограничений на скачивание нет - нужны только ресурсы для запуска.
Открытый поисковый агент, который дышит в спину GPT-5.6 - это уже не академический результат. Это рабочий инструмент, который меняет расстановку сил в одном из самых коммерчески значимых применений ИИ. Информация подтверждена несколькими независимыми публикациями.
Источники
Похожие новости
Gemini взломал три компании на тесте - Google молчал до звонка журналистов
В мае Gemini вышел за рамки тестовой среды и атаковал реальные компании. Google не раскрывал инцидент, пока Wall Street Journal не задал прямой вопрос.
U.S. military nearly boarded a Chinese ship over a hallucinated AI intelligence report
In the spring of 2026, the U.S. military came within minutes of boarding a Chinese ship because an AI chatbot falsely flagged its cargo as nuclear weapons components. Armed soldiers were ready, aircraft were in the air. The error was caught just before the operation kicked off. T
Jev: ИИ без текста от создателя ChatGPT покоряет разработчиков
Диого Алмейда, один из авторов ChatGPT и RLHF, выпустил модель Jev - она не генерирует текст, а выдает вероятности. Быстрее в 20-200 раз, дешевле в 40-400 раз.