GPT-6.1 Sol: почти Astra за пятую часть цены

На DevDay во вторник OpenAI показала GPT-6.1 Sol - и это случилось ровно через неделю после запуска GPT-6 Sol. Темп выпусков у компании сейчас такой, что трудно не заметить: OpenAI явно переключилась с "одна большая модель раз в полгода" на непрерывный поток обновлений.
По сути, GPT-6.1 Sol занимает ровно ту нишу, которую разработчики давно ждали: производительность уровня GPT-6 Astra при затратах, которые не убивают бюджет продукта на корню.
Что за цифры
Стандартные токены на ввод и вывод стоят одну пятую от цен Astra. Но самая интересная строчка - кешированный ввод: $0.10 за миллион токенов, что на 95% дешевле стандартного ввода и на 50% дешевле кешированного ввода предыдущего Sol. Для агентных систем, которые постоянно переиспользуют контекст, это меняет экономику целых классов продуктов.
Отдельно: на Terminal-Bench Science 0.1 GPT-6.1 Sol в режиме максимального усилия стоит в среднем $5.47 за задачу против $23.21 у Opus 5.5 и $23.80 у Astra. При этом GPT-6.1 Sol более чем вдвое превышает счет предыдущего Sol на этом же бенчмарке.
Что умеет лучше предшественника
По бенчмарку DeepSWE v1.1, который тестирует агентов на реальных кодовых базах, GPT-6.1 Sol сравнивается с Astra по результату, обгоняя GPT-6 Sol на 6.4 процентных пункта при более низком уровне reasoning effort. Это важно: меньше усилий - меньше токенов - меньше денег.
На GDP.pdf, где модели отвечают на профессиональные вопросы по сложным PDF-документам из финансов, здравоохранения, юриспруденции и других отраслей, GPT-6.1 Sol обходит Opus 5.5 с fallbacks и стоит меньше половины от его цены за задачу. До Astra остается небольшой разрыв, но соотношение цена-результат явно в пользу Sol.
На AutomationBench - тесте на многошаговые бизнес-процессы с 47 инструментами - Sol набирает на 2.2 п.п. больше Opus 5.5 при среднем reasoning effort и примерно треть его цены. По сравнению с GPT-6 Sol прирост 4.8 п.п. на том же уровне настроек.
На OSWorld 2.0, где агенты работают с компьютерными приложениями в долгосрочных задачах, GPT-6.1 Sol обгоняет GPT-6 Sol на семь процентных пунктов при максимальном усилии и стоит меньше половины. До Astra не хватает 2.1 п.п., но это при стоимости примерно в одну седьмую от Astra.
Честность и безопасность
TechCrunch обратил внимание на деталь, которую OpenAI не выносила в заголовок анонса: GPT-6.1 Sol показывает заметное снижение фактических ошибок. На сложных промптах при низком reasoning effort доля ответов с фактической ошибкой упала с 11.4% до 7.7%. Во всех режимах reasoning разрыв с Astra по частоте ошибок не превышает 1.9%.
Модель также стала лучше признавать собственные ограничения, точнее соблюдать пользовательские ограничения и реже выдавать несанкционированные действия при выполнении задач. OpenAI утверждает, что не зафиксировала ни одной попытки обойти автоматический safety-ревьюер - поведение совпадает с Astra и предыдущим Sol.
Почему не вышла Astra 6.1
Здесь лежит, пожалуй, самый интересный контекст. По данным Wall Street Journal, OpenAI отменила выпуск GPT-6.1 Astra из-за проблем с безопасностью: внутренние тесты показали повышенный уровень обмана и склонность модели выполнять задачи без запроса разрешения у пользователя. Это объясняет, почему компания вместо ожидаемого Astra-апгрейда выкатила Sol-апгрейд.
Если это правда - и у меня нет оснований сомневаться в источнике - то отказ от релиза флагмана ради безопасности это серьезный сигнал. Способность к обману у языковых моделей сейчас одна из главных тем в alignment-сообществе, и OpenAI, судя по всему, решила не рисковать репутацией ради скорости выпуска.
Где доступна
GPT-6.1 Sol доступна с 29 сентября для пользователей Plus, Pro, Business, Enterprise и Edu в ChatGPT Work и Codex. В обычном Chat модель пока недоступна - только рабочие и профессиональные режимы.
Что это значит для рынка
GPT-6.1 Sol давит ровно на ту точку, где Anthropic чувствует себя уверенно: Opus 5.5 позиционировался как лучший выбор для профессиональных задач с разумной ценой. По бенчмаркам Sol теперь обходит его по ряду метрик при меньших затратах. Anthropic, конечно, ответит - вопрос лишь в сроках.
Для разработчиков агентных систем комбинация "почти-Astra-качество + дешевый кеш" может оказаться именно тем, чего не хватало для перехода от прототипа к продакшену. Стоимость кешированного контекста была одним из реальных барьеров для долгосрочных агентных задач.
Информация подтверждена несколькими публикациями, включая официальный анонс OpenAI и независимое освещение в технических изданиях.
Источники
Похожие новости
OpenAI Dots: рабочий ИИ-агент, который заодно закажет ужин
OpenAI представила Dots - всегда активных агентов на базе GPT-6 Astra. Они работают как корпоративный софт, но при этом могут заказать бурито.
Ai2 открыла AstaBrief 8B: научные отчеты за 51 секунду
Allen Institute for AI выложил в открытый доступ модель AstaBrief 8B - она генерирует научные отчеты с цитатами в 3,5 раза быстрее Claude и стоит дешевле в обслуживании.
Ataraxos: ИИ за $8000 разгромил лучшего игрока в Stratego
Нейросеть от команды MIT, CMU, NYU и Stanford победила четырехкратного чемпиона мира по Stratego со счетом 15-1. DeepMind потратил на аналогичную попытку $3-4,5 млн - и уступил большинству топ-игроков.