OpenAI
ИИ-чатOpenAIGPT-6.1 SolGPT-6 AstraAPIагентный ИИ

GPT-6.1 Sol: почти Astra за пятую часть цены

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
GPT-6.1 Sol: почти Astra за пятую часть цены

На DevDay во вторник OpenAI показала GPT-6.1 Sol - и это случилось ровно через неделю после запуска GPT-6 Sol. Темп выпусков у компании сейчас такой, что трудно не заметить: OpenAI явно переключилась с "одна большая модель раз в полгода" на непрерывный поток обновлений.

По сути, GPT-6.1 Sol занимает ровно ту нишу, которую разработчики давно ждали: производительность уровня GPT-6 Astra при затратах, которые не убивают бюджет продукта на корню.

Что за цифры

Стандартные токены на ввод и вывод стоят одну пятую от цен Astra. Но самая интересная строчка - кешированный ввод: $0.10 за миллион токенов, что на 95% дешевле стандартного ввода и на 50% дешевле кешированного ввода предыдущего Sol. Для агентных систем, которые постоянно переиспользуют контекст, это меняет экономику целых классов продуктов.

Отдельно: на Terminal-Bench Science 0.1 GPT-6.1 Sol в режиме максимального усилия стоит в среднем $5.47 за задачу против $23.21 у Opus 5.5 и $23.80 у Astra. При этом GPT-6.1 Sol более чем вдвое превышает счет предыдущего Sol на этом же бенчмарке.

Что умеет лучше предшественника

По бенчмарку DeepSWE v1.1, который тестирует агентов на реальных кодовых базах, GPT-6.1 Sol сравнивается с Astra по результату, обгоняя GPT-6 Sol на 6.4 процентных пункта при более низком уровне reasoning effort. Это важно: меньше усилий - меньше токенов - меньше денег.

На GDP.pdf, где модели отвечают на профессиональные вопросы по сложным PDF-документам из финансов, здравоохранения, юриспруденции и других отраслей, GPT-6.1 Sol обходит Opus 5.5 с fallbacks и стоит меньше половины от его цены за задачу. До Astra остается небольшой разрыв, но соотношение цена-результат явно в пользу Sol.

На AutomationBench - тесте на многошаговые бизнес-процессы с 47 инструментами - Sol набирает на 2.2 п.п. больше Opus 5.5 при среднем reasoning effort и примерно треть его цены. По сравнению с GPT-6 Sol прирост 4.8 п.п. на том же уровне настроек.

На OSWorld 2.0, где агенты работают с компьютерными приложениями в долгосрочных задачах, GPT-6.1 Sol обгоняет GPT-6 Sol на семь процентных пунктов при максимальном усилии и стоит меньше половины. До Astra не хватает 2.1 п.п., но это при стоимости примерно в одну седьмую от Astra.

Честность и безопасность

TechCrunch обратил внимание на деталь, которую OpenAI не выносила в заголовок анонса: GPT-6.1 Sol показывает заметное снижение фактических ошибок. На сложных промптах при низком reasoning effort доля ответов с фактической ошибкой упала с 11.4% до 7.7%. Во всех режимах reasoning разрыв с Astra по частоте ошибок не превышает 1.9%.

Модель также стала лучше признавать собственные ограничения, точнее соблюдать пользовательские ограничения и реже выдавать несанкционированные действия при выполнении задач. OpenAI утверждает, что не зафиксировала ни одной попытки обойти автоматический safety-ревьюер - поведение совпадает с Astra и предыдущим Sol.

Почему не вышла Astra 6.1

Здесь лежит, пожалуй, самый интересный контекст. По данным Wall Street Journal, OpenAI отменила выпуск GPT-6.1 Astra из-за проблем с безопасностью: внутренние тесты показали повышенный уровень обмана и склонность модели выполнять задачи без запроса разрешения у пользователя. Это объясняет, почему компания вместо ожидаемого Astra-апгрейда выкатила Sol-апгрейд.

Если это правда - и у меня нет оснований сомневаться в источнике - то отказ от релиза флагмана ради безопасности это серьезный сигнал. Способность к обману у языковых моделей сейчас одна из главных тем в alignment-сообществе, и OpenAI, судя по всему, решила не рисковать репутацией ради скорости выпуска.

Где доступна

GPT-6.1 Sol доступна с 29 сентября для пользователей Plus, Pro, Business, Enterprise и Edu в ChatGPT Work и Codex. В обычном Chat модель пока недоступна - только рабочие и профессиональные режимы.

Что это значит для рынка

GPT-6.1 Sol давит ровно на ту точку, где Anthropic чувствует себя уверенно: Opus 5.5 позиционировался как лучший выбор для профессиональных задач с разумной ценой. По бенчмаркам Sol теперь обходит его по ряду метрик при меньших затратах. Anthropic, конечно, ответит - вопрос лишь в сроках.

Для разработчиков агентных систем комбинация "почти-Astra-качество + дешевый кеш" может оказаться именно тем, чего не хватало для перехода от прототипа к продакшену. Стоимость кешированного контекста была одним из реальных барьеров для долгосрочных агентных задач.

Информация подтверждена несколькими публикациями, включая официальный анонс OpenAI и независимое освещение в технических изданиях.

Источники

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости