GPT-OSS 120B
Первая за шесть лет модель OpenAI с открытыми весами (5 августа 2025) под свободной Apache 2.0: 117 млрд параметров, но за счёт архитектуры MoE работает всего 5.1 млрд на токен — модель помещается на одну видеокарту 80 ГБ. MMLU 90.0%, контекст 131K, полный доступ к цепочке рассуждений. Запускается бесплатно у себя, поэтому доступна в России без VPN.
Рейтинг и бенчмарки
Входные и выходные данные
API и стоимость
Способы доступа
Сценарии использования
Тарифы и подписки — OpenAI
Актуальные планы подписки провайдера. Цены могут меняться — уточняйте на странице цен
- Лицензия Apache 2.0 — коммерческое использование разрешено
- Веса на Hugging Face, запуск через Ollama, vLLM или llama.cpp
- Нужна видеокарта на 80 ГБ (для gpt-oss-20b хватит ~16 ГБ)
- Работает без интернета и без VPN
- Данные не покидают ваш контур
- Своё железо не нужно
- Groq — очень высокая скорость выдачи
- OpenRouter, Together и другие хостинги
- Цены и лимиты у каждого свои
- Нужна зарубежная карта
Плюсы и минусы
Подробный обзор
Что такое GPT-OSS 120B
GPT-OSS 120B — модель, которую OpenAI выложила с открытыми весами 5 августа 2025 года под свободной лицензией Apache 2.0. Событие само по себе примечательное: до этого компания не публиковала веса своих языковых моделей с 2019 года, и название GPT-OSS расшифровывается прямо — open source software. Скачать модель может любой, использовать в коммерческих продуктах — тоже, никаких дополнительных условий лицензия не накладывает.
Почему 117 миллиардов параметров помещаются на одну видеокарту
Здесь работает архитектура MoE — «смесь экспертов». Формально в модели 117 миллиардов параметров, разложенных на 128 «экспертов» в 36 слоях. Но на обработку каждого токена включаются только четыре эксперта, то есть реально работают всего 5.1 миллиарда параметров. Отсюда редкое сочетание: качество большой модели при скорости маленькой.
Вдобавок OpenAI обучила модель сразу в формате сжатия MXFP4, поэтому она помещается на одну видеокарту с 80 ГБ памяти без потери качества. Для модели такого размера это необычно скромное требование.
На что она способна
- MMLU 90.0% — общие знания на уровне платных моделей своего времени
- SWE-bench Verified 62.4% — решает почти две трети реальных задач с GitHub
- Примерный паритет с o4-mini на основных тестах рассуждений — то есть уровень платной модели OpenAI, но бесплатно и у себя
- Регулируемая глубина размышлений — низкая, средняя или высокая. Быстрый ответ на простой вопрос и долгое рассуждение над сложным без смены модели
- Полная цепочка рассуждений видна — можно проследить, как модель пришла к выводу. Для отладки агентов это экономит часы
- Вызов инструментов, поиск в вебе, исполнение кода и строгий JSON — всё нужное для агентных сценариев из коробки
Кому она реально подходит
Главный сценарий — когда данные нельзя отправлять наружу. Модель работает в вашем контуре: медицинские записи, юридические документы, внутренняя переписка и код компании не уходят ни в какое облако. Второй сценарий — Россия: локальный запуск не требует ни VPN, ни зарубежной карты, а лицензия Apache 2.0 не ставит никаких территориальных ограничений.
Есть важная оговорка про железо. Восемьдесят гигабайт видеопамяти — это серверная карта уровня H100, дома такой практически ни у кого нет. Для домашнего компьютера реалистична младшая gpt-oss-20b: она запускается примерно на 16 ГБ, то есть на хорошей игровой видеокарте, и остаётся под той же свободной лицензией.
Честно об ограничениях
Два момента стоит понимать до того, как строить на модели что-то серьёзное. Первый: знания обрываются на июне 2024 года. О событиях после этой даты модель не знает — и, что хуже, может отвечать о них уверенно и неправильно, поэтому свежие факты ей нужно подавать в запросе.
Второй: это модель августа 2025 года. Флагманам 2026 года — GPT-5.6, Claude Fable 5, Qwen3.8-Max — она уступает заметно. Выбирать её стоит осознанно: ради открытых весов, приватности и практически нулевой стоимости, а не ради максимального качества ответов. Ещё модель понимает только текст: картинки, аудио и видео ей недоступны.
Сколько стоит
При локальном запуске — ничего, вы платите только за электричество и железо. Если своего железа нет, модель раздают облачные провайдеры, и цены там символические: от $0.03 за миллион входных токенов и $0.17 за миллион выходных на OpenRouter, около $0.15 / $0.60 на Groq в обмен на очень высокую скорость выдачи. Это на порядки дешевле флагманских моделей. Собственного облачного API у OpenAI для этой модели нет — компания раздала веса, а хостингом занимаются сторонние площадки.