GPT-OSS 120B

GPT-OSS 120B

Первая за шесть лет модель OpenAI с открытыми весами (5 августа 2025) под свободной Apache 2.0: 117 млрд параметров, но за счёт архитектуры MoE работает всего 5.1 млрд на токен — модель помещается на одну видеокарту 80 ГБ. MMLU 90.0%, контекст 131K, полный доступ к цепочке рассуждений. Запускается бесплатно у себя, поэтому доступна в России без VPN.

Бесплатно при локальном запуске; через провайдеров от $0.03 / $0.17 за 1M токеновРаботает в РФ
7.9/10📅 2025-08-05🏢 OpenAI✓ Open Source

Рейтинг и бенчмарки

Общий рейтинг
7.9/10
Benchmark Score
7.9/10
Скорость
8.7/10
MMLU
90.0%
SWE-bench Verified
62.4%
MMMLU (многоязычный)
81.3% в среднем
HealthBench Realistic
57.6%
Против o4-mini
примерно паритет на основных тестах рассуждений
Активные параметры
5.1 млрд из 117 млрд — отсюда высокая скорость

Входные и выходные данные

Входные данные
текст
Выходные данные
текст

API и стоимость

Входные токены (Input)
Бесплатно при локальном запуске; через провайдеров от $0.03 / $0.17 за 1M токенов
цена за промпт
Выходные токены (Output)
от $0.17 за 1M токенов у провайдеров; локально — бесплатно
цена за ответ
API доступен

Способы доступа

локальный запуск (Hugging FaceOllamallama.cppvLLM)облачные провайдеры (GroqOpenRouterTogether)

Сценарии использования

локальный ИИ-ассистент без отправки данных наружуагенты с вызовом инструментовпрограммированиеобработка документовкорпоративные внедрения с требованиями к приватности

Тарифы и подписки — OpenAI

Актуальные планы подписки провайдера. Цены могут меняться — уточняйте на странице цен

Популярный
Локальный запуск
Бесплатно
  • Лицензия Apache 2.0 — коммерческое использование разрешено
  • Веса на Hugging Face, запуск через Ollama, vLLM или llama.cpp
  • Нужна видеокарта на 80 ГБ (для gpt-oss-20b хватит ~16 ГБ)
  • Работает без интернета и без VPN
  • Данные не покидают ваш контур
Через провайдеров
от $0.03 / $0.17 за 1M
  • Своё железо не нужно
  • Groq — очень высокая скорость выдачи
  • OpenRouter, Together и другие хостинги
  • Цены и лимиты у каждого свои
  • Нужна зарубежная карта
Российские карты не принимаются.Genova-ai — работает в РФ без VPN

Плюсы и минусы

✓ Плюсы
Свободная лицензия Apache 2.0 без оговорок: можно использовать коммерчески, дообучать и встраивать в свои продукты — это первая открытая модель OpenAI с 2019 года
Архитектура MoE даёт редкое сочетание: качества 117-миллиардной модели при скорости 5-миллиардной, потому что на каждый токен работает лишь 5.1 млрд параметров
Помещается на одну видеокарту 80 ГБ благодаря родному сжатию MXFP4 — для модели такого размера это необычно скромное требование
MMLU 90.0% и примерный паритет с o4-mini на основных тестах рассуждений — уровень платной модели, но у себя и бесплатно
Регулируемая глубина размышлений (низкая, средняя, высокая) — можно менять баланс скорости и качества под задачу без смены модели
Полный доступ к цепочке рассуждений: видно, как модель пришла к ответу, что важно для отладки агентов и проверки логики
Работает в России без VPN при локальном запуске, а данные не покидают ваш контур — весомый аргумент для корпоративных внедрений
Есть младшая gpt-oss-20b — запускается примерно на 16 ГБ памяти, то есть на игровом компьютере
Умеет вызывать инструменты, искать в вебе, исполнять код и выдавать строгий JSON — готова для агентных сценариев
У провайдеров стоит копейки: от $0.03 за миллион входных токенов — на порядки дешевле флагманов
✗ Минусы
Знания обрываются на июне 2024 года: о событиях после этой даты модель не знает, а на вопросы о них может отвечать уверенно и неверно
Это модель августа 2025 года — современным флагманам 2026 года она уступает заметно, брать её стоит ради открытости и цены, а не ради максимального качества
Только текст: картинки, аудио и видео не понимает вообще
Восемьдесят гигабайт видеопамяти — это серверная карта уровня H100, дома такой почти никогда нет. Для домашнего запуска реалистична только младшая gpt-oss-20b
Локальный запуск требует технических навыков: развернуть vLLM или llama.cpp с нуля — задача не для нетехнического пользователя
Русский язык знает хуже английского: 81.3% на многоязычном MMLU — приличный, но не выдающийся результат
Официального облачного API от самой OpenAI нет — модель раздаётся весами, а хостинг обеспечивают сторонние провайдеры со своими ценами и лимитами

Подробный обзор

Что такое GPT-OSS 120B

GPT-OSS 120B — модель, которую OpenAI выложила с открытыми весами 5 августа 2025 года под свободной лицензией Apache 2.0. Событие само по себе примечательное: до этого компания не публиковала веса своих языковых моделей с 2019 года, и название GPT-OSS расшифровывается прямо — open source software. Скачать модель может любой, использовать в коммерческих продуктах — тоже, никаких дополнительных условий лицензия не накладывает.

Почему 117 миллиардов параметров помещаются на одну видеокарту

Здесь работает архитектура MoE — «смесь экспертов». Формально в модели 117 миллиардов параметров, разложенных на 128 «экспертов» в 36 слоях. Но на обработку каждого токена включаются только четыре эксперта, то есть реально работают всего 5.1 миллиарда параметров. Отсюда редкое сочетание: качество большой модели при скорости маленькой.

Вдобавок OpenAI обучила модель сразу в формате сжатия MXFP4, поэтому она помещается на одну видеокарту с 80 ГБ памяти без потери качества. Для модели такого размера это необычно скромное требование.

На что она способна

  • MMLU 90.0% — общие знания на уровне платных моделей своего времени
  • SWE-bench Verified 62.4% — решает почти две трети реальных задач с GitHub
  • Примерный паритет с o4-mini на основных тестах рассуждений — то есть уровень платной модели OpenAI, но бесплатно и у себя
  • Регулируемая глубина размышлений — низкая, средняя или высокая. Быстрый ответ на простой вопрос и долгое рассуждение над сложным без смены модели
  • Полная цепочка рассуждений видна — можно проследить, как модель пришла к выводу. Для отладки агентов это экономит часы
  • Вызов инструментов, поиск в вебе, исполнение кода и строгий JSON — всё нужное для агентных сценариев из коробки

Кому она реально подходит

Главный сценарий — когда данные нельзя отправлять наружу. Модель работает в вашем контуре: медицинские записи, юридические документы, внутренняя переписка и код компании не уходят ни в какое облако. Второй сценарий — Россия: локальный запуск не требует ни VPN, ни зарубежной карты, а лицензия Apache 2.0 не ставит никаких территориальных ограничений.

Есть важная оговорка про железо. Восемьдесят гигабайт видеопамяти — это серверная карта уровня H100, дома такой практически ни у кого нет. Для домашнего компьютера реалистична младшая gpt-oss-20b: она запускается примерно на 16 ГБ, то есть на хорошей игровой видеокарте, и остаётся под той же свободной лицензией.

Честно об ограничениях

Два момента стоит понимать до того, как строить на модели что-то серьёзное. Первый: знания обрываются на июне 2024 года. О событиях после этой даты модель не знает — и, что хуже, может отвечать о них уверенно и неправильно, поэтому свежие факты ей нужно подавать в запросе.

Второй: это модель августа 2025 года. Флагманам 2026 года — GPT-5.6, Claude Fable 5, Qwen3.8-Max — она уступает заметно. Выбирать её стоит осознанно: ради открытых весов, приватности и практически нулевой стоимости, а не ради максимального качества ответов. Ещё модель понимает только текст: картинки, аудио и видео ей недоступны.

Сколько стоит

При локальном запуске — ничего, вы платите только за электричество и железо. Если своего железа нет, модель раздают облачные провайдеры, и цены там символические: от $0.03 за миллион входных токенов и $0.17 за миллион выходных на OpenRouter, около $0.15 / $0.60 на Groq в обмен на очень высокую скорость выдачи. Это на порядки дешевле флагманских моделей. Собственного облачного API у OpenAI для этой модели нет — компания раздала веса, а хостингом занимаются сторонние площадки.

Часто задаваемые вопросы

Что такое GPT-OSS 120B?
Открытая модель OpenAI, выпущенная 5 августа 2025 года под свободной лицензией Apache 2.0 — первая модель компании с открытыми весами с 2019 года. В ней 117 миллиардов параметров, но благодаря архитектуре MoE на каждый токен работают лишь 5.1 миллиарда, поэтому она быстрая и помещается на одну видеокарту 80 ГБ. Контекст — 131 072 токена.
GPT-OSS 120B действительно бесплатная?
При локальном запуске — да, полностью. Лицензия Apache 2.0 разрешает всё, включая коммерческое использование и дообучение, никаких отчислений и ограничений нет. Если своего железа нет, облачные провайдеры берут символические деньги: от $0.03 за миллион входных токенов и $0.17 за миллион выходных.
Какое железо нужно для GPT-OSS 120B?
Видеокарта с 80 ГБ памяти — это серверный уровень вроде H100, дома такой почти не бывает. Модель влезает на одну карту благодаря родному сжатию MXFP4, но требование всё равно серьёзное. Для домашнего компьютера есть младшая gpt-oss-20b под той же лицензией — ей хватает примерно 16 ГБ, то есть хорошей игровой видеокарты.
Работает ли GPT-OSS 120B в России?
Да. При локальном запуске нужны только веса с Hugging Face — ни VPN, ни зарубежная карта не требуются, модель работает даже без интернета. Лицензия Apache 2.0 не накладывает территориальных ограничений. Для доступа через облачных провайдеров понадобится зарубежная карта.
Насколько GPT-OSS 120B хороша по сравнению с платными моделями?
На момент выхода она показывала примерный паритет с o4-mini на основных тестах рассуждений: MMLU 90.0%, SWE-bench Verified 62.4%. Но это модель августа 2025 года, и флагманам 2026 года — GPT-5.6, Claude Fable 5, Qwen3.8-Max — она уступает заметно. Её выбирают за открытость, приватность и цену, а не за максимальное качество.
Что означает регулируемая глубина размышлений?
У модели три режима — низкий, средний и высокий. На простом вопросе можно поставить низкий и получить мгновенный ответ, на сложной задаче включить высокий и дать модели порассуждать подольше. Это позволяет менять баланс скорости и качества под конкретную задачу, не переключаясь на другую модель. Вдобавок видна вся цепочка рассуждений, что удобно при отладке агентов.
Чем GPT-OSS 120B отличается от gpt-oss-20b?
Размером и требованиями к железу. Старшая на 117 миллиардов параметров требует видеокарту 80 ГБ и отвечает точнее, младшая на 20 миллиардов запускается примерно на 16 ГБ, то есть на домашнем игровом компьютере, но заметно проще. Лицензия Apache 2.0 и набор возможностей у обеих одинаковые — выбор упирается только в доступное железо.
Знает ли GPT-OSS 120B о свежих событиях?
Нет, её знания обрываются на июне 2024 года. О более поздних событиях модель не осведомлена и может отвечать о них уверенно, но неверно — это типичное поведение языковых моделей. Если нужны актуальные данные, подавайте их прямо в запросе или подключайте поиск: вызов инструментов и веб-поиск модель поддерживает.

Все эти инструменты — уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно