Llama 4 Scout

Llama 4 Scout

Открытая мультимодальная MoE-модель Meta (апрель 2025): 109B总 параметров при 17B активных на 16 экспертах, рекордный контекст 10 млн токенов и помещается на одну видеокарту H100. Нативно понимает текст и изображения. По заявлению Meta — лучшая мультимодальная модель в своём классе, обходит Gemma 3 и Gemini 2.0 Flash-Lite.

Бесплатно (открытые веса) / API у провайдеров от ~$0.18 за 1MРаботает в РФ
8.1/10📅 2025-04🏢 MetaProprietary

Рейтинг и бенчмарки

Общий рейтинг
8.1/10
Benchmark Score
8/10
Скорость
8.5/10
Контекст
10M токенов — один из самых больших в индустрии
Архитектура
MoE 109B总 / 17B активных, 16 экспертов, early fusion
Железо
помещается на одну NVIDIA H100
Обучение
~40 трлн токенов мультимодальных данных

Входные и выходные данные

Входные данные
текстизображение
Выходные данные
текст

API и стоимость

Входные токены (Input)
Бесплатно (открытые веса) / API у провайдеров от ~$0.18 за 1M
цена за промпт
Выходные токены (Output)
~$0.59 / 1M токенов (зависит от провайдера)
цена за ответ
API доступен

Способы доступа

Self-hosted (Hugging FaceOllama)API (Together AIDeepInfraAWSOpenRouter)

Сценарии использования

работа с очень длинными документами и кодовыми базамиRAGмультимодальный анализ (текст + изображения)чат-ботыдообучение под свои задачи

Тарифы и подписки — Meta

Актуальные планы подписки провайдера. Цены могут меняться — уточняйте на странице цен

Открытые веса (self-host)
Бесплатно
  • Веса на Hugging Face (Llama 4 Community License)
  • Помещается на одну NVIDIA H100
  • Дообучение под свои задачи
  • Запуск через vLLM / Ollama
Популярный
API у провайдеров
от ~$0.18 / $0.59 за 1M
  • Together AI, DeepInfra, AWS Bedrock, OpenRouter
  • Без собственного железа
  • OpenAI-совместимый API
  • Оплата за токены
Российские карты не принимаются.Genova-ai — работает в РФ без VPN

Плюсы и минусы

✓ Плюсы
Рекордный контекст 10 млн токенов — целые кодовые базы, книги и архивы документов помещаются в один запрос
Нативная мультимодальность через early fusion: текст и изображения обрабатываются одной моделью, а не через приделанный энкодер
MoE-эффективность: при 109B总 активны лишь 17B параметров на 16 экспертах — качество крупной модели при цене средней
Помещается на одну NVIDIA H100 — редкость для модели такого класса, реальный self-host без кластера
По заявлению Meta — лучшая мультимодальная модель в своём классе, обходит Gemma 3, Gemini 2.0 Flash-Lite и Mistral 3.1
Открытые веса: можно запускать локально, дообучать и использовать через дешёвых провайдеров (от ~$0.18 за 1M токенов)
✗ Минусы
Лицензия Llama 4 Community — не Apache/MIT: есть условия (в частности, ограничения для очень крупных сервисов), стоит прочитать под свой кейс
Русского нет в списке официально поддерживаемых языков (заявлены английский, арабский, французский, немецкий, хинди, индонезийский, итальянский, португальский, испанский, тагальский, тайский, вьетнамский)
Заявленные 10M контекста на практике требуют огромной памяти — полностью использовать их дома не выйдет
Для локального запуска нужна серверная видеокарта уровня H100, потребительские GPU не потянут
Это модель апреля 2025 — с тех пор вышли более свежие открытые конкуренты (Qwen 3, GLM-4.7, Gemma 4)
Только текст на выходе: изображения модель понимает, но не генерирует

Подробный обзор

Что такое Llama 4 Scout

Llama 4 Scout — младшая модель поколения Llama 4 от Meta, представленная в апреле 2025 года. «Младшая» здесь условно: это Mixture-of-Experts на 109 млрд параметров, из которых на каждый токен активны лишь 17 млрд, распределённые по 16 экспертам. Модель нативно мультимодальна — понимает и текст, и изображения, причём не через приделанный сбоку энкодер, а через early fusion, когда модальности объединяются на раннем этапе.

Главная фишка — контекст 10 миллионов токенов

Scout получил лучший в индустрии контекст — 10 млн токенов. Это на порядок больше, чем у большинства конкурентов (у которых обычно 128K–1M), и открывает сценарии, недоступные другим: анализ целых кодовых баз, работа с архивами документов, суммаризация книг целиком, огромные RAG-пайплайны без нарезки на куски. Оговорка: реально задействовать все 10 млн требует колоссальной памяти — на практике столько используют редко, но сам запас делает модель удобной для длинных контекстов.

Железо и качество

Несмотря на 109B总 параметров, благодаря MoE-архитектуре Scout помещается на одну видеокарту NVIDIA H100 — для модели такого класса это редкость и главный практический аргумент. Обучена примерно на 40 триллионах токенов мультимодальных данных. По заявлению Meta, это лучшая мультимодальная модель в своём классе: она обходит Gemma 3, Gemini 2.0 Flash-Lite и Mistral 3.1 на широком наборе распространённых бенчмарков.

Лицензия и доступность в России

Веса открыты, но лицензия — Llama 4 Community License, а не Apache или MIT: она разрешает коммерческое использование, но содержит собственные условия (включая ограничения для очень крупных сервисов), поэтому под конкретный проект её стоит прочитать. В России модель работает без ограничений: веса качаются с Hugging Face и запускаются локально без аккаунтов и карт, а без своего железа доступ дают сторонние провайдеры (Together AI, DeepInfra, OpenRouter). Нюанс для русскоязычных задач: русский не входит в список официально поддерживаемых языков — модель его понимает, но качество ниже, чем на английском.

Часто задаваемые вопросы

Что такое Llama 4 Scout?
Открытая мультимодальная модель Meta из поколения Llama 4 (апрель 2025). Архитектура MoE: 109 млрд параметров总 при 17 млрд активных на 16 экспертах. Понимает текст и изображения, имеет рекордный контекст 10 млн токенов и помещается на одну видеокарту H100.
Зачем нужен контекст в 10 миллионов токенов?
Это один из самых больших контекстов в индустрии — на порядок больше типичных 128K–1M. Он позволяет загрузить целую кодовую базу, архив документов или несколько книг в один запрос без нарезки на фрагменты, что особенно полезно для RAG и анализа больших массивов. На практике задействовать все 10 млн мешает объём требуемой памяти, но запас очень удобен.
Какое железо нужно для Llama 4 Scout?
Главное преимущество модели — она помещается на одну NVIDIA H100 благодаря MoE-архитектуре (активны лишь 17B из 109B параметров). Это серверная видеокарта: на потребительских GPU модель не запустить. Если своего железа нет, проще использовать её через провайдеров вроде Together AI, DeepInfra или OpenRouter.
Llama 4 Scout бесплатна и можно ли использовать коммерчески?
Веса открыты и скачиваются бесплатно, коммерческое использование разрешено, но лицензия — Llama 4 Community License, а не Apache/MIT: у неё свои условия, включая ограничения для очень крупных сервисов. Под конкретный проект её стоит прочитать. Через API провайдеров — оплата за токены, ориентировочно от $0.18 за 1M входных.
Работает ли Llama 4 Scout в России?
Да, без ограничений — это открытые веса: качаете с Hugging Face и запускаете локально без аккаунтов и карт. Без своего железа подойдут сторонние провайдеры (Together AI, DeepInfra, OpenRouter). Важный нюанс: русский не входит в список официально поддерживаемых языков, поэтому на русском качество будет ниже, чем на английском.
Llama 4 Scout актуальна в 2026 году?
Это по-прежнему сильная модель, особенно из-за огромного контекста и того, что она влезает на одну H100. Но она вышла в апреле 2025, и с тех пор появились более свежие открытые конкуренты — Qwen 3, GLM-4.7, Gemma 4. Если нужен максимум качества, стоит сравнить их; если нужен именно рекордный контекст на одной GPU — Scout остаётся уместным выбором.

Все эти инструменты — уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно