Llama 4 Scout

Llama 4 Scout

Открытая мультимодальная MoE-модель Meta (апрель 2025): 109B总 параметров при 17B активных на 16 экспертах, рекордный контекст 10 млн токенов и помещается на одну видеокарту H100. Нативно понимает текст и изображения. По заявлению Meta - лучшая мультимодальная модель в своем классе, обходит Gemma 3 и Gemini 2.0 Flash-Lite.

Бесплатно (открытые веса) / API у провайдеров от ~$0.18 за 1MРаботает в РФ
⭐ 8.1/10📅 2025-04🏢 MetaProprietary

Рейтинг и бенчмарки

Общий рейтинг
8.1/10
Benchmark Score
8/10
Скорость
8.5/10
Контекст
10M токенов - один из самых больших в индустрии
Архитектура
MoE 109B总 / 17B активных, 16 экспертов, early fusion
Железо
помещается на одну NVIDIA H100
Обучение
~40 трлн токенов мультимодальных данных

Входные и выходные данные

Входные данные
текстизображение
Выходные данные
текст

API и стоимость

Входные токены (Input)
Бесплатно (открытые веса) / API у провайдеров от ~$0.18 за 1M
цена за промпт
Выходные токены (Output)
~$0.59 / 1M токенов (зависит от провайдера)
цена за ответ
✓API доступен

Способы доступа

Self-hosted (Hugging FaceOllama)API (Together AIDeepInfraAWSOpenRouter)

Сценарии использования

работа с очень длинными документами и кодовыми базамиRAGмультимодальный анализ (текст + изображения)чат-ботыдообучение под свои задачи

Тарифы и подписки - Meta

Актуальные планы подписки провайдера. Цены могут меняться - уточняйте на странице цен

Открытые веса (self-host)
Бесплатно
  • Веса на Hugging Face (Llama 4 Community License)
  • Помещается на одну NVIDIA H100
  • Дообучение под свои задачи
  • Запуск через vLLM / Ollama
Популярный
API у провайдеров
от ~$0.18 / $0.59 за 1M
  • Together AI, DeepInfra, AWS Bedrock, OpenRouter
  • Без собственного железа
  • OpenAI-совместимый API
  • Оплата за токены
Российские карты не принимаются.Genova-ai - работает в РФ без VPN

Плюсы и минусы

✓ Плюсы
Рекордный контекст 10 млн токенов - целые кодовые базы, книги и архивы документов помещаются в один запрос
Нативная мультимодальность через early fusion: текст и изображения обрабатываются одной моделью, а не через приделанный энкодер
MoE-эффективность: при 109B总 активны лишь 17B параметров на 16 экспертах - качество крупной модели при цене средней
Помещается на одну NVIDIA H100 - редкость для модели такого класса, реальный self-host без кластера
По заявлению Meta - лучшая мультимодальная модель в своем классе, обходит Gemma 3, Gemini 2.0 Flash-Lite и Mistral 3.1
Открытые веса: можно запускать локально, дообучать и использовать через дешевых провайдеров (от ~$0.18 за 1M токенов)
✗ Минусы
Лицензия Llama 4 Community - не Apache/MIT: есть условия (в частности, ограничения для очень крупных сервисов), стоит прочитать под свой кейс
Русского нет в списке официально поддерживаемых языков (заявлены английский, арабский, французский, немецкий, хинди, индонезийский, итальянский, португальский, испанский, тагальский, тайский, вьетнамский)
Заявленные 10M контекста на практике требуют огромной памяти - полностью использовать их дома не выйдет
Для локального запуска нужна серверная видеокарта уровня H100, потребительские GPU не потянут
Это модель апреля 2025 - с тех пор вышли более свежие открытые конкуренты (Qwen 3, GLM-4.7, Gemma 4)
Только текст на выходе: изображения модель понимает, но не генерирует

Подробный обзор

Что такое Llama 4 Scout

Llama 4 Scout - младшая модель поколения Llama 4 от Meta, представленная в апреле 2025 года. "Младшая" здесь условно: это Mixture-of-Experts на 109 млрд параметров, из которых на каждый токен активны лишь 17 млрд, распределенные по 16 экспертам. Модель нативно мультимодальна - понимает и текст, и изображения, причем не через приделанный сбоку энкодер, а через early fusion, когда модальности объединяются на раннем этапе.

Главная фишка - контекст 10 миллионов токенов

Scout получил лучший в индустрии контекст - 10 млн токенов. Это на порядок больше, чем у большинства конкурентов (у которых обычно 128K - 1M), и открывает сценарии, недоступные другим: анализ целых кодовых баз, работа с архивами документов, суммаризация книг целиком, огромные RAG-пайплайны без нарезки на куски. Оговорка: реально задействовать все 10 млн требует колоссальной памяти - на практике столько используют редко, но сам запас делает модель удобной для длинных контекстов.

Железо и качество

Несмотря на 109B总 параметров, благодаря MoE-архитектуре Scout помещается на одну видеокарту NVIDIA H100 - для модели такого класса это редкость и главный практический аргумент. Обучена примерно на 40 триллионах токенов мультимодальных данных. По заявлению Meta, это лучшая мультимодальная модель в своем классе: она обходит Gemma 3, Gemini 2.0 Flash-Lite и Mistral 3.1 на широком наборе распространенных бенчмарков.

Лицензия и доступность в России

Веса открыты, но лицензия - Llama 4 Community License, а не Apache или MIT: она разрешает коммерческое использование, но содержит собственные условия (включая ограничения для очень крупных сервисов), поэтому под конкретный проект ее стоит прочитать. В России модель работает без ограничений: веса качаются с Hugging Face и запускаются локально без аккаунтов и карт, а без своего железа доступ дают сторонние провайдеры (Together AI, DeepInfra, OpenRouter). Нюанс для русскоязычных задач: русский не входит в список официально поддерживаемых языков - модель его понимает, но качество ниже, чем на английском.

Часто задаваемые вопросы

Что такое Llama 4 Scout?
Открытая мультимодальная модель Meta из поколения Llama 4 (апрель 2025). Архитектура MoE: 109 млрд параметров总 при 17 млрд активных на 16 экспертах. Понимает текст и изображения, имеет рекордный контекст 10 млн токенов и помещается на одну видеокарту H100.
Зачем нужен контекст в 10 миллионов токенов?
Это один из самых больших контекстов в индустрии - на порядок больше типичных 128K - 1M. Он позволяет загрузить целую кодовую базу, архив документов или несколько книг в один запрос без нарезки на фрагменты, что особенно полезно для RAG и анализа больших массивов. На практике задействовать все 10 млн мешает объем требуемой памяти, но запас очень удобен.
Какое железо нужно для Llama 4 Scout?
Главное преимущество модели - она помещается на одну NVIDIA H100 благодаря MoE-архитектуре (активны лишь 17B из 109B параметров). Это серверная видеокарта: на потребительских GPU модель не запустить. Если своего железа нет, проще использовать ее через провайдеров вроде Together AI, DeepInfra или OpenRouter.
Llama 4 Scout бесплатна и можно ли использовать коммерчески?
Веса открыты и скачиваются бесплатно, коммерческое использование разрешено, но лицензия - Llama 4 Community License, а не Apache/MIT: у нее свои условия, включая ограничения для очень крупных сервисов. Под конкретный проект ее стоит прочитать. Через API провайдеров - оплата за токены, ориентировочно от $0.18 за 1M входных.
Работает ли Llama 4 Scout в России?
Да, без ограничений - это открытые веса: качаете с Hugging Face и запускаете локально без аккаунтов и карт. Без своего железа подойдут сторонние провайдеры (Together AI, DeepInfra, OpenRouter). Важный нюанс: русский не входит в список официально поддерживаемых языков, поэтому на русском качество будет ниже, чем на английском.
Llama 4 Scout актуальна в 2026 году?
Это по-прежнему сильная модель, особенно из-за огромного контекста и того, что она влезает на одну H100. Но она вышла в апреле 2025, и с тех пор появились более свежие открытые конкуренты - Qwen 3, GLM-4.7, Gemma 4. Если нужен максимум качества, стоит сравнить их; если нужен именно рекордный контекст на одной GPU - Scout остается уместным выбором.

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно