Llama 4 Scout
Открытая мультимодальная MoE-модель Meta (апрель 2025): 109B总 параметров при 17B активных на 16 экспертах, рекордный контекст 10 млн токенов и помещается на одну видеокарту H100. Нативно понимает текст и изображения. По заявлению Meta — лучшая мультимодальная модель в своём классе, обходит Gemma 3 и Gemini 2.0 Flash-Lite.
Рейтинг и бенчмарки
Входные и выходные данные
API и стоимость
Способы доступа
Сценарии использования
Тарифы и подписки — Meta
Актуальные планы подписки провайдера. Цены могут меняться — уточняйте на странице цен
- Веса на Hugging Face (Llama 4 Community License)
- Помещается на одну NVIDIA H100
- Дообучение под свои задачи
- Запуск через vLLM / Ollama
- Together AI, DeepInfra, AWS Bedrock, OpenRouter
- Без собственного железа
- OpenAI-совместимый API
- Оплата за токены
Плюсы и минусы
Подробный обзор
Что такое Llama 4 Scout
Llama 4 Scout — младшая модель поколения Llama 4 от Meta, представленная в апреле 2025 года. «Младшая» здесь условно: это Mixture-of-Experts на 109 млрд параметров, из которых на каждый токен активны лишь 17 млрд, распределённые по 16 экспертам. Модель нативно мультимодальна — понимает и текст, и изображения, причём не через приделанный сбоку энкодер, а через early fusion, когда модальности объединяются на раннем этапе.
Главная фишка — контекст 10 миллионов токенов
Scout получил лучший в индустрии контекст — 10 млн токенов. Это на порядок больше, чем у большинства конкурентов (у которых обычно 128K–1M), и открывает сценарии, недоступные другим: анализ целых кодовых баз, работа с архивами документов, суммаризация книг целиком, огромные RAG-пайплайны без нарезки на куски. Оговорка: реально задействовать все 10 млн требует колоссальной памяти — на практике столько используют редко, но сам запас делает модель удобной для длинных контекстов.
Железо и качество
Несмотря на 109B总 параметров, благодаря MoE-архитектуре Scout помещается на одну видеокарту NVIDIA H100 — для модели такого класса это редкость и главный практический аргумент. Обучена примерно на 40 триллионах токенов мультимодальных данных. По заявлению Meta, это лучшая мультимодальная модель в своём классе: она обходит Gemma 3, Gemini 2.0 Flash-Lite и Mistral 3.1 на широком наборе распространённых бенчмарков.
Лицензия и доступность в России
Веса открыты, но лицензия — Llama 4 Community License, а не Apache или MIT: она разрешает коммерческое использование, но содержит собственные условия (включая ограничения для очень крупных сервисов), поэтому под конкретный проект её стоит прочитать. В России модель работает без ограничений: веса качаются с Hugging Face и запускаются локально без аккаунтов и карт, а без своего железа доступ дают сторонние провайдеры (Together AI, DeepInfra, OpenRouter). Нюанс для русскоязычных задач: русский не входит в список официально поддерживаемых языков — модель его понимает, но качество ниже, чем на английском.