Llama 4 Scout
Открытая мультимодальная MoE-модель Meta (апрель 2025): 109B总 параметров при 17B активных на 16 экспертах, рекордный контекст 10 млн токенов и помещается на одну видеокарту H100. Нативно понимает текст и изображения. По заявлению Meta - лучшая мультимодальная модель в своем классе, обходит Gemma 3 и Gemini 2.0 Flash-Lite.
Рейтинг и бенчмарки
Входные и выходные данные
API и стоимость
Способы доступа
Сценарии использования
Тарифы и подписки - Meta
Актуальные планы подписки провайдера. Цены могут меняться - уточняйте на странице цен
- Веса на Hugging Face (Llama 4 Community License)
- Помещается на одну NVIDIA H100
- Дообучение под свои задачи
- Запуск через vLLM / Ollama
- Together AI, DeepInfra, AWS Bedrock, OpenRouter
- Без собственного железа
- OpenAI-совместимый API
- Оплата за токены
Плюсы и минусы
Подробный обзор
Что такое Llama 4 Scout
Llama 4 Scout - младшая модель поколения Llama 4 от Meta, представленная в апреле 2025 года. "Младшая" здесь условно: это Mixture-of-Experts на 109 млрд параметров, из которых на каждый токен активны лишь 17 млрд, распределенные по 16 экспертам. Модель нативно мультимодальна - понимает и текст, и изображения, причем не через приделанный сбоку энкодер, а через early fusion, когда модальности объединяются на раннем этапе.
Главная фишка - контекст 10 миллионов токенов
Scout получил лучший в индустрии контекст - 10 млн токенов. Это на порядок больше, чем у большинства конкурентов (у которых обычно 128K - 1M), и открывает сценарии, недоступные другим: анализ целых кодовых баз, работа с архивами документов, суммаризация книг целиком, огромные RAG-пайплайны без нарезки на куски. Оговорка: реально задействовать все 10 млн требует колоссальной памяти - на практике столько используют редко, но сам запас делает модель удобной для длинных контекстов.
Железо и качество
Несмотря на 109B总 параметров, благодаря MoE-архитектуре Scout помещается на одну видеокарту NVIDIA H100 - для модели такого класса это редкость и главный практический аргумент. Обучена примерно на 40 триллионах токенов мультимодальных данных. По заявлению Meta, это лучшая мультимодальная модель в своем классе: она обходит Gemma 3, Gemini 2.0 Flash-Lite и Mistral 3.1 на широком наборе распространенных бенчмарков.
Лицензия и доступность в России
Веса открыты, но лицензия - Llama 4 Community License, а не Apache или MIT: она разрешает коммерческое использование, но содержит собственные условия (включая ограничения для очень крупных сервисов), поэтому под конкретный проект ее стоит прочитать. В России модель работает без ограничений: веса качаются с Hugging Face и запускаются локально без аккаунтов и карт, а без своего железа доступ дают сторонние провайдеры (Together AI, DeepInfra, OpenRouter). Нюанс для русскоязычных задач: русский не входит в список официально поддерживаемых языков - модель его понимает, но качество ниже, чем на английском.