Phi-4 Reasoning
Маленькая reasoning-модель Microsoft (30 апреля 2025) на 14B параметров, которая обходит модели в 5 раз крупнее: AIME 2024 - 75.3%, а версия plus - 81.3%, против 69.3% у DeepSeek-R1-Distill-70B. Лицензия MIT, контекст 32K. Запускается на одной видеокарте - фактически "домашний" аналог больших reasoning-моделей.
Рейтинг и бенчмарки
Входные и выходные данные
API и стоимость
Способы доступа
Сценарии использования
Тарифы и подписки - Microsoft
Актуальные планы подписки провайдера. Цены могут меняться - уточняйте на странице цен
- Веса на Hugging Face под MIT
- Коммерческое использование, дообучение и дистилляция
- Запуск через Ollama / llama.cpp / vLLM
- Помещается на одну видеокарту
- Managed-доступ без своего железа
- Интеграция с экосистемой Azure
- Масштабирование и SLA
Плюсы и минусы
Подробный обзор
Что такое Phi-4 Reasoning
Phi-4 Reasoning - небольшая reasoning-модель Microsoft, выпущенная 30 апреля 2025 года. Это плотная (dense) decoder-only модель всего на 14 миллиардов параметров, дообученная на 1.4 миллиона отборных STEM-задач - многие из них были улучшены с помощью o3-mini от OpenAI. Контекстное окно расширено с 16K до 32K токенов.
Маленькая, но бьет крупных
Главная ценность модели - соотношение размера и результата. На AIME 2024 (олимпиадная математика) Phi-4-reasoning набирает 75.3%, обгоняя DeepSeek-R1-Distill-70B с ее 69.3% - при том, что та в пять раз крупнее. Усиленная версия Phi-4-reasoning-plus поднимает планку до 81.3% на AIME 2024 и 77.7% на AIME 2025.
И это не только математика: GPQA 63.4% (научные вопросы), LiveCodeBench 68.8% (программирование), OmniMath 53.8% - уровень, сопоставимый с моделями 70B и выше. Технически за этим стоят структурированные рассуждения через специальные теги <think> и обучение с подкреплением по алгоритму GRPO.
Почему это важно на практике
Большие reasoning-модели (DeepSeek R1, o-серия) требуют кластеров или облака. Phi-4 Reasoning с ее 14B помещается на одну видеокарту - то есть полноценные пошаговые рассуждения можно гонять локально, бесплатно и приватно. Лицензия MIT при этом самая свободная из возможных: коммерческое использование, дообучение и дистилляция без ограничений. Модель поддерживается всем популярным стеком - Hugging Face Transformers, vLLM, llama.cpp, Ollama.
Ограничения и доступность в России
Честные оговорки: контекст всего 32K токенов - мало по современным меркам, и модель узко заточена под STEM, так что вне математики, науки и кода универсальные модели будут сильнее. Плюс это апрель 2025 - с тех пор вышли более свежие открытые reasoning-модели. В России модель работает без ограничений: открытые веса качаются с Hugging Face и запускаются локально без аккаунтов, карт и VPN. Русский она понимает, но обучалась и рассуждает точнее на английском.