Phi-4 Reasoning
Маленькая reasoning-модель Microsoft (30 апреля 2025) на 14B параметров, которая обходит модели в 5 раз крупнее: AIME 2024 — 75.3%, а версия plus — 81.3%, против 69.3% у DeepSeek-R1-Distill-70B. Лицензия MIT, контекст 32K. Запускается на одной видеокарте — фактически «домашний» аналог больших reasoning-моделей.
Рейтинг и бенчмарки
Входные и выходные данные
API и стоимость
Способы доступа
Сценарии использования
Тарифы и подписки — Microsoft
Актуальные планы подписки провайдера. Цены могут меняться — уточняйте на странице цен
- Веса на Hugging Face под MIT
- Коммерческое использование, дообучение и дистилляция
- Запуск через Ollama / llama.cpp / vLLM
- Помещается на одну видеокарту
- Managed-доступ без своего железа
- Интеграция с экосистемой Azure
- Масштабирование и SLA
Плюсы и минусы
Подробный обзор
Что такое Phi-4 Reasoning
Phi-4 Reasoning — небольшая reasoning-модель Microsoft, выпущенная 30 апреля 2025 года. Это плотная (dense) decoder-only модель всего на 14 миллиардов параметров, дообученная на 1.4 миллиона отборных STEM-задач — многие из них были улучшены с помощью o3-mini от OpenAI. Контекстное окно расширено с 16K до 32K токенов.
Маленькая, но бьёт крупных
Главная ценность модели — соотношение размера и результата. На AIME 2024 (олимпиадная математика) Phi-4-reasoning набирает 75.3%, обгоняя DeepSeek-R1-Distill-70B с её 69.3% — при том, что та в пять раз крупнее. Усиленная версия Phi-4-reasoning-plus поднимает планку до 81.3% на AIME 2024 и 77.7% на AIME 2025.
И это не только математика: GPQA 63.4% (научные вопросы), LiveCodeBench 68.8% (программирование), OmniMath 53.8% — уровень, сопоставимый с моделями 70B и выше. Технически за этим стоят структурированные рассуждения через специальные теги <think> и обучение с подкреплением по алгоритму GRPO.
Почему это важно на практике
Большие reasoning-модели (DeepSeek R1, o-серия) требуют кластеров или облака. Phi-4 Reasoning с её 14B помещается на одну видеокарту — то есть полноценные пошаговые рассуждения можно гонять локально, бесплатно и приватно. Лицензия MIT при этом самая свободная из возможных: коммерческое использование, дообучение и дистилляция без ограничений. Модель поддерживается всем популярным стеком — Hugging Face Transformers, vLLM, llama.cpp, Ollama.
Ограничения и доступность в России
Честные оговорки: контекст всего 32K токенов — мало по современным меркам, и модель узко заточена под STEM, так что вне математики, науки и кода универсальные модели будут сильнее. Плюс это апрель 2025 — с тех пор вышли более свежие открытые reasoning-модели. В России модель работает без ограничений: открытые веса качаются с Hugging Face и запускаются локально без аккаунтов, карт и VPN. Русский она понимает, но обучалась и рассуждает точнее на английском.