Контекст 1 млн токенов не значит, что модель прочитала всё
К 2026 году контекстное окно перестало быть проблемой на бумаге: миллион токенов есть у Claude, GPT-5.6, Gemini и Qwen. Загрузить в модель отчёт на 300 страниц технически можно.
Проблема в том, что «поместилось» и «прочитано одинаково внимательно» — разные вещи.
Исследование «Lost in the Middle» показало эффект, который с тех пор воспроизводили десятки раз: точность ответов зависит от того, где именно в документе лежит нужная информация. Кривая имеет форму буквы U — модель лучше всего работает с началом и концом, а в середине точность падает более чем на 30%.
Эффект воспроизвели на шести семействах моделей: GPT-3.5-Turbo, GPT-4, Claude, LongChat-13B, MPT-30B и Cohere Command. То есть это не баг конкретного вендора, а свойство архитектуры.
И это не осталось в прошлом. Крупная проверка 2025 года на 18 продакшн-моделях (включая Claude 4 Sonnet, GPT-4.1 и Gemini 2.5 Pro) на многошаговых задачах показала: у всех восемнадцати качество монотонно падало по мере роста длины входа. Не у части — у всех.
Практический вывод простой: если вы бросили модели 200-страничный документ и спросили «сделай саммари», середина этого документа с высокой вероятностью прочитана хуже краёв. А именно там обычно лежат условия, оговорки и неудобные детали.
Второй враг: lead bias
Есть и вторая, менее очевидная проблема — lead bias: модель непропорционально опирается на начало текста. Отчасти это наследие обучения на новостях, где главное традиционно ставят в первый абзац.
В результате типичное «саммари» выглядит так: подробно пересказано вступление, дальше всё более общими словами, а к концу — пара дежурных фраз. Формально сводка есть. Практически — вы прочитали только введение чужими словами.
Chain of Density: как заставить сводку уплотняться
Против lead bias работает техника Chain of Density (из работы «From Sparse to Dense», arXiv 2309.04269). Идея контринтуитивная, но рабочая.
Вместо одной сводки модель пишет несколько подряд. Первая — обычная, разреженная. Затем на каждой итерации она обязана добавить 1-3 важные сущности, которых в сводке ещё нет, но не увеличивая длину. Единственный способ выполнить оба условия — выкинуть воду и общие формулировки, освободив место под факты.
Что показали замеры: сводки становятся плотнее по фактам, более абстрактными в формулировках и — главное — с каждой итерацией уменьшается перекос в сторону начала текста. Люди в оценках предпочитали такие сводки обычным, сгенерированным одним запросом.
Как устроен промпт
Промпт собран так, чтобы бить в обе проблемы сразу.
Проход 1 — карта документа. Сначала модель составляет фактическое оглавление с указанием, где что находится. Дальше она работает по этой карте, а не по общему впечатлению от текста.
Проход 2 — извлечение по секциям, снизу вверх. Ключевой приём. Модель идёт от последнего раздела к первому и разбирает каждый отдельно. Это прямая контрмера против обеих проблем: разбор по секциям не даёт середине «раствориться», а обратный порядок ломает lead bias — начало документа модель обрабатывает последним, когда все остальные разделы уже выписаны.
Проход 3 — уплотнение. Три итерации Chain of Density: каждая добавляет детали, не увеличивая объём.
Проход 4 — критика. Здесь модель переключается из режима «пересказать» в режим «проверить»: противоречия, пробелы, утверждения без источников, манипуляции с цифрами. Отдельно — топ-5 того, что стоит перепроверить вручную.
Почему в промпте так много запретов
Три ограничения в конце важнее, чем кажутся.
«Не додумывай» — потому что модель охотно подставит типичное значение вместо отсутствующего. В анализе документа это опаснее ошибки: выдуманное число выглядит ровно так же, как настоящее.
«Указывай раздел для каждого вывода» — превращает утверждения в проверяемые. Вы можете открыть документ и сверить, а не верить на слово.
«При противоречии показывай оба места» — модель по умолчанию склонна сглаживать конфликт и выдавать связную версию. Но если документ противоречит сам себе, вам нужен именно этот факт, а не гладкий пересказ.
Где это применимо
Промпт написан под любой длинный текст, где цена пропущенной детали высока: отчёты и исследования, техническая документация, тендерные требования, финансовые и аналитические материалы, длинные протоколы и стенограммы.
Работает в любой модели с большим контекстом — Claude, ChatGPT, Gemini, Qwen. Чем длиннее документ, тем заметнее разница с обычным «сделай саммари»: на 10 страницах она невелика, на 100+ становится принципиальной.

