Claude
ClaudeРабота с документамиСреднийОбновлено 29 июля 2026 г.

Промпт для разбора большого документа: как не потерять середину (и получить выводы, а не пересказ)

Пример результата, сгенерированный по этому промпту через Claude · кликни для увеличения

Контекст 1 млн токенов не значит, что модель прочитала всё

К 2026 году контекстное окно перестало быть проблемой на бумаге: миллион токенов есть у Claude, GPT-5.6, Gemini и Qwen. Загрузить в модель отчёт на 300 страниц технически можно.

Проблема в том, что «поместилось» и «прочитано одинаково внимательно» — разные вещи.

Исследование «Lost in the Middle» показало эффект, который с тех пор воспроизводили десятки раз: точность ответов зависит от того, где именно в документе лежит нужная информация. Кривая имеет форму буквы U — модель лучше всего работает с началом и концом, а в середине точность падает более чем на 30%.

Эффект воспроизвели на шести семействах моделей: GPT-3.5-Turbo, GPT-4, Claude, LongChat-13B, MPT-30B и Cohere Command. То есть это не баг конкретного вендора, а свойство архитектуры.

И это не осталось в прошлом. Крупная проверка 2025 года на 18 продакшн-моделях (включая Claude 4 Sonnet, GPT-4.1 и Gemini 2.5 Pro) на многошаговых задачах показала: у всех восемнадцати качество монотонно падало по мере роста длины входа. Не у части — у всех.

Практический вывод простой: если вы бросили модели 200-страничный документ и спросили «сделай саммари», середина этого документа с высокой вероятностью прочитана хуже краёв. А именно там обычно лежат условия, оговорки и неудобные детали.

Второй враг: lead bias

Есть и вторая, менее очевидная проблема — lead bias: модель непропорционально опирается на начало текста. Отчасти это наследие обучения на новостях, где главное традиционно ставят в первый абзац.

В результате типичное «саммари» выглядит так: подробно пересказано вступление, дальше всё более общими словами, а к концу — пара дежурных фраз. Формально сводка есть. Практически — вы прочитали только введение чужими словами.

Chain of Density: как заставить сводку уплотняться

Против lead bias работает техника Chain of Density (из работы «From Sparse to Dense», arXiv 2309.04269). Идея контринтуитивная, но рабочая.

Вместо одной сводки модель пишет несколько подряд. Первая — обычная, разреженная. Затем на каждой итерации она обязана добавить 1-3 важные сущности, которых в сводке ещё нет, но не увеличивая длину. Единственный способ выполнить оба условия — выкинуть воду и общие формулировки, освободив место под факты.

Что показали замеры: сводки становятся плотнее по фактам, более абстрактными в формулировках и — главное — с каждой итерацией уменьшается перекос в сторону начала текста. Люди в оценках предпочитали такие сводки обычным, сгенерированным одним запросом.

Как устроен промпт

Промпт собран так, чтобы бить в обе проблемы сразу.

Проход 1 — карта документа. Сначала модель составляет фактическое оглавление с указанием, где что находится. Дальше она работает по этой карте, а не по общему впечатлению от текста.

Проход 2 — извлечение по секциям, снизу вверх. Ключевой приём. Модель идёт от последнего раздела к первому и разбирает каждый отдельно. Это прямая контрмера против обеих проблем: разбор по секциям не даёт середине «раствориться», а обратный порядок ломает lead bias — начало документа модель обрабатывает последним, когда все остальные разделы уже выписаны.

Проход 3 — уплотнение. Три итерации Chain of Density: каждая добавляет детали, не увеличивая объём.

Проход 4 — критика. Здесь модель переключается из режима «пересказать» в режим «проверить»: противоречия, пробелы, утверждения без источников, манипуляции с цифрами. Отдельно — топ-5 того, что стоит перепроверить вручную.

Почему в промпте так много запретов

Три ограничения в конце важнее, чем кажутся.

«Не додумывай» — потому что модель охотно подставит типичное значение вместо отсутствующего. В анализе документа это опаснее ошибки: выдуманное число выглядит ровно так же, как настоящее.

«Указывай раздел для каждого вывода» — превращает утверждения в проверяемые. Вы можете открыть документ и сверить, а не верить на слово.

«При противоречии показывай оба места» — модель по умолчанию склонна сглаживать конфликт и выдавать связную версию. Но если документ противоречит сам себе, вам нужен именно этот факт, а не гладкий пересказ.

Где это применимо

Промпт написан под любой длинный текст, где цена пропущенной детали высока: отчёты и исследования, техническая документация, тендерные требования, финансовые и аналитические материалы, длинные протоколы и стенограммы.

Работает в любой модели с большим контекстом — Claude, ChatGPT, Gemini, Qwen. Чем длиннее документ, тем заметнее разница с обычным «сделай саммари»: на 10 страницах она невелика, на 100+ становится принципиальной.

📋 Промпт
Ты — аналитик, который читает документ ради решения, а не ради пересказа. Я дам текст документа. Работай строго в четыре прохода, по очереди, и не переходи к следующему, пока не закончил текущий.

**Проход 1 — карта документа.**
Пройди документ от начала до конца и составь оглавление фактическое (не то, что заявлено в содержании, а то, что реально есть):
| № | Раздел / блок | О чём | Примерное место (начало / первая треть / середина / вторая треть / конец) |

Это нужно, чтобы ты дальше работал по секциям, а не по общему впечатлению.

**Проход 2 — извлечение по секциям, СНИЗУ ВВЕРХ.**
Иди по таблице из прохода 1 в обратном порядке: сначала последний раздел, потом предпоследний, и так до первого. Для каждого раздела отдельно выпиши:
— Ключевые утверждения (по пунктам)
— Все числа, даты, суммы, проценты — дословно, с указанием раздела
— Условия, оговорки, исключения («если», «кроме», «не распространяется», «при условии»)

Не обобщай на этом шаге и не пропускай разделы, даже если они кажутся служебными.

**Проход 3 — уплотнение (3 итерации).**
Сделай сводку на 5-7 предложений. Затем повтори её ещё 2 раза, каждый раз добавляя 1-3 важные детали из проходов 1-2, которых в сводке ещё нет, НЕ увеличивая длину — за счёт удаления воды и общих слов. Покажи все 3 версии по порядку.

**Проход 4 — критика.**
Теперь работай против документа, а не заодно с ним:
— Противоречия: где документ спорит сам с собой (укажи оба места)
— Пробелы: что для темы обязательно, но отсутствует
— Неподтверждённое: утверждения без источника, цифры без методики, «эксперты считают» без имён
— Манипуляции: подмена базы сравнения, проценты без абсолютных чисел, выборочные периоды
— Что проверить вручную в первую очередь (топ-5, по убыванию риска)

**Ограничения:**
— Ничего не додумывай. Если чего-то в документе нет — пиши «в документе не указано», а не подставляй типичное значение
— Каждый существенный вывод сопровождай указанием раздела из прохода 1
— Если два места противоречат друг другу, не выбирай «более правильное» — покажи оба
— Не оценивай документ как «хороший» или «плохой» — только факты, пробелы и риски

**На выход:** карта документа, выжимка по секциям, 3 версии сводки, список противоречий и пробелов, топ-5 что проверить.

Разбор промпта по параметрам

ПараметрЧто делает
Проход 2 идёт снизу вверхПрямая контрмера против lead bias: модель разбирает начало документа последним, когда остальные разделы уже выписаны. Иначе вступление вытесняет всё остальное.
Разбор по секциям, а не целикомЭффект lost in the middle: точность падает более чем на 30%, когда нужная информация лежит в середине контекста. Когда модель работает с разделом отдельно, у него нет «середины» длиной в сотни страниц.
Карта документа первым проходомДаёт модели опору для последующих шагов и позволяет вам проверять выводы: каждый вывод потом привязан к конкретному разделу.
3 итерации уплотнения без роста длиныChain of Density (arXiv 2309.04269): модель обязана добавить 1-3 новых факта, не увеличив объём, поэтому вынуждена выкидывать воду. По замерам это снижает перекос в сторону начала текста.
Проход 4 работает «против» документаБез явной команды модель склонна соглашаться с источником и пересказывать его логику. Отдельный проход на противоречия и пробелы переключает её в режим проверки.
«В документе не указано» вместо догадкиМодель охотно подставляет типичное значение вместо отсутствующего. В анализе документа выдуманное число неотличимо от настоящего — это опаснее явной ошибки.

Готовые вариации

Для договоров и коммерческих условий
Акцент на цифрах, сроках, обязанностях сторон и том, что осталось несказанным. Без юридических оценок — только факты и что уточнить.
Ты — аналитик, который разбирает документ ради понимания условий, а не ради пересказа. Я дам текст. Работай в четыре прохода.

Проход 1 — карта: составь фактическое оглавление с указанием, где какой блок (начало / первая треть / середина / вторая треть / конец).

Проход 2 — идя от ПОСЛЕДНЕГО раздела к первому, выпиши по каждому: обязанности каждой стороны, все суммы и проценты дословно, сроки и даты, условия расторжения, штрафы и санкции, все оговорки со словами «если», «кроме», «не распространяется», «при условии».

Проход 3 — сводка на 5-7 предложений, затем 2 итерации уплотнения (добавляй 1-3 недостающих детали, не увеличивая длину).

Проход 4 — критика: что в документе НЕ описано, хотя обычно описывается (перечисли пробелы); где формулировки допускают несколько толкований (приведи оба); где обязанности сторон несимметричны; какие пункты противоречат друг другу.

Ограничения: ничего не додумывай, пиши «в документе не указано»; каждый вывод — с указанием раздела; не давай юридических оценок и не советуй, подписывать или нет — только факты и список из 5 пунктов, которые стоит уточнить у второй стороны или у юриста.
Для научной статьи или исследования
Проверка методологии: на чём основаны выводы, какая выборка, что авторы не проверяли.
Ты — рецензент, который читает исследование критически. Я дам текст статьи. Работай в четыре прохода.

Проход 1 — карта разделов с указанием их расположения в тексте.

Проход 2 — от последнего раздела к первому выпиши: заявленные выводы, метод и выборку (размер, состав, как набирали), все числа и доверительные интервалы дословно, ограничения, которые авторы признают сами.

Проход 3 — сводка на 5-7 предложений + 2 итерации уплотнения без роста длины.

Проход 4 — критика: где вывод шире, чем позволяют данные; корреляция подана как причинность; размер выборки не соответствует силе утверждения; отсутствует контрольная группа или сравнение; данные о конфликте интересов и финансировании (или их отсутствие); какие 5 вещей нужно проверить, прежде чем ссылаться на эту работу.

Ограничения: ничего не додумывай; каждый вывод — со ссылкой на раздел; не оценивай работу как «хорошую» или «плохую», только соответствие выводов данным.
Быстрый вариант для одного вопроса
Когда документ большой, но нужен ответ на конкретный вопрос — с защитой от потери середины.
Я дам большой документ и вопрос. Не отвечай сразу.

Шаг 1: составь список разделов документа с указанием их расположения (начало / середина / конец).

Шаг 2: пройди по КАЖДОМУ разделу отдельно, начиная с последнего, и выпиши всё, что относится к моему вопросу, — даже косвенно. Указывай раздел рядом с каждой выдержкой. Если в разделе ничего нет — так и напиши.

Шаг 3: только теперь дай ответ, опираясь на собранные выдержки. Отдельно перечисли: что в документе сказано прямо, что следует косвенно, а чего нет вообще.

Если документ отвечает на вопрос в нескольких местах по-разному — покажи все версии и не выбирай за меня.

Мой вопрос: [впишите вопрос]

Частые вопросы

Зачем такой сложный промпт, если можно просто попросить саммари?

Потому что обычное саммари страдает от двух известных эффектов. Первый — lost in the middle: точность падает более чем на 30%, если нужная информация лежит в середине контекста, и это воспроизводится на шести семействах моделей. Второй — lead bias: модель непропорционально опирается на начало текста. В сумме вы получаете подробный пересказ вступления и общие слова про остальное. На 10 страницах это некритично, на 100+ — принципиально.

Почему проход 2 идёт от конца к началу?

Это прямая контрмера против lead bias. Если модель начинает с первого раздела, вступление задаёт рамку и вытесняет остальное. Когда она идёт в обратном порядке, начало документа обрабатывается последним, когда все прочие разделы уже выписаны и не могут быть «затёрты» первым впечатлением.

Что такое Chain of Density и зачем три версии сводки?

Это техника из работы «From Sparse to Dense» (arXiv 2309.04269). Модель пишет сводку несколько раз подряд, каждый раз добавляя 1-3 недостающих факта, но не увеличивая длину. Единственный способ выполнить оба условия — выбрасывать воду. По замерам такие сводки плотнее по фактам, и с каждой итерацией уменьшается перекос в сторону начала текста.

В какой модели это работает лучше всего?

В любой с большим контекстом: Claude, ChatGPT, Gemini, Qwen. Промпт не использует особенностей конкретного вендора — он борется с эффектом, общим для архитектуры трансформеров. Проверка 2025 года на 18 продакшн-моделях показала, что качество падает с ростом длины входа у всех без исключения, так что приём универсален.

Можно ли использовать это для договоров?

Да, для этого есть отдельный вариант промпта — он вытаскивает суммы, сроки, обязанности сторон, оговорки и показывает, чего в документе нет. Важная оговорка: промпт намеренно не даёт юридических оценок и не советует, подписывать документ или нет. Он готовит список того, что стоит уточнить у второй стороны или у юриста, — решение остаётся за человеком.

Модель всё равно может что-то выдумать?

Может, поэтому в промпте три защиты. Первая — прямой запрет додумывать с указанием писать «в документе не указано». Вторая — требование привязывать каждый вывод к разделу, чтобы вы могли открыть документ и сверить. Третья — при противоречии показывать оба места, а не выбирать «правильное». Полностью риск это не снимает: топ-5 пунктов из последнего прохода стоит проверять вручную.

Все эти инструменты — уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно