Read in:
Русский

Нужны ли агенту инструкции к базе знаний

Что сделали: взяли частную базу знаний обучающего курса, подключённую к агентам по MCP, и задали четырём моделям Claude одни и те же вопросы — с серверными инструкциями и без них. Слепой судья оценил ответы. Короткий итог: слабой модели инструкции нужны, без них она проваливается; сильные находят инструкции сами. Читать, если вы собираете базу знаний для агентов и думаете, стоит ли писать для неё инструкции.

У базы знаний в trip2g, подключённой по MCP, есть три способа сказать агенту, как с ней работать. Заметка с mcp_method: initialize приходит клиенту сразу при подключении, и клиент кладёт её в системный промпт. Заметка с mcp_method: instructions отдаётся по запросу через инструмент instructions(). А через параметр ?method= можно выбрать другую заметку инструкций — например, для отдельной роли. Хороших инструкций на реальной базе мы видели немало, а вот замеров, помогают ли они, не было. Мы решили проверить.

Как проверяли

База — частная, на русском: обучающий курс, в котором есть понятия, пошаговые цепочки, карты решений «ситуация → что делать» и заметка _instructions.md с маршрутами по типам задач. Серверные инструкции initialize занимают 865 символов: что это за база, с чего начинать, как искать и как отвечать, и что делать, если материала нет.

Вопросы писал отдельный агент, которому запретили читать инструкции, чтобы вопросы не подстроились под маршруты. Шестнадцать вопросов четырёх типов:

  • 6 прямых — ответ в одной заметке;
  • 4 ситуационных — «у меня X, что делать дальше»;
  • 3 про конкретную деталь в глубине заметки — число, порог, поле шаблона;
  • 3 вопроса, на которые в базе ответа нет, — правильный ответ «этого в курсе нет».

Каждая модель отвечала на каждый вопрос дважды: с серверными инструкциями и без. Инструменты в обоих случаях одинаковые, в том числе instructions(). Модели работали через Claude Code: он сам кладёт серверные инструкции в системный промпт, как обычный клиент. Для условия «без инструкций» локальный прокси вырезал их из ответа сервера при подключении. Haiku ответила на все 16 вопросов, Sonnet, Opus и Fable — на четыре, по одному каждого типа.

Ответы оценивал отдельный судья, не зная модели и условия, по четырём признакам: правильность (0–2), опирается ли ответ на найденное, указан ли источник, есть ли дословная цитата.

Результаты

Модель Инструкции Вопросов Нужная заметка открыта Правильность (из 2) Опора на найденное Источник указан Цитата Вызовов инструментов
Claude Haiku 4.5 нет 16 9 из 13 1,56 0,75 0,75 0,12 45
Claude Haiku 4.5 есть 16 12 из 13 1,81 1,00 0,81 0,81 44
Claude Sonnet 5 нет 4 3 из 3 2,00 1,00 1,00 0,50 16
Claude Sonnet 5 есть 4 3 из 3 2,00 1,00 0,75 0,75 19
Claude Opus 5.5 нет 4 3 из 3 2,00 1,00 1,00 0,75 20
Claude Opus 5.5 есть 4 3 из 3 2,00 1,00 1,00 0,75 15
Claude Fable 5.1 нет 4 3 из 3 2,00 1,00 1,00 1,00 22
Claude Fable 5.1 есть 4 3 из 3 2,00 1,00 1,00 1,00 27

«Нужная заметка открыта» считается только по вопросам, на которые в базе есть ответ.

Что это значит

Слабым моделям инструкции нужны. Haiku без инструкций дала все провалы этого прогона. Один раз заявила, что доступа к базе у неё нет, и посоветовала из головы. Ещё раз ответила общими словами, не опираясь на найденное. С инструкциями — ни одного провала: правильность выросла с 1,56 до 1,81, опора на найденное — с 0,75 до 1,00, а нужную заметку она стала открывать в 12 вопросах из 13 вместо 9.

Сильные модели находят инструкции сами. Sonnet, Opus и Fable ответили на все вопросы правильно в обоих условиях. Без серверных инструкций они в большинстве запусков сами вызывали instructions() или открывали _instructions.md: Sonnet — в 3 случаях из 4, Opus и Fable — в 4 из 4. Haiku без подсказки не сделала этого ни разу, а с инструкциями — в 10 случаях из 16.

Правила формата работают. В инструкциях базы сказано отвечать цитатой из заметки. Доля ответов Haiku с дословной цитатой выросла с 0,12 до 0,81.

С инструкциями меньше поиска вслепую. Haiku с ними сделала 19 поисков вместо 29 при том же общем числе вызовов: вместо того чтобы перебирать формулировки, она шла по маршрутам и чаще читала нужные заметки.

Оговорки

  • Выборки маленькие. Шестнадцать вопросов у Haiku и по четыре у остальных — это наблюдения, а не доказанные различия. Особенно у сильных моделей: на четырёх вопросах они упираются в потолок оценки.
  • Обвязка Claude Code. У неё свой системный промпт про программирование. Один провал Haiku без инструкций — отказ работать с формулировкой «я ассистент для кода» — отчасти артефакт этой обвязки.
  • Только модели Claude. Прогон gpt-5.4-mini мы из статьи убрали: в нашем раннере ошибки инструментов доходили до модели пустой строкой, и её цифры это исказило.
  • Одна база. Курс с картами решений и заметкой-маршрутизатором — хорошо размеченная база. На базе без такой структуры инструкциям не на что опереться, и результат может быть другим.

Что из этого следует для авторов баз знаний, мы собрали в гайд: Как написать инструкции для базы знаний.