Начни с вопросов, а не с папки документов
База знаний для AI не обязана содержать всё, что когда-либо лежало на диске компании. Чем больше старых файлов без владельца, тем труднее понять, почему помощник дал именно такой ответ.
Первое, что я бы убрал: Считать количество загруженных файлов качеством базы.

Что оставить в первой версии базы
- Десять реальных вопросов пользователей.
- Владелец и дата проверки документа.
- Правила ответа при конфликте файлов.
- Набор тестов для старых и новых версий.
Как собрать базу, которой можно доверять
- Убери мусор до загрузки
Не добавляй в индекс дубли, черновики и документы без владельца. Сначала выбери один актуальный источник для каждого правила.
Что увидишь: Для каждого документа есть владелец и дата ревизии.
Если не сработало: Перенеси неясные файлы в quarantine, а не удаляй без разбора.
- Добавь метаданные доступа
Для каждой записи сохрани отдел, регион, продукт и уровень доступа. Поиск должен фильтровать документ до того, как текст попадёт в контекст модели.
Сверь: Пользователь не получает фрагмент документа, к которому у него нет права.
Если не сходится: Начни с одной общей папки без чувствительных данных.
- Пиши ответ с опорой на фрагмент
В инструкции задай формат: ответ, документ, версия, что делать при конфликте. Не проси цитировать, если источник не попал в контекст.
Что должно совпасть: Ответ содержит ссылку или название источника.
Если ответ другой: Сделай ответ draft и покажи найденные фрагменты человеку.
- Запусти ревизию по вопросам
Раз в неделю смотри вопросы без ответа, устаревшие документы и случаи, где сотрудник исправил помощника. Обновляй источник, а не только prompt.
Перед запуском: Каждая ошибка превращается в изменение документа или теста.
Если упёрлось: Назначь владельца базы и календарную дату проверки.

Минимальная карточка документа
Для каждого файла сохрани doc_id, title, source_url, owner, valid_from, valid_to, audience, access_level и status: draft, approved, archived. Перед поиском отфильтруй archived и документы без права доступа пользователя.
Разбивай длинные инструкции по смысловым разделам, а не каждые 500 символов. В заголовке фрагмента оставляй продукт, регион и дату — иначе смешаются возврат для России и правило для другой страны.
- У каждого ответа должна быть ссылка на фрагмент-источник.
- Вопрос, на который база не отвечает, должен уходить в очередь обновления.
Как принять базу до запуска
Составь 20 тестовых вопросов: обычные, синонимы, конфликтующие правила, просроченный документ и запрос вне доступа. Для каждого запиши expected_source и expected_answer. Проверяешь точность поиска и права доступа, а не «умность» AI.
Документ должен иметь владельца и срок жизни
Добавь `doc_id`, `title`, `source_url`, `owner`, `valid_from`, `valid_to`, `audience`, `access_level` и `status = draft/approved/archived`. Перед поиском исключай архив и документы без права доступа. Длинную инструкцию разбивай по смысловым разделам, а не случайно по 500 символов.
Составь 20 тестовых вопросов: обычный, синоним, конфликтующие правила, просроченный документ и запрос вне доступа. Для каждого сохрани `expected_source` и `expected_answer`. База готова, когда ясно, откуда ответ и кто обновит документ после ошибки.
Какие документы пускать в контекст
| Критерий | Вопрос | Хороший признак |
|---|---|---|
| Вход | Что подготовить для база знаний для AI-помощника? | Составь реестр документов: название, тип, версия, владелец, дата обновления, аудитория, доступ и срок следующей проверки. |
| Действие | Что система может сделать сама? | Только заранее перечисленные действия, без доступа ко всему аккаунту |
| Проверка | Как понять, что результат можно принять? | Создай тесты на точный вопрос, конфликт двух версий, отсутствие ответа и документ с ограниченным доступом. |
| Сбой | Куда уходит непонятный случай? | Верни «не найдено» и передай вопрос владельцу базы; не проси модель заполнить пробел из общего знания. |
Что увидит пользователь помощника
Помощник ссылается на короткий проверенный набор. Команда понимает, какой документ обновить после изменения цены, правила или процесса.

Где база знаний путает модель
Индексировать папку с черновиками и неактуальными версиями.
Надеяться на промпт вместо фильтра доступа.
Не показывать пользователю источник ответа.
Обновлять только векторную базу без владельца исходного документа.
Когда нужен отдельный контур доступа
Если база содержит персональные данные, разные уровни доступа и десятки владельцев, сначала спроектируй права и журнал изменений.
Как обновлять базу без хаоса
Кому подходит база знаний для AI-помощника?
База знаний — актуальные документы, владельцы, метаданные и правило «что делать, если ответ не найден». Папка с файлами без этого — не база.
С чего начать, если всё пока вручную?
Для первого шага составь реестр документов: название, тип, версия, владелец, дата обновления, аудитория, доступ и срок следующей проверки.
Как проверить, что настройка не навредит?
Проверка здесь такая: создай тесты на точный вопрос, конфликт двух версий, отсутствие ответа и документ с ограниченным доступом.
Что делать при непонятном результате?
При таком результате верни «не найдено» и передай вопрос владельцу базы; не проси модель заполнить пробел из общего знания.







