Retrieval-augmented generation — рабочий способ дать модели корпоративные знания. Разбираем pipeline и ошибки, из-за которых пилоты «не взлетают».
RAG звучит просто: нашли фрагменты документов → подставили в промпт → получили ответ с опорой на факты. На практике это продуктовая линия с ingestion, правами, мониторингом и юридическими ограничениями.
Pipeline от файла до ответа
- Ingestion — SharePoint, Confluence, S3, выгрузки CRM; версия, автор, ACL.
- Parsing — таблицы и заголовки из PDF, стили из Word, якоря из Wiki.
- Chunking — 300–800 токенов с overlap и метаданными.
- Index — vectors + часто BM25.
- Retrieval — top-k, rerank, фильтр прав.
- Generation — «отвечай только по контексту; нет данных — скажи об этом».
- Observability — лог чанков, feedback, hit/hallucination rate.
Почему общий ChatGPT-проект — тупик
Разные допуски сотрудников, устаревшие загрузки, лимиты контекста, отсутствие аудита и нет моста к созданию задачи в CRM. Корпоративный RAG в вашем контуре даёт контроль и встраивание в портал или бота.
Источники
PDF — главный источник боли (сканы, колонки). Нужны OCR и номер страницы в metadata. Wiki лучше синкать по API, чем выгружать раз в месяц. CRM почти всегда требует row-level security.
Типичные ошибки
- чанки слишком крупные или слишком мелкие;
- один индекс без фильтров языка/домена;
- нет гибридного поиска — артикулы и ИНН «теряются»;
- модель не умеет сказать «не знаю»;
- нет метрик ROI и legal-redaction ПДн.
От знания к действию
FAQ закрывает часть запросов. Следующий уровень — агент: RAG для фактов, API для задач. Начните с одного домена, зафиксируйте golden set вопросов и только потом расширяйте источники.
