RAG для видео и аудио: чат с моими записями (2026) — обложка

Главное

67 % продакшен-внедрений LLM используют RAG (отчёт McKinsey по корпоративному ИИ за 2026 год). Это рост с 31 % в 2024 году. Подход стал мейнстримом, а видео- и аудио-приложения остаются недостаточно изученными.

Универсальный RAG не работает с видео. Стратегия разбиения транскриптов, поиск с привязкой ко времени, выбор мультимодального эмбеддинга, диаризация говорящих — всё это важнее, чем выбор векторного хранилища.

Правило 73 %. Когда RAG не работает в продакшене, в 73 % случаев проблема — в поиске, а не в генерации. Сначала улучшайте качество поиска (чанкинг, реранкинг, гибридный поиск), а потом настраивайте промпт LLM.

Стоимость зависит от эмбеддинга и работы LLM, а не от векторного хранилища. 1 000 часов видео обходятся примерно в 9 000 ₽/мес на ASR + 3 000 ₽/мес на эмбеддинг + 1 125 ₽/мес на векторное хранилище. Расходы на работу LLM растут вместе с количеством запросов.

Глубокие ссылки с привязкой ко времени — ключевая фича. Ответ RAG, ведущий к точному моменту в исходном видео, делает «чат с моими записями» по-настоящему полезным, а не просто игрушкой. Таймкоды нужно закладывать с самого начала.

Почему Фора Софт написала этот гайд

Фора Софт с 2005 года выпустила более 200 видео- и аудиопродуктов и внедрила RAG-решения на их основе. BrainCert (e-learning-платформа с годовой выручкой 750 млн ₽) — поиск по лекциям; VALT (650+ юридических организаций) — e-discovery-поиск по записям допросов и показаний; TransLinguist — поиск по многоязычным транскриптам; Mangomolo — поиск по архивам вещателя.

В 2024–2026 годах мы разработали четыре продакшен-системы видео-рага и провели аудит ещё двух. Паттерны в этом гайде — из этих проектов и открытых источников: статья VideoRAG (KDD 2026), решение AWS V-РАГ, стратегии Morphik, данные McKinsey о 67 % внедрений.

Если вы создаёте «чат с моими записями», систему семантического поиска по видео, Q&A по лекциям или любое RAG-приложение, где источником данных являются видео или аудио, этот гайд поможет вам с архитектурой, стратегиями разбиения на части, выбором векторного хранилища и оценкой затрат.

Нужен RAG для вашего видео- или аудио-архива?

Пришлите количество видео, общее число часов и сценарий использования. Мы вернёмся с архитектурой и оценкой стоимости через 48 часов. Бесплатно.

Позвоните нам → Напишите нам →

Почему универсальный RAG не работает на видео

Универсальный RAG (Pinecone + LangChain + GPT-4) на корпусе документации запускается за 50 строк Python. Тот же подход на видеоархивах даёт бесполезные ответы. Три причины:

1. Чанкинг транскриптов сложнее, чем чанкинг документов. У документов есть заголовки, абзацы, предложения. У транскриптов — реплики говорящих, паузы, перебивания, смена темы посреди фразы. Чанк в 500 слов может включать трёх разных спикеров и четыре темы. Поиск выдаёт не тот момент, потому что у такого чанка нет чёткой семантической границы.

2. Привязка ко времени — необходимость, а не опция. «Пациент упомянул боль в груди» — бесполезно без указания времени: «на 12:34 минуте консультации 14 августа». Только глубокая ссылка на исходное видео делает ответ полезным. Таймкоды нужно закладывать в каждый фрагмент и сохранять при поиске и формировании ответа.

3. Мультимодальный контекст важен для части сценариев. Запись с камеры наблюдения, где человек заходит в зону ограниченного доступа, требует визуального контекста, а не только аудиотранскрипта. Лекция с диаграммами на доске нуждается в визуальной составляющей. Чисто текстовый эмбеддинг RAG полностью теряет визуальный сигнал.

Эталонная архитектура

Источник видео/аудио MP4, запись, архив ASR + диаризация Whisper / AssemblyAI / Deepgram Чанкинг + таймкоды По репликам, нахлёст ~30 с Эмбеддинг BGE / OpenAI Векторное хранилище — Qdrant / Pinecone / Weaviate / pgvector / Chroma Гибридный поиск (BM25 + dense) · реранкинг · фильтры по метаданным Реранкер Cohere Rerank / BGE Reranker / cross-encoder · топ-50 в топ-5 LLM с подстановкой ссылок GPT-4 / Claude 3.5 / Gemini · системный промпт требует цитировать ID чанков Ответ с глубокими ссылками по таймкодам «Пациент упомянул боль в груди на 12:34 в консультации от 14 августа»

Рисунок 1. Конвейер видео- и аудио-RAG: распознавание речи, разбиение на части, создание эмбеддингов, векторное хранилище, реранкер, LLM, ответ с таймкодами.

Стратегии чанкинга для транскриптов

Чанкинг по предложениям. Каждое предложение — отдельный чанк. Чёткая семантическая граница, много мелких чанков, при необходимости система может подтянуть дополнительный контекст. Подходит для ответов на вопросы из FAQ по хорошо структурированному контенту.

Чанкинг по репликам говорящего. Каждая реплика (непрерывный отрезок речи одного человека) становится отдельным чанком. Такой подход сохраняет структуру диалога и хорошо согласуется с результатами диаризации. Подходит для разговорного контента — встреч, допросов, интервью.

Семантический чанкинг. Определяет смену темы по схожести эмбеддингов. Границы чанков попадают на естественные семантические разрывы. Качество выше, но обработка на этапе ингеста дороже. Подходит для лекций, подкастов и длинного контента.

Окно фиксированной длины с нахлёстом. Окна по 30 секунд с нахлёстом в 5 секунд. Просто, предсказуемо, работает неплохо. Подходит для прототипа или когда структура спикеров и тем нечёткая.

Гибридный (рекомендуем). Основа — реплики говорящих, плюс детектор смены темы внутри длинных реплик. Окно обычно 60–90 секунд, нахлёст 10–20 секунд для сохранения контекста. Используем в большинстве наших продакшен-внедрений.

Таймкоды для каждого чанка. В чанке хранятся: ID чанка, ID исходного видео, время начала, время окончания, спикер (если известен), эмбеддинг. Поиск возвращает чанк с таймкодом, а ответ ссылается на «такую-то минуту в источнике X».

Когда нужен мультимодальный эмбеддинг, а когда хватит текстового

Тип контентаРекомендуемПочему
Встречи, подкасты, допросыТолько текстовый эмбеддингМного слов, визуал малоинформативен
Лекции с диаграммами и демонстрациямиГибрид (текст + эмбеддинги ключевых кадров)Визуальная часть несёт смысл
Записи с камер видеонаблюденияМультимодальный (CLIP + текст)Главное — визуал, слов мало
Спортивные трансляцииМультимодальный + дорожка комментатораВажны и визуал, и аудиокомментарий
Музыка, фоновое аудиоАудио-эмбеддинг (CLAP)Языка нет, доминируют звуковые признаки

Инструменты для мультимодального эмбеддинга. CLIP для пар «изображение — текст» (зрелое и быстрое решение). VideoCLIP / X-CLIP — для видео. CLAP — для аудио. Twelve Labs — коммерческий мультимодальный API. ImageBind от Meta. Оптимальное решение 2026 года — гибрид: текстовый эмбеддинг для транскрипта плюс разреженные эмбеддинги ключевых кадров для визуального контекста.

Сравнение векторных хранилищ

ХранилищеХостингСильная сторонаКогда подходит
QdrantSelf-hosted или облакоПроизводительность, гибридный поиск, фильтры по payloadДефолт 2026-го для серьёзных внедрений
PineconeТолько управляемое облакоПростота в использовании, обширная экосистемаКогда важна скорость запуска и нет SRE
WeaviateSelf-hosted или облакоСхемы, гибридный поиск, модулиЭнтерпрайз с богатыми структурированными метаданными
pgvectorРасширение PostgresPostgres уже работает, новая инфраструктура не нужнаДо 10 млн векторов, транзакционная интеграция
ChromaSelf-hosted, встраиваемыйУдобство для разработчика, встраивается в приложениеПрототипы, одноразовые приложения
MilvusSelf-hosted, облако ZillizМасштаб — миллиарды векторовОгромные датасеты, нагрузки на RD

Разница в стоимости между векторными хранилищами невелика по сравнению с эмбеддингами и LLM. Выбирайте то, с чем ваша команда уже умеет работать — не нужно слишком усложнять выбор.

Правило 73 % — когда RAG падает, виноват поиск

Отраслевая аналитика 2026 года стабильно показывает: когда RAG не работает в продакшене, в 73 % случаев виноват именно поиск, а не генерация. LLM редко становится узким местом, если вы используете модели уровня GPT-4 или Claude 3.5. Проблема — в том, что подаёт поисковик.

Типичные сценарии отказа поиска. (1) Слишком мелкие чанки (теряется контекст). (2) Слишком крупные чанки (запрос «размывается»). (3) Не включён гибридный поиск (dense + sparse работает лучше, чем каждый по отдельности). (4) Нет реранкера (ответ есть в топ-50, но LLM его не видит). (5) Несовпадение моделей эмбеддинга (многоязычный контент с английскими эмбеддингами).

Порядок инвестиций. Сначала настраивайте поиск: чанкинг, гибридный поиск, реранкинг, фильтры по метаданным. На каждой итерации проверяйте точность и полноту (precision/recall) на размеченном валидационном наборе (об этом подробно рассказано в нашем гайде по оценке LLM-приложений). Только когда поиск работает стабильно, приступайте к настройке промпта для LLM.

Гибридный поиск. Сочетайте плотный векторный поиск (по смыслу) с разреженным BM25 (по ключевым словам). Реранжируйте результаты. Подсказка: BM25 сам по себе хорошо справляется с запросами, содержащими имена собственные, технические термины и идентификаторы — то, что пропускает плотный эмбеддинг. На наших практиках гибридный подход повышает точность на 10–20 %.

Реранкер. Прогоните топ-50 результатов первичной выдачи через cross-encoder-реранкер (Cohere Rerank, BGE Reranker, ColBERT). Отдайте топ-5 в LLM. Реранкер значительно меньше LLM, но сильно повышает точность. На любом серьёзном внедрении он стоит небольшой задержки.

Модель стоимости

Рабочий пример: 1 000 часов записей встреч, 100 запросов в день.

ASR. Самостоятельный запуск Whisper на GPU: примерно 0,3 ₽ за минуту аудио. 1 000 часов = 60 000 минут = 22 тыс. ₽ единовременно + 3 750 ₽/мес на новый контент. Управляемые сервисы AssemblyAI / Deepgram: 0,7–1,5 ₽ за минуту. При больших объёмах самостоятельный Whisper окупает затраты на GPU.

Эмбеддинг. OpenAI text-embedding-3-small: 0,0015 ₽ за 1000 токенов. 1000 часов речи ≈ 8 млн токенов. Единоразовое создание эмбеддинга — 12 тыс. ₽. Обновление контента — 2250 ₽ в месяц.

Векторное хранилище. Self-hosted Qdrant: примерно 1 125 ₽/мес на 1 млн векторов. Управляемый Pinecone: около 5 250 ₽/мес при аналогичной нагрузке. Это копейки по сравнению со стоимостью LLM.

Реранкер. Cohere Rerank: 75 ₽ за 1000 запросов. 100 запросов в день = 225 ₽ в месяц.

Инференс LLM. GPT-4 с контекстом из 5 чанков: примерно 1,5 ₽ за запрос. 100 запросов в день — 4 500 ₽ в месяц. Или Claude 3.5 Sonnet с примерно такой же ценой. Это переменная часть расходов.

Итого. Около 12 тыс. ₽/мес на этом масштабе — в основном из-за ASR (если постоянно добавляете контент) и работы LLM. Линейно: 10 000 часов и 1 000 запросов в день — примерно 120 тыс. ₽/мес.

Хотите модель стоимости для своего архива?

Пришлите количество видео, среднюю длительность и объём запросов. Мы вернёмся с полным расчётом стоимости через 48 часов. Бесплатно.

Позвоните нам → Напишите нам →

Build vs Buy — AssemblyAI LeMUR, Twelve Labs, кастом

AssemblyAI LeMUR. Готовый сервис «распознавание речи + ИИ по транскрипту». Поддержка Q&A, кратких выдержек и пользовательских промптов на основе аудиозаписей. Самый быстрый способ запустить RAG — только по транскриптам. Доплата за использование вместо самостоятельного решения на больших объёмах — в 2–3 раза.

Twelve Labs. Мультимодальный видеопоиск и ответы на вопросы как сервис. Понимание видео (изображение + звук), семантический поиск, поиск по сценам. Подходит, когда важен визуальный контент, а строить CLIP-конвейер самостоятельно не хочется.

Morphik / V-РАГ (AWS). AWS-нативный фреймворк для работы с видео в RAG. Интегрируется с Bedrock, S3 и Kendra. Подходит, если работа внутри AWS допустима и данные уже находятся в этой экосистеме.

LlamaIndex / LangChain. Прикладные фреймворки для оркестрации. Работают с любым векторным хранилищем, моделью эмбеддингов и LLM. Стандартный выбор для кастомных решений в 2026 году.

Кастом. Когда сценарий сильно зависит от вертикальной сферы (например, юридический e-Discovery, анализ записей с камер или медицинских транскриптов) или когда по требованиям комплаенса нужна локальная установка (например, RAG для телемедицины уровня HIPAA). Затраты на разработку выше, но зато есть полный контроль.

Мини-кейс — платформа для встреч добавляет «чат с прошлой неделей» за 6 недель

B2B-платформа записи и расшифровки встреч (под NDA, около 50 тыс. записей в неделю) обратилась к нам в конце 2025 года с задачей реализовать «чат с моими записями» — фичу v2. Цель: пользователь спрашивает, например, «о чём мы вчера договорились с Марком?», а ассистент отвечает и при этом даёт ссылки на нужные фрагменты записи.

Сборка за 6 недель. Недели 1–2: стратегия чанкинга (по репликам, окна 60 секунд, нахлёст 10 секунд), Whisper-large для распознавания речи (уже использовался в пайплайне), text-embedding-3-small для эмбеддингов. Недели 3–4: векторное хранилище Qdrant с гибридным поиском, Cohere Rerank для сужения результатов с топ-50 до топ-5, GPT-4 с системным промптом, требующим цитирование. Неделя 5: добавление глубоких ссылок по таймкодам, фильтрация по нескольким записям. Неделя 6: оценка через RAGAS на 200 размеченных запросах, настройка поиска до достижения точности выше 80 %.

Результат. Точность поиска — 84 % на размеченном валидационном наборе. Внедрение: 35 % пользователей попробовали фичу за 30 дней, 58 % — за 90 дней. Месячное удержание выросло на 11 процентных пунктов у тех, кто использовал фичу 5 и более раз. Позвоните нам, чтобы обсудить аналогичную сборку под ваш архив.

Оценка — RAGAS, Braintrust, LangSmith

RAGAS. Открытый фреймворк для оценки RAG-систем. Метрики: релевантность контекста, релевантность ответа, обоснованность (проверяется, опирается ли ответ на извлечённый контекст). Стандартный инструмент для оценки RAG, совместим с большинством технологий.

Braintrust. Полнофункциональная платформа для оценки моделей, привлекла 6 млрд ₽ в феврале 2026 года по оценке 60 млрд ₽. Связывает продакшен-трейсы, оценки, итерации промптов и контрольные точки качества в CI/CD. Подходит командам, которые одновременно развивают несколько фич на основе LLM.

LangSmith. Оценка от создателей LangChain. Хорошая трассировка, инструменты для подбора промптов, интеграция с фреймворком. Подойдёт, если ваш стек построен на LangChain.

Эталонный датасет (golden dataset). Самый сложный этап при настройке оценки. Типовой вариант: 100–200 размеченных пар «вопрос-ответ», охватывающих основные сценарии и редкие случаи. Разметку проводят доменные эксперты, а не инженеры. Без этого вы настраиваете систему вслепую.

Каркас принятия решения — стек из пяти вопросов

В1. Контент с упором на речь или на визуал? Речь — конвейер с текстовым эмбеддингом. Визуал — мультимодальный (CLIP + текст). Смешанный — гибридное скоринговое объединение.

В2. Какой объём за 12 месяцев? До 1 000 часов — управляемые сервисы (AssemblyAI LeMUR, Twelve Labs). От 1 000 до 100 000 часов — гибрид: управляемый ASR + кастомный RAG. Свыше 100 000 часов — self-hosted Whisper + кастомный RAG.

В3. Требования по комплаенсу? Стандартные — любой путь. HIPAA — совместимый с HIPAA STT + конечные точки Azure OpenAI + саморазмещаемое векторное хранилище. EU AI Act high-risk — требования к документации увеличивают сроки на 4–6 недель.

В4. Масштаб векторного хранилища? До 10 млн векторов — pgvector, если уже используете Postgres. От 10 млн до 1 млрд — Qdrant или Weaviate. Свыше 1 млрд — Milvus или распределённый Qdrant.

В5. Какой бюджет задержки? Если ответ нужен быстрее секунды — пропускаем реранкер, используем более лёгкую модель и активно кэшируем. Если допустимо 2–3 секунды — запускаем полный конвейер (реранкинг + GPT-4) по умолчанию.

Ловушки, которых лучше избежать

1. Пропуск реранкера. Топ-5 из первичной выдачи без реранкинга — это шум. Всегда используйте cross-encoder-реранкер: он снижает поисковые отказы на 30–50 %.

2. Нет таймкодов. Ответ без точной ссылки на исходное видео — это не помощь, а формальность. Добавляйте таймкоды в чанки с самого начала.

3. Тюнинг LLM раньше поиска. Правило 73 %. Сначала исправляйте поиск.

4. Нет фреймворка оценки. Без RAGAS или аналога на эталонном датасете каждое «улучшение» — просто анекдот. Регрессии вы не заметите.

5. Забыть про многоязычность. Стандартные эмбеддинги OpenAI поддерживают более 50 языков, но качество сильно различается. Для многоязычных архивов проверяйте качество эмбеддингов по каждому языку, а для слабо поддерживаемых языков рассмотрите использование специализированных моделей.

KPI, которые стоит измерять

KPI качества. Точность поиска при k=5 (цель: >80 %). Полнота поиска при k=20 (цель: >90 %). Обоснованность по RAGAS (цель: >0,85). Релевантность ответа (цель: >0,85).

Бизнес-цели. Доля пользователей, попробовавших фичу (цель: 30 % и выше за 30 дней среди активных). Доля «успешных» запросов (пользователь нашёл нужное за 3 уточнения). Прирост удержания среди тех, кто пользуется фичей.

KPI надёжности. 95-й перцентиль задержки запроса (цель: менее 3 с). Доля успешных ASR (цель: 99 % и выше). Задержка обновления конвейера эмбеддинга (цель: новый контент появляется в поиске в течение 5 минут).

FAQ

Whisper или AssemblyAI для распознавания речи?

Self-hosted Whisper-large — наиболее выгодное решение при объёмах более 1 000 часов в месяц. AssemblyAI и Deepgram выигрывают по скорости запуска и удобству управляемого сервиса при меньшем объёме — до 1 000 часов в месяц. Качество распознавания сопоставимо; для английского языка Whisper-large-v3 находится в числе лучших в индустрии.

Pinecone или Qdrant?

Pinecone выигрывает по простоте эксплуатации (только управляемый). Qdrant выигрывает по стоимости (можно развернуть самостоятельно), производительности (работает быстрее на том же железе) и функциональности (лучше реализованы гибридный поиск и фильтрация по данным). Для новых проектов с собственной командой эксплуатации выбираем Qdrant; без такой команды — Pinecone.

OpenAI text-embedding-3-large или BGE?

OpenAI text-embedding-3-large — удобно использовать для английского языка, если нужен управляемый сервис. BGE-large-1.5 (open-source) — лучший выбор для self-hosted решений: качество сопоставимо с OpenAI, а маржинальная стоимость равна нулю, как только инференс запущен у вас. В многоязычных сценариях BGE-M3 показывает лучшие результаты на языках, отличных от английского.

Как оценить RAG до запуска?

Соберите эталонный датасет из 100–200 вопросов с участием доменных экспертов. Протестируйте на нём RAGAS, Braintrust или LangSmith. Настройте поиск (чанкинг, реранкинг, гибридный подход), пока точность не превысит 80 %, а обоснованность — 0,85. Полная методология описана в нашем гайде по оценке LLM-приложений.

Можно ли построить RAG на основе видео, защищённого по HIPAA?

Да — с HIPAA-совместимым STT (Azure Speech / AWS Transcribe Medical), конечными точками Azure OpenAI с BAA, self-hosted векторным хранилищем внутри вашего VPC. Логи и промпты относятся к категории «около PHI», поэтому их нужно маскировать до передачи во внешние сервисы. Подробнее — в нашем гайде по HIPAA + SOC 2.

Сколько занимает разработка продакшен-видео-RAG?

С нуля на управляемых сервисах — 4–6 недель. Кастом на базе LangChain, Qdrant и Whisper — 8–12 недель. Вертикально-специфическое решение (например, юридический e-discovery или медицина) с учётом требований комплаенса — 12–16 недель. Благодаря нашим наработкам в BrainCert и VALT мы обычно укладываемся ближе к нижней границе этих сроков.

А что насчёт VideoRAG (статья KDD 2026)?

Сильный академический бенчмарк для полноценного мультимодального видео-RAG. Открытая реализация от HKUDS на GitHub. Полезна как ориентир и для исследований, но в продакшене всё ещё преобладает подход с акцентом на транскрипт — из-за стоимости и задержек.

Twelve Labs или кастом?

Twelve Labs — самый быстрый способ внедрить мультимодальный видеопоиск, экономия по сравнению с самостоятельной разработкой на больших объёмах — в 3–5 раз. Используйте его при объёмах до 1000 часов и при срочных задачах, а при объёмах от 5000 часов стоит рассмотреть кастомное решение — там выгоднее.

Voice AI

Гайд по продакшену OpenAI Realtime

RAG через голосового агента: пользователь говорит, агент ищет.

AI-инфраструктура

MCP для видео-приложений

RAG как набор инструментов MCP для любого агента.

Оценка

Оценка LLM-приложений

RAGAS + Braintrust для RAG в продакшене.

Агенты

AI-агенты на LiveKit

Голосовой агент, оборачивающий поиск RAG.

Комплаенс

HIPAA + SOC 2

Когда RAG работает с PHI, важна архитектура с BAA.

Готовы запустить «чат с моими записями»?

67 % продакшен-приложений с LLM уже используют RAG. Универсальный RAG не работает с видео; успех достигается за счёт стратегии разбиения на чанки, поиска с привязкой ко времени, гибридного поиска и реранкинга. Правило 73 % гласит: сначала инвестируйте в поиск — LLM редко становится узким местом.

Стоимость определяется ASR и инференсом LLM, а не векторным хранилищем. Выбирайте Qdrant или Pinecone в зависимости от возможностей вашей команды по эксплуатации. Оценка через RAGAS на эталонном датасете обязательна. Глубокие ссылки по таймкодам делают ответ полезным, а не игрушкой — закладывайте их с самого начала.

Хотите план запуска видео-RAG за 6 недель?

Пришлите размер архива, тип контента и сценарий использования. Мы подготовим архитектуру, подберём подрядчика и составим план на 6–12 недель — за 48 часов. Бесплатно.

Позвоните нам → Напишите нам →

  • Технологии