Платформа для онлайн-обучения: видео и ИИ-поиск по урокам

Учебный центр два года записывает уроки в реальном времени и складывает их в архив. Через год там три тысячи часов видео, и никто им не пользуется: студент не готов пересматривать полтора часа лекции ради одной формулы, а методист вручную помечает главы только для новых курсов, до старых руки не доходят. Платформа технически работает, но архив превращается в склад, а не в актив.
Платформа для онлайн-обучения с видеослоем принимает уроки в реальном времени, хранит записи и добавляет к ним слой обработки: транскрипцию, поиск по содержанию, разбиение на главы. Без этого слоя запись остаётся файлом, который никто не откроет второй раз. С ним запись становится частью учебного материала, по которому можно искать так же, как по тексту учебника.
Почему в архиве ничего не находится
Причина сидит в формате самого видео, а не в объёме хранилища. Файл с записью урока для компьютера непрозрачен: он не знает, где в полутора часах речь зашла про нужную тему. Единственный способ узнать это без обработки: пересмотреть запись целиком или довериться названию файла и дате.
Транскрипция меняет это соотношение. Час лекции даёт примерно девять тысяч слов текста. При архиве в три тысячи часов это порядка 27 миллионов слов, и по такому объёму текста обычный полнотекстовый поиск находит только точные совпадения слов: студент, который спросит «где объясняли про наклонное движение», ничего не получит, если преподаватель произнёс «параболическая траектория». Смысловой поиск, который находит совпадение по значению, а не по буквам, требует отдельного индекса поверх транскрипции, и это уже инженерная задача, а не настройка галочки в LMS. Собранный таким образом индекс и превращается в поиск и чат по собственным видеозаписям, когда студент спрашивает своими словами и получает ответ с отметкой нужной минуты.
Что реально даёт слой ИИ над видео
Работает. Поиск по смыслу внутри записи: студент вводит вопрос своими словами и получает конкретную минуту вместо списка файлов. Автоматическое разбиение лекции на главы и черновик конспекта, который методист правит вместо того, чтобы писать заново. Для платформ с пользовательскими видео (форумы, ответы студентов на видео, конкурсные работы) полезна проверка загруженного ролика перед публикацией.
Работает хуже, чем в презентации вендора. Автоматическая нарезка коротких клипов для соцсетей хорошо работает для маркетингового контента и почти не нужна закрытой корпоративной видеоплатформе для обучения, где видео вообще не должно покидать периметр. Рекомендации следующего курса по видеопривычкам студента требуют накопленной статистики за несколько месяцев, и на новой платформе такая функция первое время советует наугад.
Отдельно про распознавание лиц и другие модели, которые работают прямо с видеопотоком, а не с текстом. Это не экспериментальная технология: на Дома.ai распознавание лиц для бесконтактного доступа работает в проде у 4305+ управляющих компаний в 40+ городах России, то есть российская обработка видео в реальном времени доказана масштабом, а не одним пилотным проектом.
Что покупать готовым, а что разрабатывать самим
Видеослой платформы удобно разложить на несколько уровней, и на каждом решение разное. Выбор протоколов и расчёт стоимости для видеостриминга в приложении для обучения считаются до всякого ИИ: без базового видеостека слой обработки строить не на чем.
| Уровень | Что делает | Решение для российской платформы |
|---|---|---|
| Приём и хранение видео | принимает поток с урока, готовит его к раздаче | готовая инфраструктура на российских мощностях: Яндекс Облако, VK Cloud, Selectel |
| Раздача зрителям | доставляет видео до браузера студента | готовый CDN и открытые протоколы: WebRTC, HLS, они не завязаны на страну поставщика |
| Плеер | воспроизводит видео на устройстве студента | готовый открытый плеер, дорабатывать не нужно |
| Транскрипция и смысловой поиск | превращает запись в текст и делает его искомым | разрабатывать под свою платформу и свои данные |
| Конспекты, главы, модерация видео | добавляет смысл поверх транскрипции | разрабатывать под свою платформу, готового отраслевого сервиса под задачу нет |
Первые три уровня давно стандартизированы, и тратить на них команду разработки не имеет смысла. Последние два уровня как раз то, ради чего вообще затевается собственная платформа: здесь у чужого сервиса нет доступа к особенностям вашего курса, вашей терминологии и вашей базы студентов. Границу между покупным и своим полезно зафиксировать до старта разработки, и именно с этого начинается оценка архитектуры платформы.
Почему нельзя просто подключить зарубежный сервис распознавания видео
Специализированные зарубежные сервисы семантического поиска по видео и генерации клипов в России недоступны или не принимают оплату. Рабочий путь для этого уровня один: открытые модели распознавания речи, развёрнутые на своих серверах, поверх которых пишется собственная логика поиска и разметки. Это дороже на старте, чем подписка на готовый сервис, и дешевле в эксплуатации, а для записей с лицами и голосами студентов часто оказывается единственным вариантом, не зависящим от того, что произойдёт с внешним сервисом через полгода.
Записи занятий содержат лица и голоса, то есть персональные данные, и по 152-ФЗ они хранятся на серверах в России так же, как список студентов и их оценки. Отправка записи во внешний сервис за периметром страны для этой обработки не подходит по закону, и вопрос доступности сервиса здесь уже вторичен. Для платформ, которые поставляются вузам и учебным центрам, дополнительно действует реестр отечественного ПО Минцифры: он даёт право на участие в госзакупках, и это отдельный документ от свидетельства Роспатента на программу для ЭВМ, которое подтверждает права на код, но закупок не открывает.
Сколько это стоит
Разработка платформы онлайн-обучения с видеослоем начинается от 400 000 ₽. В эту сумму входит рабочая база: приём урока в реальном времени, хранение записей, личные кабинеты студента и преподавателя. Транскрипция и поиск по архиву добавляются отдельным модулем и оцениваются по объёму архива и требованиям к качеству распознавания на конкретной тематике курса.
Список функций для оценки почти ничего не даёт, потому что стоимость определяют объём архива и глубина поиска, который нужен студенту, а количество галочек в списке тут почти ни при чём. Мы отдаём описание требований, архитектуру и смету за 24 часа, а план MVP, аудит кода и аудит архитектуры делаем бесплатно за 3 рабочих дня.
В команде 50 специалистов в штате, без субподряда, 250+ проектов с 2005 года, заказчики из 17+ стран. На БрейнСерте, одном из первых в мире виртуальных классов на WebRTC, мы держали доступность 99,995% при 500 млн+ минут занятий. Это цифра про инфраструктуру приёма и раздачи видео, тот самый нижний уровень таблицы выше: она набирается решениями на этапе архитектуры, а не подключением стороннего сервиса в последний момент.
Частые вопросы
Нужен ли отдельный ИИ-слой, если в LMS уже есть видео?
Стандартная СДО умеет проигрывать запись, но обычно не даёт смыслового поиска внутри неё. Если студенты и преподаватели реально ищут моменты в лекциях, а не просто просматривают их целиком, слой транскрипции и поиска добавляется отдельно поверх готовой видеочасти.
Можно ли использовать готовый зарубежный сервис для анализа видео?
Специализированные сервисы такого рода в России недоступны или не принимают оплату. Рабочий путь предполагает открытые модели распознавания речи на своих серверах с собственной логикой поиска, развёрнутые внутри периметра, где хранятся сами записи.
Что из видеоархива подпадает под 152-ФЗ?
Записи с лицами и голосами студентов, как и любые данные, по которым человека можно узнать. Обезличенная статистика просмотров без привязки к конкретному студенту под это требование не подпадает.
Обязателен ли реестр Минцифры для видео-модуля с ИИ?
Только если платформа поставляется вузам, школам или другим госзаказчикам и участвует в закупках. Для внутреннего корпоративного обучения реестр не требуется. Свидетельство Роспатента на программу для ЭВМ и реестровую запись Минцифры путать не стоит: это разные документы с разными правами.
Нужна ли модерация видео закрытой корпоративной платформе?
Если видео загружают только сотрудники компании для внутреннего курса, риск ниже, чем на открытой платформе с публичными работами студентов. Модерация становится обязательной там, где видео от одного пользователя видят другие пользователи без предварительной проверки.
Сколько времени занимает внедрение поиска по существующему архиву записей?
Зависит от объёма архива и требуемого качества распознавания на терминологии курса. Сначала транскрибируется и индексируется весь архив, потом дорабатывается интерфейс поиска. Точные сроки считаются по факту объёма и озвучиваются в смете за 24 часа.
Если у вас растёт архив записей и студенты жалуются, что не могут найти нужный момент занятия, расскажите задачу, и мы вернёмся с архитектурой и сметой e-learning-платформы с видеоархивом за 24 часа.
