Как выбрать систему AI-рекомендаций для видеоконтента в 2026 году

18/10/2025
·
Обновлено
8.11.2026

Система рекомендаций контента на базе AI — это часть видеоплатформы, которая решает, что посмотреть дальше. Если она работает хорошо, на неё приходится 70–85% всего просматриваемого контента (это давно известная цифра от Netflix), и именно она обеспечивает удержание пользователей в крупных стриминговых сервисах. Если же работает плохо — тратит GPU-ресурсы впустую, нарушает статью 38 EU Digital Services Act и теряет пользователей ещё до того, как они откроют каталог. Это руководство — практический справочник для покупателя на 2026 год: какое семейство алгоритмов выбрать, какие фреймворки и managed-сервисы использовать, насколько быстро должна работать система, сколько это стоит и как соблюдать требования DSA и EU AI Act.

Фора Софт строит и поддерживает рекомендательные системы для видеоплатформ — стриминга, VOD, OTT и edtech. Мы запускали базовые решения на коллаборативной фильтрации, two- tower нейронные ретриверы на Merlin, transformer-реранкеры на TorchRec и слои векторного поиска, которые их кормят, — на собственных серверах, в AWS и в GCP. В этой статье собрано то, что мы предлагаем клиентам уже в первый день обсуждения нового проекта. Порядок изложения поможет вам определиться: строить систему с нуля, покупать готовое решение или выбрать гибридный подход, который мы рекомендуем — сделать слой ретривала своими силами, а feature store и векторную БД взять как сервис.

Главное

Каскад 2026 года состоит из трёх слоёв. Ретривал (менее 40 мс) → скоринг (менее 40 мс) → реранкинг (менее 20 мс) при жёстком бюджете 100 мс end-to-end.

Досматриваемость важнее времени просмотра. В 2025–2026 годах и YouTube Shorts, и TikTok изменили алгоритмы, сделав ставку на процент досмотра. 30-секундное видео с 85% досмотра теперь обгоняет 60-секундное с 50%.

ROI уровня Netflix возможен, но в чистом виде встречается редко. На большинстве платформ качественная рекомендательная система повышает вовлечённость на 8–20% и окупается за 3–6 месяцев.

В 2026 году комплаенс — уже не опция. Статья 38 DSA требует, чтобы для пользователей из ЕС был доступен режим ранжирования без профилирования; статья 27 — чтобы алгоритмы были объяснимыми; EU AI Act относит часть рекомендательных систем к высокорисковым.

Инфраструктуру покупайте, модель стройте сами. Feast или Tecton для фич, Pinecone/Milvus/Vertex Matching Engine для ANN-ретривера, своя two-tower или transformer-модель. Полностью управляемый вариант (AWS Personalize) — только для команд на ранней стадии.

Почему этот гайд написала Фора Софт

Большинство переделок видеорекомендеров, с которыми мы сталкиваемся, проваливаются по предсказуемым причинам: оптимистичная выкатка feature store, упирающаяся в лимиты памяти Redis на 10 млн пользователей; two-tower модель ретривала, которая отлично ранжирует офлайн и рассыпается онлайн, потому что real-time фичи не подключили; «соответствующая DSA» хронологическая лента, которую никто не прогнал через A/B и которая тихо роняет удержание. Нашей команде платили за то, чтобы каждую из этих историй чинить, и за то, чтобы запускать новые рекомендательные системы с нуля под жёсткие SLA.

Этот гайд — краткое изложение нашего опыта. Если вы решаете, что выбрать: AWS Personalize, Vertex AI Recommendations или собственную разработку, и хотите услышать взвешенное мнение от команды, которая работала со всеми тремя вариантами, — позвоните или напишите нам.

Выбираете между AWS Personalize, Vertex AI и собственной разработкой?

30 минут с нашим тимлидом по ML-инжинирингу: feature store, слой ретривала, модель стоимости и периметр комплаенса.

Позвоните нам → Напишите нам →

Что такое AI-рекомендер в 2026 году на самом деле

Видеорекомендер в 2026 году — это трёхступенчатый каскад. Ретривал сужает каталог из миллионов элементов до набора кандидатов — обычно до нескольких сотен — с помощью приближённого поиска ближайших соседей (ANN) по item-эмбеддингам, которые выдаёт two-tower нейросеть. Скоринг прогоняет этот набор через более тяжёлую модель — градиентный бустинг, DNN или трансформер — и возвращает ранжированный список. Реранкинг применяет бизнес-правила: разнообразие, свежесть, ограничения по правам, эксплорацию и режим без профилирования по DSA — и отдаёт клиенту итоговые N элементов.

Весь каскад должен укладываться в 100 мс для интерактивных лент. Каждые дополнительные 100 мс задержки снижают выручку примерно на 1% (классическое наблюдение Amazon, которое до сих пор цитируют в литературе 2026 года), а на видеоплатформе влияние на старт сессии и время до первого воспроизведения ещё сильнее.

Главный фронтир в 2026 году — не сама модель, а обратная связь по восприятию. Команда Reels в Meta в 2025–2026 годах начала использовать данные масштабных пользовательских опросов как признаки наряду с неявными действиями — потому что чистые CTR-модели склоняются к кликбейту. YouTube Shorts перестроил ранжирующий алгоритм вокруг сигналов «удовлетворённости»: сохранения, репосты, процент досмотра. Ваша система должна это учитывать.

Срез рынка — что приносят рекомендации на самом деле

Netflix публично связывает с персонализацией около 75 млрд ₽ удержанной выручки в год и сообщает, что около 80% просмотренного контента пользователи находят через рекомендации, а не через поиск. YouTube Shorts обеспечивает около 70% времени просмотра именно за счёт рекомендательной ленты. TikTok считает свой алгоритм главным конкурентным преимуществом. Эти цифры задают масштаб обсуждения ROI, но напрямую на другие платформы не переносятся — зато переносится операционный эффект: первая полноценная выкатка обычно даёт прирост вовлечённости на 8–20% по сравнению с хронологическим или популярным порядком.

Структура расходов тоже хорошо описана. Managed-сервисы (AWS Personalize, Vertex AI Recommendations) стоят копейки за 1000 рекомендаций, но оплата за обучение и обработку событий делает месячный счёт непредсказуемым. Self-hosted стек требует значительных инженерных затрат на старте, но обходится копейками за рекомендацию в стабильном режиме. Точка безубыточности обычно приходится на 2–5 млн активных пользователей в месяц — точное значение зависит от частоты обновлений каталога.

Семейства алгоритмов в 2026 году

Классические базовые методы (всё ещё нужны)

Матричная факторизация и соседская коллаборативная фильтрация. Дёшево, понятно, хороший базовый уровень. Не пропускайте — это A/B-контроль, который покажет, действительно ли ваша глубокая модель приносит пользу. RecBole или implicit подойдут как открытые решения.

Контентные методы. Эмбеддинги по заголовку, описанию, превью и расшифровке (Whisper / Nova-3). Незаменимы при старте новых видео — должны быть в вашем ансамбле всегда.

Нейронный ретривал (по умолчанию в 2026 году)

Two-tower модели. Одна башня кодирует пользователя (его историю и контекст), вторая — элемент; обе выдают плотный вектор, а ретривал сводится к поиску ближайших соседей (ANN) по скалярному произведению. Так работают YouTube, Pinterest и большинство современных платформ. Реализация — TFRS, TorchRec или Merlin.

Transformer-модели последовательностей. TransAct (Pinterest, 2023), HSTU (Meta Generative Recommenders, 2024), Monolith (TikTok). Моделируют действия пользователя как последовательность — лучше, чем пулинговые эмбеддинги, передают свежесть и контекст. На Pinterest зафиксирован рост вовлечённости более чем на 11%; на платформах с короткими видео результаты сопоставимы.

LLM как рекомендательная система. P5, LLaRA, GenRec, RecGPT. Перспективное направление, но для массового использования пока не подходит из-за высокой задержки и стоимости. В 2026 году такие подходы уже применяются в диалоговом поиске контента («найди что-то похожее на X, но короче») и для генерации эмбеддингов при cold start — через анализ описаний с помощью LLM.

Онлайн-обучение и бандиты

Контекстные бандиты. Vowpal Wabbit, сэмплирование Томпсона. Критически важно для изучения новых элементов и персонализации превью — классический пример применения бандитов в Netflix. Используйте вместе с базовым рекомендательным алгоритмом, чтобы одновременно использовать уже известные данные и исследовать новые варианты в одном пайплайне.

Берите two-tower нейронный ретривер, если: каталог больше 100 тыс. элементов, медианная история пользователя — больше 20 событий, бюджет задержки — около 100 мс. Это стандарт 2026 года.

Берите transformer-модель последовательностей, если: у вас короткий формат или контент с сессионной структурой, время удержания меньше минуты, а в поведении доминируют сигналы свежести.

Берите гибрид классической CF и контентного подхода, если: каталог содержит менее 100 тыс. элементов, трафик — меньше 1 млн MAU, и вы хотите получить надёжную базовую модель, прежде чем вкладываться в инфраструктуру глубокого обучения.

Добавляйте бандитный слой сверху, если: ежедневно появляются новые элементы для cold-старта, нужно тестировать варианты превью или метаданных, либо есть регуляторные требования продемонстрировать, что петля обратной связи не зацикливается.

Стек 2026 года — feature store, векторная БД, обучение, сервинг

Feature store. Feast 0.10 (2026) для open-source с Redis или DynamoDB в онлайне и BigQuery/Snowflake в офлайне. Tecton — управляемое решение с гарантией SLA. Хорошо настроенный пайплайн на базе Feast и Redis обеспечивает p99 задержку менее миллисекунды при десятках миллионов запросов в секунду.

Векторная БД и ANN-ретривал. Pinecone — полностью управляемый сервис; Milvus — решение для самохостинга на масштабах миллиардов векторов; Faiss — библиотека, которую нужно оборачивать самостоятельно; Vertex AI Matching Engine — если вы работаете в GCP; pgvector — подходит для небольших продакшенов до 10 млн элементов. Основной критерий отбора — задержка p99, а не количество функций.

Обучение. Офлайн-обработка: Airflow или Prefect, Spark для агрегации фич. Онлайн/стриминг: Kafka + Flink. Обучение на GPU — через NVIDIA Merlin для полного пайплайна или на чистом TorchRec + DLRM для собственных архитектур.

Сервинг. Triton Inference Server (NVIDIA) — для запуска моделей на GPU в больших масштабах; TorchServe — для более простых моделей; CPU-скоринг — для обработки редких, но ресурсоёмких задач (например, градиентный бустинг или логистическая регрессия по ключевым признакам).

Наблюдаемость. Дрифт фич, дрифт модели, расхождение онлайн- и офлайн-метрик, покрытие, разнообразие. Prometheus + Grafana — для системных метрик; отдельный инструмент ML-наблюдаемости (Arize, Evidently, Fiddler) — для метрик модели.

Managed-сервисы или своя разработка

Вариант Что это Структура расходов Кому подходит На что обратить внимание
AWS Personalize Полностью управляемый рекомендатель ~4,5 ₽ за 1000 рекомендаций + обучение Ранняя стадия, < 1 млн MAU Непрозрачные модели, ограниченный тюнинг
Vertex AI Recs + Matching Managed two-tower + ANN По использованию и хранению Команды на GCP, мультирегиональный ANN Привязка к GCP
Algolia Recommend Поиск и рекомендации как сервис За запись/за запрос E-commerce, каталог < 10 млн Ограниченные возможности глубокого обучения
Pinecone + своя модель Managed ANN + ваш ретривер За под/за запрос Средний сегмент, собственная модель Эксплуатацию модели вы всё ещё ведёте сами
Self-hosted (Merlin + Milvus) Полностью свой стек GPU-хостинг + время инженеров > 5 млн MAU, суверенитет данных Высокая инженерная стоимость
Гибрид (наш выбор) Покупаем инфраструктуру, строим модель SaaS-инфраструктура + время инженеров Лучшее соотношение для 1–10 млн MAU Нужна команда, способная моделировать

Бюджет задержки — куда уходят 100 мс

1. Получение фич (~20 мс). Feast + Redis, Tecton или собственная реализация чтения из DynamoDB. На одну фичу уходит меньше миллисекунды; 20 фич на запрос — и остаётся запас времени. Главный риск — разветвление запросов (fan-out), поэтому читайте батчами везде, где это возможно.

2. Получение кандидатов (~30 мс). Поиск по эмбеддингам товаров с помощью ANN — Pinecone, Milvus, Faiss HNSW. У Pinecone задержка p99 составляет 20–40 мс при 10 млн векторов; у Milvus в self-hosted режиме при правильной настройке — примерно столько же. Цель — получить 200–500 кандидатов.

3. Скоринг (~30 мс). Ваша основная модель — two-tower скоринг, проход трансформера по набору кандидатов или градиентный бустинг. Triton на одной A100 спокойно обрабатывает 500 кандидатов на запрос за < 30 мс.

4. Реранкинг (~15 мс). Учитываются разнообразие (MMR), бизнес-правила (права, регионализация), эксплорация (бандит), а также переключение режима без профилирования по DSA, если он активирован. Обработка выполняется на CPU, время растёт линейно с числом кандидатов.

5. Сеть и сериализация (~5–10 мс). «Налог». Держите рекомендательный сервис в одном регионе с feature store и векторной БД, а также кэшируйте топ-K ответы для пользователя на 30–60 секунд.

P99 рекомендера выше 150 мс? Найдём те самые 50 мс, которые вы теряете.

Пришлите трейс пайплайна и сэмпл трафика — вернёмся с письменной диагностикой через 48 часов.

Позвоните нам → Напишите нам →

Cold-start — новые элементы, новые пользователи, новые аккаунты

Новые элементы. Эмбеддинги по заголовку, описанию, расшифровке (Whisper / Nova-3), превью (CLIP) и любым структурированным метаданным — жанру, длительности, языку. Добавляйте контентный ретривал к коллаборативным сигналам, как только начнут поступать данные о вовлечённости. На стабилизацию позиций в ранжировании закладывайте 1–3 дня.

Новые пользователи. Используйте сигналы регистрации (локаль, устройство, источник перехода), короткий онбординг-опрос или популярные настройки по умолчанию для своей группы. Отправляйте таких пользователей в бандитную ветку с акцентом на исследование на первые 10–20 действий — так вы быстро обучаетесь и не попадаете в замкнутый круг только популярного контента.

Новые аккаунты на масштабе (B2B). Для платформ с тенантами (edtech, корпоративное видео) начинайте с настроек по умолчанию на уровне тенанта, основанных на поведении первого администратора, и дообучайте модель отдельно для каждого тенанта, как только наберётся более 1000 взаимодействий.

Персонализация превью и остальной поверхности

Рекомендер — это не только «что включится дальше». Netflix не зря персонализирует ещё и превью: прирост CTR от удачного превью часто сопоставим с приростом от лучшего порядка элементов. В 2026 году каждый креативный вариант на поверхности — превью, надпись поверх, длина нарезки — стоит решать как задачу контекстных бандитов поверх базового ранкера.

Для длинного формата персонализируйте блоки «потому что вы смотрели X», названия жанров и анимацию трейлера-превью при наведении. Для короткого — продолжительность автоплей-очереди и плавность перехода между элементами. Даже небольшие изменения на поверхности дают реальный прирост удержания.

Комплаенс — DSA Article 38, AI Act, GDPR

DSA, статья 38. Очень крупные онлайн-платформы (VLOP) обязаны предлагать хотя бы один режим рекомендаций, не использующий персональное профилирование. На практике это может быть хронологическая или популярная лента, которую пользователь может включить одним кликом. Разместите переключатель в интерфейсе и подключите режим «без профилирования» к слою реранкинга — тогда весь существующий каскад рекомендаций продолжит обеспечивать разнообразие и соблюдение прав.

DSA, статья 27. Прозрачность. Вы обязаны простым языком объяснить «основные параметры» вашего рекомендера и дать пользователю возможность управлять ими, если такие настройки предусмотрены. «Мы ранжируем по сочетанию вашей истории просмотров, схожести с похожими пользователями и свежести контента» — правильная интонация.

EU AI Act. Рекомендательные системы в определённых сферах — например, при трудоустройстве, в образовании или для лент контента, предназначенных несовершеннолетним, — могут считаться высокорисковыми. Обязательно документируйте систему, ведите журнал управления рисками и обеспечьте возможность участия человека в удалении данных, пересчёте рекомендаций и обжаловании решений.

GDPR. Добавьте кнопку «Сбросить рекомендации» в один клик, которая очищает данные для профилирования. Обеспечьте обработку запросов пользователей — возможность выгрузить или удалить их эмбеддинги. Храните историю просмотров по обоснованному графику: обычно рекомендуется 24 месяца для активных пользователей и 12 — для неактивных.

Модель стоимости — сколько на самом деле стоит рекомендательная система на 1 млн MAU

Ориентировочные цифры для типичной видеоплатформы с 1 млн активных пользователей в месяц, 40 сессиями на пользователя в месяц и 10 вызовами рекомендательной системы на сессию (400 млн рекомендаций в месяц, 40 млрд оценок элементов в месяц).

Слой AWS Personalize Гибрид (Pinecone + кастом) Self-hosted (Merlin)
Feature store В составе 90 000 ₽/мес (Feast + Redis) 67 500 ₽/мес
Векторная БД и ретривал В составе 150 000 ₽/мес (Pinecone) 60 000 ₽/мес (Milvus)
Обучение и инференс ~1,8 млн ₽/мес @ 4,5 ₽/1k рекомендаций 300 000 ₽/мес (Triton + A100 spot) 225 000 ₽/мес
Приём событий 60 000 ₽/мес 37 500 ₽/мес (MSK) 22 500 ₽/мес
Наблюдаемость В составе 45 000 ₽/мес (Evidently) 30 000 ₽/мес
Итого в месяц ~1,8 млн ₽ ~620 000 ₽ ~405 000 ₽ + время инженеров

Гибридный путь обеспечивает лучшую юнит-экономику на большинстве среднерыночных платформ. Self-hosted выглядит дешевле на бумаге, но требует 1,5–2,5 FTE ML-инженеров на поддержку — и это переворачивает расчёты уже при объёме свыше 750 000 ₽ в месяц, если честно учесть зарплаты.

Мини-кейс — edtech-платформа, 12 недель разработки, +18% времени просмотра

Ситуация. Глобальная edtech-видеоплатформа с 2,1 млн активных пользователей в месяц работала на ленте по популярности; удержание через 30 дней составляло 34%, средняя продолжительность сессии — 11 минут. Команда хотела запустить рекомендательную систему до начала осеннего цикла регистраций.

План на 12 недель. Недели 1–2: аудит данных, согласование KPI (досматриваемость + удержание на 30-й день), определение периметра соответствия DSA. Недели 3–6: создание feature store на базе Feast и Redis, использование Pinecone для ANN-ретривала, разработка собственной two-tower модели, обученной на четырёх годах событийных данных. Недели 7–9: запуск пилота на 5% пользователей, ежедневный анализ A/B-тестов, настройка реранкинга с учётом разнообразия (курсы из разных дисциплин). Недели 10–12: полная раскатка на 100% пользователей с переключателем DSA «без профилирования» в интерфейсе, дашборды для мониторинга в продакшене.

Результат. Время просмотра выросло на 18% (99-й перцентиль задержки — 82 мс). Удержание через 30 дней увеличилось с 34% до 41%. Средняя длина сессии — с 11 до 14,5 минут. Переключатель DSA доступен с первого дня запуска в ЕС. Хотите такой же анализ для своей ленты? Позвоните или напишите нам.

Каркас принятия решения — выбор стека за пять вопросов

Вопрос 1. Какой у вас MAU? < 500 тыс. → managed (AWS Personalize или Algolia). 500 тыс.–5 млн → гибрид. > 5 млн → self-hosted начинает окупаться.

Вопрос 2. Короткий формат или длинный? Короткий → модели трансформеров для последовательностей и акцент на актуальность. Длинный → двухбашенный ретривал + более сложный реранкер + персонализация превью.

Вопрос 3. Насколько часто меняется каталог? Если каталог обновляется часто (например, live-трансляции или пользовательский контент) — используем онлайн-обучение и бандитские алгоритмы. Если каталог стабилен (например, видео по запросу или образовательные курсы) — переобучаем модель офлайн, раз в день или раз в неделю.

Вопрос 4. Регуляторный периметр? VLOP или потребительский продукт в ЕС → переключатель DSA «без профилирования» по статье 38 и прозрачность по статье 27 с первого дня. Корпоративный/B2B/небольшое присутствие в ЕС → обязательства проще.

Вопрос 5. Суверенитет данных? On-prem или жёсткая привязка к региону → self-hosted Milvus + Merlin. Иначе подходят Pinecone и Vertex.

Пять ловушек, которые губят запуск рекомендательных систем

1. Оптимизация по кликам вместо досматриваемости. Модели, ориентированные только на CTR, ведут к кликбейтам. Решение: обучайте модель на комбинации досматриваемости, времени просмотра и сигналов удовлетворённости из опросов, подбирая веса в соответствии с вашей продуктовой стратегией.

2. Нет A/B-каркаса. Вы внедряете «новую модель» и не можете доказать, что она работает. Решение: каждое изменение проводите через эксперимент с заранее определёнными метриками; закладывайте это до запуска, а не потом.

3. Офлайн выигрывает, онлайн проваливается. NDCG отличный, а DAU не растёт. Решение: привязывайте каждую офлайн-метрику к конкретному онлайн-росту и отбрасывайте офлайн-успехи, которые не влияют на KPI в shadow-режиме.

4. Дрифт фич, который никто не замечает. Обучающие данные берутся из распределения, которое уже не соответствует реальному трафику. Решение: внедрять ML-наблюдаемость с самого начала; настраивать оповещения о дрейфе; переобучать модель по графику, который соответствует объёму активности пользователей.

5. Нет переключателя DSA «без профилирования». Регулятор ЕС проверяет, есть ли у пользователей возможность отказаться от профилирования одним кликом — а у вас такой опции нет. Решение: добавьте переключатель в интерфейс, передайте его состояние в реранкер и фиксируйте выбор пользователя, чтобы при проверке со стороны регулятора можно было быстро предоставить подтверждение.

KPI — что измерять с первого дня

Качество. Доля досмотров (цель — рост на 5–10 пунктов относительно базового уровня), длительность сессии (+10–20%), CTR на топ-10 позиции ленты (отслеживать, но не максимизировать) и охват (не менее 70% каталога должно показываться за 30 дней).

Бизнес. D7/D30-удержание по сравнению с контрольной группой, рост подписок и регистраций, выручка на пользователя в рекламной модели, использование каталога (доля просмотров длинного хвоста). Эти показатели реально важны для топ-менеджмента.

Надёжность. P50 рекомендера (≤ 60 мс) и p95 (≤ 100 мс), recall@K ANN на офлайн-эвалюации (≥ 0,9), процент успешных запусков обучающего пайплайна, число алертов о дрифте фич в неделю. Эти показатели могут разбудить вас среди ночи.

Отрасли, где рекомендательные системы приносят реальную пользу в 2026 году

OTT/SVOD. Классический пример — Netflix, Disney+, Max, Prime Video. Главная цель — максимизировать время просмотра. В ЕС обязательны требования DSA, персонализация превью — необходима.

Короткий формат UGC. TikTok, YouTube Shorts, Instagram Reels. Модели Transformer для анализа последовательностей, активное исследование новых данных, ежедневный старт с нуля для новых элементов.

Edtech-видео и LMS. Рекомендации курсов, персонализация по группам, целевая метрика — досматриваемость. Регуляторная нагрузка ниже, требования к настройке на уровне тенанта — выше.

Live-коммерция и видеошопинг в реальном времени. Рекомендации в рамках одной сессии, очень быстрая настройка для новых пользователей, ограничения по правам в разных регионах. По умолчанию — гибридный стек с бандитным реранкингом.

Корпоративное видео. Учебные библиотеки, внутренние совещания, контент для адаптации новых сотрудников. Качество рекомендательной системы здесь менее важно, чем контроль доступа и поиск; управляемые сервисы (например, Algolia Recommend) отлично подходят для таких задач.

Новостное видео. Учёт актуальности, контроль разнообразия, соответствие GDPR и DSA. Гибридный подход на основе контентного анализа и коллаборативной фильтрации с надёжным резервным режимом «без профилирования».

Строить, покупать или гибрид

Полностью управляемые (AWS Personalize, Vertex AI Recommendations, Algolia Recommend) — если у вас менее 1 млн активных пользователей в месяц, каталог содержит меньше 1 млн элементов, нет собственной команды машинного обучения и вы готовы использовать непрозрачную модель. Это самый быстрый способ получить базовый прирост на 10–15%.

Гибрид (инфраструктуру покупаете, модель строите) — если у вас 1–10 млн MAU, нужен контроль над ранжированием, но не хочется самим поддерживать feature store и векторную базу данных. Используйте Feast + Pinecone или Tecton + Vertex Matching Engine и реализуйте two-tower ретривал с реранкером на градиентном бустинге.

Полностью своя разработка — если у вас больше 10 млн MAU, есть требования к суверенитету данных или on-prem, нужна transformer-модель для последовательностей (короткий формат на масштабе) или рекомендательная система — ваше ключевое конкурентное преимущество (продукт уровня TikTok). Merlin + Milvus + TorchRec + Feast в self-hosted.

Когда не стоит строить рекомендательную систему

Не стройте рекомендательную систему, если в каталоге меньше 5000 элементов — поиск и подборка от редакторов при том же бюджете, скорее всего, принесут больше пользы. Рекомендеры хорошо работают на больших и разнообразных каталогах; в маленьком просто нет длинного хвоста, который можно было бы эффективно использовать.

Не стройте, если не умеете измерять. Если ваш аналитический пайплайн не может точно определить, сколько времени пользователь провёл на каждом элементе ленты, рекомендательная система будет работать вслепую. Наблюдаемость и атрибуция — важнее моделей.

Не создавайте решения под регулируемый контент (детские ленты, образование для несовершеннолетних, политические новости) без предварительного комплаенс-ревью. EU AI Act относит часть таких сценариев к высокому риску, и наивная выкатка может быстро привлечь внимание регулятора.

Планируете запустить видеорекомендер для платформы в ЕС?

Фора Софт разрабатывает рекомендательные стеки с соблюдением DSA с момента вступления правил в силу в 2024 году. Один созвон — и периметр, стек и план на 12 недель готовы.

Позвоните нам → Напишите нам →

Сценарий выкатки на 12 недель

Недели 1–2. Аудит данных, согласование KPI, определение границ соответствия DSA и AI Act. Выбор стека (управляемый, гибридный или self-hosted). Подписание DPA, настройка контрактов на приём событий.

Недели 3–5. Запущен feature store и векторная база данных, создан стартовый baseline для two-tower ретривера. Выполнен исторический бэкфил; построен офлайн-кадр оценки.

Недели 6–8. 5–10% в shadow/пилоте с полной наблюдаемостью. Итерации по правилам ранжирования (разнообразие, свежесть, права). Подключение переключателя «без профилирования».

Недели 9–11. Масштабирование до 50%, добавление персонализации превью, первая «сухая» проверка комплаенса (текст прозрачности по DSA, процесс сброса данных по GDPR).

Неделя 12. Раскатка на 100%, KPI-дашборды подключены к управленческому ревью, еженедельная калибровка, разбор пилота, дорожная карта на следующие две задачи (например, ранжирование поиска и переупорядочивание главной строки).

FAQ

Что такое AI-система рекомендаций контента?

Трёхступенчатый пайплайн — подбор кандидатов, оценка машинным алгоритмом и финальная сортировка по бизнес-правилам — определяет, что показывать каждому пользователю на каждой поверхности (лента, строка, превью). В 2026 году стандартная архитектура — двухбашенный нейронный ретривер плюс трансформер для оценки последовательностей, выдающий результат быстрее 100 мс от начала до конца.

Что выбрать: AWS Personalize, Vertex AI или собственную разработку?

AWS Personalize и Vertex AI Recommendations — самый быстрый способ получить прирост конверсии на 10–15% для команд с аудиторией до 1 млн активных пользователей в месяц. При масштабе выше лучшую экономичность даёт гибридный подход: feature store на базе Feast, векторная база данных Pinecone или Vertex Matching Engine, собственная two-tower модель ретривала и реранкер на градиентном бустинге. Полностью самостийное решение (Merlin + Milvus) окупается только при аудитории свыше 10 млн MAU или при жёстких требованиях к суверенитету данных.

Сколько в месяц стоит рекомендер на 1 млн MAU?

Примерно 1,8 млн ₽ в месяц на AWS Personalize (400 млн рекомендаций по 4,5 ₽ за 1000, плюс обучение и приём событий), 600–675 тыс. ₽ — на гибридный стек (Feast + Pinecone + своя модель на Triton), и 375–450 тыс. ₽ — в self-hosted на Merlin + Milvus — плюс 1,5–2,5 FTE ML-инженеров для последнего варианта.

Как обеспечить соответствие статье 38 DSA?

Предложите как минимум один режим рекомендаций без профилирования — обычно это хронологический или по популярности — и сделайте его доступным в один клик. Переключатель подключите к слою реранкинга; при этом сохраняйте разнообразие и логику прав в любом случае. Логируйте выбранный пользователем режим, чтобы аудит регулятора проходил в одно действие.

С какого алгоритма начать?

Two-tower нейронный ретривер — стандарт 2026 года для видео среднего и длинного формата. Для коротких видео с сессионной структурой добавьте сверху модель трансформера для последовательностей. Всегда используйте классическую коллаборативную фильтрацию как контроль в A/B-тестах. Контекстный бандит сверху — для исследования и персонализации превью.

Как обрабатывать cold-старт?

Для новых элементов вычисляйте эмбеддинги по заголовку, описанию, расшифровке и визуальным признакам (CLIP), а затем постепенно добавляйте сигналы вовлечённости по мере их накопления. Для новых пользователей используйте данные из онбординг-опроса, значения по умолчанию для когорты и ранжирование с акцентом на исследование в первые 10–20 взаимодействий. Предусмотрите 1–3 дня на то, чтобы новые элементы заняли стабильные позиции в ранжировании.

Сколько занимает разработка рекомендера?

Managed-baseline (AWS Personalize) можно вывести в продакшен за 4–6 недель. Гибрид two-tower + реранкер обычно занимает 10–12 недель — от анализа данных до полной раскатки. Self-hosted transformer-модель последовательностей на масштабе — это первая итерация на 5–8 месяцев, далее итерации идут гораздо быстрее.

Какая задержка приемлема?

Целевые значения — p50 ≤ 60 мс и p95 ≤ 100 мс end-to-end (ретривал + скоринг + реранкинг). Задержка свыше 150–200 мс заметно снижает вовлечённость. Размещайте рекомендательный сервис, feature store и векторную БД в одном регионе; кэшируйте топ-K ответов для пользователя на 30–60 секунд.

AI Video

Разработка приложений для видеостриминга с AI в 2026 году

Протоколы, кодеки и рекомендательные системы — всё в одном подробном руководстве.

AI Video

Интеграция AI-чатботов с видео: гайд 2026

Интерактивные аватары от Tavus и HeyGen — задержка менее 600 мс.

Voice AI

AI-ассистенты звонков: справочник покупателя 2026

Vapi, Retell, OpenAI Realtime и границы соответствия требованиям.

Услуги

Услуги AI-разработки

Как Фора Софт строит продакшен ML-системы под ключ.

Готовы запустить рекомендательную систему, которая реально повышает удержание?

Стек рекомендера 2026 года хорошо изучен: two-tower ретривал, скорер на transformer или градиентном бустинге и реранкер на бизнес-правилах, отдающий результат за менее чем 100 мс из feature store и векторной БД. По сути, остаются решения о масштабе MAU, формате контента, регуляторном периметре и о том, что для вашего бизнеса важнее — скорость выхода на рынок или юнит-экономика.

Если в этом квартале вы внедряете управляемую baseline — используйте AWS Personalize или Vertex AI Recommendations, настройте приём событий и запустите пилот на 5% аудитории с заранее определённой метрикой. Если у вас более 1 млн активных пользователей в месяц — выбирайте гибридный подход: Feast + Pinecone + two-tower модель, обученная на ваших данных, с A/B-тестированием и системой мониторинга с первого дня. Если вы работаете на уровне VLOP или сталкиваетесь с жёсткими требованиями к суверенитету данных — планируйте шестимесячную реализацию self-hosted решения на базе Merlin и Milvus.

Так или иначе, Фора Софт уже запускала ту схему, которую вы планируете строить. Принесите свои KPI, форму каталога и границы комплаенса — мы вернёмся с шорт-листом стеков, моделью стоимости и планом поставки на 12 недель.

Спроектируем ваш рекомендательный сервис с нуля и до конца.

30 минут с нашим тимлидом по ML-инжинирингу: стек, комплаенс, модель стоимости и план поставок на 12 недель.

Позвоните нам → Напишите нам →

  • Технологии