Franchise Record Pool: AI-библиотека треков и Shazam для диджеев (гайд по разработке, 2026) — обложка

Главное

FRP — это лицензированная библиотека из 720 000 треков для профессиональных диджеев — с функцией распознавания музыки, как у Shazam, голосовым ИИ для создания плейлистов, данными о BPM и тональности, а также синхронизацией с Serato. Всё это — в одной платформе, которую мы запустили на frp.live.

Аудиоотпечатки (audio fingerprinting) заменяют просьбу «зашазамь мне этот трек». Хэш в виде «созвездия» пиков спектрограммы за 5–10 секунд сопоставляет фрагмент живого сета с каталогом меньше чем за секунду — даже поверх шума толпы.

Голосовой ИИ-ассистент превращает обычную речь в плейлисты. Фраза «дай мне итальянскую поп-музыку 90-х на 140 BPM» обрабатывается через Whisper (0,45 ₽/мин), GPT-4o для фильтрации и Amazon Polly для голосового ответа — весь процесс занимает меньше двух секунд.

Бюджет на разработку в 2026 году скромнее, чем кажется. При подходе с использованием агентов платформа уровня FRP (веб + десктоп на Electron + iOS/Android + распознавание + голосовой ИИ) укладывается в средний шестизначный диапазон в долларах (около 30–45 млн ₽), а не в семизначный.

Сложнее всего — лицензирование и синхронизация с Serato, а не программный код. Контракты с Sony, Universal и Virgin, а также отсутствие официального SDK у Serato — именно это убивает большинство проектов диджейских пулов ещё до запуска. Мы разбираем обе проблемы.

Почему Фора Софт написала этот гайд

Фора Софт выпускает продукты для аудио и видео в реальном времени с 2005 года — более 625 готовых решений, 21 год опыта и 100% успешных проектов из тех, что мы берём в работу. Franchise Record Pool — один из аудиопроектов, которыми мы особенно гордимся. Именно потому что почти каждая его подсистема — это то, что заказчику обычно говорят: «без большой команды такое не построить».

Мы выпустили всё семейство продуктов FRP — веб-консоль, десктопное приложение на Electron, нативные клиенты для iOS и Android, движок распознавания по аудиоотпечаткам, голосового ассистента на базе LLM и синхронизацию с Serato — для живого каталога из 720 000 лицензированных треков от Sony, Universal и Virgin. Эта статья — тот самый гайд, который мы хотели бы вручить каждому основателю music-tech-стартапа ещё до того, как он напишет своё первое техзадание. Читайте её как рабочую оценку того, что нужно, чтобы выпустить современную диджейскую платформу, а не как маркетинговый текст.

Если вы решаете, строить ли музыкальную библиотеку с нуля или использовать готовое решение, переходите сразу к разделам обзор рынка диджейских пулов и модель затрат. Если оцениваете объём разработки, то эталонная архитектура и подводные камни — это те места, где реально экономят деньги.

Строите диджейский пул или продукт для распознавания музыки?

30 минут с нашей командой по аудиостримингу — этого достаточно, чтобы проверить на прочность ваш объём работ, путь к лицензированию и модель затрат ещё до выбора подрядчика.

Позвоните нам → Напишите нам →

Бриф FRP в одном абзаце

Franchise Record Pool — это подписочная платформа для профессиональных диджеев. Один аккаунт даёт сразу три вещи: лицензированный каталог из 720 000 треков, где для каждого указаны BPM, тональность, ремиксы и информация об источнике; движок распознавания — «Shazam для диджеев», который подсказывает, какой трек только что сыграл другой диджей, и автоматически добавляет его в вашу подборку; и голосовой ИИ-ассистент, который создаёт тематические плейлисты по одной фразе. На основе этих трёх функций работают веб-интерфейс, десктопное приложение на Electron, мобильные клиенты на React Native для iOS и Android, синхронизация с Serato и WebRTC-связь для аудиообмена между диджеем и фанатами.

FRP — это не копия Spotify. Это рабочий инструмент для тех, кто выступает четыре часа подряд, и это влияет на каждое решение в продукте: от скорости загрузки волновой формы до того, как поиск ранжирует версии Clean и Dirty.

Выбирайте кастомную диджейскую платформу, когда: в вашем каталоге больше 250 тысяч треков, диджеям нужны метаданные для гармоничного сведения или у вас есть лицензионные соглашения, которые white-label-решения вроде BPM Supreme или DJcity не могут поддерживать.

Что профессиональным диджеям на самом деле нужно от трек-пула

Прежде чем создавать FRP, мы наблюдали за работой диджеев в клубах, на свадьбах, радиорезиденциях и корпоративных мероприятиях. Бриф, который получился в результате этого исследования, — тот же, что должен лежать в основе любого продукта для диджейского пула, и он гораздо шире, чем ожидают большинство основателей.

1. Clean и Dirty — быстро. Работающему диджею нужно одним касанием переключаться между explicit-версией и radio-редакцией одного и того же трека. Поиск, который прячет «Clean» за тремя фильтрами, теряет пользователей уже через неделю.

2. BPM и тональность в каждой строке. Гармоничное сведение работает по колесу Камелот (12 тональностей × мажор/минор = 24 ячейки). Если данные о тональности отсутствуют или ошибочны у более чем 2% треков, диджеи сразу это замечают на первом же выступлении и меняют провайдера.

3. Ремиксы в той же панели, что и оригинал. Редактированные версии, redrum-версии, треки с интро/аутро и акапеллы должны быть доступны одним кликом от исходного трека — с указанием автора ремикса, разницы в BPM и длительности.

4. Распознавание «что они поставили?». Диджеи следят друг за другом. Они записывают фрагмент на телефон, открывают ваше приложение и ждут, что трек определится за секунду — а потом добавляют его в свою подборку одним касанием.

5. Синхронизация с их диджейским ПО. Если музыка не попадает в Serato, rekordbox или Traktor, платформа становится просто брошюрой «только для чтения». Именно эта возможность отличает диджейские пулы от любого другого музыкального сервиса.

6. Надёжная работа офлайн на площадках. WiFi в клубах ужасен. Десктопные и мобильные клиенты должны кэшировать очереди загрузок, возобновлять их после переподключения и не падать без предупреждения при обрыве передачи.

Внутри платформы FRP — функции, которые важны

FRP несёт плотный набор функций. Те, что ниже, — это то, за что мы бы боролись, оставляя их даже в более скромном MVP, если бы бюджет урезали вдвое.

Лицензированный каталог из 720 000 треков с полными метаданными

Каждый трек в FRP лицензирован у крупных лейблов (Sony Music, Universal, Virgin Records) и независимых дистрибьюторов. В каждой строке указаны тональность, BPM, жанр, поджанр, дата релиза, семейство ремиксов или эдитов и короткая превью-волна. Ни один другой диджейский пул из нашего исследования не отображает всю эту информацию в одной строке.

Распознавание музыки («Shazam для диджеев»)

Загрузите или запишите аудио длительностью 5–10 секунд — и FRP подберёт подходящий трек с оценкой уверенности. Также сервис найдёт ближайшие ремиксы из каталога FRP — именно эта функция превращает распознавание из «забавного демо» в «добавляет треки в мою подборку».

Голосовой ИИ-сборщик плейлистов

Одна кнопка микрофона запускает диалог. «Собери плейлист с итальянской поп-музыкой из 90-х, около 140 BPM, без explicit». Ассистент подтверждает, создаёт плейлист и озвучивает название и первые пять треков.

Нативная синхронизация библиотеки с Serato

Треки, скачанные из FRP, появляются в Serato с сохранёнными метаданными FRP — без повторной разметки, без повторного импорта, без ручного управления папками. Это первая функция, которую профессионалы проверяют перед оформлением подписки.

Веб и десктоп на Electron, мобильные приложения на React Native

Одна общая кодовая база, три интерфейса. Десктопное приложение на Electron — там, где основная работа с библиотекой; мобильное приложение — то, что используют в диджейской будке или на улице, чтобы быстро найти трек; веб-приложение — для биллинга и администрирования.

Канал связи с фанатами (только в мобильном приложении)

В мобильном приложении диджеи могут отправлять короткие аудиосообщения и превью подписчикам через канал на базе WebRTC. Именно эта функция удерживает приложение на главном экране в перерывах между выступлениями.

Движок распознавания музыки — как работает «Shazam для диджеев»

Современное распознавание музыки использует алгоритм «созвездий» (constellation algorithm): берётся короткий фрагмент, вычисляется его спектрограмма, находятся пиковые точки по осям «время — частота», пары этих пиков хэшируются, а полученные хэши сравниваются с заранее подготовленной базой хэшей, рассчитанных для каждого трека в каталоге. Эйвери Ванг впервые подробно описал этот метод на конференции ISMIR в 2003 году; с тех пор все системы вроде Shazam строятся на его основе.

Движок справляется с фоновым шумом, потому что игнорирует амплитуду и анализирует только паттерн пиков — те пики, что остаются после шума толпы, звона бокалов и плохого звука, всё ещё совпадают с пиками оригинального трека. Для базы из нескольких миллионов треков достаточно 5-секундного фрагмента.

Построить, лицензировать или гибрид — три реалистичных пути

1. Сделать своё. Dejavu (open-source на Python), audfprint (Дэн Эллис, Колумбийский университет) или конвейер на Chromaprint/AcoustID. Бесплатно по лицензии, но вы сами платите за вычисления отпечатков (GPU-часы) и хостинг базы хэшей. Подходит для каталогов до ~500 тыс. треков при наличии собственной команды по машинному обучению.

2. Коммерческий API. ACRCloud, AudibleMagic или Gracenote. Оплата — либо за каждое распознавание, либо по фиксированному enterprise-тарифу. Быстрее запустить; стоимость растёт пропорционально нагрузке; вы зависите от их стабильности работы.

3. Гибрид. Используйте open-source-фингерпринтер для треков из своего каталога, а для тех, что вне каталога, переключайтесь на коммерческий API. Именно так работает FRP — это заметно дешевле в масштабах и позволяет держать задержку распознавания в заданных пределах.

Выбирайте гибридное распознавание, когда: ваш каталог насчитывает более 150 тыс. треков и вы ожидаете более 10 тыс. вызовов распознавания в день — при таких объёмах юнит-экономика делает гибридное решение выгоднее чисто коммерческого API.

Голосовой ИИ-ассистент для тематических плейлистов

Голосовой ассистент FRP намеренно узкий. Он делает одну вещь хорошо: превращает произнесённый бриф в запрос к каталогу, а затем в плейлист. У конвейера четыре подвижные части.

1. Whisper расшифровывает речь. OpenAI Whisper стоит 0,45 ₽ за минуту, работает с аудио в браузере с частотой 16 кГц. Язык определяется автоматически — в нашей аудитории диджеи говорят на четырёх-пяти языках, и Whisper отлично справляется с переключением между ними.

2. GPT-4o извлекает фильтр. Системный промпт требует от модели вернуть строгий JSON-объект: массив жанров, диапазон BPM, набор тональностей, временной диапазон, флаг explicit, настроение и язык. В поисковую систему отправляется только JSON — мы никогда не даём LLM генерировать SQL напрямую.

3. Поиск по каталогу выполняется детерминированно. JSON-фильтр попадает в наш собственный индекс метаданных (MongoDB + денормализованная поисковая проекция). LLM никогда не видит каталог; каталог никогда не видит LLM.

4. Amazon Polly зачитывает результат. Короткое подтверждение («Собрал сет из 23 треков итальянской поп-музыки со средним темпом 138 BPM») проигрывается естественным голосом. Polly Neural стоит 1 200 ₽ за миллион символов — погрешность округления при расчёте на сессию.

Эта архитектура исключает галлюцинации: модель не может придумать трек, потому что вообще не обращается к библиотеке. Тот же подход мы разбираем в нашем гайде по ИИ-ассистентам для звонков и в сравнении библиотек синтетического голоса.

// System prompt used by FRP (abbreviated)
You are a DJ-assistant router. Return ONLY a JSON object:
{
  "genre": string[],
  "subgenre": string[],
  "bpm_min": number, "bpm_max": number,
  "key_set": string[],              // Camelot notation
  "year_min": number, "year_max": number,
  "explicit_ok": boolean,
  "language": string[],
  "mood": string[]
}
No prose. No track names. No commentary.
If the user is ambiguous, default the bpm range to +/-3 around
the implied style (e.g. "house" -> 120..128).

BPM, тональность и обогащение метаданных

Метаданные лейблов часто бывают неполными, противоречивыми и содержат ошибки. На уровне FRP приходится переанализировать аудио самостоятельно. Мы используем Essentia (библиотеку MTG из Барселоны) для определения BPM, тональности и настроения — она бесплатна, с открытым исходным кодом и при сравнении с Mixed In Key показывает совпадение около 99% на стандартных тестовых наборах MIREX.

Essentia извлекает более 200 аудиодескрипторов на трек — мы храним около 15 из них (BPM, уверенность, тональность по Камелот, энергичность, танцевальность, громкость, спектральная сложность и короткий набор тегов настроения). Анализ запускается один раз при загрузке трека на недорогих CPU-воркерах; четырёхминутный трек обрабатывается за ~12 секунд на скромной виртуальной машине. Для каталога из 720 тыс. треков это примерно 2 400 воркер-часов, распределённых на несколько лет.

Интеграция с Serato, rekordbox и Traktor

Ни один из трёх крупных разработчиков диджейского ПО не предоставляет официальный SDK. Интеграция осуществляется через запись в форматы, которые они поддерживают:

1. Serato хранит подборки как бинарные файлы .crate в папке ~/Music/_Serato_/Subcrates. Точки cue и метки битгрида сохраняются в фреймах ID3 GEOB внутри самих аудиофайлов. Десктопное приложение FRP записывает и то, и другое целиком и сразу при загрузке трека.

2. rekordbox (Pioneer) использует XML-файл библиотеки (rekordbox.xml) и базу данных SQLite в новых версиях. Доступ через XML по-прежнему остаётся надёжным способом для сторонних программ записи.

3. Traktor (Native Instruments) использует коллекционный XML (collection.nml), который сторонние инструменты вроде Lexicon и DJ Conversion Utility уже умеют надёжно обрабатывать.

Серьёзный диджейский пул выпускает сначала синхронизацию с Serato, затем с rekordbox, затем с Traktor. Это порядок долей рынка среди профессиональных диджеев в 2026 году.

Эталонная архитектура (веб, десктоп, мобайл)

FRP построен на понятной четырёхслойной архитектуре, которую мы рекомендуем использовать для любого диджейского продукта с лицензированным каталогом. Границы слоёв можно адаптировать, но не саму структуру.

Слой Зона ответственности Технологии в FRP Что ломается, если сделать неправильно
Клиенты UI библиотеки, очередь загрузок, захват для распознавания, голосовые намерения, запись в Serato React (веб), Electron (десктоп), React Native (iOS/Android) Разные наборы функций на платформах → рассинхрон
Граница API Аутентификация, поиск, права доступа, подписанные URL для загрузки, биллинг Node.js + Express, JWT, Stripe Утечка загрузок = потеря лицензионной сделки
Сервисы Аудиоотпечатки, обогащение метаданных, маршрутизация намерений через LLM, генератор плейлистов Python-воркеры, Essentia, Whisper, GPT-4o, Polly Медленные конвейеры мешают выпускать новые релизы
Данные Метаданные треков, библиотека пользователя, права доступа, аналитика MongoDB (гибкие метаданные), MySQL (транзакции) Задержка поиска более 300 мс убивает UX
Медиа Мастер-файлы, транскодинг, превью, отпечатки S3-совместимое объектное хранилище + мульти-CDN, превью по WebRTC Плохая гео-привязка CDN → зависание загрузок перед выступлением

WebRTC передаёт аудио между диджеем и фанатами и обеспечивает превью с минимальной задержкой, потому что другие технологии слишком медленные. WebRTC держит задержку «от стекла до стекла» на уровне 200–500 мс. RTMP — около 3–5 секунд. Обычный HLS — 10–30 секунд. Для диджея, который работает в реальном времени, только WebRTC воспринимается как «мгновенный» ответ. Подробнее о таком выборе мы рассказываем в нашем гайде про альтернативу Agora.io.

Хотите второе мнение по вашей аудиоархитектуре?

Мы вместе разберём размер каталога, объём распознавания и требования к синхронизации с ПО — и подскажем, где скрываются реальные затраты и риски, ещё до подписания договора.

Позвоните нам → Напишите нам →

Обзор рынка диджейских пулов — FRP против BPM Supreme, DJcity и Beatport

Если вы сравниваете кастомную разработку с лицензированной подпиской, важно понимать, что предлагают основные игроки рынка. Матрица ниже — наш актуальный обзор по состоянию на апрель 2026 года; перед публикацией цен внутри компании уточните данные у вендора.

Пул Размер каталога В месяц (₽) Распознавание Голосовой ИИ-поиск Синхронизация с Serato
FRP ~720 тыс. лицензированных Pro-тариф Да (в приложении) Да (Whisper + GPT-4o) Да
BPM Supreme ~500 тыс. ~1 400–2 600 ₽ Нет Нет Да
DJcity ~300 тыс. ~2 200 ₽ Нет Нет Да
Beatport LINK ~10 млн (только стриминг) ~1 100–2 900 ₽ Нет Нет Частично (только в приложении)
ZipDJ ~200 тыс. ~1 800 ₽ Нет Нет Частично

Две ключевые ячейки для позиционирования FRP — «распознавание в приложении» и «голосовой ИИ-поиск». У всех игроков рынка они пока пусты — именно поэтому здесь оправдана кастомная разработка.

Лицензирование 720 000 треков — юридический слой

Разработка — это лёгкая часть диджейского пула. Сложнее — договориться о правах на каталог. Каждому треку нужны две лицензии: на мастер-запись (от лейбла — Sony, Universal, Warner, Virgin, BMG и независимых дистрибьюторов) и на композицию (от издателей — через механические права или от общества по коллективному управлению правами). Диджейские пулы обычно заключают с лейблами фиксированную ежемесячную лицензию на промо-использование, рассчитанную на одного пользователя, с отчётностью по количеству загрузок.

Две практические вещи, которые стоит заложить заранее: окна удаления контента в стиле DMCA (лейблы периодически снимают отдельные треки) и водяные знаки (некоторые лейблы требуют промо-DRM, чтобы треки нельзя было перепродать). Обе функции нужно предусмотреть на уровне архитектуры с самого начала — добавить их потом превратится в восьминедельный аврал.

Выбирайте кастомный пул только если: у вас есть хотя бы одно серьёзное соглашение с крупным лейблом и реалистичные процессы отчётности и нанесения водяных знаков. В противном случае white-label поверх существующего каталога будет быстрее и дешевле.

Хранилище, CDN и масштаб каталога

Для каталога из 720 тыс. треков в формате FLAC-мастеров, а также транскодов MP3-320 и MP3-128, потребуется примерно 20–28 ТБ объектного хранилища. В 2026 году это небольшая цифра; основная нагрузка ложится на исходящий трафик, а не на хранение.

Мульти-CDN-подход (Cloudflare плюс региональный резервный вариант или AWS CloudFront плюс Fastly) — это способ поддерживать стабильную скорость загрузки во всех регионах. Spotify публично сообщал о снижении исходящего трафика примерно на 35% после перехода на Opus и мульти-CDN — аналогичная арифметика работает на любом серьёзном масштабе каталога. Предварительно подписанные URL с коротким TTL и возобновление по байтовым диапазонам решают проблему «отвалился WiFi в клубе» без необходимости писать кастомный клиентский код.

Что касается хранения отпечатков, сами индексированные хэши занимают мало места — около 1–2 КБ на трек. Индекс для 1 млн треков легко помещается на одной машине с большим объёмом RAM. Именно в этой части системы чаще всего возникают излишние усложнения.

Стек, который мы выбрали (и почему)

Точный стек для FRP — и объяснение, почему каждый его элемент находится именно здесь, а не заменяется на правдоподобную альтернативу.

  • React + TypeScript для всего клиентского интерфейса. Одна библиотека компонентов, три поверхности. Выбраны вместо Svelte и Vue, потому что глубина рынка труда важна, когда у вас три клиента одновременно.
  • Electron для десктопного приложения. Синхронизация с Serato, локальный кэш и офлайн-очередь загрузок требуют доступа к файловой системе, которого браузер предоставить не может.
  • React Native для iOS и Android. Мы используем около 70% логики React-компонентов с веб-версии повторно; нативные модули отвечают за захват аудио и мобильные экспорты, как в Serato.
  • Node.js + Express для API-шлюза. Легко найти разработчиков, хорошо справляется с нагрузкой, в основном состоящей из операций CRUD и поиска.
  • Python-воркеры для машинного обучения и анализа аудио. Здесь работают Essentia, клиент Whisper и индекс аудиоотпечатков.
  • MongoDB для хранения метаданных (схема постоянно меняется, когда лейблы добавляют новые поля). MySQL для транзакционных данных — подписок, прав доступа и биллинга.
  • WebRTC для аудиосвязи между диджеем и фанатами и для превью. Задержка меньше 500 мс, без дополнительных плагинов.
  • OpenAI Whisper + GPT-4o + Amazon Polly для голосового ассистента. Почему именно эти инструменты — объяснили в статье «7 лучших ИИ-решений для аудиоприложений».

Модель затрат для похожей платформы

Ориентировочные диапазоны на 2026 год для продукта уровня FRP — без учёта лицензирования каталога и отчётности перед лейблами. Это оценки Фора Софт по методу Agent-Engineered, который работает быстрее и точнее, чем классические аутсорсинговые подходы; сверяйтесь со своим вендором, а не делайте экстраполяции самостоятельно.

Объём Поверхности ИИ-функции Сроки Диапазон бюджета
Минимальный MVP Только веб + iOS Распознавание (через коммерческий API) 4–5 месяцев 7–15 млн ₽
Полный запуск Веб + Electron + iOS + Android Распознавание и голосовые плейлисты 8–10 месяцев 30–45 млн ₽
Аналог FRP Все четыре + синхронизация с Serato, rekordbox и Traktor + канал для фанатов Гибридное распознавание + голос + гармоничные рекомендации 10–14 месяцев 50–67 млн ₽

Текущие эксплуатационные расходы после разработки: закладывайте примерно 2–4% выручки от подписок на ИИ-API (Whisper — 0,45 ₽ за минуту, GPT-4o — по текущему тарифу, Polly — 1 200 ₽ за миллион символов) плюс исходящий трафик CDN, который растёт с количеством загрузок. По части ИИ-API у нас есть полноценный материал: «6 лучших библиотек синтетического голоса для разработки приложений».

Подводные камни, которые мы уже прошли за вас

1. Воспринимать распознавание как ML-проект, а не как проект про индексацию. Команды тратят месяцы на обучение всё более сложных фингерпринтеров. При этом выигрыш почти всегда связан с индексом — кардинальностью, распределением хэшей и скоростью шардирования поиска. Начните с простой схемы хэширования и измеряйте результаты.

2. Пускать LLM напрямую к базе данных. Как только модель начинает генерировать поисковый запрос, она начинает выдумывать треки. Маршрутизируйте через строгий JSON и детерминированный поиск; LLM — это парсер, а не извлекатель данных.

3. Игнорировать Serato с первого дня. Интеграция с Serato после запуска — это аврал на шесть-восемь недель без какой-либо пользы для пользователя. Пишите в папку Serato с самого первого релиза.

4. Доверять метаданным лейблов. BPM отсутствует примерно в 30% фидов лейблов, тональность — в 60%, а настроение — почти во всех. При загрузке файлы нужно переанализировать.

5. Откладывать DRM «на потом». Если один из ваших контрактов с лейблами требует промо-водяных знаков, конвейер загрузки должен создавать отпечатки для каждого пользователя при каждой загрузке. Подключать это к уже работающему каталогу — самая дорогая ошибка, с которой мы сталкиваемся.

Метрики, которые важны для диджейского пула

Метрики качества. Точность распознавания (цель — не менее 98% по top-1 на 5-секундных фрагментах против собственного каталога), точность определения BPM по эталонным данным (не менее 99%), точность определения тональности (не менее 95%), точность распознавания намерения голосовой команды (не менее 92% на отложенной выборке). Эти показатели важны, потому что диджеи проверяют систему уже в первый день — всё, что ниже, воспринимается как «не работает».

Бизнес-метрики. Доля активных диджеев в месяц (D28 ≥ 55% от платящих пользователей), количество загрузок на одного диджея в неделю (≥ 25 — это здоровый показатель), отток (< 4% в месяц), конверсия из бесплатного в платный тариф (≥ 8% среди пользователей с пробным доступом). Если показатели ниже этих порогов — юнит-экономика почти всегда оказывается в минусе после выплат лейблам.

Метрики надёжности. p95 поиска по каталогу ≤ 250 мс, p95 распознавания ≤ 1,2 с, доля успешных возобновлений загрузок ≥ 99,5%, доля сессий десктопного приложения без сбоев ≥ 99,8%. Клубный Wi-Fi не прощает ничего другого.

Когда НЕ стоит строить это с нуля

Кастомный диджейский пул окупается, только если у вас есть реальное преимущество в каталоге, сообществе или интеграции с ПО. Если такого преимущества нет, вы заплатите за то, чтобы заново создать то, что и так работает лучше.

Не стройте, когда: ваш каталог будет содержать меньше 50 тыс. треков; у вас нет партнёрства с лейблом или дистрибьютором; вы планируете привлечь менее 2 000 платящих диджеев за первый год; или ваше преимущество — только «интерфейс приятнее, чем у BPM Supreme». В этом случае лучше адаптировать лицензированный продукт под свои нужды.

Стройте, когда: вы лейбл или дистрибьютор с эксклюзивными правами на каталог, недоступными другим участникам рынка; у вас есть преимущество в лицензировании в определённых регионах (например, Латинская Америка, Корея, страны MENA — все они недостаточно охвачены); или ваш продукт — это не просто библиотека с плеером, а полноценный инструмент для работы диджея с собственной медиатекой.

Выбирайте white-label-пул, когда: вам нужен брендированный музыкальный фид для уже существующего сообщества — каталог меньше 50 тыс., распознавание треков в приложении не требуется, синхронизация с Serato не нужна. Кастомная разработка в этом случае нецелесообразна.

Частые вопросы

Вы правда можете определить трек по шумному клубному фрагменту за секунду?

Да — против вашего собственного каталога. Хорошо настроенный фингерпринтер в стиле «созвездий» находит точное совпадение (top-1) на уровне API за менее чем 500 мс для фрагмента длиной 5 секунд, с точностью выше 95% при шуме уровня клуба. Задержку определяет сеть, а не процесс сопоставления.

Нам использовать ACRCloud или разрабатывать собственный фингерпринтер?

Сначала используйте коммерческий тариф, если ваш каталог содержит меньше ~150 тыс. треков, а объём распознавания — не более ~10 тыс. вызовов в день. Как только вы превысите любой из этих порогов, переходите на гибридный. Точка перехода зависит от цены за распознавание и того, насколько важно для вас распознавать треки вне вашего каталога.

Как вы не даёте LLM выдумывать несуществующие треки?

Никогда не позволяйте ей генерировать результаты напрямую. LLM выдаёт только структурированный JSON-фильтр (жанр, диапазон BPM, набор тональностей, диапазон лет, язык). Этот JSON попадает в детерминированный поиск по каталогу, который контролируете вы. Модель не может выдумать трек, потому что вообще не касается списка треков.

Почему для десктопа Electron, а не нативная сборка?

Десктопное приложение использует около 80% кода из веб-версии, выпускается быстрее и имеет полный доступ к файловой системе — для записи в Serato и управления очередью загрузок. Нативная разработка на Swift и C++ позволила бы уменьшить размер бинарника и немного снизить потребление оперативной памяти, но потребовала бы содержания двух параллельных команд разработчиков. Учитывая использование FRP, выбор в пользу Electron был очевидным.

Сколько на самом деле стоит работа ИИ-функций на масштабе?

Голосовой ввод через Whisper стоит 0,45 ₽ за минуту; типичный диджей говорит меньше трёх минут в месяц, так что расшифровка обходится в копейки. GPT-4o для анализа намерений использует короткий контекст (менее 500 токенов). Озвучивание ответа через Amazon Polly — 1 200 ₽ за миллион символов, что также почти не влияет на расходы. На активного диджея приходится менее 18 ₽ в месяц на ИИ-апи.

Можете ли вы поддерживать rekordbox и Traktor так же, как Serato?

Да — мы начали с Serato, потому что это лидер рынка среди профессиональных диджеев. Интеграция с rekordbox реализуется через запись в rekordbox.xml; с Traktor — через запись в collection.nml. Каждая из них добавляется через три–пять недель после того, как Serato заработает стабильно.

Какой каталог может удержать эта архитектура?

Форма FRP масштабируется до нескольких миллионов треков без архитектурных изменений. Основные узкие места: память индекса отпечатков (решается шардированием), задержка p95 при поиске по метаданным (устраняется выделенным поисковым движком, например OpenSearch или Meilisearch) и стоимость исходящего трафика CDN (оптимизируется за счёт второго CDN-провайдера).

Сколько времени от брифа до первого платящего диджея?

Для минимального MVP (веб + iOS, коммерческое распознавание, без голосового ассистента) 4–5 месяцев — это реалистичный срок при работе agent-engineered-команды. Полный объём уровня FRP занимает 10–14 месяцев. Главный сдерживающий фактор — переговоры о лицензировании с лейблами, а не разработка.

ИИ-стек для аудио

7 лучших ИИ-инструментов для аудиоприложений

AssemblyAI, Deepgram, ElevenLabs, OpenAI, Krisp, Dolby и Suno — когда какой использовать.

Глубокий разбор TTS

6 лучших библиотек синтетического голоса

ElevenLabs, OpenAI, Google, Polly, Azure, Cartesia — как выбрать подходящий TTS для озвучки в приложении.

Архитектура WebRTC

Альтернатива Agora.io в 2026 году

Кастомный WebRTC с LiveKit, mediasoup, Jitsi и Janus — реальное сравнение затрат.

Маршрутизация голоса

ИИ-ассистенты для звонков: гайд по сторонним API

Тот же подход — Whisper + LLM + TTS — применён к голосовому бизнес-софту.

Живое аудио

Преобразование речи в текст в живом стриминге

Цены на API, бюджет задержки и паттерны интеграции для конвейеров живого аудио.

Готовы построить собственную аудиоплатформу на базе ИИ?

Franchise Record Pool — это доказательство того, что диджейский пул в 2026 году — это три инженерные дисциплины, соединённые воедино: лицензированный каталог, сервис распознавания на основе отпечатков и узкая LLM, обёрнутая вокруг детерминированного поиска. По отдельности ни одна из них не является чем-то необычным; ключевое преимущество — в том, чтобы объединить их в единый продукт, которым профессиональные диджеи реально пользуются во время выступлений.

Если ваш продукт ориентирован на аудио — диджейский пул, music-tech SaaS, караоке-платформа, инструмент для вещания, бэкенд для радио — Фора Софт — это команда, которая уже делала подобное и честно скажет, где объём работ занижен, а где могут возникнуть сложности.

Начните с 30-минутного звонка. Мы вернёмся либо с оценкой объёма по статьям, либо с честной причиной, почему лучше делать это как white-label-сборку. В любом случае вы сэкономите деньги.

Готовы выпустить диджейский или музыкальный продукт?

Получите на свой звонок ту же команду по аудиостримингу, что выпустила FRP. Архитектура, модель затрат, путь к лицензированию — всё за одну встречу.

Позвоните нам → Напишите нам →

  • Опыт клиентов