Главное
• Шесть AI-паттернов стабильно доходят до продакшена в 2026 году. Голосовые ассистенты, распознавание и перевод речи в реальном времени, компьютерное зрение, генерация контента, рекомендации и модерация контента — всё остальное пока остаётся на уровне исследований или красивых слайдов.
• Покупайте модель, разрабатывайте функцию. GPT-5, Claude 4, Whisper и YOLOv8 сегодня — массовый товар. Ваше конкурентное преимущество — в рабочем процессе, данных, которыми вы их кормите, и UX, который показывает ответ, а не в обучении базовой модели.
• Большинство основателей переплачивают в 3–5 раз. Типичная первая AI-функция стоит 1,1–3,7 млн ₽ на API-архитектуре, а не 15 млн ₽ и больше, как оценивают агентства, которые до сих пор ориентируются на цены 2023 года. Мы запускаем такие решения за несколько недель с помощью Agent Engineering.
• Стоимость токенов редко убивает функцию. Проблемы вызывают не она, а плохой этап поиска, галлюцинации в юридических или медицинских текстах, ложные срабатывания в модерации или задержка больше 1,5 с при голосовом взаимодействии. Сначала решите эти вопросы, а потом оптимизируйте расходы.
• Фора Софт довела до продакшена все шесть паттернов. FRP (голосовой ассистент для диджеев), BlaBlaPlay (модерация и рекомендации), FashionAI (компьютерное зрение), ALDA (генеративное обучение), Translinguist (перевод в реальном времени на 62 языка) — каждый из них дал измеримый результат, на который мы ссылаемся в этой статье.
Почему Фора Софт написала это руководство
Фора Софт создаёт видео-, аудио- и real-time-решения с 2005 года. За последние три года мы перестроили разработку вокруг подхода Agent Engineering — сначала спецификация, затем автоматическая генерация кода и постоянные циклы оценки (evals). Это позволяет нам выпускать функции с ИИ в продакшене за недели, а не за кварталы. Для клиента, который это читает, перемены значимы: мы оцениваем проекты быстрее и дешевле, чем агентства, которые до сих пор берут деньги за ручной шаблонный код.
В этом руководстве мы собрали опыт внедрения ИИ в пять реально работающих продуктов — Franchise Record Pool, BlaBlaPlay, FashionAI, ALDA и Translinguist — охватывающих шесть различных функциональных паттернов: голос, распознавание и перевод речи, зрение, генерация, рекомендации и модерация. Ниже подробно разбираем каждый из них: используемый стек, с какими трудностями столкнулись и какие измеримые результаты получили. Перед чтением загляните в наш сервис AI-интеграции или в кейс FRP.
Если вы основатель или CTO и решаете, станет ли для вас ИИ функцией, поворотом или отвлечением, — вот краткая и ясная версия, которую мы даём потенциальным клиентам на первом звонке.
AI — это правильная следующая функция для вашего продукта?
30 минут с нашим CTO — проверим ваш сценарий на прочность, найдём самый быстрый путь к рабочей версии v1 и честно скажем, стоит ли подождать.
Шесть AI-паттернов, которые реально внедряются в продакшен
Почти каждая успешная AI-функция, которую мы выпустили, попадает в один из шести паттернов. Если ваша идея не соответствует ни одному из них, резко возрастает вероятность, что вы занимаетесь исследованием, а не созданием продукта — замедлитесь и сделайте прототип на готовом API, прежде чем тратить время из дорожной карты.
| Паттерн |
Типичный сценарий |
Технология первого выбора |
Усилия на v1 |
Где внедрила Фора Софт |
| Голосовой ассистент |
«Собери плейлист в стиле латинопоп, 150 BPM» |
Whisper + GPT-5 + Polly/ElevenLabs |
3–5 недель |
FRP |
| Распознавание и перевод речи в реальном времени |
Многоязычные видеозвонки и конференции |
Deepgram + GPT-5 + ElevenLabs TTS |
6–10 недель |
Translinguist (62 языка) |
| Компьютерное зрение |
Распознавание объектов, одежды и лиц |
YOLOv8 + CLIP + TFLite/CoreML на устройстве |
5–8 недель |
FashionAI |
| Генерация контента |
Учебные планы, плейлисты, образы, черновики |
OpenAI Assistants + кастомная схема |
2–4 недели |
ALDA |
| Рекомендации |
Персонализированная лента, подсказки, плейлисты |
Эмбеддинги + pgvector / Pinecone |
3–6 недель |
BlaBlaPlay, FRP |
| Модерация контента |
Язык вражды, PII, сигналы безопасности |
Whisper + дообученный классификатор |
4–6 недель |
BlaBlaPlay |
Обратите внимание, чего в списке нет: «обучить собственную базовую модель». За пределами исследовательских лабораторий с большими бюджетами в 2026 году это почти всегда плохая идея. Сегодня интересные инженерные задачи решаются в тех 20% стека, что ближе всего к пользователю — поиск, UX, оценка качества (evals), защитные ограничения (guardrails), — а не в повторном создании чего-то вроде GPT.
Паттерн 1 — Голосовые ассистенты и голосовой поиск
Голос — паттерн с самой высокой отдачей для любого продукта, где у пользователей заняты руки: диджеи во время сета, водители, хирурги, складские работники, авторы, родители. Вы заменяете многошаговый интерфейс одной фразой: «Собери плейлист в стиле латинопоп, 150 BPM, без Bad Bunny».
Для Franchise Record Pool — платформы для диджеев с 720 000 лицензированных треков от Sony Music, Universal и Virgin Records — мы создали голосового диджей-ассистента на базе Whisper (транскрипция), GPT-5 (определение намерения), поиска по каталогу FRP и Amazon Polly (синтез речи). Теперь диджеи могут превратить идею в сохранённый плейлист одной фразой — вместо пяти шагов фильтрации в старом интерфейсе.
Анатомия продакшен-пайплайна для голоса
1. Захват. Моно-PCM 16 кГц с микрофона передаётся потоком чанками по 250 мс. Эхоподавление и VAD выполняются на стороне клиента — встроенных средств WebRTC вполне хватает.
2. Транскрибация. Whisper (large-в3 для пакетной обработки, gpt-4o-mini-transcribe для реального времени, ~0,45 ₽/мин), Deepgram Nova-3 (~0,57 ₽/мин), если нужны частичные результаты быстрее 300 мс, или AssemblyAI, если из коробки нужна разметка тональности и сущностей.
3. Понимание. Вызов LLM с жёсткой JSON-схемой и промптом для tool use: цель, сущности, значения параметров. Делайте это до вызова функций, чтобы бэкенд не выполнял команды из свободного текста без проверки.
4. Действие. Вызовите свой реальный API. Эту часть пропускают все туториалы по AI. И именно она составляет 80% инженерных усилий.
5. Ответ. Синтез речи (TTS) отправляется пользователю (Polly, ElevenLabs или Azure) или отображается в интерфейсе. Цель — уложиться в 1,2 секунды с начала до конца; всё, что дольше 1,5 секунды, воспринимается как сбой.
Берите голосового ассистента, когда: у пользователя заняты руки, действия в интерфейсе выражены понятными глаголами (создать, найти, изменить), а экономия даже трёх кликов за сессию складывается в заметный выигрыш при ежедневном использовании.
Паттерн 2 — Транскрибация и перевод в реальном времени
Распознавание речи (ASR) и перевод в реальном времени — второй по популярности запрос на ИИ, который мы получаем. Здесь особенно дорого обходятся плохие продуктовые решения, потому что стриминг тарифицируется за минуту соединения, а не за каждое произнесённое слово.
Мы создали Translinguist (и родственную платформу Video Interpretations) для проведения живых мероприятий с синхронным, последовательным и жестовым переводом на 62 языка. Каждый участник слышит только свой язык, субтитры генерируются автоматически, а специальные термины и имена собственные сохраняются с помощью кастомного глоссария. Подробности об архитектуре — в нашем руководстве по многоязычному переводу в видеозвонках.
Whisper против Deepgram против AssemblyAI (наш вердикт за минуту)
Whisper / OpenAI Realtime. Самый дешёвый вариант — около 0,45 ₽ за минуту в пакетном режиме. Подходит, если можно терпеть задержку 500–900 мс или работать асинхронно. С августа 2025 года API gpt-realtime обеспечивает настоящий стриминг; внедрение идёт быстро.
Deepgram Nova-3. Частичные результаты за менее чем 300 мс, стоимость около 0,57 ₽/мин по факту использования. Лучший выбор, когда нужна настоящая работа в реальном времени — голосовые агенты, живые субтитры, управление без рук, как у диджеев.
AssemblyAI. ~0,31 ₽/мин по факту (тарифицирует длительность сессии, что на практике добавляет ~65% накладных расходов). Лучший выбор, если нужна транскрибация вместе с анализом тональности, удалением персональных данных и распознаванием сущностей — всё в одном решении.
Используйте перевод в реальном времени, когда: ваш продукт — это живая видео- или голосовая среда (конференции, телемедицина, зал суда, класс), и каждый участник говорит на своём языке. Если разговор может подождать 10 секунд, асинхронный Whisper обычно в 5 раз дешевле.
Паттерн 3 — Компьютерное зрение и распознавание объектов
Компьютерное зрение стало массово применяться, когда YOLOv8 и CLIP стали достаточно компактными для работы на мобильных устройствах. В приложении FashionAI, предназначенном для организации гардероба, мы использовали оба этих инструмента, чтобы распознавать не только тип одежды, ткань, цвет и узор, но и длину рукава, форму выреза, мотивы узоров, а также категории индийской этнической одежды — тех, что отсутствуют в стандартных обучающих наборах данных.
Стек: TensorFlow Lite с моделью YOLOv8m для распознавания объектов, Apple Vision и PyTorch для более глубокого анализа признаков, а также CLIP от OpenAI для семантических эмбеддингов — на их основе работает рекомендация вроде «найди мне красную куртку, в которой можно пойти на бранч». О том, как довести это до продакшена, читайте в нашем руководстве по найму инженеров компьютерного зрения.
На устройстве или в облаке — от этого решения зависит всё остальное
На устройстве (TFLite / CoreML / NNAPI). Нет платы за каждый инференс, данные остаются приватными, работает без интернета, но вы ограничены моделями вроде YOLOv8-nano или небольшими размерами (~3–22 МБ). Используйте, если инференс идёт по фото и видео пользователей и есть риски при хранении данных.
Облако. YOLOv8-m/l/x на GPU-машине, ~0,07–0,75 ₽ за изображение. Используйте, когда одно изображение стоит обращения к серверу (юридические документы, медицинские снимки, страховые заявки) или точность важнее задержки.
Гибрид. YOLOv8-nano работает на устройстве в обычных ситуациях, а в сложных случаях — переходит в облако. Именно так устроен FashionAI: 95% фото из гардероба обрабатываются за 180 мс прямо на устройстве, а необычная этническая одежда отправляется на проверку в облако.
Берите компьютерное зрение, когда: ваши пользователи вручную размечали бы объекты на изображениях — например, одежду, чеки, помещения, еду или дефекты, — и вы можете собрать более 2 000 размеченных примеров, включая редкие случаи, которые универсальные модели пропускают.
Паттерн 4 — Контент, созданный с помощью ИИ, и черновики
Генерация контента — самый «очевидный» AI-паттерн и при этом тот, что быстрее всего проваливается при наивном внедрении. Выигрышный сценарий — это не «нажал кнопку, получил 800 слов и надеялся». Это «нажал кнопку, получил черновик на 70%, который следует моей схеме, а человек доделывает остальное».
ALDA, наш AI-ассистент для преподавателей колледжей и университетов США, генерирует учебные планы, соответствующие шаблонам конкретного учебного заведения — по количеству зачётных часов, формату оценивания и тегам аккредитации. Мы не используем свободные промпты к GPT: вместо этого применяем OpenAI Assistants с чёткой структурой, передаём шаблон учебного плана как обязательную функцию и даём преподавателю возможность редактировать всё в одном контексте. Преподаватели отмечают, что экономят примерно в четыре раза больше времени на подготовке черновиков.
Пять правил для генеративных функций, за которые не будет стыдно
1. Всегда структурированный вывод. Заставляйте модель возвращать данные по JSON-схеме, а затем отображайте их. Никогда не передавайте «сырой» текст модели напрямую в интерфейс.
2. Опирайтесь на свои данные. Генерация с опорой на поиск (Retrieval-Augmented Generation, RAG) снижает галлюцинации на 42–68% по данным опубликованных бенчмарков; в узких сферах точность ответов с использованием RAG достигает 89% против чуть более 50% у языковых моделей без доступа к внешним данным.
3. По одному оценщику на функцию. Автоматические проверки (Ragas, LangSmith или собственный набор на pytest) запускаются при каждом изменении промпта. Без таких проверок уже к третьей неделе качество начнёт незаметно ухудшаться.
4. Для ответственного вывода всегда нужен человек в контуре (human-in-the-loop). Учебные планы, юридические тексты, медицинские заключения, финансовые советы — сначала черновик, потом проверка человеком. Без исключений.
5. Показывайте источники. Пользователи доверяют сгенерированному контенту примерно в три раза больше, если рядом есть ссылки на источники. Это самая простая и дешёвая победа в UX во всём AI-стеке.
Берите генерацию контента, когда: пользователи начинают с нуля, а первые 70% результата имеют чёткую и предсказуемую структуру — например, учебный план, описание вакансии, план тренировок, питания или спецификацию продукта.
Паттерн 5 — Рекомендации и персонализированные ленты
Рекомендации — самая незаметная победа. Никто не пишет в соцсетях про хорошую ленту, но удержание, длительность сессии и доход от рекламы сразу растут.
В BlaBlaPlay — анонимной соцсети голосовых карточек — мы использовали два слоя рекомендаций. Первый — генератор подсказок «о чём записать?» (OpenAI API с ежедневно меняющимся сидом на основе трендовых карточек). Второй — переранжировщик ленты, который сопоставляет эмбеддинги прослушанных и избранных карточек пользователя с пулом свежих карточек. После запуска обоих компонентов доля «молчаливых ответов» на голосовые карточки резко снизилась, а средняя длительность сессии выросла на ощутимые двузначные проценты.
В FRP тот же паттерн используется для «похожих треков» и «других диджеев, которые играли это, играли…» — классической коллаборативной фильтрации, построенной на эмбеддингах OpenAI + pgvector вместо устаревших пайплайнов матричной факторизации, требовавших в 10 раз больше инженерной работы.
Эталонный стек для первой системы рекомендаций
Активность пользователя → Очередь событий (SQS / Redpanda)
↓
OpenAI text-embedding-3-small
↓
pgvector (или Pinecone при масштабе)
↓
ANN-запрос (top-k, косинус) + переранжирование (BGE / Cohere rerank)
↓
Feed API + A/B-флаг + логирование кликов
Берите рекомендации, когда: в каталоге более 500 элементов, есть несколько тысяч активных пользователей, которые оставляют сигналы, и есть лента или список, где текущий порядок — хронологический или случайный.
Паттерн 6 — Модерация контента, доверие и безопасность
У любого продукта с пользовательским контентом (UGC) рано или поздно возникает проблема модерации. AI-модерация перестаёт быть опцией, как только вы переваливаете за несколько тысяч постов в день: очереди только из живых модераторов просто не справляются, а платформенные модераторы (Apple, Google, Meta) могут заблокировать ваше приложение, если стандартные ML-классификаторы пометят его раньше, чем это сделаете вы.
Слой модерации в BlaBlaPlay состоит из трёх этапов. Сначала Whisper транскрибирует каждую голосовую карточку на стороне сервера. Затем дообученный классификатор выявляет оскорбления, угрозы и адресную травлю. Наконец, помеченные карточки попадают в очередь модератора (не удаляются автоматически), где решение принимает админ. CoreML выполняет быстрый предварительный фильтр на устройстве, так что очевидные нарушения вообще не доходят до сервера.
Ловушка ложных срабатываний (и как её избежать)
Готовые API модерации часто ошибочно считают идентичностные термины — такие как «мусульманин», «гей», лексика, связанная с инвалидностью, или AAVE — оскорбительными, хотя они нейтральны. Это хорошо задокументированное искажение. В прямых сравнениях Claude показывает точность 0,92 при всего 2,2% ложных срабатываний, тогда как Gemini слишком часто помечает контент, имея точность около 0,77. Используйте тот классификатор, которому доверяете, добавьте проверку человеком для первых 500 пометок в каждой категории и фиксируйте каждую апелляцию.
Берите AI-модерацию, когда: пользователи создают текстовый, голосовой или графический контент, очередь модерации растёт быстрее, чем вы успеваете нанимать модераторов, а потеря доверия из-за ложных срабатываний меньше, чем репутационный ущерб от пропущенных нарушений.
Стек AI, к которому мы обращаемся (и когда)
Мы высказываем мнение осознанно. Вот компоненты, которые мы используем по умолчанию в 2026 году, и альтернативы, к которым прибегаем, когда стандартный вариант не подходит.
| Слой |
По умолчанию |
Альтернатива |
Когда переключиться |
| LLM |
GPT-5 / GPT-5-mini (OpenAI) |
Claude Sonnet 4.6 / Opus 4.6 |
Длинный контекст, сложные рассуждения, агентные сценарии |
| Бюджетная LLM |
GPT-5 Nano (3,7 ₽ / 30 ₽ за 1 млн токенов) |
DeepSeek V3.2 / Gemini 2.5 Flash |
Объёмные нагрузки, сценарии с минимальной стоимостью |
| ASR в реальном времени |
Deepgram Nova-3 |
AssemblyAI / OpenAI Realtime |
Нужны удаление PII и тональность в комплекте |
| Пакетный ASR |
Whisper (large-v3) |
Self-hosted faster-whisper на GPU |
Требования к хранению данных / изолированный контур |
| TTS |
ElevenLabs / Amazon Polly |
Azure Neural TTS |
Корпоративные SLA, HIPAA |
| Зрение |
YOLOv8 + CLIP |
Detectron2, SAM2, GPT-5V |
Много сегментации, задачи с нулевым обучением |
| Векторная БД |
pgvector (Postgres) |
Pinecone, Weaviate, Qdrant |
Более 50 млн эмбеддингов, низкая задержка p99 |
| На устройстве |
TFLite (Android) / CoreML (iOS) |
ONNX Runtime Mobile |
Кроссплатформенность, паритет ARM/x86 |
| Evals и наблюдаемость |
Ragas + LangSmith |
Свой pytest + OpenTelemetry |
On-prem, регулируемые данные |
Разрабатывать, покупать или комбинировать — как выбрать
Консенсус 2026 года во всех серьёзных разборов «разрабатывать или покупать» одинаков: покупайте тяжёлое ядро, разрабатывайте то, что вас отличает, и связывайте всё слоем ИИ. Полугодовая разработка, требующая двух штатных инженеров на постоянной основе, редко выигрывает у покупки, если учесть обновления RAG-пайплайна, переобучение модели и поддержку интеграций.
Три варианта, которые мы предлагаем клиентам
Вариант A — купить SaaS. Zapier/Make + готовый AI-решение (Jasper, Intercom Fin и т. п.). Самый быстрый путь. Ограничения — не ваши, а у поставщика. Подходит, когда искусственный интеллект — просто функция, а не основа ценности продукта.
Вариант B — Разработать на API. OpenAI/Anthropic/Deepgram + ваш бэкенд + ваш UX. Это 80% того, что мы выпускаем. Вам принадлежат рабочий процесс и данные, вендорам — модели. Стоимость: 1,1–3,7 млн ₽ за v1, 3–8 недель с нашим процессом Agent Engineering.
Вариант C — Разработать с нуля. Обучите или дообучите собственную модель. Только если ваши данные действительно уникальны и модель сама по себе — ваше конкурентное преимущество (что бывает редко). Бюджет — от 75 млн ₽.
Берите вариант B (разработка на API), когда: искусственный интеллект — часть того, что делает ваш продукт лучше конкурентов, у вас есть уникальные данные или процесс, а ваша команда (или команда партнёра) уже выпускает бэкенд и мобильные приложения в продакшен.
Нужно второе мнение по вопросу «разрабатывать или покупать»?
Мы сопоставим ваш AI-сценарий с одним из шести паттернов, определим стек и дадим честную первую оценку за 30 минут.
Мини-кейс — голосовой диджей-ассистент FRP
Ситуация. Franchise Record Pool даёт более чем 40 000 профессиональным диджеям доступ к 720 тысячам лицензированных треков от Sony Music, Universal и Virgin Records, а также глубокую интеграцию с Serato DJ. Каталог был главным преимуществом — но поиск работал через интерфейс с пятью шагами фильтрации, к которому диджеи не могли обращаться во время выступления.
План на 12 недель. Недели 1–3: интегрировать вызовы функций Whisper и GPT-5 с поисковым API FRP. Недели 4–6: создать голосовой интерфейс и добавить озвучку ответов через Polly. Недели 7–9: обучить классификатор намерений на 2000 логов запросов диджеев. Недели 10–12: реализовать распознавание музыки («Какой трек только что ремикснул другой диджей?») и провести оценку на 500 реальных запросах.
Результат. Время создания плейлиста сократилось с пяти шагов фильтрации до одной фразы. Теперь сессии диджеев включают голосовое редактирование плейлистов прямо во время сета; распознавание музыки добавляет найденные треки сразу в крейт диджея. Архитектуру смотрите в полном кейсе FRP.
Мини-кейс — генератор учебных планов ALDA
Ситуация. Преподаватели колледжей США тратят 8–15 часов на подготовку одного курса: разрабатывают учебные планы, критерии оценивания и планы лекций, которые должны соответствовать внутренним шаблонам вуза (зачётные часы, теги аккредитации, таксономия образовательных результатов). Существующие AI-инструменты генерировали слишком общий контент, который приходилось существенно переписывать.
План на 12 недель. Недели 1–2: загрузить шаблоны учебных планов заведения и сопоставить их с JSON-схемой. Недели 3–6: создать OpenAI Assistant с возможностью вызывать инструменты для генерации разделов и редактирования на месте. Недели 7–9: внедрить слой RAG поверх существующих учебных планов и каталога курсов. Недели 10–12: разработать набор тестов (evals) и UX-интерфейс с участием преподавателя в процессе.
Результат. Время на создание черновика учебного плана сократилось примерно в 4 раза. Преподаватели сохраняют полный контроль над редактированием; черновик от AI сразу соответствует шаблону их учреждения. Подробнее — на странице проекта ALDA.
Мини-кейс — живой перевод Translinguist на 62 языка
Ситуация. Международные мероприятия — конференции, судебные заседания, лекции — до сих пор зависят от живых синхронных переводчиков. Это дорого, специалистов не хватает, а масштабировать такой подход на редкие языковые пары невозможно. Машинный перевод существовал, но простое сочетание распознавания речи (ASR), машинного перевода (MT) и синтеза речи (TTS) звучало неестественно и теряло смысл, который вкладывал говорящий.
План на 12 недель. Недели 1–3: определение языка и разделение речи разных дикторов в живом аудиопотоке. Недели 4–6: передача данных в слой перевода на LLM с использованием специализированных глоссариев (юридический, медицинский, технический). Недели 7–9: нейросетевой синтез речи (TTS), сохраняющий темп, интонацию и паузы. Недели 10–12: создание дорожки жестового перевода и генерация субтитров.
Результат. Поддерживаются 62 языка — от начала до конца. Каждый участник слышит только свой язык, субтитры генерируются автоматически, а специализированная терминология (названия дел, медицинские диагнозы, названия продуктов) сохраняется благодаря глоссариям для каждого мероприятия. Полную архитектуру смотрите в кейсе Video Interpretations.
Сколько на самом деле стоит выпустить AI-функцию
Любой аналитический диапазон стоимости AI-разработки бесполезен без точки отсчёта. Опубликованные диапазоны 2026 года — от 3 до 30 млн ₽ «для большинства бизнес-сценариев». Это правда, но распределение бимодальное. Функции на API-first сгруппированы у нижней границы; кастомное обучение тянет вверх верхнюю.
| Масштаб функции |
Типичная v1 |
Диапазон Фора Софт |
Токены / инфраструктура в месяц |
| Чат- или голосовой ассистент на основе имеющихся данных |
3–5 недель |
1,1–2,2 млн ₽ |
22 500–150 000 ₽ / мес |
| Генерация контента / инструмент черновиков |
2–4 недели |
750 тыс. – 1,8 млн ₽ |
15 000–225 000 ₽ / мес |
| Рекомендации / переранжирование ленты |
3–6 недель |
1,3–2,6 млн ₽ |
15 000–112 500 ₽ / мес |
| Перевод в реальном времени / ASR-пайплайн |
6–10 недель |
2,6–5,2 млн ₽ |
0,75–1,5 ₽ за минуту пользователя |
| Компьютерное зрение (на устройстве, облако — в резерве) |
5–8 недель |
1,8–4,5 млн ₽ |
3 750–75 000 ₽ / мес + данные |
| Модерация контента (голос или текст) |
4–6 недель |
1,3–3 млн ₽ |
7 500–75 000 ₽ / мес |
Две ремарки. Во-первых, эти диапазоны рассчитаны на API-ориентированную архитектуру и наш процесс Agent Engineering — мы оцениваем быстрее, чем агентства, которые до сих пор берут деньги за ручной шаблонный код. Во-вторых, мы намеренно не указываем диапазоны для дообучения или обучения базовых моделей — правильный ответ зависит от размера датасета и вычислительного бюджета, а мы не хотим называть цифры с потолка, за которые потом нас поймают.
Фреймворк решения — выберите подходящую AI-функцию за пять вопросов
Q1. Экономит ли функция время пользователей на задаче, которую они выполняют хотя бы раз в неделю? Если нет — скорее всего, вы создаёте демонстрацию, а не реальную функцию для удержания. Стоп.
Q2. К какому из шести паттернов она относится? Голос, ASR/перевод, зрение, генерация, рекомендации, модерация. Если ни один не подходит — вы в режиме исследования: сделайте прототип на готовом API за две недели, прежде чем писать ТЗ.
Q3. Сколько стоит неправильный ответ? Низкая цена (рекомендательная лента): можно выпускать. Средняя (черновик учебного плана): нужна проверка человеком. Высокая (медицина, право, финансы): обязательно подтверждение человека, структурированный ответ и ссылки на источники.
Q4. Достаточно ли у вас собственных данных, чтобы сделать функцию лучше, чем у обычного API? Если да — у вас есть конкурентное преимущество, вкладывайтесь в RAG и evals. Если нет — купите SaaS и конкурируйте за счёт UX.
Q5. Потянете ли вы худший сценарий по счёту за токены при 10-кратном росте DAU? Если ответ вызывает сомнения — пересмотрите подход: активно используйте кэширование, пакетную обработку, применяйте бюджетные модели (GPT-5 Nano, Gemini Flash, DeepSeek) для простых задач и переходите на топовые только для сложных.
Пять ошибок, которые мы видим снова и снова
1. Запуск без evals. Самая частая ошибка. Функция работает в первый день, но молча деградирует на третьей неделе — после обновления модели от OpenAI. Команда замечает проблему только тогда, когда начинают поступать жалобы от пользователей. Составьте набор evals до того, как приступите к разработке функции.
2. Свободные промпты в продакшене. Если ваш бэкенд принимает любой текст, который возвращает LLM, кто-то может через промпт-инъекцию получить доступ к вашей базе данных. Всегда требуйте структурированный ответ (например, в формате JSON или через вызовы функций), проверяйте его и только потом выполняйте действия.
3. Игнорирование кэширования токенов. OpenAI и Anthropic в 2026 году дают около 90% скидки на кэшированный ввод. Большинство команд первые полгода не отслеживают попадания в кэш и переплачивают в 5–10 раз.
4. Чрезмерное доверие к API модерации. Универсальные классификаторы слишком часто помечают переосмысленные ругательства, AAVE и термины, связанные с идентичностью. Всегда предусматривайте возможность обжалования перед человеком — не потому что вы не доверяете модели, а потому что она относится к вашим пользователям с неравным недоверием.
5. Оценка по меркам 2023 года. Команды, которые до сих пор оценивают AI-функции в 11–22 млн ₽ за v1, либо работают по ставкам исследовательской лаборатории, либо не перешли на Agent Engineering. Если ваша оценка не выросла в 2–3 раза по сравнению с 2023 годом, вы теряете время и деньги.
KPI — как понять, что AI-функция себя окупает
KPI качества. Обоснованность (доля ответов, подкреплённых найденным контекстом, цель > 0,9), доля галлюцинаций (цель < 2%), успешность выполнения задачи (доля сессий, в которых намерение пользователя достигнуто, цель > 0,8), доля правок человеком (доля черновиков от ИИ, отредактированных более чем на 20%, цель < 0,5).
Бизнес-метрики. Рост активации в сессиях с AI-функцией (цель — на 15–30% выше, чем в контрольной группе), рост удержания через 30 дней (цель — на 5–15%), выручка с пользователя по платным AI-функциям (цена должна обеспечивать валовую маржу выше 60% после учёта стоимости токенов), снижение числа обращений в поддержку (цель — на 10–30% для AI-чат-ассистентов).
KPI надёжности. Задержка p95 (голос: <1,2 с; генерация текста: <3 с), стоимость модели на одного активного пользователя (цель — менее 15% от выручки с пользователя), доля попаданий в кэш (более 50% в зрелых функциях), доля успешных тестов (evals) — выше 0,85 при каждом изменении промпта или модели.
Когда НЕ стоит добавлять AI в продукт
Мы отказываемся от AI-проектов примерно на каждом втором установочном звонке. Самые честные сигналы, что искусственный интеллект — не то, что нужно на данном этапе:
- Ваш основной продукт ещё не нашёл product-market fit (PMF) — искусственный интеллект не решит проблему удержания, а лишь усложнит интерфейс.
- Задача требует детерминированного результата (расчёт налогов, подготовка документов для комплаенса, код, который должен компилироваться). Используйте правила и типы: LLM по своей природе вероятностны.
- У вас меньше 500 документов / меньше 5 тысяч элементов. RAG работает эффективно на больших объёмах данных; при таком объёме тщательно составленный FAQ превосходит RAG-чатбот и по точности, и по стоимости.
- Бюджет задержки — меньше 100 мс. Даже самые быстрые модели реального времени работают за сотни миллисекунд; если нужен ответ за миллисекунды — заранее вычисляйте и кэшируйте.
- Ваша команда никогда не запускала в продакшен бэкенд и мобильные приложения. Искусственный интеллект — это глазурь; сначала нужен сам торт.
Хотите такую же оценку для своего продукта?
Мы скажем, какой из шести паттернов подходит, как будет выглядеть первая готовая версия v1 и сколько это примерно стоит — за один 30-минутный звонок, без слайдов.
Частые вопросы
Как быстро Фора Софт может выпустить первую AI-функцию?
Для очерченной функции, относящейся к одному из шести паттернов, v1 обычно выходит за 3–6 недель по нашему процессу Agent Engineering. Сюда входят бэкенд, AI-пайплайн, оценки и интерфейс, готовый к выпуску — не прототип.
Нужно ли нам обучать собственную модель?
Почти никогда. Базовые модели 2026 года (GPT-5, Claude 4, Gemini 2.5) в связке с RAG и лёгким дообучением покрывают более 95% продуктовых сценариев. Обучение с нуля оправдано только тогда, когда ваши данные — это конкурентное преимущество, а ни одна коммерческая модель не справляется с вашей предметной областью.
Каков типичный регулярный счёт за токены и инференс?
Для запущенной функции масштаба SaaS затраты составляют 0,75–6 ₽ в день на активного пользователя на стеках на базе API. После внедрения кэширования и маршрутизации по уровням моделей (Nano/Flash — для простых вызовов, флагман — для сложных) стоимость снижается до 0,15–1,5 ₽ в день.
Как вы решаете вопросы приватности данных и соответствия требованиям?
По умолчанию мы используем корпоративные эндпоинты OpenAI/Anthropic (данные не используются для обучения) или Azure OpenAI / AWS Bedrock для нагрузок, подпадающих под требования HIPAA, GDPR и SOC 2. При необходимости хранения данных на стороне клиента мы развёртываем open-source-модели (Whisper, Llama, Mixtral) на его собственной инфраструктуре.
Сделает ли ИИ разработку моего продукта в целом дешевле?
Для самой AI-функции — да, кардинально. API-First архитектура плюс Agent Engineering сокращают время разработки функции в 2–3 раза по сравнению с нормами 2023 года. Для остального продукта (авторизация, интерфейс, платежи, комплаенс) стоимость почти не меняется — ИИ не уменьшает не-ИИ-часть, которую всё равно нужно строить.
OpenAI, Anthropic или open source — что вы рекомендуете?
OpenAI GPT-5 — выгоднее для большинства задач: дешевле на уровне флагманов, а версия Nano в 20 раз дешевле Claude Haiku при больших объёмах запросов. Anthropic Claude — выбор, когда нужен длинный контекст или точные агентные сценарии: у них гибкое управление кэшем, а фиксированная цена за большой контекст остаётся лучшей на рынке. Open source-модели (Llama, Mixtral, Whisper) — для развёртываний с требованиями к хранению данных или в изолированных средах.
Что делает Фора Софт иначе, из-за чего оценки ниже?
Agent Engineering — пайплайны со спецификацией в первую очередь, агентная генерация кода, непрерывные evals. Шаблонный код, на который раньше уходила неделя у двух инженеров, теперь делается за одно утро. Эту экономию мы передаём в оценку, а не оставляем себе как маржу — поэтому наши диапазоны для v1 ниже стандартных агентских.
Можете ли вы работать с нашей текущей командой?
Да — мы так же часто работаем по модели выделенной команды или усиления, как и над проектами «под ключ». Мы сотрудничаем с вашими инженерами над AI-пайплайном, evals и инфраструктурой и полностью передаём знания перед уходом.
Что почитать дальше
Готовы выпустить ИИ, который действительно окупает затраты на токены?
Каждая AI-функция, которая в 2026 году работает хорошо, устроена примерно одинаково: стек «покупай модель, разрабатывай процесс», структурированный вывод, опора на поиск, evals и участие человека в критичных местах. Шесть паттернов — голос, ASR/перевод, зрение, генерация, рекомендации, модерация — покрывают почти любую продуктовую идею, достойную реализации в этом году.
Фора Софт сегодня запускает все шесть решений в продакшен. Если вы дочитали до этого места и у вас есть конкретная идея — следующий шаг — 30-минутный звонок. Мы сопоставим вашу идею с подходящим паттерном, подберём стек и дадим максимально честную оценку, от которой потом не откажемся.
Давайте определим объём вашей первой AI-функции на этой неделе
30 минут, без слайдов. Вы уходите с конкретным паттерном, конкретным стеком и диапазоном оценки, который можно представить на совете директоров.
Позвоните нам →
Напишите нам →