Главное
• AI в мобильном приложении — это рычаг роста выручки, а не просто значок «у нас есть ИИ». Приложения, использующие ИИ для персонализации, показывают конверсию на 12–35% выше и отток на 10–20% ниже, чем аналоги без ИИ — но только если модель с самого начала привязана к конкретному измеримому KPI.
• Большинству приложений нужна гибридная схема, а не только облако. Запускайте модели на устройстве (Core ML, LiteRT, MediaPipe, Gemini Nano, Apple Foundation Models) для задач, где важны низкая задержка и защита приватности; обращайтесь к облачной LLM только тогда, когда глубина рассуждений оправдывает дополнительную задержку в 1–3 секунды и стоимость за токен.
• Закладывайте реалистичный бюджет. Разработка MVP мобильного приложения с ИИ обойдётся примерно в 2–6 млн ₽ при использовании подхода Agent Engineering. Полноценная гибридная сборка под продакшн — от 6 до 22,5 млн ₽, а ежемесячные расходы на инференс — от 22,5 тыс. до 1,3 млн ₽ в зависимости от DAU и качества промптов.
• Пять ошибок губят большинство проектов. Утечки данных, предвзятые модели, задержка p95 выше трёх секунд, быстрое разряжение батареи на старых устройствах и зависимость от одного поставщика LLM — от каждой из них можно защититься, следуя чек-листу из раздела 15.
• Не применяйте ИИ повсюду без необходимости. Если у вас нет базовой версии для A/B-тестирования, размеченных данных или есть требование к офлайн-работе с задержкой менее 100 мс, а модель не помещается на устройство — отложите эту функцию и сначала выпустите версию без ИИ.
Это руководство объясняет, как добавить ИИ в мобильное приложение — так, как это сделала бы реальная команда разработки в 2026 году. Здесь — реальные цифры, чёткая схема принятия решений и компромиссы, которые действительно важны. Оно адресовано продуктовым руководителям, CTO и основателям, которые решают, стоит ли внедрять ИИ в приложение под iOS, Android или кроссплатформенное, сколько это будет стоить и какой архитектурный подход выбрать. Каждый раздел отвечает на вопрос, на который иначе пришлось бы тратить неделю.
Если коротко: AI в мобильном приложении больше не опция. Только генеративные мобильные приложения с ИИ принесли 225 млрд ₽ выручки в 2025 году с ростом на 273% год к году, пользователи провели в них 48 миллиардов часов, а 63% мобильных разработчиков теперь выпускают хотя бы одну функцию с ИИ. Приложения, использующие ИИ для персонализации, показывают на 62% выше вовлечённость и на 80% лучше конверсию, чем аналоги без ИИ. Вопрос не в том, добавлять ли ИИ, — а в том, что именно, где и в каком объёме.
Почему это руководство написала Фора Софт
Фора Софт разрабатывает мобильные и кроссплатформенные решения с использованием ИИ уже 17 лет и выполнила 625+ проектов. Мы создали первый виртуальный класс на WebRTC и HTML5 для BrainCert, сеть видеоперевода с ИИ из 700+ сертифицированных переводчиков на 169 языках для Video Interpretations, конвейер обработки HDR-изображений на основе ИИ, который превращает три исходных снимка в скорректированный нейросетевой рендер, для LAYRS, а также платформу видеонаблюдения с ИИ для распознавания аномалий в реальном времени для MindBox.
Мы работаем в режиме Agent Engineering — наши старшие инженеры пишут код вместе с AI-агентами, которые берут на себя рутинные задачи: генерируют шаблонный код, тесты и помогают при рефакторинге. Поэтому сроки и стоимость в этой статье на 15–30% ниже средних по рынку: гибридный мобильный MVP с использованием ИИ мы создаём за 4–8 недель, а не за 10–16, как обычно. Мы не завышаем оценки, поэтому приведённые ниже суммы в рублях — консервативные и обоснованные.
Прорабатываете AI-функции для своего мобильного приложения?
Свяжитесь с нами — мы подберём подходящий вариант: на устройстве, в облаке или гибридный, и дадим точную оценку в рублях. Без лишних слов.
Позвоните нам →
Напишите нам →
Состояние ИИ в мобильных приложениях в 2026 году — цифры, которые важны
Прежде чем выбирать фреймворк, свяжите обсуждение с тем, что реально вышло в прошлом году. Эти шесть цифр задают отправную точку для любого решения по AI-функциям, которое вы примете в 2026 году.
| Показатель |
Цифра за 2025 |
Что это значит для вас |
| Выручка мобильных приложений с генеративным ИИ |
225 млрд ₽, +273% год к году |
Самостоятельное AI-приложение теперь — полноценный продукт, а не просто функция. |
| Время в приложениях с генеративным ИИ |
48 млрд часов (×3,6 к 2024) |
Привычка у пользователей сформировалась — ассистенты теперь конкурируют с вашим приложением за время сессии. |
| Внедрение разработчиками |
63% выпускают не менее одной AI-функции |
Не выпускать ИИ в 2026 году — это уже конкурентное отставание, а не нейтральный выбор. |
| Прирост вовлечённости от персонализации |
+62% вовлечённости, +80% конверсии |
Одни только AI-рекомендации влияют на финансовый результат. |
| Пользователи мобильных AI-ассистентов (США) |
200 млн+ (110 млн — только на мобильных) |
Пользователи ожидают, что голосовой и текстовый ИИ будет работать везде. |
| Прогноз Gartner |
Использование мобильных приложений снизится на 25% к 2027 году (из-за AI-ассистентов) |
Приложения без встроенного ИИ будут терять пользователей в пользу системных ассистентов. |
Прочитайте строку про Gartner внимательно. Приложения, которые не внедрят AI, не просто остановятся в развитии — к 2027 году они потеряют 25% сессий в пользу Apple Intelligence, Gemini и Copilot. Встраивание AI в приложение — это в той же мере оборонительный ход, что и наступательный.
Пять категорий AI-функций, которые реально работают
Девяносто процентов успешных мобильных функций на основе ИИ попадают в одну из пяти категорий. Выбирайте категорию до того, как выбирать фреймворк.
Персонализация и рекомендации
Netflix сообщает, что 80% просмотренных тайтлов приходят из AI-рекомендаций. Модель адаптивного обучения Duolingo обеспечила рост аудитории на 51% и увеличение удержания на второй день на 12%. Движок Deep Brew у Starbucks анализирует 100 млн транзакций в неделю и добавляет 15% к продажам и 12% к среднему чеку. Рекомендательные движки по-прежнему — AI-функция с самой высокой отдачей, которую вы можете запустить в 2026 году.
Берите персонализацию, когда: у вас уже есть поведенческие данные хотя бы по 10 000 пользователей в месяц и хотя бы одно измеримое конверсионное событие — например, покупка, завершение урока или продление подписки.
Разговорный AI и LLM-агенты
Чат-боты на GPT-5, Claude Opus 4.6 или Gemini Pro заменяют формы на естественный диалог, снижают нагрузку на поддержку на 30–70% и могут участвовать в звонках в реальном времени (см. наше руководство по видео-AI-агентам). Главная проблема — стоимость: чат-бот при 1 млн DAU будет тратить 2,25–4,5 млн ₽ в месяц на токенах, если не кэшировать промпты и не направлять простые запросы на более дешёвые тарифы.
Берите LLM-агента, когда: задача связана со свободным текстом, многошаговым рассуждением или резюмированием — и вы готовы принять задержку на 95-м перцентиле 1–3 с и стоимость 0,075–0,75 ₽ за одно взаимодействие.
Компьютерное зрение
Обнаружение объектов, распознавание текста, сканирование штрихкодов, разметка лиц, определение позы, сегментация и наложение AR-эффектов. Google Lens, Apple Visual Look Up, фильтры в TikTok и Snapchat — всё это работает на основе таких моделей. Современные мобильные NPU (Apple Neural Engine, Qualcomm Hexagon) обрабатывают кадр 640×640 менее чем за 20 мс, поэтому камерные функции в реальном времени по задержке фактически бесплатны, если вы используете MediaPipe или Core ML.
Используйте компьютерное зрение на устройстве, когда: функция зависит от камеры, важна конфиденциальность данных или работа должна идти без интернета — для всех остальных случаев облачные API, например AWS Rekognition, запускаются быстрее, но стоят 0,075–0,9 ₽ за изображение.
Голос, звук и эмоции
Распознавание речи в реальном времени (Whisper, Apple SpeechAnalyzer, Android SpeechRecognizer), синтез речи, выделение ключевых слов и распознавание эмоций в реальном времени. Whisper работает на устройстве со скоростью реального времени на iPhone 14 Pro и новее; классификация эмоций по голосу выполняется менее чем за 100 мс на любом флагмане 2023 года и новее. В связке с приложением для видеоконференций вы можете автоматически составлять краткие отчёты по звонкам, отмечать раздражение клиента или переводить с 30+ языков без обращения к серверу.
Берите голосовой AI, когда: руки заняты, важна доступность для людей с ограничениями или ввод пользователя длинный и печатать неудобно.
Предиктивная аналитика и обнаружение мошенничества
Прогноз оттока, склонность к покупке, прогноз завершения сессии, динамическое ценообразование, скоринг мошенничества и обнаружение аномалий. American Express предотвращает 150 млрд ₽ потерь от мошенничества в год благодаря анализу транзакций в реальном времени; Mastercard учитывает 200+ переменных при каждой авторизации из 1,3 млрд транзакций в день и сократила количество ложных отклонений вдвое. Такие модели обычно небольшие, недорогие в обучении и работают на сервере — мобильное приложение лишь отображает результат.
Берите предиктивную аналитику, когда: у вас есть не менее 50 000 исторических событий с размеченным целевым исходом, и решение, которое даёт модель, имеет чёткое финансовое последствие.
На устройстве, в облаке или гибридно? Решение, которое нельзя перепоручать
Это самый важный архитектурный выбор в мобильном приложении с ИИ. Ошибётесь — и либо разорите облачный бюджет, либо выпустите функцию, которая быстро сажает батарею, либо будете переделывать стек на второй год.
AI на устройстве
Модель поставляется в составе приложения (или скачивается при первом запуске) и работает локально на NPU устройства. Время выполнения инференса — от 10 до 200 мс. Обработка данных остаётся приватной, работает без интернета и бесплатна при каждом запуске. Ограничения связаны с размером и возможностями модели: до 50 МБ — для большинства приложений, до 7–8 ГБ — для базовых моделей на устройстве, таких как Apple Foundation Models (iOS 18+) или Gemini Nano (Pixel 9+, Galaxy S26+).
Облачный ИИ (через API)
Вы обращаетесь к OpenAI, Anthropic, Google, AWS или Azure со своего бэкенда и передаёте результат в приложение. Вы получаете возможности уровня передовых решений и мгновенные обновления моделей, но платите за токен или за запрос, добавляете 1–3 с к задержке на 95-м процентиле и передаёте персональные данные третьей стороне, если не шифруете их и не заключаете договоры должным образом. Грубая прикидка: LLM-функция среднего размера при 100 тыс. DAU с пятью вызовами на пользователя в день обходится примерно в 375 тыс. ₽ в месяц по ценам GPT-5.
Гибрид — правильный выбор по умолчанию на 2026 год
Большинство продакшн-приложений должны быть гибридными: на устройстве — для задач с низкой задержкой, требующих приватности и работающих без интернета; в облаке — для сложных вычислений и анализа данных. Банковское приложение помечает подозрительные транзакции на устройстве за менее чем 50 мс, а затем передаёт их в облачную модель мошенничества для детального анализа. Приложение для e-commerce распознаёт товар по фото на устройстве, а затем обращается к облачному рекомендательному сервису, чтобы ранжировать связанные товары.
Сравнительная таблица фреймворков и API
Двенадцать серьёзных вариантов, две страницы компромиссов. Это шпаргалка, которую мы используем внутри Форс Софт при проработке новой мобильной AI-функции.
| Фреймворк / API |
Платформа |
Лучше всего для |
Типичная задержка |
Структура затрат |
| Core ML |
iOS, macOS, watchOS |
Зрение и NLP на устройстве с Apple Neural Engine |
< 100 мс |
Разовая, внутри приложения |
| Apple Foundation Models |
iOS 18+, macOS 15+ |
LLM на устройстве, резюмирование, инструменты письма |
< 500 мс |
Бесплатно (в составе ОС) |
| TensorFlow Lite / LiteRT |
Android, iOS, Web |
Кроссплатформенное ML на устройстве |
< 200 мс |
Разовая, внутри приложения |
| MediaPipe |
Android, iOS, Web |
Поза, руки, лицо, жесты, сегментация |
< 100 мс |
Разовая, внутри приложения |
| ML Kit (Google) |
Android, iOS |
Распознавание текста, штрихкоды, перевод, обнаружение лиц |
50 мс–2 с |
Бесплатный тариф + оплата за запрос |
| Gemini Nano (AICore) |
Android (Pixel 9+, S26+) |
LLM на устройстве, резюмирование, подсказки ответов |
< 1 с |
Бесплатно (в составе ОС) |
| ONNX Runtime Mobile |
Android, iOS, Web |
Переносимые модели между фреймворками |
< 300 мс |
Разовая, внутри приложения |
| OpenAI API (GPT-5) |
Облако |
Рассуждения, код и зрение уровня state-of-the-art |
1–3 с |
93,75–750 ₽ за 1 млн токенов |
| Anthropic Claude API |
Облако |
Рассуждения с длинным контекстом, анализ, код |
1–3 с |
75–1 875 ₽ / 1 млн токенов (скидка 50% при батч-обработке) |
| Google Gemini API |
Облако |
Мультимодальность, экономичный текст и зрение |
1–2 с |
6–375 ₽ / 1 млн токенов |
| AWS Rekognition |
Облако |
Анализ изображений и видео, модерация |
500 мс–2 с |
0,075–0,9 ₽ за изображение |
| Azure Cognitive Services |
Облако |
Корпоративное видение, стиль общения, язык |
500 мс–2 с |
За запрос + подписка |
Правило большого пальца: начинайте с нативного фреймворка вашей платформы (Core ML на iOS, ML Kit на Android) и переходите к TensorFlow Lite или ONNX только если нужна модель, которой нет нигде больше. Используйте облачный API только тогда, когда задача требует действительно сложных вычислений.
Эталонная архитектура гибридного мобильного приложения с ИИ
Каждое мобильное приложение с ИИ, которое мы выпускаем, строится по одному и тому же пятислойному шаблону. Эти слои не зависят от используемых технологий — вы можете заменить Swift на Kotlin, Core ML на LiteRT или GPT-5 на Claude, не меняя саму структуру.
1. Слой ввода. Камера, микрофон, текстовое поле, датчики. Здесь проводите локальную предобработку — обрезайте изображение до 640×640, удаляйте EXIF, снижайте частоту звука до 16 кГц. Никогда не отправляйте необработанные данные в облако.
2. Слой инференса на устройстве. Core ML, LiteRT, MediaPipe, Foundation Models, Gemini Nano. Отвечает за задачи, где важны низкая задержка или защита приватности. Возвращает структурированный результат (JSON) и оценку уверенности.
3. Слой оркестрации. Тонкий маршрутизатор на устройстве, который решает: использовать локальный результат, отправить запрос в облако или попросить пользователя уточнить данные. Используйте пороги уверенности (например, при значении ниже 0,85 — эскалировать).
4. Слой облачного инференса. Ваш бэкенд обращается к LLM или API компьютерного зрения. Всегда используйте кэширование. Всегда ограничивайте частоту запросов. Если поставщик недоступен — плавно переходите на резервный вариант с более простой и дешёвой моделью.
5. Слой обратной связи. Логируйте правки пользователей, лайки и дизлайки, явные оценки и неявные сигналы (оставили ли они предложенный результат?). Эти данные станут эталоном для дообучения модели.
Нужно второе мнение по поводу «на устройстве или в облаке»?
Опишите свой сценарий — мы ответим в течение рабочего дня с рекомендацией по фреймворку, оценкой задержек и архитектурной схемой в три строки.
Позвоните нам →
Напишите нам →
Модель затрат — сколько на самом деле стоит мобильное приложение с ИИ в 2026 году
Бюджеты — то, на чём спотыкается большинство мобильных AI-проектов. Есть две статьи расходов: сама сборка и ежемесячный счёт за инференс. Считайте их раздельно.
Разовая стоимость сборки (по нашим тарифам Agent Engineering)
| Объём |
Пример функции |
Сроки |
Ориентировочная стоимость |
| Одна функция на устройстве |
Сканирование документа + OCR |
4–8 недель |
2–6 млн ₽ |
| Гибрид среднего размера |
Зрение на устройстве + облачный LLM-чат |
8–14 недель |
6–13,5 млн ₽ |
| Полноценный гибрид под продакшн |
Оркестрация нескольких моделей, RAG, мониторинг |
14–22 недели |
11,2–22,5 млн ₽ |
| Корпоративная платформа |
Регулируемая отрасль (здравоохранение / финтех), несколько регионов, SLA |
22+ недели |
от 22,5 млн ₽ |
Ежемесячная стоимость инференса — разбор на примере
Допустим, у приложения 100 000 активных пользователей в день. Каждый из них делает по пять запросов к LLM в день. Средний объём ввода — 800 токенов, вывода — 400 токенов. Получается 500 млн входных токенов и 250 млн выходных в месяц.
На GPT-5 (93,75 ₽ за ввод, 750 ₽ за вывод на 1 млн токенов) ежемесячный счёт составит 46 875 + 187 500 = 234 375 ₽ в месяц. При 50% кэширования промптов стоимость ввода снижается до 23 475 ₽ — 210 975 ₽ в месяц. С маршрутизацией моделей (70% простых запросов направляются на более дешёвый тариф) — примерно 120 000 ₽ в месяц.
На Gemini Flash та же нагрузка обходится примерно в 8 625 ₽ в месяц — но Flash хуже справляется с многошаговыми рассуждениями, поэтому его обычно используют через маршрутизатор, а не заменяют им GPT-5 полностью.
Чисто на устройстве (Foundation Models или Gemini Nano): 0 ₽ за инференс. Вы платите только за хостинг, телеметрию и обновление моделей — обычно 22,5 тыс.–112 500 ₽ в месяц.
Мини-кейс — масштабирование Video Interpretations до 700+ переводчиков
Американская компания, занимающаяся переводом, пришла к нам с веб-инструментом бронирования и нестабильной системой звонков на базе WebRTC. Клиенты из сферы здравоохранения требовали соответствия HIPAA; юридические клиенты нуждались в подключении менее чем за секунду; переводчики хотели работать с мобильных телефонов.
Наш план на 12 недель: пересобрать мобильное приложение на базе WebRTC с распознаванием речи на устройстве, внедрить облачный LLM-конвейер по соглашению BAA для создания резюме звонков и добавить AI-движок маршрутизации, который за миллисекунды подбирает для звонящего ближайшего доступного сертифицированного переводчика по языку.
Результат: платформа теперь поддерживает 700+ сертифицированных переводчиков на 169 языках, включая американский язык жестов, с видео, соответствующим стандарту HIPAA, автоматическими расшифровками сессий и распределённой командой, работающей полностью с мобильных устройств. Средняя стоимость одного перевода снизилась, а охват редких языков вырос. Хотите аналогичную оценку для своего приложения? Позвоните или напишите нам.
Как внедрить ИИ в мобильное приложение, шаг за шагом
Относитесь к AI как к программе поставки из четырёх этапов, а не как к спринту. У каждого этапа есть чёткий критерий завершения.
Фаза 1 — Исследование (1–2 недели)
Выберите одну точку, где пользователь испытывает трудности. Измерьте исходные показатели: среднее время выполнения задачи, долю отказов, количество обращений в поддержку. Определите целевой KPI и минимальный эффект, который можно будет зафиксировать. Если на эти три вопроса ответить не удаётся — проект не готов.
Фаза 2 — Проверка концепции (2–4 недели)
Соберите простейший конвейер из готовых API. Протестируйте его на данных 50–100 реальных пользователей. Измерьте точность, задержку (p50/p95), стоимость одного инференса и субъективную удовлетворённость. Примите решение: продолжать, изменить направление или закрыть проект.
Фаза 3 — Пилот (4–8 недель)
Выпустите фича-флаг для 5–10% пользователей. Проведите A/B-тест с контрольной группой без AI. Отслеживайте p95-задержку, частоту сбоев, стоимость инференса и основной KPI. Имейте запасной путь, который отключает AI, если будет превышен любой порог.
Фаза 4 — Масштабирование и поддержка (постоянно)
Доведите до 100% за 2–4 недели. Настройте мониторинг дрейфа модели, оповещения и конвейер дообучения. Установите ограничения по стоимости. Пересматривайте KPI ежемесячно, дообучайте модель раз в квартал и проверяйте на предвзятость дважды в год.
Оптимизация моделей под мобильные устройства — квантизация, прунинг, дистилляция
AI на устройстве живёт и умирает размером модели. Три техники уменьшают исследовательскую модель с 200 МБ до 5–20 МБ — тех, что реально влезают в сборку приложения.
Квантизация переводит 32-битные числа с плавающей точкой в 8- или 4-битные целые. Уже одно это уменьшает размер модели в 4–8 раз. Обучение с учётом квантизации (QAT) позволяет сохранить точность — потери не превышают 2%.
Прунинг удаляет связи с низким весом. Разреженность 30–60% сохраняет точность, при этом сокращая время инференса на 40%.
Дистилляция знаний обучает маленькую модель-«ученика» копировать поведение большой модели-«учителя». Дистиллированный «ученик» с 200 млн параметров на узких задачах может достичь 80% эффективности «учителя» с 7 млрд параметров, при этом требуя в десять раз меньше памяти.
В сочетании эти три техники стабильно уменьшают размер мобильных моделей с 200 МБ до 5–15 МБ при потере точности 1–3%. Это и есть разница между исследовательским прототипом и функцией, которую можно выпустить.
Приватность, GDPR, HIPAA и EU AI Act
AI-функции, которые затрагивают персональные данные, регулируются. Четыре правила помогут избежать проблем.
1. Согласие и минимизация. Собирайте только те данные, которые действительно нужны модели. Объясняйте пользователям, зачем они нужны, простым и понятным языком. Дайте возможность отказаться от сбора и удалить свои данные в любой момент.
2. На устройстве — для чувствительных данных. Медицинские, финансовые, биометрические данные и данные несовершеннолетних должны оставаться на устройстве, если модель работает там же. Это самый простой способ соответствовать HIPAA — никакие персональные медицинские данные не покидают телефон.
3. Соглашения BAA и DPA с каждым поставщиком. Если вы передаёте PHI или персональные данные граждан ЕС в OpenAI, Anthropic, AWS, Azure или Google, заключите Business Associate Agreement (BAA) по HIPAA и Data Processing Addendum (DPA) по GDPR. Без подписанного соглашения передача данных невозможна.
4. Готовность к EU AI Act. Определите уровень риска своей функции (минимальный, ограниченный, высокий, неприемлемый). Функциям высокого риска — например, медицинская диагностика, кредитный скоринг, биометрическая идентификация — требуются документированные оценки воздействия, контроль со стороны человека и проверки на предвзятость. Начинайте оформлять документы до написания кода, а не после.
Схема принятия решений — выберите подходящую AI-функцию за пять вопросов
Хватит спорить о фреймворках. Сначала ответьте на эти пять вопросов.
1. Какой измеримый KPI сдвинет эта функция? Если вы не можете назвать его и измерить уже сегодня — не стройте функцию.
2. Задача критична к задержке (< 300 мс) или чувствительна к приватности? Если да, проектируйте в первую очередь под инференс на устройстве. Если нет, облачный API обычно быстрее в запуске.
3. Есть ли у вас ≥ 10 000 размеченных примеров? Если меньше — используйте готовый API или предобученную открытую модель. Не обучайте модель с нуля.
4. Какова стоимость одного инференса при целевом DAU? Спрогнозируйте на 12 месяцев вперёд. Если ежемесячный счёт при масштабе первого года превышает 15% выручки — архитектура выбрана неправильно.
5. Что станет запасным вариантом, когда AI откажет? Если пути без AI не существует — AI-функция хрупкая. Стройте оба.
Пять ошибок, которые топят мобильные AI-проекты
1. Дыры в защите данных. Отправка персональных данных или медицинской информации в облачный API без соглашений о конфиденциальности — самый быстрый путь к судебному иску. Штрафы по GDPR могут достигать €15 млн или 3% мировой выручки компании; нарушения HIPAA облагаются штрафами от 7 500 до 112 500 000 ₽ за каждый инцидент. Что делать: обрабатывать чувствительные данные на устройстве, заключать подписанные соглашения с поставщиками, проводить и документировать оценку воздействия на защиту персональных данных (DPIA).
2. Предвзятые или неточные модели. Модели, обученные на перекошенных данных, могут дискриминировать недопредставленные группы — и теперь за это предусмотрена ответственность по EU AI Act. Что делать: разбивайте точность по демографическим признакам (возраст, пол, тон кожи, диалект), публикуйте карточку модели, используйте Fairlearn или AI Fairness 360.
3. Задержка, которая ломает UX. Если p95-задержка превышает 2–3 с при интерактивном действии на переднем плане, 20–30% пользователей откажутся от функции. Что делать: измеряйте p95, а не среднее значение, переносите критичные операции на устройство, добавьте таймаут в 2 с с альтернативным путём без использования AI.
4. Разряд батареи на старых устройствах. Запуск неоптимизированных моделей на CPU или GPU вместо NPU расходует на 10–20% больше заряда за час использования. Это вызывает негативные отзывы — в одну звезду. Что делать: применяйте квантизацию, явно настраивайте работу на NPU, измеряйте энергопотребление на реальных устройствах, добавьте переключатель «Лайт» для старых устройств.
5. Привязка к поставщику. Чат-бот, привязанный к одному поставщику LLM, может одним изменением цен разрушить вашу юнит-экономику. Что делать: абстрагируйте поставщика за интерфейсом, держите второго поставщика на подхвате, по возможности используйте ONNX для переносимости на устройстве, ограничивайте ежемесячные траты на каждого поставщика.
KPI — что измерять с первого дня
Три корзины, девять метрик — и не больше.
KPI качества. Точность (общая и по подгруппам), точность срабатывания (precision), полнота (recall). Пороги зависят от задачи, но выпускайте при ≥ 90% на зрении, ≥ 80% на классификации в NLP, ≥ 0,8 по F1 везде, где вредны и ложноположительные, и ложноотрицательные срабатывания. Аудируйте точность по подгруппам ежеквартально.
Бизнес-метрики. Прирост конверсии по сравнению с контрольной группой, скорость освоения функции, удержание на 2-й, 7-й и 30-й день, средний чек, снижение обращений в поддержку. Цель — рост основного показателя на 10% и выше. Ниже — и искусственный интеллект не окупается.
KPI надёжности. Задержка p50, p95, p99. Стоимость инференса на сессию. Время доступности модели (≥ 99,5%). Частота сбоев в коде с AI (< 0,1%). Дрейф модели (дообучайте, если точность упадёт ниже 90% от значения на день запуска).
Чек-лист перед запуском — двенадцать пунктов, которые мы всегда соблюдаем
Прежде чем любая мобильная AI-функция запускается на 100%, мы проходим двенадцать проверок. Если хотя бы одна не проходит — релиз блокируется.
- Целевой KPI измерим, базовое значение зафиксировано.
- Инфраструктура A/B-тестов запущена с холдаут-группой не менее 10%.
- p95-задержка на самом старом поддерживаемом устройстве укладывается в бюджет.
- Влияние на батарею измерено и составляет < 5% дополнительно за час активного использования.
- Точность измерена как минимум по трём демографическим группам.
- Запасной путь существует и автоматически активируется при таймауте или ошибке.
- Соглашение BAA / DPA с поставщиком подписано и сохранено.
- Обработка персональных данных и медицинских сведений задокументирована в DPIA.
- Ежемесячная стоимость инференса рассчитана на основе DAU за первый год и сопровождается оповещением при достижении жёсткого лимита.
- Мониторинг дрейфа модели запущен с оповещением при падении точности ниже 90% на день запуска.
- Сбор обратной связи (лайки / правки) подключён к конвейеру дообучения.
- Фича-флаг «аварийного выключения» позволяет отключить AI-функцию удалённо, не выпуская новый релиз.
Когда не стоит добавлять ИИ в мобильное приложение
Четыре ситуации, когда стоит отказаться от использования ИИ.
Более простое решение — дешевле. Если переработанная форма, значение по умолчанию или более короткий онбординг решают проблему — начните с них. Искусственный интеллект — это лишние накладные расходы, которые вам не нужны.
У вас нет данных и нет способа их получить. Ниже 1 000 размеченных примеров даже предобученные модели работают плохо. Потратьте квартал на инструментирование приложения и сбор событий, прежде чем что-либо обучать.
Решение слишком ответственно для частичной автоматизации. Медицинская диагностика, юридические вердикты, кредитные решения — ИИ может помогать, но не должен принимать решение самостоятельно. Если вы не можете обеспечить участие человека в процессе — отложите внедрение функции.
Вы не можете измерить эффект. Если нет A/B-инфраструктуры, базового KPI и минимального обнаружимого эффекта — AI-функция превращается в метрики тщеславия в красивой обёртке. Сначала настройте измерение.
Шесть мобильных функций с искусственным интеллектом, которые стоит взять на вооружение в 2026 году
Вместо того чтобы создавать новую AI-функцию с нуля, начните с тех, что уже приносят деньги в чужом бизнесе. Эти шесть паттернов проверены, хорошо задокументированы и легко адаптируются для большинства B2B- и B2C-приложений.
1. Ранжирование контента в духе Netflix. Персональное ранжирование каталога на основе сигналов вовлечённости. 80% того, что смотрят пользователи Netflix, появляется благодаря этому подходу. Уловка для мобильных устройств — заранее рассчитать ранжированный список на сервере, а затем переранжировать топ-200 позиций на устройстве по последним десяти действиям пользователя. Это позволяет прокрутке ощущаться мгновенной даже при слабом интернете.
2. Адаптивная сложность в духе Duolingo. Простая модель машинного обучения предсказывает, какое слово или понятие пользователь забудет следующим, и планирует его повторение. Duolingo сообщает о приросте удержания на второй день на 12% благодаря этому подходу. Такой метод недорог в реализации, хорошо вписывается в любой геймифицированный интерфейс и работает даже на слабых устройствах.
3. Персонализированные предложения в духе Starbucks. Генерация предложений под каждого пользователя на основе истории покупок и контекста — времени, погоды, местоположения. Deep Brew добавляет 1 125 ₽ на каждые 100 транзакций по сравнению с контрольной группой. На мобильном приложении выводите предложение первой карточкой при открытии — пустой экран — это зона с наибольшей вовлечённостью.
4. Скоринг мошенничества в духе American Express. Анализ транзакций в реальном времени, который блокирует подозрительные операции до завершения оплаты. American Express предотвращает 150 млрд ₽ в год убытков от мошенничества. На мобильном устройстве запускайте лёгкий классификатор поведения (например, ритм набора текста, паттерны навигации) и отправляйте оценку уверенности в облако — там облачный скорер принимает окончательное решение.
5. Видеоэффекты на устройстве в духе TikTok. Сегментация на MediaPipe и шейдеры генеративных эффектов создают фильтры, которые выглядят живыми. Паттерн: используйте NPU для построения масок сегментации, обрабатывайте каждый кадр на устройстве и отправляйте в облако только превью при публикации. Используйте этот подход как шаблон для любых творческих функций на основе камеры.
6. Голосовое резюме в духе банков. Whisper работает на устройстве в реальном времени; послезвонковая облачная LLM формирует письменное резюме с пунктами действий. Банковское или медицинское приложение с таким подходом сокращает среднее время обработки обращения на 30–50%. Добавьте запрос согласия и срок хранения — и вы пройдёте большинство проверок регулятора.
Частые вопросы
Стоит ли создавать собственную AI-модель или использовать облачный API?
Примерно для 80% мобильных AI-функций правильный выбор — готовый API или предобученная открытая модель: они дешевле, быстрее в внедрении и сопряжены с меньшими рисками. Обучайте собственную модель только в том случае, если у вас есть не менее 10 000 размеченных примеров, уникальное преимущество в данных и измеримый разрыв в точности между готовым решением и тем, что нужно вашим пользователям.
Сколько стоит мобильное приложение с AI в 2026 году?
Одна функция на устройстве обходится примерно в 2–6 млн ₽ при разработке нашей командой Agent Engineering за 4–8 недель. Полноценное гибридное приложение для продакшена с оркестрацией нескольких моделей стоит 11,2–22,5 млн ₽ и реализуется за 14–22 недели. Ежемесячные расходы на инференс — от 22,5 тыс. до 1,3 млн ₽ в зависимости от DAU и выбранной архитектуры: работа только на устройстве, только в облаке или гибридная.
Будут ли AI-функции сажать батареи пользователей?
Нет, если вы ориентируетесь на NPU. Apple Neural Engine и Qualcomm Hexagon NPU специально созданы для энергоэффективного выполнения задач ИИ — квантизированная модель компьютерного зрения обрабатывает кадр 640×640 менее чем за 20 мс с минимальным расходом заряда батареи. Запуск той же модели на CPU или GPU — антипаттерн, который быстро разряжает аккумулятор.
Соответствует ли AI на устройстве требованиям HIPAA по умолчанию?
Инференс на устройстве решает главную проблему HIPAA — передачу PHI третьим лицам, — но сам по себе не делает приложение автоматически HIPAA-совместимым. Вам всё равно нужно шифрование данных в покое, контроль доступа, ведение журнала обращений, процедуры реагирования на утечки, соглашение о сотрудничестве (Business Associate Agreement) с любым используемым облачным провайдером и документированный анализ рисков. Фора Софт выпускает HIPAA-совместимые мобильные платформы с 2019 года.
Какую LLM выбрать для мобильного чат-бота — GPT-5, Claude или Gemini?
Единственно правильного ответа нет; стоит подключить как минимум двух поставщиков за маршрутизатором. Используйте GPT-5 для общего чата и написания кода, Claude Opus 4.6 — для рассуждений с длинным контекстом и анализа документов, Gemini Flash — для чувствительных к стоимости высоконагруженных сценариев, а Haiku 4.5 — для дешёвых запасных вариантов. Маршрутизируйте запросы по сложности и активно используйте кэширование.
Сколько ждать до окупаемости мобильной AI-функции?
Быстрые победы — персонализация, обнаружение мошенничества, рекомендации — обычно выходят на положительную юнит-экономику за 3–6 месяцев. Функциям с длинным хвостом, таким как генерация контента или сложные агентные сценарии, требуется 12–18 месяцев. Постоянно отслеживайте промежуточные KPI (конверсию, удержание, отток); не ждите роста выручки, чтобы понять, верное ли вы выбрали направление.
Что будет, если AI-модель со временем начнёт работать хуже?
Дрейф модели — это нормально: статистическое распределение реальных данных со временем меняется из-за сдвига в поведении пользователей, на рынке и в продукте. Контролируйте точность модели раз в неделю, запускайте дообучение, если она упадёт ниже 90% от значения на день запуска, и всегда держите под рукой проверенную предыдущую версию на случай отката. Инструменты вроде Evidently AI, Fiddler или AWS SageMaker Model Monitor автоматизируют этот процесс.
У кого лучше инструментарий для AI в 2026 году — у iOS или Android?
Оба отличны и разные. У iOS более тесная интеграция с «железом» (Neural Engine), более строгие настройки приватности по умолчанию и теперь Apple Foundation Models доступны системно в iOS 18+. У Android — большее разнообразие устройств, готовые API в ML Kit, а также поддержка Gemini Nano на Pixel 9+ и Galaxy S26+. Кроссплатформенные приложения обычно используют Core ML на iOS, LiteRT на Android и одни и те же обученные веса модели через ONNX.
Что почитать дальше
Готовы преобразить своё мобильное приложение с помощью ИИ?
План теперь ясен. Выберите один сценарий, связанный с KPI. По умолчанию используйте гибридную архитектуру. Начните с готовых API, переходите на устройство ради снижения задержки и повышения приватности, а облачную LLM оставьте для действительно сложных задач. Закладывайте 2–22,5 млн ₽ на разработку и 22,5 тыс.–1,3 млн ₽ в месяц на инференс, а также предусмотрите резервный путь для каждой функции.
Измеряйте точность по подгруппам, задержку на 95-м перцентиле и стоимость на сессию с первого дня. Подписывайте BAA и DPA до передачи любого байта PII. Избегайте привязки к поставщику с помощью маршрутизатора на несколько провайдеров. И помните: не каждой функции нужен ИИ — часто более простое решение с точки зрения UX оказывается лучшим.
Фора Софт прошла этот путь на 625+ проектах. Если вам нужен второй взгляд на дорожную карту по мобильному ИИ — или команда, чтобы реализовать её вместе с вами, — быстрее всего просто связаться с нами.
Давайте создадим мобильное приложение с использованием ИИ
Расскажите нам о функции, пользователе и KPI — мы вернёмся с точной оценкой в рублях, рекомендацией по стеку и сроками поставки в течение одного рабочего дня.
Позвоните нам →
Напишите нам →