Задача
Нужно было научить LLM работать с динамическим мобильным интерфейсом, не выдумывать элементы, корректно переводить решение в ADB-команду, останавливаться при зацикливании и запрашивать подтверждение перед критичными действиями.
AI AGENTS / MOBILE AUTOMATION / ANDROID
AI Mobile Agent принимает задачу на естественном языке, наблюдает текущее состояние Android-устройства, выбирает одно следующее действие и выполняет его через ADB. Продукт поддерживает визуальное распознавание по скриншоту и текстовый режим по UI-дереву, сохраняя единый управляемый цикл наблюдения, решения и действия.
Для чего создан AI Mobile Agent
Большинство мобильных сценариев нельзя надёжно описать набором фиксированных координат: экран меняется, элементы перемещаются, а промежуточное состояние зависит от предыдущих шагов. Агент превращает пользовательское намерение в последовательность контекстных действий и каждый раз сверяется с фактическим интерфейсом.
Продукт рассчитан на команды мобильной автоматизации, QA-инженеров и разработчиков операционных AI-агентов. Он подходит для управляемых сценариев в Android-эмуляторе или подключённом устройстве, где важно видеть ход выполнения, ограничивать действия и воспроизводить каждый шаг.
Нужно было научить LLM работать с динамическим мобильным интерфейсом, не выдумывать элементы, корректно переводить решение в ADB-команду, останавливаться при зацикливании и запрашивать подтверждение перед критичными действиями.
Реализованы два контура наблюдения: vision-агент анализирует скриншот, а text-only агент получает компактное представление uiautomator XML. Оба работают пошагово, используют ограниченный набор действий, проверку результата, лимиты и слой безопасности перед исполнением через ADB.
Возможности
Функции собраны вокруг рабочего сценария и связаны общим состоянием, контролем и аналитикой.
Vision-контур делает скриншот Android, передаёт его мультимодальной модели и получает следующее действие с координатами и причиной.
Text-only контур преобразует uiautomator XML в компактный список элементов с ролями, подписями, состояниями и границами.
Агент умеет нажимать, вводить текст, прокручивать, возвращаться назад, переходить домой, ждать и завершать задачу.
OpenAI-compatible клиент позволяет использовать текстовые модели через настраиваемый endpoint, а отдельный контур работает с OpenAI Vision.
Отдельные команды работают с разрешёнными каналами, проверяют контекст комментариев и блокируют создание публикации вместо ответа.
Для каждого шага сохраняются скриншот, UI XML, observation, ответ модели и выполненное действие с удалением ключей из журналов.
Итог
AI Mobile Agent сформировал единый runtime для мобильных AI-сценариев: он видит Android через изображение или структурированное UI-дерево, принимает пошаговые решения, безопасно переводит их в ADB-действия и сохраняет полный след выполнения. Команда получает основу для мобильной автоматизации, которую можно проверять, расширять и подключать к разным моделям.
Новый проект
Опишите исходную ситуацию и желаемый результат. Мы разберёмся в контексте и предложим практичный первый этап.