AI AGENTS / MOBILE AUTOMATION / ANDROID

Агент, который понимает интерфейс Android и действует в нём

AI Mobile Agent принимает задачу на естественном языке, наблюдает текущее состояние Android-устройства, выбирает одно следующее действие и выполняет его через ADB. Продукт поддерживает визуальное распознавание по скриншоту и текстовый режим по UI-дереву, сохраняя единый управляемый цикл наблюдения, решения и действия.

  • Python 3.11+
  • Android SDK / ADB
  • OpenAI Vision
  • OpenAI-compatible LLM
  • uiautomator
  • uiautomator2
  • MobileUse
  • pytest
AI Mobile Agent — превью проекта

Для чего создан AI Mobile Agent

Для чего создан AI Mobile Agent

Большинство мобильных сценариев нельзя надёжно описать набором фиксированных координат: экран меняется, элементы перемещаются, а промежуточное состояние зависит от предыдущих шагов. Агент превращает пользовательское намерение в последовательность контекстных действий и каждый раз сверяется с фактическим интерфейсом.

Кому помогает система

Продукт рассчитан на команды мобильной автоматизации, QA-инженеров и разработчиков операционных AI-агентов. Он подходит для управляемых сценариев в Android-эмуляторе или подключённом устройстве, где важно видеть ход выполнения, ограничивать действия и воспроизводить каждый шаг.

01

Задача

Нужно было научить LLM работать с динамическим мобильным интерфейсом, не выдумывать элементы, корректно переводить решение в ADB-команду, останавливаться при зацикливании и запрашивать подтверждение перед критичными действиями.

02

Решение

Реализованы два контура наблюдения: vision-агент анализирует скриншот, а text-only агент получает компактное представление uiautomator XML. Оба работают пошагово, используют ограниченный набор действий, проверку результата, лимиты и слой безопасности перед исполнением через ADB.

Возможности

Что умеет продукт

Функции собраны вокруг рабочего сценария и связаны общим состоянием, контролем и аналитикой.

01

Визуальное понимание экрана

Vision-контур делает скриншот Android, передаёт его мультимодальной модели и получает следующее действие с координатами и причиной.

02

Текстовое представление UI

Text-only контур преобразует uiautomator XML в компактный список элементов с ролями, подписями, состояниями и границами.

03

Унифицированные действия

Агент умеет нажимать, вводить текст, прокручивать, возвращаться назад, переходить домой, ждать и завершать задачу.

04

Подключение разных LLM

OpenAI-compatible клиент позволяет использовать текстовые модели через настраиваемый endpoint, а отдельный контур работает с OpenAI Vision.

05

Управляемые Telegram-сценарии

Отдельные команды работают с разрешёнными каналами, проверяют контекст комментариев и блокируют создание публикации вместо ответа.

06

Полная трассировка шагов

Для каждого шага сохраняются скриншот, UI XML, observation, ответ модели и выполненное действие с удалением ключей из журналов.

Итог

Результат

AI Mobile Agent сформировал единый runtime для мобильных AI-сценариев: он видит Android через изображение или структурированное UI-дерево, принимает пошаговые решения, безопасно переводит их в ADB-действия и сохраняет полный след выполнения. Команда получает основу для мобильной автоматизации, которую можно проверять, расширять и подключать к разным моделям.

Python 3.11+ Android SDK / ADB OpenAI Vision OpenAI-compatible LLM uiautomator uiautomator2 MobileUse pytest

Новый проект

Есть похожая задача?

Опишите исходную ситуацию и желаемый результат. Мы разберёмся в контексте и предложим практичный первый этап.