DroidRun 是一个开源的移动智能体框架,主要用于让 AI 直接控制 Android 和 iOS 手机或虚拟设备。与传统依赖固定坐标、脚本点击的自动化方式不同,它可以理解自然语言指令,通过视觉识别、任务规划和手机操作完成多步骤流程。对于开发者、测试人员和自动化爱好者来说,DroidRun 可以把 AI 模型与真实 App 连接起来,例如自动打开应用、登录账号、查询信息、执行连续操作等。同时,它提供 Python SDK 供本地开发,也规划了云端托管能力,方便进一步构建移动端自动化工作流。
DroidRun是什么?
DroidRun 是一个面向移动设备的开源 AI Agent 框架,通过大语言模型理解用户目标,再结合视觉能力和设备控制工具执行具体操作。它支持 Android 与 iOS 设备,并能够连接 Google Gemini、OpenAI GPT 系列以及通过 Ollama 运行的本地模型。开发者可以使用 Python SDK 编写自动化程序,也可以将其接入 n8n、Zapier 等工作流工具,让原本没有开放 API 的手机应用具备自动执行任务的能力。

核心功能
DroidRun 的核心价值在于把自然语言、AI 推理与手机原生操作结合起来,让复杂的移动端任务能够按照目标自动完成。对于需要跨应用操作、自动测试或提取 App 内部信息的用户,这种方式能够减少大量重复性的手动操作。
- 自然语言控制——直接描述任务目标,让 AI 理解指令并执行手机操作,降低编写固定脚本的门槛。
- 跨平台设备控制——支持 Android 与 iOS,同时覆盖实体手机和虚拟设备,方便不同测试与自动化环境使用。
- 视觉识别与任务规划——AI 可以理解屏幕内容,并根据任务目标规划多个步骤,适合连续操作和复杂流程。
- 多模型兼容——能够接入 Google Gemini、OpenAI GPT 系列,也可以通过 Ollama 使用本地大语言模型。
- Python SDK——提供开发者工具包,可以通过 Python 自定义 Agent、目标和执行逻辑。
- 自动化工作流集成——能够与 n8n、Zapier 或自定义脚本结合,把手机 App 作为自动化流程中的执行环节。
- 云端智能体能力——规划中的 Cloud 服务支持云端虚拟手机、凭据管理、并行任务和工作流录制等功能,部分能力需要等待开放。
使用场景
DroidRun 更适合那些需要让 AI 真正操作手机,而不是只生成文字或调用传统 API 的任务。它尤其适合移动端测试、跨 App 工作流以及需要访问登录后信息的自动化场景。
| 人群/角色 | 场景描述 | 推荐指数 |
|---|---|---|
| AI开发者 | 使用 Python SDK 构建移动智能体,并根据实际业务定制执行逻辑 | ★★★★★ |
| 自动化开发者 | 将手机操作接入 n8n、Zapier 等自动化流程,扩展现有工作流 | ★★★★★ |
| App测试人员 | 使用自然语言描述登录、页面跳转、数据修改等测试流程 | ★★★★☆ |
| 数据分析人员 | 在获得合法授权的情况下提取需要登录后才能查看的 App 数据 | ★★★★☆ |
| 企业自动化团队 | 通过云端虚拟设备和并行任务构建较复杂的移动自动化流程 | ★★★★☆ |
| 普通手机用户 | 尝试自动完成日常手机操作,但需要具备一定技术配置能力 | ★★★☆☆ |
操作指南
DroidRun 开源 SDK 主要通过 Python 环境运行。使用 Android 设备时,需要提前配置 ADB、开启开发者选项和 USB 调试,并准备一个可调用的 LLM API 密钥;如果使用本地模型,则可以选择 Ollama 等方案。(不同模型服务商的 API 费用和配置方式可能不同。)
- 打开 DroidRun 官方项目页面,查看当前安装要求和 SDK 文档。
- 准备 Android 手机或虚拟设备,并安装 Android SDK Platform-Tools。
- 在手机「设置」>「关于手机」中连续点击「版本号」开启开发者选项,再进入「开发者选项」开启「USB 调试」。
- 将手机连接电脑,在终端执行
adb devices,确认设备已经被 ADB 正确识别。 - 使用 Python 的
pip安装 DroidRun:pip install droidrun。 - 准备 Google Gemini、OpenAI 或其他兼容模型的 API Key,并根据所选模型完成环境配置。
- 使用 Python 创建
DroidAgent,设置任务目标、LLM 和 ADB 工具,并根据任务需要开启视觉识别和推理能力。 - 保存脚本后运行
python run_agent.py,观察智能体是否按照目标自动完成手机操作。(首次使用建议先从打开设置、查看电量等简单任务开始。)
支持平台
DroidRun 的设计目标是同时支持 Android 与 iOS,并可以控制物理设备或虚拟设备。开源 SDK 主要面向具备 Python 开发环境的用户,实际使用还需要根据设备类型配置相应的连接和调试环境。模型方面支持 Google Gemini、OpenAI 等云端模型,也支持通过 Ollama 连接本地模型。云平台则面向更托管化的使用方式,目前部分功能仍处于等待开放阶段。
产品定价
开源 SDK 免费使用,但实际运行 DroidRun 时,如果调用 Google、OpenAI 等第三方大语言模型,需要按照对应服务商的 API 使用量支付费用。Ollama 本地模型可以减少第三方模型 API 的直接调用成本,但本地运行模型仍需要承担电脑硬件、存储和运行资源等成本。DroidRun Cloud 属于后续的托管服务能力,具体订阅或使用价格应以正式上线后的官方信息为准。
常见问题
DroidRun 开源 SDK 和 Cloud 有什么区别?
开源 SDK 需要用户自己准备电脑、手机、ADB、模型等运行环境,更适合开发者进行定制。Cloud 则计划提供托管式虚拟手机、凭据管理、并行任务和工作流管理等能力,减少本地部署工作。
使用 DroidRun 一定要付费吗?
DroidRun 开源框架本身可以免费使用,但连接第三方云端大模型时可能产生 API 费用。选择本地 Ollama 模型可以避免对应的云端模型调用费用,但仍需要准备足够的本地计算资源。
DroidRun 能否使用本地模型?
可以,官方功能说明中提供了通过 Ollama 连接本地大语言模型的方式。对于涉及敏感数据或希望减少云端 API 调用的开发者,本地模型是一种可考虑的运行方案,但实际效果取决于模型能力和设备性能。
总裁说
DroidRun 的特点是让 AI 从“理解任务”进一步进入手机 App 的实际操作环节,适合移动端自动化、应用测试、跨 App 工作流和 AI Agent 开发。它的优势建立在视觉理解、任务规划和设备控制能力之上,同时也意味着配置难度会高于普通的手机自动化工具。对于开发者和技术团队,可以从开源 SDK 入手;如果只是偶尔进行简单手机操作,则需要权衡安装环境、模型调用和维护成本。