游乐游手机版
首页/AI教程/文章详情

自然语言控制手机,一条命令让AI帮你操作安卓和iOS设备

时间:2026-07-28 21:45
你有没有想过——对着手机说一句话,它就自己操作了? "打开设置,把深色模式关掉。 " "打开微信,给张三发一条消息说周五会议改到下午三点。 " "打开美团,帮我找附近评分最高的火锅店。 " 然后手机真的自己动了。自己点、自己滑、自己输入。 这不是科幻。这是 mobilerun 正在做的事情。 它是什么?

你有没有想过——对着手机说一句话,它就自己操作了?

"打开设置,把深色模式关掉。"

"打开微信,给张三发一条消息说周五会议改到下午三点。"

"打开美团,帮我找附近评分最高的火锅店。"

然后手机真的自己动了。自己点、自己滑、自己输入。

这不是科幻。这是 mobilerun 正在做的事情。

它是什么?

一句话介绍:它是一款用自然语言控制 Android 和 iOS 设备的开源 Agent 框架。

MIT 开源,Python 写的,目前在 GitHub 上接近 9000 star,900+ fork。

用自然语言控制手机,一条命令让 AI 帮你操作 Android 和 iOS 设备!

你只需要几步:

uv tool install mobilerun# 安装Mobilerun# 或uv pip install mobilerunmobilerun setup# 安装 Portal 到手机mobilerun configure# 配置你的 LLMmobilerun run "打开设置,关闭深色模式"# 执行

然后你的手机就开始自己操作了。

不需要写一行脚本,不需要 XPath,不需要定位元素。

你只需要说人话。

为什么它能冲到 9000 star?

细究起来,原因有三。

第一,它是 Agent,不是工具。

这是它与同类项目最大的区别。之前有项目定位是"给 Codex 或 Claude Code 当手脚",你得先有一个 AI Agent 来驱动它。mobilerun 不一样。它自己就是 Agent。不用装 Codex,不用开 Claude Code。给它一个 prompt,它自己看屏幕、理解界面、规划步骤、执行操作。换句话说——有些方案需要你来当大脑,而 mobilerun 自带大脑。门槛直接砍掉一半。

第二,LLM agnostic——什么模型都能接。

OpenAI、Anthropic、Gemini、DeepSeek、Ollama、OpenRouter——主流模型全支持。这意味着什么?你可以用 DeepSeek 白嫖,也可以用 Ollama 跑本地模型保护隐私。不想折腾 API 的,DeepSeek 充几块钱就能跑,对国内用户非常友好。

第三,Portal 机制——这才是真正的巧妙设计。

传统手机自动化依赖 USB 调试加 ADB 命令,你得插着线,开着调试模式。mobilerun 不一样。它在你手机上装一个 Portal App,通过无障碍服务来控制。这意味着什么?手机不需要插线,不需要在你手边——只要 Portal 在跑,就能远程控制。这就直接打开了 Cloud 模式的想象力。

两个最值得关注的功能

第一个,reasoning 模式。

简单的任务,mobilerun 直接执行。但复杂任务呢?比如"帮我订下周去上海的机票"——搜索、比价、填信息、支付,十几步操作。mobilerun 有个 --reasoning 模式,启动后用"管理者-执行者"架构:管理者负责规划,执行者逐步完成,管理者实时纠偏。这才是解决复杂多步任务的设计。

mobilerun run "帮我找联系人张三,给他发邮件" --reasoning

第二个,vision 模式。

有些 App 没做无障碍适配,界面元素全是"button"、"view",Agent 根本分不清谁是谁。

用自然语言控制手机,一条命令让 AI 帮你操作 Android 和 iOS 设备!

mobilerun 的 --vision 模式会把截图直接发给 LLM,让它像人一样"看"屏幕。还有 --vision-only 模式——完全不依赖无障碍树,纯靠视觉理解。对那些没做 accessibility 的 App 来说,这是救命稻草。

但别急着吹,三个现实问题

第一,效果取决于模型。LLM agnostic 的另一面是——模型选不好,体验就是灾难。同样一句"帮我订机票",顶尖模型和免费模型的执行效果可能天差地别。

第二,稳定性还得打磨。自然语言操控手机,本质上是概率性的。同一个任务,跑十次可能八次成功两次失败。对于个人效率、探索性场景——没问题。对于生产环境的关键路径——你还不敢完全信任它。

第三,安全风险。让 AI 直接操作你的手机——读你的消息、翻你的相册、操作你的支付——这件事本身就有风险。Portal 的权限怎么管控?Agent 的操作边界在哪?这些目前还没有标准答案。

总结

mobilerun 代表了一个方向——手机的交互方式正在被重新定义。过去 15 年,我们操作手机的方式没变过:用手指点屏幕。mobilerun 让人看到另一种可能:你说话,手机自己动。但现在还处在早期。稳定性、安全性、准确性都有提升空间。但趋势已经出来了。从"人适应机器"到"机器适应人"——这个方向不会变。

如果你对 AI 加移动端感兴趣,建议去 GitHub 跑一遍 Demo。不用写代码,三行命令,你的手机就开始自己动了。那种感觉,真的很赛博朋克。

GitHub 项目地址:github.com/droidrun/mobilerun

来源:https://juejin.cn/post/7667215324232335370
上一篇Writeonce快速高质量内容生成工具 下一篇Ollama本地安装部署与对接Codex完整教程
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。

相关推荐

补充同频道和同主题内容,方便继续浏览更多相关内容。

同类最新

继续查看同栏目最近更新的文章。

更多
CAD零基础入门教程:坐标输入、图层管理与基础绘图命令
AI教程 · 2026-09-01

CAD零基础入门教程:坐标输入、图层管理与基础绘图命令

本文面向CAD零基础学习者,系统讲解坐标输入、图层管理与基础绘图命令的核心用法。通过分步实操与常见问题排查,帮助新手建立精确绘图习惯,掌握规范出图的基础能力。

CAD从入门到项目交付:绘图、标注、图块与实战工作流
AI教程 · 2026-09-01

CAD从入门到项目交付:绘图、标注、图块与实战工作流

掌握CAD的核心在于建立“画得准、标得清、复用快、交付稳”的工作流。本文提供从环境设置、高频命令组合、标注规范、图块标准化到项目分阶段交付的完整路径,帮助初学者避免常见返工陷阱,独立完成可检查、可复用、可打印的工程图纸。

Claude Code 登录指南:个人、Teams 与企业账号区分与授权步骤
AI教程 · 2026-09-01

Claude Code 登录指南:个人、Teams 与企业账号区分与授权步骤

本文详细解析 Claude Code 登录前的账号类型区分方法,涵盖个人订阅、Teams 席位与企业 Enterprise 席位的授权路径差异。提供终端登录命令、环境变量排查及常见异常处理步骤,帮助用户快速完成正确授权并避免登录路径混淆。

Claude Code 文件修改前的权限模式配置与命令审批指南
AI教程 · 2026-09-01

Claude Code 文件修改前的权限模式配置与命令审批指南

本文详细介绍Claude Code在修改文件前的权限模式配置方法,包括defaultMode可选值、permissions allow与deny规则设置、多层级配置文件管理以及 status验证技巧,帮助开发者安全高效地使用AI编程助手。

Claude Code接入VS Code后先测扩展和终端命令
AI教程 · 2026-09-01

Claude Code接入VS Code后先测扩展和终端命令

在VS Code中接入Claude Code后,建议优先验证扩展面板与集成终端两条入口。本文提供标准检查顺序、关键命令与常见故障排查路径,帮助你快速确认环境就绪,避免后续开发受阻。