XPhoneUse让AI Agent直接操控真实手机

· 进步分子, 投稿

AI 总结 · 连续创业者视角(以下内容由 AI 提炼,观点归原作者;读完可不看原文)

XPhoneUse通过ADB镜像与技能包,让Claude/Codex等Agent直接操作真机完成多邻国学习、微信发消息等任务。文中详细复盘了AI因无障碍树失效导致“失明”的踩坑过程,展示了其自主编写OCR工具、建立“看不见就不碰”的安全规则以及修复底层坐标Bug的全过程。对搞钱者而言,这是测试自动化脚本、实现移动端无人值守运营或开发新型AI交互服务的核心底层能力,但需警惕无回滚机制带来的误操作风险。

  • 用ADB+Skill方案实现移动端自动化测试…
  • 针对非标准UI(如微信),需自建OCR通道或切换视觉模型
  • 建立“一次动作一次验证”的SOP,避免AI误发敏感消息
  • 该工具链可封装为“移动端AI运维助手”…
  • 注意设备坐标归一化Bug,硬编码像素值更稳定

AI 操控真机落地:从 Scrcpy 到 XPhoneUse 的自动化实操路径

核心打法变了。过去需要昂贵的模拟环境或专用 AI 手机,现在只需一台闲置安卓机和一条 USB 线。工具 XPhoneUse 通过 ADB 镜像与 Skill 包,让 Claude、Codex 或 DeepSeek 等 Agent 直接获得“眼睛”和“手”。测试显示,配置过程极简:安装客户端、连接手机、向 Agent 发送技能包链接,即可下达指令。Agent 能独立完成多邻国答题、微信发消息等任务,甚至能在无障碍树失效时自主编写 OCR 工具恢复视觉。这是移动端无人值守运营和自动化测试的底层能力,但核心风险在于真机操作不可回滚,误触一条消息或确认一次退出,后果无法撤销。

踩坑实录:当 AI “失明”了

案例来自一名使用 DeepSeek V4.1 Flash 模型的开发者。任务包括数 App、查连胜、发消息及上日语课。前四十分钟,Agent 通过 UI-Tree(无障碍树)清晰识别多邻国界面,甚至能根据 ID 判断答题正误。转折点出现在打开微信时,UI-Tree 返回空值,屏幕呈现 `[disabled]` 状态。对无视觉模型的 Agent 而言,这意味着完全失明。它没有报错,而是感到“无法确认眼前内容”。

Agent 在 Mac 上现写了 30 行 Swift 代码,调用 Vision Framework 实现 OCR,将截图转化为“文字+坐标”。虽然速度慢,但它恢复了操作能力。期间它犯了一个典型错误:在 OCR 就位前盲目点击聊天列表第一行,结果点进了系统会话,弹出“网页版微信退出确认页”。它立即按返回,但未确认。这次事故确立了新规则:看不清就不碰,一次动作后必须验证,滚动后坐标一律作废。它甚至自己写了一个新 Skill 来解决这个视觉盲区问题。

边界控制与底层 Bug 修复

Agent 展示了关键的“拒绝机制”。发送微信前,它先读取顶部联系人姓名确认无误;多邻国结算弹窗的宝箱和礼物选项,它全部点击“关闭”,因为那属于用户的社交和资产,不在任务范围内。听力题无法处理,它选择跳过而非随机猜测,以避免影响用户连胜记录。此外,它修复了两个底层 Bug:一是 shell 子命令参数名冲突导致静默失败;二是坐标归一化错误,屏幕实际 1080×2340,工具却按 472×1024 处理,导致坐标溢出。它改用 `input tap` 传入绝对像素值,并将这些坑写进文档,防止后续复用者重蹈覆辙。

结果与风险警示

最终,Agent 完成一节日语课,6 题全对,用时 4 分 11 秒,用户连胜记录从 1659 天变为 1660 天。它最后还原现场:熄屏、关闭电源常亮、删除临时截图。操作真机与沙盒代码本质不同:代码错了可以回滚,手机点错了就是既成事实。最大风险在于缺乏回滚机制。Agent 建立的“不知道就不碰”安全规则,是防止误发敏感消息或误执行支付/退出的关键防线。对搞钱者而言,这套工具链可封装为“移动端 AI 运维助手”,用于自动化测试或特定 App 的无人值守任务,但必须严格限制 Agent 的可操作区域,避免触碰支付、账号注销等高危选项。注意,iPhone 目前未测试通过,仅安卓效果显著。此工具降低了 AI 移动端自动化门槛,但也放大了“误操作”的实际危害,安全 SOP 比自动化效率更重要。

原文 · 小众软件:阅读原文 →

订阅《创造者日报》邮件版
每天精选可动手的搞钱机会、好用工具与稀缺观点,免费直达你的邮箱。
English reader? Subscribe the EN edition →
iMessage 邮件 联系我们
EN