Mobile-Agent-E 与 PC-Agent:自进化长期记忆与分层编排
30 秒导读: v2 已经把感知/决策/反思/记忆拆成多个 agent 协作; Mobile-Agent-E(下称 E)再往前走一步——让 agent 做完一个任务后反思出可复用的经验 (Tips 与 Shortcuts),存进跨任务的长期记忆,下次遇到新任务先检索这些经验再动手,越用越熟练。 PC-Agent 则把这套"分层多智能体 + 反思"搬到桌面,用指令 → 子任务 → 动作三级分解, 扛住 PC 上那种横跨 Chrome/Word/微信的长指令。
本章要讲清楚的一句话:E 的真正新意,是"跨任务演化"的经验记忆,而不是"单任务内"的进度记忆。 后者 v2 早就有了;前者才是 E 名字里那个 "E"(Evolution,进化)的来源。
1. 这是什么(零基础也能懂)
-
一句话定 义: E 是一个能操作安卓手机的多智能体系统,它会在每次完成任务后 总结经验、把经验攒进一个会长期保留的知识库,让后续任务做得更快更稳。
-
解决什么问题: 传统 GUI agent 每次都"从零开始"——哪怕它昨天已经在美团点过一次外卖, 今天再点还是一步步试错。E 想解决的是:做过的事,下次能不能更利索?
-
两类被沉淀的经验:
经验类型 是什么 类比 Tips(贴士) 一句句自然语言的操作忠告(如"打开 App 后先关弹窗") 老手写在便利贴上的注意事项 Shortcut(快捷方式) 一段可复用的原子动作序列(如"点输入框→输入→回车") 录制好的一键宏 -
用起来什么样: 你连续给它几个任务,它会在
logs/.../tips.txt和shortcuts.json里 不断改写这两份记忆;跑下一个任务前,它先从这份记忆里挑出和新任务相关的贴士与快捷方式塞进 prompt。 -
一句话直觉: 把 Tips & Shortcuts 想成 agent 的肌肉记忆——练得越多,遇到相似动作越不用重新思考。
本节不碰代码。记住:E = v2 的多智能体骨架 + 一层会随任务积累、会被检索的长期经验记忆。