AutoGLM 论文解读:AI自己学会”点点点”,不用人教,还能自己给自己出考题
AutoGLM: Autonomous Foundation Agents for GUIs 作者:智谱AI(Zhipu AI)
说白了,这篇论文干的事情就是:让AI自己学会操作手机和电脑。不是那种”你告诉我点哪里我就点哪里”的笨办法,而是AI自己看屏幕、自己想、自己点,点错了还能自己纠正。更狠的是——训练数据不用人标注,模型自己在真实环境里摸爬滚打,还能从失败中自己出题、自己练。这在国内GUI Agent领域,算是真正从论文走到了免费产品。
一、先说背景:GUI Agent到底在解决什么问题
咱们先聊个最基本的认知。
你每天用手机、用电脑,本质上就是在跟**图形用户界面(GUI, Graphical User Interface)**打交道。点按钮、滑屏幕、填表单、切页面——这些操作对你来说跟呼吸一样自然,但对AI来说,这玩意儿曾经是一道天堑。
为什么?因为GUI不是一个结构化的API。你没法给AI一个click(button_id="submit")的接口。AI看到的就是一张截图,它得从像素里”读懂”哪里是按钮、哪里是输入框、哪里能点、哪里不能点。
以前的做法是什么?要么是写死脚本(自动化工具那套),要么是靠** accessibility API**(无障碍接口)去拿控件信息。但这些方法都有硬伤:换个APP就废了,换个分辨率就瞎了,根本不具备通用性。
AutoGLM想做的事情就很清楚了:让一个视觉语言大模型,直接看截图,理解界面,然后自主完成复杂的多步操作任务。
二、核心架构:把”想”和”做”拆开
AutoGLM的底座是CogAgent——智谱自家的视觉语言大模型。这个模型的特点是能处理高分辨率图像,对GUI界面的理解能力很强。
但光有一个能”看懂”屏幕的模型还不够。AutoGLM在架构设计上做了一个很聪明的决定:把规划(Planning)和定位(Grounding)拆成两个独立的模块。
什么意思?
打个比方。你让助手帮你订一张机票。“规划”就是决定整个流程:先打开携程→搜索航班→选日期→选座位→填信息→提交。“定位”就是每一步具体该点屏幕上的哪个坐标。
这两个能力需要的技能完全不同。规划需要逻辑推理、任务分解;定位需要精确的视觉感知、坐标映射。把它们耦合在一起,两边都会互相拖累。
AutoGLM通过一个**中间接口(Intermediate Interface)**把这两件事解耦。规划模块输出的是一套结构化的动作指令(比如”点击搜索按钮”),定位模块负责把这条指令翻译成具体的屏幕坐标。
这样做的好处是:两个模块可以独立优化,独立升级。你换了个新手机分辨率,只需要重新调定位模块;你发现规划逻辑有问题,只改规划模块就行。
三、“观察-思考-行动”循环:Agent的大脑是怎么转的
AutoGLM的核心运行机制是一个经典的**观察-思考-行动(Observe-Think-Act)**循环。
这个循环是这样转的:
- 观察(Observe):Agent接收当前屏幕截图,加上任务目标描述。
- 思考(Think):Agent分析当前状态,判断下一步该做什么。
- 行动(Act):Agent输出具体操作——点击某个坐标、输入某段文字、滑动屏幕等。
然后环境返回新的截图,循环继续,直到任务完成或失败。
听起来简单对吧?但魔鬼在细节里。
AutoGLM的动作输出是固定格式的函数调用(Function Call)。比如click(x=320, y=580)、type(text="北京")、scroll(direction="down")。这种设计让模型输出可控、可解析,不会出现”自由发挥”导致系统崩溃的情况。
更关键的是,这个循环里内置了**自我纠错(Self-correction)**机制。如果Agent点了一个按钮发现页面没变化,或者跳到了错误的页面,它能感知到”不对劲”,然后调整策略。这就像你玩游戏走错了路,会退回来重新找方向一样。
四、最硬核的部分:自进化在线课程强化学习
好,接下来是这篇论文最让我兴奋的部分。
训练一个GUI Agent,最大的难题是什么?数据。
你想啊,要训练一个模型操作手机,你得有大量的”操作轨迹”数据——就是从任务开始到完成的每一步截图+动作对。传统做法是人工标注:找人录屏,一步步记录操作,再整理成训练数据。
这太贵了,太慢了,而且根本覆盖不了真实世界的复杂度。
AutoGLM的解法是:不要人标注,让模型自己在真实环境里探索学习。
这就是自进化在线课程强化学习(Self-Evolving Online Curriculum Reinforcement Learning),论文里也叫WebRL。
我来拆解一下这个机制:
第一层:在线强化学习。 模型直接在真实的网页/手机环境里执行任务。做对了给奖励,做错了给惩罚。不需要预先准备标准答案,环境本身就是裁判。
第二层:课程学习(Curriculum Learning)。 不是一上来就让模型做最难的题目。而是从简单任务开始,逐步增加难度。就像学数学,先学加减法,再学乘除法,最后才上微积分。
第三层:自进化(Self-Evolving)。 这是最骚的操作。当模型在某个任务上失败了,系统会基于这个失败任务自动生成一个近似但略简单的变体任务。然后由一个**评论模型(Critic Model)**来筛选:只保留难度在0.05到0.75之间的任务(太简单的没训练价值,太难的模型学不会),并验证这个任务确实是可完成的。
你品品这个设计——模型从自己的失败中出题,给自己降低难度再练,练会了再挑战原来的难题。这不就是人类学习的本质吗?
这套机制解决了两个核心痛点:
- 任务数据稀缺(Task Data Scarcity):不需要人工构造海量任务
- 策略分布漂移(Policy Distribution Drift):课程难度跟着模型能力动态调整,不会出现”学的和考的完全不一样”的问题
五、渐进式训练:从”一步”到”百步”
除了强化学习,AutoGLM还设计了一套渐进式训练框架(Progressive Training Framework)。
思路很直白:
- 第一阶段:训练单步操作。给模型看一个界面,让它完成一个动作(比如”点击这个按钮”)。
- 第二阶段:训练短链操作。2-3步的小任务。
- 第三阶段:训练长程复杂任务。需要十几步甚至几十步的完整流程。
这种从简到繁的训练策略,让模型在每个阶段都能打好基础,避免一开始就面对过于复杂的任务导致训练崩溃。
在定位能力上,AutoGLM训练了一个专门的定位模型(Grounding Model)。输入是截图+元素描述,输出是坐标。训练数据覆盖了900万个UI元素,来源包括网页、混合界面和安卓应用界面。
六、实验结果:数据说话
来看看AutoGLM在主要基准上的表现:
Web端:
- VAB-WebArena-Lite:55.2%成功率,第二次尝试提升到59.1%
- OpenTable评估任务:96.2%成功率
移动端:
- AndroidLab(VAB-Mobile):36.2%成功率
- 中文热门APP(微信、美团、淘宝等7个):89.7%成功率
怎么评价这组数据?
Web端55%乍一看可能不高,但要知道WebArena的任务是真的难——它不是”点个按钮”这种简单操作,而是需要跨页面、填表单、做搜索的复杂流程。55%在当时已经是相当不错的水平了。第二次尝试能提升4个百分点,说明模型的自我纠错机制确实在起作用。
中文APP的89.7%非常亮眼。这说明AutoGLM在本土化场景上做了大量优化,毕竟微信、淘宝这些APP的交互逻辑跟国外差异很大。
移动端的36.2%相对低一些,但手机操作的难度本身就比Web高——屏幕小、元素密集、手势操作多,这个成绩在2024年底是合理的。
七、从论文到产品:AutoGLM沉思版
这篇论文最让我佩服的一点是:它不是发完论文就完事了。智谱真的把AutoGLM做成了产品。
2025年3月31日,在中关村论坛上,智谱发布了AutoGLM沉思版。
这个版本基于GLM-Z1-Rumination模型——一个在GLM-Z1基础上通过扩展强化学习训练提升长程推理能力的推理模型。它融合了实时联网搜索、动态工具调用、深度分析和自我验证能力。
产品定位是”集深度研究和操作执行于一体”——能一边进行复杂思考,一边执行操作。比如你让它做一份行业分析报告,它可以自己搜索信息、分析数据、生成报告,全程不需要你动手。
最关键的是:免费、不限量开放。 网页端、PC端、手机App都能用。
这在2025年的AI Agent赛道里,是相当有魄力的决定。
而在手机端,AutoGLM-Phone的安卓操作成功率相比之前提升了超过20%。这说明从论文到产品落地的过程中,工程优化带来了实质性的性能提升。
八、在GUI Agent赛道里的位置
要理解AutoGLM的意义,得把它放在整个GUI Agent赛道里看。
2024年是GUI Agent的爆发年。Anthropic发了Computer Use,OpenAI在GPT-4V里展示了界面理解能力,Google也在做类似的事情。但这些大多是”能力展示”层面——给你看看我能做什么,但离真正的产品化还有距离。
AutoGLM的特殊之处在于:
- 它是国内最早的自主GUI Agent之一。在时间线上,它比大部分竞品都要早。
- 它有完整的训练方法论。自进化在线课程RL不是拍脑袋想出来的,是一套完整的、可复现的训练体系。
- 它真的落地了。从论文到免费产品,这个闭环在国内AI领域并不多见。
- 它同时覆盖了Web和Phone两个场景。很多竞品只做一个平台,AutoGLM两个都做。
收尾:我的一点看法
说实话,第一次读AutoGLM这篇论文的时候,最让我震动的不是具体的技术细节,而是它的训练哲学。
在大部分人还在纠结”怎么搞到更多标注数据”的时候,智谱团队换了一个思路:干脆不要标注数据了,让模型自己去真实环境里学。这个决定在技术上是有风险的——在线RL的训练稳定性、环境交互的成本、奖励信号的设计,每一个都是硬骨头。但他们啃下来了。
自进化课程设计是整篇论文最优雅的部分。从失败中生成变体任务、用Critic过滤难度、动态调整训练课程——这套机制让训练变成了一个自驱动的过程。模型不再是被”喂”数据的学生,而是一个会自己找练习题做的自学者。这种思路如果继续深化,未来的Agent可能真的能做到”越用越聪明”。
当然,AutoGLM也有局限。36.2%的移动端成功率说明在复杂手机操作上还有很大提升空间。Web端虽然达到了55%+,但距离真正可靠的自动化还有距离。不过这是2024年底的数据,到2025年沉思版发布时已经有了显著提升。
我最看好的一点是:AutoGLM证明了GUI Agent可以从论文走到免费产品。这不只是技术能力的证明,更是工程化能力的证明。能把一个研究原型做成几百万人能用(而且免费)的产品,这在国内AI圈是稀缺能力。
GUI Agent这个赛道,未来一定是属于”能落地”的玩家。AutoGLM在这条路上,走得比大多数人都远。
附:核心数据速查
| 指标 | 数值 |
|---|---|
| 论文发布时间 | 2024年11月 |
| 基座模型 | CogAgent(视觉语言大模型) |
| Web成功率(VAB-WebArena-Lite) | 55.2%(重试后59.1%) |
| Web成功率(OpenTable) | 96.2% |
| 移动端成功率(AndroidLab) | 36.2% |
| 中文APP成功率 | 89.7% |
| 定位训练数据覆盖 | 900万个UI元素 |
| 自进化课程难度范围 | 0.05 - 0.75 |
| 产品化时间 | 2025年3月(沉思版) |
| 产品化模型 | GLM-Z1-Rumination |
| AutoGLM-Phone提升 | 安卓成功率+20%以上 |
| 产品定价 | 免费、不限量 |
关键概念清单
| 术语 | 英文 | 含义 |
|---|---|---|
| 图形用户界面 | GUI (Graphical User Interface) | 通过图形元素(按钮、图标等)与用户交互的界面 |
| 观察-思考-行动循环 | Observe-Think-Act Loop | Agent的基本决策循环:感知环境→推理决策→执行动作 |
| 自进化在线课程强化学习 | Self-Evolving Online Curriculum RL | 模型在真实环境中自主学习,并从失败中自动生成训练课程 |
| 规划 | Planning | 将复杂任务分解为有序步骤的能力 |
| 定位 | Grounding | 将抽象指令映射到具体屏幕坐标的能力 |
| 中间接口 | Intermediate Interface | 解耦规划与定位的结构化动作指令层 |
| 课程学习 | Curriculum Learning | 从简单到复杂逐步增加训练难度的策略 |
| 评论模型 | Critic Model | 评估生成任务难度和可完成性的辅助模型 |
| 渐进式训练 | Progressive Training | 分阶段从单步到多步逐步训练 |
| 策略分布漂移 | Policy Distribution Drift | 训练分布与测试分布不一致导致性能下降 |
| 函数调用 | Function Call | 模型以结构化格式输出可执行动作 |
| 自我纠错 | Self-Correction | Agent感知操作失误并调整策略的能力 |
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





