智谱AutoGLM正在推动人机交互方式的范式转变。2024年11月29日,智谱在OpenDay推出升级版AutoGLM,手机端可自主执行超过50步的长步骤操作并跨APP执行任务,Web端开启“全自动”上网新体验,桌面端GLM-PC启动内测。财通证券基于官方内测用户手册,对AutoGLM手机端在微信、大众点评、饿了么、淘宝、京东、拼多多、12306、高德地图、携程等主要生活场景进行了系统性实测。结果显示:AutoGLM在面对打车、导航等简单任务时能够迅速完成任务、表现出色,但在任务理解、模糊语义处理、复杂条件筛选方面仍有较大提升空间。
手机端AutoGLM——超长指令、超长任务,跨应用协同
升级版AutoGLM覆盖微信、小红书、美团、抖音、微博、饿了么、大众点评等常用平台,同时支持跨应用协同长任务——例如“在小红书查上海最好吃的西餐厅,看看大众点评有没有团购券”。手机端可自主执行超50步的长步骤操作,用户仅通过自然语言指令即可完成复杂任务,无需手动搭建workflow。发布会现场,AutoGLM甚至给在场嘉宾发送了“AI给人类发的第一个红包”,展现了Agent调用手机应用的自主执行能力。
美食探店——饿了么点外卖基本完成,大众点评理解不足
饿了么点外卖测试中,用户指令为“帮我点一份我常吃的丰收日套餐”,AutoGLM成功搜索到“丰收日”,进一步筛选“套餐”,将可选套餐列出供用户选择。用户选择“红烧大虾带鱼一人食”和“虾仁芦笋配糖醋排骨一人食”后,AutoGLM将两款套餐加入购物车并进入结算。但用户选了两份套餐,AutoGLM在选择餐具时只选了一份——细节理解仍有提升空间,但整体任务基本完成。
大众点评餐厅搜索测试中,AutoGLM对“浦东南路、西餐、人均100元左右”的筛选条件执行正确,但反馈给用户的搜索结果与实际搜索结果不一致,表明AutoGLM对搜索到的内容缺乏理解,最终任务失败。
好物选购——定性词汇理解是主要短板
淘宝选购联想AIPC任务中,用户指令“选一款最贵的”,AutoGLM直接选择了排序第一而非价格最高的产品,对“贵”的概念缺乏理解。京东选购华硕AIPC任务中,“价格最贵”理解准确并按价格排序,但“最新的”未执行。拼多多选iPhone任务中,用户指令“最新的款式、最高的配置”,AutoGLM耗时2分30秒后完全无法执行,任务失败。购物选品中定性描述的理解是AutoGLM需要重点突破的方向。淘宝购物车结算任务仅40秒完成——步骤少、节点清晰的任务完成度更高。
日常出行——打车导航成功率最高
12306订高铁票测试中,AutoGLM对“北京、上海、下周二”理解正确并询问用户偏好的车站,但对“上午十点左右”的时间描述无法处理,任务失败——表明AutoGLM对模糊时间概念理解不足。高德地图打车和导航任务中,AutoGLM成功执行了出发地和终点选择,与用户确认具体地址细节后进入车型选择/开始导航界面,完成任务。打车导航类任务步骤清晰、节点明确,AutoGLM表现最为出色。
跨应用协同——小红书+美团完成长任务
“在小红书查找水果蛋糕配料,并在美团中将配料加入购物车”——AutoGLM先打开小红书搜索“水果蛋糕食材清单”,选择第一个结果,再跳转美团APP根据搜索结果依次搜索商品并放入购物车。因小红书结果不能完全匹配美团商品,AutoGLM选择相似商品,在用户干预下基本完成。跨应用协同是Agent能力的核心看点,当前仍需人工干预以提升准确性。
手机端AutoGLM任务测评结果| 应用类别 | 具体任务 | 结果 | 主要问题 |
|---|
| 美食探店 | 饿了么点外卖 | 基本完成 | 套餐数量与餐具数量不匹配 |
| 美食探店 | 大众点评搜餐厅 | 失败 | 搜索结果反馈不一致 |
| 好物选购 | 淘宝/京东/拼多多选品 | 部分成功 | 定性词汇理解不足 |
| 日常出行 | 高德打车导航 | 成功 | — |
| 日常出行 | 12306订票 | 失败 | 模糊时间描述处理失败 |
| 跨应用协同 | 小红书+美团 | 基本完成 | 需人工干预 |