从全军覆没到点一杯奶茶:国内视觉模型这一年的变化

今天忍不住测试了一下 DeepSeek 前几天发布的 deepseek-v4-flash-vision-exp 的视觉能力,看它在操纵手机 APP 上能做到什么程度。

为什么说是「忍不住」?因为这件事我一年多前就试过一次,结果记忆犹新。

2024 年中的那次测试:国内模型全军覆没

那时候我们用一个纯视觉框架来测模型操作手机的能力。所谓纯视觉,就是不给模型读取界面的底层结构,只让它「看」屏幕截图,然后决定下一步点哪里。这意味着它理论上可以操作任意一个 APP——不像那些深度绑定某个平台 API 的方案,只能点淘宝闪购就只能点淘宝闪购,只能点美团就只能点美团。

当时给的任务都不复杂:发邮件、发微博,读取或者修改手机的配置。

结果很分明。国外的模型,GPT-4O 和 Claude,基本都能胜任,有的地方需要补充或优化一下提示词——比如针对某个环节多做一点提示——但整体是能跑通的。

国内的模型则是全军覆没。当时试了千问、GLM,偶尔能走动一两步,但非常不稳定,走着走着就出错,简单任务都跑不完。

一年后:不用刻意调提示词,就能点一杯奶茶

这一年国内模型取得了长足的发展。这次测试最直观的感受是:在不需要刻意优化提示词的情况下,它就能胜任更复杂的任务。

我给它的任务是——在美团上点一杯奶茶。这个任务的链条其实很长:

从桌面上的美团 APP 图标开始,点击进入首页,到商品页,再进店铺页面,找到店铺里的商品,加进购物车,最后一路走到支付页面。

整个流程,它一次性完成了。中间没有卡死,没有需要我手动介入去纠正它点错的地方。有意思的是,它点着点着发现奶茶差两块钱才到配送起送额,于是自己把订单从外卖切换成了到店自取,接着往下走。

对比一年前连发条微博都做不到的状态,这个跨度是实打实的。

唯一的缺点:慢

当然也有明显的短板:慢。整个任务从头到尾用了 22 分钟——中间还遇到了接口格式不兼容的问题,临时改了一段代码才继续跑起来。

对于「点一杯奶茶」这种日常操作,22 分钟显然没有实用价值——人自己点两分钟就完事了。但测试的意义不在于替代人点奶茶,而在于验证:模型现在到底能不能理解一个多步骤、跨页面的真实任务,并且自己走完全程。

能走完,就说明能力到位了;剩下的慢,是工程和推理速度的问题,往后大概率会被解决。

所以我挺开心的。能力一旦解锁,后面就能接着解锁更多,适用到更多场景里去。