阿里巴巴推出Qwen-UI-Agent,真机操作智能体,覆盖手机电脑网页
该模型全面覆盖了移动端、电脑端、网页端以及深度搜索环境,旨在打破传统模拟测试的局限,让模型真正具备在复杂真实设备上无缝操作的能力。真机基准,使研发团队能够根据真机成功率进行精准选型。界面操作,还能直接执行命令行操作,并在单次决策中以批量动作输出,大幅缩短了执行轨迹并提升了效率。
那因阿里近期所发布的全新的AI模型, 其具备能够直接于手机之上进行划屏幕、点按钮这般的操作, 且相较于以往的AI要聪慧许多。此情况对于开发者而言乃是一件重大的事件, 这意味着AI真正可以协助人去开展工作了。
能操控真实设备的AI来了

由阿里巴巴最新推出的Qwen-UI-Agent, 是一个具备操作手机能力的智能模型, 也是一个能够操作电脑的智能模型, 还是一个可以操作网页的智能模型。它并非局限于模拟环境, 而是切实能够在100多台真实手机上达成任务。这一突破致使AI从“纸上谈兵”转变为了“实干家’。
该模型涵盖了移动端, 电脑端, 网页端, 还有深度搜索环境这四大场景, 不管用户要去完成怎样的操作, 它都能够如同在真实设备之上那般流畅地执行, 这是行业里面第一全面打通往四面八方而各异的具备操作运转可能性周围条件的智能体。
真机环境打造坚实基础
研发团队构建起了测试环境, 其中含有100多台真实手机, 还有150多个应用。这个极为庞大的真机网络给模型训练准备了充分的数据来源, 致使模型可以去应对各种各样复杂场景。
众多同时被推出的400多个真实任务基准, 使得开发者能够依据实际成功率去挑选恰当方案, 这种凭借数据驱动的研发模式, 保证了模型在真实世界里有可靠表现。
命令行与图形界面双管齐下
除去平常的屏幕点击行为, 这个模型另外支持直接去执行命令行方面的指令, 用户于面对存在底层操作需求的复杂任务之际, 能够一次性获取多个动作所产生的结果, 极大地缩减执行所需要的时间。
工作效率因这种批量动作输出机制而得到显著提升, 开发者无需再逐个输入命令, 模型能够智能判断, 接着输出最为合适的操作序列, 从而真正达成全自动操作。
安全管控机制完善

模型当中设置了完备的安全判断体系, 一旦碰到违法或者高风险的请求, 便会径直予以拒绝, 把任务终止掉。这样一种主动的拦截机制, 切实有效地防止了AI被用作不当利用的情况, 对用户的合法权益起到了保障作用。
为处理支付, 为删除数据, 为授权隐私等敏感操作时, 模型会于关键步骤停下来, 等待用户确认。这般如此的“人机协作”模式, 在保证了效率的同时, 又确保重要决策始终被人把控着。
超长任务也能搞定
这个模型具备支持在超出100步之上的超长任务链条当中开展强化学习训练的能力, 借助配合拥有的自适应课程学习办法, 该模型能够分阶段逐步攻克具备高难度性质的复杂任务。
这种始终持续进行学习的机制会使得模型在使用时变得越发聪明起来。当面对复杂流程之际, 它有能力独立自主地规划路径, 还能够对策略予以调整, 最终达成任务设定的目标。这作为一种标志表明AI在长程推理这个方面获取到了具备实质意义的进步。
项目资源公开共享
拥有开发资格的人员能够借助项目的主要页面去得到完备的技术方面的文档, 以及使用的说明, 还有开源性质的代码。阿里巴巴把这样的一项成果面向社区予以放开, 目的在于促使整个行业的技术朝着更好的方向发展变化。
这样的一个举动, 显著地彰显出了阿里于AI领域之中的开放态度, 经过共享技术方面的成果, 怀着期望能够拉拢更多开发者加入进来的想法, 一起促使智能体技术向前发展以及将其应用实现落地, 成为既前进又落地的状况。
试问, 依你之见, 人工智能有无可能全然取代人工进行的各项操作呢? 诚邀你于评论区域踊跃分享你对此所持的观点, 若能点赞, 便可让更多人得以看见!