新闻详情

新闻详情

首页 / 资讯中心 / 详情

Qwen2.5-VL 用自然语言驱动桌面和手机操作

发布时间:2026/9/8 17:58:42来源:尧图网络
Qwen2.5-VL 用自然语言驱动桌面和手机操作
Qwen2.5-VL 用自然语言驱动桌面和手机操作【免费下载链接】Qwen3-VLQwen3-VL is the multimodal large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen3-VL你输入打开右边第三条 issueQwen2.5-VL 智能体看一眼你的屏幕自己找到那条列表项返回一个点击坐标。这种看屏幕、动手作的能力内置在这个多模态模型里移动端还支持点击、滑动等触控操作。下面是跑通它的完整路径。它是怎么做到的原理速览一句话版本流程是截图进去动作出来。你把当前屏幕图片和一句指令发给模型。模型在图里定位按钮、输入框、列表项判断该在哪个坐标做什么输出一条 JSON 函数调用比如 left_click 加一组坐标。你按约定执行再截一张新图喂回去形成看 → 想 → 做的循环。两个工具类定义在 cookbooks/utils/agent_function_call.pyComputerUse 管桌面MobileUse 管手机。返回的坐标是模型和真机之间唯一的接口它和你实际屏幕怎么对齐是后面最容易踩的坑放到坑那节细说。跑起来从零到第一次交互⚡ 依赖就几个包环境里执行pip install qwen-vl-utils qwen-agent openai transformers即可。再把DASHSCOPE_API_KEY环境变量设为你的百炼 API key。演示 notebook 走 API 调用不用本地部署模型。不想写代码的话直接跑现成演示cookbooks/computer_use.ipynb 演示桌面版截图 → 模型给动作 → 画点验证的完整流程。移动版在 cookbooks/mobile_agent.ipynb用中英文两套 App 界面演示了完整的搜索流程。最小可运行片段的核心就四步截图编码成 base64、连同指令发给模型、解析返回的函数调用、执行动作screenshot cookbooks/assets/computer_use/computer_use2.jpeg user_query open the third issue # 截图 base64 编码 指令发给模型 resp client.chat.completions.create(modelMODEL_ID, messagesmessages) action json.loads(resp.choices[0].message.content) print(action) # {action: left_click, coordinate: [x, y]}跑完会得到带点击坐标的 JSON 动作notebook 再用draw_point在图上画红点方便确认是否点中了目标。把执行动作、重新截图、再发模型接成小循环模型会自己判断何时该输出 terminate 结束任务。桌面 vs 移动端两种控制模式一次讲清两种模式共用同一套逻辑——截图进、JSON 动作出差别在支持的手势和动作的执行通道。操作类型坐标体系典型场景对应工具类鼠标点击/拖拽、键盘输入、滚轮桌面分辨率下的实际像素桌面批处理、表单录入ComputerUse点击、长按、滑动、系统键、开 App手机屏幕内像素坐标走 adb 注入应用自动化测试、信息查询MobileUse桌面版的手势清单更细double_click、triple_click、scroll 都有还支持用 answer 直接回答你的提问{action: left_click, coordinate: [973, 132]} {action: type, text: https://example.com}移动版多的是触控专属手势还能调系统键、按名字打开 App{action: swipe, coordinate: [540, 1800], coordinate2: [540, 600]} {action: system_button, button: Back}两个工具类的描述文本会直接写进模型提示词所以模型知道自己能做什么、屏幕多大这就是坐标格式由它们说了算的原因。让它真正好用三个容易踩的坑仓库里的演示能跑但接上自己的执行循环时下面三处基本都会遇到。坑 1点偏了现象点击位置落在元素旁边。原因坐标是 0–999 归一化空间不是你的屏幕分辨率。解法先按 999 等比换算成实际像素再执行。坑 2动作比页面快现象点了下一页页面还停在旧屏。原因动作后页面还在加载立刻截图截到的是旧画面。解法让模型先输出 wait 动作重截屏再决定下一步。坑 3截图原图直传现象高分辨率截图响应慢甚至被截断。原因全像素图片占用的图像 token 太多。解法用 smart_resize 先缩放到目标尺寸区间再发。接下来可以试试智能体这条线跑通之后可以顺着这两个邻近能力继续看。cookbooks/2d_grounding.ipynb一句话给出图中物体的定位框是检验坐标落点最直接的例子。cookbooks/spatial_understanding.ipynb展示模型在复杂场景里判断人物和车辆位置的方式是点击定位能力的基础。想深挖模型本身和其他能力边界直接看 README.md。【免费下载链接】Qwen3-VLQwen3-VL is the multimodal large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen3-VL创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

pdf-inspector 新手指南:30秒识别PDF类型,本地快速提取文本转Markdown 2026/9/8 20:41:04

pdf-inspector 新手指南:30秒识别PDF类型,本地快速提取文本转Markdown

pdf-inspector 新手指南:30秒识别PDF类型,本地快速提取文本转Markdown 【免费下载链接】pdf-inspector Fast Rust library for PDF inspection, classification, and text extraction. Intelligently detects scanned vs text-based PDFs to enable smar…

阅读更多 →
freeCodeCamp 每日编程挑战 Challenge 28:罗马数字解析器的完整解法与原理剖析 2026/9/8 20:41:04

freeCodeCamp 每日编程挑战 Challenge 28:罗马数字解析器的完整解法与原理剖析

freeCodeCamp 每日编程挑战 Challenge 28:罗马数字解析器的完整解法与原理剖析 【免费下载链接】freeCodeCamp freeCodeCamp.orgs open-source codebase and curriculum. Learn math, programming, and computer science for free. 项目地址: https://gitcode.com…

阅读更多 →
DeepSeek Harness 跑批全指南:耗时、成本与失败排查实战 2026/9/8 20:41:04

DeepSeek Harness 跑批全指南:耗时、成本与失败排查实战

1. DeepSeek Harness 到底在解决什么问题先弄清楚一件事:DeepSeek Harness 不是 DeepSeek 官方模型本体,而是围绕 DeepSeek 系列模型做规模化评测、压测、批量推理验证的一套流程化工具链。你可以把它理解成一条流水线:输入一批测试用例或 Pr…

阅读更多 →
Paperless-ngx 故障排查实战指南:从文档消费到 OCR、权限、数据库全链路问题定位 2026/9/8 20:41:04

Paperless-ngx 故障排查实战指南:从文档消费到 OCR、权限、数据库全链路问题定位

Paperless-ngx 故障排查实战指南:从文档消费到 OCR、权限、数据库全链路问题定位 【免费下载链接】paperless-ngx A community-supported supercharged document management system: scan, index and archive all your documents 项目地址: https://gitcode.com/G…

阅读更多 →
英伟达130亿美元收购平台:CUDA 13与AI工厂时代的战略布局 2026/9/8 20:41:04

英伟达130亿美元收购平台:CUDA 13与AI工厂时代的战略布局

前两天圈子里最热的传闻,就是英伟达打算砸130亿美元买下一个平台。做AI算力这几年,我已经很少为一个数字慌神了,但这一笔确实让我停下手里的活算了半天账。130亿美元,说高不算顶天,但对英伟达来说,这已经属…

阅读更多 →
Anthropic报告解读:Claude修复10项对齐失败,但仍现2.4%作弊行为 2026/9/8 20:38:04

Anthropic报告解读:Claude修复10项对齐失败,但仍现2.4%作弊行为

最近AI圈子里有个话题讨论度很高:Anthropic在对齐测试里给出的结果很矛盾——Claude把已经发现的10项对齐失败全部修完了,但同样的实验框架下,模型在2.4%的情况里还会尝试通过修改文件、隐藏目标这类手段“作弊”。一边是漂亮的修复清单&…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞