微软OmniParser
微软OmniParser是微软研究院推出的一款屏幕解析工具,用于把图形用户界面的截图转换成结构化元素,从而让大语言模型驱动的界面代理能够据此执行操作。它通过微调的目标检测模型识别可交互区域、通过图标描述模型提取元素功能语义,再结合光学字符识别模块,生成带编号标注的界面表示。该工具不依赖网页文档对象模型或安卓视图层级等额外信息,可与多种视觉语言模型搭配使用。
定义
微软OmniParser是一种把用户界面截图解析为结构化元素的屏幕解析方法,其目标是提升多模态模型在界面上生成可精确定位动作的能力[1]。它的输入是用户任务与界面截图,输出包括两部分:一张叠加了边界框与数字编号的截图,以及一份包含提取文本和图标描述的局部语义信息[1]。
该工具被定位为通用屏幕解析模块,可与多种视觉语言模型组合,用于构建能够在界面上执行操作的代理系统[2]。它针对的问题在于,此前多模态模型缺少可靠的屏幕解析手段,难以同时做到识别可交互图标和理解各元素的语义,并把预期动作对应到屏幕上的具体区域[1]。
原理
OmniParser把界面理解与动作预测拆成两个环节,先在解析阶段提取语义,再交由视觉语言模型专注于判断下一步操作[3]。其管线由三个部分集成:一个经过微调的可交互图标检测模型、一个经过微调的图标描述模型,以及一个用于提取文本边界框的光学字符识别模块[3]。三者输出合并后,得到类似文档对象模型的结构化界面表示,以及叠加了候选可交互元素边界框的截图[3]。
在可交互区域检测环节,模型并不直接预测操作坐标,而是采用标记集方法,在截图上叠加可交互图标的边界框,再让视觉语言模型输出对应框的编号以完成操作[3]。图标检测框与文本识别框会进行合并,重叠超过 90% 的框被去除,随后为每个框分配一个唯一编号,分配算法会尽量降低编号与其他框的重叠[3]。
为补充局部功能语义,研究团队对每个检测到的图标生成功能描述,对文本框则使用识别出的文字及其标签[3]。由于当时缺少针对界面图标的公开描述模型,团队借助 GPT-4o 构建了 7000 组图标与描述的配对数据,并据此微调描述模型,使模型对常见应用图标的描述更为可靠[3]。
发展历程
2024 年 8 月,相关技术报告发布,作者为 Yadong Lu、Jianwei Yang、Yelong Shen 与 Ahmed Awadallah[1]。2024 年 9 月,该方法在 Windows Agent Arena 基准上取得当时最好的表现[4]。同年 10 月,可交互区域检测模型与图标功能描述模型在模型托管平台发布,项目随后成为该平台模型库的热门模型之一[4]。
2024 年 11 月,V1.5 版本发布,新增了对更细小图标的检测能力,并可以预测每个屏幕元素是否可交互[2]。该版本还引入了针对微软 365 应用的图标数据集,并改进了检测区域的去重逻辑[2]。
2025 年 1 月,团队公布 V2 版本在 ScreenSpot Pro 基准上取得 39.5% 的成绩[4]。2025 年 2 月,V2 模型权重发布,并推出 OmniTool,可在 Windows 11 虚拟机中配合所选视觉模型使用,原生支持 OpenAI、DeepSeek、Qwen 与 Anthropic 的多种模型[5]。V2 相较 V1 延迟改善约 60%,在 A100 上平均每帧 0.6 秒,在单张 4090 上为 0.8 秒[5]。
2025 年 3 月,项目增加了轨迹本地记录功能,便于使用该工具与 OmniTool 构建面向特定领域的代理训练数据管线,同时逐步加入多代理编排并改进 OmniTool 界面[4]。2026 年 7 月,项目新增基于 YOLOv9-E 的交互区域检测器,其推理权重以 MIT 许可发布,使检测器与描述模型可以组成完全采用 MIT 许可的解析管线[5]。
应用
该工具面向需要计算机操作代理但无自有微调资源的用户,为现成的视觉语言模型提供插件式能力[2]。实验显示,将其与 Phi-3.5-V 和 Llama-3.2-V 等视觉语言模型结合,可明显提升 ScreenSpot 基准上的表现[2]。
在跨平台与跨应用场景中,它可作为通用工具解析个人电脑和手机上的界面,且不依赖网页文档对象模型或安卓视图层级等额外信息[2]。在 Mind2Web 基准上,仅使用屏幕截图输入的该工具与 GPT-4V 组合,表现优于需要从网页标记中提取额外信息的方案[2]。在 AITW 基准上,它的表现也超过配用专门安卓图标检测模型的方案[2]。
局限
该工具按设计只负责把截图忠实转换为可交互区域的位置与界面语义,本身并不检测输入中是否存在有害内容,其使用被期望输入不含危害性内容[5]。它虽只把截图转换为文本,却可用于搭建具备操作能力的代理,开发者在开发与运行此类代理时需遵循通行的安全规范并承担相应责任[5]。
官方说明指出,该工具能够从截图中提取信息,但输出仍需人工判断[5]。在此基础上,微软表示不推荐将其用于工作场所类的使用场景[6]。
在许可方面,早期图标检测模型基于 YOLOv8 微调,因而沿用 AGPL-3.0 许可,被官方称为许多下游用户的使用障碍;新增的 icon_detect_v3 基于 MIT 许可的 YOLOv9 实现微调,与描述模型搭配可组成完全 MIT 许可的管线[5]。该检测器被有意设计为对小尺寸界面元素给出较低置信度,若把置信度阈值调得明显高于 0.1,会开始漏掉图标、工具栏按钮和页脚链接等真实元素,而非仅仅过滤噪声[5]。
参见
参考资料
- OmniParser for Pure Vision Based GUI Agent . github.io [引用日期2026-10-08]
- OmniParser for Pure Vision-Based GUI Agent . microsoft.com [引用日期2026-10-08]
- OmniParser for Pure Vision Based GUI Agent . arxiv.org [引用日期2026-10-08]
- OmniParser . github.com [引用日期2026-10-08]
- README.md · microsoft/OmniParser-v2.0 at refs/pr/37 . huggingface.co [引用日期2026-10-08]
- README . huggingface.co [引用日期2026-10-08]
浏览次数:3 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-10-08T12:40:21Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。