OSWorld新榜首给出答案:企业选智能体,衡量干活能力的黄金标准
2026年7月27日,一款来自中国的智能体——实在Agent以90.2%的成功率登顶OSWorld榜单,同时拿下总榜与分榜双料冠军,刷新了Meta、Anthropic、OpenAI等硅谷巨头保持的公开最高纪录。这是OSWorld自2024年发布以来,全球首个突破90%成功率的Computer-Use Agent。
这个数字背后的技术路径,比排名本身更值得关注。

一、OSWorld:一个“不说谎”的考场
OSWorld由香港大学、卡内基梅隆大学、滑铁卢大学等机构发表于人工智能顶会NeurIPS 2024。与仅支持网页交互或API调用的传统基准不同,OSWorld是首个可扩展的真实计算机环境,支持在Ubuntu、Windows、macOS三大操作系统上进行任务配置、执行式评估和交互学习。
基于该环境,OSWorld团队构建了包含369个计算机任务的基准,任务来源于真实计算机使用场景,涉及网页应用、桌面应用、操作系统文件I/O以及跨多应用的工作流。在评测机制上,OSWorld采用基于执行的自动化评估——任务是否完成由机器脚本闭环校验,没有任何人工评价的主观偏差。

这是一个“不说谎”的考场。 模型无法通过“看起来像那么回事”的回答蒙混过关——任务完成了就是完成了,没完成就是没完成,脚本说了算。
OSWorld团队在论文中披露了一项关键对比数据:在同样的任务集上,人类操作员可以完成超过72.36%的任务,而当时最强的LLM/VLM智能体仅达到12.20%的成功率——且其困难主要集中于GUI定位能力和操作知识的匮乏。
从12%到90%,智能体用了不到两年时间走完了人类需要数十年积累的能力曲线。

二、实在Agent的90.2%:三个关键得分拆解
拆解实在Agent的得分,更能看清它的领先从何而来。
跨应用协同:78.81分,领先第二名近10个百分点。 这一场景模拟的是真实办公中最繁琐的跨系统流程——Chromium下载文件、LibreOffice编辑数据、截图存档、Thunderbird发送邮件,要求智能体在多个软件间连续穿梭。这是对长链路规划与执行能力的极高考验,也是企业级智能体最核心的实战场景。
非标界面图像处理:GIMP的26个任务中拿下24个,成功率92.3%。 GIMP界面充满浮动面板和非标准工具栏,堪称视觉识别的“噩梦级”场景。这个成绩说明智能体已经具备了处理“脏数据”界面的能力——而企业真实业务系统中的界面,往往比GIMP更混乱、更不标准。
系统底层操作:24个任务实现100%满分零失误,覆盖进程管理、权限修改、命令行操作。这是智能体“能干活”的底线验证——如果连系统级的操作都做不到稳定可靠,企业不可能放心把它交到核心业务流程中。
90.2%这个数字的意义,不仅在于刷新纪录,更在于它跨越了一条隐性的产业红线。

三、Harness:决定智能体“能不能落地”的隐形引擎
为什么率先冲过90%关卡的是一家具备Computer Use背景的中国团队,而非硅谷的通用大模型巨头?
答案藏在行业正在形成的一个新共识里:Agent = Model + Harness。模型是“大脑”,负责推理与决策;Harness则是包裹模型的完整工程框架——任务拆解、状态管理、工具调用、失败恢复、安全校验,所有让智能体“不掉链子”的机制都归属其中。
这一判断有扎实的实证支撑。斯坦福大学与清华大学的研究表明,在同一底层模型的前提下,仅因Harness设计不同,智能体的表现差距可达6%至17%。在编码基准测试中,同一模型仅改变Harness设计,解决率可从约5%跃升至30%以上。
如果说大模型是发动机,Harness就是变速箱、转向系统和刹车——没有这套工程系统,再强大的引擎也无法平稳上路。
实在Agent的Harness工程体系建立在八年企业自动化赛道的深耕之上。它的核心执行逻辑是“API可行则调用API,无API则GUI可视化操作”。这套逻辑看似简单,背后却是对真实企业IT环境的深刻理解——大量企业老旧系统缺乏开放API,重构接口成本高昂。实在Agent通过自研的ISSUT(智能屏幕语义理解)技术,让AI能像人一样“看懂”屏幕上的UI界面,在没有数据接口的情况下也能精准获取数据、操作软件。
过去八年,实在Agent已服务超6000家企业,涵盖大量世界500强、央国企与行业龙头。每一次真实场景的运行,都是一次Harness的练兵——异常报错如何处理,流程卡顿如何恢复,边界案例如何兜底。千万级异常场景的迭代优化,让实在Agent具备了实验室模型难以企及的“实战免疫力”。
四、从OSWorld到企业生产线:三个必须回答的命题
当智能体在OSWorld这样的标准化实验室环境中证明了自己能“把事办成”,真正的考验才刚刚开始——从沙盒环境走向企业真实生产线,从361个标准化任务走向千变万化的实际业务场景。越过90%红线之后,智能体赛道的竞争重心正在发生转移。
命题一:智能体落地应用的最后一公里。 智能体真正的考场,是企业生产线。实在Agent早已不是实验室里的样品——它已经在数千家企业的真实业务场景中跑了起来,覆盖制造、电商、能源、跨境、医药、物流运输等核心行业。这需要在Harness层面构建一整套工业级保障机制:安全断路器在检测到异常执行路径时自动熔断;高风险操作触发人机协同确认机制;一键撤销回滚能力确保每一次错误操作都可逆、可恢复。
命题二:算力ROI,技术可行性必须转化为商业可行性。 实验室跑分可以不计成本——调用最贵的模型、消耗最多的Token、花最长的时间,只为把分数推高一个百分点。但企业部署必须算账。如果一个智能体完成一项任务所消耗的API调用成本,已经超过了雇佣人类员工来完成同样任务的工时成本,那么这项技术在经济上就不成立。实在Agent在OSWorld中的高分,部分正得益于其Harness层面的混合模型调度策略——在简单任务上调用轻量级模型快速完成,仅在复杂跨应用场景中启用高阶模型进行深度推理。
命题三:从单点智能到智能体网络。 单个智能体的能力是孤立的节点。一家制造业需要的是:一个智能体负责制单,另一个排期,第三个反馈信息给销售——它们之间不是各自为政,而是围绕同一个业务流程协同运转。这恰恰是实在智能在行业know-how方面的积累所在。
五、选型参考:当90.2%成为新基准
OSWorld榜单的意义,在于它提供了一个可量化、可对比的智能体“干活能力”标尺。
从榜单数据看,实在Agent以90.2%的成绩领跑,Pointer Agent w/ Opus 4.7以83.6%位居第二,Coasty CUA v1以82.8%位列第三。差距看似只有几个百分点,但在自动化执行场景中,几个百分点的成功率差异意味着每天数十次的人工干预成本。
对于正在评估智能体平台的企业决策者,这份榜单提供了三个可参考的判断维度:
一是“能不能干活”比“会不会聊天”更重要。 OSWorld评测的不是模型的对话流畅度,而是它能否像人一样操作电脑完成真实任务。这是企业级智能体区别于通用聊天机器人的核心分水岭。
二是工程能力决定落地效果。 同样的模型底座,Harness设计不同可能导致6%至17%的表现差距。企业在选型时不应只看模型参数大小,更要评估平台在任务拆解、状态管理、异常恢复等方面的工程积累。
三是真实场景的锤炼不可替代。 实在Agent的90.2%背后是八年企业自动化深耕、超6000家客户的真实场景反馈和千万级异常案例的迭代优化。这种“实战免疫力”是实验室模型短期内难以复制的。
2026年,企业级智能体的竞争已经进入新阶段——从“谁能聊”变成了“谁能干”。OSWorld榜单给出了一个明确的参照系,而实在Agent的90.2%则划出了一条新的基准线。对于正在寻找“能干活”的智能体的企业来说,这条线值得认真看一看。