【极新】全球第一!国产智能体刷新OSWorld纪录

   
2026 年 7 月 27 日实在 Agent 登顶 OSWorld 榜单,成首个突破 90% 成功率的桌面操作智能体。
2026年7月27日,OSWorld榜单完成更新,国内技术团队自研的实在Agent以90.2%的总成功率、325.59分总成绩,包揽总榜与Agentic Framework分榜双冠,成为业内首个突破90%成功率的桌面操作智能体。
对于开发者与技术从业者而言,OSWorld是衡量智能体实景落地能力的重要基准。区别于仅能模拟简单网页交互的轻量化评测体系,OSWorld基于Ubuntu真实操作系统,搭建361项全场景实战任务,全程机器无主观评分,精准考核智能体的环境感知、长链路规划、多软件协同、底层系统操作等核心能力。自2024年上线以来,GPT、Gemini、Claude等旗舰模型的技术迭代成果,均以该榜单数据为核心佐证。

OSWorld排行榜(按得分排序)
复盘行业两年迭代曲线,全球计算机使用智能体完成了快速进化:从2024年的12.2%基础成功率,到2025年突破72.6%超越人类基线,再到2026年5月83.6%的行业高点,技术迭代速度持续攀升。实在Agent此次90.2%的突破,将行业纪录推向了新阶段,标志着Computer-Use Agent的可靠性达到了新高度。

从技术拆解维度来看,实在Agent的领先源于三大核心能力的突破。
在最考验长链路逻辑的跨应用协同场景中,面对93项多软件连续流转的复杂任务,可自主完成浏览器下载、文档编辑、截图存档、邮件发送的全流程操作;
在GIMP像素级图像处理场景中,攻克非标准浮动面板、自定义工具栏的识别难题,26项任务完成24项,成功率达92.3%;
在零容错的系统底层运维场景中,实现24项任务满分通关,文件权限修改、进程管理、命令行操作全程零失误,展现出稳定的底层执行能力。

业内开发者共识显示,大模型底座能力已进入同质化阶段,Harness工程体系成为智能体能力分层的核心关键。研究数据表明,相同模型底座下,优质的Harness架构优化可带来6-10个百分点的性能提升,复杂场景下优化迭代增益最高可达17个百分点。实在Agent的领先,源于实在智能自2018年起在企业自动化领域的长期积累,而非单次模型调优的偶然突破。
自2018年成立以来,实在智能始终聚焦自动化落地,持续打磨适配真实桌面环境的多模态Harness体系,形成“API可行则调用API,API失效则GUI可视化操作”的类人执行逻辑。同时依托海量企业级真实场景数据,完成了大量异常场景的迭代优化,解决了实验室模型“跑分强、落地弱”的行业通病,让智能体具备适配复杂真实环境的实战能力。

跑分突破是技术里程碑,产业落地才是最终目标。当前AI智能体竞争已从“参数竞赛”转向“工程落地竞赛”,实在智能已明确下一阶段技术迭代方向:通过人机协同熔断机制,将智能体可靠性从90.2%提升至工业级99.99%;优化动态环境抗干扰能力,适配弹窗、版本更新、网络波动等真实办公场景;迭代端云混合调度架构,降低推理成本与延迟,搭配全链路可审计合规体系,让智能体真正走进企业生产场景,成为开发者高效生产力工具与企业的组织重塑中枢。

责任编辑: 流过

相关资讯
写评论