Kaka Web3Kaka Web3
ProductContentCalendarDownload
中文
KAKA WEB3News

Cua Driver给Agent补上「眼睛」:纯像素界面也能识别按钮和文字

律动 BlockBeats·Sep 29, 2026 18:04 GMT+8
动察 Beating AI 快讯,开源 Computer Use 工具 Cua 给 Cua Driver 加入可选的 Perception 视觉扩展。Driver 原本优先通过网页结构和系统无障碍树找按钮。遇到 Canvas、游戏、远程桌面或自绘应用时,这些结构可能为空。Perception 会直接读取截图,把画面拆成带文字、类型和位置的区域,供 Agent 继续操作。 首版用 OmniParser 识别图标和控件,用 PP-OCR 读取文字。整个解析过程在本机 CPU 完成,不需要 GPU,也不把截图发到网络。官方实测单张截图在 macOS 约需 2 至 2.5 秒,Linux 为 3.5 至 4 秒,Windows 为 8 至 9 秒。它主要在页面结构和无障碍树失效时兜底,不会默认每一步都跑视觉解析。 Cu
动察 Beating AI 快讯,开源 Computer Use 工具 Cua 给 Cua Driver 加入可选的 Perception 视觉扩展。Driver 原本优先通过网页结构和系统无障碍树找按钮。遇到 Canvas、游戏、远程桌面或自绘应用时,这些结构可能为空。Perception 会直接读取截图,把画面拆成带文字、类型和位置的区域,供 Agent 继续操作。 首版用 OmniParser 识别图标和控件,用 PP-OCR 读取文字。整个解析过程在本机 CPU 完成,不需要 GPU,也不把截图发到网络。官方实测单张截图在 macOS 约需 2 至 2.5 秒,Linux 为 3.5 至 4 秒,Windows 为 8 至 9 秒。它主要在页面结构和无障碍树失效时兜底,不会默认每一步都跑视觉解析。 Cua 还限制了视觉操作对旧截图的复用。每次视觉识别都会绑定当前截图的 `capture_id`,随后点击必须来自同一张截图。截图超过 60 秒,或者已经执行过一次操作,Driver 就会拒绝继续使用,避免界面变化后还拿旧坐标误点。 Cua 过去其实已经能通过 `cua-som` 和 OmniParser 做视觉定位。现在这套能力被直接接进 Cua Driver,上层 Agent 可以通过统一接口拿到识别结果。即使模型本身不会看图,也可以根据这些文字和区域信息决定下一步操作。 Perception 不是默认组件,其中 OmniParser 检测器采用 AGPL-3.0;Cua Driver 仍保持 MIT 协议。
Original source More content
Public content from Kaka Web3. Market and digital-asset information is not investment advice.