让 AI 帮你写代码这件事已经卷了两年,但真正有意思的下一步是让它替你操作电脑——点按钮、填表单、在表格里核对数字。难就难在,模型看得见截图,却摸不到那台机器。cua 这个开源项目就是冲着这个缺口来的:把「给智能体一台能用的电脑」所需要的每一层,都摊开来做成开源件。

是什么
cua(GitHub:trycua/cua)是一套面向 computer-use 的开源工具链,MIT 协议,目前 2.7 万多个 Star,最新组件版本 sandbox-v0.8.0,2026 年 9 月底还在天天提交。它不绑某一家模型:你用 Claude Code、Codex、Cursor 还是自研智能体都行,cua 负责的是底下那层——把电脑递过去,并把过程记下来。
仓库里几块拼图各管一段:Cua Driver 负责操控真实的桌面应用,macOS、Windows、Linux 都支持,走 CLI、MCP 或者带类型的 SDK 接入;Lume 用 Apple 的虚拟化框架在 Apple 芯片上起本地 macOS / Linux 虚拟机;Cua Fleets 是云上的隔离桌面池,代码从池子里领一台、用完归还;CUA-S1 是他们训练的小型专用模型,专门干「下一步点哪儿」这类快判断;Cua Bench 则用来造任务、跑评测、导出轨迹数据。

cua 仓库首页。README 里按组件给了五条上手路径,每条都带「你的第一个结果」教程
它到底好用在哪儿
第一是「同一任务里穿层」。官方管这叫 Computer-Use 2.0:智能体在一段任务里既能调 API、跑代码,也能直接去点图形界面——能走接口就走接口,界面挡住了才下手点。这比「只能截图点击」或者「只能调接口」都更接近人干活的顺序。
第二是环境给得很足。很多 computer-use 实验死在环境上:没有干净的机器、装不了依赖、跑完留一摊痕迹。cua 的思路是给你隔离的桌面——本地用 Lume 起虚拟机,云端用 Fleets 领一台,跑命令、截屏、操作应用全在沙箱里,用完即回收,不污染你的主力机。
第三是评测和训练闭环。Cua Bench 可以不依赖虚拟机和模型 API 就先造个模拟任务,跑参考解法、看评测器给不给满分奖励,再把轨迹导出来喂训练。CUA-S1 的表单场景模型就是这么练出来的——按结构化界面元素打分做决策,而不是逐 token 生成回答。

cua 官网。主打并行跑智能体训练、评测和数据生成,机器覆盖 Linux、Windows、macOS 和 Android
怎么用
最轻的入口是 Driver:macOS 或 Linux 上一行 curl -fsSL https://cua.ai/driver/install.sh | bash 装好(Windows 用 PowerShell 脚本),然后照官方教程让智能体打开计算器算 6 × 7,再让它自己核对屏幕上显示的是不是 42——走通这一趟,权限、连接、动作边界就都清楚了。
想上虚拟机就装 Lume(也是一条 curl 命令),从 Apple 恢复镜像起一台 macOS 虚拟机然后 SSH 进去;想跑评测就 uv tool install 'cua-bench[browser]'。模型随便换,Claude Code、Codex、Cursor、OpenClaw 都有现成的接入文档。
不足也得说清楚
第一,协议是拼起来的。核心 MIT 没问题,但可选的感知扩展(OmniParser 那套模型)是 AGPL 系,CUA-S1 的权重单独放在 Hugging Face、按各自卡片的条款走。商用前得逐个组件看协议,别整包当成 MIT 拿去分发。
第二,云桌面要花钱。本地虚拟机免费,但 Fleets 云端按容量计费,池子还能保留付费容量,教程里专门提醒要跟着清理步骤走,不然账单会给你惊喜。
第三,别高估现状。CUA-S1 还在早期研究阶段,目前主要覆盖表单类决策;computer-use 这件事本身在行业里也还不稳,复杂界面照样会点错。把它当「基础设施 + 试验台」合适,当「开箱即用的员工」还早。
跟同类怎么比
和 Anthropic、OpenAI 那种模型自带的 computer use 能力比,cua 不跟模型抢活——它做的是底下那层:驱动、虚拟机、云桌面、评测集,模型随便换。所以它更像「给智能体用的测试机房」,而不是另一个模型。
和 Playwright、Puppeteer 这类 Web 自动化比,后者只覆盖浏览器,cua 连原生桌面应用一起管。和自己攒 VNC 加虚拟机农场比,cua 把环境、动作接口、评测轨迹都打包好了,省的是搭台子的时间。如果你正打算让智能体走出浏览器去碰真实桌面,这套东西值得先跑一遍教程——2.7 万 Star、天天有提交,社区也是活的。
GitHub:https://github.com/trycua/cua
官方网站:https://cua.ai
标签:#cua #AI智能体 #桌面自动化 #ComputerUse #开源工具 #评测基准
你的智能体现在还只待在浏览器里,还是已经放手让它去点真实的桌面应用了?