如果你最近关注 GPT-6 Astra 这类具备 computer use 能力的模型,最容易产生的误判是:只要 AI 能看懂屏幕、移动鼠标,就可以把所有电脑操作交给它。真正适合上线初期试点的,通常不是最复杂、最“像人”的任务,而是那些规则清楚、过程重复、结果容易检查,出错后也不会造成严重损失的工作。
Computer use 的特点,是让模型通过观察屏幕、识别界面并执行鼠标键盘操作,完成原本需要人手动点击的任务。它可以触达没有开放接口的网页、内部系统或桌面软件,因此比单纯生成文本更接近“替人操作电脑”。
但能操作,不代表适合托管。模型可能看错字段、误解页面提示,或者在流程发生变化时采取不符合预期的动作。上线初期更稳妥的思路,是把它当成一个需要边界的执行助手,而不是完全自主的员工。
可以用四个问题筛选任务:
四项中如果有两三项明显不满足,就不应该直接扩大权限。尤其是最后一项,不能因为任务看起来简单,就忽略错误带来的后果。
电子表格是比较适合入门的场景,但前提是任务目标要具体。例如,把多个表格中的姓名、日期、分类和金额整理到统一模板,清理明显重复项,按照指定字段排序,或者把缺失内容标记出来。
这类任务的优势在于,输入和输出都比较容易对照。试点时可以保留原始文件,让 AI 只处理副本,并要求它在完成后说明修改了哪些列、跳过了哪些异常行。人工不必逐个观察每次点击,但要抽查结果,并确认没有覆盖原始数据。
如果任务要求 AI 根据上下文判断某条记录属于哪个复杂类别,难度就会明显上升。此时更适合让它先提出分类建议,由人确认后再写入正式表格,而不是直接自动提交。
重复填写报名信息、资料登记表、内部申请表等,也可以作为早期试点对象。适合的表单通常具有固定字段,所需资料已经准备好,提交前还有预览或确认页面。
比较稳妥的流程是:AI 负责读取资料、填写草稿、检查空白字段;人在最终提交前核对关键信息。涉及金额、身份信息、收货地址或对外承诺的表单,不应默认自动提交。
这里的重点不是让 AI 代替所有输入,而是把人工从重复打字中解放出来,把注意力集中到最终确认环节。只要保留“填写”和“提交”的分界,出错范围通常更容易控制。
从多个公开页面收集产品名称、价格、营业时间、联系方式或活动规则,再整理成表格,是另一个可以尝试的方向。它尤其适合页面结构相对稳定、结果主要用于内部参考的任务。
不过,跨页面收集不能只看“有没有填满表格”。还要检查来源是否对应、字段是否错位、页面上的时间和条件是否被误读。试点时可以要求 AI 同时记录页面名称或来源位置,方便人工回看;如果页面需要登录、包含个人资料,或存在大量弹窗和动态内容,则应降低自动化权限。
对普通用户来说,整理优惠信息、店铺营业资料、商品参数等轻量工作,可以先从少量页面开始。不要一开始就让 AI 长时间运行,也不要把未经核验的结果直接发布出去。
按照统一规则整理下载文件,例如根据日期、主题或文件类型改名,再移动到对应文件夹,也适合在隔离环境中试用。它的判断标准比较直接,结果通常可以通过文件数量、名称格式和目录位置检查。
这类任务仍然需要设置例外处理。遇到重名文件、无法识别的格式或缺少日期时,AI 应该停下来标记问题,而不是自行猜测。一个好的自动化流程,不是遇到任何情况都继续执行,而是知道什么时候交还给人。
涉及付款、转账、下单、删除数据、修改权限和发送正式通知的操作,通常不适合在上线初期完全自动执行。即使页面流程很固定,错误也可能立即产生实际损失。
合同录入、财务数据修改、客户隐私资料处理等任务,也不应只因为“最后可以抽查”就放开权限。抽查并不能保证发现所有错误,尤其当错误内容看起来格式正常时。更合适的方式是让 AI 做资料预填、差异标记和初步检查,最终修改或提交由人完成。
需要复杂判断的客服回复、投诉处理、招聘筛选和内容审核,同样要谨慎。它们表面上可能只是打开页面、选择选项,但真正的难点在于理解上下文和承担判断责任。AI 可以整理信息、生成草稿或提示遗漏,却不宜在没有明确规则的情况下独立作出最终决定。
还有一种常见误区,是把“网页能打开”当成“任务已经适合自动化”。如果页面经常改版、按钮位置变化大、登录状态不稳定,或者操作过程中经常出现验证码、弹窗和异常提示,维护成本可能很快超过节省的时间。
在尝试一个新任务前,可以先写下以下内容:
如果这些问题还回答不清楚,优先整理流程,而不是急着换模型。很多自动化失败,并不是模型能力不足,而是任务本身没有明确的输入、规则和验收标准。
第一步,选择一个低风险、频率较高、人工操作比较重复的任务。不要直接从核心业务或重要账号开始,最好使用测试账号、样例文件或副本数据。涉及敏感资料时,应先确认运行环境的权限范围,并避免让 AI 接触不必要的账号和文件。
第二步,把任务拆成“观察、填写、检查、提交”几个阶段。上线初期可以只开放观察和填写,让 AI 生成草稿;检查由人完成;提交继续保留人工确认。等连续多次运行都能稳定通过,再考虑扩大自动执行范围。
第三步,提前写出停止条件。例如发现字段缺失、页面结构变化、出现异常提示、无法确认金额,或者准备执行不可逆操作时,立即暂停并请求人工处理。停止条件越具体,越容易落地。
第四步,不要只记录“成功还是失败”,还要记录失败发生在哪一步。是没有找到按钮,还是填错字段?是页面变化,还是任务规则本身不清楚?这些记录能帮助你判断,问题应该通过改流程、增加校验,还是减少 AI 权限来解决。
可以采用这样的试点分级:
Computer use 让 AI 有机会接管更多原本没有接口的电脑操作,但它并没有消除流程设计、权限控制和结果校验的必要性。上线初期最值得尝试的,不是展示 AI 能连续点击多少页面,而是找到一类边界清楚的重复工作,让它稳定完成其中一部分。
判断一个任务是否适合交给 AI,可以记住一句话:规则越明确,流程越稳定,结果越容易检查,错误成本越低,越适合先试点。
Δ
Ctrl+D