2026-08-22 — views
任务模型诱导从计算机轨迹中恢复交错工作流
为什么值得读 构建桌面智能体的人工智能工程师可以使用TMI从原始交互数据中学习真实世界的工作流,从而实现更稳健且可审计的任务执行。
新的TMI方法从被动计算机使用轨迹中提取结构化任务模型,显著提高了智能体相对于现有基线的准确性。该方法通过递归目标分解和控制流模型,从原始交互数据中恢复交错任务,在受控轨迹上实现0.974的一致性,并重建74.9%的执行步骤,使保留任务的准确性提高30.0%。
自然主义计算机使用的挑战
自然主义计算机使用轨迹由被动记录的屏幕截图以及鼠标或键盘操作组成,是推导日常工作任务执行的符号化、可审计且可重用模型的重要资源。随着计算机使用智能体开始进入真实世界的工作环境,学习任务实际执行方式的能力变得至关重要。组织还需要能够有效审计和重用这些知识。然而,诱导此类任务模型面临重大挑战。活动通常仅以低级事件的形式被观察到,而真实世界的工作本质上是多线程的,具有交错的目标。现有方法通常假设给定的任务或单一工作流,仅产生步骤级摘要,而非结构化任务模型。
引入任务模型诱导
为了解决这些局限性,研究人员引入了任务模型诱导(Task Model Induction, TMI)。这种方法旨在从不受约束的轨迹中发现潜在任务,有效解耦并发活动。对于每个识别出的潜在任务,TMI诱导出一个任务模型,该模型将递归目标分解的层次化目标模型与组织执行的控制流过程模型相结合。这种双模型结构使得对任务的理解比以前的方法更加全面。
性能与准确性
TMI的有效性已通过内在和外在评估得到证明。在受控的人类和智能体轨迹上,TMI恢复交错任务与真实分组的一致性达到0.974。此外,它重建了74.9%的观察执行步骤,这一性能指标远超最强的工作流诱导基线。在外在评估中,源自TMI任务模型的技能使保留任务的准确性比最强基线提高了30.0%。这些结果表明,TMI在从被动数据源对复杂真实世界计算机使用模式进行建模方面提供了显著进步。
实务笔记
构建自主智能体的开发人员应考虑集成TMI,以从原始交互日志中提取结构化任务模型,从而实现更准确的任务执行。通过利用层次化目标分解和控制流模型,工程师可以创建更能理解和审计真实世界工作流的智能体。