2026-08-22 — views
タスクモデル誘導はコンピュータトレースからインターリーブされたワークフローを復元する
読む理由 デスクトップエージェントを構築するAIエンジニアは、TMIを使用して生データから現実のワークフローを学習し、より堅牢で監査可能なタスク実行を可能にできます。
新手法TMIは、受動的なコンピュータ使用トレースから構造化されたタスクモデルを抽出し、既存のベースラインを上回るエージェント精度を実現します。
自然なコンピュータ使用の課題
受動的に記録されたスクリーンショットやマウス・キーボード操作からなる自然なコンピュータ使用トレースは、日常業務がどのように行われるかの記号的で監査可能、かつ再利用可能なモデルを導出するための貴重なリソースです。コンピュータ使用エージェントが現実の業務環境に参入するにつれ、タスクが実際にどのように実行されるかを学習する能力が重要になっています。組織はまた、この知識を効果的に監査し、再利用する能力も必要としています。しかし、このようなタスクモデルを誘導するには大きな課題があります。活動は通常、低レベルのイベントとしてのみ観察され、現実の業務は本質的にマルチスレッドで、インターリーブされた目標を持っています。既存の手法は一般的に、特定のタスクまたは単一のワークフローを前提としており、構造化されたタスクモデルではなく、ステップレベルの要約のみを生成します。
タスクモデル誘導の紹介
これらの制限に対処するため、研究者らはタスクモデル誘導(TMI)を導入しました。このアプローチは、制約のないトレース内の潜在的なタスクを発見し、並行して行われる活動を効果的に分離することを目的としています。TMIは、特定された各潜在的なタスクに対して、再帰的な目標分解の階層的な目標モデルと、実行を整理する制御フローの手順モデルをペアにしたタスクモデルを誘導します。この二重モデル構造により、以前の手法よりも包括的なタスクの理解が可能になります。
性能と精度
TMIの有効性は、内在的評価と外生的評価の両方を通じて実証されました。制御された人間およびエージェントの軌跡において、TMIは真のグループ分けに対して0.974の一致率でインターリーブされたタスクを復元します。さらに、観測された実行ステップの74.9%を再構築しており、このパフォーマンス指標は最も強力なワークフロー誘導のベースラインを大幅に上回っています。外生的評価では、TMIのタスクモデルから派生したスキルにより、最も強力なベースラインに対して保持されたタスクの精度が30.0%向上しました。これらの結果は、TMIが受動的なデータソースから複雑な現実のコンピュータ使用パターンをモデル化する能力において、重要な進展を提供することを示しています。
実装ノート
自律型エージェントを構築する開発者は、生データから構造化されたタスクモデルを抽出するためにTMIの統合を検討すべきです。これにより、より正確なタスク実行が可能になります。階層的な目標分解と制御フローモデルを活用することで、エンジニアは現実のワークフローをより良く理解し、監査できるエージェントを作成できます。