LLMエージェントにおけるタスク間スキル転移:サブタスクとテキストの利点
読む理由 自律型エージェントを開発する際、メモリをテキスト形式のサブタスクとして構造化することで信頼性を向上させられる。提案されたユーティリティスコアは、有効なスキルをフィルタリングする実行前診断として機能する。
LLMエージェントのスキル転移において、サブタスクレベルでの誘導とテキスト形式が信頼性を高め、タスクレベルやコードベース手法を上回ることを実証。
読む理由 自律型エージェントを開発する際、メモリをテキスト形式のサブタスクとして構造化することで信頼性を向上させられる。提案されたユーティリティスコアは、有効なスキルをフィルタリングする実行前診断として機能する。
LLMエージェントのスキル転移において、サブタスクレベルでの誘導とテキスト形式が信頼性を高め、タスクレベルやコードベース手法を上回ることを実証。
読む理由 テーマは「より良いモデル」から「信頼できる自律性」へのシフト。Outcomes(エージェント実行を採点する grader loop)と Dreaming(スケジュールされたメモリ整理)は、無人で走らせ続けられるエージェントのインフラ —— エンタープライズ展開の本当の障壁はモデル IQ ではない。
Code with Claude ロンドン(5/20-21)で Anthropic が 5 つのエージェント機能 —— Dreaming、Outcomes、マルチエージェント編成、Claude Finance、Add-ins —— と Small Business 統合を出荷。
読む理由 テーゼはボリュームへの実際の賭け:CEO Will Bryk はエージェント検索需要が Google の人間総量の数千倍を超えると主張。エージェントが主要 Web クライアントになれば、検索層はインフラ —— Exa はエージェントファーストで構築、人間検索エンジンの改造ではない。
Exa が $2.5 億 Series C を評価額 $22 億で調達、a16z がリード —— 昨秋の $7 億評価から 3 倍。AI ネイティブ検索 API(Google/Bing ラッパーでない)、5,000+ 顧客に Cursor、Cognition、HubSpot。
読む理由 Anthropic 初の垂直特化プロダクト。注目点は機能リストではなく、『Claude for X』がモデル API ではなくパッケージ SaaS として出荷され始めたこと。
Anthropic が Claude for Small Business を発表。15 ワークフロー、15 スキル、12 コネクタ(QuickBooks、PayPal、Square 等)。追加料金なし。
Anthropic ships 10 finance agent templates + governed data connectors (Moody's MCP, D&B). Claude Opus 4.7 leads Vals AI Finance benchmark at 64.37%.
Picobot ships as a single 9MB Go binary, 10MB idle RAM, 29MB Alpine image. 16 built-in tools, OpenAI-compatible. Runs on $5 VPS, Pi, old Android.
Opsera が Cursor IDE 内に 3 つの DevSecOps エージェントを出荷:アーキテクチャ検証、SQL/セキュリティ・スキャン、SOC2/HIPAA/PCI/GDPR の自動エビデンス収集。
Bret Taylor の Sierra が $158 億ポストマネーで $9.5 億調達 — Fortune 50 の 40% と 8 四半期で $1.5 億 ARR を達成。Tiger Global と Google GV がリード。
Snyk が AI Security Platform に Claude を組み込み Evo を出荷 — プロンプト・インジェクション、MCP サプライチェーン攻撃、エージェント・ツール呼び出しに対応する初の主要 AppSec ツール。
Anthropic は Managed Agents 向けにフリート編成、Outcomes ゴール仕様、Dreaming を出荷。Dreaming はファインチューニングなしでセッションを跨いだ自己改善を可能にする。
Anthropic が Claude Code Routines を出荷 — Anthropic インフラ上で稼働する (prompt, repo, connectors) 設定で、スケジュール、HTTP POST、GitHub イベントでトリガー。
JulesがGemini 3 Pro搭載でグローバルパブリックベータ公開。GitHubラベルトリガーのActionと新しい「Jules Tools」CLIを提供し、Claude Codeへの最初の本格的な非同期GitHub対抗馬となった。
OX SecurityがMCPサーバーの標準STDIOトランスポートに入力サニタイズなしでOSコマンドを実行する脆弱性を開示。200,000台以上が影響を受け、36.7%がSSRF攻撃にも脆弱。
Agent 365がユーザーあたり月$15でGA。各エージェントに独自のEntra IDとDefender MCP脅威検知を付与。Agent Framework 1.0はA2A・MCP互換を標準搭載したオープンソース多エージェント基盤。
Mistral Medium 3.5 は 128B パラメータの密モデル、256K context。あわせて Vibe にクラウド remote agent、Le Chat に Work Mode を追加。
Anthropic は社員 69 名に各 $100 の予算を渡し、4 つの異なるモデル設定の市場でエージェント同士に売買させた。計 186 件の取引、約 $4K の流通、モデル品質による顕著な非対称性が確認された。
Cursor 3.2 は /multitask による並列 async サブエージェント、Agents Window の worktrees、複数フォルダ/repo にまたがる multi-root workspace を追加しました。
Google が Gemini API に Gemini 3.1 Pro 駆動のリサーチエージェント 2 種を投入。低レイテンシの Deep Research と長時間計算の Deep Research Max。両者とも Model Context Protocol をネイティブサポート。