LLMエージェントにおけるタスク間スキル転移:サブタスクとテキストの利点
読む理由 自律型エージェントを開発する際、メモリをテキスト形式のサブタスクとして構造化することで信頼性を向上させられる。提案されたユーティリティスコアは、有効なスキルをフィルタリングする実行前診断として機能する。
LLMエージェントのスキル転移において、サブタスクレベルでの誘導とテキスト形式が信頼性を高め、タスクレベルやコードベース手法を上回ることを実証。
読む理由 自律型エージェントを開発する際、メモリをテキスト形式のサブタスクとして構造化することで信頼性を向上させられる。提案されたユーティリティスコアは、有効なスキルをフィルタリングする実行前診断として機能する。
LLMエージェントのスキル転移において、サブタスクレベルでの誘導とテキスト形式が信頼性を高め、タスクレベルやコードベース手法を上回ることを実証。
読む理由 本研究は、堅牢なエージェントツール使用のために専用中間学習が不可欠であることを示し、LLMに対してポストトレーニング手法のみを頼るよりも優れた代替案を提供します。
MidToolは、Webデータと合成API監督を組み合わせる中間学習パイプラインにより、Qwen3モデルの汎用ツール使用能力を大幅に向上させます。
読む理由 モデルは政策より先に準備が整った。OpenAIの供給能力ではなく政府の承認がフロンティアモデルの公開を制御する——ビルダーが今後も目にするであろう新しいガバナンスの型だ。
OpenAIは6月26日にGPT-5.6 Sol/Terra/Lunaを発表——SolはTerminal-Bench 2.1で91.9%を記録するが、アクセスは米政府承認済みの約20社に限定される。
読む理由 オープンウェイトと最前線のクローズドモデルとの差は、いまや一桁のベンチマークポイントで測られる。セルフホストする開発者にとって、GLM-5.2 はエージェント型コーディングの「自作か購入か」の計算を変える。
Z.ai は6月17日に GLM-5.2 を MIT ライセンスで公開——7,530億パラメータの MoE で100万トークンのコンテキストを持ち、オープンソースのコーディングベンチマークで首位、コストは GPT-5.5 の約6分の1。
読む理由 料金体系と無料試用期間が開発者が最初に確認すべき点。100万トークンあたり入力$15・出力$60という価格設定は、試用ではなく本格利用を想定している。
Gemini 3.5 ProがVertex AIエンタープライズの最終プレビューに入り、200万トークンのコンテキストウィンドウとDeep Think推論を搭載。2026年6月中のGA一般公開が目前。
読む理由 一つのフロンティアモデルに二つのリリース形態:ガードレール付きの公開版と、制限付きの完全版。ビルダーがまず確認すべきは価格、無料期間、安全分類器のフォールバック挙動だ。
Anthropic が初の一般公開 Mythos 級モデル Claude Fable 5 をリリース。価格は 100 万トークンあたり入力 $10/出力 $50。制限解除版 Mythos 5 は審査済みパートナー限定。
読む理由 GitHub Copilot に入り浸っているなら、今週カーソル下のデフォルトモデルが密かに変わっているかもしれない。実際に何が出荷され、どう見分けるかを解説する。
マイクロソフトは Build 2026 で 5B の自社製コーディングモデルを VS Code に投入し、35B の推論モデルも出荷した——いずれも OpenAI の蒸留なしで訓練。
読む理由 大手プラットフォームの所有者が自社の推論モデルを出荷し、それを OpenAI への支払いを減らす手段だと公然と位置づけることは、単なる製品の投下ではなく構造的な話だ——それはフロンティアモデルのサプライチェーン全体を再価格付けする。
6 月 2 日の Build 2026 で、マイクロソフトはコストを下げ OpenAI への依存を減らすため、推論モデル MAI-Thinking-1 を筆頭に、ゼロから構築した 7 つの MAI モデルを出荷した。
中国の 4 ラボが 12 日間でフロンティア級コーディングモデルを出荷。GLM-5.1(MIT)が SWE-Bench Pro で Kimi K2.6 と 58.4% で並ぶ。コスト差は西側 API の 5〜25 分の 1。