2026-08-22 — views
MidTool: 중간 훈련을 통한 에이전트 능력 강화
읽어야 하는 이유 이 연구는 전임 훈련만 의존하는 것보다 강력한 에이전트 도구 사용을 위해 전용 중간 훈련이 필수적임을 보여주며, 대규모 언어 모델(LLM)에 대한 우월한 대안을 제시합니다.
MidTool은 웹 데이터와 합성 API 감독을 결합하여 Qwen3 모델의 일반 도구 사용 능력을 크게 향상시키는 중간 훈련 파이프라인을 소개합니다.
중간 훈련의 중요한 역할
중간 훈련은 대규모 언어 모델의 능력을 형성하는 데 있어 점점 더 중요한 단계로 인식되고 있습니다. 최근 연구들은 표적화된 중간 훈련이 수학 및 과학과 같은 추론 집약적 능력을 강화할 수 있을 뿐만 아니라, 소프트웨어 공학 환경에서의 에이전트 능력도 향상시킬 수 있음을 보여주었습니다. 본 연구에서는 병렬적이지만 덜 탐구된 에이전트 능력인 일반 도구 사용에 대해 조사합니다.
MidTool 소개
우리는 MidTool을 제시합니다. 이는 대규모 웹, PDF 및 코드 데이터와 실제 세계 도구 API, MCP 스킬, 문서 기반 워크플로우에서 유래한 합성 감독을 결합하여 에이전트 도구 사용 중간 훈련을 위한 오픈 코퍼스 구축 파이프라인입니다. MidTool은 모델이 도구 기능(affordances)을 인식하고, 컨텍스트에서 인수를 근거화하며, 도구 호출 워크플로우를 구성하고, 불완전한 정보로부터 복구하는 방법을 가르치도록 설계되었습니다.
실험 결과 및 영향
우리는 Qwen3-4B-Base와 Qwen3-8B-Base를 MidTool-Mix로 중간 훈련한 후, 감독형 미세 조정(SFT)과 강화 학습(RL)을 모두 적용하여 후속 전임 훈련을 수행했습니다. 베이스라인과 비교할 때, MidTool-Mix는 BFCL, tau2-Bench 및 MCP Universe에서 SFT와 RL 모두 하에서 다운스트림 성능을 일관되게 향상시켰습니다. 이러한 결과는 일반 도구 사용이 다른 중요한 LLM 능력과 마찬가지로 전임 훈련에만 맡겨지는 것보다 전용 중간 훈련의 혜택을 받음을 시사합니다.
실무자 노트
개발자들은 강력한 에이전트 도구 사용 능력을 필요로 할 경우 모델 개발 파이프라인에 중간 훈련 단계를 통합하는 것을 고려해야 합니다. SFT 및 RL과 같은 전임 훈련 방법에만 의존하는 것은 일반 도구 사용 시나리오에서 최적의 성능을 달성하기에 충분하지 않을 수 있습니다.