LLM 에이전트의 작업 간 기술 이전: 하위 작업과 텍스트의 승리
읽어야 하는 이유 자율 에이전트를 개발하는 개발자는 메모리를 텍스트 형식의 하위 작업으로 구조화하여 신뢰성을 높일 수 있습니다. 제안된 유틸리티 점수는 효과적인 기술을 선별하기 위한 실행 전 진단 기능을 제공합니다.
연구에 따르면 하위 작업 수준의 유도 및 텍스트 형식이 코드 기반 방법보다 더 나은 성능을 보이는 LLM 에이전트의 신뢰할 수 있는 기술 이전을 가능하게 합니다.
읽어야 하는 이유 자율 에이전트를 개발하는 개발자는 메모리를 텍스트 형식의 하위 작업으로 구조화하여 신뢰성을 높일 수 있습니다. 제안된 유틸리티 점수는 효과적인 기술을 선별하기 위한 실행 전 진단 기능을 제공합니다.
연구에 따르면 하위 작업 수준의 유도 및 텍스트 형식이 코드 기반 방법보다 더 나은 성능을 보이는 LLM 에이전트의 신뢰할 수 있는 기술 이전을 가능하게 합니다.
읽어야 하는 이유 이 연구는 전임 훈련만 의존하는 것보다 강력한 에이전트 도구 사용을 위해 전용 중간 훈련이 필수적임을 보여주며, 대규모 언어 모델(LLM)에 대한 우월한 대안을 제시합니다.
MidTool은 웹 데이터와 합성 API 감독을 결합하여 Qwen3 모델의 일반 도구 사용 능력을 크게 향상시키는 중간 훈련 파이프라인을 소개합니다.
읽어야 하는 이유 OpenAI의 처리 용량이 아니라 정부 승인이 프런티어 모델 출시의 관문이 되는 이런 새로운 거버넌스 패턴은 빌더들이 앞으로도 다시 보게 될 것이다.
OpenAI가 6월 26일 GPT-5.6 Sol/Terra/Luna를 공개했다. Sol은 Terminal-Bench 2.1에서 91.9%를 기록했지만, 접근은 정부 승인을 받은 약 20개 파트너로 제한된다.
읽어야 하는 이유 오픈 웨이트와 최전선 폐쇄형 모델 간 격차는 이제 한 자릿수 벤치마크 점수로 측정된다. 셀프 호스팅 개발자에게 GLM-5.2는 에이전트 코딩의 「자체 구축 vs 구매」 계산을 바꾼다.
Z.ai가 6월 17일 GLM-5.2를 MIT 라이선스로 공개 — 100만 토큰 컨텍스트를 갖춘 7,530억 파라미터 MoE로, 오픈소스 코딩 벤치마크 1위에 비용은 GPT-5.5의 약 6분의 1.
읽어야 하는 이유 개발자가 먼저 확인해야 할 것은 가격과 무료 체험 기간. 입력 100만 토큰당 $15, 출력 $60의 가격은 시험용이 아닌 실전 사용을 위한 설정이다.
Gemini 3.5 Pro가 200만 토큰 컨텍스트 윈도우와 Deep Think 추론을 탑재하고 최종 Vertex 엔터프라이즈 프리뷰에 진입. 2026년 6월 중 GA 출시 임박.
읽어야 하는 이유 하나의 프런티어 모델, 두 가지 출시: 가드레일을 두른 공개판과 제한된 완전판. 빌더가 먼저 확인해야 할 것은 가격, 무료 기간, 안전 분류기의 폴백 동작이다.
Anthropic이 최초의 공개 Mythos급 모델 Claude Fable 5를 출시했다. 가격은 100만 토큰당 입력 $10/출력 $50. 제한 해제판 Mythos 5는 심사를 거친 파트너 전용이다.
읽어야 하는 이유 GitHub Copilot에서 살다시피 한다면, 이번 주 커서 아래의 기본 모델이 조용히 바뀌었을 수 있다. 실제로 무엇이 출시됐고 어떻게 알아보는지 정리한다.
마이크로소프트는 Build 2026에서 5B 자체 코딩 모델을 VS Code에 넣고 35B 추론 모델도 출시했다——둘 다 OpenAI 증류 없이 학습.
읽어야 하는 이유 대형 플랫폼 소유자가 자사의 추론 모델을 출시하고 이를 OpenAI에 비용을 덜 지불하는 방법이라고 공개적으로 규정하는 것은 단순한 제품 출시가 아니라 구조적인 이야기이다 — 그것은 프런티어 모델 공급망 전체를 다시 가격 매긴다.
6월 2일 Build 2026에서 마이크로소프트는 비용을 낮추고 OpenAI 의존도를 줄이기 위해 추론 모델 MAI-Thinking-1을 필두로 처음부터 구축한 7개의 MAI 모델을 출시했다.
중국 4개 랩이 12일 만에 프론티어급 코딩 모델 출시. GLM-5.1(MIT)이 SWE-Bench Pro에서 Kimi K2.6과 58.4%로 동률. 비용 차이는 서방 API의 5~25분의 1.