LLM 에이전트의 작업 간 기술 이전: 하위 작업과 텍스트의 승리
읽어야 하는 이유 자율 에이전트를 개발하는 개발자는 메모리를 텍스트 형식의 하위 작업으로 구조화하여 신뢰성을 높일 수 있습니다. 제안된 유틸리티 점수는 효과적인 기술을 선별하기 위한 실행 전 진단 기능을 제공합니다.
연구에 따르면 하위 작업 수준의 유도 및 텍스트 형식이 코드 기반 방법보다 더 나은 성능을 보이는 LLM 에이전트의 신뢰할 수 있는 기술 이전을 가능하게 합니다.
읽어야 하는 이유 자율 에이전트를 개발하는 개발자는 메모리를 텍스트 형식의 하위 작업으로 구조화하여 신뢰성을 높일 수 있습니다. 제안된 유틸리티 점수는 효과적인 기술을 선별하기 위한 실행 전 진단 기능을 제공합니다.
연구에 따르면 하위 작업 수준의 유도 및 텍스트 형식이 코드 기반 방법보다 더 나은 성능을 보이는 LLM 에이전트의 신뢰할 수 있는 기술 이전을 가능하게 합니다.
읽어야 하는 이유 테마는 「더 나은 모델」에서 「신뢰할 수 있는 자율성」으로의 전환. Outcomes(에이전트 실행을 채점하는 grader loop)와 Dreaming(스케줄 메모리 큐레이션)은 무인으로 돌릴 수 있는 에이전트의 인프라 —— 그것이 엔터프라이즈 배포의 진짜 장벽이지 모델 IQ가 아니다.
Code with Claude 런던(5/20-21)에서 Anthropic이 5개 에이전트 기능 —— Dreaming, Outcomes, 멀티 에이전트 오케스트레이션, Claude Finance, Add-ins —— 와 Small Business 통합을 출시.
읽어야 하는 이유 테제는 볼륨에 대한 진짜 베팅: CEO Will Bryk는 에이전트 검색 수요가 Google 인간 총량의 수천 배를 넘을 것이라 주장. 에이전트가 주요 웹 클라이언트가 되면 검색 계층은 인프라 —— Exa는 에이전트 퍼스트로 구축, 인간 검색엔진 개조가 아니다.
Exa가 $2.5억 Series C를 밸류 $22억에 조달, a16z 리드 —— 작년 가을 $7억 밸류 대비 3배. AI 네이티브 검색 API(Google/Bing 래퍼 아님), 5,000+ 고객에 Cursor, Cognition, HubSpot.
읽어야 하는 이유 Anthropic의 첫 버티컬 제품. 핵심은 기능 목록이 아니라 'Claude for X'가 모델 API가 아닌 패키지 SaaS로 출하되기 시작했다는 점.
Anthropic, Claude for Small Business 출시: 15개 워크플로우, 15개 에이전트 스킬, 12개 SaaS 커넥터(QuickBooks, PayPal, Square 등). 추가 요금 없음.
Anthropic ships 10 finance agent templates + governed data connectors (Moody's MCP, D&B). Claude Opus 4.7 leads Vals AI Finance benchmark at 64.37%.
Picobot ships as a single 9MB Go binary, 10MB idle RAM, 29MB Alpine image. 16 built-in tools, OpenAI-compatible. Runs on $5 VPS, Pi, old Android.
Opsera가 Cursor IDE에 3개 DevSecOps 에이전트 출시: 아키텍처 검증, SQL/보안 스캔, SOC2/HIPAA/PCI/GDPR 자동 증거 수집.
Bret Taylor의 Sierra가 $158억 포스트머니로 $9.5억 조달 — Fortune 50의 40%와 8분기 만에 $1.5억 ARR 달성. Tiger Global과 Google GV가 리드.
Snyk가 AI Security Platform에 Claude를 임베드하고 Evo 출시 — 프롬프트 인젝션, MCP 공급망 공격, 에이전트 툴 호출에 대응하는 첫 주요 AppSec 도구.
Anthropic이 Managed Agents에 플릿 오케스트레이션, Outcomes 목표 사양, Dreaming을 출시. Dreaming은 파인튜닝 없이 세션 간 자가 개선을 가능하게 한다.
Anthropic이 Claude Code Routines 출시 — Anthropic 인프라에서 실행되는 (prompt, repo, connectors) 구성, 스케줄/HTTP POST/GitHub 이벤트로 트리거.
Jules(Gemini 3 Pro 기반)가 전 세계 퍼블릭 베타 출시. GitHub 레이블 트리거 Action과 새 「Jules Tools」CLI 제공. Claude Code에 대한 첫 번째 진지한 비동기 GitHub 네이티브 경쟁자.
OX Security가 20만 대 이상의 MCP 서버가 STDIO 전송 레이어의 입력 검증 없이 OS 명령을 실행한다고 공개. 별도 스캔에서 36.7%가 SSRF 취약점 보유 확인.
Agent 365가 사용자당 월 $15로 GA. 각 에이전트에 독립 Entra ID와 Defender MCP 위협 탐지 제공. Agent Framework 1.0은 A2A·MCP 상호운용 내장 오픈소스 다중 에이전트 기반.
Mistral Medium 3.5는 128B 파라미터 dense 모델로 256K 컨텍스트를 지원합니다. Mistral은 Vibe에 클라우드 remote agent를, Le Chat에 Work Mode를 함께 추가했습니다.
Anthropic이 직원 69명에게 $100 예산을 주고, 4개의 서로 다른 모델 설정 마켓에서 에이전트들이 서로 사고 팔게 했습니다. 거래 186건, 약 $4K가 흐르며 모델 품질이 뚜렷한 비대칭을 만들어냈습니다.
Cursor 3.2가 /multitask로 비동기 서브에이전트 병렬 실행, Agents Window에서 worktrees, 여러 폴더와 repo를 가로지르는 multi-root workspace를 도입했습니다.
Google이 Gemini API에 Gemini 3.1 Pro 기반의 두 가지 리서치 에이전트를 출시했습니다. 저지연 Deep Research와 장기 컴퓨트의 Deep Research Max로, 모두 Model Context Protocol을 네이티브로 지원합니다.