MIT 라이선스의 Agent Lightning 1.0은 학습 엔진이 도구 실행 루프를 다시 구현하지 않고 실제 프로덕션 하네스의 질문과 답변 기록만 관찰해 강화학습하도록 분리합니다. Microsoft는 약 3500줄의 Python 코어와 재현 가능한 학습 스크립트로 Qwen 3.5 9B를 6000개 데이터에 학습해 SWE-bench Verified를 41.8%에서 56.4%로 높였다고 밝혔습니다. 학습과 배포 환경의 차이를 줄이는 장점이 있지만 보상 설계, GPU 인프라와 하네스 버전 관리가 필요합니다.
Tech로 돌아가기
Tech
Microsoft가 실제 에이전트 하네스를 그대로 학습하는 Agent Lightning 1.0을 공개했습니다
에이전트의 실제 도구와 복구 동작을 유지한 채 모델을 훈련하는 실무형 오픈소스 경로가 열렸습니다.