[클로바 시선 #56] 충돌은 나누고, 성능은 합치다: 효율적인 LLM Post-training 전략 MERIT
AI
[클로바 시선 #56] 충돌은 나누고, 성능은 합치다: 효율적인 LLM Post-training 전략 MERIT
두줄요약
멀티모달 LLM 후학습에서 서로 다른 데이터를 섞을 때 생기는 충돌 문제를 다뤘습니다. 효율적인 Post-training 전략 MERIT를 소개했습니다.
핵심 내용
- 멀티모달 대규모 언어모델 후학습에서 여러 지시·응답 데이터를 섞는 Instruction Mixture 전략의 활용 배경
- 인식, 추론, OCR, 문서 이해, 비디오 이해처럼 능력이 다양해질수록 데이터 충돌과 학습 효율 문제가 커지는 상황
- 효율적인 LLM Post-training 전략 MERIT를 통해 충돌 데이터를 다루는 접근을 소개하는 글