아티클 목록으로
모델 평가

Chain-of-Experience: 추론 중 경험으로 계속 개선하는 LLM

약 3분 소요

들어가며

일반적인 LLM 평가는 하나의 프롬프트와 하나의 응답을 완결된 과정으로 취급한다. 이 방식은 모델이 첫 시도에서 무엇을 할 수 있는지는 보여주지만, 실패한 뒤 결과를 검토하고 다음 전략을 바꿀 수 있는지는 충분히 측정하지 못한다. 논문 「Chain-of-Experience for Continual LLM Improvement」는 이러한 추론 시점의 학습 능력을 연구하고 **Chain-of-Experience(CoE)**라는 설정을 제시한다.

핵심 내용

  • 추론을 반복 루프로 구성한다. CoE는 배포 중 모델 가중치를 다시 학습시키지 않는다. 대신 여러 상호작용에서 얻은 경험 흔적을 축적하고, 이후 시도에서 이를 참고하도록 한다.
  • 피드백의 출처가 다양하다. 모델이 스스로 생성하는 피드백뿐 아니라 답변의 정답 여부, 프로그래밍 과제의 공개 테스트 통과율과 같은 환경 신호도 사용한다. 서로 다른 신호는 오류와 개선 방향을 각기 다른 방식으로 드러낼 수 있다.
  • 여러 영역과 모델을 평가했다. 실험은 수학, 코딩, 지식 과제를 대상으로 진행됐으며 8개 LLM을 비교했다. 초록에는 GPT-5, Gemini-2.5 Pro, Claude-4.5 Sonnet이 포함된 것으로 제시되어 있다.
  • 피드백 없는 추론보다 높은 성능을 보였다. 연구 요약에 따르면 경험을 활용한 반복 방식은 피드백 없는 기준선을 일관되게 앞섰다. 전체 과제와 모델에서 5.6%의 개선과 19% 낮은 API 비용이 보고됐으며, 기존 테스트 시점 전략보다 token당 정확도도 높았다.
  • 상호보완적 신호가 추가 이득을 준다. 모델 피드백과 정답성 같은 환경 피드백을 결합하면 추가적인 성능 향상이 나타났다. 기본 능력이 높은 모델일수록 개선 여력도 큰 양의 상관관계가 관찰됐고, 대부분의 이득은 초기 반복에서 발생했다.

의미와 과제

CoE는 테스트 시점 스케일링의 의미를 확장한다. 더 많은 계산을 투입하는 방법이 반드시 후보 답변을 늘리거나 추론을 길게 만드는 것만을 뜻하지는 않는다. 이전 시도의 결과를 저장하고, 그 결과에 따라 다음 전략을 바꾸는 방식도 하나의 확장 경로가 될 수 있다. 수학 문제나 실행 가능한 코드처럼 결과를 검증할 수 있는 영역에서 특히 실용적인 가능성이 있다.

이 접근법은 LLM 평가의 질문도 바꿀 수 있다. 모델이 처음부터 정답을 내는가뿐 아니라, 상호작용을 통해 얼마나 빠르게 더 나아지는가를 측정해야 한다는 것이다. 실제 환경에서 행동하고 결과를 받는 에이전트에는 이런 능력이 중요하다.

다만 약하거나 부정확한 피드백에도 어느 정도 강건하다는 결과가 모든 피드백이 안전하다는 뜻은 아니다. 제공된 자료에는 세부 실험 설정, 반복 횟수, 비용 산정 방식이 포함되어 있지 않으므로 보고된 수치를 모든 배포 환경에 적용할 수 있는 보편적 보장으로 해석해서는 안 된다. 앞으로는 유용한 경험을 선별하고, 잘못된 피드백의 누적을 막으며, 반복을 언제 종료할지 결정하는 방법이 필요하다.

Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
SWE-bench Science가 드러낸 과학 소프트웨어 코드 수정의 난점
모델 평가
cctest.ai
모델 평가

SWE-bench Science가 드러낸 과학 소프트웨어 코드 수정의 난점

SWE-bench Science는 98개 GitHub 저장소와 20개 과학 분야를 대상으로 과학 소프트웨어 공학을 저장소 수준에서 평가합니다. 공개 테스트를 통과하는 것만으로는 과학적 의미를 보존한 수정이라고 볼 수 없다는 점을 보여줍니다.

더 보기
CCTest · Blog
ASR 모델은 정말 음성을 듣는가: 벤치마크 최적화의 함정
모델 평가
cctest.ai
모델 평가

ASR 모델은 정말 음성을 듣는가: 벤치마크 최적화의 함정

Hume AI의 연구는 자동 음성 인식 모델이 공개 벤치마크의 정답 문구를 재현하는 경향을 측정하는 방법을 제시했다. 일부 고득점 오픈소스 모델은 음성이 모순되거나 가려졌거나 모호한 상황에서도 참조 문장을 그대로 출력했다.

더 보기