EvoDuet, 웹 검색과 문제 해결을 함께 진화시키다
들어가며
대규모 언어 모델을 과학적 탐색에 활용하는 한 가지 방법은 후보를 만들고, 평가하고, 그 결과를 바탕으로 다음 후보를 생성하는 진화적 검색이다. 그러나 더 나은 해답을 만들기 위해 모델 외부의 지식이 필요할 때 탐색은 비슷한 아이디어를 반복하며 정체될 수 있다. 웹 검색을 붙이면 부족한 정보를 보완할 수 있지만, 해답이 바뀌어도 같은 페이지를 계속 반환한다면 검색은 탐색의 발전으로 이어지지 않는다.
EvoDuet은 검색과 문제 해결을 함께 진화시키는 방식으로 이 문제를 다룬다. 모델의 파라미터는 고정하고, 후보 해답, 검색 질의, 문서, 평가 결과 사이의 관계를 반복적으로 갱신한다.
핵심 구조
- 검색 게이트: 매 반복마다 모델이 지식 부족 여부를 판단하고 새 문서를 검색할지, 저장된 문서를 재사용할지, 검색 없이 진행할지를 선택한다. 무조건 검색하는 방식을 피한다.
- 내부 루프: 검색 질의를 다듬고, 어떤 문서가 더 높은 점수의 해답을 만들 가능성이 있는지 예측해 순위를 매긴다. 문서의 가치를 단순한 텍스트 유사성으로만 판단하지 않는 것이다.
- 외부 루프: 선택된 문서를 바탕으로 후보를 병렬 생성하고 실제 과제 점수를 기록한다. 이 결과는 이후 검색과 문서 선택의 피드백으로 사용된다.
- 다른 탐색 프레임워크와의 결합: Top-K와 EvoX 같은 진화적 검색 스캐폴드와 결합했을 때도 Sums/Diffs와 Denoising에서 개선이 관찰됐다.
실험 결과와 한계
21개 최적화 과제에서 반복마다 후보 하나만 생성하는 조건에서, GPT-5.6-Luna를 사용한 EvoDuet은 OpenEvolve의 정규화 발견 이득을 74.1%에서 78.0%로 높였다. Gemini-3.8-Flash에서는 61.3%에서 82.3%로 상승했다. 논문에 따르면 최상의 실행 결과는 8개 과제에서 기존에 보고된 최고 점수를 넘어섰고, 3개 과제에서는 같은 수준에 도달했다. 여기에는 Q20과 Rosetta의 Swap Reduction이 포함된다.
다만 모든 모델이 이득을 얻은 것은 아니다. Qwen3.5-9B에서는 개선이 나타나지 않았다. 이는 검색 도구를 제공하는 것만으로는 충분하지 않다는 뜻이다. 모델은 정보가 부족한 시점을 파악하고, 유용한 질의를 만들며, 문서를 이해하고, 이를 더 높은 점수의 후보로 변환해야 한다.
의미와 영향
EvoDuet의 핵심은 검색 기록을 단순한 문맥 저장소가 아니라 해답 평가와 연결된 최적화 신호로 만든 데 있다. 과학 최적화에서는 관련 정보를 찾는 것 자체보다, 그 정보가 평가 가능한 해답의 개선으로 이어지는지가 중요하다. 이런 폐쇄형 피드백은 정적인 검색 증강보다 탐색 목표에 더 직접적으로 맞을 수 있다.
반면 검색 호출에 따른 비용, 품질이 낮은 문서가 후속 탐색에 미치는 영향, 모델별 성능 차이는 남은 과제다. 더 다양한 과학 문제에서 효율성과 안정성을 검증해야 한다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…