AI 에이전트는 개방형 과학 발견에 다가갔지만 판단력은 여전히 과제
들어가며
AI의 과학 발견 성과는 목표와 평가 지표가 명확할 때 빠르게 발전해 왔습니다. 하지만 실제 연구는 정해진 벤치마크를 푸는 일과 다릅니다. 연구자는 무엇을 조사할지, 어떤 이상 현상을 따라갈지, 언제 실험을 반복하거나 중단할지, 그리고 결과가 과학적으로 중요한지를 판단해야 합니다.
“Can AI Agents Make Open-Ended Scientific Discovery? Evidence from Station”은 AI 에이전트가 이러한 개방형 연구를 얼마나 지속할 수 있는지 살펴본 연구입니다. 중간 목표와 정답이 주어지지 않는 상황에서 에이전트가 스스로 방향을 정하고 연구를 이어갈 수 있는지가 핵심입니다.
핵심 내용
- 개방형 연구에 가까운 설정. 연구진은 최근 ICLR 구두 발표 논문 3편을 바탕으로 과제를 만들었습니다. 에이전트에는 연구 질문과 실험 설정만 제공하고 원 논문의 결과는 공개하지 않았습니다. 웹 접근도 차단해 검색으로 답을 찾는 대신 직접 실험하고 기록을 축적하도록 했습니다.
- 사전 정의된 발견을 더 많이 회수. 원 논문의 결과를 개별 기준으로 나눈 뒤, 각 시스템이 얼마나 재발견했는지 비교했습니다. Station은 평균 62.7%를 회수했습니다. Codex Multiagent-v2는 15.4%, AI Scientist-v2는 설정에 따라 14.4~20.6%였습니다. 누적 실험 시간은 맞췄지만 모델 구성과 토큰 예산은 달랐으므로, 이 수치를 모든 환경에 적용되는 절대적 순위로 보기는 어렵습니다.
- 탐색 지속성을 높인 두 가지 장치. Supervisor는 연구 방향을 안내하고, 주기적인 Meta Reflection은 진행 상황과 연구 계획을 재검토하게 합니다. 분석 결과 두 장치를 함께 사용했을 때 연구 범위와 연속성이 개선됐으며, 에이전트가 어려운 문제를 일찍 포기하고 쉬운 문제로 이동하는 경향도 줄었습니다.
- 참조 논문이 없는 과제에서도 유사한 발견. 추가로 진행한 두 개의 탐색 과제에서는 이후 인간 연구자가 보고한 발견과 가까운 결과도 나왔습니다. 잠재 학습 과제에서 에이전트는 LoRA 훈련을 초기 레이어로 제한하면 실패했던 특성 전이를 회복할 가능성이 있다는 결과를 찾았습니다.
의미와 한계
Station의 의미는 단순한 재발견 비율에만 있지 않습니다. 여러 에이전트가 연구 방향을 선택하고, 실험을 수행하며, 서로의 결과를 검토하고, 공유 지식 기반의 결론을 다음 탐색에 활용하는 장기 연구 구조를 제시했다는 점이 중요합니다. 연구진은 코드와 전체 연구 기록도 공개할 예정이어서 성공 사례뿐 아니라 실패 과정도 확인할 수 있습니다.
그러나 이 결과가 AI가 독립적으로 과학 연구를 수행한다는 뜻은 아닙니다. 과제와 실험 공간, 평가 기준은 여전히 사람이 설계했습니다. 더 근본적으로, 결과를 재현하는 것과 그 결과가 중요한지 판단하는 것은 별개의 능력입니다. 연구진도 에이전트가 인간 연구자라면 흥미롭지 않다고 여길 질문에 상당한 자원을 소비한다고 지적합니다.
따라서 Station은 완성된 과학자라기보다 능력의 경계를 측정하는 실험에 가깝습니다. 앞으로는 가치 있는 질문을 고르고, 의미 있는 이상 신호를 포착하며, 생산성이 낮은 연구 방향을 적절히 중단하는 과학적 판단이 핵심 과제가 될 것입니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…