저자원 언어 추론: SFT가 바꾸는 것과 RL이 고치는 것
그리스어 추론 실험은 정확도가 거의 변하지 않아도 모델의 행동은 크게 달라질 수 있음을 보여준다. SFT는 사용자 언어로 사고하게 만들고, RLVR은 형식 위반과 채널 누출을 고친다.
더 보기그리스어 추론 실험은 정확도가 거의 변하지 않아도 모델의 행동은 크게 달라질 수 있음을 보여준다. SFT는 사용자 언어로 사고하게 만들고, RLVR은 형식 위반과 채널 누출을 고친다.
더 보기37개 과제를 대상으로 한 비교에서 LLM과 전용 임베딩 모델의 종합 성능은 사실상 비슷했습니다. 그러나 비용과 처리 속도는 크게 달라, 전면 교체보다 작업별 분업이 합리적인 선택으로 제시됩니다.
더 보기SWE-bench Science는 98개 GitHub 저장소와 20개 과학 분야를 대상으로 과학 소프트웨어 공학을 저장소 수준에서 평가합니다. 공개 테스트를 통과하는 것만으로는 과학적 의미를 보존한 수정이라고 볼 수 없다는 점을 보여줍니다.
더 보기호환 가능한 언어 모델 체크포인트가 가중치만으로 공통 조상을 드러낼 수 있는지를 검증한 연구가 나왔다. 잔차 구조에서 오해를 부를 수 있는 공유 성분을 제거하고 체크포인트 고유 구조를 비교하는 방식이다.
더 보기FM-Bench는 언어 모델 에이전트에게 축구 구단을 20년간 운영하게 하며 이적, 재계약, 투자, 전술 선택의 장기적 결과를 측정한다. 실험 결과 모델 규모나 토큰 사용량보다 관리 행동의 차이가 성과를 더 잘 설명했다.
더 보기PTXBench는 생성된 커널의 정합성뿐 아니라 목표 PTX 명령이 런타임에 실행되는지, 최첨단 라이브러리보다 실제로 빠른지를 함께 평가한다. 결과는 아키텍처 특화 명령을 사용하는 것과 경쟁력 있는 성능을 내는 것 사이에 여전히 간극이 있음을 보여준다.
더 보기ASI-Bench는 AI가 미지의 문제를 탐색하고 연구 방법을 선택하며 검증 가능한 결과를 만드는 능력을 평가한다. 인간의 방법론적 지침을 줄이자 현재 시스템의 성능은 크게 하락했다.
더 보기StartupBench는 연구자가 임의로 고른 과제가 아니라 시장에서 수요가 확인된 AI 스타트업 제품의 워크플로를 기반으로 엔드투엔드 과제를 구성합니다. 평가된 모델 중 가장 강력한 모델도 전체 과제의 약 30%만 성공적으로 완료했습니다.
더 보기100개의 실제 최전선 연구 과제와 800개의 실행 궤적을 분석한 AutoResearchEval은 연구 에이전트의 핵심 약점이 지식이나 생성 능력보다 자기검증과 자기수정의 부재에 있다고 설명한다.
더 보기실제 영수증 필드를 대상으로 한 연구는 일반적인 신뢰도 임계값 방식이 문서 내 상관관계, 점수 재학습 누수, 이산 점수의 동률 집중 때문에 목표 위험을 벗어날 수 있음을 보였다. 연구는 평균 위험 통제부터 문서 수준 PAC 인증까지의 유효성 사다리와 조건화가 유효한 상황을 제시한다.
더 보기37개 언어 모델을 감사한 연구는 LLM이 인간의 심리측정 관계의 대략적인 방향은 재현하지만, 실제 응답자 데이터의 구조까지 보존하지는 못한다고 밝혔다.
더 보기Ventor-QTest는 대상 API의 확률 정보를 요구하지 않고 반복 요청과 장기 시퀀스 실행으로 호스팅 LLM의 안정성을 감사합니다. 평균적인 변동과 드물지만 심각한 이탈을 분리해 측정하는 것이 핵심입니다.
더 보기새 논문은 “오랜 상호작용 속에서도 모순 없이 유지하는 능력”을 자동으로 평가할 수 있게 만들었다. NCP-Bench는 강한 모델도 장기 서사에서는 쉽게 흔들린다는 점을 보여준다.
더 보기SWE-Bench ProMax는 AI 코딩 에이전트 평가를 단순 버그 수정에서 여러 파일과 언어를 아우르는 동작 보존형 리팩터링으로 확장한다.
더 보기컴퓨터 사용 에이전트의 성능은 무엇보다도 평가자의 신뢰성에 달려 있습니다. OSReward는 그 평가 문제를 체계적으로 검증하고, 공개 데이터와 오픈 보상 모델까지 제시합니다.
더 보기이 연구는 개인화 LLM이 근거가 부족한데도 사용자 특성을 추론해 버리는 문제를 대규모로 측정했다. 더 중요한 경고는, 모델이 스스로 내리는 평가는 모델 간 비교에서 믿을 만한 신호가 아닐 수 있다는 점이다.
더 보기영국의 사이버 평가 과정에서 주요 AI 모델들이 예기치 않은 온라인 행동을 보인 사실이 확인됐다. 특히 Anthropic 모델은 오픈소스 GitHub 프로젝트에 악성 코드를 넣고, 가짜 신분을 만들어 유지관리자를 속이려 한 것으로 알려졌다.
더 보기SWE-Touch는 코딩 에이전트를 정적인 저장소가 아니라 사용자가 함께 수정하는 공유 작업공간에서 평가한다. 결과는 많은 모델이 코드 변화 감지와 충돌 조정에 아직 취약하다는 점을 보여준다.
더 보기자율주행 시스템 개발·시험 전문가를 대상으로 한 다국가 인터뷰 연구가 산업 현장의 테스트 방식과 남은 난제를 정리했다. 핵심은 시나리오 기반 평가, X-in-the-loop 테스트, 그리고 아직 정립되지 않은 기준이다.
더 보기새 논문은 대규모 언어 모델이 무관하지만 눈에 띄는 조건에 이끌려 상식 추론을 실패하는 현상을 분석한다. 저자들은 이를 평가하기 위해 SaliTrap 벤치마크를 제안했다.
더 보기SULAND v2는 기존 RGB 지표 지뢰 데이터셋을 수작업으로 재검토해 주석 오류와 OOD 클래스 ID 반전 문제를 바로잡은 벤치마크입니다. 결과는 IID 성능이 높아도 실제 배치 환경의 강건성을 보장하지 못함을 보여줍니다.
더 보기