AlphaEvolve, 행렬 곱셈 지수 상한을 2.371177로 개선
DeepMind 연구진을 포함한 연구팀이 조합 손실 분석의 핵심 최적화 문제를 재정식화하고, 머신러닝 기반 최적화와 AlphaEvolve를 결합했습니다. 그 결과 행렬 곱셈 지수의 기존 상한 2.371339가 2.371177로 낮아졌습니다.
더 보기Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우
총 791개의 아티클
DeepMind 연구진을 포함한 연구팀이 조합 손실 분석의 핵심 최적화 문제를 재정식화하고, 머신러닝 기반 최적화와 AlphaEvolve를 결합했습니다. 그 결과 행렬 곱셈 지수의 기존 상한 2.371339가 2.371177로 낮아졌습니다.
더 보기Ventor-QTest는 대상 API의 확률 정보를 요구하지 않고 반복 요청과 장기 시퀀스 실행으로 호스팅 LLM의 안정성을 감사합니다. 평균적인 변동과 드물지만 심각한 이탈을 분리해 측정하는 것이 핵심입니다.
더 보기DumpsterCluster 연구는 퇴역 GPU를 묶어 대규모 언어 모델 추론 시스템으로 활용할 수 있음을 보여준다. 그러나 낮은 구매 비용만으로는 충분하지 않으며, 전기요금과 전력의 탄소집약도가 실제 경제성과 지속가능성을 결정한다.
더 보기37개 언어 모델을 감사한 연구는 LLM이 인간의 심리측정 관계의 대략적인 방향은 재현하지만, 실제 응답자 데이터의 구조까지 보존하지는 못한다고 밝혔다.
더 보기RAG 포이즈닝 공격은 모델을 불확실하게 만드는 대신 잘못된 정보에 과도한 확신을 갖게 할 수 있다. 새로운 연구는 생성 과정의 문서 수준 어텐션 엔트로피를 추적하는 D-SCAN을 제안했다.
더 보기UI-Mate는 환경 기반 학습 파이프라인과 문맥 내 시연 학습을 결합해 장기 컴퓨터 작업을 수행하는 GUI 에이전트입니다. 제공된 논문 요약에 따르면 UI-Mate-27B는 OSWorld-Verified에서 77.0%를 기록했습니다.
더 보기상하이 인공지능 연구소의 한 논문은 LLM 기반 에이전트의 인지 범위가 넓어질 때 발생할 수 있는 위험을 물리적 인지, 사회적 인지, 자기참조 인지의 세 단계로 정리한다. 핵심 쟁점은 능력이 커질수록 인간의 주체성, 자율성, 통제력을 어떻게 지킬 것인가이다.
더 보기WorldRover는 Unreal Engine을 활용해 장시간 탐색 경로와 기하, 움직임, 대응 관계 주석을 함께 생성하는 데이터 엔진입니다. 일관된 세계 표현을 유지하고 다시 방문해야 하는 모델의 학습을 지원하는 것이 목표입니다.
더 보기실제 영수증 필드를 대상으로 한 연구는 일반적인 신뢰도 임계값 방식이 문서 내 상관관계, 점수 재학습 누수, 이산 점수의 동률 집중 때문에 목표 위험을 벗어날 수 있음을 보였다. 연구는 평균 위험 통제부터 문서 수준 PAC 인증까지의 유효성 사다리와 조건화가 유효한 상황을 제시한다.
더 보기SPARGen은 공간 지능에 필요한 여러 과제를 지시 조건부 생성 문제로 다시 정의한다. 핵심은 3D 재구성, 조밀 대응, 공간 추론을 별도 모듈이 아니라 하나의 네이티브 멀티모달 생성 프레임워크에서 다루는 것이다.
더 보기OpenAI가 macOS용 ChatGPT 데스크톱 앱에 Computer History 기능을 추가한다. 클릭, 입력, 앱 사용 흐름을 ChatGPT와 Codex가 참고할 수 있게 해 생산성을 높이지만, 개인 작업 기록을 AI에 맡기는 문제도 함께 제기된다.
더 보기한 보안 연구 글은 스타트업이 쓰지 못한 AI API 크레딧을 사들여 할인된 추론 접근권으로 되파는 ‘토큰 브로커’ 시장을 추적했다. 추론 자원이 일종의 준화폐처럼 유통되면서 비용 절감과 함께 보안·컴플라이언스 리스크도 커지고 있다.
더 보기UniSwap은 말하는 영상에서 인물의 외형과 음색을 동시에 바꾸기 위한 통합 오디오-비주얼 프레임워크다. 별도 모델을 조합하는 대신 하나의 확산 Transformer 안에서 두 모달리티를 함께 다룬다.
더 보기LiveAnimate는 포즈 기반 인물 애니메이션의 오래된 딜레마, 즉 좋은 품질과 느린 속도 사이의 충돌을 다룬다. 14B 규모의 비디오 DiT를 실시간 스트리밍 추론에 맞게 재구성해 긴 시퀀스에서도 안정성을 유지하려는 점이 핵심이다.
더 보기새 논문은 “오랜 상호작용 속에서도 모순 없이 유지하는 능력”을 자동으로 평가할 수 있게 만들었다. NCP-Bench는 강한 모델도 장기 서사에서는 쉽게 흔들린다는 점을 보여준다.
더 보기StateFlow는 영화, 게임, 건축, 도시 설계의 프리비주얼라이제이션을 위해 지속적인 3D 세계 상태를 중심에 둔 생성 프레임워크입니다. 영상을 한 번에 만드는 대신, 세계를 구성하고 변화시키며 카메라를 통해 접근하는 방식을 제안합니다.
더 보기Ex-Omni-2D는 말은 할 수 있지만 ‘보이지는 않는’ 기존 멀티모달 대화 모델의 한계를 겨냥한다. 텍스트, 개인화 음성, 참조 조건 비디오를 하나의 응답으로 함께 생성한다.
더 보기VibeLifeBench는 짧은 명령 수행이 아니라, 조용히 변하는 생활 환경 속에서 몇 주간 이어지는 과제를 AI 에이전트가 감당할 수 있는지 평가한다.
더 보기UniMoMo는 학습이 끝난 대형 추천 MoE 모델을 더 적은 전문가 수의 표준 MoE로 바꾸는 후처리 압축 프레임워크다. 파라미터 거리 대신 보정 데이터에서의 기능적 유사성과 라우팅 트래픽을 기준으로 전문가를 병합한다.
더 보기SWE-Bench ProMax는 AI 코딩 에이전트 평가를 단순 버그 수정에서 여러 파일과 언어를 아우르는 동작 보존형 리팩터링으로 확장한다.
더 보기Ouroboros는 도구, 프롬프트, 컨텍스트 조립 방식, 핵심 구현까지 개선 대상으로 삼는 자기 발전형 에이전트 하네스다. 논문은 여러 벤치마크에서 높은 성과를 보고하는 동시에, 자기 수정 에이전트의 안전 거버넌스를 핵심 과제로 제시한다.
더 보기