LiveAnimate: 실시간 장편 인물 애니메이션을 가능하게 하다
LiveAnimate는 포즈 기반 인물 애니메이션의 오래된 딜레마, 즉 좋은 품질과 느린 속도 사이의 충돌을 다룬다. 14B 규모의 비디오 DiT를 실시간 스트리밍 추론에 맞게 재구성해 긴 시퀀스에서도 안정성을 유지하려는 점이 핵심이다.
더 보기Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우
총 548개의 아티클
LiveAnimate는 포즈 기반 인물 애니메이션의 오래된 딜레마, 즉 좋은 품질과 느린 속도 사이의 충돌을 다룬다. 14B 규모의 비디오 DiT를 실시간 스트리밍 추론에 맞게 재구성해 긴 시퀀스에서도 안정성을 유지하려는 점이 핵심이다.
더 보기UniSwap은 말하는 영상에서 인물의 외형과 음색을 동시에 바꾸기 위한 통합 오디오-비주얼 프레임워크다. 별도 모델을 조합하는 대신 하나의 확산 Transformer 안에서 두 모달리티를 함께 다룬다.
더 보기StateFlow는 영화, 게임, 건축, 도시 설계의 프리비주얼라이제이션을 위해 지속적인 3D 세계 상태를 중심에 둔 생성 프레임워크입니다. 영상을 한 번에 만드는 대신, 세계를 구성하고 변화시키며 카메라를 통해 접근하는 방식을 제안합니다.
더 보기새 논문은 “오랜 상호작용 속에서도 모순 없이 유지하는 능력”을 자동으로 평가할 수 있게 만들었다. NCP-Bench는 강한 모델도 장기 서사에서는 쉽게 흔들린다는 점을 보여준다.
더 보기UniMoMo는 학습이 끝난 대형 추천 MoE 모델을 더 적은 전문가 수의 표준 MoE로 바꾸는 후처리 압축 프레임워크다. 파라미터 거리 대신 보정 데이터에서의 기능적 유사성과 라우팅 트래픽을 기준으로 전문가를 병합한다.
더 보기VibeLifeBench는 짧은 명령 수행이 아니라, 조용히 변하는 생활 환경 속에서 몇 주간 이어지는 과제를 AI 에이전트가 감당할 수 있는지 평가한다.
더 보기Ex-Omni-2D는 말은 할 수 있지만 ‘보이지는 않는’ 기존 멀티모달 대화 모델의 한계를 겨냥한다. 텍스트, 개인화 음성, 참조 조건 비디오를 하나의 응답으로 함께 생성한다.
더 보기Evidence-RL은 비전-언어 모델이 정답을 맞혔더라도 실제로 이미지의 핵심 증거를 사용했는지 검증하려는 연구다. CED는 증거 영역을 반사실적으로 중화해 답변이 해당 시각 증거에 의존하는지를 훈련 중 감사한다.
더 보기SPOT은 온폴리시 증류에서 어느 위치를 추가로 탐색하고 어떤 후보를 학습 목표로 삼을지 함께 결정한다. 교사 모델의 국소 확률만 따르지 않고, 검증기가 평가한 후속 생성 결과로 증류 타깃을 보정한다.
더 보기AMD는 강한 교사 에이전트의 성공 궤적을 계층적 기억으로 추출해 작은 LLM 에이전트에 전달하는 방식이다. 재학습보다 재사용 가능한 경험을 구조화하는 데 초점을 둔다.
더 보기이 기술 보고서는 언어모델의 해석 가능성을 학습 이후에 덧붙이는 방식이 아니라, 학습 과정의 제약으로 함께 최적화해야 한다고 주장한다. Steerling-8B는 생성 결과를 입력 토큰, 인간이 이해할 수 있는 개념, 학습 데이터와 연결하려는 사례다.
더 보기이미지 생성 대화에서 유용한 후속 편집 제안은 채팅 텍스트만으로 만들 수 없다. 이 연구는 실제 서비스 데이터와 클릭 피드백, 시각 검증기를 결합해 현재 이미지에 맞는 다음 편집 추천을 개선한다.
더 보기Motif 3는 총 3140억 파라미터, 토큰당 132억 활성 파라미터를 가진 decoder-only MoE 언어 모델이다. GDLA와 다단계 후학습을 결합해 추론, 코딩, 장문맥 성능을 높이려 한다.
더 보기이 논문은 모델의 여러 생성 결과에서 내부 일관성을 찾아 의사 해답을 만들고, 그 합의와 어긋나는 출력을 학습하는 U-OPSD를 제안한다. 정답 라벨이나 더 큰 교사 모델 없이도 수학 추론 벤치마크에서 기반 모델을 꾸준히 개선했다는 점이 핵심이다.
더 보기Ouroboros는 도구, 프롬프트, 컨텍스트 조립 방식, 핵심 구현까지 개선 대상으로 삼는 자기 발전형 에이전트 하네스다. 논문은 여러 벤치마크에서 높은 성과를 보고하는 동시에, 자기 수정 에이전트의 안전 거버넌스를 핵심 과제로 제시한다.
더 보기SWE-Bench ProMax는 AI 코딩 에이전트 평가를 단순 버그 수정에서 여러 파일과 언어를 아우르는 동작 보존형 리팩터링으로 확장한다.
더 보기YOLO-PEFT는 실시간 객체 탐지기에서 PEFT 어댑터를 어디에 둘지 결정하는 문제를 감사 가능한 제약 계획으로 바꾼다. 단순히 LoRA를 붙이는 것이 아니라, 위험할 때 훈련 전에 거부하는 절차까지 포함한다.
더 보기Skaling law는 모델 용량과 학습 데이터가 손실에 미치는 영향을 독립적으로 보지 않고, 하나의 상호작용 지수로 결합해 기존 스케일링 법칙의 한계를 보완하려는 제안입니다.
더 보기이 논문은 Test-Time Training을 개별 변형의 집합이 아니라 조합 가능한 설계 공간으로 다시 정의한다. 핵심은 새 변형을 만들기 쉬워지는 것뿐 아니라, 어떤 구성요소가 실제로 성능에 기여하는지 분리해서 볼 수 있다는 점이다.
더 보기AI 중심 헤지펀드 Situational Awareness가 공개시장 포트폴리오 축소 이후에도 칩 제조 스타트업에 대규모 투자를 이어갔다. 이번 투자로 Source Foundry에 대한 누적 투자액은 5억 달러가 됐다.
더 보기Us vs. Them은 버전 이력과 diff를 이용해 현재 텍스트의 어느 구간이 인간이 쓴 부분이고 어느 구간이 에이전트가 만든 부분인지 추정하는 오픈소스 도구다. AI 에이전트가 인간의 의도가 담긴 영역을 함부로 덮어쓰지 않도록 돕는 데 초점이 있다.
더 보기