InfiniSplat: 단일 이미지 3DGS를 표면 정렬 표현으로 확장하다
InfiniSplat은 한 장의 이미지에서 큰 시점 변화에도 더 일관된 3D Gaussian Splatting 표현을 생성하려는 프레임워크입니다. 픽셀 격자 중심 예측 대신 기하 기반 샘플링과 암시적 가우시안 디코딩을 사용합니다.
더 보기Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우
총 793개의 아티클
InfiniSplat은 한 장의 이미지에서 큰 시점 변화에도 더 일관된 3D Gaussian Splatting 표현을 생성하려는 프레임워크입니다. 픽셀 격자 중심 예측 대신 기하 기반 샘플링과 암시적 가우시안 디코딩을 사용합니다.
더 보기GradCuit은 Transformer 중간층에 최적화 가능한 연속 잠재 상태를 삽입해, 생성 결과의 피드백을 내부 추론 상태로 직접 전달하는 방법입니다. 모델 파라미터를 고정한 채 추론 정확도와 안정성을 높이는 데 초점을 둡니다.
더 보기Motion Beyond Morphology(MBM)는 참조 영상과 대상 객체의 형태가 크게 달라도 의미 있는 움직임을 옮기기 위한 프레임워크다. 고정된 구조 대응 대신, 범주를 넘어 보존될 수 있는 추상적 모션 표현을 활용한다.
더 보기새 논문은 LLM 코드 편집에서 ‘삭제 회피’라는 문제를 측정한다. 모델은 고쳐야 할 파일을 찾더라도, 실제로 지워야 할 코드를 남겨두는 경우가 많았다.
더 보기GPTQ-2D는 잔차의 왼쪽과 오른쪽 모두에 기저 행렬이 작용하는 더 일반적인 적응형 반올림 문제를 다룬다. 단순 벡터화 방식과 동일한 반올림 결과를 유지하면서, 반대각선 단위 처리로 계산 복잡도를 3차 시간으로 낮춘다.
더 보기Roomer는 생성된 3D 실내 배치에 남는 충돌, 경계 이탈, 출입구 가림, 동선 차단 문제를 특정 객체에 연결하고 국소 편집으로 고치는 반성적 복구 프레임워크다.
더 보기DeepVoyager-VL은 이미지를 처음에만 보는 방식에서 벗어나, 시각 증거가 검색과 중간 추론을 계속 이끄는 구조를 제안합니다. 긴 정보 탐색 과정에서 텍스트와 이미지를 반복적으로 활용하는 점이 핵심입니다.
더 보기N₀-TWAM은 접촉이 많은 로봇 조작을 위해 미래의 영상뿐 아니라 미래의 접촉까지 예측하는 촉각 네이티브 world-action model이다.
더 보기Weak-to-Strong On-Policy Distillation은 더 강한 교사 모델 없이도 강한 LLM을 개선하려는 증류 프레임워크입니다. 작은 모델들의 logit 차이를 이용해 능력 방향을 만들고 이를 학생 모델 학습에 사용합니다.
더 보기Mental World Modeling은 세계 모델이 물리적 장면만 정확히 재현해서는 인간 행동을 제대로 예측할 수 없으며, 믿음·의도·감정 같은 숨은 정신 상태를 함께 추적해야 한다고 제안한다.
더 보기새 논문은 세션을 넘나드는 개인화된 모호성 적응을 코딩 어시스턴트의 새로운 평가 과제로 제시한다. 핵심은 같은 사용자의 과거 해결 기록을 활용해 반복되는 애매한 요청을 더 적은 확인으로 처리할 수 있는지다.
더 보기SAF-OPD는 검증 가능한 보상 기반 강화학습과 온폴리시 증류를 단순히 고정 비율로 섞을 때 발생하는 불안정성을 다룬다. 교사 신호의 크기와 적용 시점을 조절해 탐색 능력을 보존하는 것이 핵심이다.
더 보기Rubric 기반 강화학습은 개방형 LLM 과제에서 유망하지만, 기준별 신호가 학습 과정에서 사라질 수 있다. CriPO는 미탐색 기준과 억제된 기준을 함께 다루는 on-policy 자기 증류 프레임워크다.
더 보기EMBL AI Librarian은 Europe PMC를 AI 에이전트가 쓰기 쉬운 자연어 기반 증거 검색 인터페이스로 바꾸려는 시도다. 단순한 논문 목록 대신 질문에 답하는 데 필요한 문헌 근거 조각을 제공한다.
더 보기ODEWorld는 고정된 시간 간격의 다음 상태 예측 대신, 물리 시간에서 움직이는 연속 잠재 속도장을 학습합니다. 이를 통해 임의의 시간 해상도 예측, 역방향 예측, 로봇 계획에 유용한 동역학 표현을 목표로 합니다.
더 보기RL²-VLA는 비전-언어-행동 모델이 어려운 로봇 작업에서 실패할 가능성이 높을 때만 오프라인 강화학습 기반 조향을 적용하는 추론 시 프레임워크다.
더 보기새 논문은 군집 로봇을 위한 분산 예측 아키텍처 Collective-State JEPA를 제안한다. 각 로봇은 지역 관측과 제한된 이웃 메시지만으로 동일한 미래 집단 상태를 나타내는 표현을 만든다.
더 보기새 연구는 원칙과 가치 기반 콘텐츠를 후처리 이전의 미드트레이닝 단계에 넣었을 때 정렬 효과가 더 오래 유지되는지 검증했다. 결과는 복잡한 구성보다 헌법적 콘텐츠의 존재 자체가 더 큰 영향을 준다는 점을 보여준다.
더 보기SULAND v2는 기존 RGB 지표 지뢰 데이터셋을 수작업으로 재검토해 주석 오류와 OOD 클래스 ID 반전 문제를 바로잡은 벤치마크입니다. 결과는 IID 성능이 높아도 실제 배치 환경의 강건성을 보장하지 못함을 보여줍니다.
더 보기새 논문은 극심한 노이즈가 섞인 RGB 관측과 근적외선(NIR) 단서를 3D 공간에서 융합하는 3DarkFusion을 제안한다. 깨끗한 RGB 감독 데이터 없이 저조도 컬러 이미지를 복원하는 것이 핵심이다.
더 보기이 논문은 감정 대화 시스템의 목표를 즉각적인 위로에서 사용자 역량 유지로 확장하며, 반복 사용과 종료까지 포함한 장기 연구 패러다임을 제안한다.
더 보기