VideoRAE: 비디오 파운데이션 모델을 생성용 잠재공간으로 바꾸다
VideoRAE는 동결된 비디오 파운데이션 모델의 표현을 압축 가능하고 재구성 가능하며 생성 모델에 적합한 잠재표현으로 전환하려는 접근이다. 픽셀 재구성에 치우친 기존 3D-VAE의 한계를 겨냥한다.
더 보기Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우
총 811개의 아티클
VideoRAE는 동결된 비디오 파운데이션 모델의 표현을 압축 가능하고 재구성 가능하며 생성 모델에 적합한 잠재표현으로 전환하려는 접근이다. 픽셀 재구성에 치우친 기존 3D-VAE의 한계를 겨냥한다.
더 보기새 arXiv 논문은 spike-tokenizing 신경 디코더를 위한 MOJO 프레임워크를 제안했다. 마스크드 오토인코더 기반 자기지도학습과 지도학습 목표를 함께 사용해 라벨 없는 신경 기록을 훈련에 활용한다.
더 보기새 arXiv 논문은 표준 가우시안까지의 제곱 Wasserstein 거리로 비가우시안성을 측정하는 OT-ICA를 제안했다. 이는 기존 ICA에서 쓰이던 누적량이나 모수적 우도 기반 대리 목적을 대체하려는 접근이다.
더 보기새 arXiv 논문은 생성형 게임 엔진 논의를 전통적인 게임 루프인 행동, 상태, 관측의 관점에서 다시 정리한다. 핵심은 그럴듯한 영상 생성이 아니라 규칙을 따르고 결과를 기억하는 상태 기반 세계다.
더 보기404 Media 보도에 따르면 해킹으로 확보된 Suno 자료에는 YouTube Music, Deezer, Genius 등에서 음악과 가사를 수집하는 지시가 포함돼 있었다. 이번 사안은 AI 음악 학습이 공정 이용인지, 무단 수집인지에 대한 논쟁을 더 구체화한다.
더 보기MetaPerch는 동물 소리 자체뿐 아니라 녹음 위치와 시간 같은 메타데이터를 보조 감독 신호로 활용하는 생물음향 파운데이션 모델이다. 실제 수동 음향 모니터링에서 중요한 분포 변화와 도메인 이동에 대응하는 데 초점을 맞춘다.
더 보기새 arXiv 논문은 동결된 Evo 2 표현 위에 경량 프로브를 학습해 메타게놈 데이터에서 항생제 내성과 세균 독력 신호를 읽어낼 수 있는지 평가했다. AMR 탐지는 강한 성능을 보였지만, 독력 탐지와 생성 서열 라벨 해석에는 한계가 확인됐다.
더 보기Ai2는 해양 분야 AI 에이전트 Shippy의 구축 경험을 공개했다. 핵심은 더 강한 모델 하나가 아니라, 도구와 권한, 샌드박스, 평가 체계를 함께 설계하는 데 있다.
더 보기IBM Research는 Agent 시스템의 모델 라우팅을 단순 분류 문제로 보면 한계가 있다고 지적한다. 실제 운영에서는 비용, 품질, 지연시간, 캐시, 인프라, 거버넌스가 함께 작동한다.
더 보기Hindcast는 이미 종료된 Polymarket 시장을 과거 시점에서 다시 실행해, LLM이 결과를 모르는 상태에서 얼마나 잘 예측하는지 평가하는 방법이다. 핵심은 검색과 학습 데이터에서 발생하는 정답 누수를 막는 데 있다.
더 보기arXiv 논문은 사용자가 LLM의 원래 답변에서 잘못된 추론 단계를 직접 수정하고, 수정된 CoT를 정제된 프롬프트로 바꿔 이후 추론을 유도하는 Deep Interaction을 제안한다.
더 보기arXiv 논문은 Lego WeDo2 로봇 시뮬레이션, 검색 증강 생성 대화형 도우미, 루브릭 기반 평가를 결합한 초등 지진 교육 프레임워크 Earthquaker-AI를 소개한다.
더 보기arXiv 논문은 지식 수집, 콘텐츠 개발, 검토, 교육, 평가 설계까지 AI를 적용하는 전문 직무 업스킬링 프레임워크를 제안한다. 핵심은 개별 도구가 아니라 교육 프로그램 전체 흐름을 AI로 재구성하는 데 있다.
더 보기arXiv 논문이 만주어 역사 문헌 OCR을 사례로, 시각적 서체에 따라 페이지를 전문 모델로 보내는 다중 전문가 방식을 제안했다. 반복 미세조정 과정의 체크포인트를 영역 전문가로 재활용하는 점이 특징이다.
더 보기arXiv 논문은 LLM 번역을 문장별 변환이 아닌 문서 전체의 재구성으로 확장하기 위해 RAG 기반 PAT 시스템을 제안한다. 명세와 비교 말뭉치는 더 큰 폭의 재구성을 유도할 수 있지만, 그 효과는 아직 일관적이지 않다.
더 보기arXiv에 공개된 연구는 2361개 인기 GitHub 저장소를 분석해 에이전트형 코딩 도구가 오픈소스 워크플로에 들어오고 있지만, 집중적 활용은 아직 일부 프로젝트에 머물러 있음을 보여준다.
더 보기arXiv 논문은 재생에너지 발전 예측에서 입력 특징을 어떻게 고를 것인지에 주목하며 CSFS를 제안했다. 이 방법은 기존 순차 특징 선택과 유사한 예측 성능을 보이면서 평균 21%의 계산 비용 절감을 보고했다.
더 보기이 arXiv 논문은 Transformer 피드포워드 블록의 설계를 깊이가 증가할 때 얼마나 많은 그래디언트 랭크가 살아남는지로 해석한다. 잔차 연결, 정규화 위치, 폭 확장은 단순한 크기 안정화 장치가 아니라 랭크 붕괴를 조절하는 요소로 설명된다.
더 보기새 arXiv 논문은 학습 중 발견한 고성능 회로 설정을 ‘등대’로 저장하고, 이후 강화학습 에피소드의 재시작 지점으로 활용하는 Lighthouse RL을 제안한다. 핵심 목표는 비용이 큰 아날로그 회로 크기 최적화에서 불필요한 탐색을 줄이는 것이다.
더 보기arXiv 논문은 AI 기반 시스템의 침투 테스트가 서버나 권한 침해 여부에만 머물러서는 안 된다고 주장한다. 공격자가 프롬프트, 검색 콘텐츠, 센서 입력, 도구 호출 등을 통해 AI의 행동을 바꾸고 운영 목표를 위반하게 만들 수 있기 때문이다.
더 보기arXiv 논문 M⁴World는 주변 시점 비디오와 동기화된 LiDAR를 생성하면서 객체 단위 조작을 지원하는 주행 월드 모델을 제안합니다. 핵심은 제어 가능성, 장시간 안정성, 희귀 주행 상황 맞춤 생성입니다.
더 보기