아티클 & 가이드

비전·비디오

Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우

총 35개의 아티클

CCTest · Blog
Luce, 한 장의 이미지로 재조명 가능한 3D 에셋 생성
비전·비디오
cctest.ai
비전·비디오

Luce, 한 장의 이미지로 재조명 가능한 3D 에셋 생성

Luce는 기하 구조와 PBR 재질을 통합한 멀티모달 Gaussian 표현을 제안하고, 단일 이미지에서 재조명 가능한 3D 에셋을 생성합니다. PBR Gaussian과 함께 텍스처 메시 및 탄젠트 공간 노멀 맵도 선택적으로 출력할 수 있습니다.

더 보기
CCTest · Blog
고덕, 12프레임으로 만 프레임급 3D 재구성하는 ABot-Recon 공개
비전·비디오
cctest.ai
비전·비디오

고덕, 12프레임으로 만 프레임급 3D 재구성하는 ABot-Recon 공개

고덕이 최근 12개 프레임만을 국소 문맥으로 활용해 긴 영상의 3D 장면을 순차적으로 재구성하는 모델 ABot-Recon을 공개했다. 장기 메모리 의존을 없애 장거리 시퀀스에서 발생하는 오차 누적, 속도 저하, 메모리 증가 문제를 줄이는 것이 핵심이다.

더 보기
CCTest · Blog
InfinityEdit, 고정 영상 편집을 무한 스트리밍 편집으로 확장
비전·비디오
cctest.ai
비전·비디오

InfinityEdit, 고정 영상 편집을 무한 스트리밍 편집으로 확장

InfinityEdit는 완성된 영상 클립을 프레임 단위로 다시 쓰는 대신, 편집 지시를 반영하면서 앞으로 이어질 영상 구간을 생성하는 방식을 제안합니다. 영상 이력, 시간적 인과성, 편집 텍스트를 연결하는 경량 어댑터로 스트리밍 영상 생성기에 편집 기능을 더합니다.

더 보기
CCTest · Blog
4DAnyone: 일반 단안 영상에서 동적 4D 인물 재구성
비전·비디오
cctest.ai
비전·비디오

4DAnyone: 일반 단안 영상에서 동적 4D 인물 재구성

4DAnyone은 보정되지 않은 단안 인물 영상에서 시점 간 일관성이 높은 다중 시점 영상을 생성한 뒤 이를 4D Gaussian Splatting으로 변환합니다. 늘어나는 참조 정보와 분할된 시점 그룹 사이의 구조적 불일치를 두 가지 컨텍스트 설계로 해결하려 합니다.

더 보기
CCTest · Blog
JoyAI-Video-Edit: 실시간 개방형 비디오 편집을 위한 자기회귀 확산
비전·비디오
cctest.ai
비전·비디오

JoyAI-Video-Edit: 실시간 개방형 비디오 편집을 위한 자기회귀 확산

미래 프레임 없이, 길이도 미리 정하지 않은 상태에서 비디오를 편집하는 것은 쉽지 않습니다. JoyAI-Video-Edit는 자기회귀 확산과 증류 전략을 결합해 실시간성과 원본 보존을 함께 노립니다.

더 보기
CCTest · Blog
InfiniSplat: 단일 이미지 3DGS를 표면 정렬 표현으로 확장하다
비전·비디오
cctest.ai
비전·비디오

InfiniSplat: 단일 이미지 3DGS를 표면 정렬 표현으로 확장하다

InfiniSplat은 한 장의 이미지에서 큰 시점 변화에도 더 일관된 3D Gaussian Splatting 표현을 생성하려는 프레임워크입니다. 픽셀 격자 중심 예측 대신 기하 기반 샘플링과 암시적 가우시안 디코딩을 사용합니다.

더 보기
CCTest · Blog
VideoCoCo: Blender 코드를 비디오 생성의 과정 추론으로 활용하다
비전·비디오
cctest.ai
비전·비디오

VideoCoCo: Blender 코드를 비디오 생성의 과정 추론으로 활용하다

VideoCoCo는 텍스트 프롬프트를 실행 가능한 Blender 프로그램으로 바꾼 뒤, 시뮬레이션 초안을 사실적인 영상으로 편집하는 이중 엔진 프레임워크다. 핵심 목표는 텍스트-비디오 생성에서 부족했던 물리적 일관성을 높이는 것이다.

더 보기
CCTest · Blog
O-VAD, 산업 영상 이상 탐지를 클립 판단에서 객체 상태 추론으로 전환하다
비전·비디오
cctest.ai
비전·비디오

O-VAD, 산업 영상 이상 탐지를 클립 판단에서 객체 상태 추론으로 전환하다

O-VAD는 산업 공정 영상에서 객체를 분할·추적하고 시간에 따른 상태 궤적을 추론해 이상을 찾는 학습 불필요 프레임워크다. 핵심 주장은 프런티어 VLM의 산업 현장 성능 저하가 추론 능력 부족보다 객체 수준 증거 부족에서 비롯된다는 것이다.

더 보기
CCTest · Blog
생성 비디오가 같은 장소를 기억하게 하는 학습 없는 일관성 기법
비전·비디오
cctest.ai
비전·비디오

생성 비디오가 같은 장소를 기억하게 하는 학습 없는 일관성 기법

이 논문은 3D 엔진 조건 기반 장기 비디오 생성에서 카메라가 같은 장소를 다시 방문할 때 외관이 달라지는 문제를 다룬다. 과거 잠재 청크를 KV cache로 되돌리고, 자세와 깊이 재투영으로 attention을 유도해 추가 학습 없이 일관성을 높인다.

더 보기
CCTest · Blog
SANA-Video 2.0: 하이브리드 어텐션으로 고해상도 비디오 생성을 가속
비전·비디오
cctest.ai
비전·비디오

SANA-Video 2.0: 하이브리드 어텐션으로 고해상도 비디오 생성을 가속

SANA-Video 2.0은 선형 어텐션의 효율성과 softmax 어텐션의 표현력을 결합한 비디오 확산 Transformer입니다. 논문은 단일 H100에서 최대 720p 비디오 생성을 목표로 하며, 긴 비디오에서 계산 효율의 이점이 커진다고 설명합니다.

더 보기
CCTest · Blog
Self Gradient Forcing: 긴 영상 생성을 위한 메모리 쓰기 학습
비전·비디오
cctest.ai
비전·비디오

Self Gradient Forcing: 긴 영상 생성을 위한 메모리 쓰기 학습

Self Gradient Forcing은 자기회귀 영상 확산 모델에서 미래 프레임의 손실이 과거 생성 잠재표현의 KV 메모리 쓰기를 충분히 감독하지 못하는 문제를 다룹니다. 두 단계 학습으로 긴 rollout 전체를 역전파하지 않고도 빠진 기울기 신호를 복원합니다.

더 보기
CCTest · Blog
FlowMimic: 이미지 편집 데이터를 영상 편집으로 옮기는 방법
비전·비디오
cctest.ai
비전·비디오

FlowMimic: 이미지 편집 데이터를 영상 편집으로 옮기는 방법

FlowMimic은 영상 편집 데이터 수집이 비싸고 번거롭다는 문제를 정면으로 다룬다. 이미지 편집 샘플을 실시간으로 영상 편집 샘플로 바꾸고, 이미지와 영상의 능력을 서로 모방하게 만들어 하나의 모델로 묶는다.

더 보기