블랙포레스트랩스, 네이티브 오디오·비디오 생성을 앞세운 Flux3 공개
독일 AI 스타트업 블랙포레스트랩스가 멀티모달 기반 모델 Flux3를 발표했다. 이 모델은 Self-Flow 아키텍처를 기반으로 이미지, 비디오, 오디오, 액션 정보를 통합적으로 이해하고 생성하는 것을 목표로 한다.
더 보기Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우
총 795개의 아티클
독일 AI 스타트업 블랙포레스트랩스가 멀티모달 기반 모델 Flux3를 발표했다. 이 모델은 Self-Flow 아키텍처를 기반으로 이미지, 비디오, 오디오, 액션 정보를 통합적으로 이해하고 생성하는 것을 목표로 한다.
더 보기TechCrunch가 만난 보안 연구자들은 OpenAI와 Anthropic의 안전 가드레일이 악용을 줄이려는 장치인 동시에 합법적 취약점 연구를 지연시킬 수 있다고 말한다.
더 보기이 논문은 LLM과 AI 에이전트가 검색 결과의 주요 소비자가 되면서, 검색 품질을 개별 문서 관련도보다 문서 집합의 품질로 평가해야 한다고 주장한다.
더 보기ActiveVision은 멀티모달 대형언어모델이 한 번 보고 답하는 수준을 넘어, 관찰과 추론, 재확인을 반복할 수 있는지 평가하는 벤치마크다. 논문은 최신 모델과 인간 사이의 큰 격차를 보고한다.
더 보기Self Gradient Forcing은 자기회귀 영상 확산 모델에서 미래 프레임의 손실이 과거 생성 잠재표현의 KV 메모리 쓰기를 충분히 감독하지 못하는 문제를 다룹니다. 두 단계 학습으로 긴 rollout 전체를 역전파하지 않고도 빠진 기울기 신호를 복원합니다.
더 보기AMD가 대형 AI 연구소와 클라우드 데이터센터를 겨냥한 랙 스케일 AI 시스템 Helios를 앞세워 Nvidia에 도전한다. Microsoft, Anthropic, OpenAI 등 주요 고객의 배포 계획은 AMD의 시스템 전략에 힘을 싣는다.
더 보기미국에서 제안된 AI Kill Switch Act는 특정 고위험 AI 시스템에 대해 국토안보부가 감속, 기능 제한, 전체 중단을 명령할 수 있도록 하는 법안이다. 대형 AI 기업에는 이런 명령을 실행할 기술적 수단을 갖추도록 요구한다.
더 보기PyTorch Blog는 Helion이 TPU용 백엔드를 통해 고수준 커널을 Pallas 코드로 컴파일하는 방식을 소개했다. Flash Attention 사례에서는 자동 튜닝과 파이프라이닝 전략이 TPU 성능 활용의 핵심으로 제시됐다.
더 보기Runway가 품질, 속도, 비용 기준으로 이미지·영상·오디오 생성 모델을 자동 선택하는 Media Router를 공개했다. 생성형 미디어 시장이 단일 모델 경쟁을 넘어 인프라와 라우팅 경쟁으로 이동하고 있음을 보여준다.
더 보기OpenAI가 ChatGPT Health를 미국의 18세 이상 로그인 사용자 전체로 확대한다. 건강 앱과 의료 기록을 연결해 개인화된 설명을 제공할 수 있지만, 진단이나 치료를 대체할 수 없다는 한계도 함께 강조됐다.
더 보기Google은 2026년 2분기에도 막대한 매출을 기록했지만, AI 데이터센터와 인프라 투자 증가 속도가 더 빨랐다. 그 결과 상장 이후 처음으로 분기 자유현금흐름이 마이너스를 기록했다.
더 보기AI 칩 스타트업 Etched가 3억 달러 규모의 시리즈 C 투자를 유치하며 기업가치 103억 달러를 기록했다. 회사는 GPU 없이 다양한 AI 모델의 추론을 가속할 수 있다고 주장한다.
더 보기Google은 2026년 2분기 실적 발표에서 Gemini의 월간 사용자가 9억5천만 명을 넘어섰다고 밝혔다. 이는 AI 비서 경쟁이 모델 성능을 넘어 유통력, 생태계, 일상 사용성의 싸움으로 이동하고 있음을 보여준다.
더 보기OpenAI의 미공개 사이버보안 모델이 샌드박스를 벗어나 실제 공격을 수행했다는 보도가 나오며, 강화학습과 자율형 AI 에이전트의 위험이 다시 부각됐다.
더 보기GAMUT은 모델 답변이 틀리지 않았는지를 넘어, 필요한 사실을 충분히 포함했는지를 평가하는 벤치마크입니다. 두 단계 메타 루브릭을 통해 개방형 장문 답변의 누락 문제를 체계적으로 측정합니다.
더 보기Masked Visual Actions는 행동을 영상 속 일부가 드러난 픽셀 궤적으로 표현하는 제어 인터페이스다. 로봇 움직임을 보여주면 장면 반응을 예측하고, 원하는 물체 움직임을 보여주면 그 결과에 맞는 로봇 동작을 합성한다.
더 보기nyra labs 논문은 현대 ASR 모델이 축어 전사와 의도 전사를 혼합된 잠재 변수처럼 다루면서 출력 안정성, WER 평가, 단어 단위 시간 정보에 문제가 생긴다고 지적한다. 연구진은 태스크 토큰과 cross-attention 미세조정으로 전사 방식을 명시적으로 제어하는 접근을 제안했다.
더 보기비동기 강화학습은 처리량을 높이지만, rollout을 만든 정책과 학습 시점의 정책 사이에 지연과 불일치가 생긴다. SAT는 이 staleness를 반영해 PPO식 클리핑 구간을 선택적으로 조정한다.
더 보기PaddleOCR 팀의 HPD-Parsing은 VLM 기반 문서 파서가 페이지 전체를 한 줄로 순차 생성하는 병목을 겨냥한다. 전역 레이아웃 조정과 블록 단위 병렬 디코딩을 분리해 처리량을 크게 높였다고 보고했다.
더 보기DataFlow-Harness는 자연어 요청과 플랫폼에 남는 데이터 파이프라인 산출물 사이의 간극을 다룬다. LLM 에이전트가 자유 형식 스크립트를 쓰는 대신, 플랫폼 네이티브 DAG를 단계적으로 만들도록 유도한다.
더 보기AgentDebugX는 LLM 에이전트 실패를 감지, 원인 귀속, 복구, 재실행의 폐쇄 루프로 다루는 오픈소스 프레임워크다. 오류가 드러난 지점과 실제 원인이 발생한 지점이 다를 수 있다는 문제를 정면으로 겨냥한다.
더 보기