Anthropic, AI 안전성을 스스로 개선하는 연구 시스템의 초기 사례 공개
Anthropic의 새 논문은 문헌 검색부터 방법 제안, 학습, 평가까지 자동화하는 정렬 연구 시스템을 소개했다. 10개 오정렬 행동 벤치마크 모두에서 성능을 높였으며 전체 성능 저하는 보고되지 않았다.
더 보기Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우
총 775개의 아티클
Anthropic의 새 논문은 문헌 검색부터 방법 제안, 학습, 평가까지 자동화하는 정렬 연구 시스템을 소개했다. 10개 오정렬 행동 벤치마크 모두에서 성능을 높였으며 전체 성능 저하는 보고되지 않았다.
더 보기Hugging Face, Poolside, OpenRouter를 둘러싼 대형 거래 보도는 오픈 웨이트 AI가 단순한 모델 공유를 넘어 핵심 인프라 사업으로 변하고 있음을 보여준다. 반도체 기업과 소프트웨어 플랫폼은 개발자와 추론의 관문을 확보하기 위해 경쟁하고 있다.
더 보기앤트로픽이 치명적 자율무기와 미국인 대량 감시에 대한 사용 제한을 완화하지 않자 트럼프 행정부가 취한 전면 거래 중단 조치를 연방법원이 위법한 보복으로 판단했다. 법원은 앤트로픽의 국가안보 공급망 위험 지정과 관련 정부 지침을 취소했다.
더 보기미 환경보호청(EPA)이 일부 ‘소규모’ 오염원에 대한 연방 차원의 공고와 의견 수렴 의무를 없애는 규칙 변경을 제안했다. 환경단체들은 데이터센터와 관련 전력 시설이 지역 주민의 충분한 검토 없이 추진될 수 있다고 우려한다.
더 보기메타가 녹화 중 안전 표시등을 가리면 카메라가 작동을 멈추도록 AI 안경을 업데이트한다. 눈에 띄는 우회 방법은 차단되지만 비동의 촬영과 데이터 처리에 대한 우려까지 해소된 것은 아니다.
더 보기LinkedIn은 기존 AI 리뷰 도구를 저장소 앞에 그대로 붙이는 대신, 여러 리뷰 에이전트와 조직 고유의 규칙을 결합한 플랫폼을 구축했다. 핵심은 댓글 수가 아니라 환각과 저가치 피드백을 줄이고 개발자가 실제로 채택할 만한 신호를 제공하는 데 있다.
더 보기Cloudflare가 HTML 추출, 스크린샷, PDF 생성 같은 자동화 작업을 겨냥한 실험적 브라우저 엔진 Kitesurf를 공개했다. 아직 Chromium을 대체할 수는 없지만, 사람보다 소프트웨어 에이전트에 맞춘 브라우저 인프라의 가능성을 보여준다.
더 보기새 논문은 월드 모델의 확장이 더 많은 웹 비디오와 연산량만으로 해결되지 않으며, 근거 있는 보상 신호를 반복적으로 만들어내는 데이터 엔진이 필요하다고 주장합니다. 게임 엔진은 공간 모델의 강화학습 후학습에 실행 가능한 환경과 장기 궤적을 제공할 수 있습니다.
더 보기GameWAM은 게임 화면의 미래와 실행 가능한 키보드·마우스 궤적을 함께 생성하는 폐루프 모델입니다. 장기 과제의 재계획을 지원하는 동시에 생성 행동에서 발생하는 방향 편향도 분석합니다.
더 보기미국 캘리포니아 연방법원은 트럼프 행정부가 앤트로픽을 ‘공급망 위험’으로 지정한 조치가 위법하다고 판결했다. 워싱턴 D.C.에서 진행 중인 별도 국방부 소송은 아직 계속되고 있다.
더 보기메타의 인도·동남아시아 담당 부사장 산드야 데바나탄이 10년 넘게 몸담은 메타를 떠나 오픈AI에 합류한다. 그는 동남아시아와 호주에서 소비자 성장, 기업 도입, 파트너십, 규제 대응을 총괄한다.
더 보기텐센트 혼위안이 총 770B 파라미터, 활성 파라미터 4.9B, 1M 컨텍스트를 지원하는 Hy4 preview를 공개했다. 여러 플랫폼에 모델을 배포하고 게임 엔진과 MCP를 연결하는 에이전트 활용 방향도 제시했다.
더 보기윈즈성이 공개한 2026년 상반기 실적에서 기업 지능화 서비스가 매출 기반을 유지했고, Token 과금 사업은 빠르게 성장했다. 핵심 과제는 무거운 프로젝트 납품을 얼마나 반복 가능한 사업으로 바꾸느냐에 있다.
더 보기Anthropic이 AI 에이전트가 로봇 팔, 현미경, 카메라, 실험 장비를 발견하고 제어할 수 있도록 설계한 ‘모델 하드웨어 표준(MHS)’ 연구 프리뷰를 공개했다. Claude에 하나의 고정된 몸을 부여하기보다, 연결된 장비를 필요에 따라 빌려 쓰는 접근이다.
더 보기고덕이 최근 12개 프레임만을 국소 문맥으로 활용해 긴 영상의 3D 장면을 순차적으로 재구성하는 모델 ABot-Recon을 공개했다. 장기 메모리 의존을 없애 장거리 시퀀스에서 발생하는 오차 누적, 속도 저하, 메모리 증가 문제를 줄이는 것이 핵심이다.
더 보기미 연방법원이 국방부의 앤트로픽 ‘공급망 위험’ 지정이 위헌이라고 판결했다. 군사용 AI의 안전 제한을 유지한 기업을 정부가 보복성 조치로 압박했다는 판단이다.
더 보기VGI-Bench는 동영상 생성 모델을 화질이 아니라 변화하는 시각적 과정의 논리까지 평가한다. 현재 모델은 일부 추론 능력을 보이지만 안정성과 자기 수정에서는 여전히 한계를 드러냈다.
더 보기WarpSAC은 오프폴리시 강화학습에서 모든 학습 환경에 동일한 안정화 기법을 적용할 필요가 없다고 주장한다. 제한된 CPU 학습과 대규모 GPU 병렬 학습을 위해 서로 다른 SAC 구성을 제시했다.
더 보기JIT-Agent는 에이전트의 메모리 관리, 계획, 행동 프로토콜, 도구 오케스트레이션을 생성 가능한 실행 프레임워크로 다룬다. 작업별 맞춤화와 함께 실행 오류 수정, 과거 설정을 활용한 지속적 진화도 목표로 한다.
더 보기Video-IFBench는 동영상을 정확히 이해하는지를 넘어 시각·음성·의미·형식·조건 분기를 포함한 복잡한 지시를 따르는지 평가한다. 20개가 넘는 최신 MLLM을 대상으로 한 평가에서 동영상 지시 준수의 어려움이 드러났다.
더 보기AnTrap은 해결 가능한 Android 작업의 실행 과정에 현실적인 런타임 이상을 주입해 GUI 에이전트의 견고성을 평가한다. 실험 결과 대부분의 모델이 성능 저하를 보였으며, 학습으로 고칠 수 있는 오류와 더 깊은 추론 한계가 구분됐다.
더 보기