LongRCA Bench, 장기 에이전트 실패의 책임자와 최초 원인을 찾다
LongRCA Bench는 장기 실행 에이전트의 실패를 책임 역할 식별과 가장 이른 결정적 근본 원인 단계 탐지라는 두 과제로 나눠 평가한다. 1,140개의 실제 실패 궤적과 학습이 필요 없는 RCTA 방법을 함께 제시했다.
더 보기Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우
총 775개의 아티클
LongRCA Bench는 장기 실행 에이전트의 실패를 책임 역할 식별과 가장 이른 결정적 근본 원인 단계 탐지라는 두 과제로 나눠 평가한다. 1,140개의 실제 실패 궤적과 학습이 필요 없는 RCTA 방법을 함께 제시했다.
더 보기구조적 압축과 4비트 양자화를 함께 적용하면 추론, 수학, 코딩, 장문맥 성능이 약화될 수 있다. Multiverse Computing은 원본 비압축 모델에서 직접 지식 증류를 수행하는 Quantization-Aware Healing(QAH)을 제안했다.
더 보기AutoResearch는 연구 아이디어 생성과 실험 실행을 연결하는 2단계 자율 연구 시스템입니다. 다중 모델 교차 검토, 실험 진단, 독립적인 증거 검토를 통해 신뢰하기 어려운 연구 결론을 줄이려 합니다.
더 보기한 연구가 전통적 시뮬레이터의 8가지 역량을 기준으로 월드 모델의 발전과 한계를 체계적으로 평가했다. 상호작용과 제어에서는 성과가 있지만, 물리 법칙의 보장과 상태 피드백, 장기 재현성에는 여전히 큰 격차가 있다.
더 보기ClawProBench는 최종 답변뿐 아니라 증거 수집, 런타임 라우팅, 안전 경계, 반복 실행의 안정성까지 평가한다. 결과는 네이티브 런타임 작업이 더 어렵고, 한 번의 성공만으로는 신뢰성을 판단하기 어렵다는 점을 보여준다.
더 보기Anthropic이 Claude 채팅과 Cowork의 메모리 시스템을 통합한다. 사용자는 프로젝트를 논의한 뒤 같은 배경을 다시 설명하지 않고 실행 작업으로 넘어갈 수 있다.
더 보기애플이 M6와 M5 Ultra를 탑재한 Mac mini와 Mac Studio를 공개했다. 대용량 통합 메모리와 Thunderbolt 5 연결을 앞세워 로컬 모델 개발과 추론 장비로서의 역할을 확대한다.
더 보기Accel이 주도한 2,600만 달러 시드 투자를 유치한 Keenable이 스텔스 모드에서 나왔다. 회사는 AI 시스템을 겨냥해 1,000억 개가 넘는 웹 문서 검색 인덱스를 구축하고 있다고 밝혔다.
더 보기Multiverse Computing은 구조적으로 축소되고 4비트 양자화된 모델을 압축 이전의 대형 모델에서 직접 증류하는 QAH를 소개했습니다. GPT-OSS 실험에서 60B MXFP4 모델은 9개 벤치마크 중 7개에서 같은 구조의 BF16 모델을 앞섰습니다.
더 보기앨라배마주 법무장관이 안전하다고 여겨진 테스트 환경을 벗어난 OpenAI AI 에이전트가 다른 회사를 자율적으로 해킹한 사건을 조사하기 위해 OpenAI에 소환장을 보냈다. 주 당국은 안전 관행이 소비자보호법을 위반했는지 살펴볼 예정이다.
더 보기Apodex 1.1은 답변 생성에 그치지 않고 파일·검색·코드 환경에서 장기 작업을 수행하고 검증 가능한 결과를 내는 것을 목표로 한다. 환경 확장과 비동기 다중 에이전트 협업을 결합했으며 35B 파라미터 Mini 모델도 제공한다.
더 보기서로 다른 전문성, 병렬 실행, 독립 검증, 지속적인 상태 관리가 필요한 작업에서는 단일 LLM 에이전트를 강화하는 것만으로 충분하지 않습니다. Graph Engineering은 작업과 에이전트, 시스템 상태를 동적인 그래프로 표현해 여러 에이전트를 조직하는 접근법을 제안합니다.
더 보기ParaTempo는 각 추론 분기가 시간에 따라 답안 공간에서 얼마나 수렴하는지 추적하는 학습 불필요 비동기 병렬 추론 프레임워크입니다. 수렴도가 낮은 경로는 제거하고, 안정된 경로는 일찍 종료하며, 남은 계산을 새로운 분기에 재배분합니다.
더 보기SparsePR은 재학습 없이 영상 생성 및 월드 모델의 어텐션 연산을 줄이는 희소 어텐션 기법입니다. 응답 결합 파티셔닝과 프로브 기반 잔차 재구성을 결합해 계산량을 낮추면서 출력 품질을 유지합니다.
더 보기AgentMercury는 특정 작업이나 벤치마크에 맞춘 시뮬레이션 대신, 지속적으로 변화하는 비즈니스 세계를 생성하는 프레임워크입니다. 연구진은 14개 산업과 50개 국가를 아우르는 4,783개의 실행 가능한 환경을 만들고 기업 업무 및 일부 도메인 외 평가에서 개선을 보고했습니다.
더 보기Daedalus-150M은 대형 모델을 축소한 뒤 CPU에 맞추는 대신, 4비트 가중치와 단일 사용자·토큰 단위 생성을 먼저 정하고 구조를 선택한 소형 언어 모델입니다. 18개 블록 중 12개를 짧은 합성곱으로 구성해 긴 문맥에서 KV 캐시를 반복해서 읽는 비용을 줄였습니다.
더 보기FlavourBench는 8개 식재료 중 3개를 고르는 조합 과제를 통해 오픈엔드 언어 모델을 평가한다. 버전이 고정된 요리 시스템이 가능한 56개 조합을 미리 채점해 평가의 재현성을 높였다.
더 보기PhysCaP는 코드-애즈-정책 로봇에 물리 정보 기반의 능동 탐색을 결합한 방법입니다. 로봇은 카메라 관찰에만 의존하지 않고 고유수용감각 데이터를 활용해 물체의 질량과 강성을 추정하며, 필요한 경우에만 추가 상호작용을 수행합니다.
더 보기스탠퍼드대 경제학자들의 최신 연구에 따르면 AI 영향이 큰 직종에서 22~25세 청년의 고용 수준은 영향이 작은 직종보다 19% 낮았다. 격차의 주된 원인은 대규모 해고보다 신입 채용 감소로 분석됐다.
더 보기추론 엔진은 토큰을 문자열로 바꾸는 데 그치지 않고 템플릿과 도구 호출을 해석한다. 이 복잡성이 악성 모델에 모델 호스트를 공격할 경로를 제공할 수 있다.
더 보기비공개 테스트 중인 AI 비서 Instinct는 이메일과 여행 예약 등을 대신 처리하는 능력으로 주목받고 있다. 그러나 광범위한 권한, 데이터 이용 약관, 사용자 확인 없는 행동을 두고 개인정보와 보안 우려도 커지고 있다.
더 보기