MaxKernel, 멀티 에이전트로 TPU 커널 생성과 최적화
MaxKernel은 대규모 언어 모델을 컴파일러 피드백 및 하드웨어 프로파일링과 결합해 TPU 커널 개발을 자동화한다. 인간 협업, 자율 최적화, 그래프 기반 탐색을 모두 지원한다.
더 보기MaxKernel은 대규모 언어 모델을 컴파일러 피드백 및 하드웨어 프로파일링과 결합해 TPU 커널 개발을 자동화한다. 인간 협업, 자율 최적화, 그래프 기반 탐색을 모두 지원한다.
더 보기Iris-mini와 Iris-pro는 웹 링크 구조에서 다단계 검색 과제를 만들고, 지도 미세조정과 온라인 강화학습을 번갈아 수행하는 검색 에이전트입니다. 긴 탐색 과정에서 증거를 관리하는 컨텍스트 관리도 핵심 설계 요소로 다뤄집니다.
더 보기Terminal-Universe는 터미널 기반 코드 에이전트의 기존 실행 궤적에서 작업공간을 복원하고, 이를 바탕으로 검증 가능한 추가 작업을 생성하는 프레임워크입니다. 하나의 고정된 시연을 원래 작업 재현, 저장소 간 질의, 다중 턴 상호작용에 활용할 수 있는 환경으로 확장합니다.
더 보기터미널 에이전트의 성능이 높아지면 처음부터 생성한 과제는 지나치게 쉬워져 유용한 학습 신호를 제공하기 어렵다. 새로운 방법은 환경 난도를 세대별로 높여 장기 강화학습을 지원한다.
더 보기Editable Visual Design은 비전 언어 모델, 이미지 생성 모델, Coding Agent를 결합해 생성 이후에도 수정할 수 있는 시각 결과물을 만드는 방법을 제안한다. 최종 이미지를 평면 비트맵으로 내보내는 대신 생성 자산과 HTML/CSS를 구조적으로 결합하는 것이 핵심이다.
더 보기새 연구는 자율형 LLM 사후학습에서 과거의 성공적인 업데이트를 그대로 재사용하는 문제를 다루며, 적용 조건을 확인하는 BCIT를 제안했다.
더 보기Google이 개인용 에이전트 Gemini Spark를 Google 포토와 연결해 자연어로 사진 편집과 앨범 정리를 수행할 수 있게 한다. 초기 지원 대상은 미국에서 영어를 사용하는 Gemini AI Pro 및 Ultra 가입자다.
더 보기OOMOL Lab이 AI Agent를 위한 워크플로 자동화 플랫폼 Open Flow를 오픈소스로 공개했다. 시각화 Workbench, 명령줄 인터페이스, 자체 호스팅 런타임을 통해 Agent가 노드를 만들고 워크플로를 구성·실행할 수 있도록 지원한다.
더 보기DisCo는 머신러닝 저장소에 흩어진 실무 지식을 재사용 가능하고 검증된 스킬로 증류합니다. 1,000개 저장소에서 5,000개 이상의 스킬을 만든 라이브러리도 제시합니다.
더 보기HarnessDev는 에이전트의 최종 답변뿐 아니라 성능을 결정하는 실행 인프라 자체를 평가하는 벤치마크입니다. 생성된 프레임워크는 코드·검색·연구에서는 성숙한 인간 설계 시스템에 뒤졌지만, 글쓰기와 머신러닝 실험에서는 경쟁력 있는 결과를 보였습니다.
더 보기Meta가 코딩과 기타 에이전트 작업을 겨냥한 Muse Spark에 ‘기여자’ 요금제를 도입했다. 프롬프트와 모델 출력을 공유하는 고객은 평균 약 95%의 할인을 받을 수 있다.
더 보기UI-Venus-2는 실제 GUI 자동화를 가로막는 좁은 환경 범위, 취약한 작업 구성, 불안정한 결과 검증 문제를 겨냥한 기반 시스템입니다. 모바일·웹·데스크톱을 통합 추론-행동 루프로 다루고, 중요한 작업에는 안전 제어를 적용합니다.
더 보기Uber가 소프트웨어 개발 전반에 AI 에이전트를 확대하면서도 비용 증가를 제한한 방법을 공개했다. 핵심은 단순한 저가 모델 전환이 아니라 실행 과정 전체의 최적화다.
더 보기CAST는 작업의 성공·실패처럼 희소한 결과를 개별 행동을 검증하는 감독 신호로 바꾼다. 이를 통해 장기적이고 상태가 변하는 도구 호출 환경에서 실행 전 오류를 찾는 능력을 학습시키려 한다.
더 보기데이터 과학 자동화의 결과는 언어 모델뿐 아니라 작업 표현, 실행 상태 관리, 산출물 제약, 평가 방식에도 좌우됩니다. DS-Lighting은 그동안 암묵적으로 처리되던 에이전트 하니스를 네 개의 계층으로 분리해 다룹니다.
더 보기LLM 에이전트는 프롬프트와 도구, 실행 하니스를 직접 바꿀 수 있지만, 성공한 변경이 이후 상태에서도 되돌릴 수 있다는 보장은 없습니다. EvoUndo는 정확한 상태 식별과 복구 언어의 표현력이 검증 가능한 복구에 미치는 영향을 분석합니다.
더 보기StarHarness는 모델을 재학습하지 않고도 특정 기업 환경에 맞는 에이전트 harness를 탐색하는 프레임워크다. 프롬프트뿐 아니라 도구 인터페이스, 스킬, 하위 에이전트, 실행 루프까지 조정 대상으로 삼는다.
더 보기코드 생성 속도만 높아져서는 기업의 개발 납기가 단축되지 않는다. 샤오홍슈의 Muse는 컨텍스트 공유, Agent 오케스트레이션, 실행 단계 제어를 통해 기획부터 운영 반영까지 연결하려 한다.
더 보기메타는 AI 에이전트가 수천 명의 일상 업무를 맡는 ‘AI 네이티브’ 조직을 구상했다. 그러나 실제로는 코드 잡음과 사고, 남은 엔지니어의 대응 부담이 함께 늘어나며 계획의 한계가 드러났다.
더 보기Cisco가 사내 AI를 문맥을 기억하고 여러 업무 시스템을 호출하며 감독 아래 작업을 진행하는 개인 에이전트로 확장하고 있다. MyAgent의 핵심 의미는 사용자 수보다 에이전트를 기업 업무의 새로운 진입점으로 만들려는 데 있다.
더 보기DART-SD는 도구 호출 과정을 하나의 선형 궤적이 아니라 여러 경로가 갈라졌다가 수렴하는 ‘다이아몬드 토폴로지’로 모델링한다. 실패가 시작된 지점 이후의 복구 단계만 학습해 이미 올바른 추론 접두부를 보호한다.
더 보기