아티클 목록으로
AI 에이전트

AsyncLLM, 대규모 언어 모델을 범용 비동기 에이전트로 확장

약 4분 소요

들어가며

많은 LLM 에이전트는 입력을 받고, 추론하고, 응답이나 도구 호출을 수행한 뒤 다음 입력을 기다리는 방식으로 동작한다. 이 구조는 대화형 질의나 짧은 자동화 작업에는 적합하지만, 외부 환경이 계속 변하는 상황에서는 한계가 분명하다. 음성 비서는 이전 발화를 처리하는 동안 새로운 음성을 받아야 하고, 로봇은 주변을 관찰하면서 다음 동작을 계획해야 한다. 모니터링 시스템 역시 이전 분석이 끝날 때까지 새로운 이벤트 수집을 멈출 수 없다.

Yandex Research가 공개한 오픈소스 프레임워크 AsyncLLM은 이런 비순차적 작업을 더 일반적인 방식으로 구현하려는 시도다. 논문 “LLMs are General Asynchronous Agents”는 비동기 기능을 특정 작업용 아키텍처나 모델 API 바깥의 오케스트레이션에만 맡기지 않고, LLM 추론 자체의 구성 요소로 다루자는 관점을 제시한다.

핵심 내용

  • 추론 내부에서 동시성이 작동한다. AsyncLLM은 여러 API 요청을 동시에 시작하는 단순한 래퍼가 아니다. 여러 추론 흐름을 동시에 실행하고, 아직 계속 바뀌는 상태를 서로 읽을 수 있도록 한다.
  • 코루틴으로 에이전트를 구성한다. 에이전트는 Python async/await 코루틴의 집합으로 표현할 수 있다. 관찰, 분석, 메모리 갱신, 행동을 별도 코루틴으로 나누고 이벤트, 락, 큐로 조정한다.
  • 캐시 블록이 공유 상태를 담당한다. 각 코루틴은 캐시 블록에 기록하고, 캐시 뷰를 통해 어떤 블록을 참조할지 선택한다. 모든 단계에서 전체 컨텍스트를 다시 읽지 않고도 필요한 정보를 공유할 수 있는 구조다.
  • 여러 모델 구성과 호환된다. Mini-SGLang을 기반으로 한 추론 엔진은 코루틴 사이의 요청을 배치 처리한다. 공개된 설명에 따르면 전체 어텐션, Gated DeltaNet, 멀티모달 M-RoPE 모델을 지원한다.
  • 시연에는 작업 특화 학습이 필요하지 않았다. 연구팀은 Qwen 3.x 모델을 스트리밍 영상 이해, 비디오게임, 모니터링에 비동기 방식으로 적용했다. 핵심은 각 작업에 맞춰 모델을 다시 학습하는 것이 아니라 추론 흐름을 재구성하는 데 있다.

의미와 남은 과제

기존 에이전트 시스템에서는 애플리케이션 계층이 동시성을 관리하는 경우가 많다. 애플리케이션이 여러 요청을 실행하더라도 각각의 모델 호출은 사실상 순차적으로 진행되기 때문에 컨텍스트 반복 전달, 상태 동기화, 불필요한 지연이 발생할 수 있다. AsyncLLM은 동시성을 추론의 기본 추상화로 끌어올려, 여러 추론 흐름이 계속 업데이트되는 메모리 상태를 함께 사용하도록 한다.

이 설계는 지속적인 영상 분석, 실시간 모니터링, 상호작용형 환경에 자연스럽게 적용될 수 있다. 한 코루틴은 영상 스트림을 계속 읽고, 다른 코루틴은 더 느리지만 깊이 있는 판단을 수행하며, 또 다른 코루틴은 이상 징후에 대응할 수 있다. 모든 단계가 매번 하나의 대기열에서 순서대로 끝날 필요가 없다는 의미다.

물론 비동기화가 항상 속도나 정확도의 향상을 보장하는 것은 아니다. 공유 상태가 충돌할 수 있고, 오래된 계획을 언제 중단할지 결정해야 하며, 여러 코루틴 사이에서 계산 자원을 어떻게 배분할지도 정해야 한다. 동시 추론이 늘어나면 조정 로직과 안전 제어의 중요성도 커진다.

따라서 AsyncLLM은 실시간 에이전트의 모든 문제를 해결한 완성형 시스템이라기보다, 새로운 설계 방향을 보여주는 프레임워크로 보는 편이 적절하다. LLM을 ‘모든 것을 읽고 한 번 생각한 뒤 출력하는’ 단일 루프가 아니라, 새로운 정보가 들어오는 동안 관찰·추론·행동을 협력적으로 수행하는 시스템으로 바라보게 한다는 점이 핵심이다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Omni-Decision, 증거 원장으로 옴니모달 에이전트의 계획을 재설계하다
AI 에이전트
cctest.ai
AI 에이전트

Omni-Decision, 증거 원장으로 옴니모달 에이전트의 계획을 재설계하다

Omni-Decision은 계속 늘어나는 대화 기록 대신 확인된 정보, 부족한 정보, 충돌하는 기록을 관리하는 구조화된 ‘증거 원장’을 사용한다. 이 연구는 옴니모달 에이전트의 핵심 병목이 인식보다 계획에 있을 수 있음을 보여준다.

더 보기
CCTest · Blog
Omni-IO Skills: 범용 에이전트에 멀티모달 실행 능력 더하기
AI 에이전트
cctest.ai
AI 에이전트

Omni-IO Skills: 범용 에이전트에 멀티모달 실행 능력 더하기

Omni-IO Skills는 파운데이션 모델을 다시 학습시키는 대신 기존 에이전트 주변에 Skills와 실행 관리 계층을 추가한다. 이를 통해 이미지, 오디오, 비디오, 문서, 3D, 코드가 연결된 작업을 하나의 워크플로로 조정한다.

더 보기