Kubeflow, 클라우드 네이티브 AI 확장하며 CNCF 졸업에 접근
들어가며
Kubeflow는 Kubernetes에서 머신러닝을 실행하기 위한 도구 모음에서 AI 개발 생명주기 전반을 다루는 플랫폼으로 확장되고 있다. 최근 변화는 노트북 개발, 데이터 처리, 파이프라인 오케스트레이션, 분산 학습, 모델 관리, 추론, 보안, 커뮤니티 운영을 동시에 아우른다. CNCF 졸업 단계에 가까워지는 가운데, 프로젝트가 본 production 환경에서 요구되는 표준화와 운영성을 중요하게 보고 있다는 의미다.
핵심 업데이트
- 실험에서 파이프라인으로의 전환을 단순화했다. Kale 2.0은 네이티브 Spark를 지원하며, 주석이 달린 Jupyter Notebook을 production-ready 파이프라인으로 변환한다. Kubeflow Pipelines v2 아키텍처를 지원하므로 데이터 과학자는 KFP SDK 코드를 직접 작성하는 부담을 줄일 수 있다.
- 노트북 환경을 선언적으로 관리한다. Notebooks v2는 CRD 중심으로 처음부터 다시 설계됐다. 플랫폼 팀은 JupyterLab과 VS Code 같은 대화형 환경을 템플릿으로 관리할 수 있다. 현재 Alpha 버전을 통해 정식 출시 전 기능을 시험할 수 있다.
- AI 학습과 HPC를 통합한다. Kubeflow SDK는 Spark 데이터 처리, 파이프라인 구성, 분산 학습, 하이퍼파라미터 튜닝을 위한 통합 Python 인터페이스를 제공한다. 대규모 언어 모델 미세 조정을 위한 블루프린트도 포함한다. 새 Trainer는 MPI를 지원하고 Flux Framework와 공식 통합돼, 하나의 Kubernetes 환경에서 AI 작업과 대규모 HPC 시뮬레이션을 조정할 수 있다.
- 모델 관리와 추론의 범위를 넓혔다. Model Registry는 Hub로 이름을 바꾸고 Model Catalog와 MCP Catalog를 포함하게 됐다. OCI를 모델과 MCP 서버의 저장·배포 표준으로 활용한다. KServe의 LLMInferenceService CRD는 대규모 모델 추론을 플랫폼의 기본 추상화로 만들며, 멀티노드 추론과 OpenAI 호환 API를 지원한다.
- 보안과 관측성을 강화한다. Kubeflow Community Distribution 26.03은 Kubernetes 1.34 이상을 공식 검증하고 멀티테넌시 기본 설정을 강화했다. Pod Security Standards의 Restricted 정책과도 호환된다. 향후 SDK에는 OpenTelemetry 계측과 MLflow 추적이 추가될 예정이다.
의미와 영향
Production AI 플랫폼은 가속기 접근성만으로 충분하지 않다. 노트북과 데이터 작업에서 학습, 모델 자산, 추론 서비스까지 이어지는 흐름과 다중 테넌트 환경의 격리가 필요하다. Kubeflow는 CRD, OCI, OpenAI 호환 API 같은 공통 인터페이스를 통해 구성 요소 사이의 개별 통합 비용을 줄이려 한다.
다만 CNCF 졸업이 모든 기능의 완전한 성숙을 뜻하는 것은 아니다. Kale과 Notebooks v2는 다양한 조직의 실제 업무 흐름에서 추가 검증이 필요하다. 분산 학습과 멀티노드 추론, Spark와 HPC의 결합은 스케줄링과 운영 복잡성을 높일 수도 있다. 향후에는 버전 안정성, 생태계 협력, production 사용자의 피드백이 중요하다. Outreach Program과 ML Experience Working Group은 사용자 경험 개선과 기여자 지원을 통해 도입 및 참여 장벽을 낮추려는 커뮤니티 측면의 대응이다.
출처: InfoQ 中文
댓글
로그인 상태 확인 중…
댓글 불러오는 중…