Ray AI 라이브러리는 Google Cloud의 TPU에서 실행됩니다
TPU에서의 Ray는 멀티 호스트 서빙, JAX 학습, 데이터 पाइ프라인을 간소화합니다 Serve, Data, 그리고 JaxTrainer가 Ray로 TPU 워크플로를 어떻게 단순화하는지 확인해 보세요
Google Cloud가 TPU에서 Ray를 실행하는 가이드의 2부를 게시했으며, 기본적인 슬라이스 기반 배치 모델 위에 워크로드를 구축하는 데 사용되는 Ray AI 라이브러리에 중점을 두고 있습니다.
이 글에서는 Ray Serve가 단일 토폴로지 설정으로 TPU에서 멀티호스트 모델을 배포하는 방법, Ray Data의 iterjaxbatches가 디바이스 샤딩된 JAX 배열로 TPU 작업에 데이터를 공급하는 데 어떻게 도움이 되는지, 그리고 JaxTrainer가 체크포인팅과 장애 허용 기능을 갖춘 분산 JAX 학습을 어떻게 지원하는지 설명합니다.
또한 새로운 공식 Ray TPU Docker 이미지, TPU 메트릭에 대한 대시보드 지원, 그리고 Ray 도구 전반에서 TPU 통합을 확대하기 위한 진행 중인 작업도 언급합니다.