데이터브릭스, '유니티 카탈로그' 오픈소스화

데이터브릭스는 클라우드, 데이터 형식 및 데이터 플랫폼 전반의 데이터 및 AI 거버넌스를 위한 업계 유일의 통합 솔루션인 유니티 카탈로그(Unity Catalog)를 오픈소스로 제공한다고 19일 발표했다.

데이터브릭스는 아마존웹서비스(AWS), 구글 클라우드, 마이크로소프트, 엔비디아, 세일즈포스 등 글로벌 지원을 받아 데이터 및 AI를 위한 개방형 카탈로그 표준에 투자하고 있다.

데이터브릭스 유니티 카탈로그 OSS는 모든 데이터 형식과 컴퓨팅 엔진을 지원하는 범용 인터페이스를 제공한다. 여기에는 델타 레이크, 아파치 아이스버그 및 아파치 후디 클라이언트를 통해 델타 레이크 유니폼(UniForm)으로 테이블을 읽을 수 있는 기능이 포함된다. 아이스버그 REST 카탈로그 및 하이브 메타스토어(HMS) 인터페이스 표준도 지원된다. 유니티 카탈로그 OSS는 테이블 데이터, 비 테이블 데이터, 그리고 머신러닝(ML) 모델 및 생성형 AI 도구와 같은 AI 자산에 대한 통합 거버넌스를 제공해 조직이 대규모로 관리를 간소화할 수 있도록 한다.

유니티 카탈로그 OSS는 테이블 형식 데이터, 비 테이블 형식 데이터, 그리고 ML 모델 및 생성형 AI 도구와 같은 AI 자산에 걸친 통합 거버넌스를 제공해 조직이 대규모로 관리, 검색, 및 개발을 간소화할 수 있도록 돕는다.

유니티 카탈로그 OSS는 오픈 API와 아파치 2.0 라이선스의 오픈소스 서버를 통해 다양한 엔진, 도구 및 플랫폼 전반에 걸친 광범위한 상호운용성을 지원한다. 이로써 유연성과 선택의 폭을 극대화한다.

조직은 데이터 및 AI 워크로드 처리를 위해 상호 운용 가능한 카탈로그를 필요로 한다. 데이터브릭스는 이러한 고객 수요를 충족하기 위해 2021년 유니티 카탈로그를 출시했다.

기존 조직은 단일 목적을 가진 여러 개의 솔루션에 의존했다. 이에 따라 플랫폼 간, 그리고 데이터 및 AI 자산 간 사일로가 발생했으며, 다중 테이블 형식의 테이블 데이터, 비정형 데이터, ML 모델, 벡터 인덱스 및 AI 도구를 결합하는 현대적인 데이터 및 AI 애플리케이션을 구축하는 데 한계가 있었다. 고객은 메타데이터 사일로를 관리하기 위해 복잡한 웹을 만들고, 다양한 엔진에 접근하기 위해 데이터를 여러 장소나 형식으로 복사하거나, 카탈로그 간의 메타데이터를 동기화하기 위해 자체 솔루션을 유지해야 했다. 결과적으로 비용과 복잡성이 증가하고, 거버넌스가 약화됐으며, 접근 제어가 파편화됐다. 유니티 카탈로그는 오늘날 1만개 이상의 조직에서 사용되고 있다.

이번 발표로 데이터브릭스는 상호 운용 가능한 도구, 데이터 및 AI 자산에 대한 범용 지원, 그리고 내장된 보안으로 구성된 생태계를 촉진하고 데이터 및 AI 거버넌스를 계속해서 선도해 나갈 계획이다.