Databricks: Blog
85

Tin ngành

Databricks trình làng loạt cải tiến về Lakebase, xử lý luồng và kiến trúc Lakehouse tại VLDB 2026

(giờ Việt Nam)

Tóm tắt AI

Databricks giới thiệu các đột phá công nghệ mới tại hội nghị VLDB 2026, tập trung tối ưu hóa nền tảng dữ liệu thông minh thông qua kiến trúc Lakebase và xử lý luồng dữ liệu thời gian thực.

Bản dịch AI

Building for the AI Era: Lakebase, Streaming, and Lakehouse Innovations  at VLDB 2026

Chúng tôi sẽ đến với VLDB 2026 để chia sẻ nhiều đổi mới đang vận hành nền tảng Databricks. Đồng sáng lập kiêm Kiến trúc sư trưởng của Databricks, Reynold Xin, sẽ mở màn hội nghị bằng bài phát biểu khai mạc. Databricks có bốn bài báo được chấp nhận liên quan đến Lakebase, Spark Structured Streaming và các tối ưu hóa Lakehouse tự động. Bài báo demo về engine Enzyme sẽ trình bày cách chúng tôi duy trì các materialized view một cách tăng dần (incrementally). Dưới đây là bản xem trước của các bài thuyết trình này.

Bài phát biểu chính: Ba kỷ nguyên vàng của kỹ thuật cơ sở dữ liệu

Đồng sáng lập Databricks, Reynold Xin, sẽ thảo luận về cách các AI agent đang mở ra "kỷ nguyên vàng thứ ba" của kỹ thuật cơ sở dữ liệu. Một số bạn có thể nhớ đến công trình đầu năm 2012 của ông tại Berkeley về hệ thống phân tích có khả năng mở rộng mang tên Shark. Reynold sẽ nhìn lại cách quan điểm của chính ông về công nghệ cơ sở dữ liệu đã phát triển qua nhiều năm, từ những ngày ở Berkeley, qua sự trỗi dậy của kiến trúc Lakehouse, và giờ đây là những yêu cầu thay đổi đối với các engine giao dịch và phân tích. Ông sẽ giới thiệu hai mô hình mới giúp đáp ứng nhu cầu của các AI agent: (1) Lakebase, áp dụng việc tách biệt lưu trữ và tính toán cho cơ sở dữ liệu OLTP, và (2) LTAP (Lake Transactional Analytical Processing), giúp hợp nhất quá trình xử lý giao dịch và phân tích.

Lakebase: Serverless Postgres trên Open Lake Storage

Khối lượng công việc của AI agent đang tạo ra các mô hình sử dụng độc đáo như hàng triệu cơ sở dữ liệu tồn tại trong thời gian ngắn và phân nhánh sâu. Các engine OLTP truyền thống là nguyên khối và không thể đáp ứng những yêu cầu đầy thách thức này. Stas Kelvich sẽ trình bày kiến trúc Lakebase, một kiến trúc cơ sở dữ liệu đám mây thế hệ thứ ba. Lakebase đáp ứng các yêu cầu của quy trình làm việc theo hướng agent bằng cách tách biệt tính toán PostgreSQL serverless khỏi lưu trữ, lưu trữ dữ liệu và write-ahead log trực tiếp trong cloud object storage bằng các định dạng mở. Lakebase không chỉ cung cấp khả năng cold start dưới một giây mà còn hỗ trợ các quy trình làm việc cơ sở dữ liệu giống như Git hiệu quả thông qua copy-on-write branching. Hơn nữa, với việc tách biệt tính toán-lưu trữ, nó cho phép phân tích độ trễ thấp trên dữ liệu giao dịch trực tiếp. Hình 1 cho thấy cách Lakebase đang mở ra thế hệ thứ ba của cơ sở dữ liệu đám mây.

Hình 1: Lakebase Postgres rất phù hợp cho kỷ nguyên agent và được xây dựng trên nền tảng open data lake.

Một thập kỷ của Apache Spark Structured Streaming: Cách chúng tôi phát triển kiến trúc để đáp ứng nhu cầu thực tế

Structured Streaming vận hành hàng triệu công việc mỗi tuần tại Databricks. Nó sử dụng kiến trúc xử lý micro-batch độc đáo, mang lại những ưu điểm về khả năng mở rộng, khả năng chịu lỗi và ngữ nghĩa exactly-once so với các thiết kế khác. Tuy nhiên, Structured Streaming cần nhiều đổi mới để đáp ứng nhu cầu của khách hàng thực tế và đạt được quy mô như hiện nay. Siying Dong sẽ trình bày cách kiến trúc streaming đã phát triển qua nhiều năm— microbatch pipelining cải thiện thông lượng lên đến 3 lần, các API có trạng thái (stateful) mới giúp dễ dàng thể hiện logic nghiệp vụ phức tạp, và hệ thống hiện đã hỗ trợ kiểm soát truy cập chi tiết (fine-grained access control).

AutoLiquid: Tối ưu hóa bố cục dữ liệu tự động cho Databricks Lakehouse

Phân cụm (clustering) các bảng theo khóa có thể cải thiện đáng kể hiệu suất truy vấn. Tuy nhiên, việc chọn khóa phân cụm tối ưu theo cách thủ công trên hàng triệu bảng lakehouse là không khả thi về quy mô. Yunjia Zhang sẽ mô tả cách AutoLiquid tự động hóa vòng đời này thông qua một primitive đơn giản là CLUSTER BY AUTO. AutoLiquid sử dụng kết hợp các heuristic để chọn khóa và xác minh shadow hiệu quả nhằm phân cụm hàng triệu bảng. Sử dụng các kỹ thuật này, AutoLiquid có thể vượt trội hơn các khóa do khách hàng chọn trên hơn 95% khối lượng công việc được đánh giá.

Ultron: Tối ưu hóa truy vấn dựa trên lịch sử tại Databricks

Độ trễ của các truy vấn Lakehouse có thể được cải thiện đáng kể nếu bộ tối ưu hóa có kiến thức gần như hoàn hảo về dữ liệu. Ultron là một framework tối ưu hóa truy vấn dựa trên lịch sử, tận dụng tính chất lặp đi lặp lại của các khối lượng công việc phân tích để cải thiện các lựa chọn của bộ tối ưu hóa, chẳng hạn như chọn loại toán tử join. Eric Liang sẽ mô tả kiến trúc của Ultron, bao gồm cách nó lưu trữ lịch sử và quản lý log của các truy vấn đã thực thi một cách hiệu quả. Ultron đã cải thiện đáng kể hiệu suất của các khối lượng công việc thực tế, bao gồm việc cải thiện độ trễ join trung vị lên 25%.

Ngoài bốn bài báo này, hãy tham gia cùng chúng tôi để xem Yuhong Chen trình diễn Enzyme, engine duy trì view tăng dần của chúng tôi dành cho các khối lượng công việc kỹ thuật dữ liệu.

Cơ sở hạ tầng dữ liệu dành cho Agent: LakehouseRT, Lakebase và LTAP (Bài thuyết trình của nhà tài trợ) Databricks là Nhà tài trợ Vàng của VLDB 2026. Ippokratis Pandis sẽ thực hiện bài thuyết trình của nhà tài trợ Databricks, nơi ông sẽ mô tả cách Databricks đang phát triển kiến trúc hệ thống của mình để thích ứng với các vòng lặp tự trị, hướng agent. Với suy nghĩ đó, chúng tôi sẽ giới thiệu LakehouseRT. LakehouseRT được vận hành bởi engine Reyden mới và được thiết kế để phân tích thời gian thực với độ trễ thấp trực tiếp trên open lake storage. Sự kết hợp giữa Lakebase và LakehouseRT cung cấp nền tảng để phân phối hệ thống Lake Transactional Analytical Processing (LTAP) thực sự đầu tiên.

Gặp gỡ đội ngũ tại VLDB 2026

Hãy ghé thăm gian hàng của Databricks để kết nối với các đội ngũ kỹ thuật và nghiên cứu của chúng tôi, thảo luận về các bài báo và trò chuyện với các nhà tuyển dụng của chúng tôi.

DatabricksLakehouseDữ liệu lớnVLDB 2026Công nghệ dữ liệu
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Databricks: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.