Thủ thuật
Hướng dẫn toàn diện TimesFM 2.5: Từ dự báo chuỗi thời gian đến triển khai trên Colab
(giờ Việt Nam)
Tóm tắt AI
Hướng dẫn thực hành xây dựng quy trình dự báo chuỗi thời gian với TimesFM 2.5, bao gồm kiểm thử ngược, xử lý biến phụ thuộc, phát hiện bất thường và tối ưu hóa hiệu suất trên Google Colab.
Bản dịch AI

Trong hướng dẫn này, chúng ta sẽ xây dựng một quy trình dự báo chuỗi thời gian end-to-end nâng cao với TimesFM 2.5. Chúng ta bắt đầu bằng việc cấu hình môi trường runtime, cài đặt các thư viện phụ thuộc cần thiết, phát hiện phần cứng khả dụng và tạo một tập dữ liệu bán lẻ đa cửa hàng thực tế với các yếu tố như xu hướng, tính mùa vụ, giá cả, khuyến mãi, ngày lễ, ảnh hưởng của nhiệt độ và biến động ngẫu nhiên. Sau đó, chúng ta tải và biên dịch mô hình TimesFM 2.5, kiểm tra cấu hình dự báo và sử dụng nó để thực hiện dự báo điểm (point forecasting) và dự báo xác suất (probabilistic forecasting) theo phương thức zero-shot. Trong quá trình thực hiện, chúng ta đánh giá chất lượng dự báo bằng các chỉ số như MAE, RMSE, sMAPE, MASE, pinball loss và độ bao phủ khoảng dự báo (prediction-interval coverage), đồng thời kiểm thử khả năng suy luận theo lô (batched inference), kiểm thử ngược rolling-origin (rolling-origin backtesting), độ nhạy với độ dài ngữ cảnh (context-length sensitivity), tích hợp biến hiệp biến (covariate) thông qua XReg, phát hiện bất thường, dự báo tầm xa, tối ưu hóa thông lượng và độ bền vững của dữ liệu đầu vào. Thông qua các bước này, chúng ta sẽ phát triển sự hiểu biết thực tiễn về cách cấu hình, xác thực, đánh giá và triển khai TimesFM cho các tác vụ dự báo thực tế.
Chúng ta cấu hình môi trường Google Colab, cài đặt TimesFM cùng các thư viện hỗ trợ, phát hiện CPU hoặc GPU khả dụng và khởi tạo các hạt giống ngẫu nhiên (random seeds) để đảm bảo tính tái lập. Chúng ta tạo ra một tập dữ liệu bán lẻ đa cửa hàng thực tế bao gồm các xu hướng, tính mùa vụ theo tuần và năm, ảnh hưởng của giá cả, khuyến mãi, ngày lễ, biến động nhiệt độ và nhiễu cầu ngẫu nhiên. Sau đó, chúng ta tải mô hình TimesFM 2.5, xác định cấu hình dự báo cơ sở, biên dịch mô hình và tạo một hàm có thể tái sử dụng để thay đổi cài đặt mô hình trong các thử nghiệm sau này.
Chúng ta tạo dự báo zero-shot đầu tiên và trực quan hóa dữ liệu lịch sử, các quan sát thực tế, dự đoán trung vị và các dải phân vị xác suất trong biểu đồ quạt (fan chart). Chúng ta kiểm tra cấu trúc của các đầu ra dạng điểm và phân vị, xác định các hàm đánh giá cho MAE, RMSE, MAPE, sMAPE, MASE, pinball loss và độ bao phủ khoảng dự báo, đồng thời so sánh TimesFM với các mô hình dự báo cơ sở đơn giản. Chúng ta cũng dự báo tất cả các chuỗi cửa hàng trong một lô duy nhất, tính toán các chỉ số hiệu suất cấp cửa hàng và vẽ biểu đồ các dự báo cùng khoảng không chắc chắn trên toàn bộ tập dữ liệu bán lẻ.
Chúng ta thực hiện kiểm thử ngược rolling-origin qua nhiều điểm cắt lịch sử để đánh giá TimesFM trong nhiều giai đoạn dự báo thực tế thay vì chỉ dựa vào một cửa sổ kiểm chứng (holdout window) duy nhất. Chúng ta so sánh mô hình với một mô hình cơ sở seasonal-naive, tóm tắt các chỉ số lỗi trung bình, tính toán mức cải thiện MASE và trực quan hóa hiệu suất qua các fold kiểm thử ngược. Sau đó, chúng ta thực hiện nghiên cứu cắt bỏ (ablation study) về độ dài ngữ cảnh để xác định lượng dữ liệu lịch sử khác nhau ảnh hưởng như thế nào đến độ chính xác dự báo, độ bao phủ khoảng và thời gian suy luận.
Chúng ta tích hợp các biến hiệp biến dạng số, phân loại và tĩnh vào quy trình dự báo thông qua chức năng XReg của TimesFM. Chúng ta so sánh các chế độ kết hợp xreg + timesfm và timesfm + xreg với dự báo đơn biến trong khi sử dụng thông tin về giá, nhiệt độ, khuyến mãi, ngày lễ, ngày trong tuần, khu vực và cửa hàng. Chúng ta đánh giá các phương pháp cạnh tranh, xác định chế độ biến hiệp biến hoạt động tốt nhất và trực quan hóa cách các dự đoán phản ứng với các giai đoạn khuyến mãi đã biết trong tương lai.
Chúng ta tạo quy trình phát hiện bất thường bằng cách so sánh các giá trị quan sát được với các khoảng phân vị dự báo của TimesFM và gán mức độ nghiêm trọng cảnh báo hoặc nghiêm trọng cho các quan sát bất thường. Chúng ta đưa các đột biến, sự cố mất điện và các thay đổi kéo dài vào một chuỗi bán lẻ, tính toán điểm bất thường dựa trên khoảng và trực quan hóa các sự kiện được phát hiện cùng với phạm vi dự báo kỳ vọng. Chúng ta cũng so sánh dự báo tầm xa trực tiếp và đệ quy để xem xét cách mỗi chiến lược ảnh hưởng đến độ chính xác, sự không chắc chắn và tích lũy sai số trong một khoảng thời gian dự đoán mở rộng.
Chúng ta đánh giá thông lượng dự báo trên các kích thước lô (batch size) khác nhau trên mỗi lõi và đo lường số lượng chuỗi thời gian được xử lý mỗi giây. Chúng ta kiểm tra độ bền vững của mô hình với các giá trị thiếu ở đầu và giữa, dữ liệu lịch sử rất ngắn, cắt tỉa giá trị dương, danh sách đầu vào có thể thay đổi và suy luận lặp lại tất yếu. Cuối cùng, chúng ta tạo dự báo tương lai cho mọi cửa hàng, xuất kết quả và tóm tắt thử nghiệm sang các tệp CSV và JSON, đồng thời cung cấp một mẫu có thể tái sử dụng để áp dụng TimesFM 2.5 cho tập dữ liệu chuỗi thời gian của riêng chúng ta.
Tóm lại, chúng ta đã hoàn thành một quy trình dự báo TimesFM 2.5 toàn diện, vượt xa việc chỉ tạo ra một dự đoán cơ bản. Chúng ta đã sử dụng các phân vị xác suất để đo lường sự không chắc chắn, so sánh mô hình với các mô hình cơ sở seasonal-naive và last-value, đồng thời áp dụng kiểm thử ngược rolling-origin để có cái nhìn đáng tin cậy hơn về hiệu suất trong thế giới thực. Chúng ta cũng đã khám phá cách độ dài ngữ cảnh, kích thước lô, biến hiệp biến ngoại sinh, cờ biên dịch và các chiến lược dự báo trực tiếp hoặc đệ quy ảnh hưởng đến độ chính xác và chi phí tính toán. Thông qua việc phát hiện bất thường và các bài kiểm tra độ bền vững, chúng ta đã xem xét cách mô hình hoạt động với các giá trị thiếu, lịch sử ngắn, ràng buộc giá trị dương, đầu vào có thể thay đổi và các chân trời dự báo dài. Cuối cùng, chúng ta đã xuất kết quả dự báo, kiểm thử ngược, nghiên cứu cắt bỏ và thông lượng vào các tệp có thể tái sử dụng và cung cấp mẫu để áp dụng quy trình vào dữ liệu chuỗi thời gian cách đều của riêng mình. Chúng ta đã kết thúc với một nền tảng có cấu trúc và hướng tới sản xuất để điều chỉnh TimesFM 2.5 cho dự báo nhu cầu, lập kế hoạch vận hành, giám sát bất thường và các ứng dụng dự báo quy mô lớn khác.
Xem toàn bộ mã nguồn tại đây. Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML 150k+ của chúng tôi và đăng ký nhận Bản tin. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Cần hợp tác với chúng tôi để quảng bá GitHub Repo HOẶC trang Hugging Face HOẶC Phát hành sản phẩm HOẶC Hội thảo trực tuyến, v.v.? Hãy kết nối với chúng tôi.
Sana Hassan, thực tập sinh tư vấn tại Marktechpost và là sinh viên bằng kép tại IIT Madras, rất đam mê việc ứng dụng công nghệ và AI để giải quyết các thách thức thực tế. Với sự quan tâm sâu sắc đến việc giải quyết các vấn đề thực tiễn, anh mang đến một góc nhìn mới mẻ cho sự giao thoa giữa AI và các giải pháp đời sống.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.