12/09/2026
GIẢI PHÁP KHOÁN TÌNH HIỆU SUẤT KHAI THÁC MẪU TIỆN ÍCH TRUNG BÌNH CAO TRÊN DỮ LIỆU LUỒNG
Khai thác mẫu tiện ích trung bình cao (HAUP) trên cơ sở dữ liệu tăng dần hoặc luồng dữ liệu luôn gặp thách thức lớn về hiệu suất do phải quét lại toàn bộ dữ liệu và mở rộng mẫu quá thường xuyên khi có giao dịch mới đến.
Nghiên cứu của Kim et al. đề xuất thuật toán PIHAUPA (Pre-large Insertion High Average Utility Pattern Analysis) - một bước đột phá giải quyết bài toán này. Khác với các phương pháp tiền lớn truyền thống dùng điều kiện quét lại lỏng lẻo dựa trên tổng tiện ích giao dịch TU(ID), PIHAUPA đưa ra "Điều kiện quét lại chặt chẽ" (Tight Re-scan Condition) sử dụng tổng tiện ích tối đa MU(ID) - một cận trên gắt gao hơn (MU(ID) ≤ TU(ID) luôn đúng). Ba đỉnh cao kỹ thuật cốt lõi bao gồm: (1) Căn cứ lý thuyết chắc chắn: Lema 1 chứng minh không mẫu nhỏ nào trở thành lớn nếu điều kiện sai (đảm bảo không mất mẫu); Lema 2 chứng minh số lần quét lại ít hơn hoặc bằng phương pháp cũ. (2) Cấu trúc dữ liệu thông minh: Danh sách PIHAUP-List (xây dựng một lần quét) kết hợp Cây Mẫu (Pattern Tree) lưu trữ mẫu lớn/tiền lớn theo thứ tự AUUB giảm dần, cho phép cập nhật tăng dần cực nhanh. (3) Cận cắt tỉa MAU (Maximum Average Upper bound) siết chặt hơn AUUB, giảm đáng kể không gian tìm kiếm khi mở rộng mẫu theo chiều sâu. Khi dữ liệu mới đến, thuật toán kiểm tra điều kiện chặt: nếu sai thì chỉ cập nhật tiện ích trên Cây Mẫu hiện có (phức tạp O(d·avg(T) + |PT|)), nếu đúng thì xây dựng lại từ đầu. Thực nghiệm cho thấy trường hợp "không quét lại" xảy ra rất nhiều, tạo lợi thế tuyệt đối về tốc độ.
Những phát hiện chính từ nghiên cứu này:
🔹 Tốc độ vượt trội: Trên tập thực Accidents, PIHAUPA chỉ quét lại 2/9 lần so với 9/9 của đối thủ, nhanh hơn khoảng 80 giây mỗi bước không quét lại. Trên Chainstore tránh được 4/9 lần quét lại, nhanh hơn khoảng 15 giây mỗi lần.
🔹 Bộ nhớ cực gọn: Chỉ tiêu tốn dưới 0.1 MB khi không quét lại (so với 600-750 MB của các phương pháp so sánh như PRE-HAUIMI, PIHUPM*).
🔹 Khả năng mở rộng tuyệt vời: Trên 1 triệu giao dịch tổng hợp, PIHAUPA chỉ mất 61.6 giây so với 540.9 giây của PRE-HAUIMI. Khoảng cách hiệu suất càng mở rộng khi quy mô dữ liệu tăng.
🔹 Độ nhạy ngưỡng thấp nhất: Khi thay đổi ngưỡng Su, Sl, thời gian chạy PIHAUPA chỉ tăng +84.5 giây, trong khi PULM* tăng +266 giây và PRE-HAUIMI tăng tới +8109 giây. Bộ nhớ cũng ổn định tốt hơn.
🔹 Đúng đắn 100%: Kết quả tập mẫu và giá trị tiện ích trung bình khớp hoàn toàn với thuật toán cơ sở trên 30 tập dữ liệu lấy mẫu ngẫu nhiên (độ chính xác 3 chữ số thập phân).
🔹 Thích ứng Trôi dạt khái niệm: Có tích hợp cơ chế quên, hiệu suất vượt trội khi tỷ lệ trùng lặp dữ liệu tăng từ 60% lên 80% (Chainstore: PIHAUPA chỉ tăng +13.7 giây vs +37.8 giây của PRE-HAUIMI).
Bạn nghĩ sao về việc áp dụng cận trên dựa trên tiện ích tối đa (MU) thay vì tổng tiện ích (TU) để kiểm soát chi phí quét lại trong các bài toán khai thác mẫu luồng dữ liệu khác?
🔗 Link bài nghiên cứu: https://openreview.net/pdf?id=OuFNXESoCO
____________________________________________________________
CONTACT US:
📌 Page: https://www.facebook.com/IEFPA.Vietnam
📌 Page: https://www.facebook.com/Science.for.Economics
📌 Website: http://iefpa.org.vn/
📌 Hệ thống khoá học trực tuyến (LMS): https://lms.scienceforeconomics.com/
📌 Nền tảng phân tích thị trường chứng khoán: https://senfin-info.scienceforeconomics.com/
☎️ Hotline: 0357.947.680 (Ms.Hà)
📩 Email: [email protected]
📩 Email: [email protected]
📍 Địa chỉ: Số 60, ngõ 41, Phố Thái Hà, Đống Đa, Hà Nội