Xử lý dữ liệu lớn và tối ưu năng lực tính toán AI: Góc nhìn của Giáo sư tại APWeb-WAIM 2026
Tại Hội nghị quốc tế về Web & Big Data APWeb-WAIM 2026, Giáo sư Hai Jin từ ĐH Khoa học và Công nghệ Hoa Trung (Trung Quốc), đã chia sẻ nghiên cứu “A Unified Approach of Graph Computing: From Foundations to Systems and Beyond”.
Đây là hướng tiếp cận thống nhất cho điện toán đồ thị (Graph computing) - công nghệ được kỳ vọng trở thành nền tảng xử lý dữ liệu quan trọng trong các hệ thống AI và tính toán khoa học hiện đại.
Trong các hệ thống công nghệ ngày nay, dữ liệu không chỉ ngày càng lớn mà còn có tính kết nối. Một người có thể kết nối với bạn bè trên mạng xã hội, một thành phố được liên kết bởi mạng lưới giao thông, các công trình khoa học có quan hệ trích dẫn với nhau hay các phân tử được tạo thành từ nhiều mối liên kết hóa học.
Để xử lý những mối quan hệ này, điện toán đồ thị trở thành một phương pháp quan trọng. Trong đó, các đối tượng được biểu diễn thành các “nút” và mối quan hệ giữa chúng thành các “cạnh”, tạo nên một mạng lưới có thể được máy tính phân tích.
Theo Giáo sư Hai Jin, sự phát triển của dữ liệu đang tạo ra một xu hướng chuyển dịch từ cách tính toán truyền thống sang tính toán dựa trên các mối quan hệ (relational computation).
Nếu dữ liệu trong các cơ sở dữ liệu truyền thống thường được tổ chức thành những bảng gồm hàng và cột, dữ liệu thực tế ngày càng giống một mạng lưới phức tạp. Nhiều bài toán quen thuộc cũng có thể được mô hình hóa dưới dạng đồ thị như tìm đường đi, phát hiện cộng đồng, phân tích mạng lưới, hệ thống gợi ý hay đánh giá rủi ro tài chính. Trong AI, các mô hình cũng ngày càng khai thác những dữ liệu có cấu trúc tương tự đồ thị để tìm ra mối liên hệ giữa các đối tượng.
Trong khoa học, tiềm năng của điện toán đồ thị còn mở rộng sang những lĩnh vực như khám phá thuốc, phân tích protein, thiết kế phân tử, thiên văn học hay khí tượng. Tuy nhiên, dữ liệu khoa học thường đa dạng, không có cấu trúc sẵn và có quy mô rất lớn. Việc chuyển đổi dữ liệu thành đồ thị phù hợp, sau đó xử lý với tốc độ cao, trở thành một bài toán không đơn giản. Đó không chỉ là xử lý nhanh hơn, mà còn phải sử dụng tài nguyên hiệu quả hơn, tiết kiệm năng lượng và có thể mở rộng khi kích thước dữ liệu tăng lên rất lớn.
Nghiên cứu của Giáo sư Hai Jin cùng cộng sự đã đề xuất một phương pháp tiếp cận thống nhất cho điện toán đồ thị, bắt đầu từ việc xây dựng một nền tảng chung để các loại dữ liệu và tác vụ khác nhau có thể được biểu diễn và xử lý theo cùng một cách. Một trong những nền tảng của hướng tiếp cận này là sử dụng ma trận thưa (sparse matrix) để biểu diễn dữ liệu. Nếu hình dung một bảng rất lớn nhưng phần lớn các ô đều không có dữ liệu, “ma trận thưa” cho phép hệ thống tập trung vào những vị trí thực sự có thông tin, thay vì dành tài nguyên để xử lý cả những phần trống. Cách làm này đặc biệt phù hợp với điện toán đồ thị bởi trong nhiều đồ thị lớn, mỗi đối tượng chỉ liên kết với một phần rất nhỏ trong tổng số đối tượng còn lại.
Từ nền tảng đó, nhóm nghiên cứu của GS. Hai Jin phát triển một kiến trúc xử lý theo hướng phối hợp chặt chẽ giữa phần mềm và phần cứng. Hệ thống được thiết kế để hạn chế những điểm nghẽn khi nhiều tác vụ cùng được xử lý, tận dụng tốt hơn bộ nhớ và cho phép hệ thống mở rộng khi lượng dữ liệu tăng lên.
Nghiên cứu của GS. Hai Jin cũng chỉ ra điện toán đồ thị trở thành một nền tảng tính toán có thể phục vụ nhiều loại ứng dụng khác nhau trong tương lai, đặc biệt là các hệ thống AI và quá trình suy luận của những mô hình lớn.
Nếu trước đây điện toán đồ thị chủ yếu được nhìn nhận như một công cụ để xử lý các dữ liệu có nhiều mối quan hệ, hướng nghiên cứu được chia sẻ tại APWeb-WAIM 2026 cho thấy tiềm năng của nó có thể rộng hơn. Điện toán đồ thị có thể trở thành điểm kết nối giữa phân tích dữ liệu, AI và tính toán khoa học, giúp các hệ thống công nghệ xử lý khối lượng công việc ngày càng phức tạp trên một nền tảng hiệu quả hơn.
Khi AI tiếp tục mở rộng về quy mô, những đổi mới phía sau các mô hình cũng trở nên quan trọng không kém bản thân mô hình. Và trong câu chuyện ấy, việc tìm ra cách biểu diễn dữ liệu hiệu quả, giảm chi phí di chuyển dữ liệu và khai thác tốt hơn năng lực phần cứng sẽ là một trong những chìa khóa để đưa các hệ thống AI và tính toán thế hệ mới tiến xa hơn.
Hội nghị APWeb-WAIM đang diễn ra tại Trường ĐH FPT phân hiệu Đà Nẵng, từ ngày 07-09/9/2026. Hội nghị có sự tham gia của ba diễn giả chính uy tín đến từ các trường đại học hàng đầu Singapore, Hong Kong, Trung Quốc, hơn 100 nhà nghiên cứu, chuyên gia, giảng viên và sinh viên đến từ 12 quốc gia và vùng lãnh thổ. Hội nghị quy tụ 162 công trình nghiên cứu trải rộng trên nhiều chủ đề như hệ thống Web, khai phá dữ liệu Web, cơ sở dữ liệu, Big Data, truy hồi thông tin, trí tuệ nhân tạo, học máy và điện toán đám mây. Các nghiên cứu được trình bày theo hình thức trực tuyến và trực tiếp.
Thu Uyên - fpt.edu.vn