21-08-2026
Bài báo:Long-Sequence Modeling for Sparse-View Computed Tomography ReconstructionTác giả:- Lê Đức Thành – KHMT2023 – Đồng tác giảGiảng viên hướng dẫn:- TS. Bùi Cao Doanh- PGS.TS. Nguyễn Tấn Trần Minh KhangTóm tắt:Tái tạo ảnh cắt lớp vi tính (Computed Tomography – CT) từ dữ liệu sparse-view là một hướng nghiên cứu quan trọng nhằm giảm liều chiếu tia X cho bệnh nhân nhưng vẫn đảm bảo chất lượng hình ảnh. Các phương pháp truyền thống dựa trên mạng nơ-ron tích chập (CNN) có khả năng trích xuất hiệu quả các đặc trưng cục bộ, tuy nhiên còn hạn chế trong việc mô hình hóa các mối quan hệ phụ thuộc ở khoảng cách xa. Trong khi đó, các mô hình Transformer có thể khắc phục hạn chế này bằng cách học các mối quan hệ toàn cục giữa các vùng ảnh, nhưng thường sử dụng các token ảnh có kích thước lớn (ví dụ 16 × 16 pixel), dẫn đến thiên lệch về thông tin cục bộ và làm giảm khả năng biểu diễn các cấu trúc tinh vi. Do các vùng bất thường trên ảnh CT thường có kích thước nhỏ, việc sử dụng các token có độ phân giải cao hơn (chẳng hạn 2 × 2 pixel) là cần thiết. Tuy nhiên, cách biểu diễn này làm số lượng token tăng mạnh, kéo theo chi phí tính toán của cơ chế self-attention tăng theo bậc hai.Để giải quyết vấn đề trên, nghiên cứu này khai thác các phương pháp xấp xỉ self-attention hiệu quả. Cụ thể, chúng tôi đề xuất biểu diễn gradient của thành phần chuẩn hóa (regularization gradient) của ảnh CT dưới dạng một chuỗi token dài, trong đó mỗi token tương ứng với một vùng ảnh 2 × 2 pixel. Cách biểu diễn này cho phép mô hình hóa hiệu quả các phụ thuộc dài bằng các kiến trúc xử lý chuỗi hiện đại. Trên cơ sở đó, nghiên cứu tích hợp cơ chế Selective State Space Model của Mamba cùng ba phương pháp self-attention xấp xỉ gồm Longformer, LongNet và Nyströmformer vào mạng tái tạo ảnh dựa trên regularization.Kết quả thực nghiệm trên hai bộ dữ liệu công khai AAPM và DeepLesion cho thấy mô hình sử dụng Nyström Attention đạt chỉ số SSIM lần lượt là 0,9607 và 0,9711, vượt trội hơn các phương pháp tiên tiến hiện nay với mức cải thiện 1,3% và 3,1%. Bên cạnh đó, trong khi nhiều phương pháp tái tạo truyền thống suy giảm đáng kể chất lượng khi dữ liệu đầu vào có nhiễu, mô hình đề xuất vẫn duy trì được tính ổn định và chất lượng tái tạo cao. Kết quả nghiên cứu cho thấy việc biểu diễn ảnh CT bằng các token kích thước nhỏ ở mức pixel là một hướng tiếp cận hiệu quả và có chi phí tính toán hợp lý để mô hình hóa các phụ thuộc dài trong bài toán tái tạo ảnh CT sparse-view.Bài báo được công bố tại tạp chí quốc tế:Machine Vision and Applications (MVA) là tạp chí khoa học quốc tế bình duyệt do Springer Nature xuất bản, chuyên về các lĩnh vực thị giác máy tính (Computer Vision), xử lý ảnh (Image Processing), trí tuệ nhân tạo (Artificial Intelligence) và các ứng dụng liên quan.Tạp chí được chỉ mục trong Web of Science (SCIE) và Scopus, đồng thời được xếp hạng Q2 theo Scopus/SJR trong các lĩnh vực Computer Vision and Pattern Recognition và Computer Science Applications. Theo các chỉ số công bố giai đoạn 2025–2026, tạp chí có Journal Impact Factor (JIF) ≈ 2.3, CiteScore ≈ 4.9, SJR ≈ 0.50, SNIP ≈ 0.79 và H-index = 84, phản ánh mức độ ảnh hưởng và uy tín tốt trong cộng đồng nghiên cứu về thị giác máy tính và xử lý ảnh.Thông tin chi tiết tại: https://www.facebook.com/share/p/1Dnf3KsXEV/ Đông Xanh - Cộng tác viên truyền thông Trường Đại học Công nghệ Thông tin