Nổi bật

Chúc mừng nhóm sinh viên Đinh Hữu Nhiên và Châu Thế Vĩ đã có bài báo khoa học được chấp nhận đăng tại Hội nghị quốc tế MAPR 2026

Chúc mừng Đinh Hữu Nhiên và Châu Thế Vĩ đã có bài báo khoa học được chấp nhận trình bày và xuất bản tại The 9th International Conference on Multimedia Analysis and Pattern Recognition (MAPR 2026), diễn ra tại Huế, Việt Nam.

Bài báo:
  • An Empirical Study on the Transferability of Transformer-Based Models for Software Vulnerability Detection
Sinh viên thực hiện:
  • Đinh Hữu Nhiên - Cộng tác viên Phòng thí nghiệm An toàn thông tin
  • Châu Thế Vĩ - KHTN2022, Khoa Khoa học Máy tính, Trường Đại học Công nghệ Thông tin - ĐHQG-HCM
Giảng viên hướng dẫn:
  • ThS. Tô Trọng Nghĩa
  • TS. Phan Thế Duy
Tóm tắt bài báo:

Mặc dù các mô hình dựa trên kiến trúc Transformer đang chiếm ưu thế trong việc phát hiện lỗ hổng phần mềm, khả năng khái quát hóa logic bảo mật đã học của chúng trên các ngôn ngữ lập trình khác nhau vẫn là một câu hỏi mở quan trọng. Để giải quyết vấn đề này, bài báo đề xuất một khung đánh giá toàn diện được tổ chức thành ba giai đoạn trải dài qua năm kịch bản thực nghiệm khác nhau, nhằm phân tích nghiêm ngặt các hành vi của mô hình từ độ nhạy đầu vào (input sensitivity) và hiệu suất cơ sở (baseline performance) đến khả năng chuyển giao đa ngôn ngữ (cross-lingual transferability) và tính minh bạch trong ra quyết định (decision transparency). Chúng tôi thử nghiệm đối sánh (benchmark) bốn mô hình tiêu biểu (CodeBERT, GraphCodeBERT, UniXcoder và CodeT5+) bằng cách sử dụng tập dữ liệu Polyglot Injection Dataset được tinh lọc (gồm C/C++ và Java). Các kết quả thực nghiệm chỉ ra rằng việc mở rộng ngữ cảnh đầu vào từ 128 lên 512 token mang lại hiệu quả không đáng kể, cho thấy sự phụ thuộc lớn của mô hình vào các đặc trưng mang tính cục bộ (localized features). Trong khi chúng tôi nhận thấy sự bất đối xứng rõ rệt trong quá trình chuyển giao nghiêng về phía các nguồn C/C++, kiến trúc Encoder-Decoder (CodeT5+) lại chứng minh khả năng khái quát hóa đa ngôn ngữ vượt trội. Quan trọng hơn, độ bền vững cấu trúc (structural robustness) cao trước các biến đổi ngữ nghĩa (semantic transformations), kết hợp với phân tích sự đồng thuận XAI định lượng, đã xác nhận rằng các mô hình này thực sự nắm bắt được logic lỗ hổng cốt lõi. Những phát hiện này gợi mở rằng rào cản chính đối với việc chuyển giao đa ngôn ngữ là do sự bất tương thích về mặt từ vựng (vocabulary mismatch) chứ không phải do sự hạn chế trong khả năng lập luận của mô hình.

Thông tin về hội nghị:

MAPR 2026 (International Conference on Multimedia Analysis and Pattern Recognition) là hội nghị khoa học quốc tế uy tín về Phân tích đa phương tiện và Nhận dạng mẫu do Trường Đại học Công nghệ Thông tin (UIT) – ĐHQG-HCM tổ chức. Hội nghị là diễn đàn trao đổi học thuật chất lượng cao, kết nối các nhà nghiên cứu, chuyên gia và học giả trong và ngoài nước thuộc lĩnh vực trí tuệ nhân tạo, nhận dạng mẫu và xử lý đa phương tiện. MAPR 2026 sẽ được diễn ra tại thành phố Huế, với sự tham gia của diễn giả chính (Keynote Speaker) là Giáo sư NGO Chong Wah đến từ Trường Máy tính và Hệ thống Thông tin thuộc Đại học Quản lý Singapore (SMU). Tất cả các bài báo được chấp nhận tại hội nghị sẽ được xuất bản trong kỷ yếu hội nghị và lập chỉ mục trong cơ sở dữ liệu uy tín IEEE Xplore.

Xin chúc mừng nhóm nghiên cứu và quý thầy hướng dẫn. Thành quả này là minh chứng cho tinh thần nghiên cứu nghiêm túc, sự hợp tác hiệu quả giữa các thành viên, đồng thời góp phần lan tỏa niềm đam mê nghiên cứu khoa học và đổi mới sáng tạo trong cộng đồng sinh viên.