Bỏ qua điều hướng

Phân tích chủ thành phần là gì?

Principal Component Analysis (PCA) Thống kê & Mô hình

Phân tích chủ thành phần

Phân tích chủ thành phần (Principal Component Analysis – PCA) là một kỹ thuật thống kê đa biến thuộc nhóm giảm chiều dữ liệu (dimensionality reduction), được sử dụng để chuyển đổi một tập hợp gồm nhiều biến ban đầu có tương quan với nhau thành một tập hợp nhỏ hơn các biến mới gọi là các thành phần chính (principal components), trong đó mỗi thành phần chính là một tổ hợp tuyến tính của các biến gốc và vẫn giữ được phần lớn thông tin (phương sai) của dữ liệu ban đầu. Thành phần chính thứ nhất giải thích cho phương sai lớn nhất có thể, thành phần chính thứ hai giải thích cho phương sai lớn nhất có thể trong phần dư sau khi đã loại trừ thành phần thứ nhất, và cứ tiếp tục như vậy; các thành phần chính trong cùng một phân tích luôn trực giao với nhau, tức là không có sự trùng lặp thông tin giữa chúng. PCA được giới thiệu lần đầu bởi Karl Pearson vào năm 1901 và sau đó được phát triển hoàn thiện bởi Harold Hotelling vào năm 1933, đến nay đã trở thành công cụ nền tảng trong phân tích dữ liệu, học máy, tài chính và đặc biệt trong quản trị rủi ro ngân hàng.

Nguyên lý toán học và quy trình thực hiện

Về mặt toán học, PCA dựa trên phép phân tích trị riêng và vectơ riêng của ma trận hiệp phương sai (hoặc ma trận tương quan) của dữ liệu. Trình tự thực hiện chuẩn gồm các bước: (1) Chuẩn hóa dữ liệu, thường là đưa về dạng z-score để đảm bảo các biến có cùng thang đo; (2) Tính ma trận hiệp phương sai hoặc tương quan; (3) Tính các trị riêng và vectơ riêng tương ứng; (4) Sắp xếp các trị riêng theo thứ tự giảm dần và chọn ra k thành phần chính có trị riêng lớn nhất; (5) Xây dựng ma trận chiếu (projection matrix) và chuyển đổi dữ liệu gốc sang không gian mới. Tỷ lệ phươ sai tích lũy giải thích (cumulative explained variance ratio) là chỉ số quyết định số thành phần chính được giữ lại; theo quy ước phổ biến, người phân tích thường chọn k sao cho tỷ lệ này đạt từ 80% đến 95% tùy mục đích ứng dụng. Một tiêu chí khác là chỉ giữ lại các thành phần có trị riêng lớn hơn 1 khi làm việc trên ma trận tương quan (tiêu chí Kaiser).

Ý nghĩa và giới hạn của phương pháp

PCA mang lại ba giá trị cốt lõi: thứ nhất, giảm chiều dữ liệu giúp tiết kiệm tài nguyên tính toán và tránh hiện tượng "lời nguyền chiều dữ liệu" (curse of dimensionality); thứ hai, loại bỏ nhiễu và nhiễu đa cộng tuyến giữa các biến, từ đó cải thiện hiệu quả của các mô hình dự báo; thứ ba, trực quan hóa dữ liệu khi chiếu xuống hai hoặc ba thành phần chính để quan sát cụm, xu hướng và giá trị ngoại lệ. Tuy nhiên, PCA cũng có những hạn chế cần lưu ý: các thành phần chính là tổ hợp tuyến tính nên khó diễn giải ý nghĩa kinh tế trực tiếp từ các hệ số; phương pháp giả định các biến có phân phối chuẩn và quan hệ tuyến tính, do đó kém hiệu quả với dữ liệu phi tuyến hoặc phi chuẩn; ngoài ra, PCA nhạy cảm với thang đo của biến đầu vào nên bước chuẩn hóa là bắt buộc khi các biến có đơn vị khác nhau.

Ứng dụng trong ngân hàng và tài chính

Trong lĩnh vực ngân hàng, PCA được ứng dụng rộng rãi ở nhiều bài toán thực tiễn. Trong quản trị rủi ro, PCA giúp xây dựng mô hình rủi ro tổng hợp từ nhiều chỉ tiêu tài chính vĩ mô (lạm phát, tỷ giá, lãi suất, tăng trưởng tín dụng...) thành một chỉ số rủi ro hệ thống duy nhất. Trong phân tích danh mục đầu tư, PCA được sử dụng để xác định các yếu tố rủi ro chung (common risk factors) giải thích biến động đồng thời của danh mục, từ đó hỗ trợ xây dựng mô hình định giá tài sản vốn (CAPM) đa yếu tố hoặc mô hình Fama-French. Trong xếp hạng tín dụng và phân loại khách hàng, PCA giúp gom hàng chục chỉ tiêu tài chính của doanh nghiệp (doanh thu, biên lợi nhuận, hệ số nợ, dòng tiền, khả năng thanh toán...) thành vài thành phần chính phản ánh các khía cạnh như quy mô, hiệu quả hoạt động và mức độ đòn bẩy, phục vụ cho mô hình chấm điểm tín dụng nội bộ. Trong phát hiện gian lận, PCA kết hợp với phân tích giá trị ngoại lệ (outlier detection) giúp nhận diện các giao dịch bất thường khi khoảng cách của điểm dữ liệu đến không gian thành phần chính vượt ngưỡng cho phép.

Một số lưu ý khi áp dụng trong đề thi và thực hành

Khi làm bài thi tuyển dụng ngân hàng hoặc phỏng vấn vị trí phân tích dữ liệu, ứng viên cần phân biệt rõ PCA với phân tích nhân tố (Factor Analysis – FA): PCA tìm tổ hợp tuyến tính tối đa hóa phương sai dữ liệu, trong khi FA giả định tồn tại các nhân tố tiềm ẩn (latent factors) sinh ra các biến quan sát được và ước lượng cấu trúc đó. Ngoài ra, cần nhớ công thức tổng phương sai bằng tổng các trị riêng, và mỗi trị riêng chính là phương sai của thành phần chính tương ứng. Trong thực hành, các thư viện phổ biến như scikit-learn trong Python cung cấp hàm PCA với tham số n_components cho phép chọn số thành phần theo số lượng cố định hoặc theo tỷ lệ phương sai tích lũy (ví dụ n_components=0.95); trong R, hàm prcomp() và princomp() là hai cách tiếp cận thường gặp. Lưu ý rằng princomp sử dụng ma trận hiệp phương sai và yêu cầu dữ liệu đã được chuẩn hóa, trong khi prcomp chấp nhận đối số scale=TRUE để tự chuẩn hóa. Đối với dữ liệu chuỗi thời gian tài chính có tính chu kỳ và dễ có phương sai thay đổi theo thời gian, nên cân nhắc các biến thể như Kernel PCA, Robust PCA (chịu nhiễu tốt hơn) hoặc Dynamic PCA trước khi áp dụng trực tiếp PCA chuẩn.

Lưu ý: Nội dung trên mang tính tham khảo chuyên môn, không thay thế tư vấn của chuyên gia thống kê hoặc chuyên gia phân tích dữ liệu trong từng bối cảnh nghiệp vụ cụ thể.

Kiến thức này có trong đề thi tuyển dụng ngân hàng

Luyện thi với đề mô phỏng thực tế, chấm điểm tức thì

A
Agribank

Miễn trừ trách nhiệm: Nội dung câu hỏi trên thithu.com chỉ mang tính chất luyện tập và tham khảo, không đại diện cho đề thi chính thức của bất kỳ tổ chức nào. Chúng tôi không chịu trách nhiệm về kết quả thi thực tế của người dùng.