Bỏ qua điều hướng

Phương pháp bootstrap là gì?

Bootstrap Method Thống kê & Mô hình

Phương pháp bootstrap

Phương pháp bootstrap (hay còn gọi là phương pháp "tự lấy mẫu lại") là một kỹ thuật thống kê và tính toán được nhà thống kê học Bradley Efron giới thiệu vào năm 1979. Ý dụng cốt lõi của phương pháp này là sử dụng chính dữ liệu mẫu gốc để mô phỏng lại quá trình lấy mẫu nhiều lần, từ đó ước tính phân phối lấy mẫu của một thống kê (statistic) khi không thể hoặc rất khó xác định được phân phối lý thuyết của nó thông qua các công thức toán học cổ điển.

Theo đó, từ một tập dữ liệu mẫu gốc có kích thước n, bootstrap sẽ tạo ra rất nhiều (thường từ 1.000 đến 10.000) mẫu "giả" có cùng kích thước n bằng cách lấy mẫu có hoàn lại (sampling with replacement). Vì lấy có hoàn lại nên một quan sát có thể xuất hiện nhiều lần trong mẫu bootstrap, trong khi một số quan sát khác lại vắng mặt — điều này mô phỏng sự biến thiên ngẫu nhiên vốn có của quá trình lấy mẫu. Trên mỗi mẫu bootstrap, người ta tính lại giá trị thống kê quan tâm (trung bình, phương sai, hệ số hồi quy, hệ số VaR, v.v.), rồi tổng hợp phân phối của hàng nghìn giá trị này để suy ra đặc trưng mong muốn: sai số chuẩn, khoảng tin cậy, độ lệch (bias), hoặc giá trị p.

Phân loại các dạng bootstrap phổ biến

Bootstrap không tham số (non-parametric bootstrap): Đây là dạng phổ biến nhất, không đặt ra bất kỳ giả định nào về dạng phân phối của dữ liệu gốc. Mẫu bootstrap được rút trực tiếp từ dữ liệu quan sát với xác suất đều cho mỗi phần tử. Dạng này phù hợp với hầu hết các bài toán thống kê mô tả và suy luận trong ngân hàng như ước lượng khoảng tin cậy cho tỷ lệ nợ xấu, mức sinh lời trung bình của danh mục cho vay, hay sai số chuẩn của hệ số rủi ro tín dụng (PD, LGD).

Bootstrap tham số (parametric bootstrap): Thay vì lấy mẫu trực tiếp từ dữ liệu, người ta giả định dữ liệu tuân theo một phân phối lý thuyết đã biết (ví dụ: chuẩn, log-normal, Student-t), ước lượng tham số của phân phối đó từ dữ liệu gốc, rồi sinh ra các mẫu bootstrap từ phân phối đã được tham số hóa. Dạng này thường được dùng trong mô hình hóa rủi ro tài chính, chẳng hạn như mô phỏng lợi nhuận danh mục theo phân phối chuẩn đa biến.

Bootstrap khối (block bootstrap): Được thiết kế cho dữ liệu chuỗi thời gian (time series) có tính tự tương quan. Thay vì lấy mẫu từng quan sát đơn lẻ, người ta lấy mẫu theo từng khối liên tiếp (ví dụ: khối 5 phiên giao dịch) để bảo toàn cấu trúc phụ thuộc giữa các quan sát gần nhau. Hai biến thể phổ biến là Moving Block Bootstrap (Künsch, 1989) và Stationary Bootstrap (Politis & Romano, 1994). Trong ngân hàng, kỹ thuật này thường được dùng để ước lượng khoảng tin cậy của chỉ số VaR hoặc Expected Shortfall từ chuỗi lợi nhuận hàng ngày.

Bootstrap dư (residual bootstrap): Áp dụng cho mô hình hồi quy. Mô hình được ước lượng trên dữ liệu gốc, sau đó phần dư (residuals) được lấy mẫu có hoàn lại để tái tạo biến phụ thuộc mới, rồi mô hình được ước lại trên dữ liệu tái tạo. Dạng này rất phù hợp khi kiểm định tính đáng tin cậy của các hệ số trong mô hình điểm tín dụng (credit scoring).

Ứng dụng trong thống kê và mô hình tài chính – ngân hàng

Ước lượng khoảng tin cậy khi không có công thức đóng: Nhiều thống kê phức tạp trong ngân hàng — chẳng hạn như hệ số Gini đo mức độ tập trung danh mục cho vay, hoặc tỷ lệ VaR của danh mục có công cụ phái sinh — không có phân phối lý thuyết đã biết. Khoảng tin cậy percentile bootstrap (lấy khoảng từ phân vị 2,5% đến phân vị 97,5% của phân phối bootstrap) cung cấp một cách ước lượng mạnh mẽ và linh hoạt.

Kiểm định giả thuyết: Phương pháp bootstrap cho phép tính giá trị p một cách thực nghiệm thông qua việc so sánh thống kê quan sát được với phân phối bootstrap dưới giả thuyết không (null hypothesis). Ví dụ: kiểm định xem hệ số beta trong mô hình CAPM có thực sự khác 1 hay chỉ do sai số mẫu ngẫu nhiên.

Mô hình rủi ro tín dụng: Trong mô hình xác suất vỡ nợ (PD — Probability of Default), bootstrap được dùng để đánh giá sự ổn định của mô hình qua các mẫu khác nhau, hỗ trợ quá trình backtest và validation mô hình — một yêu cầu quan trọng trong khung quản trị rủi ro Basel II/III.

Mô phỏng danh mục: Ngân hàng có thể bootstrap từ chuỗi lợi nhuận lịch sử để tạo ra hàng nghìn kịch bản tương lai, phục vụ cho stress test hoặc tính toán phân bổ vốn kinh tế (economic capital).

Ưu điểm, hạn chế và lưu ý khi áp dụng

Ưu điểm nổi bật: Bootstrap không đòi hỏi giả định mạnh về phân phối của dữ liệu, có thể áp dụng cho các thống kê phức tạp mà không có công thức phân tích, đồng thời cung cấp ước lượng sai số chuẩn và khoảng tin cậy một cách trực quan. Phương pháp này cũng đặc biệt hữu ích khi cỡ mẫu nhỏ (small sample) — trường hợp rất phổ biến đối với dữ liệu vỡ nợ theo phân khúc khách hàng hoặc ngành nghề cụ thể.

Hạn chế cần lưu ý: Bootstrap dựa trên giả định rằng mẫu gốc đại diện cho quần thể — nếu mẫu bị sai lệch (biased sampling) thì mọi ước lượng bootstrap cũng sẽ bị sai lệch theo. Phương pháp này cũng đòi hỏi dung lượng tính toán lớn khi số lần lặp bootstrap cao, và có thể hoạt động kém hiệu quả đối với các thống kê nhạy cảm với giá trị ngoại lệ (outliers) hoặc với các bài toán có số chiều dữ liệu (dimensionality) rất cao. Ngoài ra, với dữ liệu chuỗi thời gian có cấu trúc phụ thuộc mạnh, bootstrap i.i.d. (độc lập, đồng nhất) cổ điển sẽ làm mất thông tin tự tương quan và cần thay bằng block bootstrap hoặc stationary bootstrap.

Lưu ý thực hành: Số lần lặp bootstrap nên được chọn đủ lớn (thường ≥ 1.000, tốt nhất ≥ 10.000) để đảm bảo tính ổn định của phân phối ước lượng. Khi xây dựng mô hình trong ngân hàng, kết quả bootstrap cần được đối chiếu với phương pháp phân tích truyền thống để kiểm tra tính hợp lý, đồng thời cần lập báo cáo minh bạch về loại bootstrap, số lần lặp và giả định được sử dụng.

Nội dung mang tính tham khảo chuyên môn, không thay thế tư vấn hoặc hướng dẫn chính thức từ chuyên gia thống kê, quant hoặc đơn vị quản trị rủi ro của tổ chức tín dụng.

Kiến thức này có trong đề thi tuyển dụng ngân hàng

Luyện thi với đề mô phỏng thực tế, chấm điểm tức thì

B
BIDV

Miễn trừ trách nhiệm: Nội dung câu hỏi trên thithu.com chỉ mang tính chất luyện tập và tham khảo, không đại diện cho đề thi chính thức của bất kỳ tổ chức nào. Chúng tôi không chịu trách nhiệm về kết quả thi thực tế của người dùng.