Phân tích số liệu là chỗ nhiều nghiên cứu sinh và bác sĩ làm luận văn thấy khó nhất: không phải vì thiếu số liệu, mà vì không chắc nên dùng test thống kê nào cho câu hỏi của mình. Bài này trình bày một quy trình rõ ràng để đi từ câu hỏi nghiên cứu đến kết quả có thể báo cáo, cùng một bảng tra nhanh câu hỏi ứng với test chuẩn.
Đây là hướng dẫn công cụ nghiên cứu mang tính giáo dục; việc chọn test và diễn giải kết quả cuối cùng vẫn thuộc về người làm nghiên cứu.
Phân tích số liệu nghiên cứu thực chất là gì
Phân tích số liệu không phải là bấm nút cho ra một con số p. Nó là một chuỗi quyết định: câu hỏi của bạn muốn so sánh, tìm mối liên quan, hay dự đoán? Mỗi biến trong dữ liệu thuộc loại nào? Test bạn định dùng có giả định gì, và dữ liệu của bạn có thỏa các giả định đó không?
Khi trả lời được những câu này theo thứ tự, việc chọn test trở nên gần như hiển nhiên, vì mỗi loại câu hỏi kết hợp với mỗi loại dữ liệu chỉ dẫn tới một nhóm nhỏ test phù hợp. Phần lớn lỗi thống kê trong luận văn không nằm ở phép tính mà nằm ở bước chọn test sai ngay từ đầu.
Quy trình phân tích theo từng bước
Quy trình dưới đây là thực hành chuẩn, áp dụng được cho hầu hết đề tài định lượng.
Bước 1: Nêu câu hỏi nghiên cứu và giả thuyết
Viết câu hỏi ra thành một câu rõ ràng, kèm giả thuyết không (H0) và giả thuyết đối (H1). Câu hỏi quyết định bản chất phép phân tích: bạn đang so sánh giữa các nhóm, đo mối liên quan giữa các biến, hay dự đoán một kết cục?
Bước 2: Xác định loại dữ liệu của từng biến
Với mỗi biến, xác định nó là biến định tính (phân loại, ví dụ nhóm bệnh/nhóm chứng, giới tính) hay biến định lượng (liên tục, ví dụ huyết áp, tuổi). Loại dữ liệu của biến kết cục và biến độc lập là yếu tố then chốt để chọn test.
Bước 3: Chọn test khớp với câu hỏi và loại dữ liệu
Ghép loại câu hỏi (so sánh, liên quan, dự đoán) với loại dữ liệu để chọn test. Bảng ở phần sau tóm tắt các ghép nối chuẩn theo sách giáo khoa.
Bước 4: Kiểm tra các giả định của test
Mỗi test có giả định riêng (ví dụ phân phối, phương sai, tính độc lập của quan sát). Kiểm tra giả định trước khi tin vào kết quả; nếu giả định bị vi phạm, cân nhắc test thay thế phù hợp.
Bước 5: Chạy test và báo cáo kèm thước đo độ bất định
Chạy test rồi báo cáo kết quả cùng thước đo độ bất định của nó (ví dụ khoảng tin cậy), không chỉ nêu một con số đơn lẻ. Trình bày đủ để người đọc đánh giá được độ mạnh của bằng chứng.
Bước 6: Giữ phân tích có thể tái lập bằng cách lưu code
Lưu lại toàn bộ code phân tích. Nhờ đó bất kỳ ai chạy lại đúng code sẽ ra đúng kết quả, và bạn tự kiểm chứng lại được từng bước khi phản biện yêu cầu.
Bảng tra: câu hỏi nghiên cứu ứng với test chuẩn
Bảng dưới đây là các ghép nối chuẩn theo sách giáo khoa. Đây là kiến thức cơ bản, dùng để định hướng nhanh; test cụ thể vẫn phụ thuộc vào giả định và thiết kế của bạn.
| Câu hỏi nghiên cứu | Loại dữ liệu điển hình | Test chuẩn |
|---|---|---|
| So sánh trung bình của hai nhóm | Kết cục liên tục, một biến nhóm hai mức | t-test |
| So sánh trung bình của từ ba nhóm trở lên | Kết cục liên tục, một biến nhóm nhiều mức | ANOVA |
| Mối liên quan giữa hai biến định tính | Hai biến phân loại | Chi-square (khi bình phương) |
| Quan hệ giữa hai biến liên tục | Hai biến liên tục | Tương quan (correlation) |
| Dự đoán một kết cục từ các biến dự báo | Một hay nhiều biến dự báo | Hồi quy (regression) |
| Dữ liệu thời gian đến biến cố | Thời gian theo dõi và tình trạng biến cố | Phân tích sống còn (survival analysis) |
Những lỗi thường gặp
- Chọn test trước khi xác định loại dữ liệu, dẫn tới dùng test cho biến liên tục lên biến phân loại hoặc ngược lại.
- Bỏ qua bước kiểm tra giả định rồi báo cáo kết quả như thể luôn hợp lệ.
- Dùng nhiều t-test rời rạc để so sánh từ ba nhóm trở lên thay vì dùng ANOVA cho câu hỏi đó.
- Chỉ báo cáo con số p mà không kèm thước đo độ bất định để người đọc đánh giá độ mạnh của bằng chứng.
- Không lưu code, khiến phân tích không thể tái lập khi bị yêu cầu chạy lại.
- Nhầm mối liên quan (tương quan) với quan hệ nhân quả khi diễn giải kết quả.
Phở giúp được gì
Nếu bạn đã chọn được test nhưng chưa có SPSS hay R trong máy, Phở có thể chạy phần tính toán giúp bạn. Bạn cung cấp dữ liệu hoặc chọn test; Phở kiểm tra yêu cầu theo một danh sách gói R được phép, chạy R trong một sandbox cách ly, rồi trả về cả code R lẫn kết quả. Vì có code đi kèm, phân tích của bạn tái lập được và bạn kiểm chứng lại được từng bước.
Phở không thay thế phán đoán của nhà thống kê và không tự bảo đảm test được chọn là “đúng” cho bạn. Việc chọn test phù hợp và diễn giải kết quả cuối cùng vẫn thuộc về người làm nghiên cứu. Phở chỉ chạy đúng phân tích được yêu cầu và hiển thị code cùng kết quả để bạn xem xét.
Tài liệu tham khảo
- The R Project for Statistical Computing: (source)(https://www.r-project.org/)