Bỏ qua tới nội dung

· Đội ngũ Phở

Cách phân tích số liệu nghiên cứu: chọn test thống kê đúng

Hướng dẫn cách phân tích số liệu nghiên cứu theo quy trình, chọn test thống kê phù hợp với câu hỏi và loại dữ liệu, kể cả khi không cần SPSS.

Cụm: Công cụ & phương pháp nghiên cứu
Trong bài này

Phân tích số liệu là chỗ nhiều nghiên cứu sinh và bác sĩ làm luận văn thấy khó nhất: không phải vì thiếu số liệu, mà vì không chắc nên dùng test thống kê nào cho câu hỏi của mình. Bài này trình bày một quy trình rõ ràng để đi từ câu hỏi nghiên cứu đến kết quả có thể báo cáo, cùng một bảng tra nhanh câu hỏi ứng với test chuẩn.

Đây là hướng dẫn công cụ nghiên cứu mang tính giáo dục; việc chọn test và diễn giải kết quả cuối cùng vẫn thuộc về người làm nghiên cứu.

Phân tích số liệu nghiên cứu thực chất là gì

Phân tích số liệu không phải là bấm nút cho ra một con số p. Nó là một chuỗi quyết định: câu hỏi của bạn muốn so sánh, tìm mối liên quan, hay dự đoán? Mỗi biến trong dữ liệu thuộc loại nào? Test bạn định dùng có giả định gì, và dữ liệu của bạn có thỏa các giả định đó không?

Khi trả lời được những câu này theo thứ tự, việc chọn test trở nên gần như hiển nhiên, vì mỗi loại câu hỏi kết hợp với mỗi loại dữ liệu chỉ dẫn tới một nhóm nhỏ test phù hợp. Phần lớn lỗi thống kê trong luận văn không nằm ở phép tính mà nằm ở bước chọn test sai ngay từ đầu.

Quy trình phân tích theo từng bước

Quy trình dưới đây là thực hành chuẩn, áp dụng được cho hầu hết đề tài định lượng.

Bước 1: Nêu câu hỏi nghiên cứu và giả thuyết

Viết câu hỏi ra thành một câu rõ ràng, kèm giả thuyết không (H0) và giả thuyết đối (H1). Câu hỏi quyết định bản chất phép phân tích: bạn đang so sánh giữa các nhóm, đo mối liên quan giữa các biến, hay dự đoán một kết cục?

Bước 2: Xác định loại dữ liệu của từng biến

Với mỗi biến, xác định nó là biến định tính (phân loại, ví dụ nhóm bệnh/nhóm chứng, giới tính) hay biến định lượng (liên tục, ví dụ huyết áp, tuổi). Loại dữ liệu của biến kết cục và biến độc lập là yếu tố then chốt để chọn test.

Bước 3: Chọn test khớp với câu hỏi và loại dữ liệu

Ghép loại câu hỏi (so sánh, liên quan, dự đoán) với loại dữ liệu để chọn test. Bảng ở phần sau tóm tắt các ghép nối chuẩn theo sách giáo khoa.

Bước 4: Kiểm tra các giả định của test

Mỗi test có giả định riêng (ví dụ phân phối, phương sai, tính độc lập của quan sát). Kiểm tra giả định trước khi tin vào kết quả; nếu giả định bị vi phạm, cân nhắc test thay thế phù hợp.

Bước 5: Chạy test và báo cáo kèm thước đo độ bất định

Chạy test rồi báo cáo kết quả cùng thước đo độ bất định của nó (ví dụ khoảng tin cậy), không chỉ nêu một con số đơn lẻ. Trình bày đủ để người đọc đánh giá được độ mạnh của bằng chứng.

Bước 6: Giữ phân tích có thể tái lập bằng cách lưu code

Lưu lại toàn bộ code phân tích. Nhờ đó bất kỳ ai chạy lại đúng code sẽ ra đúng kết quả, và bạn tự kiểm chứng lại được từng bước khi phản biện yêu cầu.

Bảng tra: câu hỏi nghiên cứu ứng với test chuẩn

Bảng dưới đây là các ghép nối chuẩn theo sách giáo khoa. Đây là kiến thức cơ bản, dùng để định hướng nhanh; test cụ thể vẫn phụ thuộc vào giả định và thiết kế của bạn.

Câu hỏi nghiên cứuLoại dữ liệu điển hìnhTest chuẩn
So sánh trung bình của hai nhómKết cục liên tục, một biến nhóm hai mứct-test
So sánh trung bình của từ ba nhóm trở lênKết cục liên tục, một biến nhóm nhiều mứcANOVA
Mối liên quan giữa hai biến định tínhHai biến phân loạiChi-square (khi bình phương)
Quan hệ giữa hai biến liên tụcHai biến liên tụcTương quan (correlation)
Dự đoán một kết cục từ các biến dự báoMột hay nhiều biến dự báoHồi quy (regression)
Dữ liệu thời gian đến biến cốThời gian theo dõi và tình trạng biến cốPhân tích sống còn (survival analysis)

Những lỗi thường gặp

  • Chọn test trước khi xác định loại dữ liệu, dẫn tới dùng test cho biến liên tục lên biến phân loại hoặc ngược lại.
  • Bỏ qua bước kiểm tra giả định rồi báo cáo kết quả như thể luôn hợp lệ.
  • Dùng nhiều t-test rời rạc để so sánh từ ba nhóm trở lên thay vì dùng ANOVA cho câu hỏi đó.
  • Chỉ báo cáo con số p mà không kèm thước đo độ bất định để người đọc đánh giá độ mạnh của bằng chứng.
  • Không lưu code, khiến phân tích không thể tái lập khi bị yêu cầu chạy lại.
  • Nhầm mối liên quan (tương quan) với quan hệ nhân quả khi diễn giải kết quả.

Phở giúp được gì

Nếu bạn đã chọn được test nhưng chưa có SPSS hay R trong máy, Phở có thể chạy phần tính toán giúp bạn. Bạn cung cấp dữ liệu hoặc chọn test; Phở kiểm tra yêu cầu theo một danh sách gói R được phép, chạy R trong một sandbox cách ly, rồi trả về cả code R lẫn kết quả. Vì có code đi kèm, phân tích của bạn tái lập được và bạn kiểm chứng lại được từng bước.

Phở không thay thế phán đoán của nhà thống kê và không tự bảo đảm test được chọn là “đúng” cho bạn. Việc chọn test phù hợp và diễn giải kết quả cuối cùng vẫn thuộc về người làm nghiên cứu. Phở chỉ chạy đúng phân tích được yêu cầu và hiển thị code cùng kết quả để bạn xem xét.

Tài liệu tham khảo

Câu hỏi thường gặp

Phân tích số liệu nghiên cứu gồm những bước nào?

Sáu bước: nêu câu hỏi và giả thuyết, xác định loại dữ liệu của từng biến, chọn test khớp với câu hỏi và loại dữ liệu, kiểm tra giả định của test, chạy test và báo cáo kết quả kèm thước đo độ bất định, rồi lưu lại code để tái lập.

So sánh trung bình hai nhóm thì dùng test nào?

So sánh trung bình của hai nhóm dùng t-test. Nếu có từ ba nhóm trở lên thì dùng ANOVA.

Có thể phân tích thống kê mà không cần cài SPSS hay R không?

Có. Phở chạy phân tích trong sandbox R cách ly, kiểm tra yêu cầu theo danh sách gói R được phép, rồi trả về cả code R lẫn kết quả nên bạn không cần cài SPSS hay R tại máy.

Vì sao phải lưu lại code phân tích?

Lưu code giúp phân tích có thể tái lập: người khác chạy lại đúng code sẽ ra đúng kết quả, và bạn kiểm chứng lại được từng bước khi bảo vệ luận văn.

Đọc tiếp