Xác suất-Thống kê Y học

Xác suất-Thống kê Y học Giảng dạy, nghiên cứu Xác suất Thống kê y học.

Bộ đề trắc nghiệm về One-Sample t test theo kết quả SPSSTS. Đào Hồng NamCâu 1. Dựa vào bảng One-Sample Statistics, một b...
20/08/2026

Bộ đề trắc nghiệm về One-Sample t test theo kết quả SPSS
TS. Đào Hồng Nam

Câu 1. Dựa vào bảng One-Sample Statistics, một bác sĩ muốn kiểm định xem trung bình Cholesterol của nhóm bệnh nhân có khác giá trị tham chiếu 200 hay không. Cặp giả thuyết phù hợp nhất là:
A. H₀: μ > 200; H₁: μ ≤ 200.
B. H₀: μ = 200; H₁: μ ≠ 200.
C. H₀: μ < 200; H₁: μ ≥ 200.
D. H₀: μ = 229,32; H₁: μ ≠ 229,32.
Câu 2. Dựa vào bảng One-Sample Test, với t = 14,246; df = 269 và Sig. (2-tailed) < 0,001, kết luận nào phù hợp nhất?
A. Chưa đủ bằng chứng để bác bỏ H₀: μ = 200.
B. Trung bình Cholesterol của quần thể bằng chính xác 229,32.
C. Có bằng chứng thống kê cho thấy trung bình Cholesterol khác 200.
D. 95% bệnh nhân có Cholesterol lớn hơn 200.
Câu 3. Dựa vào bảng One-Sample Statistics, biết trung bình Cholesterol là 229,32 và giá trị kiểm định là 200. Nếu bác sĩ quan tâm đến độ chênh lệch giữa trung bình quan sát và giá trị tham chiếu, giá trị nào cần được sử dụng?
A. 29,32.
B. 33,822.
C. 2,058.
D. 270.
Câu 4. Dựa vào bảng One-Sample Test, Mean Difference = 29,322. Nếu giá trị kiểm định là 200, trung bình mẫu được suy ra là:
A. 170,678.
B. 202,058.
C. 229,322.
D. 258,644.
Câu 5. Dựa vào bảng One-Sample Statistics, SD = 33,822 và N = 270. Sai số chuẩn của trung bình được tính theo công thức SE = SD/√N. Giá trị nào phù hợp nhất với kết quả trong bảng?
A. 0,125.
B. 1,254.
C. 2,058.
D. 33,822.
Câu 6. Dựa vào bảng One-Sample Test, KTC 95% của Mean Difference là 25,27 đến 33,37. Cách diễn giải nào đúng nhất?
A. 95% bệnh nhân có độ chênh lệch từ 25,27 đến 33,37.
B. Chênh lệch giữa trung bình Cholesterol quần thể và giá trị tham chiếu 200 được ước lượng nằm trong khoảng 25,27–33,37 với độ tin cậy 95%.
C. 95% giá trị Cholesterol của quần thể nằm trong khoảng 25,27–33,37.
D. Trung bình Cholesterol của mẫu nằm trong khoảng 25,27–33,37.
Câu 7. Dựa vào bảng One-Sample Test, KTC 95% của Mean Difference không chứa 0. Điều này có ý nghĩa gì đối với kiểm định hai phía ở mức 5%?
A. Có bằng chứng về sự khác biệt giữa trung bình và giá trị kiểm định.
B. Chứng minh mọi cá thể đều khác giá trị 200.
C. Chứng minh độ lệch chuẩn bằng 0.
D. Chứng minh dữ liệu phân phối chuẩn.
Câu 8. Dựa vào bảng Descriptives, KTC 95% của Mean Cholesterol là 225,27–233,37. Nếu so với giá trị tham chiếu 200, nhận định nào phù hợp nhất?
A. Khoảng tin cậy chứa 200 nên không có khác biệt.
B. Trung bình mẫu chắc chắn bằng 200.
C. Toàn bộ KTC nằm trên 200, phù hợp với kết luận trung bình Cholesterol cao hơn 200.
D. 95% bệnh nhân có Cholesterol từ 225,27 đến 233,37.
Câu 9. Dựa vào bảng One-Sample Test, df = 269. Cỡ mẫu của nghiên cứu là bao nhiêu?
A. 268.
B. 269.
C. 270.
D. 271.
Câu 10. Dựa vào bảng One-Sample Statistics, nếu tính t theo công thức t = (x̄ − μ₀)/SE, với x̄ = 229,32; μ₀ = 200 và SE = 2,058, giá trị nào gần đúng nhất?
A. 0,87.
B. 14,25.
C. 29,32.
D. 65,49.
Câu 11. Dựa vào bảng Tests of Normality, Shapiro–Wilk có Sig. = 0,909. Kết luận nào phù hợp nhất trước khi thực hiện kiểm định t một mẫu?
A. Có bằng chứng dữ liệu không phân phối chuẩn.
B. Chưa có bằng chứng để bác bỏ giả thuyết dữ liệu tuân theo phân phối chuẩn.
C. Chứng minh trung bình Cholesterol bằng 200.
D. Chứng minh không có giá trị ngoại lai.
Câu 12. Dựa vào biểu đồ Histogram of Cholesterol, phân bố Cholesterol tập trung chủ yếu quanh vùng trung tâm và không thể hiện sự lệch quá nghiêm trọng. Thông tin này có vai trò gì?
A. Hỗ trợ việc xem xét giả định phân phối của dữ liệu khi sử dụng kiểm định t.
B. Chứng minh H₀ đúng.
C. Xác định trực tiếp p-value của kiểm định t.
D. Xác định trực tiếp độ lớn hiệu ứng.
Câu 13. Dựa vào biểu đồ Normal Q-Q Plot of Cholesterol, phần lớn các điểm quan sát nằm tương đối gần đường tham chiếu. Cách diễn giải phù hợp nhất là:
A. Trung bình Cholesterol chắc chắn bằng 229,32.
B. Dữ liệu có sự phù hợp tương đối với phân phối chuẩn.
C. Không tồn tại bất kỳ giá trị ngoại lai nào.
D. 95% số quan sát nằm trên đường thẳng.
Câu 14. Dựa vào biểu đồ Boxplot of Cholesterol, một số quan sát nằm xa phần lớn dữ liệu. Bác sĩ nên làm gì trước khi quyết định loại bỏ các quan sát này?
A. Loại ngay tất cả các quan sát nằm ngoài hộp.
B. Thay chúng bằng trung bình 229,32.
C. Kiểm tra nguồn gốc, tính hợp lệ và ảnh hưởng của các quan sát trước khi xử lý.
D. Kết luận ngay rằng kiểm định t không thể sử dụng.
Câu 15. Dựa vào bảng One-Sample Effect Sizes, Cohen’s d = 0,867. Ý nghĩa phù hợp nhất là:
A. Trung bình Cholesterol cao hơn giá trị kiểm định một lượng tương đương khoảng 0,87 độ lệch chuẩn.
B. Có 86,7% bệnh nhân có Cholesterol cao hơn 200.
C. p-value của kiểm định bằng 0,867.
D. Khoảng cách giữa hai trung bình là 0,867 mg/dL.
Câu 16. Dựa vào bảng One-Sample Effect Sizes, Cohen’s d = 0,867 và Hedges’ correction = 0,865. Vì sao hai giá trị này gần nhau?
A. Hai chỉ số đều chính là p-value của kiểm định t.
B. Hedges’ correction là một phiên bản hiệu chỉnh của Cohen’s d và với cỡ mẫu này mức hiệu chỉnh nhỏ.
C. Cả hai đều được tính trực tiếp từ trung vị.
D. Vì độ lệch chuẩn bằng 1.
Câu 17. Một bác sĩ dựa vào kết quả One-Sample Test có p < 0,001 và nói: “Kết quả này chứng minh sự khác biệt có ý nghĩa lâm sàng rất lớn”. Nhận định nào phù hợp nhất?
A. Đúng, vì p càng nhỏ thì hiệu ứng càng lớn.
B. Đúng, vì mọi kết quả có p < 0,001 đều có ý nghĩa lâm sàng.
C. Sai, vì p-value không trực tiếp đo độ lớn hiệu ứng hay ý nghĩa lâm sàng.
D. Sai, vì kiểm định t không thể đánh giá sự khác biệt.
Câu 18. Dựa vào bảng One-Sample Test, trung bình Cholesterol là 229,32 và Mean Difference = 29,322. Nếu giá trị tham chiếu được thay từ 200 xuống 220 nhưng giữ nguyên dữ liệu, điều gì chắc chắn xảy ra với Mean Difference?
A. Tăng lên 49,322.
B. Giảm xuống 9,322.
C. Không thay đổi.
D. Bằng 220.
Câu 19. Một bác sĩ muốn kiểm định giả thuyết có hướng rằng trung bình Cholesterol cao hơn 200, thay vì chỉ kiểm định “khác 200”. Cách đặt giả thuyết phù hợp nhất là:
A. H₀: μ = 200; H₁: μ > 200.
B. H₀: μ > 200; H₁: μ = 200.
C. H₀: μ < 200; H₁: μ ≥ 200.
D. H₀: μ = 229,32; H₁: μ > 229,32.
Câu 20. Dựa trên các bảng One-Sample Statistics, One-Sample Test, Tests of Normality, Descriptives, One-Sample Effect Sizes và các biểu đồ Histogram of Cholesterol, Boxplot of Cholesterol, Normal Q-Q Plot of Cholesterol, kết luận nào đầy đủ và phù hợp nhất?
A. Cholesterol chắc chắn cao ở tất cả bệnh nhân và nguyên nhân là bệnh lý nền.
B. Do có một số điểm khác biệt trên Boxplot nên không thể sử dụng kiểm định t.
C. Trung bình Cholesterol là 229,32; dữ liệu không cho thấy bằng chứng rõ về vi phạm giả định chuẩn; kiểm định t một mẫu cho thấy trung bình khác 200 có ý nghĩa thống kê, với chênh lệch 29,322 và Cohen’s d = 0,867.
D. Shapiro–Wilk p = 0,909 chứng minh trung bình Cholesterol của quần thể bằng 229,32.

20/08/2026

So sánh hai khoảng tin cậy giao nhau trong Paired t-test: Có đúng về mặt thống kê?
TS. Đào Hồng Nam

Trong thực hành phân tích số liệu y khoa, kiểm định t bắt cặp (Paired t-test) là phương pháp chuẩn mực để so sánh trung bình của hai quan sát trên cùng một nhóm đối tượng trước và sau can thiệp. Nhưng khi thu thập dữ liệu thứ cấp hoặc đọc báo cáo y văn, nhà nghiên cứu thường gặp tình huống bài toán không cung cấp dữ liệu thô từng cặp để tính độ lệch chuẩn của hiệu số (s_d), mà chỉ báo cáo trung bình và độ lệch chuẩn riêng biệt của từng thời điểm. Trong bối cảnh đó, một thắc mắc phương pháp luận phổ biến đặt ra: Liệu nhà nghiên cứu có thể dựa vào việc tính khoảng tin cậy 95% của từng nhóm rồi so sánh mức độ chồng lấp (giao nhau) giữa hai khoảng tin cậy này để đưa ra kết luận về sự khác biệt có ý nghĩa thống kê hay không?
Sử dụng KTC giao nhau là một sai sót phương pháp luận rất phổ biến trong phân tích số liệu y học!
Cách làm so sánh sự giao nhau (chồng lấp - overlap) của hai khoảng tin cậy 95% độc lập trong trường hợp dữ liệu bắt cặp là KHÔNG ĐÚNG về mặt toán thống kê, và có thể dẫn đến kết luận sai lệch nghiêm trọng.
Lý do thứ nhất nằm ở bản chất của dữ liệu bắt cặp. Điểm cốt lõi của phép kiểm t bắt cặp là hai số liệu trước và sau được đo trên cùng một đối tượng, do đó chúng có tương quan với nhau (correlation, ký hiệu là r).
Độ lệch chuẩn của hiệu số s_d phụ thuộc chặt chẽ vào hệ số tương quan này theo công thức:
s_d = √(s₁² + s₂² - 2 × r × s₁ × s₂).
Khi chỉ có trung bình và độ lệch chuẩn riêng lẻ của từng nhóm thì hoàn toàn không biết được giá trị r. Nếu bỏ qua r, ta đã vô tình coi hai nhóm này là độc lập.
Lý do thứ hai nằm ở nguyên lý của khoảng tin cậy. Việc hai khoảng tin cậy 95% độc lập chồng lấp lên nhau không đồng nghĩa với việc sự khác biệt giữa hai trung bình không có ý nghĩa thống kê. Trên thực tế, ngay cả đối với hai nhóm độc lập, hai khoảng tin cậy 95% vẫn có thể giao nhau một khoảng nhỏ mà mức ý nghĩa p vẫn nhỏ hơn 0,05. Đối với dữ liệu bắt cặp, khi tương quan r giữa trước và sau là tương quan dương (thường rất cao trong y khoa), độ biến thiên của hiệu số s_d sẽ giảm đi đáng kể, giúp tăng sức mạnh kiểm định. Nếu dùng quy tắc chồng lấp khoảng tin cậy độc lập, sẽ phạm sai lầm bảo thủ (nguy cơ bác bỏ nhầm một sự khác biệt thực sự có ý nghĩa lâm sàng - lỗi Loại II).
Do đó, nếu đề bài hoặc báo cáo không cho dữ liệu gốc để tính s_d hay không cho hệ số tương quan r, ta không thể thực hiện chính xác phép kiểm t bắt cặp hay tính khoảng tin cậy cho sự khác biệt trung bình (d_trung_bình ± t × s_d / √n). Giải pháp đúng đắn trong thực hành là quay lại truy xuất dữ liệu gốc từng cặp, hoặc báo cáo rõ hạn chế là thiếu thông tin độ lệch chuẩn của hiệu số nên không đủ điều kiện thực hiện kiểm định bắt cặp chuẩn xác.
Kết luận:
Tóm lại, không được dùng sự giao nhau của hai khoảng tin cậy độc lập để kết luận cho thiết kế bắt cặp vì cách này bỏ qua hệ số tương quan trước - sau, làm bóp méo sai số chuẩn và dễ dẫn đến kết luận sai về ý nghĩa thống kê.

Bộ 20 câu trắc nghiệm về kiểm định giả thuyết với biến định lượng theo kế t quả phân tích từ SPSSTS. Đào Hồng NamCâu 1. ...
19/08/2026

Bộ 20 câu trắc nghiệm về kiểm định giả thuyết với biến định lượng theo kế t quả phân tích từ SPSS
TS. Đào Hồng Nam

Câu 1. Dựa vào Bảng Group Statistics, một nghiên cứu so sánh cholesterol giữa nhóm Control và Disease, trong đó hai nhóm gồm những đối tượng khác nhau. Nếu mục tiêu là kiểm định sự khác biệt về trung bình cholesterol giữa hai nhóm, phép kiểm định phù hợp nhất là:
A. Paired-samples t-test
B. One-sample t-test
C. Mann–Whitney U test
D. Independent-samples t-test
Câu 2. Dựa vào Bảng Group Statistics, cholesterol trung bình của nhóm Disease cao hơn nhóm Control 31,45 đơn vị. Mức tăng tương đối của nhóm Disease so với nhóm Control xấp xỉ bao nhiêu?
A. 14,8%
B. 31,5%
C. 6,9%
D. 12,9%
Câu 3. Dựa vào Bảng Independent Samples Test, Levene's Test có p = 0,548. Với α = 0,05, nên xử lý giả định phương sai như thế nào?
A. Bác bỏ giả thuyết phương sai bằng nhau.
B. Không bác bỏ giả thuyết phương sai bằng nhau và đọc dòng “Equal variances assumed”.
C. Chuyển sang Mann–Whitney U test vì p > 0,05.
D. Không thể thực hiện t-test vì kích thước hai nhóm khác nhau.
Câu 4. Dựa vào Bảng Independent Samples Test, ở dòng “Equal variances assumed”, Mean Difference = −31,450 và Std. Error Difference = 3,679. Giá trị t tính từ hai đại lượng này gần nhất với:
A. −3,679
B. −6,450
C. −8,549
D. −31,450
Câu 5. Dựa vào Bảng Independent Samples Test, tại sao Mean Difference = −31,450 trong khi Mean cholesterol của nhóm Disease lại cao hơn nhóm Control?
A. Vì kiểm định t luôn cho kết quả âm khi p < 0,05.
B. Vì SD của nhóm Disease nhỏ hơn nhóm Control.
C. Vì cholesterol của nhóm Control thực tế cao hơn nhóm Disease.
D. Vì SPSS tính Mean Difference theo thứ tự Control − Disease.
Câu 6. Dựa vào Bảng Independent Samples Test, 95% CI của chênh lệch Control − Disease là −38,693 đến −24,207. Nếu biểu diễn chênh lệch theo chiều Disease − Control, 95% CI đúng là:
A. −38,693 đến −24,207
B. −24,207 đến 38,693
C. 24,207 đến 38,693
D. −38,693 đến 24,207
Câu 7. Dựa vào Bảng Independent Samples Test, kết quả nào dưới đây là bằng chứng trực tiếp nhất để kết luận cholesterol trung bình khác nhau giữa hai nhóm ở mức α = 0,05?
A. SD của hai nhóm gần nhau.
B. df = 268.
C. p < 0,001 và 95% CI của Mean Difference không chứa 0.
D. Cỡ mẫu tổng cộng là 270.
Câu 8. Dựa vào Bảng Independent Samples Test, SPSS hiển thị Sig. (2-tailed) = .000. Cách diễn giải nào đúng nhất trong báo cáo khoa học?
A. Xác suất giả thuyết không bằng 0%.
B. Xác suất hai nhóm bằng nhau là 0%.
C. p = 0 chính xác.
D. Nên báo cáo là p < 0,001, cho thấy bằng chứng rất mạnh chống lại giả thuyết không.
Câu 9. Dựa vào Bảng Independent Samples Test, với n₁ = 120 và n₂ = 150, tại sao df của dòng “Equal variances assumed” bằng 268?
A. Vì 120 + 150 − 2 = 268.
B. Vì 150 + 120 − 1 = 269.
C. Vì 150 − 120 = 30 rồi cộng thêm 238.
D. Vì df luôn bằng tổng số đối tượng trừ 2 trong mọi loại kiểm định t.
Câu 10. Dựa vào Bảng Group Statistics và Bảng Independent Samples Test, cách báo cáo nào phù hợp nhất với kết quả nghiên cứu?
A. Cholesterol nhóm Disease cao hơn Control 31,45 đơn vị, nhưng chưa có bằng chứng thống kê.
B. Cholesterol nhóm Disease cao hơn Control 31,45 đơn vị, 95% CI từ 24,207 đến 38,693, p < 0,001.
C. Cholesterol nhóm Control thấp hơn Disease vì Mean Difference = −31,450, p = 0,000.
D. Cholesterol hai nhóm khác nhau vì SD của hai nhóm gần bằng nhau.
Câu 11. Dựa vào Bảng Independent Samples Effect Sizes, Cohen's d = −1,047. Nếu chỉ xét độ lớn tuyệt đối của hiệu ứng, diễn giải phù hợp nhất là:
A. Hiệu ứng rất nhỏ vì d gần 0.
B. Hiệu ứng khoảng 1,05 độ lệch chuẩn, thuộc mức lớn.
C. Không thể diễn giải vì Cohen's d phải luôn dương.
D. Cohen's d = −1,047 nghĩa là p = −1,047.
Câu 12. Dựa vào Bảng Independent Samples Effect Sizes, 95% CI của Cohen's d là −1,302 đến −0,790. Kết luận nào phù hợp nhất?
A. Hiệu ứng không có ý nghĩa vì khoảng tin cậy không chứa 1.
B. Không thể kết luận vì Cohen's d có dấu âm.
C. Độ lớn hiệu ứng khác 0 và giá trị tuyệt đối của hiệu ứng ước tính nằm khoảng 0,79–1,30 SD.
D. Khoảng này chính là 95% CI của Mean cholesterol nhóm Disease.
Câu 13. Dựa vào Bảng Independent Samples Effect Sizes, Cohen's d và Glass's delta khác nhau chủ yếu ở cách chuẩn hóa. Phát biểu nào đúng?
A. Cohen's d dùng SD gộp của hai nhóm, còn Glass's delta dùng SD của nhóm Control.
B. Cohen's d dùng Median, còn Glass's delta dùng Mean.
C. Cohen's d dùng p-value, còn Glass's delta dùng t-value.
D. Cohen's d chỉ dùng được khi hai nhóm có cùng cỡ mẫu.
Câu 14. Dựa vào Bảng Tests of Normality, Shapiro-Wilk có p = 0,594 ở Control và p = 0,577 ở Disease. Với α = 0,05, kết luận nào phù hợp nhất?
A. Bác bỏ giả thuyết phân phối chuẩn ở cả hai nhóm.
B. Chỉ nhóm Control có phân phối chuẩn.
C. Cả hai nhóm chắc chắn có phân phối chuẩn tuyệt đối.
D. Không có đủ bằng chứng để bác bỏ giả định phân phối chuẩn ở cả hai nhóm.
Câu 15. Dựa vào Bảng Tests of Normality và Bảng Independent Samples Test, kết quả nào hỗ trợ việc sử dụng independent-samples t-test?
A. Shapiro-Wilk p > 0,05 ở cả hai nhóm và Levene p > 0,05.
B. Shapiro-Wilk p < 0,05 ở cả hai nhóm và Levene p < 0,05.
C. Chỉ cần Mean của hai nhóm khác nhau.
D. Chỉ cần cỡ mẫu tổng cộng lớn hơn 100.
Câu 16. Dựa vào Bảng Descriptives, 95% CI của Mean cholesterol ở Control là 206,32–217,38, trong khi ở Disease là 238,52–248,08. Một bác sĩ nói: “Do hai CI không chồng lấp nên không cần thực hiện kiểm định t”. Đánh giá nào đúng nhất?
A. Đúng, CI của từng nhóm thay thế hoàn toàn kiểm định t.
B. Đúng, vì CI không chồng lấp luôn đồng nghĩa p = 0.
C. Sai; CI mô tả độ không chắc chắn của từng Mean, còn kết luận chính thức về sự khác biệt hai Mean cần dựa vào kiểm định so sánh hai nhóm.
D. Sai vì CI chỉ được dùng cho nghiên cứu có một nhóm.
Câu 17. Dựa vào Bảng Descriptives và Bảng Independent Samples Test, SD của Control = 30,576, SD của Disease = 29,597 và Levene p = 0,548. Kết luận nào phù hợp nhất?
A. Hai phương sai chắc chắn bằng nhau tuyệt đối.
B. Có bằng chứng phương sai Disease lớn hơn Control.
C. Không thể đánh giá phương sai từ kết quả này.
D. Độ phân tán của hai nhóm khá tương đồng và Levene không cho thấy bằng chứng có ý nghĩa về sự khác biệt phương sai.
Câu 18. Dựa vào Biểu đồ Boxplot và Bảng Descriptives, một số giá trị cholesterol được đánh dấu là các giá trị cực trị. Nên xử lý các giá trị này như thế nào trước khi quyết định loại khỏi phân tích?
A. Tự động loại tất cả các giá trị được đánh dấu trên boxplot.
B. Giữ hoặc loại tùy ý để p-value đạt < 0,05.
C. Kiểm tra tính hợp lý của dữ liệu và ảnh hưởng của các giá trị cực trị; không tự động loại chỉ vì chúng được đánh dấu trên boxplot.
D. Không cần kiểm tra vì t-test không bị ảnh hưởng bởi outlier.
Câu 19. Dựa vào Bảng Group Statistics, Bảng Independent Samples Test và Bảng Independent Samples Effect Sizes, phát biểu nào phản ánh đầy đủ nhất kết quả?
A. Nhóm Disease có cholesterol cao hơn Control, nhưng hiệu ứng nhỏ vì Cohen's d chỉ khoảng 1.
B. Có sự khác biệt có ý nghĩa thống kê, nhưng chưa thể đánh giá độ lớn hiệu ứng.
C. Nhóm Disease có cholesterol trung bình cao hơn Control 31,45 đơn vị, p < 0,001 và Cohen's d có độ lớn khoảng 1,05 SD, cho thấy hiệu ứng lớn.
D. Vì Cohen's d âm nên nhóm Disease có cholesterol thấp hơn Control.
Câu 20. Dựa vào Bảng Group Statistics, Bảng Independent Samples Test, Bảng Tests of Normality và Bảng Independent Samples Effect Sizes, cần viết kết luận cho bài báo. Phát biểu nào phù hợp nhất?
A. Ở 270 đối tượng, cholesterol trung bình ở nhóm Disease cao hơn nhóm Control 31,45 đơn vị; kiểm định t độc lập cho thấy sự khác biệt có ý nghĩa thống kê, t(268) = −8,549, p < 0,001, 95% CI của chênh lệch Control − Disease là −38,693 đến −24,207; Cohen's d = −1,047 cho thấy hiệu ứng lớn.
B. Cholesterol cao là nguyên nhân gây bệnh vì nhóm Disease có cholesterol cao hơn và p < 0,001.
C. Không có sự khác biệt vì hai nhóm đều có khoảng tin cậy 95%.
D. Không thể kết luận vì Cohen's d mang dấu âm.

19/08/2026

Biến kết cục bị "kịch trần" 32%: Dùng Hồi quy tuyến tính hay chuyển sang Hồi quy Tobit?
TS. Đào Hồng Nam

Trong nghiên cứu y khoa và khoa học sức khỏe, việc phân tích đa biến để xác định các yếu tố liên quan đến một biến kết cục định lượng là tiếp cận rất phổ biến. Tuy nhiên, trong thực hành xử lý dữ liệu, nhà nghiên cứu thường xuyên đối mặt với tình huống biến kết cục bị lệch phân phối nghiêm trọng và xuất hiện hiệu ứng trần (ceiling effect) do một tỷ lệ lớn đối tượng nghiên cứu tập trung ở mức điểm tối đa của công cụ đo.
Thực tế này đặt ra một nghi vấn lớn về mặt phương pháp luận: Khi nghiên cứu đạt cỡ mẫu khá lớn, liệu việc dựa vào Định lý Giới hạn Trung tâm để tiếp tục áp dụng mô hình Hồi quy tuyến tính đa biến cổ điển có còn đảm bảo tính vững chắc của kết quả phân tích, hay nhà nghiên cứu bắt buộc phải chuyển sang sử dụng mô hình Hồi quy Tobit đa biến? Việc lựa chọn mô hình hồi quy nào để vừa phản ánh trung thực bản chất dữ liệu, vừa tối ưu hóa độ chính xác của các ước lượng thống kê là một bài toán phương pháp cần được làm sáng tỏ.
Trường hợp nghiên cứu có cỡ mẫu 250 với biến kết cục định lượng bị lệch nghiêm trọng và xuất hiện hiệu ứng trần lên tới 32% thì việc dựa vào Định lý Giới hạn Trung tâm để áp dụng Hồi quy tuyến tính đa biến cổ điển là không phù hợp, mà Hồi quy Tobit đa biến mới là lựa chọn chuẩn xác về mặt lý thuyết toán thống kê.
Định lý Giới hạn Trung tâm giúp đảm bảo tính tiệm cận chuẩn cho các ước lượng trung bình khi cỡ mẫu đủ lớn, nhưng không thể khắc phục được bản chất tổn thất thông tin do hiệu ứng trần gây ra. Điểm số tối đa của thang đo thường chỉ là ngưỡng chặn trên của công cụ đo lường chứ chưa phản ánh hết mức độ thực sự của đối tượng. Khi gần một phần ba dữ liệu bị nén dồn tại mức trần, mô hình Hồi quy tuyến tính cổ điển sẽ vi phạm nghiêm trọng giả định về miền giá trị liên tục không bị giới hạn, dẫn đến hiện tượng suy giảm hệ số hồi quy. Kết quả là các hệ số β thu được từ hồi quy tuyến tính sẽ bị ước lượng thấp hơn giá trị thực tế, đồng thời làm giảm đáng kể độ nhạy trong việc phát hiện các yếu tố liên quan.
Hồi quy Tobit đa biến được thiết kế chuyên biệt để xử lý các biến số bị chặn trên hoặc chặn dưới. Mô hình này giả định tồn tại một biến ẩn liên tục phản ánh đúng trạng thái thực của đối tượng và sử dụng phương pháp Ước lượng Khả năng Tối đa để điều chỉnh sự sai lệch do nén điểm. Với tỷ lệ hiệu ứng trần đạt 32%, Hồi quy Tobit sẽ kiểm soát tốt hiện tượng lệch dồn điểm, cung cấp các ước lượng hệ số β và trị số p trung thực, chính xác hơn.
Phương án xử lý chuyên sâu và minh bạch nhất là sử dụng Hồi quy Tobit đa biến làm mô hình phân tích chính với ngưỡng chặn trên đặt tại giá trị điểm tối đa. Bên cạnh đó, việc thực hiện phân tích độ nhạy bằng cách chạy song song mô hình Hồi quy tuyến tính đa biến hoặc Hồi quy tuyến tính kết hợp kỹ thuật Bootstrapping sẽ giúp đối chiếu kết quả. Nếu cả hai mô hình đều chỉ ra sự đồng nhất về các yếu tố có ý nghĩa thống kê, kết luận của nghiên cứu sẽ đạt độ tin cậy và tính thuyết phục rất cao.
Tóm lại, đối với biến kết cục định lượng có tỷ lệ hiệu ứng trần cao đến 32%, không nên dựa vào Định lý Giới hạn Trung tâm để dùng Hồi quy tuyến tính cổ điển vì sẽ làm chệch và giảm ước lượng hệ số β. Phương án chuẩn xác nhất là áp dụng Hồi quy Tobit đa biến (chặn trên) làm phân tích chính, kết hợp Hồi quy tuyến tính trong phân tích độ nhạy để đảm bảo tính vững chắc cho kết luận nghiên cứu.

18/08/2026

Cách xử lý dữ liệu cỡ mẫu lớn nhưng bị lệch chuẩn do giá trị ngoại lai
TS. Đào Hồng Nam

Nếu dữ liệu có cỡ mẫu lớn nhưng phân phối bị lệch chuẩn do ảnh hưởng của các giá trị ngoại lai (outliers) thì trong trường hợp này nên xử lý thế nào cho đúng và thuyết phục?
Đây là một tình huống rất thực tế trong phân tích dữ liệu y học! Với cỡ mẫu lớn, Định lý Giới hạn Trung tâm giúp các phép kiểm tham số khá bền vững. Tuy nhiên, sự xuất hiện của các giá trị ngoại lai vẫn có thể kéo lệch Trung bình và làm tăng vọt Độ lệch chuẩn, khiến kết quả phân tích bị bóp méo.
Khi gặp trường hợp này, việc đầu tiên là kiểm tra bản chất của giá trị ngoại lai. Nếu ngoại lai do lỗi nhập liệu hoặc lỗi đo lường, bạn cần sửa lại hoặc xóa bỏ quan sát lỗi đó. Nếu ngoại lai đại diện cho biến đổi sinh học thực sự của bệnh nhân, bạn tuyệt đối không được tự ý xóa bỏ vì đây là thông tin lâm sàng có giá trị.
Để xử lý dữ liệu thực sự có ngoại lai, bạn có thể lựa chọn một trong ba hướng tiếp cận.
Hướng thứ nhất là giữ nguyên dữ liệu gốc và sử dụng các chỉ số cùng phép kiểm bền vững. Ở phần thống kê mô tả, bạn trình bày bằng Trung vị và Khoảng tứ phân vị thay vì Trung bình và Độ lệch chuẩn để tránh bị kéo lệch. Ở phần phân tích, bạn chuyển sang dùng phép kiểm phi tham số như Mann-Whitney U, Kruskal-Wallis hoặc các mô hình hồi quy bền vững.
Hướng thứ hai là thực hiện biến đổi dữ liệu. Bạn có thể áp dụng phép biến đổi Logarithm hay căn bậc hai để nén khoảng cách của các giá trị cực đoan, đưa phân phối về gần chuẩn hơn trước khi áp dụng phép kiểm tham số.
Hướng thứ ba là sử dụng kỹ thuật xử lý ngoại lai như cắt tỉa hoặc Winsorization. Cắt tỉa sẽ loại bỏ một tỷ lệ nhỏ các giá trị cực đoan ở hai đầu, trong khi Winsorization sẽ thay thế các giá trị ngoại lai bằng giá trị nằm ở ngưỡng bách phân vị chỉ định.
Cách làm chuẩn mực và minh bạch nhất trong các nghiên cứu y khoa là báo cáo chỉ số mô tả bằng Trung vị và Khoảng tứ phân vị, đồng thời thực hiện phân tích độ nhạy. Bạn tiến hành chạy phép kiểm trên cả bộ dữ liệu gốc lẫn bộ dữ liệu đã xử lý ngoại lai hoặc biến đổi log. Nếu cả hai cách tiếp cận đều đưa ra cùng một kết luận về mặt ý nghĩa thống kê, kết quả nghiên cứu của bạn sẽ hoàn toàn vững chắc và thuyết phục.

18/08/2026

Có cần kiểm định phân phối chuẩn cho cả biến chính lẫn biến phụ không?
TS. Đào Hồng Nam

Có nhiều ý kiến trái chiều về việc kiểm định phân phối chuẩn. Có quan điểm cho rằng chỉ cần áp dụng cho biến chính, còn các biến phụ thì không cần. Ngược lại, có ý kiến lại khẳng định mọi biến định lượng trong nghiên cứu, dù là biến chính hay biến phụ, đều bắt buộc phải kiểm định phân phối chuẩn. Bản chất vấn đề này ra sao và nên đưa ra luận điểm như thế nào
Bản chất của kiểm định phân phối chuẩn là lựa chọn phép kiểm thống kê phù hợp và chỉ số mô tả chính xác, chứ phân phối chuẩn không phải điều kiện bắt buộc mà mọi biến định lượng đều phải đáp ứng. Việc có cần kiểm định phân phối chuẩn cho một biến định lượng hay không không phụ thuộc vào vị trí biến chính hay biến phụ, mà dựa vào mục đích phân tích của biến đó trong nghiên cứu.
Đối với thống kê mô tả đặc điểm đối tượng, việc kiểm định phân phối chuẩn cần thực hiện cho tất cả các biến định lượng dù là biến chính hay biến phụ. Kết quả kiểm định sẽ quyết định đại lượng trình bày xu hướng trung tâm thích hợp, trong đó biến có phân phối chuẩn trình bày bằng Trung bình và Độ lệch chuẩn, còn biến không chuẩn trình bày bằng Trung vị và Khoảng tứ phân vị.
Đối với các phân tích so sánh hoặc tương quan đơn biến, việc kiểm định phân phối chuẩn cho cả biến chính lẫn biến phụ là bắt buộc nhằm lựa chọn đúng nhóm phép kiểm. Các biến thỏa mãn phân phối chuẩn sẽ áp dụng các phép kiểm tham số như kiểm định t, ANOVA hay tương quan Pearson, trong khi các biến vi phạm giả định chuẩn phải chuyển sang dùng các phép kiểm phi tham số tương ứng như Mann-Whitney U, Kruskal-Wallis hay tương quan Spearman để đảm bảo tính chính xác của trị số p.
Đối với phân tích đa biến như mô hình hồi quy tuyến tính, quan niệm bắt buộc mọi biến độc lập đầu vào phải có phân phối chuẩn là chưa chính xác về mặt lý thuyết toán thống kê. Mô hình hồi quy tuyến tính không yêu cầu các biến độc lập phải tuân theo phân phối chuẩn, mà giả định phân phối chuẩn áp dụng cho phần dư của mô hình hoặc biến phụ thuộc. Bên cạnh đó, khi nghiên cứu có kích thước mẫu đủ lớn, Định lý Giới hạn Trung tâm sẽ đảm bảo phân phối của trung bình mẫu tiệm cận về phân phối chuẩn, giúp các phép kiểm tham số vẫn duy trì độ bền vững ngay cả khi một số biến phụ có hiện tượng lệch nhẹ.

Bộ 20 câu trắc nghiệm từ kết quả phân tích của SPSSTS. Đào Hồng NamCâu 1. Dựa vào Mean BMI = 25,198 và Median BMI = 25,5...
18/08/2026

Bộ 20 câu trắc nghiệm từ kết quả phân tích của SPSS
TS. Đào Hồng Nam

Câu 1. Dựa vào Mean BMI = 25,198 và Median BMI = 25,550, nhận xét nào phù hợp nhất về vị trí trung tâm của phân phối BMI?
A. Mean lớn hơn Median nên phân phối chắc chắn lệch phải.
B. Mean và Median bằng nhau nên phân phối đối xứng.
C. Median lớn hơn Mean, phù hợp với dấu âm rất nhẹ của Skewness, cho thấy phân phối có xu hướng lệch trái rất nhẹ.
D. Không thể so sánh Mean và Median vì chúng được tính bằng hai phương pháp khác nhau.
Câu 2. Khoảng tin cậy 95% của Mean BMI là từ 24,450 đến 25,946. Độ rộng của khoảng tin cậy này xấp xỉ bằng bao nhiêu?
A. 1,496
B. 0,748
C. 2,896
D. 4,400
Câu 3. Nếu giữ nguyên mức độ biến thiên của dữ liệu nhưng tăng kích thước mẫu, độ rộng khoảng tin cậy 95% của Mean BMI có xu hướng thay đổi như thế nào?
A. Có xu hướng rộng hơn.
B. Không thay đổi.
C. Có xu hướng dịch sang giá trị nhỏ hơn.
D. Có xu hướng hẹp hơn.
Câu 4. Phương sai BMI là 8,386 và độ lệch chuẩn là 2,8958. Mối quan hệ nào dưới đây giải thích đúng hai đại lượng này?
A. Độ lệch chuẩn bằng phương sai nhân với 2.
B. Độ lệch chuẩn xấp xỉ bằng căn bậc hai của phương sai.
C. Phương sai bằng độ lệch chuẩn chia cho kích thước mẫu.
D. Độ lệch chuẩn bằng phương sai chia cho kích thước mẫu.
Câu 5. Một đối tượng có BMI = 30,0. So với Mean BMI = 25,198, giá trị này cách trung bình khoảng bao nhiêu độ lệch chuẩn?
A. Khoảng 0,83 SD.
B. Khoảng 1,00 SD.
C. Khoảng 1,66 SD.
D. Khoảng 2,90 SD.
Câu 6. Dựa trên Mean BMI = 25,198 và SD = 2,8958, một BMI bằng 18,9 có vị trí tương đối như thế nào so với trung bình?
A. Thấp hơn trung bình khoảng 2,18 độ lệch chuẩn.
B. Thấp hơn trung bình khoảng 1,00 độ lệch chuẩn.
C. Cao hơn trung bình khoảng 2,18 độ lệch chuẩn.
D. Cao hơn trung bình khoảng 1,66 độ lệch chuẩn.
Câu 7. Range của BMI là 14,1 trong khi IQR là 4,4. Cách diễn giải nào phù hợp nhất?
A. IQR phản ánh toàn bộ khoảng biến thiên từ nhỏ nhất đến lớn nhất.
B. Range phản ánh 50% số quan sát nằm ở trung tâm.
C. Range và IQR luôn phải có giá trị bằng nhau.
D. Range chịu ảnh hưởng bởi hai giá trị cực trị, còn IQR phản ánh độ phân tán của 50% quan sát trung tâm.
Câu 8. Nếu một đối tượng có BMI = 25,95, so với Mean BMI = 25,198 thì BMI của đối tượng này cao hơn trung bình khoảng bao nhiêu độ lệch chuẩn?
A. Khoảng 0,26 SD.
B. Khoảng 0,75 SD.
C. Khoảng 1,26 SD.
D. Khoảng 2,18 SD.
Câu 9. Skewness của BMI bằng -0,063. Kết hợp với Mean = 25,198 và Median = 25,550, nhận xét nào phù hợp nhất?
A. Phân phối lệch trái rất mạnh.
B. Phân phối lệch phải rất mạnh.
C. Phân phối gần đối xứng, chỉ có xu hướng lệch trái rất nhẹ.
D. Không thể đánh giá hình dạng phân phối từ các thông tin này.
Câu 10. Kurtosis của BMI bằng -0,180. Nếu xem xét cùng với các kết quả kiểm định tính chuẩn, diễn giải nào phù hợp nhất?
A. Giá trị Kurtosis âm chứng minh dữ liệu không có phân phối chuẩn.
B. Kurtosis âm cho thấy phân phối hơi thấp hơn mức nhọn của phân phối chuẩn, nhưng riêng chỉ số này không đủ để kết luận dữ liệu không chuẩn.
C. Kurtosis âm chứng minh dữ liệu lệch trái mạnh.
D. Kurtosis âm chứng minh Mean phải nhỏ hơn Median trong mọi trường hợp.
Câu 11. Trong kiểm định Shapiro-Wilk, p = 0,379. Với mức ý nghĩa α = 0,05, kết luận nào phù hợp nhất?
A. Bác bỏ giả thuyết dữ liệu có phân phối chuẩn.
B. Chứng minh dữ liệu có phân phối chuẩn tuyệt đối.
C. Chứng minh Mean bằng Median.
D. Không bác bỏ giả thuyết dữ liệu có phân phối chuẩn.
Câu 12. Kiểm định Kolmogorov-Smirnov cho BMI có p = 0,200. Với α = 0,05, cách diễn giải nào đúng?
A. Không có đủ bằng chứng để bác bỏ giả thuyết phân phối chuẩn.
B. Có bằng chứng mạnh rằng BMI không có phân phối chuẩn.
C. BMI chắc chắn có phương sai bằng 1.
D. BMI chắc chắn có Skewness bằng 0.
Câu 13. Hai kiểm định Kolmogorov-Smirnov và Shapiro-Wilk lần lượt cho p = 0,200 và p = 0,379. Kết luận phù hợp nhất là gì?
A. Hai kiểm định cho kết quả hoàn toàn giống nhau.
B. Có thể khẳng định BMI có phân phối chuẩn tuyệt đối.
C. Cả hai kiểm định đều không cung cấp bằng chứng đủ mạnh để bác bỏ tính chuẩn ở mức ý nghĩa 5%.
D. Cả hai kiểm định đều cho thấy dữ liệu lệch trái.
Câu 14. Standard Deviation của BMI là 2,8958 và Standard Error của Mean là 0,3739. Tỷ số SD/SE xấp xỉ bằng bao nhiêu?
A. 2,90
B. 4,40
C. 5,20
D. 7,74
Câu 15. Từ SD = 2,8958 và SE của Mean = 0,3739, nếu sử dụng công thức gần đúng (SE = SD/√n), kích thước mẫu ước tính gần nhất là bao nhiêu?
A. 30
B. 45
C. 60
D. 90
Câu 16. Dựa vào Mean = 25,198 và 95% CI = [24,450; 25,946], Mean nằm ở vị trí nào trong khoảng tin cậy?
A. Gần đúng tại trung điểm của khoảng tin cậy.
B. Gần sát cận dưới hơn nhiều so với cận trên.
C. Gần sát cận trên hơn nhiều so với cận dưới.
D. Nằm ngoài khoảng tin cậy.
Câu 17. Một BMI bằng 33,0 được quan sát trong mẫu. So với Mean = 25,198 và SD = 2,8958, giá trị 33,0 cách Mean khoảng bao nhiêu SD?
A. Khoảng 1,66 SD.
B. Khoảng 2,69 SD.
C. Khoảng 3,30 SD.
D. Khoảng 7,80 SD.
Câu 18. Trên Histogram, phần lớn các quan sát BMI tập trung quanh vùng khoảng 23–28, trong khi các giá trị cực thấp và cực cao xuất hiện ít hơn. Kết hợp với Mean = 25,2 và SD ≈ 2,896, nhận xét nào phù hợp nhất?
A. Dữ liệu tập trung hoàn toàn ở một giá trị duy nhất.
B. Dữ liệu có độ phân tán rất lớn đến mức Mean không còn có ý nghĩa.
C. Dữ liệu có sự tập trung quanh vùng trung tâm nhưng vẫn có một mức độ biến thiên nhất định.
D. Histogram chứng minh chắc chắn rằng dữ liệu có phân phối chuẩn.
Câu 19. Quan sát Normal Q-Q Plot of BMI cùng với Shapiro-Wilk p = 0,379, nhận xét nào hợp lý nhất?
A. Các điểm không cần phải nằm hoàn toàn trên đường thẳng mới có thể xem là phù hợp tương đối với phân phối chuẩn.
B. Chỉ cần một điểm lệch khỏi đường thẳng là phải bác bỏ phân phối chuẩn.
C. Q-Q Plot không có liên quan đến đánh giá tính chuẩn.
D. Vì p > 0,05 nên tất cả các điểm trên Q-Q Plot bắt buộc phải nằm chính xác trên đường thẳng.
Câu 20. Dựa vào BMI Stem-and-Leaf Plot, có 26 quan sát ở stem 2 với các leaf từ 0 đến 4 và 31 quan sát ở stem 2 với các leaf từ 5 đến 9. Tỷ lệ quan sát có BMI từ 25,0 trở lên là bao nhiêu?
A. 26/60 ≈ 43,3%
B. 31/60 ≈ 51,7%
C. 25/60 ≈ 41,7%
D. 33/60 = 55,0%

Address

727 Tran Hung Dao, Cho Quan Ward
Ho Chi Minh City
848

Website

Alerts

Be the first to know and let us send you an email when Xác suất-Thống kê Y học posts news and promotions. Your email address will not be used for any other purpose, and you can unsubscribe at any time.

Shortcuts

Share

Category