Mọi thứ đều có tương quan với nhau (2014–23)
(gwern.net)- Trong khoa học xã hội và khoa học sự sống, gần như mọi biến số đều có một mức độ tương quan nhất định với nhau
- Hiện tượng này không phải chỉ là ngẫu nhiên đơn thuần hay lỗi thống kê, mà là một thực tế bắt nguồn từ các yếu tố di truyền và môi trường đan xen phức tạp
- Khi cỡ mẫu tăng lên, các tương quan có ý nghĩa thống kê xuất hiện ở hầu hết mọi cặp biến, và nhà nghiên cứu bắt đầu chú ý đến chính mẫu hình tương quan thay vì từng tương quan riêng lẻ
- ‘Crud factor’ nghĩa là gần như mọi cặp biến đều tồn tại một tương quan nhỏ, và chỉ với việc chọn ngẫu nhiên một lý thuyết cùng cặp biến, cũng có xác suất cao thu được kết quả có ý nghĩa
- Trong tình huống như vậy, ý nghĩa của ngưỡng ý nghĩa truyền thống (0.05) bị suy yếu, đòi hỏi phải thận trọng khi diễn giải thống kê trong khoa học xã hội
Tổng quan và bối cảnh
- Trong tâm lý học và xã hội học, nhận định “mọi thứ ở một mức độ nào đó đều có tương quan với nhau” được chấp nhận rộng rãi
- Một đặc tính cụ thể được quyết định bởi nhiều yếu tố di truyền và môi trường, và giữa các yếu tố này cũng tự thân tồn tại tương quan
- Vì vậy, trên thực tế gần như mọi biến có thể đo lường đều có một mức độ liên hệ lẫn nhau nào đó
“Crud Factor” và các phát hiện thống kê
- “Crud factor” là hiện tượng, trong nghiên cứu khoa học xã hội (và một phần khoa học sự sống), luôn tồn tại một tương quan nhỏ ngay cả giữa các cặp biến được chọn ngẫu nhiên
- Trong bộ dữ liệu quy mô lớn khảo sát 57.000 học sinh trung học Minnesota năm 1966, kết quả phân tích 105 bảng chéo (crosstabulation) giữa các biến đa dạng như gia đình, giáo dục, hoạt động sở thích, định hướng nghề nghiệp, tôn giáo... đều có ý nghĩa thống kê
- 96% trong toàn bộ số này loại trừ khả năng chỉ là ngẫu nhiên với mức xác suất cực thấp p<10⁻⁶
- Khi mở rộng số biến lên 45, thì trong tổng số 990 tổ hợp, có 92% đạt ý nghĩa thống kê
- Trung vị (median) về số quan hệ có ý nghĩa giữa một biến và tất cả các biến còn lại là 41 trên 44
Các ví dụ giữa những biến thực tế
- Với mối quan hệ giữa điểm MCAT và số anh chị em, thứ tự sinh, giới tính, kế hoạch nghề nghiệp, sở thích tôn giáo..., tất cả đều phát hiện ý nghĩa thống kê cao
- Ví dụ: nữ sinh có điểm cao hơn nam, số anh chị em càng nhiều thì điểm có xu hướng giảm, con đầu/là con một thông minh hơn con út, có nhiều khác biệt rõ rệt giữa các nhóm tôn giáo, v.v.
- Ngay cả giữa 5 hệ phái Tin Lành tiêu biểu, mức ý nghĩa cao cũng được quan sát trong quan hệ với nhiều biến khác nhau
- Ví dụ: xác suất con một theo Presbyterian gần gấp đôi Baptist, sự khác biệt theo hệ phái về mức yêu thích trường học và nguyện vọng nghề nghiệp, cùng nhiều tương quan khác
Trường hợp các câu hỏi MMPI
- Trong 550 mục của MMPI (trắc nghiệm nhân cách), có 507 mục (92%) cho thấy khác biệt có ý nghĩa theo giới tính
- Một số câu hỏi có thể giải thích rõ ràng sự khác biệt về xu hướng, nhưng các mục khác thì nguyên nhân lại phức tạp hoặc không thể giải thích
- Vì các kết quả này xuất hiện trong nghiên cứu quy mô lớn với cỡ mẫu rất lớn, nên đây không phải lỗi thống kê (type I error) mà là hiện tượng thực chất
Tương quan trong khoa học xã hội và giới hạn của việc kiểm chứng lý thuyết
- Ngay cả khi kết hợp ngẫu nhiên một lý thuyết và một cặp biến, nếu tương quan trung bình (crud factor) ở mức 0.30, thì trên thực tế có thể phát hiện khác biệt có ý nghĩa khoảng một lần trong ba lần
- Hiện tượng này xảy ra thường xuyên hơn rất nhiều so với ngưỡng ý nghĩa (0.05) vốn thường được xem là có ý nghĩa trong khoa học xã hội
- Vì tương quan cũng dễ dàng lộ ra ở cả những cặp biến mà nhà nghiên cứu không dự đoán về mặt lý thuyết, nên chỉ riêng ý nghĩa thống kê rất khó dùng để hậu thuẫn cho quan hệ nhân quả thực chất
- Các nguyên nhân phức hợp (di truyền/môi trường) cùng sự phong phú của dữ liệu quan sát tạo ra những tương quan đa chiều như vậy
Kết luận thực tiễn
- Khi diễn giải dữ liệu khoa học xã hội và kiểm chứng lý thuyết, cần luôn ghi nhớ “những tương quan bình thường nhưng có thật” do ‘crud factor’ tạo ra
- Thay vì tuyệt đối tin vào thống kê ngưỡng ý nghĩa (ví dụ: p<0.05), cần có cách tiếp cận tập trung hơn vào tính nhân quả thực chất giữa các biến và việc diễn giải mẫu hình
- Như câu nói nổi tiếng của Thorndike, “mọi điều tốt đẹp đều có xu hướng đi cùng nhau”, trong thế giới thực quá nhiều thứ đang đan xen với nhau
1 bình luận
Ý kiến trên Hacker News
Bài này nói về một trong những điều khiến tôi khó chịu nhất
Mọi người thường hiểu nhầm cụm từ "có ý nghĩa thống kê (statistically significant)" theo nghĩa "đáng chú ý/có ý nghĩa"
Họ phát hiện ra một khác biệt được đo lường và cho rằng thống kê nói khác biệt đó là 'quan trọng', nhưng đó là cách hiểu sai
Thực ra, kiểm định ý nghĩa chỉ cho biết xác suất khác biệt quan sát được là một 'phép đo tốt'
Tức là, với một mức độ tin cậy nào đó, ta có thể nói rằng "khác biệt thực sự tồn tại"
Còn việc khác biệt được đo có 'ý nghĩa' về mặt giá trị hay không thì phải đánh giá riêng, và thường dựa vào độ lớn của khác biệt đó
Nghe có vẻ quá hiển nhiên, nhưng đây là lỗi rất phổ biến trong công nghiệp cũng như nhiều lĩnh vực khoa học
Ví dụ: "biện pháp này làm thay đổi [chỉ số] với p<0.001, thật quá có ý nghĩa! độ lớn thay đổi là 0.000001%"
Trong trường hợp như vậy, cần nghĩ lại xem nó có thực sự 'có ý nghĩa' hay không
Tuy vậy, tôi muốn nói thêm một chút về ví dụ này
p-value rất nhỏ không phải lúc nào cũng đồng nghĩa với hiệu ứng 'có ý nghĩa', nhưng cũng không hoàn toàn độc lập với kích thước hiệu ứng
Bản thân p-value xuất hiện dưới dạng (kích thước hiệu ứng)/(nhiễu/căn bậc hai của cỡ mẫu)
Nói cách khác, thống kê kiểm định lớn hơn sẽ tương ứng với p-value nhỏ hơn
p-value cực nhỏ thường đến từ hiệu ứng lớn hoặc cỡ mẫu (n) cực lớn
Vì vậy, chỉ khi N cực lớn thì hiệu ứng rất nhỏ mới có thể cho ra p<0.001
Nhưng trong nghiên cứu thực tế, nếu ra p<0.001 thì do giới hạn cỡ mẫu, khả năng cao hiệu ứng cũng thực sự lớn
Bài này nhấn mạnh rằng ý nghĩa thống kê là phần kém thú vị nhất của kết quả, và kết quả nên được giải thích bằng kích thước hiệu ứng
Không chỉ hỏi can thiệp có hiệu quả hay không, mà phải chú ý đến việc nó hiệu quả 'đến mức nào'
– Gene V. Glass
Nhưng thay vì gọi đây là một 'pet peeve' đơn giản, tôi xem nó là một sự hiểu sai mang tính bệnh lý về thống kê
Kiểu hiểu sai này có thể dẫn đến những kết luận lệch lạc, đặc biệt trong truyền thông sức khỏe/wellness đại chúng
Nhiều nghiên cứu về sức khỏe và dinh dưỡng được đưa tin là có ý nghĩa thống kê, nhưng hiệu ứng thực tế lại rất nhỏ
Vì vậy người ta có thể thay đổi mạnh lối sống và thói quen chỉ vì tin vào các kết quả như thế, trong khi thật ra không có đủ căn cứ
Tệ hơn nữa là khi người ta không xác định trước giả thuyết cần kiểm định, mà lục lại dữ liệu quá khứ chỉ để tìm ra các tương quan 'có ý nghĩa thống kê'
Trong đó có đề xuất nên xem ý nghĩa như một cách cập nhật xác suất
Lập luận là một phép thử (hoặc một nghiên cứu) chỉ cập nhật xác suất thêm X%, nên để đi đến kết luận 'có ý nghĩa' thường cần nhiều thí nghiệm hơn
Đúng là kiểu bài rất "rationalist"
Một góc thì có những quan sát đúng về hiện tượng thống kê, nhưng lại rắc thêm vài câu chữ chính trị kỳ quặc
Câu ví dụ: "Các cân nhắc lý thuyết và thực nghiệm làm dấy lên nghi ngờ về suy luận nhân quả đối với 'algorithmic bias' hay 'protected groups': việc không loại trừ có thể là không mong muốn, bất khả thi hoặc vô nghĩa"
Câu này quá kỳ lạ, tự nhiên chui ra mà chẳng có giải thích ngữ cảnh
Có vẻ như tác giả muốn nói rằng vì biến tiềm ẩn quyết định xu hướng phạm tội, nên có thể dùng
is_blacktrong black box (mô hình xét ân xá), điều này theo tôi là vô lýThực ra, mối quan tâm về cách mô hình vận hành còn là vấn đề sâu hơn cả việc diễn giải thống kê
Nếu có quá nhiều bậc tự do trong quá trình chọn mô hình thì có thể thiết kế để cho ra hầu như bất kỳ kết quả nào
Ví dụ, nếu mô hình xét ân xá có biến như
likes_hiphop, thì phải kiểm tra vì sao nó lại có mặt ở đó, và liệu đó có thật sự là 'mô hình tối ưu' khôngRốt cuộc, việc các biến trong hiện tượng xã hội có nhiều tương quan cũng nhắc ta rằng bất kỳ mô hình nào ít nhiều cũng có thể là sản phẩm mang tính chính trị
Cụm "các cân nhắc lý thuyết và thực nghiệm" là nói đến phần thảo luận phía trên
Tức là, vì mọi thứ đều có tương quan với nhau, nên chỉ vì thấy một tương quan không có nghĩa là ta có thể chắc nó mang ý nghĩa bản chất nào đó
Các nhà khoa học xã hội xây mô hình phức tạp, quan sát nhiều biến và tìm ra những tương quan ủng hộ giả thuyết của mình, nhưng lập luận ở đây là các tương quan như vậy có thể được tìm thấy ở khắp nơi nên giá trị chứng cứ của chúng yếu
Và cũng không thể khẳng định mô hình thật sự đã dùng biến như
is_blackChỉ vì một black box cho ra kết quả bất lợi cho người da đen không có nghĩa là biến
is_blackthực sự có trong đóĐặc biệt ở các chủ đề như di truyền, IQ, họ thường rút ra kết luận từ những nghiên cứu và dữ liệu có cơ sở yếu
Tôi nghĩ mô hình hóa trong khoa học xã hội nhất thiết phải có nền tảng lý thuyết, nhưng tôi nghi ngờ liệu TFA (bài gốc) có giữ cùng lập trường với các vấn đề chính trị cụ thể khác hay không
Ví dụ, tôi tự hỏi liệu họ có nói y hệt như vậy nếu một tổ chức dành cho nhóm thiểu số dùng biến
is_whitetrong tuyển dụng hay khôngKiểu của ông ấy là tạo cảm giác mình rất thông minh rồi tung các suy đoán thiếu căn cứ như thể là sự thật
Cũng lạ là cộng đồng scaling/AI lại đặc biệt thích gwern đến vậy
Tôi hơi tiếc vì bài viết không nhắc đến câu trích trong The Hitchhiker's Guide to the Galaxy
Nó gợi tôi nhớ tới ý rằng "vì mọi vật chất trong vũ trụ đều ảnh hưởng lẫn nhau theo cách nào đó, nên về mặt lý thuyết chỉ cần nhìn một miếng fairy cake cũng có thể suy ra toàn bộ vũ trụ, Mặt Trời, các hành tinh, quỹ đạo, cả lịch sử xã hội và kinh tế"
Các cấu hình T_zero khác nhau sẽ nối đến T_current (trạng thái hiện tại), và ngay cả cùng một cấu hình vật lý thì trạng thái "vũ trụ-bánh" trước đó cũng có thể khác nhau
Hơn nữa, điều đó còn giả định một hệ hoàn toàn tất định
Liên kết giải thích
Trước đây người ta vẫn khám phá ra chân lý của thế giới mà không cần thống kê
Đúng là từ khi thống kê xuất hiện, nó đã trở thành công cụ hữu ích, nhưng khi cách làm đó bị lạm dụng thì số vụ ngu ngốc được ngụy trang thành thông minh cũng tăng lên
Vậy nên nhận xét lần này về 'nhiễu tương quan' vẫn đáng để đặt câu hỏi
Trên hết, logic và tri thức nền về lĩnh vực vẫn phải đi trước
Tôi nghĩ chỉ đếm số thôi thì dễ dẫn đến hiểu lầm
Chỉ dùng logic thì không thể học được tri thức mới
Logic chỉ diễn giải lại điều ta đã biết, còn tri thức nền cần kinh nghiệm hoặc thí nghiệm
Vì quan sát thế giới thực luôn không hoàn hảo, nên diễn giải thống kê là thiết yếu
Trước thời thống kê thì hoặc là (a) người giàu ngồi nghĩ sâu xa về thế giới, (b) một nhân vật có sức hút rao giảng theo ý mình, hoặc (c) đôi khi người thông minh đoán trúng
Khi thống kê ra đời, bất kỳ ai cũng có thể biết đúng sai dựa trên kết quả, nó không còn là đặc quyền của giới có sẵn vị thế nữa
Dĩ nhiên, một trong các ưu điểm của suy luận thống kê là 'so sánh chéo (intercomparison)', tức có thể rút ra kết luận từ khác biệt ngay cả khi không hiểu rõ bản thân quá trình
Nhưng chính vì vậy mà việc thao túng kết quả hay hiểu sai cũng trở nên dễ hơn
Video liên quan
Hơi lạc đề, nhưng tôi thấy blog này thật sự rất đẹp
Drop cap, các bình luận inline hiện bên phải màn hình, thanh tiến độ... đều cho thấy tình yêu dành cho dự án này
Đây đúng là một bài viết đồ sộ
Nó khiến tôi cũng ước mình có thể viết được những bài nghiêm túc như vậy
Xem các bài khác của tác giả nữa thì cảm giác như ông ấy làm việc không ngừng như một cỗ máy
Tất nhiên, sẽ còn tốt hơn nếu có ai đó tài trợ tài chính cho việc này
Kiểu tranh luận này đã có từ hàng chục năm nay
Điều quan trọng là đừng đánh mất góc nhìn phản biện
Nhưng cá nhân tôi, càng vật lộn với thứ logic này trong công việc, tôi càng thấy nó không hữu ích lắm và hơi rỗng
'crud' tồn tại trong các mẫu hình như kiểu bức xạ nền vi sóng vũ trụ của thống kê; thay vì gạt nó đi là vô nghĩa, đôi khi nó lại quan trọng
Có khi sự liên hệ giữa các biến không dễ giải thích, nhưng cũng có khi đó là chìa khóa để hiểu những biến gây nhiễu tiềm tàng cần phải kiểm soát
Không phải lúc nào cũng có tương quan, và cũng tồn tại những trường hợp liên hệ thật sự bằng 0
Việc xác định một 'kích thước hiệu ứng khác 0 và có ý nghĩa' cũng rất tùy tiện và chủ quan
Tôi nghĩ phải có một khung nhìn hiệu quả hơn để xem xét hiện tượng này
Correlated. Ví dụ nào khác?<i>Everything Is Correlated</i> - thảo luận cũ
Đây cũng là lý do khoa học thực nghiệm khác với nghiên cứu quan sát
Phân tích thống kê chỉ cho ta lý do để tin hơn vào một giả thuyết, và cần được củng cố bằng cách tiếp cận thực nghiệm thật sự
Các ví dụ trong blog chủ yếu là những trường hợp thuộc y học, khoa học xã hội, khoa học hành vi... nơi rất khó làm thí nghiệm được kiểm soát đúng nghĩa, hoặc khó làm rõ quan hệ nhân quả vì thiếu cỡ mẫu
Dĩ nhiên, thất bại trong thiết kế thì không thể sửa bằng phân tích (You can’t fix by analysis what you bungled by design - nguồn), nhưng đó vẫn là hướng giúp giảm bớt thiên lệch
Về đoạn trích trong bài rằng “điều này làm cho ý nghĩa của kiểm định trở nên mơ hồ; nó chẳng qua chỉ là việc tính rất chính xác xác suất của dữ liệu trong một kịch bản mà ta biết a priori (tiên nghiệm) là sai”
Tôi nghĩ việc đi đến kết quả có ý nghĩa bằng cách dùng các mô hình đã được đơn giản hóa, và thừa nhận rằng chúng sai theo nghĩa nghiêm ngặt, là chuyện rất thường gặp
Ví dụ như định luật Newton, phân tích mạch điện cũng khả thi nhờ đơn giản hóa, và trong ngân hàng người ta từng tính 1 năm là 360 ngày
Chúng vẫn hoạt động rất tốt trong thực tế, nên tôi tự hỏi mình đã bỏ sót điều gì
Xét nghiên cứu như một hành trình tìm kiếm chân lý thì đây là một thế tiến thoái lưỡng nan nghiêm trọng
(chẳng hạn cách tính khoản chi trả cho khoảng thời gian dưới 1 tháng)
Nói cách khác, Einstein là phiên bản tinh chỉnh của Newton
Giống như thuyết tương đối hẹp hội tụ về cơ học Newton ở giới hạn tốc độ thấp
Thực ra trong thống kê không có cái gọi là 'sai', mà phải hiểu là "không đúng với xác suất x%"
Nếu muốn giảm x thì phải 'làm thống kê chăm hơn', và cách chắc chắn nhất là tăng cỡ mẫu (N)
Chỗ hoàn toàn sai trong bài là cho rằng với N đủ lớn thì có thể đối xử chân lý/sai lầm như những thứ tuyệt đối
Bởi khi đó xác suất sẽ xuống đến mức kiểu 'dù tạo ra vũ trụ một triệu lần cũng chưa chắc xuất hiện một lần'
Nhưng ngoài đời, phần lớn nghiên cứu trong khoa học xã hội, y học, kinh tế học... đều làm việc với N rất nhỏ nên vấn đề thống kê là điều tất yếu
Vì vậy người ta cố 'làm thống kê chăm hơn', nhưng thực tế lại không tăng được N mà đi bóp số, hoặc chỉ tăng N chút ít rồi tuyên bố đã giải quyết xong vấn đề