Giới thiệu về Thống kê Hiện đại, ấn bản thứ 2
(openintro-ims2.netlify.app)- Giáo trình thống kê Introduction to Modern Statistics ấn bản thứ 2 của dự án OpenIntro được cung cấp miễn phí trên web
- Nội dung giáo trình luôn có thể xem miễn phí trên web, và bản PDF có thể nhận trên Leanpub miễn phí hoặc với mức đóng góp tự chọn
- Bản paperback đen trắng được bán với giá 25 USD, thông tin bản quyền ghi năm 2024 và ngày phiên bản là 31 tháng 3, 2026
- Tài liệu bổ sung gồm slide, bài thực hành, hướng dẫn tương tác cũng có thể tải miễn phí tại openintro.org/book/ims
- Giáo trình này là tác phẩm phái sinh từ các giáo trình thống kê OpenIntro trước đó và được cung cấp theo giấy phép CC BY-SA 3.0 Unported United States License
Giáo trình thống kê miễn phí của OpenIntro
- Introduction to Modern Statistics, Second Edition là giáo trình thống kê của Mine Çetinkaya-Rundel và Johanna Hardin
- Giáo trình được gọi tắt là IMS và là một phần của dự án OpenIntro
- Trang web được lưu trữ trên Netlify
Hình thức sử dụng và giá
- Nội dung giáo trình được cung cấp luôn miễn phí trên web
- Có thể nhận bản PDF trên Leanpub qua Download PDF
- PDF được cung cấp miễn phí hoặc với mức đóng góp do người dùng tự chọn
- Bản paperback đen trắng có thể mua với giá 25 USD
- Thông tin bản quyền là 2024, ngày phiên bản là 31 tháng 3, 2026
Tài liệu bổ sung và giấy phép
- Giáo trình và tài liệu bổ sung có thể tải miễn phí tại openintro.org/book/ims
- Tài liệu bổ sung gồm slide, bài thực hành, hướng dẫn tương tác
- Giáo trình này là tác phẩm phái sinh từ OpenIntro Statistics 4th Edition và Introduction to Statistics with Randomization and Simulation 1st Edition
- Giấy phép là Creative Commons Attribution-ShareAlike 3.0 Unported United States License
- Có thể xem chi tiết giấy phép tại creativecommons.org
- Tệp nguồn nằm trên GitHub tại github.com/openintrostat/ims
1 bình luận
Ý kiến trên Hacker News
Tôi cho rằng giáo dục thống kê đang được đổi mới đáng kể nhờ khả năng tiếp cận máy tính
Ví dụ, giới thiệu kiểm định giả thuyết bằng ngẫu nhiên hóa[1] và dùng kiểm định hoán vị ngẫu nhiên[2]
Khi học thống kê theo cách truyền thống, tôi chỉ học một danh sách kiểu sách dạy nấu ăn như “tình huống này dùng kiểm định t, tình huống kia dùng kiểm định chi bình phương”, chứ không hiểu vì sao phải dùng các kiểm định đó hay chúng xuất phát từ đâu
Muốn xem một cách tiếp cận tương tự trong bối cảnh hơi khác thì cũng có [3]
[1]: https://openintro-ims2.netlify.app/11-foundations-randomizat...
[2]: https://en.wikipedia.org/wiki/Permutation_test
[3]: https://inferentialthinking.com/chapters/11/1/Assessing_a_Mo...
Gosset đã tạo ra kiểm định t và chứng minh tính hợp lệ của nó, nhưng sinh viên thường được dạy áp dụng nó như một hộp đen mà không có hiểu biết căn bản về vì sao nó đúng, điều này không tốt về mặt giáo dục
Ở điểm này, tôi cho rằng thống kê Bayes tốt hơn nhiều. Đẳng cấu Curry-Howard nối với logic rất sâu sắc, và cũng có thể giới thiệu bằng các phân phối liên hợp có nghiệm giải tích dạng đóng
Những thứ phức tạp hơn là việc của máy tính, và với các công cụ như STAN, ta có thể xử lý những phân phối phức tạp tinh vi hơn nhiều so với các phương pháp tần suất
Kiểm định hoán vị làm tôi thấy thỏa mãn vì nó sắp xếp lại những gì tôi đã biết từ lý thuyết phân phối, nhưng nếu tôi hoàn toàn không biết lý thuyết phân phối thì không chắc nó có tác dụng tương tự không
Khi học thống kê toán học, bạn không học theo kiểu sách dạy nấu ăn. Ở giai đoạn cơ bản, bạn học lý thuyết xác suất, lý thuyết phân phối và nhiều phân phối khác nhau, rồi kiểm định giả thuyết, hồi quy, phân tích phương sai, v.v. nối tiếp từ đó
Ngược lại, các nhà khoa học nghiên cứu thường học qua những khóa ngắn dành cho lĩnh vực cụ thể, chẳng hạn thống kê cho nhà sinh học, nên có vẻ họ tiếp cận thống kê như một tập hợp công thức
Phân phối nhị thức khá cụ thể nên sinh viên dễ nắm khái niệm giá trị p, nhưng về sau khi chuyển sang phân phối chuẩn, phân phối t, v.v. thì ngày càng trừu tượng hơn và trôi dần thành kiểu sách dạy nấu ăn “khi nào dùng cái gì”
Tôi đánh giá cao và thích các nỗ lực giáo dục trong lĩnh vực này, đặc biệt là dưới dạng giáo trình mở, nhưng tôi thật sự không thích việc dạy thống kê nhập môn theo cách tổng quát như thế này
Tôi hy vọng theo thời gian, nó sẽ chuyển khỏi kiểm định ý nghĩa giả thuyết không kiểu chắp vá, sang tập trung vào mô hình tuyến tính, và dùng cách tiếp cận Bayes làm mặc định
Tôi cho rằng ngay cả trong khóa nhập môn cũng có thể làm được từ đầu; liên kết dưới đây là tài liệu tham khảo: https://lindeloev.github.io/tests-as-linear/#:~:text=Most%20...
Tuy nhiên, cách tiếp cận “Bayes làm mặc định” thì có cảm giác là đang đi theo hướng bất định hơn một chút
Kỹ sư phần mềm thường có năng lực này, nhưng phần lớn người dùng thống kê thì không
Nếu cố giải thích cho một nhà khoa học xã hội vốn không thích bản thân con số hay công thức về sự tương đồng của các phương pháp tuyến tính này và kiểu “mọi thứ là một”, khả năng cao họ sẽ càng bối rối hơn
Dù vậy, nếu có ai làm một thí nghiệm ngẫu nhiên ước lượng hiệu quả của hai phương pháp bằng một mô hình tuyến tính phù hợp, xin hãy cho tôi biết. Hẳn sẽ là một thí nghiệm 10/10
[1]: https://lindeloev.github.io/tests-as-linear/#41_one_sample_t...
Rất vui khi thấy trong số tác giả ở đây có Mine Çetinkaya-Rundel
Nhiều người hẳn quen với “R for Data Science”(https://r4ds.had.co.nz/) mà cô ấy đã đóng góp, nhưng cô ấy cũng có nhiều bài báo xuất sắc về giáo dục khoa học dữ liệu
Cô ấy chắc chắn thuộc nhóm giảng viên tốt nhất tôi từng xem
Một trong những cuốn sách tôi thích nhất về thống kê và xác suất là Regression and Other Stories của Andrew Gelman, Jennifer Hill, Aki Vehtari
Có thể xem miễn phí tại đây: https://users.aalto.fi/~ave/ROS.pdf
Tôi thắc mắc liệu có cuốn sách tiền thống kê nào dạy tư duy và khái niệm cần thiết để hiểu thống kê không
Nếu hiểu vững các công cụ cơ bản của xác suất thì có thể học thống kê khá dễ
Nếu không có sự hiểu biết đó, thống kê rất dễ trông như một tập hợp các công thức nấu ăn
Ngược lại, nếu quen với xác suất, bạn có thể công thức hóa bài toán thực tế mình đang có, rồi tìm ra công cụ thống kê cần thiết chỉ bằng một chút tìm kiếm
Không cần nhiều hơn giải tích cơ bản là mấy
Nhiều người từ nhỏ đã có rào cản tâm lý kiểu “tôi không giỏi toán” vì gặp giáo viên tệ
Cứ nhảy vào học, bạn sẽ không hối tiếc đâu
Ronald Fisher có thể đã không dùng bootstrap để tính khoảng tin cậy, nhưng phần lớn phần còn lại của đề cương bài giảng trông như thể gần như do ông tạo ra từ đầu những năm 1900 :-)
Tôi đã làm một cheat sheet tổng hợp để học thống kê: https://github.com/mavam/stat-cookbook
Tôi thích việc có bao gồm ngẫu nhiên hóa và bootstrapping
Tuy nhiên hơi tiếc là khung giả thuyết vẫn là NHST. Theo bất kỳ nghĩa nào thì cũng khó xem là “hiện đại”
Nếu chuyển sang Bayes thì phải viết lại hoàn toàn môn học
Tôi cũng từng thấy người ta đề xuất khoảng tin cậy như một lựa chọn thay thế, nhưng việc đó cũng có phản biện
Tôi cũng từng thấy lập luận rằng không nên dùng kiểm định giả thuyết nữa
Trong bối cảnh NHST vẫn được dùng rộng rãi và chưa có lựa chọn thay thế rõ ràng, tôi nghĩ không giới thiệu nó cho sinh viên còn có hại hơn
Tôi thắc mắc đâu là sách thống kê hay để tự học
Cuốn sách được liên kết là sách nhập môn năm nhất và làm tốt vai trò đó
Nếu muốn đi xa hơn thì có nhiều lựa chọn
Statistical Inference của Casella và Berger có danh tiếng rất tốt như một cuốn sách xây dựng thống kê từ các nguyên lý đầu tiên. Tôi sẽ không dẫn link, nhưng tìm kiếm đơn giản là có thể thấy bản scan PDF đầy đủ. Đánh giá trên Amazon: https://www.amazon.com/Statistical-Inference-Roger-Berger/dp...
Statistics của Freedman, Pisani, Purves cũng được đánh giá rất tốt và dễ tìm trên mạng. Đánh giá trên Amazon: https://www.amazon.com/Statistics-Fourth-David-Freedman-eboo...
Phần lớn sách trong chương trình cốt lõi khoa học dữ liệu của Berkeley cũng có trên mạng. Không chỉ thuần thống kê, nhưng chúng dạy theo cách hiện đại, tận dụng tính toán và ngẫu nhiên hóa, đồng thời đề cập đến những công cụ đáng học
Data 8: https://inferentialthinking.com/chapters/intro.html, Data 100: https://learningds.org/intro.html, Data 140: http://prob140.org/textbook/content/README.html, Data 102: https://data102.org/fa23/resources/#textbooks-from-previous-...
Không chỉ có chương trình của Berkeley; các khóa học trực tuyến thì có hàng chục, thậm chí có thể hàng trăm. Chỉ là phạm vi khá rộng, và khi gần đây tôi khảo sát giáo dục khoa học dữ liệu, tôi đọc nhiều nhất về phía Berkeley
Sách nhắm đến nghiên cứu sinh trong các ngành khoa học, nên tập trung vào “có thể dùng thống kê như thế nào để kiểm định giả thuyết khoa học và xác định quan hệ nhân quả”
Sách không đi quá sâu về mặt toán học, nhưng kỳ vọng người đọc có cảm giác toán học nhất định và quen phân tích dữ liệu ngay cả khi không dùng thống kê
Trên thực tế sách gần như chỉ bàn về mô hình Bayes và cách khớp chúng bằng máy tính, nên gần như không đề cập đến trường phái tần suất
Cũng có chuỗi video đi kèm: https://www.statlearning.com/
Introduction to Probability của Joseph K. Blitzstein và Jessica Hwang cũng đáng xem. Sách được cung cấp miễn phí: http://probabilitybook.net (chuyển hướng sang Drive)
Nếu thích, cuốn Think Bayes tương tự cũng đáng xem
Ngoài ra còn có https://nostarch.com/learnbayes
Nếu đã có nền tảng thống kê và muốn học lại từ một góc nhìn rất khác, thiên về nhân quả và Bayes hơn, tôi cũng có thể khuyên đọc Statistical Rethinking