Thống kê ổ đĩa Backblaze năm 2024
(backblaze.com)- Backblaze so sánh tỷ lệ hỏng trong Q4, cả năm và theo vòng đời dựa trên 301.120 ổ dữ liệu trong tổng số 305.180 ổ đĩa đang quản lý vào cuối năm 2024
- Tổng hợp Q4 2024 xét 300.633 ổ cứng sau khi loại 487 ổ không đạt tiêu chí; AFR theo quý giảm từ 1,89% ở Q3 xuống 1,35% ở Q4
- Bảng cả năm 2024 còn lại 298.954 ổ đĩa và 27 mẫu; AFR hằng năm tổng thể giảm từ 1,70% năm 2023 xuống 1,57% năm 2024
- 1.200 ổ Seagate 24TB được đưa vào từ đầu tháng 12/2024 không có lỗi nào đến hết Q4, nhưng không xuất hiện trong bảng cả năm và vòng đời vì chưa đủ số ngày ổ đĩa
- AFR theo vòng đời giảm từ 1,46% năm 2023 xuống 1,31% năm 2024; việc hoàn tất di chuyển các ổ Seagate 4TB có tác động lớn
Đối tượng thống kê và tiêu chí loại trừ
- Tính đến ngày 31/12/2024, Backblaze quản lý tổng cộng 305.180 ổ đĩa
- Ổ khởi động: 4.060
- Ổ dữ liệu: 301.120
- Thống kê so sánh tỷ lệ hỏng quy đổi theo năm (AFR) của ổ cứng dùng để lưu trữ dữ liệu trong Q4 2024, cả năm 2024 và theo vòng đời
- Để được đưa vào bảng và biểu đồ, ổ phải đáp ứng điều kiện tối thiểu theo từng giai đoạn
- Theo quý: hơn 100 ổ, hơn 10.000 ngày ổ đĩa
- Theo năm: hơn 250 ổ, hơn 50.000 ngày ổ đĩa
- Theo vòng đời: hơn 500 ổ, hơn 100.000 ngày ổ đĩa
- Các đối tượng bị loại gồm ổ thử nghiệm không còn được xem là ổ production hiện tại và các mẫu thiếu điểm dữ liệu
- Dữ liệu đầy đủ, bao gồm cả các ổ không xuất hiện trong bảng, có thể tải từ trang Drive Stats của Backblaze
Tỷ lệ hỏng ổ cứng Q4 2024
- Đối tượng phân tích Q4 2024 là 300.633 ổ trong số 301.120 ổ dữ liệu, sau khi loại 487 ổ không đạt tiêu chí
- Seagate 24TB ST24000NM002H, được đưa vào đầu tháng 12, có quy mô 1.200 ổ để lấp đầy một Backblaze Vault và không có lỗi nào đến hết Q4
- Mẫu này được xếp vào nhóm dung lượng trên 20TB cùng với Toshiba 20TB và WDC 22TB
- Có 5 mẫu không có lỗi trong Q4
- Seagate 24TB ST24000NM002H
- HGST 4TB HMS5C4040ALE640
- Seagate 8TB ST8000NM000A
- Seagate 14TB ST14000NM000J
- Seagate 16TB ST16000NM002J
- Cần thận trọng khi diễn giải các mẫu có 0 lỗi vì số lượng ổ và số ngày ổ đĩa tương đối ít
- AFR tổng thể Q4 giảm từ 1,89% ở Q3 xuống 1,35%
- Tất cả các nhóm dung lượng ổ đĩa đều cải thiện so với Q3
- Việc bổ sung hơn 14.000 ổ dung lượng trên 20TB là một trong những yếu tố chính
- AFR Q4 của nhóm ổ trên 20TB là 0,77%
Thay thế ổ 4TB và chuyển sang dung lượng lớn
- Trong Q4, số lượng ổ 4TB tiếp tục giảm thêm 1.774 ổ
- Khoảng 4.000 ổ 4TB còn lại dự kiến sẽ biến mất trước cuối Q1 2025
- Các ổ thay thế là những ổ 20TB, 22TB và 24TB mới được đưa vào
- Trong số các ổ 4TB đang vận hành ở Q4, chỉ có 1 ổ bị hỏng, nên trong so sánh tỷ lệ hỏng, các ổ trên 20TB trở thành đối tượng quan sát quan trọng hơn
Tỷ lệ hỏng cả năm 2024
- Trong bảng cả năm 2024, 9 mẫu và 2.012 ổ không đạt tiêu chí đã bị loại
- Đối tượng thống kê cuối cùng là 298.954 ổ đĩa, thuộc 27 mẫu
- Năm 2024 không có mẫu nào đạt tiêu chí mà ghi nhận 0 lỗi
- Seagate 16TB ST16000NM002J chỉ ghi nhận 1 lỗi ở Q3, nên AFR năm 2024 chỉ ở mức 0,22%
- Đội kỹ thuật trung tâm dữ liệu đã lắp đặt 53.337 ổ trong năm 2024
- Nếu giả định 2.080 giờ làm việc mỗi năm, tương đương 26 ổ mỗi giờ
- 1.200 ổ Seagate 24TB mới được bổ sung trong năm 2024 được lắp đặt vào đầu tháng 12, nên không đủ số ngày ổ đĩa cần thiết cho bảng cả năm và vòng đời
- Các mẫu không được đưa vào bảng cả năm như sau
- Seagate ST8000NM000A: 247 ổ, 22.684 ngày ổ đĩa, AFR 2024 là 0,84%
- Seagate ST14000NM000J: 232 ổ, 19.696 ngày ổ đĩa, AFR 2024 là 1,32%
- Seagate ST24000NM002H: 1.200 ổ, 18.000 ngày ổ đĩa, AFR 2024 là 0,00%
So sánh 2022~2024 và xu hướng theo dung lượng
- AFR hằng năm tổng thể năm 2024 là 1,57%, thấp hơn mức 1,70% của năm 2023
- Dự kiến tỷ lệ hỏng tổng thể sẽ tiếp tục giảm trong năm 2025, nhưng các nhóm dung lượng cần theo dõi là khác nhau
- Mẫu 8TB và 12TB: đều đã vượt 5 năm sử dụng, và thông thường tỷ lệ hỏng tăng rõ rệt sau 5 năm
- Mẫu 14TB và 16TB: đang tiến gần nhóm tuổi trung bình 3~5 năm vận hành, nên tỷ lệ hỏng có thể tăng dần theo bathtub curve
- Mẫu 20TB, 22TB, 24TB: đang bước vào đoạn phẳng của bathtub curve, nơi tỷ lệ hỏng lẽ ra thấp nhất
- Ổ 4TB và 10TB có số lượng tương đối ít vào cuối năm 2024 nên tác động nhỏ đến tỷ lệ hỏng tổng thể
- Ổ 8TB và 12TB là các ổ đời cũ đã 5~8 năm
- 12TB tăng từ khoảng 1% AFR năm 2021 lên khoảng 3% năm 2024
- 8TB có dao động theo quý, nhưng đường xu hướng trong cùng giai đoạn gần như phẳng
- Ổ 14TB và 16TB chiếm 57% tổng số ổ đang vận hành
- Tuổi trung bình là 2~4 năm
- Đây là giai đoạn đáng lẽ phải có tỷ lệ hỏng thấp và ổn định, và thực tế cũng cho thấy như vậy
- Ổ 22TB vẫn ở giai đoạn đầu tiếp tục được bổ sung, nên có thể quan sát hướng đi của AFR tốt hơn sau khi quần thể ổ đĩa ổn định
- AFR theo vòng đời hiện tại là 1,06%
Xu hướng tỷ lệ hỏng theo nhà sản xuất
- Đường xu hướng theo nhà sản xuất của HGST không tốt, nhưng trước Q4 2023 vẫn ở dưới hoặc xấp xỉ mức trung bình tổng thể
- AFR cao của HGST trong năm 2024 chủ yếu do hai mẫu 12TB dẫn dắt
- HUH721212ALN604 cho thấy tín hiệu AFR theo quý tăng từ Q1 2023
- HUH721212ALE604 có xu hướng tương tự từ Q3 2024
- Nếu loại hai mẫu này, AFR của HGST năm 2024 là 0,55%
- Đường xu hướng AFR theo quý của Seagate giảm nhẹ từ 2,25% xuống 2,0% trong giai đoạn 2022~2024
- Seagate là nhà sản xuất duy nhất có xu hướng giảm trong giai đoạn này
- Một phần mức giảm có vẻ đến từ tác động của việc loại bỏ ổ Seagate 4TB
- AFR theo quý của các mẫu ổ Toshiba dao động trong khoảng 0,80%~1,52% trong giai đoạn 2022~2024
- Hầu hết các quý ở gần mức khoảng 1,2%
- AFR theo quý cao nhất trong từng mẫu Toshiba là 1,58%
- Các mẫu WDC có độ nhất quán tương tự Toshiba nhưng ghi nhận AFR thấp hơn ở mọi quý
- Phạm vi AFR theo quý của các mẫu WDC trong giai đoạn 2022~2024 là 0,0%~0,85%
- Q1 2022, trong số 12.207 ổ WDC đang vận hành, không có lỗi nào, ghi nhận AFR 0,0%
Thống kê theo vòng đời và cảnh báo sao lưu
- Trong bảng theo vòng đời, 11 mẫu và 2.736 ổ không đạt tiêu chí đã bị loại
- Đối tượng thống kê cuối cùng là 298.230 ổ đĩa, thuộc 25 mẫu
- AFR theo vòng đời tổng thể giảm từ 1,46% năm 2023 xuống 1,31% năm 2024
- Lý do chính khiến AFR theo vòng đời giảm là việc hoàn tất di chuyển các ổ Seagate 4TB trong năm 2024
- Tính đến cuối năm 2024, chỉ còn 2 ổ Seagate 4TB đang vận hành
- 79 triệu ngày ổ đĩa và hơn 5.600 lỗi tích lũy của các ổ này tính đến cuối năm 2023 không còn được đưa vào bảng vòng đời năm 2024
- Cũng có bảng riêng sắp xếp các mẫu có AFR theo vòng đời từ 1,50% trở xuống
- Giá trị AFR theo từng mẫu có đủ dữ liệu nên có thể xem là vững chắc, nhưng tỷ lệ hỏng ổ đĩa thường đi theo bathtub curve và vẫn có ngoại lệ
- Có những mẫu như HGST 4TB dù đã cũ nhưng vẫn hiếm khi hỏng
- Một số mẫu có thể đang tốt rồi đột ngột có đường cong hỏng tăng nhanh
- AFR 1% nghĩa là trong 100 ổ, có thể có 1 ổ hỏng trong vòng một năm
- Ngay cả người dùng cá nhân chỉ có 1 ổ, chính ổ đó vẫn có thể hỏng
- Luôn phải có và kiểm thử bản sao lưu
Công bố dữ liệu và thay đổi người phụ trách
- Toàn bộ bộ dữ liệu dùng để lập bảng và biểu đồ trong báo cáo lần này được cung cấp tại trang Hard Drive Test Data
- Dữ liệu có thể được tải xuống và sử dụng miễn phí
- Khi sử dụng phải ghi nguồn là Backblaze
- Người dùng chịu trách nhiệm về cách sử dụng dữ liệu
- Không được bán chính dữ liệu này
- Người phụ trách đã viết báo cáo Drive Stats trong 10 năm qua sẽ nghỉ hưu sau báo cáo này
- Từ báo cáo Q1 2025, Stephanie Doyle và David Johnson sẽ tiếp quản Drive Stats
1 bình luận
Các ý kiến trên Hacker News
Gần như khó tin là tôi đã đều đặn đọc các báo cáo Drive Stats trong suốt 10 năm qua
Dữ liệu trước khi hành động không có giá trị tự thân, và ngay cả sau khi hành động cũng không đảm bảo kết quả mong muốn. Cảm ơn vì 10 năm thống kê và bài học tuyệt vời; chúc bạn sau khi nghỉ hưu vẫn vui vẻ “resilvering”
Dù không phải best practice, trong 10 năm qua tôi đã vận hành home server bằng một ổ tốc độ cao dung lượng nhỏ cho OS và một ổ đơn dung lượng lớn chọn dựa trên Backblaze Drive Stats, đến giờ vẫn chưa hỏng lần nào
Tôi tin tưởng phương pháp luận của Backblaze và xem đây là tài liệu rất có giá trị từ góc nhìn người tiêu dùng. Ổ gần đây nhất là WDC WUH722222ALE6L4 22TiB; tuy chỉ có dữ liệu vài tháng, nhưng nhìn xu hướng chung của WDC trong báo cáo lần này thì tôi thấy yên tâm là có lẽ sẽ ổn cho đến chu kỳ thay thế tiếp theo
Trên mạng thường thấy các câu chuyện về việc nhiều ổ mua từ cùng một lô bị hỏng. Tôi không biết mô hình mua sắm của Backblaze nên không thể chứng minh, nhưng tôi từng mua ST16000NM001G, một model thuộc nhóm khá ổn trong danh sách, rồi nó hỏng trong vòng 1 năm. Với ổ cứng hay thiết bị lưu trữ, tốt hơn là chuẩn bị cho downtime bằng RAID phần mềm và backup, và nếu có hỏng thì hy vọng nó hỏng trong thời hạn bảo hành
Lý do là ngay cả khi độ tin cậy cao hơn giúp giảm tổng chi phí sở hữu, nếu cùng lắm chỉ khoảng 10% thì nó cũng bị bù trừ bởi việc các ổ “tốt nhất” thường không được giảm giá. Vấn đề của giai thoại n=1 là không thể biết liệu kết quả là nhờ làm theo lời khuyên tốt hay chỉ đơn giản là may mắn
Marketing ổ đĩa vẫn dùng đơn vị thập phân, còn TiB là đơn vị nhị phân. 22TB xấp xỉ 20TiB
Trong trường hợp này, 3 ổ WUH721414ALE6L4 refurbished có tổng giá tương tự. Ghép chúng thành RAIDZ1 sẽ có 28TB, và tiến gần đến mức độ tin cậy có thể kỳ vọng trong phạm vi một thiết bị đơn. Dĩ nhiên backup vẫn quan trọng, nhưng đó là chủ đề riêng
Ở đây “hình thức nào đó” có nghĩa là phần cứng hay phần mềm đều được
Trong 24 tháng qua, tôi đã dùng 17 ổ Seagate ST12000NM001G 12TB SATA trong một pool raidz3 lớn, và thống kê cá nhân theo 3–4 ký tự đầu của số serial như sau: ZLW2 hỏng 5/8, ZL2 hỏng 1/4, ZS80 hỏng 1/2, ZTN hỏng 0/2, ZLW0 hỏng 0/1
Tất cả đều là ổ refurbished; 2 ổ mua từ cửa hàng eBay của Seagate, số còn lại từ ServerPartDeals. Trong 15 ổ mua từ ServerPartDeals, 7 ổ đã hỏng, trong đó ít nhất 4 ổ hỏng trong vòng 6 tuần sau khi lắp đặt. Khi chọn ổ để xây dựng storage pool ban đầu, tôi đã tham khảo thống kê Backblaze; mỗi lần thống kê cập nhật vào hộp thư, tôi lại kiểm tra bảng để xem ổ của mình có thật sự là 001G mà Backblaze nói có tỷ lệ hỏng hằng năm 0,99% hay không. Rốt cuộc, kết quả có thể khác nhau tùy từng người
Trước đây tôi từng nghĩ các thống kê này thú vị và hữu ích cho lần mua HDD tiếp theo, nhưng cuối cùng nhận ra rằng mình chỉ dùng chúng để chọn một thương hiệu có độ tin cậy gần đây tương đối ổn
Giờ thực tế chỉ còn 3 thương hiệu, còn thống kê thì phần lớn là các model cũ, nên công dụng chính chỉ là khi mua ổ cũ cùng lô mà Backblaze tình cờ đã dùng. Tốt hơn là mua 2 ổ từ các người bán khác nhau để dựng RAID, hoặc thực hiện backup offsite định kỳ
Lý tưởng là nên dùng RAID phần mềm hoặc filesystem có khả năng scrubbing và phục hồi để phát hiện bit rot. Hoặc cần một giải pháp phần cứng làm được việc tương tự và có thể báo lỗi sửa sai cho OS. Như mọi khi, các giải pháp kiểu RAID chủ yếu nhằm tăng tính sẵn sàng, còn backup là vấn đề hoàn toàn khác. Không gì tốt hơn việc có nhiều bản sao ở nhiều địa điểm
Nhìn các số liệu của WDC và Toshiba thì khó phản bác, còn so với đó số liệu của Seagate khá đáng ngại
Ổ HGST rất tuyệt, nhưng giờ là dòng legacy thuộc WDC. HGST đã là một phần của WD từ khá lâu trước đây, và các model mới ra dưới thương hiệu WDC
https://www.heise.de/en/news/Hard-disk-fraud-Increasing-evid...
Hơn 10 năm trước, khi bắt đầu dùng NAS 24 bay hiện tại, tôi đã xem thống kê ổ đĩa Backblaze khi đó mới xuất hiện để quyết định nên mua ổ nào. Lựa chọn là ổ HGST 4TB 7200rpm
Theo thống kê Louwrentius cá nhân của tôi, hơn 10 năm qua có 0 ổ hỏng. Nhân tiện, nghe nói Andy Klein, tác giả Backblaze Drive Stats, sắp nghỉ hưu; chúc ông mọi điều tốt đẹp và xin cảm ơn. Ngoài ra, thật đáng kinh ngạc khi dữ liệu trong NAS 24 ổ của tôi giờ có thể nằm gọn trong 2 ổ 32TB đời mới
Backblaze là một trong những dịch vụ được tôn trọng nhất trong ngành lưu trữ, và sau khi tôi ra mắt giải pháp lưu trữ đám mây của mình, sự kính trọng đó vẫn tiếp tục tăng lên
Sau khi vài ổ cứng trong NVR cũ bị hỏng, tôi nhận ra rằng nhiệt là kẻ thù lớn nhất của ổ cứng
Chiếc NVR đó tỏa rất nhiều nhiệt vì nó cấp nguồn cho camera PoE, thực hiện chuyển mã video và liên tục ghi xuống đĩa. Có lẽ do nhiệt mà đĩa bị cong vênh, đầu đọc va vào bề mặt và gây mất dữ liệu. Với NVR mới, tôi tách việc cấp nguồn PoE sang một switch có cấp nguồn, CPU mới xử lý mã hóa video bằng phần cứng, dùng SSD cho ghi chính và để ổ cứng làm bản sao lưu thứ cấp. Nhiệt giảm đáng kể và đến giờ vẫn chạy tốt. Tôi biết việc liên tục ghi đè lên SSD là không tốt, nhưng nhìn vào thời gian trung bình đến khi hỏng của SSD thì chắc cũng phải mất vài năm mới hỏng, nên đó là rủi ro có thể chấp nhận được
Ngay cả ổ HGST dùng cho trung tâm dữ liệu cũng chỉ trung bình khoảng 5,5W, và công suất thiết kế nhiệt ở tải tối đa vào khoảng 7,8W. Không khó để thiết kế một vỏ máy cho luồng khí đi qua 6–8 ổ cứng, làm mát bằng quạt DC 12V 120mm hoặc 140mm chạy tương đối chậm và êm. Ngay cả khi dùng vỏ PC desktop mid-tower với CPU công suất thấp làm NAS, nhiều trường hợp chỉ cần một quạt 140mm phía sau hút gió từ trước ra sau là đủ làm mát 8 ổ HDD 3,5 inch. Thế nhưng các nhà thiết kế thiết bị vẫn cứ nhồi nhét vào không gian quá nhỏ và làm thông gió không đủ
Mỗi năm, báo cáo này trông như một hoạt động quảng bá thương hiệu tuyệt vời của Backblaze nhắm tới khách hàng tiềm năng trong giới công nghệ, đồng thời cũng là một dịch vụ hữu ích cho cả ngành
Tôi tò mò không biết ngoài mã nguồn mở ra còn có những ví dụ tương tự nào từ các công ty khác
Tuy vậy, các bài thống kê ổ đĩa của Backblaze được đầu tư công sức nhiều hơn hẳn và có tiêu chuẩn chất lượng cao hơn so với những gì thường thấy ở chiến thuật này
https://www.techempower.com/benchmarks/#hw=ph&test=fortune&s...
Các bài tháo máy của iFixIt cũng là nội dung mang tính thông tin khá tốt: https://www.ifixit.com/Teardown
Còn có các bản quét CT của Lumafield: https://www.scanofthemonth.com/
Cũng có benchmark phần cứng: https://benchmark.clickhouse.com/hardware/ cái này cũng được Phoronix sử dụng
Dù đã thấy vài dấu hiệu ở chỗ này chỗ kia, chúng tôi vẫn thấy tự mình làm rất thú vị và đang mở rộng sang Networking Stats cùng các nội dung bổ sung sắp tới. Chúng tôi cũng dự định nói về việc các thống kê này được phản ánh như thế nào trong triển khai hạ tầng, nên có lẽ sẽ khá thú vị
Năm nào xem cái này cũng hay. Tuy nhiên, dù biết là miễn phí, nếu có một điểm hơi tiếc thì tôi muốn được xem cả chỉ số sử dụng thực tế, chứ không chỉ đơn giản là “đã được bật nguồn”
Nếu không biết ổ đĩa đã được dùng bao lâu, dùng thường xuyên đến mức nào, chẳng hạn số lần đọc/ghi hay byte/giây, thì tỷ lệ hỏng hằng năm của HDD sẽ kém ý nghĩa hơn. Nếu mọi ổ đĩa đều chạy ở mức sử dụng 99% suốt cả năm thì lúc đó có thể hiểu được
Đến mức Backblaze phải cân nhắc liệu có nên tiếp tục dùng các ổ nhỏ hơn hay không vì thời gian rebuild và vì các ổ mật độ cao không chịu được mức hành hạ lớn hơn