Tôi đã thêm ở cuối bài viết về AlphaChip (https://vighneshiyer.com/misc/ml-for-placement/) phần phản hồi của Google và một phụ lục bàn về thuật toán AlphaChip nói chung
Tóm lại, tôi cho rằng các tác giả bài Nature đã đưa ra một số phê bình hợp lý về phương pháp huấn luyện của các tác giả ISPD. Tuy vậy, AlphaChip vẫn kém cạnh tranh hơn trình lập floorplan tự động thương mại và AutoDMP vì chi phí tính toán và thời gian chạy quá lớn. Dù vậy, các tác giả ISPD vẫn nên đưa ra một nghiên cứu chặt chẽ hơn để xử lý toàn bộ các phê bình từ phía tác giả Nature, và ngay cả việc chỉ đánh giá các checkpoint tiền huấn luyện mà Google công bố cũng sẽ là dữ liệu hữu ích cho cuộc tranh luận này
Trong phần kết bài có viết rằng “dù tôi thừa nhận có những điểm mà các tác giả ISPD có thể làm tốt hơn, kết luận vẫn còn giá trị. Các tác giả Nature không đề cập đến việc CMP và AutoDMP cho hiệu năng tốt hơn CT với thời gian chạy và yêu cầu tính toán thấp hơn rất nhiều”, nhưng một trong những điểm cốt lõi của phản biện là tài nguyên dùng để so sánh nhỏ hơn rất nhiều
Chỉ riêng lý do này thôi dường như cũng đã đủ để đặt nghi vấn về tính hợp lệ của kết luận nghiên cứu ISPD, nên tôi muốn biết bạn nhìn nhận thế nào. Ngoài ra, bình luận này có giọng điệu trung lập, trong khi trong bài bạn dùng các từ như “arrogance”, “disdain”, “hyperbole”, “belittling”, “hostile” để nói về các tác giả AlphaChip, còn với phó chủ tịch của Synopsys thì lại dùng từ “excellent”, nên tôi cũng tò mò sự khác biệt đó đến từ đâu
Nếu mức dùng là 16 GPU trong khoảng 6 giờ cho suy luận, và 48 giờ cho tiền huấn luyện, thì đó không phải lượng tính toán quá mức
Trên cloud, GPU có giá khoảng 1~2 USD mỗi giờ, nên suy luận vào khoảng 100~200 USD, còn tiền huấn luyện khoảng 800~1600 USD, và chi phí tiền huấn luyện được khấu hao qua nhiều con chip. Giá cloud gần như là mức trần, và phần lớn các phòng thí nghiệm khoa học máy tính đều có tài nguyên on-premise nhiều hơn đáng kể mức này. Trong môi trường công nghiệp, các chi phí đó hoàn toàn nhỏ bé so với phần còn lại của quy trình thiết kế chip, và riêng chi phí giấy phép phần mềm EDA thương mại cũng đã ở mức hàng triệu USD
Ở thời điểm này, tôi không thấy có lý do gì để không mặc định dành cho Jeff Dean ít nhất một mức độ tin cậy tối thiểu. Thành tích của ông ấy rất khó đem ra so với bất kỳ ai, và ông ấy vẫn đang hoạt động tích cực. Có chuyện gì từng xảy ra đủ để phủ bóng lên ông ấy không? Đôi khi chính người đưa thông điệp cũng mang lại trọng lượng cho nó
Trong chuyện này, ông ấy có vẻ đã đứng cùng phe với những người không đúng. Về bản chất ông ấy là người xây dựng hệ thống, chứ không phải chuyên gia thiết kế chip hay EDA, và nói nghiêm ngặt thì cũng không phải nhà nghiên cứu machine learning
Cũng sẽ có người cho rằng ông ấy bị lôi kéo bởi một tay lừa đảo trẻ tuổi đầy sức hút, và giờ đã lún quá sâu nên khó mà rút lui. Việc ông ấy tập trung vào dự án này cũng không giúp ích gì cho vị thế của ông ấy trong Google; năm ngoái mọi việc quan trọng đều đã chuyển sang cho Demis, còn ông ấy chỉ còn lại một chức danh gần như mang tính danh dự. Nghĩ đến những thành tựu của ông ấy thì khá đáng tiếc
Nếu là lúc Jeff Dean đi nói chuyện vào các năm 2020, 2021, 2022 thì mức tin cậy đó còn hợp lý. Nhưng bây giờ ông ấy đang đáp lại sự hoài nghi của cộng đồng EDA bằng các công kích cá nhân phi học thuật và những ám chỉ mơ hồ rằng “nhiều công ty” đang dùng nó
Tôi nghĩ giờ đã qua giai đoạn nên mặc định thiện chí, và đã bước vào vùng có thể nghi ngờ ở mức đáng kể
Tôi thắc mắc vì sao cuộc tranh cãi này lại có quá nhiều cảm xúc và khó chịu đến vậy. Làm sao một tranh luận học thuật nhàm chán về benchmark hay ý nghĩa thống kê lại biến thành một cuộc đấu đá công kích cá nhân như thế này?
Có rất nhiều người làm theo cách triển khai không dùng AI
Đưa ra những tuyên bố lớn lao mà không có cách tái lập, rồi chạy đến báo chí thì báo chí sẽ nuốt hết mọi thứ
Câu kiểu “AI thiết kế AI... à không, thiết kế chip” nghe rất tương lai với dân học ngành xã hội, và có vẻ cũng vậy với cả các lập trình viên lẽ ra phải hoài nghi với mọi thứ gắn mác “AI”. Ngay từ việc đăng trên Nature, toàn bộ quy trình xuất bản đã có vẻ thiếu trung thực. Sao lại không phải là một nơi như ISCCC?
Vì tiền
Nếu bạn thấy mức này đã là khó chịu thì nên xem các nhà hoạt động môi trường trên Twitter tấn công Jeff Dean
Vấn đề là động cơ thương mại của Big Tech xung quanh AI đã làm đục dòng nước của “học thuật nhàm chán”, tạo ra những quảng cáo thông tin thiếu trung thực được ngụy trang thành bài báo tạp chí hoặc preprint trên arXiv[1]
Hệ quả là nghiên cứu AI hiện đại đang trải qua khủng hoảng khả năng tái lập còn tệ hơn nhiều so với khoa học xã hội, trong khi có ít lý do bào chữa chính đáng hơn hẳn. Nếu Google không nói dối thì chỉ cần công bố dữ liệu benchmark để những người độc lập có thể xem xét là đã xóa bớt được rất nhiều tranh cãi, nhưng họ vẫn từ chối: https://cacm.acm.org/news/updates-spark-uproar/ Có vẻ Google nghĩ rằng mọi người nên chấp nhận kết luận chỉ vì thẩm quyền của họ. Ngoài ra, bài báo bị rò rỉ của người tố giác nội bộ Satrajit Chatterjee, người bị Google sa thải vào năm 2022, nói rằng lợi thế “30~35%” của RePlAce phù hợp với các kết quả bác bỏ những tuyên bố “siêu phàm” mà Google từng đưa ra về cách tiếp cận AI cho thiết kế chip vào thời điểm đó. Những “công kích cá nhân” nhắm vào Jeff Dean là hoàn toàn thích đáng, vì cốt lõi của chỉ trích nằm ở chỗ tính cách của ông ấy là thiếu trung thực và độc đoán. Ông ấy công bố nghiên cứu đáng ngờ rồi sa thải những người phản đối
[1] Việc Jeff Dean cười nhạo bài báo phê bình chỉ vì đó là bài hội thảo là đặc biệt kinh tởm. Một thái độ tệ hại đến khó tin
Theo tweet của Jeff Dean, Cheng và cộng sự đã không làm theo các quy trình cần thiết để tái hiện công trình của các nhà nghiên cứu Google
Cụ thể, ông nói rằng “các tác giả hoàn toàn không dùng tiền huấn luyện, dù bài báo trên Nature nhắc đến tiền huấn luyện 37 lần, nên họ đã tước đi khả năng để phương pháp dựa trên học tập học được từ các thiết kế chip khác”. Tuy nhiên, kho Circuit Training của Google[1] lại ghi rõ rằng “kết quả huấn luyện từ đầu tương tự hoặc tốt hơn kết quả trong bài báo thu được bằng cách fine-tune mô hình đã tiền huấn luyện”. Có thể tôi đang hiểu sai điều gì đó, nhưng rốt cuộc là bên nào đúng? Họ thất bại vì không tiền huấn luyện, hay họ đã cố gắng tái hiện một cách công bằng bằng cách làm theo “quy trình” được ghi trong chính kho mã? Việc nhóm UCSD phải đảo ngược kỹ thuật nhiều bước khiến có vẻ như chỉ riêng kết quả trong bài báo là chưa đủ để tái hiện
[1]: https://github.com/google-research/circuit_training/blob/mai...
Trong bài của Markov cũng có các liên kết đến những bài báo của các nhóm tác giả khác nhau trong Google, và ở đó lợi ích của tiền huấn luyện cũng xuất hiện rất nhỏ
Hơn nữa, khi số lượng benchmark ít, việc dùng một mô hình tiền huấn luyện của Google mà không rõ nguồn gốc có thể phản tác dụng. Có khả năng Google đã huấn luyện trên tất cả benchmark sẵn có để khiến mô hình chỉ lặp lại lời giải tối ưu của các công cụ thương mại
“Huấn luyện từ đầu” cũng có thể có nghĩa là trộn các lần thử thiết kế mới với các thiết kế trước đây
Khi đó sẽ không có mâu thuẫn. Khác biệt nằm ở giữa cách tiền huấn luyện trên các thiết kế cũ rồi fine-tune trên thiết kế mới, và cách huấn luyện ngay từ đầu bằng cách trộn toàn bộ dữ liệu trong toàn bộ khoảng thời gian. Fine-tune có thể gây ra quên thảm khốc, và cả hai cách đều có thể cho hiệu năng tốt hơn so với việc hoàn toàn không đưa các thiết kế cũ vào
Kho Circuit Training gần giống như chỉ để minh họa một ví dụ đơn giản. Việc kho mã nguồn mở mô tả một ví dụ đơn giản để kiểm tra cấu hình hay xác minh là chuyện bình thường, và điều đó không có nghĩa đây nói chung là cách để đạt kết quả tối ưu
Sự nhầm lẫn có thể bắt nguồn từ việc ví dụ đó nói rằng nó cho ra kết quả tương tự kết quả có tiền huấn luyện trong bài báo. Nhưng điều này rõ ràng không phủ nhận tiền huấn luyện nói chung. Nếu Cheng và cộng sự thực sự cảm thấy mơ hồ, họ lẽ ra nên hỏi tác giả liên hệ. Nếu họ cảm thấy phải “đảo ngược kỹ thuật” một phần kho mã, họ cũng lẽ ra nên hỏi về việc đó
Chatterjee, người bị mô tả như phản diện trong bài được dẫn, có vẻ giờ đang kiện Google. Có vẻ anh ta cho rằng mình bị sa thải vì đã chỉ ra rằng cấp trên là Jeff Dean đang công bố những tuyên bố mà ông biết là sai sự thật
Câu “Nói rõ ra, không có bằng chứng nào khiến chúng tôi tin rằng RL tốt hơn trình độ tiên tiến trong học thuật hay các công cụ đặt macro thương mại mạnh nhất. Việc so sánh với nhóm sau quá sơ sài, đến mức trong nhiều trường hợp các công cụ thương mại thậm chí còn không chạy được vì lỗi cài đặt” được cho là ảnh chụp màn hình từ bài trình bày nội bộ của Jeff Dean. https://regmedia.co.uk/2023/03/26/satrajit_vs_google.pdf Với người ngoài cuộc, rất khó đánh giá liệu Chatterjee là một tuyển dụng tệ hại và tốn kém đã kìm hãm các kết quả tốt của đồng nghiệp, hay là một nhân viên cực kỳ giá trị đã cố ngăn chặn một bài trình bày sai sự thật
Quả thực đã có rất nhiều thời gian bị lãng phí
Ông ấy thậm chí còn làm nghiên cứu nội bộ cùng Markov, nhưng các tác giả AlphaChip giải thích như sau. Năm 2022, một ủy ban độc lập của Google đã xem xét và kết luận rằng “các tuyên bố và kết luận trong bản thảo không được các thí nghiệm hỗ trợ một cách khoa học”, đồng thời nói rằng “khi các kết quả trên bộ dữ liệu gốc của [AlphaChip] được tái lập độc lập, chúng đã làm dấy lên nghi vấn về các kết quả RL của [Markov et al.]”. Các tác giả cho biết họ đã cung cấp cho ủy ban một script một dòng tạo ra kết quả RL tốt hơn rất nhiều so với những gì Markov và cộng sự báo cáo, và các kết quả này thậm chí còn tốt hơn cả baseline mô phỏng tôi luyện “mạnh hơn” của họ. Họ nói rằng đến giờ vẫn chưa biết Markov và các đồng tác giả đã tạo ra các con số trong bài báo như thế nào
(https://arxiv.org/pdf/2411.10053)
Việc tuyển những người sẵn sàng thực hiện gian lận hay thao túng trong học thuật, tài chính và các lĩnh vực khác thực sự là một vấn đề lớn
Cách tốt nhất, và có lẽ là duy nhất, để giảm chuyện đó là động lực nội bộ, cơ chế kiểm soát và văn hóa. Nếu bạn liên tục đòi hỏi những cải thiện vô tận vài phần trăm qua từng chu kỳ, trong khi lại thăng chức cho những người đều đặn mang về thành tích mà ngay từ đầu chẳng ai xác minh xem có thật hay không, thì rốt cuộc chuyện này sẽ xảy ra bất kể quy mô. Nó có thể xảy ra ở một nhóm nhỏ, một bộ phận, một công ty, một quỹ hedge fund nắm nhiều công ty như vậy, các quỹ của những quỹ đó, hay ở chính phủ liên bang. Chẳng bao lâu, giới lãnh đạo sẽ bị những người vô lương tâm thâm nhập đáng kể. Hàng loạt bê bối xuất bản trong giới học thuật và vô số vụ việc trong tài chính là ví dụ. Holmes và SBF đang ngồi tù, nhưng những người cùng phe với các nhà tài trợ của họ vẫn ở đỉnh cao quyền lực, vẫn mang cùng hệ tư tưởng đó đi khắp nơi và còn có luật sư giỏi hơn. Có câu cũ rằng “cá thối từ đầu”. Nếu nhìn vào đủ loại điều mờ ám và bê bối liên miên của các lãnh đạo mang tính biểu tượng trong ngành STEM mà lại nói “làm tốt lắm, hệ thống đã bị qua mặt”, thì khó có thể mong đợi điều gì khác ngoài việc trật tự cũ vốn trung thực và công bằng bị tấn công trên mọi mặt trận. Rốt cuộc, chúng ta cũng đã bỏ phiếu bằng chính đôi chân cho một lý tưởng gần như tôn giáo rằng “kẻ mạnh là lẽ phải”, và tôi cũng từng là một phần của nó trước khi bỏ đi vì ghê tởm. Nó được gọi bằng nhiều tên như Objectivism, Effective Altruism, Capitalism, nhưng cũng chẳng phải chủ nghĩa tư bản thật sự. Không thể ngạc nhiên khi mọi thứ đều bị vấy bẩn một cách nhớp nhúa. Tôi không biết câu trả lời hôm nay là gì. Có lẽ là làm việc ở những công ty bớt tệ hơn, vạch trần lạm dụng ít nhất là một cách ẩn danh, và lắng nghe rồi soi xét kỹ các phát ngôn phỏng vấn của lãnh đạo. Tôi cũng muốn nghe thêm đề xuất khác
Tôi hiểu vì sao Jeff bị gây áp lực phải trả lời chuyện này. Tên ông ấy có trên gần như toàn bộ đầu ra nghiên cứu của “Google Brain”
Nhưng kiểu đáp trả “họ không tái lập được vì họ ngu, nên nó vẫn tái lập được” không phải phản biện mà là bắt nạt. Có vẻ như các nhà phê bình đã chạm đúng chỗ nhức nhối, và ông ấy không có cách nào hay để bác bỏ các vấn đề về tính tái lập mà nghiên cứu của ông phơi bày
Tweet được dẫn không đưa ra tuyên bố như vậy. Lập luận của ông ấy là “họ không tái lập được vì không làm đúng quy trình”, và dù động cơ là gì thì đó vẫn có vẻ là một lập luận khá hợp lý
Nếu họ thất bại sau khi không làm theo quy trình tái lập, chẳng hạn như tiền huấn luyện trước hoặc dùng đủ lượng tính toán, thì tôi không thấy có vấn đề gì khi chỉ ra khuyết điểm của nỗ lực “tái lập” đó
Điều đó được viết ở đâu? Trong tweet, Dean nêu ra các bước cụ thể mà các tác giả đã bỏ sót
May là ông ấy đã không nói như vậy
Tweet chỉ nói rằng nỗ lực tái lập trên thực tế đã không làm theo phương pháp gốc. Không có chỗ nào gọi các tác giả tái lập là “ngu” hay điều gì tương tự; đó hoàn toàn là bịa ra. Và cái logic sai rành rành rằng “không tái lập được nên vẫn tái lập được” cũng là ngụy tạo hoàn toàn
Thật buồn cười khi lại cho rằng có thiên kiến vì nhà tuyển dụng của người chỉ trích. Như thể làm việc ở Google thì không có xung đột lợi ích vậy
Chẳng phải Google là công ty đang liều mạng thổi phồng đủ thứ phát triển AI kiểu “tôi cũng làm được” để đẩy giá cổ phiếu sao? Có vẻ Jeff đã uống quá nhiều Kool-Aid đến mức quên cả nước là gì
Bằng chứng cuối cùng của Google là làm ra con chip tốt hơn đối thủ. Hiện tại thì họ chưa làm được
Chỉ trích rằng “khi tái lập phương pháp của chúng tôi, các anh đã không dùng đủ tài nguyên tính toán” nghe hơi buồn cười trong thời buổi này. Ừ thì đúng thôi, vì các anh là Google mà
Nghe như đang nói rằng nếu không sở hữu cloud thì chúng tôi không thể kiểm chứng phương pháp luận của các anh. Dù đúng là nhiều tính toán hơn và tiền huấn luyện nhiều hơn có ích thì cũng chẳng có gì đáng ngạc nhiên, nhưng như vậy việc xác minh sẽ khó hơn. Cũng có một khía cạnh ngược lại khá thú vị. Google có lượng tài nguyên tính toán khổng lồ, nhưng Synopsys lại có lượng dữ liệu để huấn luyện khổng lồ. Tất nhiên, điều kiện rất lớn ở đây là liệu có được phép huấn luyện trên tài sản trí tuệ của khách hàng hay không
Các nhà thiết kế chip chạy công cụ EDA on-premise. Công ty EDA thì làm sao tiếp cận dữ liệu khách hàng được? Có thể dưới NDA vì mục đích gỡ lỗi, nhưng như vậy cũng không có nghĩa là họ có thể huấn luyện bằng tài sản trí tuệ của khách hàng
1 bình luận
Ý kiến Hacker News
Tôi đã thêm ở cuối bài viết về AlphaChip (https://vighneshiyer.com/misc/ml-for-placement/) phần phản hồi của Google và một phụ lục bàn về thuật toán AlphaChip nói chung
Tóm lại, tôi cho rằng các tác giả bài Nature đã đưa ra một số phê bình hợp lý về phương pháp huấn luyện của các tác giả ISPD. Tuy vậy, AlphaChip vẫn kém cạnh tranh hơn trình lập floorplan tự động thương mại và AutoDMP vì chi phí tính toán và thời gian chạy quá lớn. Dù vậy, các tác giả ISPD vẫn nên đưa ra một nghiên cứu chặt chẽ hơn để xử lý toàn bộ các phê bình từ phía tác giả Nature, và ngay cả việc chỉ đánh giá các checkpoint tiền huấn luyện mà Google công bố cũng sẽ là dữ liệu hữu ích cho cuộc tranh luận này
Chỉ riêng lý do này thôi dường như cũng đã đủ để đặt nghi vấn về tính hợp lệ của kết luận nghiên cứu ISPD, nên tôi muốn biết bạn nhìn nhận thế nào. Ngoài ra, bình luận này có giọng điệu trung lập, trong khi trong bài bạn dùng các từ như “arrogance”, “disdain”, “hyperbole”, “belittling”, “hostile” để nói về các tác giả AlphaChip, còn với phó chủ tịch của Synopsys thì lại dùng từ “excellent”, nên tôi cũng tò mò sự khác biệt đó đến từ đâu
Trên cloud, GPU có giá khoảng 1~2 USD mỗi giờ, nên suy luận vào khoảng 100~200 USD, còn tiền huấn luyện khoảng 800~1600 USD, và chi phí tiền huấn luyện được khấu hao qua nhiều con chip. Giá cloud gần như là mức trần, và phần lớn các phòng thí nghiệm khoa học máy tính đều có tài nguyên on-premise nhiều hơn đáng kể mức này. Trong môi trường công nghiệp, các chi phí đó hoàn toàn nhỏ bé so với phần còn lại của quy trình thiết kế chip, và riêng chi phí giấy phép phần mềm EDA thương mại cũng đã ở mức hàng triệu USD
Ở thời điểm này, tôi không thấy có lý do gì để không mặc định dành cho Jeff Dean ít nhất một mức độ tin cậy tối thiểu. Thành tích của ông ấy rất khó đem ra so với bất kỳ ai, và ông ấy vẫn đang hoạt động tích cực. Có chuyện gì từng xảy ra đủ để phủ bóng lên ông ấy không? Đôi khi chính người đưa thông điệp cũng mang lại trọng lượng cho nó
Cũng sẽ có người cho rằng ông ấy bị lôi kéo bởi một tay lừa đảo trẻ tuổi đầy sức hút, và giờ đã lún quá sâu nên khó mà rút lui. Việc ông ấy tập trung vào dự án này cũng không giúp ích gì cho vị thế của ông ấy trong Google; năm ngoái mọi việc quan trọng đều đã chuyển sang cho Demis, còn ông ấy chỉ còn lại một chức danh gần như mang tính danh dự. Nghĩ đến những thành tựu của ông ấy thì khá đáng tiếc
Tôi nghĩ giờ đã qua giai đoạn nên mặc định thiện chí, và đã bước vào vùng có thể nghi ngờ ở mức đáng kể
Tôi thắc mắc vì sao cuộc tranh cãi này lại có quá nhiều cảm xúc và khó chịu đến vậy. Làm sao một tranh luận học thuật nhàm chán về benchmark hay ý nghĩa thống kê lại biến thành một cuộc đấu đá công kích cá nhân như thế này?
Câu kiểu “AI thiết kế AI... à không, thiết kế chip” nghe rất tương lai với dân học ngành xã hội, và có vẻ cũng vậy với cả các lập trình viên lẽ ra phải hoài nghi với mọi thứ gắn mác “AI”. Ngay từ việc đăng trên Nature, toàn bộ quy trình xuất bản đã có vẻ thiếu trung thực. Sao lại không phải là một nơi như ISCCC?
Hệ quả là nghiên cứu AI hiện đại đang trải qua khủng hoảng khả năng tái lập còn tệ hơn nhiều so với khoa học xã hội, trong khi có ít lý do bào chữa chính đáng hơn hẳn. Nếu Google không nói dối thì chỉ cần công bố dữ liệu benchmark để những người độc lập có thể xem xét là đã xóa bớt được rất nhiều tranh cãi, nhưng họ vẫn từ chối: https://cacm.acm.org/news/updates-spark-uproar/ Có vẻ Google nghĩ rằng mọi người nên chấp nhận kết luận chỉ vì thẩm quyền của họ. Ngoài ra, bài báo bị rò rỉ của người tố giác nội bộ Satrajit Chatterjee, người bị Google sa thải vào năm 2022, nói rằng lợi thế “30~35%” của RePlAce phù hợp với các kết quả bác bỏ những tuyên bố “siêu phàm” mà Google từng đưa ra về cách tiếp cận AI cho thiết kế chip vào thời điểm đó. Những “công kích cá nhân” nhắm vào Jeff Dean là hoàn toàn thích đáng, vì cốt lõi của chỉ trích nằm ở chỗ tính cách của ông ấy là thiếu trung thực và độc đoán. Ông ấy công bố nghiên cứu đáng ngờ rồi sa thải những người phản đối
[1] Việc Jeff Dean cười nhạo bài báo phê bình chỉ vì đó là bài hội thảo là đặc biệt kinh tởm. Một thái độ tệ hại đến khó tin
Theo tweet của Jeff Dean, Cheng và cộng sự đã không làm theo các quy trình cần thiết để tái hiện công trình của các nhà nghiên cứu Google
Cụ thể, ông nói rằng “các tác giả hoàn toàn không dùng tiền huấn luyện, dù bài báo trên Nature nhắc đến tiền huấn luyện 37 lần, nên họ đã tước đi khả năng để phương pháp dựa trên học tập học được từ các thiết kế chip khác”. Tuy nhiên, kho Circuit Training của Google[1] lại ghi rõ rằng “kết quả huấn luyện từ đầu tương tự hoặc tốt hơn kết quả trong bài báo thu được bằng cách fine-tune mô hình đã tiền huấn luyện”. Có thể tôi đang hiểu sai điều gì đó, nhưng rốt cuộc là bên nào đúng? Họ thất bại vì không tiền huấn luyện, hay họ đã cố gắng tái hiện một cách công bằng bằng cách làm theo “quy trình” được ghi trong chính kho mã? Việc nhóm UCSD phải đảo ngược kỹ thuật nhiều bước khiến có vẻ như chỉ riêng kết quả trong bài báo là chưa đủ để tái hiện
[1]: https://github.com/google-research/circuit_training/blob/mai...
Hơn nữa, khi số lượng benchmark ít, việc dùng một mô hình tiền huấn luyện của Google mà không rõ nguồn gốc có thể phản tác dụng. Có khả năng Google đã huấn luyện trên tất cả benchmark sẵn có để khiến mô hình chỉ lặp lại lời giải tối ưu của các công cụ thương mại
Khi đó sẽ không có mâu thuẫn. Khác biệt nằm ở giữa cách tiền huấn luyện trên các thiết kế cũ rồi fine-tune trên thiết kế mới, và cách huấn luyện ngay từ đầu bằng cách trộn toàn bộ dữ liệu trong toàn bộ khoảng thời gian. Fine-tune có thể gây ra quên thảm khốc, và cả hai cách đều có thể cho hiệu năng tốt hơn so với việc hoàn toàn không đưa các thiết kế cũ vào
Sự nhầm lẫn có thể bắt nguồn từ việc ví dụ đó nói rằng nó cho ra kết quả tương tự kết quả có tiền huấn luyện trong bài báo. Nhưng điều này rõ ràng không phủ nhận tiền huấn luyện nói chung. Nếu Cheng và cộng sự thực sự cảm thấy mơ hồ, họ lẽ ra nên hỏi tác giả liên hệ. Nếu họ cảm thấy phải “đảo ngược kỹ thuật” một phần kho mã, họ cũng lẽ ra nên hỏi về việc đó
Các bài liên quan. Còn bài nào khác không?
AI Alone Isn't Ready for Chip Design - https://news.ycombinator.com/item?id=42207373 - tháng 11 năm 2024, 2 bình luận
That Chip Has Sailed: Critique of Unfounded Skepticism Around AI for Chip Design - https://news.ycombinator.com/item?id=42172967 - tháng 11 năm 2024, 9 bình luận
Reevaluating Google's Reinforcement Learning for IC Macro Placement (AlphaChip) - https://news.ycombinator.com/item?id=42042046 - tháng 11 năm 2024, 1 bình luận
How AlphaChip transformed computer chip design - https://news.ycombinator.com/item?id=41672110 - tháng 9 năm 2024, 194 bình luận
Tension Inside Google over a Fired AI Researcher’s Conduct - https://news.ycombinator.com/item?id=31576301 - tháng 5 năm 2022, 23 bình luận
Google is using AI to design chips that will accelerate AI - https://news.ycombinator.com/item?id=22717983 - tháng 3 năm 2020, 1 bình luận
Ngữ cảnh cho phần trả lời của Jeff Dean ở đây
https://news.ycombinator.com/item?id=41673769
https://news.ycombinator.com/item?id=41673808
Việc tuyển nhầm người có thể đắt đỏ đến mức nực cười: https://www.wired.com/story/google-brain-ai-researcher-fired...
Câu “Nói rõ ra, không có bằng chứng nào khiến chúng tôi tin rằng RL tốt hơn trình độ tiên tiến trong học thuật hay các công cụ đặt macro thương mại mạnh nhất. Việc so sánh với nhóm sau quá sơ sài, đến mức trong nhiều trường hợp các công cụ thương mại thậm chí còn không chạy được vì lỗi cài đặt” được cho là ảnh chụp màn hình từ bài trình bày nội bộ của Jeff Dean. https://regmedia.co.uk/2023/03/26/satrajit_vs_google.pdf Với người ngoài cuộc, rất khó đánh giá liệu Chatterjee là một tuyển dụng tệ hại và tốn kém đã kìm hãm các kết quả tốt của đồng nghiệp, hay là một nhân viên cực kỳ giá trị đã cố ngăn chặn một bài trình bày sai sự thật
Ông ấy thậm chí còn làm nghiên cứu nội bộ cùng Markov, nhưng các tác giả AlphaChip giải thích như sau. Năm 2022, một ủy ban độc lập của Google đã xem xét và kết luận rằng “các tuyên bố và kết luận trong bản thảo không được các thí nghiệm hỗ trợ một cách khoa học”, đồng thời nói rằng “khi các kết quả trên bộ dữ liệu gốc của [AlphaChip] được tái lập độc lập, chúng đã làm dấy lên nghi vấn về các kết quả RL của [Markov et al.]”. Các tác giả cho biết họ đã cung cấp cho ủy ban một script một dòng tạo ra kết quả RL tốt hơn rất nhiều so với những gì Markov và cộng sự báo cáo, và các kết quả này thậm chí còn tốt hơn cả baseline mô phỏng tôi luyện “mạnh hơn” của họ. Họ nói rằng đến giờ vẫn chưa biết Markov và các đồng tác giả đã tạo ra các con số trong bài báo như thế nào
(https://arxiv.org/pdf/2411.10053)
Cách tốt nhất, và có lẽ là duy nhất, để giảm chuyện đó là động lực nội bộ, cơ chế kiểm soát và văn hóa. Nếu bạn liên tục đòi hỏi những cải thiện vô tận vài phần trăm qua từng chu kỳ, trong khi lại thăng chức cho những người đều đặn mang về thành tích mà ngay từ đầu chẳng ai xác minh xem có thật hay không, thì rốt cuộc chuyện này sẽ xảy ra bất kể quy mô. Nó có thể xảy ra ở một nhóm nhỏ, một bộ phận, một công ty, một quỹ hedge fund nắm nhiều công ty như vậy, các quỹ của những quỹ đó, hay ở chính phủ liên bang. Chẳng bao lâu, giới lãnh đạo sẽ bị những người vô lương tâm thâm nhập đáng kể. Hàng loạt bê bối xuất bản trong giới học thuật và vô số vụ việc trong tài chính là ví dụ. Holmes và SBF đang ngồi tù, nhưng những người cùng phe với các nhà tài trợ của họ vẫn ở đỉnh cao quyền lực, vẫn mang cùng hệ tư tưởng đó đi khắp nơi và còn có luật sư giỏi hơn. Có câu cũ rằng “cá thối từ đầu”. Nếu nhìn vào đủ loại điều mờ ám và bê bối liên miên của các lãnh đạo mang tính biểu tượng trong ngành STEM mà lại nói “làm tốt lắm, hệ thống đã bị qua mặt”, thì khó có thể mong đợi điều gì khác ngoài việc trật tự cũ vốn trung thực và công bằng bị tấn công trên mọi mặt trận. Rốt cuộc, chúng ta cũng đã bỏ phiếu bằng chính đôi chân cho một lý tưởng gần như tôn giáo rằng “kẻ mạnh là lẽ phải”, và tôi cũng từng là một phần của nó trước khi bỏ đi vì ghê tởm. Nó được gọi bằng nhiều tên như Objectivism, Effective Altruism, Capitalism, nhưng cũng chẳng phải chủ nghĩa tư bản thật sự. Không thể ngạc nhiên khi mọi thứ đều bị vấy bẩn một cách nhớp nhúa. Tôi không biết câu trả lời hôm nay là gì. Có lẽ là làm việc ở những công ty bớt tệ hơn, vạch trần lạm dụng ít nhất là một cách ẩn danh, và lắng nghe rồi soi xét kỹ các phát ngôn phỏng vấn của lãnh đạo. Tôi cũng muốn nghe thêm đề xuất khác
Tôi hiểu vì sao Jeff bị gây áp lực phải trả lời chuyện này. Tên ông ấy có trên gần như toàn bộ đầu ra nghiên cứu của “Google Brain”
Nhưng kiểu đáp trả “họ không tái lập được vì họ ngu, nên nó vẫn tái lập được” không phải phản biện mà là bắt nạt. Có vẻ như các nhà phê bình đã chạm đúng chỗ nhức nhối, và ông ấy không có cách nào hay để bác bỏ các vấn đề về tính tái lập mà nghiên cứu của ông phơi bày
Tweet chỉ nói rằng nỗ lực tái lập trên thực tế đã không làm theo phương pháp gốc. Không có chỗ nào gọi các tác giả tái lập là “ngu” hay điều gì tương tự; đó hoàn toàn là bịa ra. Và cái logic sai rành rành rằng “không tái lập được nên vẫn tái lập được” cũng là ngụy tạo hoàn toàn
Chẳng phải Google là công ty đang liều mạng thổi phồng đủ thứ phát triển AI kiểu “tôi cũng làm được” để đẩy giá cổ phiếu sao? Có vẻ Jeff đã uống quá nhiều Kool-Aid đến mức quên cả nước là gì
Bằng chứng cuối cùng của Google là làm ra con chip tốt hơn đối thủ. Hiện tại thì họ chưa làm được
Chỉ trích rằng “khi tái lập phương pháp của chúng tôi, các anh đã không dùng đủ tài nguyên tính toán” nghe hơi buồn cười trong thời buổi này. Ừ thì đúng thôi, vì các anh là Google mà
Nghe như đang nói rằng nếu không sở hữu cloud thì chúng tôi không thể kiểm chứng phương pháp luận của các anh. Dù đúng là nhiều tính toán hơn và tiền huấn luyện nhiều hơn có ích thì cũng chẳng có gì đáng ngạc nhiên, nhưng như vậy việc xác minh sẽ khó hơn. Cũng có một khía cạnh ngược lại khá thú vị. Google có lượng tài nguyên tính toán khổng lồ, nhưng Synopsys lại có lượng dữ liệu để huấn luyện khổng lồ. Tất nhiên, điều kiện rất lớn ở đây là liệu có được phép huấn luyện trên tài sản trí tuệ của khách hàng hay không