2 điểm bởi GN⁺ 2025-08-15 | 1 bình luận | Chia sẻ qua WhatsApp
  • Huấn luyện một mô hình transformer kiểu GPT khoảng 1.8M tham số trên MacBook Pro trong 5 phút với khoảng 20M token TinyStories, đạt khoảng 9.6 perplexity
  • Ràng buộc chính của việc huấn luyện trong 5 phút là kích thước mô hình và số token có thể xử lý; mô hình càng lớn thì hội tụ càng chậm và hiệu quả giảm do dữ liệu ít
  • Về tối ưu hiệu năng, dùng MPS, còn thay vì compile/lượng tử hóa/tích lũy gradient hay thay PyTorch thì chọn mô hình nhỏ hơn hiệu quả hơn
  • Các bộ dữ liệu đơn giản và nhất quán như TinyStories có tác động tích cực hơn đến hiệu năng của mô hình nhỏ so với dữ liệu kiểu bách khoa toàn thư
  • Kiến trúc transformer cho kết quả tốt hơn LSTM hay diffusion trong điều kiện kích thước nhỏ và thời gian huấn luyện ngắn

Tổng quan

Bài viết này trình bày kết quả thử nghiệm về mô hình ngôn ngữ AI có hiệu năng tối đa có thể được huấn luyện trên laptop (MacBook Pro) trong 5 phút, cùng với các insight về chiến lược huấn luyện tối ưu, lựa chọn bộ dữ liệu và kiến trúc mô hình.

Tóm tắt kết quả thử nghiệm

  • Huấn luyện một mô hình transformer kiểu GPT khoảng 1.8M tham số với khoảng 20M dữ liệu TinyStories, ghi nhận 9.6 perplexity
  • Ví dụ sinh văn bản tuy ngắn nhưng có dạng câu chuyện nhất quán, với ngữ pháp tiếng Anh nhìn chung được giữ đúng
  • Nhấn mạnh rằng kết quả mô hình ở mức thực dụng trong vòng 5 phút là tốt hơn kỳ vọng

Bối cảnh và giới hạn của thử nghiệm

  • Đây là một thử nghiệm xuất phát từ sự tò mò mang tính không thực tế: huấn luyện nhanh một mô hình mạnh trong môi trường laptop
  • Trên thực tế có thể huấn luyện các mô hình mạnh hơn bằng GPU hiệu năng cao trên cloud (như H100), nhưng ràng buộc của thử nghiệm này là thời gian (5 phút)
  • Kích thước mô hình càng lớn thì tốc độ xử lý token càng chậm, khiến việc đạt kết quả tốt trong 5 phút trở nên khó khăn
    • Các mô hình quá nhỏ (ví dụ: 10K tham số) không thể học đủ độ phức tạp
    • Phạm vi thực dụng là các mô hình khoảng 1M~2M tham số

Tối ưu thông lượng xử lý

  • Dùng MPS (Metal Performance Shaders của Apple) là hiệu quả nhất
  • Các tối ưu toán học như torch.compile, float16, MLX... cho hiệu quả cải thiện thấp hơn kỳ vọng, thậm chí còn làm giảm hiệu năng
  • Tích lũy gradient có mục đích quản lý bộ nhớ, nhưng trên thực tế làm giảm tốc độ nghiêm trọng
  • Mô hình cần có khả năng cập nhật weight nhanh trong bộ nhớ nội bộ để đạt hiệu quả

Lựa chọn bộ dữ liệu

  • Khi dùng số token hạn chế (khoảng 10~20M), ban đầu tác giả thử dữ liệu wiki tiếng Anh đơn giản như Simple English Wikipedia; kết quả là giữ được tính nhất quán ngữ pháp nhưng thiếu nhất quán về ngữ nghĩa
    • Nội dung thiên về danh từ riêng, liệt kê các sự kiện có cảm giác gượng ép nên bị hạn chế trong việc tạo ra nội dung có ý nghĩa
  • Khi dùng bộ dữ liệu TinyStories, do cấu trúc câu chuyện rõ ràng và ngôn ngữ đơn giản nên kết quả nhất quán và có ý nghĩa hơn nhiều
    • Đây là các câu chuyện ở mức trẻ 4 tuổi, nên mô hình nhỏ cũng học tốt

Tokenizer và token hóa

  • Việc huấn luyện tokenizer không được tính trong 5 phút, và do quy mô dữ liệu nhỏ nên nhu cầu tối ưu hóa cũng thấp
  • Học các token đa byte dễ hơn cho quá trình huấn luyện mô hình

Thử nghiệm kiến trúc mô hình

  • Sử dụng kiến trúc transformer (kiểu GPT-2)

    • Điều chỉnh các siêu tham số như 2~3 layer, hàm kích hoạt SwiGLU, positional embedding...
    • LSTM có hiệu năng gần sát nhưng transformer vẫn tốt hơn về perplexity
    • Dropout, mixture-of-experts... không hiệu quả vì quy mô quá nhỏ
    • Curriculum learning gần như không có tác dụng vì thời gian huấn luyện quá ngắn
  • Thử mô hình diffusion (D3PM)

    • Vì ngôn ngữ tự nhiên là các token rời rạc, quá trình khuếch tán chỉ tạo ra các token ngẫu nhiên vô nghĩa nên thất bại
    • So với transformer hay LSTM, rất khó hình thành cấu trúc câu nhanh

Mối quan hệ giữa kích thước mô hình và thông lượng token/giây

  • Các mô hình 1M~2M tham số là điểm ngọt lý tưởng nhất
    • Quá lớn thì không thể hội tụ trong 5 phút, quá nhỏ thì chạm trần hiệu năng gần như ngay lập tức
  • Kết quả thử nghiệm nhìn chung phù hợp với Chinchilla scaling law
    • Kích thước mô hình lý tưởng là tổng số token huấn luyện/20, và điều này cũng được xác nhận trong thử nghiệm này

Kết luận và hàm ý

  • Ngay cả với thời gian rất ngắn và phần cứng nhỏ, việc huấn luyện một mô hình kể chuyện nhất quán vẫn khả thi
  • Việc huấn luyện trong 5 phút không phù hợp để phát triển mô hình mạnh, nhưng vẫn có ý nghĩa với thiết kế mô hình nhỏ, siêu nhẹ và các thử nghiệm tối ưu phần cứng/kiến trúc
  • Trong tương lai, khi GPU trên laptop và cấu trúc mô hình tiếp tục phát triển, hiệu năng của các mô hình có thể được huấn luyện chỉ trong vài phút vẫn còn nhiều tiềm năng cải thiện

1 bình luận

 
GN⁺ 2025-08-15
Ý kiến Hacker News
  • Muốn xem bài nói chuyện của anh ấy về mật mã lượng tử, và thắc mắc liệu có ai biết link của bài nói chuyện được nhắc tới ở đầu video không

  • Việc huấn luyện tối ưu cho các mô hình nhỏ không chỉ quan trọng về mặt khả năng tiếp cận mà còn cả với nghiên cứu khoa học về LLM; giống như sinh học dùng các sinh vật đơn giản như nấm men để nghiên cứu, ta cần nghiên cứu những transformer đơn giản nhất nhưng vẫn thể hiện các hành vi thú vị của mô hình lớn để có thể hiểu và kiểm soát chúng

    • Một trong những podcast gây ấn tượng gần đây là về bài báo và bộ dữ liệu Tiny Stories; bộ dữ liệu này chỉ gồm các từ và khái niệm đơn giản như truyện cổ tích cho trẻ nhỏ, nhưng nhờ đó ngay cả mô hình nhỏ cũng có thể sinh tiếng Anh với ngữ pháp, tính đa dạng và khả năng suy luận; bản thân podcast với tác giả cũng giải thích rất hay về năng lực của LLM bằng một ví dụ nghiên cứu nhỏ và có kiểm soát; theo phép so sánh sinh học, bộ dữ liệu này có lẽ giống như đĩa thạch agar, tức một môi trường rất đơn giản và được kiểm soát chặt; link liên quan là tập podcast, bài báo TinyStories

    • Nhiều doanh nghiệp có thể dùng các bộ dữ liệu riêng như lịch sử mua hàng của người dùng để giải quyết các bài toán kinh doanh thực tế bằng mô hình nhỏ; những tiến bộ từ mô hình ngôn ngữ lớn cũng có thể được áp dụng nguyên vẹn cho các bài toán nhỏ nếu chuỗi đầu vào có thể được biểu diễn bằng một ngôn ngữ chuyên biệt

    • Đây là điều đã được biết đến rộng rãi: các hành vi và tối ưu hóa xuất hiện ở mô hình nhỏ thường không được tái hiện tốt ở mô hình lớn

    • Công việc tác giả đang làm ở đây là pretraining, thường là việc của các nhà làm mô hình như Google hay Meta; còn với bài toán kinh doanh thì fine-tuning hoặc, ít hơn một chút, continued pretraining thực tế hơn nhiều; họ nhấn mạnh rằng tác giả đang thử điều này vì lý do học thuật

    • Có hứng thú với những mô hình chạy nhanh trên laptop, nhưng riêng quá trình huấn luyện thì vẫn có thể mất vài ngày hoặc hơn

  • Có ý kiến rằng nên lấy năng lượng thay vì thời gian làm chuẩn, tức là huấn luyện mô hình tốt nhất trong một mức ngân sách năng lượng tính bằng joule mới là phép so sánh thực sự, khi đó việc so giữa MBP và H100 cũng sẽ công bằng hơn

    • Điểm cốt lõi ở đây không phải là hiệu suất mà là ‘khả năng tiếp cận’, vì H100 không phải sản phẩm dùng hằng ngày còn laptop thì có

    • Theo hiểu biết của người này, Mac cạnh tranh hơn về mức tiêu thụ điện, vì nó không ngốn điện như GPU Nvidia; ngoài ra, có thể thuê H100 với giá dưới 10 USD một giờ, nên cũng sẽ thú vị nếu so hiệu năng của các mô hình có thể huấn luyện trong vòng dưới 1 giờ

    • Dùng tiêu chí nào cũng được, hơi tùy ý một chút cũng không sao

    • Nếu ý là muốn biểu diễn một chỉ số thực tế kiểu “dựa trên laptop” hay “dựa trên MacBook Pro”, thì nên nói rõ mục tiêu hơn

  • Cảm giác như giờ nên tổ chức Olympic về hiệu quả AI: laptop hay desktop, điện thoại, 5 phút, 1 giờ, 1 ngày, 1 tuần, trên thuyền hay cùng với dê đều được, miễn là vui

    • “Cùng với dê” chắc là đang ám chỉ Llama; vần điệu thì hơi hạn chế nhưng nếu nói bằng accent Boston chắc còn buồn cười hơn

    • Có một tiểu thuyết của Vernor Vinge kể chuyện con người chế tạo máy tính cờ vua cầm tay để dùng làm trợ lý trong trận đấu; sẽ khá thú vị nếu ở giải đấu ngoài đồng hồ cờ còn cấp luôn cả điện, vì khi đó người tham gia có thể cân nhắc những nước đi có lợi cho AI của mình

    • Một câu đùa kiểu dùng Mac Studio M3 Ultra 512GB để đẩy hiệu năng lên cực hạn, với cái thuyền đó thì chở cả dê cũng nổi

    • Đùa rằng dê có quá nhiều tham số nên gần như cấp GPT-4 rồi

    • Nếu có GoatLM thì sẵn sàng trả tiền

  • Với ví dụ nhảm kiểu "Paris, France is a city in North Carolina...", người này thích cụm “officially major people” và tò mò không biết có thể dùng nó trong hội thoại hằng ngày như thế nào

  • Có ý kiến nói bài này gợi nhớ đến bài báo “cramming” vài năm trước, trong đó tác giả thử huấn luyện mô hình tối ưu trên laptop hiện đại trong một ngày, kèm link bài báo

  • Có người cho rằng chỉ cần áp dụng vài thủ thuật từ các nỗ lực speedrun GPT-2 như Muon, khởi tạo trọng số tốt hơn, và điều chỉnh learning rate cẩn thận là kết quả đã có thể tốt hơn rất nhiều; tài liệu liên quan ở đây

  • Có ý kiến cho rằng AI còn thiếu một demoscene, kiểu văn hóa phô diễn kỹ thuật với tài nguyên cực nhỏ như các demo đồ họa thập niên 90

  • Có cảm giác việc tạo ra các mô hình nhỏ, chuyên biệt hơn, và tạo ngay khi cần cũng rất có giá trị; không phải lúc nào cũng cần một mô hình lớn biết mọi thứ, mà cần hơn một mô hình tập trung bằng laser vào đúng domain mình làm việc và chạy thật nhanh; người này muốn có thể bảo một LLM lớn rằng “hãy viết script để huấn luyện một mô hình tối ưu cho <tác vụ cần làm>” rồi đem chạy mô hình đó; nhưng trong lúc đang viết bình luận thì Google đã phát hành Gemma 3 270M

    • Thực tế thì trong machine learning, một xu hướng là mô hình tổng quát lại cho hiệu năng tốt hơn cả mô hình chuyên biệt ngay trên chính tác vụ của chuyên gia đó
  • Dùng ví dụ đầu ra nhảm kiểu "Paris, France is a city in North Carolina..." để nói rằng chỉ cần có kỹ thuật giúp mô hình biết nói “I don't know” thì mô hình nhỏ sẽ hữu ích hơn rất nhiều; lý do cần LLM cực lớn là vì phạm vi quá rộng nên phải tránh bịa đặt; sẽ rất tốt nếu có thể huấn luyện chatbot chăm sóc khách hàng trên laptop trong thời gian hợp lý, nhưng ngoài domain đó thì khả năng cao nó sẽ trả lời sai lệch nghiêm trọng

    • Có ý kiến cho rằng dùng một AI được huấn luyện trên laptop chỉ trong 5 phút để bàn về giới hạn của mô hình nhỏ là hơi gượng ép; tất nhiên vấn đề hallucination vẫn rất lớn, nhưng cũng không thấy bài viết này mang lại thêm nhiều insight về khía cạnh đó