- Nhiều startup và viện nghiên cứu cùng mua một cụm GPU để cùng đảm bảo nguồn lực tính toán cần thiết cho việc huấn luyện mô hình lớn
- Thay vì mỗi bên tự mua N GPU, K startup cùng nhau mua một cụm quy mô N×K
- Trình lập lịch job phân bổ tài nguyên tính toán công bằng theo tỷ lệ sở hữu, và khi có tài nguyên nhàn rỗi thì sẽ cấp thêm
- Thay vì phải lấp đầy 128 A100 suốt cả tháng, có thể burst lên 512 A100 trong một tuần để huấn luyện mô hình nhanh hơn
- Cấu trúc này mang cách phân bổ burst vốn chỉ các phòng nghiên cứu lớn như OpenAI, Deepmind mới có cho cả startup
Ý tưởng cốt lõi
- Thay vì K startup mỗi bên tự mua một cụm N GPU, họ cùng nhau mua một cụm N×K GPU
- Đặt trình lập lịch job để phân bổ tài nguyên tính toán công bằng theo tỷ lệ sở hữu của từng startup
- Khi phát sinh tài nguyên nhàn rỗi, trình lập lịch sẽ phân bổ luôn, nên nếu may mắn có thể dùng nhiều tài nguyên hơn phần sở hữu của mình
- Thay vì phải duy trì 128 A100 luôn đầy tải trong một tháng, có thể burst tới 512 A100 trong một tuần để có mô hình nhanh hơn
- Các phòng nghiên cứu lớn như OpenAI, Deepmind có những cụm lớn hỗ trợ phân bổ burst cho nhà nghiên cứu
- Trong khi đó, startup đến nay chỉ có thể đảm bảo các cụm rất nhỏ bằng hợp đồng dài hạn rất lâu, phải chờ nhiều tháng và luôn phải giữ chúng bận rộn
- Mục tiêu là áp dụng phân bổ burst và hợp đồng ngắn hạn trong khi vẫn giữ mức khoảng 2,00 USD cho mỗi H100
- Startup muốn tham gia có thể điền vào biểu mẫu đăng ký, hoặc liên hệ qua email evan@roomservice.dev
Tham gia · rời đi · mở rộng
- Giống như hacker house, nếu muốn rời cụm (ví dụ: tự xây cụm riêng) thì cần báo trước một đến hai tháng để có thể tìm người khác lấp chỗ
- Startup mới sẽ được thêm vào nhóm theo đợt (batch), và cứ vài tháng sẽ bổ sung H100 mới vào cụm
- Điều tương tự cũng áp dụng khi một thành viên trong nhóm muốn mở rộng thêm năng lực tính toán
- Có cân nhắc một mức overprovisioning nhỏ — ví dụ: nếu bạn bè muốn vài node cho các thử nghiệm nhỏ thì có thể cung cấp ngay với giá tốt
- Nếu overprovision 10% thì giá H100 theo giờ sẽ tăng 10%
Tài chính
- Đã đảm bảo một lộ trình khả thi để đưa 512 H100 vào vận hành trong vòng 4–6 tuần
- Nếu nhu cầu vượt mức này thì có thể đảm bảo thêm H100 trong khoảng 8 tuần
- Nhờ có thể dàn trải chi phí mua cụm với điều kiện tốt từ ngân hàng, mô hình này có thể duy trì hợp đồng ngắn hạn và phân bổ burst trong khi vẫn đạt mức 2,00 USD cho mỗi H100
Hạ tầng
- Chia sẻ mailing list/Slack để debug hạ tầng, nên khi có vấn đề như InfiniBand thì có thể hỏi cả nhóm
- Nếu có người từng xử lý vấn đề tương tự thì họ có thể hỗ trợ nhau
1 bình luận
Ý kiến trên Hacker News
Mong dự án thành công. TPU Research Cloud(TRC) từng thử làm điều này vào năm 2019, và đó là cơ duyên giúp tôi bắt đầu
Năm 2023, kiếm được một TPU trong hơn một giờ cũng khó, nhưng khi đó đúng nghĩa là có thể nhận được hàng trăm chiếc. Tôi đã tin vào TRC và nghĩ rằng nếu mở rộng quy mô để tạo thành một lục địa TPU thì vấn đề sẽ được giải quyết, nhưng cuối cùng thời gian TPU được ưu tiên phân bổ cho các nhà nghiên cứu nội bộ và dần ít đi. Giờ nếu đề xuất dùng H100 để dạy GPT chơi cờ vua thì thế giới đã khác đến mức sẽ bị cười nhạo
Dự án này có một sự lạc quan trẻ trung mà tôi hy vọng không đánh mất, và về lâu dài có lẽ đó có thể là cách để chiến thắng. Nếu có ai đó đến xin một mẩu H100 rất nhỏ cho một ý tưởng kỳ quặc, tôi mong họ sẽ được chấp nhận. Đó là lý do duy nhất khiến tôi có thể trở thành một điều gì đó
Tất nhiên là chúng tôi cũng định chấp nhận những yêu cầu kỳ quặc xin một mẩu H100 nhỏ
Có thể xem danh sách bài báo gần đây được TRC hỗ trợ tại https://sites.research.google/trc/publications/
Nhu cầu Cloud TPU rất cao nên nếu dùng dung lượng preemptible thì có thể thấy việc bị gián đoạn xảy ra thường xuyên hơn, nhưng cũng có thể dùng dung lượng đặt trước. Nên thử liên hệ với nhóm hỗ trợ TRC
Dù đối tượng so sánh không hoàn toàn giống nhau, TRC rất khó xử lý, tôi chỉ được truy cập TPUv3 một lần và thời gian cũng không đủ để nắm các phần cơ bản. Tôi hiểu rằng tình hình khác nhau rất nhiều tùy theo bạn dùng địa chỉ email nào và tài khoản Twitter của bạn nổi tiếng đến đâu
Tôi tò mò liệu bạn có thuộc giới học thuật không. Nếu không thì tôi không biết vì sao họ lại hào phóng hơn với tôi, mà các dự án của tôi cùng lắm cũng chỉ ở mức hơi thú vị. Tuy vậy, đúng là họ đã keo kiệt hơn nhiều với các Pod lớn so với trước
“Thay vì mỗi startup trong số K startup mua riêng một cụm N GPU, họ cùng mua một cụm NK GPU và phân bổ tính toán bằng bộ lập lịch tác vụ” về lý thuyết trông gần như giống mô hình của các nhà cung cấp đám mây như AWS, Azure
Cấu trúc là “thay vì mọi người mua riêng phần cứng cố định, chúng tôi mua một pool phần cứng khổng lồ để chia sẻ theo thời gian”. Ngoài việc các nhà cung cấp đám mây phải tăng giá để có biên lợi nhuận ròng, tôi tò mò liệu còn điều gì đang bị bỏ sót đến mức cần một dự án như thế này không
Thứ nhất, nhà đầu tư của các đám mây công cộng kỳ vọng một cấu trúc biên lợi nhuận nhất định nên khó cạnh tranh với biên lợi nhuận của Lambda hay Fluidstack. Thứ hai, các cloud lớn cũng có phần bất lợi về mạng cho huấn luyện mô hình ngôn ngữ lớn. Theo tôi biết chỉ Azure có InfiniBand, Oracle là 3200Gbps nhưng không phải InfiniBand, và tôi nghĩ AWS cũng tương tự. GCP thì tôi không chắc, nhưng tôi nhớ tốc độ mạng A100 là 100Gbps chứ không phải 1600Gbps. Trong khi đó Lambda, Fluidstack, CoreWeave đều có InfiniBand. Thứ ba, Nvidia không phân bổ cho các cloud lớn lượng hàng đúng như họ muốn
Thứ hai, ở đây có vấn đề căn bản về chia sẻ tài nguyên. Ngay cả trong dự án này của Evan và AI Grant, cũng sẽ có câu hỏi: nếu một nhóm có tiền để chiếm toàn bộ cụm liên tục thì tại sao lại không cho họ làm? Vấn đề là tiêu chí chính xác của sử dụng công bằng là gì. Trong networking có các thuật toán chia sẻ băng thông như TCP fairness, nhưng chúng không hợp lắm với những công việc có tính “khối” như thế này
Trong vài tháng tới, AWS và các bên khác có lẽ sẽ cố ra mắt dịch vụ hàng đợi để tạm thời được phân bổ các khối tính toán, và khả năng cao sẽ đi kèm trả trước cùng chi phí cao. Thậm chí có thể đắt hơn giá on-demand
Họ tự thực hiện việc pooling đó và không muốn nhường quan hệ khách hàng cũng như lợi nhuận cho bên trung gian hoặc khách hàng
Từ góc nhìn của người từng vận hành hạ tầng tại nhiều cơ sở colocation ở CA, nếu có thể thì nên đặt ở nơi khác. Chi phí điện ở California và các chi phí hạ tầng khác cao hơn nhiều so với AZ hay NV
Tôi thấy câu “không nhà cung cấp đám mây nào trên thế giới cấp 100 nghìn USD tiền tính toán chỉ trong vài tuần”, và dù chưa từng mua lượng tính toán rất lớn, tôi vẫn nghĩ đó là cốt lõi của cloud
Tò mò là khác gì so với https://lambdalabs.com/
Hiện nay việc kiếm vài A100/H100 khá dễ, và Lambda cũng rất tốt cho mục đích này. Nhưng để có từ 24 chiếc trở lên với giá hợp lý, khoảng 2 USD/giờ, thì rất khó. Ngay cả khi chỉ muốn chạy huấn luyện 8 giờ trên H100, nhiều nơi cũng yêu cầu cam kết hơn 6 tháng
Việc các môi giới GPU thích đặt trước dài hạn là quyết định hợp lý về mặt kinh doanh, và nếu ở vị trí đó chúng tôi cũng có thể làm vậy. Nhưng mục tiêu của chúng tôi khác. Đó là trang bị cho phe nổi dậy. Chúng tôi muốn những người không phải BigCorp cũng có thể huấn luyện mô hình
Cách trong bài gốc gần giống với việc mua quyền đưa job vào hàng đợi công việc của cụm 512 GPU, nên job cần 256 GPU cũng không thành vấn đề. Tuy nhiên có thể phải chờ phía sau ai đó đang chạy job 512 GPU
Không rõ dung lượng thực tế của Lambdalabs ra sao. Tò mò không biết có ai biết việc khởi chạy hơn 2–3 instance ở đó dễ đến mức nào không
Cá nhân tôi rất quan tâm đến AI và đã tham gia lĩnh vực này vài năm, nhưng chưa từng thấy tình trạng khan hiếm GPU như hiện nay. Với người muốn thử học máy như một sở thích, tôi rất khuyến nghị vast.ai
GPU không phải A100/H100 thì có vast, TensorDock, và cả RunPod
Hiện họ đang bán lại AWS và GCP, cũng có A100, nhưng lúc này T4 là đủ
Tôi hiểu AWS/GCP/Azure có overhead và vì sao nhiều công ty chọn bare metal cho vận hành. Cá nhân tôi cho rằng hiếm khi đáng bỏ thời gian và công sức, nhưng cũng chấp nhận rằng ở quy mô lớn khoản tiết kiệm có thể đáng kể
Tuy nhiên nếu ngay cả với huấn luyện AI, public cloud cũng không cạnh tranh được cho nhu cầu burst, thì biên lợi nhuận của họ cao hơn dự đoán rất nhiều. Tò mò mức tiết kiệm chi phí 10–20 lần trong bài gốc là so với cái gì. Có phải so với AWS không
Là người thích SF, tôi tò mò liệu cái tên này có điều gì thú vị không. Phần cứng có thực sự đặt ở SF không, và có kế hoạch tổ chức meetup hoặc tập hợp khách hàng để giao lưu không
Chúng tôi vẫn chưa biến mất như Xerces blue, chúng tôi vẫn tồn tại
https://en.wikipedia.org/wiki/Xerces_blue
Nhưng tôi nghĩ khá nhiều khách hàng sẽ ở khu vực này. SF có lẽ vẫn là nơi tốt nhất để làm startup. Có rất nhiều người đang giải các vấn đề kỹ thuật khó. Ở mọi nơi tôi từng sống tại SF, tầng trên hoặc tầng dưới đều có một startup khác
Tổ chức sự kiện offline cũng là một ý hay
Tôi thích ý tưởng về tài sản cộng đồng. Liệu đây có thể là khởi đầu của một hợp tác xã GPU không
https://cloud.vast.ai/host/setup
Bất cứ thứ gì cũng được: không gian rack, VM, container, kết nối. Về cơ bản là Twitter thoái hóa thành một nhà cung cấp colocation cuối thập niên 90
Nói thêm cho những ai chưa nhận ra: đây là câu đùa
Tò mò họ lấy đâu ra tiền để mua 512 H100