2 điểm bởi GN⁺ 2023-07-31 | 1 bình luận | Chia sẻ qua WhatsApp
  • Nhiều startup và viện nghiên cứu cùng mua một cụm GPU để cùng đảm bảo nguồn lực tính toán cần thiết cho việc huấn luyện mô hình lớn
  • Thay vì mỗi bên tự mua N GPU, K startup cùng nhau mua một cụm quy mô N×K
  • Trình lập lịch job phân bổ tài nguyên tính toán công bằng theo tỷ lệ sở hữu, và khi có tài nguyên nhàn rỗi thì sẽ cấp thêm
  • Thay vì phải lấp đầy 128 A100 suốt cả tháng, có thể burst lên 512 A100 trong một tuần để huấn luyện mô hình nhanh hơn
  • Cấu trúc này mang cách phân bổ burst vốn chỉ các phòng nghiên cứu lớn như OpenAI, Deepmind mới có cho cả startup

Ý tưởng cốt lõi

  • Thay vì K startup mỗi bên tự mua một cụm N GPU, họ cùng nhau mua một cụm N×K GPU
  • Đặt trình lập lịch job để phân bổ tài nguyên tính toán công bằng theo tỷ lệ sở hữu của từng startup
  • Khi phát sinh tài nguyên nhàn rỗi, trình lập lịch sẽ phân bổ luôn, nên nếu may mắn có thể dùng nhiều tài nguyên hơn phần sở hữu của mình
  • Thay vì phải duy trì 128 A100 luôn đầy tải trong một tháng, có thể burst tới 512 A100 trong một tuần để có mô hình nhanh hơn
  • Các phòng nghiên cứu lớn như OpenAI, Deepmind có những cụm lớn hỗ trợ phân bổ burst cho nhà nghiên cứu
    • Trong khi đó, startup đến nay chỉ có thể đảm bảo các cụm rất nhỏ bằng hợp đồng dài hạn rất lâu, phải chờ nhiều tháng và luôn phải giữ chúng bận rộn
  • Mục tiêu là áp dụng phân bổ burst và hợp đồng ngắn hạn trong khi vẫn giữ mức khoảng 2,00 USD cho mỗi H100
  • Startup muốn tham gia có thể điền vào biểu mẫu đăng ký, hoặc liên hệ qua email evan@roomservice.dev

Tham gia · rời đi · mở rộng

  • Giống như hacker house, nếu muốn rời cụm (ví dụ: tự xây cụm riêng) thì cần báo trước một đến hai tháng để có thể tìm người khác lấp chỗ
  • Startup mới sẽ được thêm vào nhóm theo đợt (batch), và cứ vài tháng sẽ bổ sung H100 mới vào cụm
  • Điều tương tự cũng áp dụng khi một thành viên trong nhóm muốn mở rộng thêm năng lực tính toán
  • Có cân nhắc một mức overprovisioning nhỏ — ví dụ: nếu bạn bè muốn vài node cho các thử nghiệm nhỏ thì có thể cung cấp ngay với giá tốt
    • Nếu overprovision 10% thì giá H100 theo giờ sẽ tăng 10%

Tài chính

  • Đã đảm bảo một lộ trình khả thi để đưa 512 H100 vào vận hành trong vòng 4–6 tuần
  • Nếu nhu cầu vượt mức này thì có thể đảm bảo thêm H100 trong khoảng 8 tuần
  • Nhờ có thể dàn trải chi phí mua cụm với điều kiện tốt từ ngân hàng, mô hình này có thể duy trì hợp đồng ngắn hạn và phân bổ burst trong khi vẫn đạt mức 2,00 USD cho mỗi H100

Hạ tầng

  • Chia sẻ mailing list/Slack để debug hạ tầng, nên khi có vấn đề như InfiniBand thì có thể hỏi cả nhóm
  • Nếu có người từng xử lý vấn đề tương tự thì họ có thể hỗ trợ nhau

1 bình luận

 
GN⁺ 2023-07-31
Ý kiến trên Hacker News
  • Mong dự án thành công. TPU Research Cloud(TRC) từng thử làm điều này vào năm 2019, và đó là cơ duyên giúp tôi bắt đầu
    Năm 2023, kiếm được một TPU trong hơn một giờ cũng khó, nhưng khi đó đúng nghĩa là có thể nhận được hàng trăm chiếc. Tôi đã tin vào TRC và nghĩ rằng nếu mở rộng quy mô để tạo thành một lục địa TPU thì vấn đề sẽ được giải quyết, nhưng cuối cùng thời gian TPU được ưu tiên phân bổ cho các nhà nghiên cứu nội bộ và dần ít đi. Giờ nếu đề xuất dùng H100 để dạy GPT chơi cờ vua thì thế giới đã khác đến mức sẽ bị cười nhạo
    Dự án này có một sự lạc quan trẻ trung mà tôi hy vọng không đánh mất, và về lâu dài có lẽ đó có thể là cách để chiến thắng. Nếu có ai đó đến xin một mẩu H100 rất nhỏ cho một ý tưởng kỳ quặc, tôi mong họ sẽ được chấp nhận. Đó là lý do duy nhất khiến tôi có thể trở thành một điều gì đó

    • Câu “dự án có sự lạc quan trẻ trung” là câu hay nhất tôi từng nghe đến giờ. Hay đến mức tôi muốn đóng khung treo lên tường
      Tất nhiên là chúng tôi cũng định chấp nhận những yêu cầu kỳ quặc xin một mẩu H100 nhỏ
    • Thực ra chương trình TPU Research Cloud vẫn đang vận hành tốt. Họ đã mở rộng đáng kể pool tính toán, bao gồm cả Cloud TPU v4 Pod slice, và các dự án lớn vẫn dùng hàng trăm chip cùng lúc. Dung lượng TRC không bị thu hồi cho mục đích nội bộ
      Có thể xem danh sách bài báo gần đây được TRC hỗ trợ tại https://sites.research.google/trc/publications/
      Nhu cầu Cloud TPU rất cao nên nếu dùng dung lượng preemptible thì có thể thấy việc bị gián đoạn xảy ra thường xuyên hơn, nhưng cũng có thể dùng dung lượng đặt trước. Nên thử liên hệ với nhóm hỗ trợ TRC
    • Đáng ngạc nhiên là có vẻ giờ tôi mới thấy được ánh sáng đó. Trong các bài trước tôi chỉ thấy lời khen TRC, nhưng với tư cách người bắt đầu muộn hơn, tôi đạt được nhiều kết quả hơn nhiều bằng GPU gaming tự có
      Dù đối tượng so sánh không hoàn toàn giống nhau, TRC rất khó xử lý, tôi chỉ được truy cập TPUv3 một lần và thời gian cũng không đủ để nắm các phần cơ bản. Tôi hiểu rằng tình hình khác nhau rất nhiều tùy theo bạn dùng địa chỉ email nào và tài khoản Twitter của bạn nổi tiếng đến đâu
    • Trải nghiệm của tôi thì khác. Xét việc đăng ký khá dễ, tôi thấy hiện vẫn khá hào phóng. Trong 6 tháng gần đây, với nhiều dự án, tôi đã được đề xuất v3-8, v3-32 30 ngày, và v3-64 28 ngày dạng preemptible
      Tôi tò mò liệu bạn có thuộc giới học thuật không. Nếu không thì tôi không biết vì sao họ lại hào phóng hơn với tôi, mà các dự án của tôi cùng lắm cũng chỉ ở mức hơi thú vị. Tuy vậy, đúng là họ đã keo kiệt hơn nhiều với các Pod lớn so với trước
    • Shawn nói hoàn toàn đúng. Cạnh tranh hiện quá nóng nên không còn sự dư dả kiểu đó. Một khách hàng có thể lấy 512 GPU trong 3 năm
  • “Thay vì mỗi startup trong số K startup mua riêng một cụm N GPU, họ cùng mua một cụm NK GPU và phân bổ tính toán bằng bộ lập lịch tác vụ” về lý thuyết trông gần như giống mô hình của các nhà cung cấp đám mây như AWS, Azure
    Cấu trúc là “thay vì mọi người mua riêng phần cứng cố định, chúng tôi mua một pool phần cứng khổng lồ để chia sẻ theo thời gian”. Ngoài việc các nhà cung cấp đám mây phải tăng giá để có biên lợi nhuận ròng, tôi tò mò liệu còn điều gì đang bị bỏ sót đến mức cần một dự án như thế này không

    • Chủ yếu là vì giátính sẵn có
      Thứ nhất, nhà đầu tư của các đám mây công cộng kỳ vọng một cấu trúc biên lợi nhuận nhất định nên khó cạnh tranh với biên lợi nhuận của Lambda hay Fluidstack. Thứ hai, các cloud lớn cũng có phần bất lợi về mạng cho huấn luyện mô hình ngôn ngữ lớn. Theo tôi biết chỉ Azure có InfiniBand, Oracle là 3200Gbps nhưng không phải InfiniBand, và tôi nghĩ AWS cũng tương tự. GCP thì tôi không chắc, nhưng tôi nhớ tốc độ mạng A100 là 100Gbps chứ không phải 1600Gbps. Trong khi đó Lambda, Fluidstack, CoreWeave đều có InfiniBand. Thứ ba, Nvidia không phân bổ cho các cloud lớn lượng hàng đúng như họ muốn
    • Các cloud lớn cũng đang làm việc này. Mọi cloud lớn đều đang chuẩn bị tính năng yêu cầu/đặt trước ngắn hạn. Trước generative AI, đây không phải tính năng có nhiều ích lợi. Có mấy khi người ta cần yêu cầu 1000 node CPU trong một availability zone trong 48 giờ đâu
      Thứ hai, ở đây có vấn đề căn bản về chia sẻ tài nguyên. Ngay cả trong dự án này của Evan và AI Grant, cũng sẽ có câu hỏi: nếu một nhóm có tiền để chiếm toàn bộ cụm liên tục thì tại sao lại không cho họ làm? Vấn đề là tiêu chí chính xác của sử dụng công bằng là gì. Trong networking có các thuật toán chia sẻ băng thông như TCP fairness, nhưng chúng không hợp lắm với những công việc có tính “khối” như thế này
      Trong vài tháng tới, AWS và các bên khác có lẽ sẽ cố ra mắt dịch vụ hàng đợi để tạm thời được phân bổ các khối tính toán, và khả năng cao sẽ đi kèm trả trước cùng chi phí cao. Thậm chí có thể đắt hơn giá on-demand
    • AWS và Azure thà tự cắt cổ mình còn hơn tạo ra cách để khách hàng gom instance lại nhằm tiết kiệm chi phí
      Họ tự thực hiện việc pooling đó và không muốn nhường quan hệ khách hàng cũng như lợi nhuận cho bên trung gian hoặc khách hàng
  • Từ góc nhìn của người từng vận hành hạ tầng tại nhiều cơ sở colocation ở CA, nếu có thể thì nên đặt ở nơi khác. Chi phí điện ở California và các chi phí hạ tầng khác cao hơn nhiều so với AZ hay NV

    • Xét điện rẻ và cả lợi thế tỷ giá CAD-USD thì Montreal có vẻ phù hợp
    • Trong chi phí tính toán GPU, điện có vẻ chỉ chiếm một phần rất nhỏ
  • Tôi thấy câu “không nhà cung cấp đám mây nào trên thế giới cấp 100 nghìn USD tiền tính toán chỉ trong vài tuần”, và dù chưa từng mua lượng tính toán rất lớn, tôi vẫn nghĩ đó là cốt lõi của cloud

  • Tò mò là khác gì so với https://lambdalabs.com/

    • Chúng tôi thiên về vận hành điện toán quy mô trung bình với biên lợi nhuận bằng 0. Mục tiêu không phải là bán cho Fortune 500, mà là giúp nghiên cứu sinh có thể dùng khoản tài trợ nghiên cứu 50.000 USD
      Hiện nay việc kiếm vài A100/H100 khá dễ, và Lambda cũng rất tốt cho mục đích này. Nhưng để có từ 24 chiếc trở lên với giá hợp lý, khoảng 2 USD/giờ, thì rất khó. Ngay cả khi chỉ muốn chạy huấn luyện 8 giờ trên H100, nhiều nơi cũng yêu cầu cam kết hơn 6 tháng
      Việc các môi giới GPU thích đặt trước dài hạn là quyết định hợp lý về mặt kinh doanh, và nếu ở vị trí đó chúng tôi cũng có thể làm vậy. Nhưng mục tiêu của chúng tôi khác. Đó là trang bị cho phe nổi dậy. Chúng tôi muốn những người không phải BigCorp cũng có thể huấn luyện mô hình
    • Giá rất tương tự, nhưng mô hình có vẻ khá khác. Khác biệt quan trọng có thể là khi thường xuyên chạy các lượt huấn luyện ngắn trên nhiều GPU. Lambdalabs có thể không cấp được 256 instance ngay lúc này
      Cách trong bài gốc gần giống với việc mua quyền đưa job vào hàng đợi công việc của cụm 512 GPU, nên job cần 256 GPU cũng không thành vấn đề. Tuy nhiên có thể phải chờ phía sau ai đó đang chạy job 512 GPU
      Không rõ dung lượng thực tế của Lambdalabs ra sao. Tò mò không biết có ai biết việc khởi chạy hơn 2–3 instance ở đó dễ đến mức nào không
    • Thông thường nếu không cam kết reserved instance dài hạn thì H100 chỉ được cấp vài chiếc mỗi lần
    • Không có cách thực tế nào để lấy được một khối lớn mà không cam kết. Theo trí nhớ, cam kết tối thiểu cho H100 là 64 GPU trong 3 năm, khoảng 3 triệu USD
    • H100 giá 2 USD/giờ thì có vẻ linh hoạt hơn, nhưng tôi chưa từng kiếm được 10.000 GPU-giờ từ các dịch vụ kiểu này. Có lẽ đó có thể là điểm nghẽn
  • Cá nhân tôi rất quan tâm đến AI và đã tham gia lĩnh vực này vài năm, nhưng chưa từng thấy tình trạng khan hiếm GPU như hiện nay. Với người muốn thử học máy như một sở thích, tôi rất khuyến nghị vast.ai

    • Một số cloud khác: H100 và A100 có Lambda, Fluidstack, RunPod, CoreWeave, Crusoe, Oblivus, Latitude
      GPU không phải A100/H100 thì có vast, TensorDock, và cả RunPod
    • Tùy bạn xem phạm vi sở thích là gì, nhưng để chạy T4 vài phút mỗi lần nhằm làm quen với công cụ và khái niệm thì modal.com khá tốt
      Hiện họ đang bán lại AWS và GCP, cũng có A100, nhưng lúc này T4 là đủ
    • vast.ai gần giống một chợ kiểu gig economy dành cho GPU. Tôi vừa thử máy đầu tiên, chạy tốt; có RAM 512GB, 256 CPU AMD, GPU A100, và dùng khoảng 4 phút với 0,05 USD. Số tiền đó cũng được tặng miễn phí
  • Tôi hiểu AWS/GCP/Azure có overhead và vì sao nhiều công ty chọn bare metal cho vận hành. Cá nhân tôi cho rằng hiếm khi đáng bỏ thời gian và công sức, nhưng cũng chấp nhận rằng ở quy mô lớn khoản tiết kiệm có thể đáng kể
    Tuy nhiên nếu ngay cả với huấn luyện AI, public cloud cũng không cạnh tranh được cho nhu cầu burst, thì biên lợi nhuận của họ cao hơn dự đoán rất nhiều. Tò mò mức tiết kiệm chi phí 10–20 lần trong bài gốc là so với cái gì. Có phải so với AWS không

    • p5.48xlarge của AWS có 8 H100 với giá 98,32 USD/giờ, tức 12,29 USD/giờ cho mỗi H100. Xấp xỉ đắt hơn 6 lần
  • Là người thích SF, tôi tò mò liệu cái tên này có điều gì thú vị không. Phần cứng có thực sự đặt ở SF không, và có kế hoạch tổ chức meetup hoặc tập hợp khách hàng để giao lưu không
    Chúng tôi vẫn chưa biến mất như Xerces blue, chúng tôi vẫn tồn tại
    https://en.wikipedia.org/wiki/Xerces_blue

    • Phần cứng sẽ không đặt ở SF. Vì đó không phải là nơi có không gian datacenter rẻ nhất
      Nhưng tôi nghĩ khá nhiều khách hàng sẽ ở khu vực này. SF có lẽ vẫn là nơi tốt nhất để làm startup. Có rất nhiều người đang giải các vấn đề kỹ thuật khó. Ở mọi nơi tôi từng sống tại SF, tầng trên hoặc tầng dưới đều có một startup khác
      Tổ chức sự kiện offline cũng là một ý hay
  • Tôi thích ý tưởng về tài sản cộng đồng. Liệu đây có thể là khởi đầu của một hợp tác xã GPU không

    • Nếu là card tiêu dùng thì đã có hình thức như vậy rồi. Bạn có thể kiếm tiền từ GPU của mình qua vast.AI
      https://cloud.vast.ai/host/setup
    • Tôi hoàn toàn không biết hạ tầng nội bộ của Twitter, nhưng nhìn vào các tình huống như doanh thu quảng cáo giảm, mức độ tương tác người dùng giảm, hay người dùng chuyển sang Threads, tôi nghĩ Twitter có thể dùng một phần hạ tầng để hỗ trợ các startup kiểu này
      Bất cứ thứ gì cũng được: không gian rack, VM, container, kết nối. Về cơ bản là Twitter thoái hóa thành một nhà cung cấp colocation cuối thập niên 90
      Nói thêm cho những ai chưa nhận ra: đây là câu đùa
  • Tò mò họ lấy đâu ra tiền để mua 512 H100

    • Như đã nói rõ ngay câu đầu của bài, họ là các nhà đầu tư VC làm việc này cho những startup mà họ vừa đầu tư, và cũng đang tìm thêm người tham gia