1 điểm bởi GN⁺ 3 giờ trước | 1 bình luận | Chia sẻ qua WhatsApp

1 bình luận

 
Các ý kiến trên Hacker News
  • Nếu là một doanh nghiệp lớn chi hàng triệu USD mỗi tháng cho suy luận, việc tự mua một rack GB300 khoảng 6 triệu USD là đáng cân nhắc
    Chỉ cần chưa tới 10% trong 20,7TB bộ nhớ để nạp toàn bộ mô hình MXFP4, và tổng băng thông HBM là 576TB/s, nên có thể chạy song song hơn 6.000 tác vụ agent với ngữ cảnh trung bình 100.000 token ở khoảng 30 token/giây
    Nếu tính khấu hao hằng năm và tiền điện là 1,5 triệu USD, mức sử dụng trung bình 50%, thì chi phí dưới 0,6 USD cho mỗi 1 triệu token đầu ra; dữ liệu cũng vẫn nằm trong nội bộ và rẻ hơn dịch vụ hosting hơn 10 lần
    Với các công ty tin rằng mô hình trọng số mở sẽ tiếp tục tiến bộ và AI sẽ còn tồn tại lâu dài, lần đầu tiên đã có cơ sở rõ ràng để quyết định mua rack trực tiếp

    • Đang chạy Kimi 2.8 trên một máy chủ 107.000 USD, xử lý hơn khoảng 50.000 token/giây trong hầu hết tác vụ
      Khoản tiết kiệm đã vượt chi phí token từng chi cho Claude và Gemini trong năm ngoái
    • Nếu thuê 2–3 nhân sự DevOps để vận hành thì sẽ tốn thêm 400.000–700.000 USD, và mọi sự cố cũng như bảo trì đều do công ty chịu trách nhiệm
      Dù vậy, với dữ liệu cần giữ bí mật thì vẫn không tin tưởng LLM được hosting
    • Cũng cần không gian có làm mát bằng chất lỏng và hạ tầng điện siêu mật độ cao, nên các cơ sở colocation thông thường hoặc phòng máy chủ nội bộ khó gánh nổi
    • Nếu là công ty có thể mua rack 6 triệu USD và hạ tầng đi kèm, còn phải xét đến điều khoản giấy phép thương mại áp dụng, nên phép tính không hề đơn giản
  • Cùng với mô hình, họ cũng công bố nhiều hạ tầng dựa trên mã nguồn mở
    https://github.com/MoonshotAI/MoonEP
    https://github.com/kvcache-ai/AgentEnv
    https://github.com/MoonshotAI/FlashKDA
    Khó chấp nhận quan điểm xem mô hình mã nguồn mở và trọng số mở là hành động làm chậm tiến bộ AI

    • Tôi lại từng xem đó là hành động làm chậm tiến bộ
      Lý do là các phòng lab khác có thể bắt kịp bằng cách chưng cất mô hình của phòng lab tuyến đầu, đồng thời lấy đi một phần doanh thu mà phòng lab đó có thể tái đầu tư cho thế hệ tiếp theo
      Tôi từng nghĩ rằng nếu muốn tăng tốc hoàn toàn thì nên quốc hữu hóa hai phòng lab hàng đầu và đóng kín như Manhattan Project cho đến khi đạt được tự cải thiện đệ quy (RSI), nhưng các phản biện trong phần trả lời đã khiến quan điểm của tôi thay đổi đáng kể
  • Có thể xem giấy phép Kimi-K3 tại https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE
    Các nhà cung cấp Model as a Service có doanh thu cộng gộp của các công ty liên kết vượt 20 triệu USD trong 12 tháng liên tiếp phải ký hợp đồng riêng với Moonshot AI trước khi sử dụng thương mại
    Điều khoản hiện có cũng quy định nếu có từ 100 triệu người dùng hoạt động hằng tháng trở lên hoặc doanh thu sản phẩm thương mại vượt 20 triệu USD thì phải hiển thị tên Kimi

    • Kimi 2.6 cũng dùng kiểu giấy phép tương tự, https://huggingface.co/moonshotai/Kimi-K2.6/blob/main/LICENS..., và có vẻ truy ngược đến tận K2
      Các mô hình công bố năm 2025 dùng giấy phép MIT gọn gàng, nhưng từ moonshotai/Kimi-K2-Thinking vào tháng 1/2026, họ bắt đầu dùng giấy phép MIT đã sửa đổi
    • Ngay từ đầu đã thắc mắc giấy phép này áp dụng cho thứ gì
      Cũng không rõ trọng số mô hình có bản quyền hay không
    • Ở Mỹ, có thể diễn giải rằng trọng số của mô hình học máy là sản phẩm của quá trình tối ưu hóa tự động như stochastic gradient descent, expectation maximization hay thuật toán di truyền, nên không thuộc đối tượng bản quyền
      Điều này vẫn chưa được kiểm chứng đầy đủ tại tòa, và chi phí kiện tụng cũng lớn, nên nhà tuyển dụng thường sẽ chọn tuân thủ giấy phép cho an toàn
      Vụ Thaler v. Perlmutter đã xác nhận bản quyền cần có tác giả là con người, và hướng dẫn của Văn phòng Bản quyền Mỹ cũng nêu rõ tác phẩm do máy tự động tạo ra mà không có sự can thiệp sáng tạo của con người thì không thể đăng ký
      Các điều khoản tiếp theo cũng loại trừ nguyên lý toán học, công thức, thuật toán và phương trình khỏi đối tượng bản quyền, nên nếu xem mô hình là thuật toán thì kết luận tương đối rõ ràng
      [1] https://media.cadc.uscourts.gov/opinions/docs/2025/03/23-523...
      [2] https://www.copyright.gov/comp3/chap300/ch300-copyrightable-...
    • Việc có thể tải xuống là tốt hơn, nhưng với các điều kiện này thì thật đáng tiếc vì khó gọi là trọng số mở hay mã nguồn mở thực sự
    • Cũng không rõ họ sẽ tìm ra người vi phạm giấy phép và đưa họ thành đối tượng kiện tụng bằng cách nào
  • Cách tiếp cận dùng đồ thị tri thức phân cấp tự tiến hóa, trong đó agent liên tục mở rộng khi khám phá các lĩnh vực giàu tri thức và mảng lập trình ở quy mô web, khá thú vị

  • Nhìn việc hàm kích hoạt quay lại tanh khiến người ta có cảm giác xu hướng kỹ thuật đang vận động theo chu kỳ

    • Theo trang 6 của bài báo, họ không dùng nguyên xi tanh mà dùng f_gate(b,x) = b * tanh(x / b) * sigmoid(x)f_up(b,x) = b * tanh(x / b)
      Nhìn trên đồ thị, có vẻ đây là thiết kế nhằm kết hợp ưu điểm của GLU là biểu đạt tốt hơn khi x lớn hơn khoảng 5 với ưu điểm của SwiGLU là giá trị vọt lên ngay trước 0
  • Tổng hợp tác vụ dựa trên đồ thị tri thức là một cách tiếp cận phù hợp với bài toán lâu nay: làm sao bao quát đầy đủ nhiều loại tác vụ khác nhau
    Có vẻ nó cũng có thể dẫn tới nghiên cứu lý thuyết về tốc độ tạo ra tri thức mới và các phương thức tạo sinh của con người lẫn máy móc

  • Tôi đang băn khoăn giữa LoRA+DPO, GRPO thì hiện tại phương án nào là tốt nhất để tinh chỉnh cho các tác vụ agent riêng

    • Trước mắt LoRA+SFT là phù hợp, nhưng do mô hình lớn nên chi phí sẽ là gánh nặng đáng kể
      Có lẽ nên chờ API tinh chỉnh của nhà cung cấp; không nhất thiết phải đi thẳng từ đầu sang học tăng cường hoặc dạng giống học tăng cường off-policy như DPO
  • Tôi tò mò mô hình giáo viên trong chưng cất on-policy đa giáo viên là gì
    Với các lĩnh vực có thể kiểm chứng như toán học, lập trình thì dễ hiểu, nhưng vì có cả sinh học nên không rõ liệu đây có phải là cấu trúc chưng cất từ một mô hình lớn hơn hay không

    • Họ trích dẫn https://thinkingmachines.ai/blog/on-policy-distillation/
      Tôi hiểu đây là một phương pháp chưng cất trong đó mô hình giáo viên chấm điểm từng token của mô hình học sinh đang giải bài toán bằng xác suất sinh ở mỗi bước, rồi dùng điểm đó làm phần thưởng hoặc hàm mất mát để học tăng cường
      Đa giáo viên có vẻ nghĩa là chưng cất từ nhiều mô hình, và cũng có thể bao gồm các mô hình đóng tiên tiến nhất
      Tuy nhiên cần xác suất log; OpenAI API cho phép điều này, còn Anthropic thì không cung cấp, nên có thể có cách ước lượng từ bên ngoài
      Phương pháp này có thể áp dụng cho bất kỳ lĩnh vực nào mà giáo viên biết, bao gồm cả sinh học
    • Giáo viên là các mô hình khác
  • Tôi tò mò liệu việc giá suy luận của nhiều nhà cung cấp đều giống nhau có phải do hợp đồng cấp phép với Moonshot hay không

  • Tôi tò mò cần những gì để tạo ra một mô hình mở của Mỹ có thể cạnh tranh với Kimi

    • Mô hình công khai quy mô lớn gần đây của các phòng thí nghiệm lớn tại Mỹ có lẽ là GPT-OSS-120b vào mùa hè 2025, khoảng một năm trước
      Có vẻ khó trông chờ họ tự nguyện tung ra, nên có lẽ cần gây sức ép công khai theo một hình thức nào đó
      Gần đây tôi đã kỳ vọng Gemma sẽ ra mắt ở mức tối thiểu 100B, nhưng có vẻ Google chỉ giữ mô hình quy mô đó nội bộ
    • MSL hoặc SpaceXAI có vẻ có khả năng cao sẽ công bố mã nguồn mở một trong các mô hình lớn tiếp theo
      Cả hai đều thân thiện với mã nguồn mở và sẽ cạnh tranh cho vị trí Kimi của Mỹ
    • Nếu quan niệm phổ biến rằng Trung Quốc chỉ cần chưng cất mô hình rồi sao chép trong 2 tuần là đúng, thì Mỹ cũng phải có thể tung ra một mô hình sao chép trong vòng 2 tuần
    • Inkling cũng nằm trong phạm vi có thể cạnh tranh ở mức đại khái