2 điểm bởi GN⁺ 3 giờ trước | 1 bình luận | Chia sẻ qua WhatsApp
  • Đây là mô hình production mở rộng Kimi Linear được công bố năm ngoái từ 48B lên 2.8T, và hiện là mô hình có trọng số mở lớn nhất trong số các mô hình công khai
  • LatentMoE mới được giới thiệu nén các tầng tuyến tính lớn bằng cách down projection, và toàn bộ cấu trúc thay thế MoE thông thường cùng attention bằng các thành phần tập trung vào hiệu quả suy luận
  • Attention residuals kết nối residual giữa các tầng bằng trọng số dựa trên điểm attention, giúp cải thiện nhẹ nhưng nhất quán loss kiểm chứng và hiệu năng downstream
  • Attention residual làm tăng chi phí huấn luyện khoảng 4% và chi phí suy luận khoảng 2%, đồng thời loại bỏ toàn bộ các tầng RoPE và áp dụng NoPE cho toàn bộ mô hình
  • Mô hình còn bổ sung hỗ trợ đa phương thức native, theo đuổi đồng thời việc mở rộng quy mô lớn của Kimi Linear cùng cải thiện hiệu quả suy luận và đường residual

Mở rộng từ Kimi Linear lên 2.8T

  • Kimi K3 là phiên bản production Kimi Linear được mở rộng từ 48B lên 2.8T, và là mô hình có trọng số mở lớn nhất hiện nay
  • LatentMoE mới được bổ sung so với Kimi Linear về bản chất giống với cách làm của Nemotron 3 Ultra
  • Tập trung vào cải thiện hiệu quả suy luận như xu hướng thấy ở Nemotron 3 và DeepSeek V4
    • Thay MoE thông thường bằng LatentMoE
    • Dùng multi-head latent attention và Kimi Delta Attention thay cho attention thông thường

Đường residual và thông tin vị trí

  • Attention residuals là thành phần nhằm cải thiện đường residual chứ không phải tối ưu hiệu quả, và đã được áp dụng trên Kimi Linear
    • Khác với mHC (manifold-constrained Hyper-Connections) của DeepSeek V4 mở rộng đường residual, attention residual kết nối residual giữa các tầng
    • Nó sử dụng điểm attention thể hiện mức độ quan trọng hay đóng góp của từng residual làm trọng số kết nối
    • Theo báo cáo kỹ thuật, nó cải thiện nhẹ nhưng nhất quán loss kiểm chứng và hiệu năng downstream, nhưng làm tăng chi phí huấn luyện khoảng 4% và chi phí suy luận khoảng 2%
  • Loại bỏ toàn bộ các tầng RoPE và áp dụng NoPE, tức không dùng positional embedding, cho mọi tầng
    • Gần đây, các kiến trúc khác có xu hướng dùng RoPE cho local attention như sliding window attention, và dùng NoPE cho các tầng toàn cục
    • Dù đã có các kiến trúc trước đó chỉ dùng NoPE, Kimi K3 là mô hình frontier đầu tiên được xác nhận áp dụng điều này trên toàn bộ mô hình

Hỗ trợ đa phương thức native

  • Kimi K3 cũng được bổ sung hỗ trợ đa phương thức native

1 bình luận

 
Ý kiến trên Hacker News
  • Khác với việc lãnh đạo các phòng thí nghiệm phương Tây quy Kimi chỉ là sản phẩm của một cuộc tấn công chưng cất, trên thực tế họ đang đưa vào những cách tiếp cận mới mẻ và độc đáo

  • Sebastian Raschka là một nhà nghiên cứu và tác giả xuất sắc về mô hình ngôn ngữ lớn, và tôi rất khuyến nghị Substack của ông

    • Trước đây tôi không biết, nhưng tôi ấn tượng ở chỗ ông viết đi thẳng vào trọng tâm mà vẫn dễ hiểu
    • Trong một lĩnh vực tràn ngập các bản tóm tắt AI được tạo qua loa, đây là một viên ngọc hiếm nên tôi đã thêm vào RSS feed
  • “Điều thú vị là Kimi K3 loại bỏ toàn bộ các lớp RoPE, thay vào đó dùng NoPE (No Positional Embeddings) ở mọi nơi”
    Bản thân việc cách này hoạt động đã đáng kinh ngạc. Nếu không có thông tin vị trí thì chẳng phải sẽ thành một nồi súp token sao? Tôi tò mò liệu attention có đủ chính xác để token thứ hai nhận ra nó là token thứ hai chỉ bằng cách học cách tích lũy thứ gì đó trong không gian embedding hay không

    • Thông qua causal masking, mô hình có thể học positional embedding ngầm định. Quan niệm phổ biến rằng các khối Transformer là bất biến với hoán vị thực ra không đúng
    • Với Transformer causal chỉ có decoder thì positional embedding không nhất thiết là bắt buộc, nhưng với mô hình phi causal như encoder trong bài báo Transformer gốc thì chắc chắn cần
      Trực giác về sự tích lũy cũng phù hợp. Nếu một số attention head liên tục ghi giá trị vào cùng một vùng của residual stream, thì khi số token đầu vào tăng lên, các giá trị sẽ được tích lũy qua phép cộng attention và có thể đóng vai trò như một dạng chỉ số mà không cần mã hóa vị trí riêng
    • Các lớp tuyến tính dùng suy giảm giống bộ lọc FIR để tự nhiên cung cấp vị trí tương đối. Khi đó các lớp attention đầy đủ có thể tập trung vào việc kết nối các khái niệm với nhau bất kể khoảng cách
    • Trong các mô hình attention lai như vậy, ít nhất các lớp mô hình không gian trạng thái (SSM) có lẽ đã nội tại hóa positional embedding tương đối thông qua cấu trúc hồi quy
  • Việc dùng NoPE ở mọi nơi thật thú vị. Các mô hình khác thường vẫn giữ RoPE ở các lớp cục bộ, còn ở đây có vẻ các lớp attention tuyến tính như Kimi Delta đã âm thầm đảm nhiệm xử lý vị trí nên có thể bỏ qua nó. Tôi tò mò liệu điều này có còn giữ được ở quy mô tối tân hay không

    • Dù tên gọi là vậy, Kimi Delta Attention (KDA) không hẳn là attention theo nghĩa thông thường, mà gần với một RNN có thể song song hóa hiệu quả khi huấn luyện hơn. Đây là một cấu trúc sửa đổi nhẹ từ Gated DeltaNet, một RNN có trạng thái ẩn hoạt động như một bộ nhớ attention nhỏ có thể chỉnh sửa
      Vì giống RNN, nó vốn nhận biết thứ tự của X, Y, Z trong XYZ. Transformer cơ bản xử lý một tập hợp không có thứ tự, nên phải được cung cấp riêng thông tin vị trí giữa các mục
      Mỗi lớp attention có 3 lớp KDA và cũng có 3 lớp trước lớp attention đầu tiên, nên mọi token có thể học thông tin vị trí của mình trước khi đi tới lớp attention thực sự đầu tiên
      RoPE làm hỏng một phần thông tin, nên nếu có thể bỏ qua theo cách này thì có lợi. Gemma-4 cũng có cấu trúc 5:1 tương tự, với năm lớp sliding window attention (SWA) cho mỗi lớp attention toàn cục. SWA rẻ và kém hiệu năng hơn nhưng xử lý thông tin cục bộ, lấp vào giữa các lớp toàn cục mạnh; trong mô hình này KDA đảm nhiệm vai trò tương tự
      Trong Gemma, RoPE chỉ cần cho SWA, vốn là attention thực sự, và được bỏ qua ở attention toàn cục. KDA không phải là attention nên không cần positional embedding
      Tôi không biết phải tối tân hơn đến mức nào nữa, nhưng không có lý do gì để nó không hoạt động ở quy mô lớn hơn. Càng có nhiều tham số, các lớp KDA càng dễ truyền thông tin vị trí hơn
    • Trên benchmark, Kimi K3 nằm trong phạm vi tương tự Opus và Fable, nên tôi nghi ngờ liệu quy mô lớn hơn thế có còn là tối tân hay không. Tất cả đều ở khoảng 2–4 nghìn tỷ tham số, và tôi dự đoán khác biệt chính sẽ nằm ở chất lượng huấn luyện và kiến trúc
    • Cũng có một tác dụng phụ hơi kỳ lạ. Các nhà cung cấp mà tôi đã dùng không lưu KV cache chỉ đến prompt đầu vào mới nhất, mà triển khai theo các khối tăng cố định 1.024 token. Kết quả là mỗi lần suy luận có thể phát sinh thêm tối đa 1.023 token đầu vào bị cache miss