- Đây là mô hình production mở rộng Kimi Linear được công bố năm ngoái từ 48B lên 2.8T, và hiện là mô hình có trọng số mở lớn nhất trong số các mô hình công khai
- LatentMoE mới được giới thiệu nén các tầng tuyến tính lớn bằng cách down projection, và toàn bộ cấu trúc thay thế MoE thông thường cùng attention bằng các thành phần tập trung vào hiệu quả suy luận
- Attention residuals kết nối residual giữa các tầng bằng trọng số dựa trên điểm attention, giúp cải thiện nhẹ nhưng nhất quán loss kiểm chứng và hiệu năng downstream
- Attention residual làm tăng chi phí huấn luyện khoảng 4% và chi phí suy luận khoảng 2%, đồng thời loại bỏ toàn bộ các tầng RoPE và áp dụng NoPE cho toàn bộ mô hình
- Mô hình còn bổ sung hỗ trợ đa phương thức native, theo đuổi đồng thời việc mở rộng quy mô lớn của Kimi Linear cùng cải thiện hiệu quả suy luận và đường residual
Mở rộng từ Kimi Linear lên 2.8T
- Kimi K3 là phiên bản production Kimi Linear được mở rộng từ 48B lên 2.8T, và là mô hình có trọng số mở lớn nhất hiện nay
- LatentMoE mới được bổ sung so với Kimi Linear về bản chất giống với cách làm của Nemotron 3 Ultra
- Tương tự multi-head latent attention, nó nén các tầng tuyến tính lớn bằng down projection
- Tập trung vào cải thiện hiệu quả suy luận như xu hướng thấy ở Nemotron 3 và DeepSeek V4
- Thay MoE thông thường bằng LatentMoE
- Dùng multi-head latent attention và Kimi Delta Attention thay cho attention thông thường
Đường residual và thông tin vị trí
- Attention residuals là thành phần nhằm cải thiện đường residual chứ không phải tối ưu hiệu quả, và đã được áp dụng trên Kimi Linear
- Khác với mHC (manifold-constrained Hyper-Connections) của DeepSeek V4 mở rộng đường residual, attention residual kết nối residual giữa các tầng
- Nó sử dụng điểm attention thể hiện mức độ quan trọng hay đóng góp của từng residual làm trọng số kết nối
- Theo báo cáo kỹ thuật, nó cải thiện nhẹ nhưng nhất quán loss kiểm chứng và hiệu năng downstream, nhưng làm tăng chi phí huấn luyện khoảng 4% và chi phí suy luận khoảng 2%
- Loại bỏ toàn bộ các tầng RoPE và áp dụng NoPE, tức không dùng positional embedding, cho mọi tầng
- Gần đây, các kiến trúc khác có xu hướng dùng RoPE cho local attention như sliding window attention, và dùng NoPE cho các tầng toàn cục
- Dù đã có các kiến trúc trước đó chỉ dùng NoPE, Kimi K3 là mô hình frontier đầu tiên được xác nhận áp dụng điều này trên toàn bộ mô hình
Hỗ trợ đa phương thức native
- Kimi K3 cũng được bổ sung hỗ trợ đa phương thức native
1 bình luận
Ý kiến trên Hacker News
Khác với việc lãnh đạo các phòng thí nghiệm phương Tây quy Kimi chỉ là sản phẩm của một cuộc tấn công chưng cất, trên thực tế họ đang đưa vào những cách tiếp cận mới mẻ và độc đáo
Sebastian Raschka là một nhà nghiên cứu và tác giả xuất sắc về mô hình ngôn ngữ lớn, và tôi rất khuyến nghị Substack của ông
“Điều thú vị là Kimi K3 loại bỏ toàn bộ các lớp RoPE, thay vào đó dùng NoPE (No Positional Embeddings) ở mọi nơi”
Bản thân việc cách này hoạt động đã đáng kinh ngạc. Nếu không có thông tin vị trí thì chẳng phải sẽ thành một nồi súp token sao? Tôi tò mò liệu attention có đủ chính xác để token thứ hai nhận ra nó là token thứ hai chỉ bằng cách học cách tích lũy thứ gì đó trong không gian embedding hay không
Trực giác về sự tích lũy cũng phù hợp. Nếu một số attention head liên tục ghi giá trị vào cùng một vùng của residual stream, thì khi số token đầu vào tăng lên, các giá trị sẽ được tích lũy qua phép cộng attention và có thể đóng vai trò như một dạng chỉ số mà không cần mã hóa vị trí riêng
Việc dùng NoPE ở mọi nơi thật thú vị. Các mô hình khác thường vẫn giữ RoPE ở các lớp cục bộ, còn ở đây có vẻ các lớp attention tuyến tính như Kimi Delta đã âm thầm đảm nhiệm xử lý vị trí nên có thể bỏ qua nó. Tôi tò mò liệu điều này có còn giữ được ở quy mô tối tân hay không
Vì giống RNN, nó vốn nhận biết thứ tự của X, Y, Z trong XYZ. Transformer cơ bản xử lý một tập hợp không có thứ tự, nên phải được cung cấp riêng thông tin vị trí giữa các mục
Mỗi lớp attention có 3 lớp KDA và cũng có 3 lớp trước lớp attention đầu tiên, nên mọi token có thể học thông tin vị trí của mình trước khi đi tới lớp attention thực sự đầu tiên
RoPE làm hỏng một phần thông tin, nên nếu có thể bỏ qua theo cách này thì có lợi. Gemma-4 cũng có cấu trúc 5:1 tương tự, với năm lớp sliding window attention (SWA) cho mỗi lớp attention toàn cục. SWA rẻ và kém hiệu năng hơn nhưng xử lý thông tin cục bộ, lấp vào giữa các lớp toàn cục mạnh; trong mô hình này KDA đảm nhiệm vai trò tương tự
Trong Gemma, RoPE chỉ cần cho SWA, vốn là attention thực sự, và được bỏ qua ở attention toàn cục. KDA không phải là attention nên không cần positional embedding
Tôi không biết phải tối tân hơn đến mức nào nữa, nhưng không có lý do gì để nó không hoạt động ở quy mô lớn hơn. Càng có nhiều tham số, các lớp KDA càng dễ truyền thông tin vị trí hơn