- Nativ là ứng dụng mã nguồn mở theo giấy phép MIT, cho phép tải xuống và chạy các mô hình AI mở trên Apple Silicon Mac mà không cần tài khoản, gói đăng ký hay đám mây
- Cung cấp các mô hình từ Google, Cohere, Liquid AI, v.v.; đề xuất mô hình phù hợp với phần cứng Mac và tạo mọi phản hồi cục bộ
- Trong chat, hỗ trợ streaming, Markdown, tô sáng mã và nhập hình ảnh; đồng thời có thể xem trạng thái hiệu năng theo thời gian thực như số token mỗi giây và áp lực bộ nhớ
- Được tối ưu hóa cho bộ nhớ hợp nhất và Metal của MLX-VLM và dòng M, xử lý các tác vụ ngôn ngữ, thị giác, video, mã và âm thanh
- Có thể kết nối máy chủ mô hình cục bộ với Pi, Codex, Claude Code, Hermes, OpenCode, đồng thời công khai cả toàn bộ mã của ứng dụng và model loader
Chạy mô hình cục bộ tối ưu cho Mac
- Là ứng dụng macOS phổ quát hỗ trợ Apple Silicon M1 trở lên, chạy mô hình thực tế trên Mac mà không cần đám mây hay lớp chuyển đổi riêng
- Có thể chọn các mô hình mở của Google, Cohere, Liquid AI từ thư viện được tuyển chọn, đồng thời nhận đề xuất mô hình phù hợp với phần cứng
- Giao diện chat cung cấp các chức năng sau
- Phản hồi streaming và chỉ số hiệu năng theo từng tin nhắn
- Markdown và tô sáng cú pháp mã
- Nhập hình ảnh
- Thông qua đo hiệu năng theo thời gian thực, có thể kiểm tra số token mỗi giây, áp lực bộ nhớ, trạng thái nhiệt và thời gian tạo token đầu tiên
- Dựa trên MLX-VLM, được tinh chỉnh cho bộ nhớ hợp nhất và Metal của dòng M
- Hỗ trợ chat LLM, tạo chú thích ảnh, tóm tắt video, tự động hoàn thành mã, chuyển đổi và tạo giọng nói
- Không cần tài khoản, credit hay gói đăng ký, và không bán dữ liệu người dùng
Tích hợp công cụ phát triển và nguyên tắc mã nguồn mở
- Thông qua một endpoint cục bộ duy nhất của Nativ, có thể kết nối các coding agent hiện có với mô hình cục bộ chạy trên Mac
- Pi
- Codex
- Claude Code
- Hermes
- OpenCode
- Công khai toàn bộ mã, bao gồm ứng dụng desktop, model loader và biểu đồ đo hiệu năng, cho phép xem, fork và gửi Pull Request
- Phát hành theo giấy phép MIT, không có lộ trình VC, cấp enterprise hay dark pattern biến prompt thành dữ liệu huấn luyện
- Có thể xem toàn bộ thư viện mô hình trên Hugging Face
1 bình luận
Ý kiến trên Hacker News
Ứng dụng giấy phép MIT này được tạo bởi Prince Canuma, người duy trì thư viện phổ biến MLX-VLM. MLX-VLM từ lâu đã được dùng làm dependency cho các công cụ như LM Studio, vì có thể cung cấp suy luận nhanh hơn llama.cpp trên thiết bị Apple
Hệ sinh thái MLX nhỏ hơn CUDA, nhưng hỗ trợ các mô hình mới rất nhanh, đặc biệt là mô hình đa phương thức như thị giác, nhận dạng giọng nói, tổng hợp giọng nói và tạo video. mlx-audio-swift cũng đáng tham khảo, và sẽ không ngạc nhiên nếu các mô hình như vậy được tích hợp vào UI này
Trang landing có thể mang dấu vết của vibe coding, nhưng phần lớn ứng dụng được viết bằng Swift, nên có vẻ cũng dễ đưa stack suy luận này lên iPad và iPhone
blaizzytrong domain làm tôi vui, vì các công trình liên quan đến MLX của Prince Canuma có chất lượng đặc biệt caomlx-community/Qwen3-TTS-12Hz-1.7B-Base-bf16hằng ngày để sao chép giọng nóiĐể hỗ trợ các sampler hiện đại, có thể bắt đầu xem từ bài báo 1, bài báo 2, bài báo 3
Có vẻ cụm frontier đang bị lạm dụng. Tôi tưởng nó chỉ các mô hình ở mức hàng đầu như Fable hiện nay, nhưng những mô hình đó cần lượng RAM khổng lồ và GPU đắt tiền, nên có lẽ khó tự host
Nhìn biểu đồ Artificial Analysis sẽ dễ hiểu hơn. Chẳng hạn, không có mô hình nào thông minh như DeepSeek V4 Pro mà rẻ hơn, nên có thể xem đó là mô hình frontier. Các nghiệm trên biên Pareto là lựa chọn tốt nhất trong hạng cân của mình, không thể đổi sang phương án tốt hơn mà không phải hy sinh thứ gì đó
Mỗi khi dùng Gemma 4 12B, tôi lại có cảm giác nó nhỏ, thông minh và hiệu quả, trong khi năng lượng của ngành AI đang đi hoàn toàn sai hướng. Nếu tập trung kinh phí nghiên cứu vào cải thiện các mô hình chạy được trên hệ thống bộ nhớ hợp nhất 16GB, có thể đạt được tiến bộ quan trọng
Qwen 3.6 và các mô hình fine-tune 27B của BottleCap cũng tốt, nhưng hiệu năng đáng kinh ngạc của các mô hình Gemma 4 cỡ nhỏ vẫn chưa được biết đến đủ rộng rãi. Việc website này gọi Qwen 3.6 27B là frontier có vẻ không phù hợp, nhưng xét về hiệu năng thì cũng không phải quá xa vời
Tôi ngạc nhiên vì trang chủ giới thiệu như thể không có các ứng dụng hiện có như LM Studio. Nhìn qua thì không rõ khác biệt là gì, và Open WebUI cũng bị bỏ qua
Tôi đã chạy local DeepSeek V4 Flash trên MacBook Pro bằng Open WebUI và DS4 suốt vài tuần nay
Giờ frontier đã trở thành một từ bị lạm dụng, giống như
load-bearingmà người dùng Claude Code hẳn sẽ biết. Đặc biệt ứng dụng này không thể chạy local các mô hình thật sự hàng đầu trên Mac, nên mong họ ngừng dùng từ đóTôi không thích câu chữ marketing kiểu “vì sao chúng tôi là open source trong khi không ai làm vậy”. Tôi đang dùng oMLX, vốn là open source, và có vẻ cung cấp đủ mọi tính năng của Nativ
Mong họ so sánh đàng hoàng với các đối thủ open source hiện có mà họ đã coi như không tồn tại
Tò mò không biết các mô hình cục bộ nhỏ thực tế được dùng vào việc gì. Chúng đã khá có năng lực, nhưng ngoài vài dự án đồ chơi làm cho vui thì vẫn khó tin cậy để giao công việc thực tế
Muốn biết liệu chúng có thật sự được dùng làm coding agent hay chủ yếu cho mục đích khác
Khó viết từ đầu những đoạn mã cần kiến thức chuyên sâu như engine suy luận hiệu năng cao cho GPU Blackwell, nhưng các PR thông thường để thêm use case vào dự án hiện có thì ở mức tương tự Sonnet. Cần cấu hình đúng như temperature và top-p được khuyến nghị, lượng tử hóa không quá mức, và ngữ cảnh tối thiểu 150 nghìn token
Agent đích dùng DeepSeek V4 Flash; mô hình cục bộ thì chậm để làm chat agent, nhưng hoạt động khá tốt cho việc trích xuất bộ nhớ và giúp giảm lượng API dùng ở mỗi lượt hội thoại
--help, Markdown, viết README. Nếu thất bại thì có thể hoàn tác bằnggit restorehoặc từ chối PR rồi giao lại cho mô hình tốt hơnTò mò không biết nó hơn LM Studio ở điểm nào, và có chạy cả mô hình MTP không. Theo tôi biết thì mô hình MTP ở định dạng GGUF
Đã thử MLX bằng Rapid MLX, nhưng Qwen cứ bị ngắt quãng và lặp lại cùng nội dung. Khi chuyển sang llama.cpp thì tốc độ sinh token với MTP nhanh hơn và mô hình cũng ổn định hơn
Muốn biết những người khác so sánh MLX và llama.cpp thì thu được kết quả thế nào
Với các mô hình tôi thử, có lúc hiệu năng GGUF của llama.cpp còn tốt hơn. MTP của Gemma 4 không có nhiều giá trị, nhưng trên Qwen 3.6 MoE thì có khác biệt đo được, và trên phần cứng mới nhất có thể còn có ý nghĩa hơn
Tò mò cấu hình Mac tầm trung nào phù hợp cho mục đích này. Đang phân vân giữa M5 Pro 64GB và việc mua M5 Air giá rẻ rồi trả chi phí token cloud
Thay vì chi thêm 2.000–3.000 USD để chạy cục bộ các mô hình hiệu năng thấp hơn, có thể mua được một lượng token cloud đáng kể
Tò mò vì sao không chạy DeepSeek V4 trên ds4. Có vẻ kết quả sẽ khá tốt