1 điểm bởi GN⁺ 3 giờ trước | 1 bình luận | Chia sẻ qua WhatsApp
  • Nativ là ứng dụng mã nguồn mở theo giấy phép MIT, cho phép tải xuống và chạy các mô hình AI mở trên Apple Silicon Mac mà không cần tài khoản, gói đăng ký hay đám mây
  • Cung cấp các mô hình từ Google, Cohere, Liquid AI, v.v.; đề xuất mô hình phù hợp với phần cứng Mac và tạo mọi phản hồi cục bộ
  • Trong chat, hỗ trợ streaming, Markdown, tô sáng mã và nhập hình ảnh; đồng thời có thể xem trạng thái hiệu năng theo thời gian thực như số token mỗi giây và áp lực bộ nhớ
  • Được tối ưu hóa cho bộ nhớ hợp nhất và Metal của MLX-VLM và dòng M, xử lý các tác vụ ngôn ngữ, thị giác, video, mã và âm thanh
  • Có thể kết nối máy chủ mô hình cục bộ với Pi, Codex, Claude Code, Hermes, OpenCode, đồng thời công khai cả toàn bộ mã của ứng dụng và model loader

Chạy mô hình cục bộ tối ưu cho Mac

  • Là ứng dụng macOS phổ quát hỗ trợ Apple Silicon M1 trở lên, chạy mô hình thực tế trên Mac mà không cần đám mây hay lớp chuyển đổi riêng
  • Có thể chọn các mô hình mở của Google, Cohere, Liquid AI từ thư viện được tuyển chọn, đồng thời nhận đề xuất mô hình phù hợp với phần cứng
  • Giao diện chat cung cấp các chức năng sau
    • Phản hồi streaming và chỉ số hiệu năng theo từng tin nhắn
    • Markdown và tô sáng cú pháp mã
    • Nhập hình ảnh
  • Thông qua đo hiệu năng theo thời gian thực, có thể kiểm tra số token mỗi giây, áp lực bộ nhớ, trạng thái nhiệt và thời gian tạo token đầu tiên
  • Dựa trên MLX-VLM, được tinh chỉnh cho bộ nhớ hợp nhất và Metal của dòng M
  • Hỗ trợ chat LLM, tạo chú thích ảnh, tóm tắt video, tự động hoàn thành mã, chuyển đổi và tạo giọng nói
  • Không cần tài khoản, credit hay gói đăng ký, và không bán dữ liệu người dùng

Tích hợp công cụ phát triển và nguyên tắc mã nguồn mở

  • Thông qua một endpoint cục bộ duy nhất của Nativ, có thể kết nối các coding agent hiện có với mô hình cục bộ chạy trên Mac
    • Pi
    • Codex
    • Claude Code
    • Hermes
    • OpenCode
  • Công khai toàn bộ mã, bao gồm ứng dụng desktop, model loader và biểu đồ đo hiệu năng, cho phép xem, fork và gửi Pull Request
  • Phát hành theo giấy phép MIT, không có lộ trình VC, cấp enterprise hay dark pattern biến prompt thành dữ liệu huấn luyện
  • Có thể xem toàn bộ thư viện mô hình trên Hugging Face

1 bình luận

 
Ý kiến trên Hacker News
  • Ứng dụng giấy phép MIT này được tạo bởi Prince Canuma, người duy trì thư viện phổ biến MLX-VLM. MLX-VLM từ lâu đã được dùng làm dependency cho các công cụ như LM Studio, vì có thể cung cấp suy luận nhanh hơn llama.cpp trên thiết bị Apple
    Hệ sinh thái MLX nhỏ hơn CUDA, nhưng hỗ trợ các mô hình mới rất nhanh, đặc biệt là mô hình đa phương thức như thị giác, nhận dạng giọng nói, tổng hợp giọng nói và tạo video. mlx-audio-swift cũng đáng tham khảo, và sẽ không ngạc nhiên nếu các mô hình như vậy được tích hợp vào UI này
    Trang landing có thể mang dấu vết của vibe coding, nhưng phần lớn ứng dụng được viết bằng Swift, nên có vẻ cũng dễ đưa stack suy luận này lên iPad và iPhone

    • Hiện nay trên Hugging Face hầu như mọi mô hình phổ biến đều có phiên bản MLX. Ví dụ, từ trang chính của Qwen 3.6 35B-A3B, chỉ cần đi theo các liên kết lượng tử hóa và chọn một biến thể MLX có uy tín, phổ biến
    • Thấy blaizzy trong domain làm tôi vui, vì các công trình liên quan đến MLX của Prince Canuma có chất lượng đặc biệt cao
    • Repo GitHub ghi rằng hỗ trợ cho các mô hình chỉ âm thanh và mô hình chuyên tạo ảnh sẽ sớm được bổ sung. Prince Canuma phản hồi rất nhanh trên X và trong issue GitHub; tôi gần như dùng mlx-audio cùng mlx-community/Qwen3-TTS-12Hz-1.7B-Base-bf16 hằng ngày để sao chép giọng nói
    • Câu hỏi đầu tiên nảy ra là khác gì so với Unsloth
    • mlx-vlm, giống vllm hay sglang, hỗ trợ các sampler hiện đại rất kém, nên chuyển sang có khi còn hại hơn. Tôi là một trong các tác giả của bài báo min_p, và nếu min_p là lựa chọn tốt nhất trong khi llama.cpp hỗ trợ top-n-sigma vượt trội hơn nhiều, thì dù tốc độ có nhanh hơn cũng không có lý do để chuyển
      Để hỗ trợ các sampler hiện đại, có thể bắt đầu xem từ bài báo 1, bài báo 2, bài báo 3
  • Có vẻ cụm frontier đang bị lạm dụng. Tôi tưởng nó chỉ các mô hình ở mức hàng đầu như Fable hiện nay, nhưng những mô hình đó cần lượng RAM khổng lồ và GPU đắt tiền, nên có lẽ khó tự host

    • Ở đây có vẻ muốn nói đến biên Pareto, tức tập các lời giải tốt nhất của một bài toán tối ưu đa mục tiêu. Nếu xét theo trí tuệ và giá, một mô hình thuộc frontier khi không có mô hình nào cung cấp trí tuệ ngang bằng hoặc cao hơn với giá rẻ hơn, cũng không có mô hình nào thông minh hơn ở mức giá bằng hoặc thấp hơn
      Nhìn biểu đồ Artificial Analysis sẽ dễ hiểu hơn. Chẳng hạn, không có mô hình nào thông minh như DeepSeek V4 Pro mà rẻ hơn, nên có thể xem đó là mô hình frontier. Các nghiệm trên biên Pareto là lựa chọn tốt nhất trong hạng cân của mình, không thể đổi sang phương án tốt hơn mà không phải hy sinh thứ gì đó
    • Cách dùng này dễ gây nhầm lẫn nên tôi khó đồng ý, nhưng nhìn chung frontier có thể có nhiều loại, và trong đó frontier của các mô hình local nhỏ, trọng số mở là quan trọng và thú vị nhất
      Mỗi khi dùng Gemma 4 12B, tôi lại có cảm giác nó nhỏ, thông minh và hiệu quả, trong khi năng lượng của ngành AI đang đi hoàn toàn sai hướng. Nếu tập trung kinh phí nghiên cứu vào cải thiện các mô hình chạy được trên hệ thống bộ nhớ hợp nhất 16GB, có thể đạt được tiến bộ quan trọng
      Qwen 3.6 và các mô hình fine-tune 27B của BottleCap cũng tốt, nhưng hiệu năng đáng kinh ngạc của các mô hình Gemma 4 cỡ nhỏ vẫn chưa được biết đến đủ rộng rãi. Việc website này gọi Qwen 3.6 27B là frontier có vẻ không phù hợp, nhưng xét về hiệu năng thì cũng không phải quá xa vời
    • Frontier được định nghĩa là tổ hợp tối ưu trên nhiều chiều, như số tham số, hiệu năng theo từng tác vụ, tốc độ sinh token trên cùng phần cứng, yêu cầu bộ nhớ hoạt động, v.v. Trong các lựa chọn hiện có, mô hình nào mà muốn cải thiện một chỉ số thì ít nhất một chỉ số khác phải xấu đi sẽ thuộc frontier
    • Frontier là một đường cong, tức Pareto front
    • Khoảng cách giữa open source và tuyến đầu đang thu hẹp nhờ các mô hình như Kimi K3, nhưng Kimi K3 có hơn 2 nghìn tỷ tham số. Những mô hình như Gemma 4 có thể thực sự chạy trên Mac thông thường thì không cùng hạng
  • Tôi ngạc nhiên vì trang chủ giới thiệu như thể không có các ứng dụng hiện có như LM Studio. Nhìn qua thì không rõ khác biệt là gì, và Open WebUI cũng bị bỏ qua
    Tôi đã chạy local DeepSeek V4 Flash trên MacBook Pro bằng Open WebUI và DS4 suốt vài tuần nay

    • LM Studio là phần mềm đóng được xây dựng dựa trên mã mà nhà phát triển Nativ đã công khai
    • LM Studio cũng làm việc tương tự nhưng không open source. Vì vậy Nativ vẫn có điểm khác biệt để cung cấp
    • Câu “các ứng dụng AI local khác mà bạn từng nghe đến là lớp vỏ độc quyền xây trên engine open source mà họ không sở hữu” là cách nói nhắm vòng vo vào LM Studio
    • Tôi tò mò cấu hình MacBook của bạn. Trên Strix Halo của tôi, DeepSeek V4 Flash quá chậm để dùng cho tác vụ agent
  • Giờ frontier đã trở thành một từ bị lạm dụng, giống như load-bearing mà người dùng Claude Code hẳn sẽ biết. Đặc biệt ứng dụng này không thể chạy local các mô hình thật sự hàng đầu trên Mac, nên mong họ ngừng dùng từ đó

  • Tôi không thích câu chữ marketing kiểu “vì sao chúng tôi là open source trong khi không ai làm vậy”. Tôi đang dùng oMLX, vốn là open source, và có vẻ cung cấp đủ mọi tính năng của Nativ
    Mong họ so sánh đàng hoàng với các đối thủ open source hiện có mà họ đã coi như không tồn tại

    • Có lẽ họ định nói về lý do các lựa chọn như LM Studio không phải open source
  • Tò mò không biết các mô hình cục bộ nhỏ thực tế được dùng vào việc gì. Chúng đã khá có năng lực, nhưng ngoài vài dự án đồ chơi làm cho vui thì vẫn khó tin cậy để giao công việc thực tế
    Muốn biết liệu chúng có thật sự được dùng làm coding agent hay chủ yếu cho mục đích khác

    • Từng triển khai lên production mã do Qwen3.6 27B sinh ra trong OpenCode. Phạm vi kiến thức không rộng như Opus, nhưng nếu nó có thể suy luận hoàn toàn các thay đổi chỉ từ prompt và mã xung quanh thì hoạt động rất tốt
      Khó viết từ đầu những đoạn mã cần kiến thức chuyên sâu như engine suy luận hiệu năng cao cho GPU Blackwell, nhưng các PR thông thường để thêm use case vào dự án hiện có thì ở mức tương tự Sonnet. Cần cấu hình đúng như temperature và top-p được khuyến nghị, lượng tử hóa không quá mức, và ngữ cảnh tối thiểu 150 nghìn token
    • Dùng Gemma 4 cục bộ để trích xuất memory graph cho agent cá nhân. Chia tin nhắn thành chủ đề, nguồn, sự kiện, thực thể, v.v. rồi đưa vào graph phục vụ tìm kiếm bằng NLEmbeddings
      Agent đích dùng DeepSeek V4 Flash; mô hình cục bộ thì chậm để làm chat agent, nhưng hoạt động khá tốt cho việc trích xuất bộ nhớ và giúp giảm lượng API dùng ở mỗi lượt hội thoại
    • Không dùng làm coding agent, nhưng rất hữu ích cho chuyển đổi văn bản, tóm tắt và trích xuất thông tin. Nếu đã đăng ký mô hình trả phí thì có thể không có lợi ích đặc biệt nào ngoài quyền riêng tư, nhưng bản thân điều đó cũng không nên bị xem nhẹ
    • Các mô hình nhỏ cũng xử lý đủ tốt những tác vụ lặp lại như cập nhật dependency, giải quyết merge conflict, --help, Markdown, viết README. Nếu thất bại thì có thể hoàn tác bằng git restore hoặc từ chối PR rồi giao lại cho mô hình tốt hơn
    • Qwen35ba3b có thể thực hiện làm sạch dữ liệu quy mô lớn ngay cả trên phần cứng tương đối bình thường. Với hai GPU 3090, đã xử lý khoảng 100 tỷ token
  • Tò mò không biết nó hơn LM Studio ở điểm nào, và có chạy cả mô hình MTP không. Theo tôi biết thì mô hình MTP ở định dạng GGUF

  • Đã thử MLX bằng Rapid MLX, nhưng Qwen cứ bị ngắt quãng và lặp lại cùng nội dung. Khi chuyển sang llama.cpp thì tốc độ sinh token với MTP nhanh hơn và mô hình cũng ổn định hơn
    Muốn biết những người khác so sánh MLX và llama.cpp thì thu được kết quả thế nào

    • Trên M1 Max, tôi hầu như không thấy lợi ích của MLX. Có thể lợi ích sẽ lớn hơn trên M3 trở lên nhờ các thay đổi ở Apple Neural Engine
      Với các mô hình tôi thử, có lúc hiệu năng GGUF của llama.cpp còn tốt hơn. MTP của Gemma 4 không có nhiều giá trị, nhưng trên Qwen 3.6 MoE thì có khác biệt đo được, và trên phần cứng mới nhất có thể còn có ý nghĩa hơn
    • Đã thử MLX hai lần ở các thời điểm khác nhau, nhưng lần nào cũng cho thấy hiệu năng thấp hơn đáng kể so với llama.cpp
  • Tò mò cấu hình Mac tầm trung nào phù hợp cho mục đích này. Đang phân vân giữa M5 Pro 64GB và việc mua M5 Air giá rẻ rồi trả chi phí token cloud
    Thay vì chi thêm 2.000–3.000 USD để chạy cục bộ các mô hình hiệu năng thấp hơn, có thể mua được một lượng token cloud đáng kể

    • Ngay cả M1 Max 64GB cũng có thể chạy khá nhiều mô hình kiểu này
  • Tò mò vì sao không chạy DeepSeek V4 trên ds4. Có vẻ kết quả sẽ khá tốt

    • Có vẻ Nativ không hỗ trợ streaming từ SSD như DwarfStar