4 điểm bởi GN⁺ 2024-12-08 | 1 bình luận | Chia sẻ qua WhatsApp
  • Countless.dev là một website nhằm so sánh giá và tính năng của các mô hình AI từ nhiều nhà cung cấp trong một bảng duy nhất, giúp nhanh chóng xem qua giới hạn token và đơn giá cần thiết khi chọn mô hình
  • Danh sách liệt kê các mô hình theo từng nhà cung cấp như OpenAI, Anthropic, Google, Qwen, DeepSeek, Mistral..., đồng thời hiển thị kèm các chỉ số có vẻ như độ dài ngữ cảnh và giới hạn đầu ra
  • Các dòng mô hình thương mại và mã nguồn mở như GPT-5.x, Claude Opus/Sonnet/Haiku, Gemini 2.5/3.x, Qwen3.x, DeepSeek V3/R1, Mistral, Llama, Nemotron... được trộn chung trên một màn hình
  • Một số mục được đánh dấu (free) nên cột giá để trống, và các router như Auto Router, Free Models Router, Pareto Code Router, Switchpoint Router cũng được xử lý như các mục riêng biệt
  • Có thể so sánh các mô hình mới nhất, cũ hơn, preview, hình ảnh, âm thanh, lập trình và nghiên cứu theo từng nhà cung cấp, nhưng chỉ từ nội dung được cung cấp thì vẫn chưa thể xác nhận định nghĩa từng cột trong bảng hay cách tính giá

Bảng so sánh giá·tính năng mô hình AI

  • Countless.dev tự giới thiệu ngay trong tiêu đề là so sánh giá và tính năng LLM
  • Trong tiêu đề trên Hacker News, website này được giới thiệu là nơi so sánh không chỉ LLM mà còn cả TTSSTT
  • Nội dung được cung cấp có dạng một danh sách mô hình dài, và mỗi hàng nhìn chung chứa các thông tin sau
    • Tên nhà cung cấp hoặc router
    • Tên mô hình
    • Chỉ số token được trình bày cùng ký hiệu T
    • Hai mức giá bằng đô la hoặc để trống phần giá
    • Có phải là mô hình miễn phí với dấu (free) hay không

Các nhóm mô hình được trộn theo nhà cung cấp

  • Mục OpenAI bao gồm GPT-5.5, GPT-5.4, GPT-5.3, GPT-5.2, GPT-5.1, GPT-5, GPT-4.1, GPT-4o, GPT-4 Turbo, GPT-3.5 Turbo...
    • Các mô hình Pro giá cao như GPT-5 Pro, GPT-5.4 Pro, GPT-5.5 Pro cũng được liệt kê thành mục riêng
    • Cũng có thể thấy các mô hình âm thanh·hình ảnh như GPT Audio, GPT Audio Mini, GPT-5 Image, GPT-5 Image Mini
    • Các dòng o1, o3, o4 Mini, Deep Research cũng được đưa vào cùng danh sách
  • Mục Anthropic gồm các dòng Claude Opus, Sonnet, Haiku, Fable
    • Có liệt kê Claude Opus 4.8, Claude Opus 4.7, Claude Opus 4.6, Claude Opus 4.5, Claude Opus 4.1, Claude Opus 4
    • Cũng bao gồm Claude Sonnet 5, Sonnet 4.6, Sonnet 4.5, Sonnet 4, Claude Haiku Latest, Claude Haiku 4.5
  • Mục Google có các dòng Gemini, Gemma, Nano Banana, Lyria
    • Có liệt kê Gemini 3 Flash Preview, Gemini 3.5 Flash, Gemini 3.1 Pro Preview, Gemini 2.5 Pro, Gemini 2.5 Flash...
    • Cũng bao gồm các mục mô hình hình ảnh như Nano Banana Pro, Nano Banana 2, Nano Banana Lite
  • Các mô hình từ những nhà cung cấp khác như Qwen, DeepSeek, Mistral, Meta, NVIDIA, MoonshotAI, MiniMax, Z.ai... cũng có thể được so sánh trong cùng một danh sách

Cách hiển thị giá và mô hình miễn phí

  • Những mục có giá sẽ hiển thị cùng lúc hai mức đơn giá bằng đô la
    • Anthropic Claude Opus 4.8: $5, $25
    • OpenAI GPT-5.5: $5, $30
    • Google Gemini 2.5 Pro: $1.25, $10
    • OpenAI o1-pro: $150, $600
  • Các mục có (free) thì cột giá để trống bằng
    • NVIDIA Nemotron 3 Ultra (free)
    • Poolside Laguna M.1 (free)
    • Cohere North Mini Code (free)
    • Google Gemma 4 26B A4B (free)
    • OpenAI gpt-oss-120b (free)
    • Meta Llama 3.3 70B Instruct (free)
  • Một số mô hình có cả phiên bản miễn phí và trả phí ở các hàng riêng
    • Poolside Laguna XS.2
    • Poolside Laguna M.1
    • NVIDIA Nemotron 3 Super
    • Google Gemma 4 26B A4B
    • OpenAI gpt-oss-120b
    • OpenAI gpt-oss-20b

Giới hạn mô hình nhìn qua các chỉ số token

  • Nhiều mô hình hiển thị các con số lớn khoảng 1 triệu token
    • OpenAI GPT-5.5, GPT-5.4, GPT Latest: 1,050,000
    • Anthropic Claude Opus 4.8, Claude Opus 4.7, Claude Sonnet 5: 1,000,000
    • Google Gemini 3 Flash Preview, Gemini 3.1 Flash Lite, Gemini 2.5 Pro: 1,048,576
    • DeepSeek V4 Pro, DeepSeek V4 Flash: 1,048,576 hoặc 1,048,575
  • Chỉ số token thứ hai, có vẻ là giới hạn đầu ra, cũng khác nhau theo từng mô hình
    • OpenAI GPT-5.5: 128,000
    • Anthropic Claude Opus 4.8: 128,000
    • MoonshotAI Kimi K2.6: 262,144
    • MiniMax MiniMax-01: 1,000,192
  • Ở một số hàng, chỉ số thứ hai hoặc giá được để , cho thấy không phải mọi mô hình đều có cùng mức độ thông tin

Router và các mô hình mục đích đặc biệt

  • Ngoài các mô hình thông thường, các mục Router cũng được đưa vào như thể là mô hình riêng
    • OpenRouter Fusion
    • Pareto Code Router
    • Free Models Router
    • Switchpoint Router
    • Auto Router
  • Danh sách cũng bao gồm các mô hình phục vụ mục đích cụ thể như an toàn, nghiên cứu, tìm kiếm, áp dụng mã
    • NVIDIA Nemotron 3.5 Content Safety
    • Meta Llama Guard 4 12B
    • OpenAI o3 Deep Research
    • Perplexity Sonar Deep Research
    • Relace Search
    • Relace Apply 3
  • Chỉ từ nội dung được cung cấp thì khó xác nhận các tiêu chí chi tiết như cách chọn của từng router hay mô hình đặc thù, benchmark, API được hỗ trợ, hoặc chu kỳ cập nhật

1 bình luận

 
GN⁺ 2024-12-08
Các ý kiến trên Hacker News
  • OP, có phải bạn lấy cảm hứng từ công cụ so sánh LLM này không?
    https://whatllm.vercel.app
    Bảng khá giống, nhưng việc thêm trực tiếp máy tính ở đây là một điểm hay
    Trong phần Versus Comparison, sẽ tốt nếu có tính năng làm nổi bật ngay các mục có giá trị cao nhất của từng LLM khi bấm checkbox

    • Dữ liệu của công cụ này được lấy từ https://artificialanalysis.ai/ tính đến ngày 13/10/2024 nên hơi cũ
      Thông tin mới nhất về tất cả mô hình và nhà cung cấp có ở trang này: https://artificialanalysis.ai/leaderboards/providers
      Các trang khác cũng bao gồm nhận dạng giọng nói, tổng hợp giọng nói, tạo hình ảnh và tạo video
      Nhân tiện, tôi là một trong những người tạo ra Artificial Analysis
  • Việc có thêm nhiều so sánh mô hình là hướng đi tốt. Tôi tò mò liệu bạn có kế hoạch bổ sung phân tích độc lập về các mô hình này không, hay chỉ tổng hợp thông tin như giới hạn đầu vào
    Bạn thấy điểm khác biệt hoặc giá trị gia tăng nào so với các phân tích khác như dưới đây?
    https://artificialanalysis.ai
    https://huggingface.co/spaces/TTS-AGI/TTS-Arena
    https://huggingface.co/spaces/hf-audio/open_asr_leaderboard
    https://huggingface.co/spaces/TIGER-Lab/GenAI-Arena
    Phần tổng hợp rất tuyệt, và website cũng dễ điều hướng

    • Tôi đã tạo https://aimodelreview.com/ để so sánh kết quả đầu ra của LLM theo nhiều prompt và danh mục, đồng thời cho xem cạnh nhau
      Tôi đã chạy mỗi prompt 4 lần với các giá trị temperature khác nhau, và có thể xem bằng nút chuyển đổi
      Tôi cũng định thêm review cho từng mô hình nhưng hết sức. Dù vậy, tôi từng nhận được phản hồi rằng phần so sánh vẫn hữu ích để hình dung các mô hình trả lời khác nhau thế nào với cùng một prompt, và temperature ảnh hưởng ra sao đến đầu ra của cùng một mô hình
    • Cá nhân tôi thấy UI của Gradio xấu, nên đã dùng shadcn và Next.js để website trông đẹp hơn
      Tôi đang cố làm cho nó thân thiện với người dùng nhất có thể. Phần lớn website đều xấu hoặc quá kỹ thuật
    • Hãy tưởng tượng tiến thêm một bước nữa: thực sự chạy cùng một prompt trên mọi mô hình AI, rồi hiển thị câu trả lời tốt nhất và mô hình đã tạo ra câu trả lời đó
  • Hay đấy! Sẽ tốt nếu có thể xem giá trị hiệu năng trên giá tiền
    Cần có cách để biết mô hình rẻ nhất có thể dùng khi tạo dữ liệu có cấu trúc một cách ổn định từ văn bản phi cấu trúc
    Hiện tôi đang dùng gpt4o-mini giá rẻ, nhưng không biết liệu có mô hình rẻ hơn nào cũng làm được việc tương tự không

    • Hãy thử xem Gemini Flash 1.5. Tôi cần chuyển video thành ghi chú có cấu trúc và kết quả khá hài lòng, kỳ lạ là còn tốt hơn Gemini 1.5 Pro
      https://jampauchoa.substack.com/i/151329856/ai-studio
      Theo website này, chi phí bằng một nửa gpt4-o mini. 0,15 so với 0,07 trên mỗi 1 triệu token
    • Tôi vẫn chưa tìm thấy mô hình nào ở mức giá của GPT-4o mini mà có năng lực tương đương. Nhìn vào kỳ vọng dành cho Llama 3.3 70B thì có thể là mô hình đó
      Trên Deepinfra, token đầu vào đắt hơn nhưng token đầu ra rẻ hơn, nên tôi xem giá gần như tương đương
      Tuy nhiên, hiệu năng trên giá tiền tốt nhất khá chủ quan. Vì có người chỉ cần chạy tốt một use case, còn người khác có thể muốn nó tốt trên phạm vi rộng hơn
    • Khi so sánh nhiều mô hình, tôi luôn khuyên dùng openrouter.ai. Đó là nơi tôi thường dùng cho các tác vụ linh tinh
      Tôi không có liên quan gì, chỉ là người dùng
  • Tôi muốn chia sẻ một góc nhìn cá nhân và lời than thở về AI. Như nhiều người, tôi cũng cực kỳ hào hứng với làn sóng AI hiện nay
    Đây đang là tuyến đầu của đổi mới, nên thôi thúc nhảy vào lĩnh vực này và đóng góp là điều tự nhiên
    Nhưng tôi thấy thời điểm này giống một thị trường tài chính quá nóng. Một lời khuyên thường nghe khi thị trường biến động mạnh là chờ và quan sát
    Trong AI cũng vậy, những nhân tài và tổ chức xuất sắc đang chạy đua để tạo ra các đột phá lớn. Rất có khả năng thứ tôi tưởng tượng là dự án lớn tiếp theo đã đang được làm ở đâu đó, hoặc sắp xuất hiện
    Vì vậy, chiến lược chờ và quan sát có thể hiệu quả bất ngờ. Thay vì vội vàng, hãy đợi bụi lắng xuống, quan sát dòng chảy, rồi tận dụng những thứ mới xuất hiện
    Theo một nghĩa nào đó, toàn bộ hệ sinh thái AI đang xây nền cho ý tưởng lớn tiếp theo của tôi
    Nói vậy không có nghĩa là đừng tích hợp công nghệ mới nhất vào các sản phẩm và dịch vụ đã hoạt động

    • Đề xuất này khá hợp lý. Hẳn đã có nhiều công ty tích hợp các mô hình tiên tiến nhất vào sản phẩm của họ
      Tuy nhiên không có bữa trưa miễn phí. Làm như vậy sẽ khiến bạn hành động mang tính phản ứng hơn là đi trước
      Bạn giảm rủi ro, nhưng cũng mất cơ hội có phần sở hữu ở một trong số ít nơi sẽ sống sót và trở nên rất có giá trị
      Nếu cứ như vậy lâu dài, rốt cuộc bạn sẽ không còn hiểu người trong lĩnh vực đó đang nói gì. Nếu muốn nắm được ý tôi, hãy xem tập Dwarkesh Patel mới nhất
      Ở đây, phần sở hữu được hiểu rộng, như cổ phần công ty, kiến thức với tư cách nhà nghiên cứu AI
  • Hỏi hơi lệch chủ đề một chút, nhưng trên desktop có ứng dụng nào tốt hơn client ChatGPT mặc định không?
    Tôi thấy chức năng sắp xếp chat quá đơn giản, mà có đến khoảng hơn chục ứng dụng nên khó đánh giá. Phần lớn trông giống như lớp vỏ bọc để dẫn sang dịch vụ API của công ty nào đó
    Có ứng dụng nào đáng giới thiệu không? Sẽ tốt nếu tương thích macOS/Linux

    • Có Telosnex. Chạy native trên mọi nền tảng và cũng có bản web
      Hỗ trợ Anthropic, OpenAI, Mistral, Groq, Gemini, và LLM local trên gần như mọi nền tảng
      Bạn có thể mang API key của mình vào, và tính năng tìm kiếm cũng tốt nhất. Trả theo mức dùng; nếu trả 10 USD/tháng thì mọi thứ được cung cấp theo giá gốc. Hoặc dùng miễn phí
      Toàn bộ dữ liệu được lưu dưới dạng JSON đơn giản
    • https://www.typingmind.com/. Chỉ chạy local, không có máy chủ, do một nhà phát triển indie làm
    • Tôi đã dùng Machato khá ổn: https://untimelyunicorn.gumroad.com/l/machato
  • Chỉ có hai mô hình phiên âm giọng nói thôi nhỉ. Bình thường thật sự là như vậy sao?
    Tôi thắc mắc không biết có mô hình mã nguồn mở kiểu Llama dành cho phiên âm hay không, hay là dataset của trang này còn nhỏ

    • Có vẻ trang này chỉ liệt kê các mô hình được host của những nhà cung cấp lớn, chứ không phải tất cả mô hình trên Hugging Face, civit.ai, v.v.
      Nhìn danh sách tạo ảnh và chat cũng thấy trên Hugging Face có nhiều mô hình hơn rất nhiều mà ở đây bị thiếu
      Xem https://huggingface.co/models?pipeline_tag=automatic-speech-...
      Nhân tiện, mô hình tổng hợp giọng nói và mô hình phiên âm/nhận dạng giọng nói tự động có thể được huấn luyện bằng cùng một dữ liệu. Tuy nhiên hiện tại kiến trúc mô hình khác nhau nên phải huấn luyện riêng
      Một trong những điểm khó là thời gian huấn luyện. Dữ liệu có thể tăng lên tới hàng trăm giờ audio
    • Mô hình thì thật sự rất nhiều, bao phủ nhiều trường hợp sử dụng. Ví dụ như on-device, streaming/độ trễ thấp, mô hình cho ngôn ngữ cụ thể, v.v.
      Mọi người cứ nghĩ OpenAI đã phát minh ra phiên âm giọng nói với Whisper vào năm 2022, nhưng các mô hình khác đã tồn tại suốt hàng chục năm và đã được dùng trong môi trường vận hành thực tế
      Trang web đó chỉ có Whisper
  • UI và cách bố trí bảng tốt. Bạn đã nghĩ đến việc hiển thị yêu cầu VRAM theo từng mô hình chưa?

  • Sẽ tốt nếu có thêm thông tin xếp hạng lmarena để so sánh hiệu năng và chi phí

  • Tài liệu hay. Với người không biết hết tên các phiên bản con thì gần như còn quá bao quát
    Sẽ tốt nếu có cột điểm bảng xếp hạng lmarena. Một số giá hiển thị là 0.00, lý do là gì vậy?
    Cũng sẽ tốt nếu mỗi hàng có liên kết tới một trang chi tiết hơn

    • Cảm ơn! Một số mô hình hiển thị N/A hoặc 0.00, có vẻ là do đó là mô hình miễn phí hoặc không khả dụng
      Tôi chắc chắn sẽ thêm llmarena. Nhiều người khác cũng đã đề xuất
      Theo thời gian tôi sẽ làm website có nhiều mô tả và chi tiết hơn
    • Cũng sẽ tốt nếu có liên kết tới trang của công ty nơi có thể dùng hoặc đăng ký mô hình