- Kết quả tinh chỉnh bằng học tăng cường một mô hình mã nguồn mở 9B cho kiểm duyệt catalog thương mại điện tử với chi phí khoảng 500 USD cho thấy mô hình này đạt điểm cao hơn mọi cấu hình mô hình frontier dùng cùng công cụ, hình ảnh và bộ chấm điểm
- Trong một bản sao số được tạo từ 177.767 phiên kiểm duyệt, mô hình lặp lại việc phân loại sản phẩm, xác minh thương hiệu, trích xuất thuộc tính và phán định theo chính sách để học vào trọng số mô hình hệ phân loại và tiêu chí đánh giá riêng của doanh nghiệp
- Mô hình được huấn luyện bằng GRPO đạt 87,3% mức điểm tối đa có thể đạt, cao hơn tương đối 13,5% so với cấu hình frontier tốt nhất là 76,9%, và cải thiện 36% so với mô hình nền chưa huấn luyện là 64,2%
- Chi phí vào khoảng 0,50 USD cho mỗi 1.000 sản phẩm, rẻ hơn 40 lần so với cấu hình frontier rẻ nhất và khoảng 340 lần so với cấu hình đắt nhất; ở quy mô 40 triệu lượt mỗi ngày, chênh lệch chi phí hằng năm là khoảng 7 triệu USD so với 500 triệu USD
- Cách làm này phù hợp với các công việc lặp lại quy mô lớn mà kết quả có thể được kiểm chứng bằng quy tắc, bài kiểm tra và rubric; các dữ kiện thay đổi nên để ở công cụ tìm kiếm, còn cách ra quyết định riêng của doanh nghiệp thì cần được học vào mô hình
Cách vận hành quyết định hiệu quả đầu tư AI
- Từ sau khi ChatGPT ra mắt, việc ứng dụng AI đã mở rộng từ các công việc rủi ro thấp như tóm tắt tài liệu hay soạn nháp email sang phát triển phần mềm, tạo nội dung, và ý tưởng bộ não doanh nghiệp (company brain) kết nối tri thức, dữ liệu và công cụ nội bộ
- Trong dữ liệu khách hàng của Ramp, nhóm doanh nghiệp thuộc top 25% về chi tiêu AI đã tăng hơn gấp đôi doanh thu từ tháng 11/2022 đến tháng 12/2025, trong khi các doanh nghiệp không chi cho AI chỉ tăng khoảng 15% trong cùng kỳ
- Ở các tổ chức đạt kết quả, các cách vận hành sau lặp đi lặp lại
- Thiết kế lại luồng công việc: không chỉ thêm mô hình vào quy trình hiện có mà phải thiết kế lại các điểm phê duyệt, rà soát, bàn giao và can thiệp của con người
- Trong khảo sát năm 2025 của McKinsey về các tổ chức dùng AI tạo sinh, việc thiết kế lại luồng công việc có tương quan cao nhất với tác động tới EBIT, nhưng chỉ 21% tổ chức thực sự thiết kế lại dù chỉ một quy trình
- Khuyến khích thử nghiệm: vì mô hình, công cụ và thông lệ tốt nhất thay đổi rất nhanh, cần khen thưởng không chỉ các lần ra mắt thành công mà cả việc thử nghiệm và chia sẻ thất bại
- Ngữ cảnh công việc tùy biến: truy cập dữ liệu, kiểm soát truy cập theo từng yêu cầu, truy xuất bằng chứng liên quan và quản lý cửa sổ ngữ cảnh vốn càng dài càng bị dùng không đồng đều đều trở thành các bài toán kỹ thuật riêng
- Đo lường mức sử dụng và hiệu quả: nếu không có đánh giá chấm điểm trên dữ liệu riêng, rất khó chứng minh hiệu năng, chi phí ra quyết định và tác động tới hiệu suất; các số liệu tiết kiệm thời gian do người dùng tự báo cáo cũng có thể không chính xác
- Thiết kế lại luồng công việc: không chỉ thêm mô hình vào quy trình hiện có mà phải thiết kế lại các điểm phê duyệt, rà soát, bàn giao và can thiệp của con người
Cách triển khai để ‘sở hữu trí tuệ’
- Cấu hình lặp lại nhiều lần là dùng mô hình mã nguồn mở, dữ liệu tác vụ riêng của doanh nghiệp và học tăng cường trên luồng công việc có thể chấm điểm
- Mô hình frontier được dùng để xác nhận khả năng tự động hóa và thiết lập đường cơ sở ban đầu
- Trong quá trình gọi, các bản ghi đầu vào, quyết định và chỉnh sửa được tích lũy, sau này trở thành dữ liệu huấn luyện cho mô hình chuyên biệt
- Khi vượt qua giai đoạn prototype để bước vào vận hành quy mô lớn, chi phí mỗi lần gọi và hiệu năng trở thành ưu tiên
- Mô hình frontier và mô hình chuyên biệt không hoàn toàn thay thế nhau
- Các mô hình đa dụng như ChatGPT hay Claude có thể giao cho mô hình chuyên biệt xử lý những phần cần tri thức nội bộ
- Mô hình chuyên biệt cũng có thể gọi mô hình frontier ở các tác vụ cần năng lực tổng quát cao
- Mô hình làm việc với công cụ và dữ liệu của doanh nghiệp, rubric chấm kết quả và tín hiệu phần thưởng cập nhật mô hình
- Khi lặp lại hàng chục nghìn tác vụ, các phán đoán nghiệp vụ sẽ được ghi vào trọng số
- Các dữ kiện thay đổi như giá, tồn kho hay tài liệu chính sách được giữ ở công cụ
Các ví dụ triển khai mô hình chuyên biệt trong thực tế
- Bridgewater Associates huấn luyện một mô hình mã nguồn mở bằng nhãn của chuyên gia đầu tư để phán định xem bài báo, công bố hay email có liên quan tới luận điểm đầu tư hay không, và xác định chỗ nào bắt đầu xuất hiện ngôn từ sáo rỗng
- Chỉ dùng prompt không thể phản ánh ổn định các tiêu chí đánh giá nội bộ
- Mô hình đã huấn luyện có số lỗi ít hơn khoảng 30% so với mô hình frontier tốt nhất, đồng thời chi phí suy luận cũng thấp hơn
- Harvey áp dụng mô hình trọng số mở và học tăng cường cho các công việc mà lỗi tích lũy qua nhiều bước như thẩm định giao dịch và soạn bản ghi nhớ pháp lý
- Theo rubric nội bộ, tác nhân pháp lý này vượt GPT-5.5 và Claude Opus 4.8
- Intercom Fin Apex được huấn luyện tiếp bằng hàng tỷ tương tác dịch vụ khách hàng để cải thiện chi phí mỗi lần gọi và tỷ lệ giải quyết ở quy mô xử lý khoảng 2 triệu vấn đề khách hàng mỗi tuần
- Intercom cho biết mô hình này giải quyết được nhiều vấn đề hơn mô hình frontier tốt nhất trong khi chi phí vận hành thấp hơn
- Quy trình triển khai chung là tạo đường cơ sở bằng mô hình frontier đã tối ưu prompt và ngữ cảnh, rồi chuyển bản ghi thực thi và nội dung học được sang một mô hình nhỏ mà doanh nghiệp sở hữu
Bài toán toàn vẹn catalog và chi phí
- Catalog thương mại điện tử đòi hỏi phải đặt mọi sản phẩm vào đúng hệ phân loại, đồng thời trích xuất chính xác các thuộc tính từ hình ảnh và mô tả để phục vụ tìm kiếm, lọc, gợi ý và các vận hành tiếp theo
- Phán đoán sai làm giảm khả năng được tìm thấy của sản phẩm và chất lượng gợi ý, đồng thời khiến vi phạm chính sách bị bỏ sót
- Nếu bỏ sót hàng giả, khách hàng và thương hiệu sẽ đối mặt với gian lận
- Nếu gắn cờ quá mức với sản phẩm bình thường, hàng đợi rà soát và sự bất tiện cho người bán sẽ tăng lên
- Quy mô công việc cũng rất lớn
- eBay có khoảng 2,5 tỷ sản phẩm đang hoạt động
- Catalog của Shopify nhận hơn 10 triệu lượt cập nhật sản phẩm mỗi ngày
- Walmart ước tính nếu chỉ dùng con người cho công việc catalog có hỗ trợ AI thì sẽ cần nhân lực nhiều hơn khoảng 100 lần
- 71% người tiêu dùng cho biết từng trả hàng vì sản phẩm thực tế khác với thông tin đăng bán
- Nếu một marketplace cỡ trung xử lý khoảng 10 triệu lượt tạo/sửa sản phẩm mỗi ngày, chi phí kiểm duyệt dựa trên mô hình frontier ước tính khoảng 500 triệu USD mỗi năm, còn mô hình chuyên biệt được tinh chỉnh khoảng 10 triệu USD
- Shopify sử dụng mô hình mở đã tinh chỉnh để thực hiện khoảng 40 triệu lượt suy luận phân loại sản phẩm mỗi ngày vì cho rằng API thương mại là không khả thi về mặt kinh tế
Công việc của tác nhân kiểm duyệt catalog
- Khi rà soát sản phẩm, tác nhân sẽ tìm kiếm hệ phân loại, xác minh thương hiệu, lấy schema thuộc tính của phân loại tương ứng rồi chốt quyết định có cấu trúc
- Nếu thiếu căn cứ hoặc rủi ro cao, tác vụ sẽ được chuyển sang con người rà soát
- Ví dụ với găng tay lao động, quy trình diễn ra theo thứ tự sau
- Dùng
search_taxonomyđể tìm phân loạiSafety Work Gloves - Dùng
lookup_brandđể xác nhận AmazonBasics đã được đăng ký nhưng không thuộc diện được bảo hộ - Dùng
get_attribute_schemađể lấy các thuộc tính thương hiệu, màu sắc, chất liệu và kích cỡ - Chốt phán định
allowedcùng với phân loại và thuộc tính
- Dùng
- Chi phí bỏ sót vi phạm thực tế được đặt cao gấp 7 lần so với báo động giả, để hai loại lỗi được học theo cách bất đối xứng
Bản sao số phục vụ huấn luyện
- Dựa trên hình ảnh và thông tin đăng bán sản phẩm thực từ Amazon Berkeley Objects, nhóm nghiên cứu xây dựng 177.767 phiên kiểm duyệt
- Mỗi phiên gồm hình ảnh, tiêu đề, mô tả, thương hiệu được khai báo và khu vực
- Các vi phạm chính sách có kiểm soát, hình ảnh không khớp, tuyên bố thương hiệu mâu thuẫn và cả các tuyên bố hợp lệ được cài vào như những mẫu âm tính khó
- Mọi phiên đều có đáp án đúng có thể chấm điểm
- Môi trường mà mô hình dùng tái hiện công việc của nhà phân tích thực tế
- Tìm kiếm trong khoảng 13.000 phân loại
- Kiểm tra tình trạng đăng ký và bảo hộ của thương hiệu
- Lấy các thuộc tính cần thiết cho phân loại đã chọn
- Chốt quyết định cuối cùng về phân loại, thuộc tính và chính sách
- Bộ chấm điểm thưởng cho đáp án đúng, đồng thời phạt việc bỏ sót vi phạm, gán thuộc tính thiếu căn cứ, phân loại sai và gọi công cụ không cần thiết
- Học tăng cường chỉ khả thi khi môi trường có thể tái hiện danh mục công việc, công cụ và chi phí phán định của công việc thực để mô hình lặp lại thất bại và thử lại
Đường cơ sở mô hình frontier
- So sánh GPT-5.5, GPT-5.6-sol, Gemini 3.1 Pro, Claude Opus 4.8, Claude Fable 5 trên 200 phiên kiểm định được phân tầng
- Tất cả mô hình dùng cùng công cụ, hình ảnh, bộ chấm điểm và ngân sách số lượt
- Mỗi mô hình được thử với prompt mặc định và một prompt tối ưu chứa 2.800 ký tự quy tắc trích xuất, thủ tục tra cứu và ví dụ
- Cấu hình frontier tốt nhất đạt 76,9% mức điểm có thể đạt, còn mô hình 9B huấn luyện bằng GRPO đạt 87,3%
- Với mỗi phiên, mô hình frontier phải dựng lại từ prompt hệ phân loại của cửa hàng, quy ước tồn kho, các giá trị thuộc tính được hỗ trợ và cách xử lý ngoại lệ
- Hướng dẫn tối ưu có thể nén một phần tri thức, nhưng không thể liệt kê hết mọi ngoại lệ quyết định điểm số
- Các cấu hình frontier đã tối ưu hội tụ trong phạm vi 0,1 điểm phần trăm của nhau
- Gemini vốn có hiệu năng trích xuất zero-shot cao nhất lại giảm hiệu năng sau khi áp dụng hướng dẫn tối ưu
- Tùy mô hình, phần hướng dẫn bổ sung làm tăng chi phí token đầu vào lên 28–55% cho mỗi lần gọi
- Tri thức tác vụ đặt trong prompt phải trả chi phí ở mọi lần gọi, trong khi tri thức đã học thì được giữ trong trọng số
Huấn luyện GRPO với quy mô 500 USD
- Quá trình huấn luyện thuê 2 GPU RTX PRO 6000, một GPU dùng tạo rollout và GPU còn lại dùng cập nhật gradient
- Hạ tầng được xây dựng bằng mã nguồn mở prime-rl
- Toàn bộ huấn luyện tốn 1.000 bước tối ưu, khoảng 3,5 ngày và chi phí GPU khoảng 500 USD
- Chỉ sau khoảng 250 bước, tương đương khoảng một ngày huấn luyện, mô hình đã vượt vùng hiệu năng của các mô hình frontier
- Các bước còn lại được dùng để kéo hiệu năng lên mức tối đa
- Điểm benchmark nghiêm ngặt cuối cùng là 0,626, tương đương 87,3% trần trên có thể đạt, cao hơn khoảng 10 điểm phần trăm so với cấu hình frontier tốt nhất
- Trên màn hình theo dõi huấn luyện W&B, điểm tăng từ khoảng 0,50 lên 0,671 ở bước 1.000
- Màn hình theo dõi dùng 2 rollout mẫu cho mỗi phiên nên điểm hơi cao hơn so với harness benchmark nghiêm ngặt
- Mô hình nền 9B chưa huấn luyện đạt 64,2% mức điểm tối đa, sau tinh chỉnh tăng lên 87,3%, tức cải thiện tương đối khoảng 36%
- Mô hình chuyên biệt học mối quan hệ giữa hệ phân loại, công cụ, chính sách và phần thưởng để tập trung năng lực hành vi vào một môi trường cụ thể, đổi lại phải hy sinh năng lực tổng quát
- Khi xuất hiện mô hình nền mã nguồn mở mạnh hơn, có thể chuyển cùng phương pháp huấn luyện sang đó; các quyết định được ghi lại trong quá trình vận hành cũng có thể được chưng cất thành dữ liệu tinh chỉnh có giám sát cho các lần tái huấn luyện sau
So sánh chi phí và chất lượng
- Chi phí suy luận của mô hình chuyên biệt là khoảng 0,50 USD cho mỗi 1.000 sản phẩm; nhờ tinh chỉnh, mô hình đạt điểm cao hơn khoảng 23 điểm phần trăm so với mô hình nền 9B ở cùng mức chi phí
- Chênh lệch chi phí so với các đối tượng so sánh như sau
- Gemini, cấu hình frontier rẻ nhất, có giá 19 USD cho mỗi 1.000 sản phẩm, đắt hơn mô hình chuyên biệt 40 lần
- GPT-5.5-pro, cấu hình đắt nhất, có giá 172 USD cho mỗi 1.000 sản phẩm, đắt hơn khoảng 340 lần
- Cấu hình đạt điểm frontier cao nhất có giá 34 USD cho mỗi 1.000 sản phẩm, đắt hơn mô hình chuyên biệt 68 lần
- Phần hướng dẫn 2.800 ký tự làm chi phí đo được của GPT-5.5 tăng khoảng một phần ba, và thuế prompt này lặp lại ở mọi lần gọi sau đó
- Nếu xử lý khoảng 40 triệu lượt mỗi ngày, cấu hình giá 34 USD cho mỗi 1.000 lượt sẽ tốn khoảng 500 triệu USD mỗi năm, còn mô hình chuyên biệt giá 0,50 USD sẽ tốn khoảng 7 triệu USD, tức chênh lệch chi phí khoảng 98%
Công việc phù hợp và lĩnh vực nên tránh
- Các công việc phù hợp là tác vụ lặp lại quy mô lớn tạo ra quyết định từ thông tin
- Điều phối ticket
- Trích xuất trường dữ liệu từ tài liệu
- Kiểm tra hồ sơ nộp theo chính sách
- Phân loại sản phẩm
- Phê duyệt hoặc gắn cờ giao dịch
- Điều kiện cốt lõi là có thể kiểm chứng tính đúng sai của từng quyết định bằng quy tắc, schema, bài kiểm tra, rubric hoặc phán đoán của chuyên gia hay không
- Quyết định chấm điểm được thì mô hình có thể luyện tập
- Kết quả chỉ có thể tranh luận mà không có đồng thuận thì không thể luyện theo cách này
- Công cụ được chọn theo tần suất và khả năng kiểm chứng
- Công việc tần suất cao và kiểm chứng được phù hợp để tinh chỉnh
- Công việc hiếm nhưng vẫn kiểm chứng được phù hợp với mô hình frontier đã tối ưu prompt
- Kết quả không kiểm chứng được thì cần con người can thiệp
- Nếu cốt lõi vấn đề không phải là phán đoán mà là dữ kiện thay đổi, thì RAG phù hợp bất kể tần suất
- Nếu thỏa ít nhất một trong các điều kiện sau, tác vụ có thể là ứng viên để tinh chỉnh
- Chi phí gọi và lỗi tích lũy thành chi phí thực ở quy mô lớn
- Có thể kiểm tra mọi kết quả bằng quy tắc, bài kiểm tra hoặc rubric mà không cần con người
- Các chuyên gia đồng thuận về tiêu chuẩn của đáp án đúng
- Một mô hình đủ năng lực đã thành công phần nào nhưng chưa đủ nhất quán để tin cậy
- Đáp án đúng không thể xuất hiện do đoán mò may mắn
- Tác vụ gồm nhiều bước như suy luận, gọi công cụ và quyết định cuối cùng
- Tác vụ chạy trên công cụ, schema và chính sách riêng
- Mỗi loại lỗi có chi phí khác nhau
- Không thể gửi dữ liệu nhạy cảm ra hạ tầng ngoài tầm kiểm soát
- Khi chạy mô hình trong ranh giới của mình, prompt và bản ghi không bị gửi tới nhà cung cấp bên ngoài; đồng thời doanh nghiệp có thể cùng sở hữu và cải thiện mô hình, đánh giá và dữ liệu
Ví dụ mô hình chuyên biệt ở các ngành khác
- Cognition có mô hình viết và sửa phần mềm production vượt GPT-5.5 trên benchmark coding tiêu chuẩn và stream 1.000 token mỗi giây
- AT&T tóm tắt 900.000 cuộc gọi hỗ trợ mỗi ngày và gắn cờ thông tin cá nhân
- Hiệu năng phát hiện thông tin cá nhân cao hơn GPT-4o 17%
- Rà soát vụ việc gian lận nhanh hơn 12 lần với độ chính xác ngang GPT-4o và tiết kiệm hàng triệu USD mỗi năm
- LinkedIn có mô hình ghép nối người tìm việc và tin tuyển dụng chính xác hơn 4% so với mô hình GPT mà nó thay thế
- Rẻ hơn GPT-4 tới 75 lần và rẻ hơn GPT-4o 6 lần
- Ambience Healthcare có mô hình mã hóa thanh toán y tế chính xác hơn 18 bác sĩ chuyên khoa trong bài kiểm tra panel vàng
- Cao hơn 12 điểm phần trăm so với cách làm dựa trên prompt o4-mini làm nền
- Phonely có mô hình tiếp nhận cuộc gọi đạt độ chính xác 99,2%, vượt GPT-4o ở mức 94,7%
- Phản hồi nhanh hơn 73% so với cấu hình GPT-4o trước đó, và một khách hàng đã thay thế 350 nhân viên tư vấn chỉ sau một tháng
- OpenPipe có mô hình email và ticket hỗ trợ đạt 93% trong QA hỗ trợ, vượt OpenAI o3 ở mức 50%
- Rẻ hơn o3 64 lần và nhanh hơn 5 lần
- Perplexity Sonar đạt mức ngang GPT-4o trong các câu trả lời tìm kiếm kèm nguồn theo thử nghiệm mù với người dùng
- Nhanh hơn GPT-4o 10 lần và giá cũng thấp hơn
- Checkr có mô hình phân loại hồ sơ tiền án vượt GPT-4 ở những ca khó nhất
- Rẻ hơn 5 lần và nhanh hơn 30 lần so với cấu hình GPT-4 trước đây
- Các số liệu trên là kết quả do chính các công ty tự báo cáo, so với mô hình frontier mà họ thay thế hoặc cạnh tranh
2 bình luận
Tâm lý con người đúng là thường muốn giao cho một người rồi người đó tự lo và xử lý tốt mọi thứ, hơn là phải đi tìm chuyên gia cho từng sự việc và chỉ giao đúng phạm vi công việc cho họ
Có lẽ với LLM cũng khó tránh việc hàm thưởng được thiết kế theo kiểu cứ ném gì vào cũng phải nhận và xử lý hết nhỉ
Ý kiến trên Hacker News
Điều cốt lõi mà các viện nghiên cứu lớn bỏ lỡ là hầu hết trường hợp sử dụng không cần mức kiến thức của 50 tiến sĩ và khả năng dùng 12 ngôn ngữ, trong khi ràng buộc chi phí lại quan trọng hơn nhiều
Khi mô hình trọng số mở và tinh chỉnh giá rẻ trở nên phổ biến, tính kinh tế của các mô hình siêu lớn và hạ tầng quy mô lớn được tài trợ bằng nợ sẽ sụp đổ
Chính trị hay luận điệu đe dọa từ Trung Quốc chỉ là cái cớ bề nổi; nếu mô hình trọng số mở cỡ nhỏ trở thành tiêu chuẩn thì các viện nghiên cứu lớn sẽ khó tồn tại
Phần thực sự đắt đỏ của fine-tuning là thu thập bộ dữ liệu tốt, và ngay cả khi có dữ liệu sạch thì vẫn cần năng lực chạy đánh giá và đo lường chất lượng
Nếu cộng cả chi phí kỹ thuật, gán nhãn dữ liệu và rà soát chất lượng liên tục, thì với nhiều trường hợp dùng, tiếp tục dùng mô hình từ các phòng nghiên cứu hàng đầu vốn đã hoạt động tốt ngay từ đầu lại rẻ hơn
Khá giống thời cách phỏng vấn của FAANG được công khai khoảng 10 năm trước rồi ai cũng làm theo y hệt
Con đường cứ tiếp tục tăng trọng số và đổ thêm phần cứng như hiện nay là ngõ cụt, và cuối cùng sẽ quay về thuật toán phù hợp với mục đích, như AI vẫn luôn làm trong suốt lịch sử của nó
Tôi đang làm TinyToT để chứng minh rằng không cần nhiều tham số đến vậy
Mỗi lần thấy những câu chuyện như thế này, tôi đều vướng hai điểm
Thứ nhất, tôi đã nhiều lần thấy rằng chiến lược tận dụng tốt hơn mô hình hiện có hoặc đơn giản là không làm gì và chờ đợi lại cho kết quả tốt hơn so với huấn luyện lại. Đối tượng so sánh không nên là mô hình tối tân hiện tại mà phải là mô hình kế tiếp sẽ ra mắt trong lúc bạn còn đang duy trì mô hình fine-tune
Thứ hai, 500 USD chi phí huấn luyện là hạng mục rẻ nhất; việc tạo dữ liệu và bảo trì mô hình sau đó mới đắt hơn nhiều. Tôi nghi ngờ có bao nhiêu trường hợp sử dụng thực sự có thể tạo ra 177.000 episode được chấm điểm
Ở đây họ phải tổng hợp bằng Amazon Berkeley Objects, và chính bộ dữ liệu này — thứ đã không cần tạo ra nếu nó vốn tồn tại một cách tự nhiên — cho thấy rõ nhất độ khó khi áp dụng fine-tuning
Giống như phần cứng chuyên dụng như GPU vẫn được dùng sau khi CPU phát triển, mô hình chuyên biệt nhiều khả năng vẫn sẽ tiếp tục vượt mô hình đa dụng về chi phí hoặc kết quả
Nếu huấn luyện ban đầu là 500 USD thì việc tiếp tục huấn luyện tự thân tương đối rẻ. Việc tạo ví dụ mới để theo kịp thay đổi dữ liệu thì đắt hơn, nhưng có thể tái sử dụng cho lần huấn luyện mô hình tiếp theo, và dù sao cũng cần ở mức nào đó để đánh giá thay đổi mô hình và prompt
Cuối cùng, điều này không phải lúc nào cũng hợp lý vì chi phí tạo dữ liệu, chi phí huấn luyện hoặc thiếu dữ liệu; nó chỉ phù hợp với các tác vụ thường xuyên và có thể kiểm chứng như biểu đồ trong bài viết. Có lẽ chỉ thực tế với các doanh nghiệp lớn xử lý hàng triệu quyết định
Chi phí duy trì bộ dữ liệu và mô hình cũng đang được các startup như Braintrust hay Hugging Face biến thành dịch vụ phổ dụng
Các mô hình tối tân rất giỏi trong việc tự xóa bỏ công việc của chính mình
Ngay từ GPT, Luna đã xử lý 90% nhu cầu dành cho Sol. Lý do Trung Quốc vẫn dồn sức vào chưng cất mô hình là để tạo dữ liệu huấn luyện chính xác, còn OpenAI và Anthropic đã mất nhiều năm thu thập thứ đó trong khi tránh các vấn đề pháp lý
Mô hình càng thông minh thì người ta càng chuyển sang các lựa chọn rẻ hơn nhưng vẫn đủ dùng. Nếu độ chính xác đã là 99% thì gần như không còn nhiều lợi ích thực tế khi dùng mô hình tối tân, và đây có vẻ là rủi ro lớn nhất với các viện nghiên cứu Mỹ
Ngoài việc đó ra, dùng mô hình rẻ hơn là đủ
Cũng như tôi không có ý định thay chiếc TV LCD mua khoảng năm 2018, các công nghệ khác cũng tương tự
Công nghệ có xu hướng thay thế công nghệ mới hoặc xâm nhập vào khoảng trống, nhưng hiếm khi thay thế những lĩnh vực phi công nghệ như tương tác giữa con người. Các hoạt động giải trí trước màn hình nhìn chung cũng đang hướng đến quan hệ cận xã hội
Tôi rất quan tâm đến fine-tuning mô hình mở nên đang tìm tài liệu thực sự đáng để tự mình giới thiệu, và cũng đã lưu bài này để đọc kỹ
Tôi đã chạy Nemotron-3-Nano 30B cục bộ và đang nhắm đến các mô hình 30B–120B tham số. Chỉ với mô hình nền tảng thôi cũng đã đủ tạo ra giá trị thực tế, nhưng với tác vụ chuyên biệt thì huấn luyện có thể lấp nốt khoảng cách cuối cùng
Tôi đặc biệt thích việc tác giả suy nghĩ về toàn bộ quy trình, và có thể xác nhận cùng trường hợp sử dụng cũng như chiến lược tạo giá trị. Đây là dự án dài hạn nên tôi cũng định mua phần cứng cho fine-tuning
Tôi chưa đọc bài của Ramp, nhưng có vẻ như đây là ngụy biện hậu nghiệm. Có thể chỉ là công ty có doanh thu gấp 2 lần thì có tiền chi cho AI, còn công ty tăng 1,15 lần thì không
Cách tinh chỉnh các mô hình ngôn ngữ nhỏ hơn như LLM cỡ nhỏ hoặc BERT đã được khuyến nghị từ những ngày đầu LLM xuất hiện. Ưu điểm rất rõ ràng: chạy nhanh, có thể kiểm soát toàn bộ cấu trúc kỹ thuật và phù hợp hơn với miền tùy chỉnh
Tuy nhiên trên thực tế việc tinh chỉnh vẫn không nhiều, vì API mô hình ngôn ngữ lớn vẫn rẻ, đủ nhanh và tiếp tục được cải thiện. Vừa tốn thời gian và tiền bạc để tung ra một mô hình chuyên biệt thì một mô hình đa dụng mới có thể đã vượt qua nó
Một ngày nào đó, khi tiến bộ của LLM chậm lại hoặc giá API trở nên khó gánh nổi, thời của tinh chỉnh và mô hình nhỏ sẽ quay lại
Tôi thích ma trận 2×2 cho thấy khi nào nên tinh chỉnh mô hình và khi nào nên dùng mô hình tối tân nhất
Tuy vậy, chưa rõ bộ đánh giá đã chấm điểm từng episode như thế nào. Nếu một mô hình tối tân nhất dùng để chấm điểm, thì tôi tự hỏi liệu việc đánh giá đó còn hiệu lực không sau khi mô hình tinh chỉnh bắt đầu làm tác vụ tốt hơn chính mô hình ấy
Sẽ hữu ích nếu trước tiên chưng cất toàn bộ phân phối xác suất của quy trình làm việc chuyên biệt theo miền từ một mô hình mở lớn hơn như Kimi K3, rồi áp dụng pipeline học tăng cường riêng tư nội bộ lên kết quả. Chúng tôi đã dùng GLM 5.2 để tạo một mô hình riêng tư 27B cho English→SQL và đạt kết quả tốt hơn Fable, nhưng khả năng giải thích thì biến mất
Trong các lĩnh vực được chuyên biệt hóa cao, không khó để vượt qua mô hình tối tân nhất với chỉ một phần rất nhỏ chi phí. Ngay cả khi không có pipeline học tăng cường riêng, chỉ riêng việc chưng cất cũng có thể tiết kiệm rất nhiều chi phí, và mô hình 27B có thể tiến gần mô hình 3T trong tác vụ đó
Tuy nhiên, với những tác vụ tham vọng đến mức không phù hợp với mô hình chuyên gia thì có khả năng cách này sẽ không hiệu quả
Gần đây tôi bị cuốn vào nghiên cứu tự động nhằm kéo 3B Foundation Model của Apple lên mức Sonnet 4.6 trong một tác vụ cực kỳ cụ thể
Bằng cách kết hợp adapter tinh chỉnh với một bước tất định, tôi đã đưa nó lên khoảng mức 90%
Toàn bộ quá trình, bao gồm hỏi đáp, 96 thí nghiệm và phả hệ, được tổng hợp tại https://alexisrondeau.me/tada/research/FMDiscovery/dashboard...
Nút thắt không nằm ở kích thước mô hình, mà nằm ở việc người thực sự hiểu vấn đề định nghĩa hàm thưởng
Có rất nhiều ngôn ngữ lập trình tuyệt vời để định nghĩa lời giải, nhưng tôi tự hỏi ngôn ngữ nào tồn tại để định nghĩa rõ ràng vấn đề