3 điểm bởi alfadur 3 giờ trước | Chưa có bình luận nào. | Chia sẻ qua WhatsApp
  • Gần đây trong ngành phần mềm, khái niệm “Software Factory” đang thu hút nhiều chú ý. Đây là một mô hình mới trong đó các AI agent tự thực hiện nhiều bước công việc theo mục tiêu được giao và đảm nhiệm việc viết mã nguồn; còn nhà phát triển tập trung vào việc xây dựng và nâng cấp hệ thống — tức “nhà máy” — để sản xuất ổn định phần mã đó.
  • Dru Knox của Tessl, một công ty công cụ phát triển AI, đã đặt tên cho kỷ luật phát triển mới này là Harness Engineering.
  • Harness chỉ toàn bộ framework dùng để kiểm soát và vận hành AI agent, giống như bộ yên cương dùng để điều khiển ngựa; ở lõi của framework này có ba vòng lặp (Loop, một chu trình lặp lại cùng một quy trình).
  • Video đề cập đến: Software Factory là gì và ba chỉ số định nghĩa nó / Vì sao Tessl cấm các phiên coding tương tác trong nội bộ và điều gì xảy ra sau đó / Ba tầng Inner, Outer và Meta Loop / Vì sao Harness Engineering khó / Cách Change Review và Verifier của Tessl hiện thực hóa điều này trong thực tế
  • Video: https://www.youtube.com/watch?v=D_cw-k0F1DM&t=236

Nếu áp dụng cùng cấu trúc đó vào sản xuất tri thức

  • Knowledge Factory là một hệ thống trong đó AI agent viết các trang wiki, còn con người thiết kế và vận hành “hệ thống tòa soạn” để sản xuất hàng loạt chúng. Người vận hành không trực tiếp viết bài, mà quản lý hướng dẫn viết và các cơ chế kiểm duyệt tự động.
  • Tổ chức bên trong nhà máy được benchmark theo hệ thống 5 vai trò của tòa soạn báo: phóng viên, cây bút chuyên mục, biên tập ngôn ngữ, thư ký tòa soạn và tổng biên tập.
  • Điểm cốt lõi ở đây là không phải cả 5 vai trò đều là “AI biết phán đoán”. “Biên tập ngôn ngữ” không phải AI mà là mã Python dựa trên quy tắc, còn “tổng biên tập” là người điều phối phân chia công việc. Vị trí duy nhất nơi AI đưa ra phán đoán đánh giá độc lập là “thư ký tòa soạn”.
  • Thiết kế nhà máy hiệu quả không phải là tăng số lượng agent một cách vô tội vạ, mà là định nghĩa rõ vùng phán đoán sẽ được đặt ở đâu và bị loại trừ khỏi đâu.

Ba trục trưởng thành, và niềm tin

  • Độ trưởng thành của hệ thống được đo theo ba trục: tính tự chủ (hoàn thành trang mà không cần con người can thiệp), tự động hóa (phạm vi cho phép xuất bản mà không cần con người rà soát), và chất lượng (mức độ của tri thức được tạo ra).
  • Ngay cả khi tính tự chủ cao, nếu người vận hành vẫn bất an và kiểm tra toàn bộ mọi trang, thì mức tự động hóa vẫn ở trạng thái thấp. Yếu tố then chốt để lấp khoảng cách này chính là “niềm tin”.
  • Trước tiên bảo đảm tính tự chủ, sau đó mở rộng vùng tự động hóa tương ứng với phạm vi niềm tin đã tích lũy, đồng thời duy trì ổn định mức chất lượng trong quá trình đó. Cơ chế bảo chứng cho niềm tin này chính là “loop”.

1. Inner Loop — Tự kiểm tra theo thời gian thực

  • Inner Loop là quy trình kiểm chứng nhanh và nhẹ mà agent thường xuyên chạy trong quá trình viết, trước khi nộp bản nháp. Vòng lặp này càng tinh vi, AI agent càng có thể tự sửa lỗi mà không cần con người can thiệp, nhờ đó cải thiện tính tự chủ.
  • Trong khi viết, agent chỉ kiểm tra tài liệu do chính mình tạo bằng công cụ kiểm tra Python (tools/lint.py); nếu cùng một lỗi lặp lại từ 2 lần trở lên, nó lập tức chuyển sang bước tiếp theo để duy trì tốc độ xử lý.

2. Outer Loop — Hai cổng kiểm soát ngay trước khi xuất bản

  • Cổng thứ nhất là biên tập ngôn ngữ. Mã Python kiểm tra tĩnh 10 lĩnh vực như liên kết, trích dẫn, cấu trúc tài liệu và xung đột dữ liệu theo các quy tắc xác định.
  • Cổng thứ hai là thư ký tòa soạn. Từ góc nhìn của độc giả bên thứ ba, vai trò này đánh giá định tính theo 6 khía cạnh như thiên lệch, mật độ thông tin, khả năng đọc và mạch lập luận, đồng thời không trực tiếp chỉnh sửa mà chỉ trả về danh sách các mục cần cải thiện.
  • Cấu trúc này giống với cấu trúc hai tầng Verifier (cổng 1) và Change Review (cổng 2) của Software Factory.
  • Ở đây có một nguyên tắc thiết kế mang tính quyết định. Thư ký tòa soạn chỉ được chuyển bản thảo hoàn chỉnh và tiêu chí đánh giá, không được chuyển ý đồ viết của tác giả. Vì nếu tự rà soát bài viết của mình trong cùng một ngữ cảnh, phán định sẽ dễ dãi hơn, nên hệ thống chặn hẳn thông tin để ngăn thiên lệch đó.
  • Khác biệt thực chất của hệ thống này không nằm ở việc chạy bao nhiêu agent, mà ở sự cô lập ngữ cảnh như vậy. Nếu bị từ chối 3 lần vì cùng một lý do, tiến trình tự động sẽ dừng và chuyển quyền phán đoán cho người vận hành.

3. Meta Loop — Cơ chế tự cải tiến

  • Tuân theo nguyên tắc: “Không để cùng một sai lầm lặp lại hai lần. Lỗi đã phát hiện sẽ được nâng cấp thành quy tắc của hệ thống.”
  • Nếu cùng một khiếm khuyết tiếp tục xảy ra, hệ thống tự động đề xuất sửa đổi hướng dẫn biên soạn. Đề xuất sửa đổi sẽ trải qua đánh giá đối chiếu mù, trong đó không cho biết bài nào được viết theo quy tắc đã sửa, và bài kiểm thử bằng các trường hợp thất bại mới chưa từng được dùng trong kiểm chứng.
  • Chỉ khi điểm số thực sự cải thiện, và bắt buộc chỉ sau khi nhận được phê duyệt cuối cùng của người vận hành, thay đổi mới được phản ánh vào hệ thống.
  • Các điểm bị nhắc đi nhắc lại được nâng cấp thành Python hook hoặc quy tắc biên tập ngôn ngữ để cố định thành mã. Bằng cách chuyển vùng phán đoán định tính sang vùng kiểm tra bằng quy tắc, hệ thống giúp thư ký tòa soạn luôn tập trung vào các vấn đề bậc cao.

4. Reground Loop — Vòng lặp thứ tư chỉ cần cho tri thức

  • Mã phần mềm, sau khi được build và triển khai một lần, sẽ duy trì trạng thái ổn định cho đến khi đặc tả thay đổi; nhưng tài sản tri thức sẽ lão hóa theo thời gian khi khoảng cách với sự thật trong thực tế ngày càng lớn.
  • Để giải quyết điều này, hệ thống bổ sung Reground Loop (nghĩa là đặt chân trở lại trên căn cứ) làm vòng lặp thứ tư, đưa các tài liệu đã xuất bản quay lại làm đầu vào cho nhà máy sản xuất tri thức.
  • Cập nhật: Khi nguồn dữ liệu gốc có thay đổi. Cây bút chuyên mục phân tích lại và cập nhật các trang đã cũ do công cụ kiểm tra xác định. (bài tiếp theo)
  • Theo dõi tiếp: Khi trong tài liệu có câu nêu “cần xác nhận sau” hoặc điều kiện có thời hạn. Khi đến hạn, thư ký tòa soạn và người vận hành sẽ kiểm chứng lại. (điều tra theo dõi)
  • Đính chính: Khi phát hiện xung đột thông tin giữa các trang của chúng ta. Thư ký tòa soạn đọc lại toàn bộ cụm tài liệu đã xuất bản theo từng cluster, bắt các điểm lệch mà nếu xem từng tài liệu riêng lẻ sẽ không lộ ra. (bản tin đính chính)

Human-in-the-Loop

  • Các tình huống ngoại lệ cần con người phê duyệt được định nghĩa và quản lý bằng checklist rõ ràng, thay vì dựa vào cảm tính.
  • Hiện tại hệ thống được vận hành theo hướng nâng cao tính tự chủ nhưng cố ý hạn chế tự động hóa. Agent tự viết trang, nhưng việc xuất bản lên Wiki và thay đổi quy tắc viết vẫn cần phê duyệt cuối cùng của con người.

Toàn văn: https://alfadur7.github.io/llm-wiki-newsroom/ko/knowledge-factory/

Chưa có bình luận nào.

Chưa có bình luận nào.