1 điểm bởi belhyun 5 giờ trước | Chưa có bình luận nào. | Chia sẻ qua WhatsApp

Xin chào.

Gần đây tôi đã tạo một Chrome Extension tự động chuyển các tác vụ thực hiện trên trình duyệt thành hướng dẫn sử dụng (SOP).

Khác với cách ghi màn hình truyền thống, tiện ích này thu thập các sự kiện nhấp chuột và nhập liệu cùng với ngữ cảnh DOM, rồi tái cấu trúc chúng thành các bước thao tác mà con người dễ hiểu.

Pipeline hiện tại như sau.

Browser Recording → DOM Context Extraction → Solar Pro 3 → AI Validation → Word / PDF / Markdown

Phần khó nhất khi triển khai là "xác định đến đâu thì được xem là một Step".

Nếu ghi lại nguyên trạng các sự kiện trên trình duyệt thì sẽ bị chia quá nhỏ, ngược lại nếu gộp quá nhiều thì ý định quan trọng của người dùng sẽ biến mất. Hiện tại, tôi triển khai theo cách gộp sự kiện dựa trên thay đổi DOM, trạng thái nhập liệu, chuyển trang, v.v., sau đó Solar Pro 3 tạo mô tả ngôn ngữ tự nhiên cho từng bước và AI kiểm tra lại thứ tự cũng như việc có thiếu bước nào hay không.

Hiện mới triển khai đến giai đoạn tạo tài liệu, và tiếp theo tôi đang thử nghiệm hướng tận dụng manual được tạo ra như một Task Plan có cấu trúc. Mục tiêu không phải là một tài liệu đơn thuần, mà là phát triển thành một workflow có thể thực thi, nơi AI Agent có thể hiểu công việc để hướng dẫn hoặc tái hiện các tác vụ lặp đi lặp lại trên trình duyệt.

Hiện Interaction Segmentation và Task Planning vẫn đang tiếp tục được cải thiện. Tôi muốn lắng nghe phản hồi từ những ai có nghiên cứu liên quan hoặc kinh nghiệm triển khai trong lĩnh vực này.

Chưa có bình luận nào.

Chưa có bình luận nào.