Tôi đã thử đo lường việc agent thực thi trùng lặp trên các trace benchmark công khai. Cách đếm là khi cùng một công cụ được gọi hai lần với cùng tham số và cả kết quả cũng giống nhau.
Trong 6.780 trace, có 8.042 trường hợp; nếu loại bớt những thứ như lặp lại tuyên bố hoàn thành tác vụ thì còn 4.249 trường hợp. Trong số đó, với 3.432 lần gọi trùng lặp vào các công cụ có thay đổi trạng thái, tôi so sánh entity ID trong phản hồi và xác nhận được 159 trường hợp thực sự tạo ra hai đối tượng. Ví dụ như tạo ra hai tài liệu cùng tiêu đề, hoặc bốn bảng tính giống hệt nhau.
Ở đây có một giới hạn rất rõ ràng. Những con số này đều đến từ trace benchmark. Đây là bản ghi 22 mô hình giải task, không phải dịch vụ đang vận hành thực tế. Tôi đã lục qua tám bộ dữ liệu công khai và chỉ có đúng một bộ cho phép quan sát hiện tượng này. Phần lớn benchmark được thiết kế để chấm điểm độ chính xác, nên nếu xảy ra trùng lặp thì cấu trúc sẽ coi đó là đáp án sai.
Vì vậy tôi muốn hỏi những người đang vận hành thực tế.
- Mọi người đang gắn và dùng bao nhiêu công cụ MCP (hoặc server)?
Hai bộ dữ liệu chúng tôi xem có tỷ lệ trùng lặp chênh nhau 3 lần (0,80% vs 2,41%). Số lượng công cụ cũng chênh lớn, 20 so với 523, nhưng tính chất task và cấu hình mô hình cũng khác nên chúng tôi không tách riêng được liệu số công cụ có phải nguyên nhân hay không.
Thực tế, khi chia ngay trong benchmark theo số lượng server gắn vào task, mức cao nhất lại rơi vào 4~5 cái (khoảng 2,5%), còn trên mức đó thì ngược lại lại thấp hơn, tức là một mẫu không đơn điệu. Chúng tôi chưa thấy mối quan hệ đơn giản kiểu "càng nhiều công cụ thì càng tăng trùng lặp". Không rõ trong vận hành thực tế thì thế nào.
- Mọi người đã từng gặp thực thi trùng lặp chưa? Phát hiện bằng cách nào?
Các trường hợp chúng tôi thấy phần lớn không báo lỗi. Cả hai lần đều trả về 200 và log cũng sạch, nên chỉ xem log sau đó thì không nhìn ra. Có lẽ ngoài thực tế thường là khách hàng báo thì mới biết, không rõ bên mọi người có vậy không.
- Các công cụ mọi người dùng có trả về entity ID trong phản hồi không?
Đây là điểm phân biệt giữa "bị gọi hai lần" và "đã tạo ra hai đối tượng". API tạo tài liệu đa số trả ID, nhưng gửi email thì nhiều trường hợp chỉ trả chuỗi "thành công". Trong 3.197 trường hợp không thể kết luận, có 2.011 trường hợp thuộc kiểu này, và có 24 loại công cụ chưa từng trả ID trong phản hồi.
Tôi không tìm kiếm câu trả lời đúng tuyệt đối, mà muốn cảm nhận xem benchmark và vận hành thực tế khác nhau đến mức nào. Chỉ riêng chia sẻ trải nghiệm thôi cũng đã là giúp đỡ rất lớn.
Chưa có bình luận nào.