1 điểm bởi GN⁺ 2 giờ trước | 1 bình luận | Chia sẻ qua WhatsApp
  • Tổng hợp hướng dẫn thực chiến và ví dụ để triển khai ứng dụng Claude, bao quát rộng từ xây dựng agent đến RAG, sử dụng công cụ, đa phương thức và đánh giá
  • Các ví dụ về Claude Agent SDK và Managed Agents bao gồm những pattern vận hành như điều phối đa agent, quản lý phiên, triển khai, ứng phó sự cố, phát hiện lỗ hổng và bộ nhớ người dùng
  • Cung cấp bộ nhớ và nén ngữ cảnh cho agent chạy dài hạn, gọi công cụ theo lập trình, tìm kiếm công cụ dựa trên embedding và kỹ thuật sub-agent bất đồng bộ
  • Có thể xem qua các ví dụ triển khai không chỉ RAG, sinh SQL, knowledge graph, tóm tắt tài liệu, xử lý hình ảnh và giọng nói, mà còn cả đánh giá, chi phí, observability và cơ chế an toàn
  • Bao quát triển khai Docker, Modal, Kubernetes, quản lý phiên bản prompt và rollback, phê duyệt của con người, phân tích chi phí; có thể dùng cho toàn bộ phát triển và vận hành production

Đánh giá agent và cơ chế an toàn

Pattern đa agent và workflow

  • Điều phối đa agent bất đồng bộ: Đề cập cấu trúc messaging và vòng đời của đội N agent cố định trao đổi thông điệp đồng nghiệp trong một hub chung, cùng các sub-agent bất đồng bộ được tạo động
  • Đa agent: điều phối đội ngũ chuyên gia: Người điều phối dẫn dắt nhà nghiên cứu tìm kiếm web, người phụ trách đọc tệp và người phụ trách giá dựa trên quy tắc để viết đề xuất bán hàng
    • Bao gồm trường multiagent, sự kiện thread_createdthread_message_received, cùng giới hạn phạm vi công cụ theo vai trò
  • Outcomes: agent tự xác minh công việc của mình: Xây dựng vòng lặp chấm điểm và cải thiện, trong đó tác giả tạo tóm tắt nghiên cứu có trích dẫn, bộ chấm điểm không trạng thái kiểm tra URL và câu trích dẫn rồi chỉnh sửa cho đến khi đạt
    • Đề cập các sự kiện user.define_outcome, span.outcome_evaluation_* và cách viết tiêu chí đánh giá mà bộ chấm điểm có thể thực thi
  • Workflow cơ bản: Cung cấp ba pattern đa LLM đánh đổi chi phí hoặc độ trễ để lấy hiệu năng
  • Evaluator-optimizer: Cấu trúc lặp trong đó một LLM tạo kết quả và một LLM khác cung cấp phản hồi đánh giá
  • Orchestrator-workers: LLM trung tâm ủy nhiệm tác vụ một cách động và tổng hợp kết quả của các LLM worker
  • Dùng Haiku làm sub-agent: Sub-agent Haiku trích xuất báo cáo tài chính và Opus tổng hợp kết quả

Claude Agent SDK

  • Agent nghiên cứu một dòng: Xây dựng agent nghiên cứu tự chủ bằng Claude Code SDK và WebSearch
  • Agent chánh văn phòng: Tạo hệ thống đa agent bằng sub-agent, hook, kiểu đầu ra và chế độ lập kế hoạch
  • Agent observability: Kết nối agent với hệ thống bên ngoài bằng MCP server để xử lý giám sát GitHub và workflow CI
  • Agent độ tin cậy trang web: Chẩn đoán và khắc phục sự cố bằng công cụ MCP đọc/ghi, rồi viết báo cáo hậu kiểm
  • Di chuyển từ OpenAI Agents SDK: Lấy agent phê duyệt chi phí làm ví dụ để ánh xạ công cụ, guardrail, phiên và handoff sang các thành phần cơ bản của Claude Agent SDK
  • Xây dựng trình duyệt phiên: Liệt kê và xem các phiên Agent SDK trên đĩa, đổi tên, gắn thẻ và fork chúng để tạo sidebar mà không cần parser lịch sử hội thoại riêng
  • Agent phát hiện lỗ hổng: Lập mô hình đe dọa cho mục tiêu C, tìm lỗi an toàn bộ nhớ bằng công cụ tệp tích hợp rồi phân loại thành báo cáo có cấu trúc
  • Hosting agent: Triển khai agent nghiên cứu qua ba bước Docker, Modal và Kubernetes, trong khi giữ nguyên cùng image container và giao diện HTTP

Claude Managed Agents

Quản lý bộ nhớ và ngữ cảnh

Sử dụng công cụ và tích hợp bên ngoài

Tìm kiếm, RAG và xử lý tri thức

Đa phương thức, giọng nói và tài liệu

Phản hồi, suy luận và prompt

Skills và ứng dụng nghiệp vụ

Mẫu agent LlamaIndex và đóng góp cộng đồng

  • Agent ReAct: xây dựng agent ReAct thực hiện workflow suy luận và hành động dựa trên công cụ bằng LlamaIndex
  • Đang nhận đóng góp từ cộng đồng cho các ý tưởng Cookbook mới và cung cấp hướng dẫn đóng góp

1 bình luận

 
Ý kiến trên Hacker News
  • Thành thật mà nói, gần như mọi tài liệu hướng dẫn sử dụng AI đều có vẻ vô nghĩa. Cách làm thì có thể hỏi trực tiếp AI, còn nếu là cách tận dụng AI thì hoặc được tích hợp vào harness, hoặc chỉ là tính năng nhỏ nên cứ chờ Anthropic/OpenAI triển khai là được
    Những thứ như quy trình tác nhân, quản lý bộ nhớ, kỹ thuật harness cũng phần lớn có cảm giác chỉ để trình diễn

    • Năm 2023, người ta nói prompt engineering sẽ trở thành software engineering mới nên tôi đã chăm chỉ học CoT, ReAct, v.v., nhưng đến năm 2024 thì phần lớn trở nên không cần thiết nhờ các mô hình suy luận và cập nhật harness
      Các kỹ thuật hay framework AI mới nhất cũng bị hấp thụ hoặc thay thế theo chu kỳ 3 tháng, nên có vẻ không đáng đầu tư
    • Khi năng lực của mô hình tăng lên, nó tự hấp thụ các công cụ xung quanh, vì vậy những công cụ kiểu này có thời hạn hữu dụng quá ngắn. Chúng ta đã liên tục chứng kiến cùng một mô thức như vậy
    • Vercel từng giới thiệu rằng một file Markdown duy nhất chứa chỉ dẫn rõ ràng có thể hiệu quả hơn gọi công cụ, và cả cách dùng chỉ mục nén. Tôi cũng từng mất nhiều giờ để hoàn thiện việc gọi công cụ nhưng gặp kết quả tương tự; sau đó tôi chỉ dùng Claude.md, Agents.md và nếu cần thì Project.md
    • LLM có vẻ rất kém trong việc tận dụng LLM khác bên trong harness. Nếu để mặc, nó còn nhét đủ thứ vào các file .md, làm ô nhiễm context
      Rốt cuộc phải để LLM tìm kiếm những tài liệu này, nên có lẽ đây là tài liệu dành cho LLM hơn là cho con người
    • Đến lúc mọi người tung hô MCP thì skills đã trở thành lựa chọn thay thế hiệu quả hơn, và việc quản lý context quyết liệt cũng bớt quan trọng vì cửa sổ context dài và các tính năng tác nhân. Nếu là kỹ thuật tốt, rất có khả năng nó sẽ được tích hợp trong phiên bản sau
      Vì vậy nếu không thật cần, tôi tránh plugin và MCP, dùng prompt đầy đủ, kỹ lưỡng. Nhờ vậy tôi tránh được việc ép LLM dùng các tối ưu hóa đã cũ và cản trở sự tiến bộ của nó
  • Các ảnh trước/sau trong prompting thẩm mỹ frontend buồn cười đến mức khó tin. Có vẻ không ai kiểm tra xem skill này có thật sự cải thiện thiết kế hay không

    • Tất cả kết quả được đưa ra đều trông như thoái hóa chứ không phải cải thiện
    • Nhiều hướng dẫn cứ mù quáng khuyến nghị skill thiết kế frontend theo kiểu cargo cult điển hình của LLM, nhưng nội dung thực tế lại khác với những gì mọi người nghĩ
    • Trang web sau khi áp dụng thẩm mỹ trông như keygen đầu những năm 2000, chỉ cần thêm nhạc techno nữa là đủ
    • Kết quả thật sự khá ngượng. Về cơ bản chỉ ở mức “hãy dùng nền đen và font chữ rộng kinh khủng”
    • Tôi tự hỏi có phải họ chọn các ví dụ tối đa hóa khác biệt trước/sau để tạo cảm giác là có hiệu quả không. Cá nhân tôi thấy trong mọi ví dụ, thiết kế trước khi áp dụng đều tốt hơn
  • Kết quả của prompting thẩm mỹ frontend là trước khi áp dụng thì nhạt nhẽo, sau khi áp dụng thì nhạt nhẽo có thêm gradient

    • Một vài ví dụ thì bản trước khi áp dụng tốt hơn, và thứ duy nhất có thể gọi là thật sự cải thiện là ví dụ blog
    • Tôi còn thích phiên bản không áp dụng thẩm mỹ hơn
    • Nó cũng thêm nhãn viết hoa toàn bộ, một đặc trưng điển hình của các trang do AI thiết kế
  • Tôi đang dùng skills của Matt Pocock ở nhà và thấy khá tuyệt. Chúng được thiết kế để người dùng gọi thủ công chứ không phải tự động gọi, nên chỉ vì tồn tại mà không chiếm nhiều context
    Thay vì loại lập trình viên khỏi kết quả cuối cùng, chúng khiến người ta suy nghĩ sâu hơn về kết quả. Grill skills giúp làm rõ yêu cầu thực tế, còn prototype skill giúp khám phá những phần cần tự trải nghiệm mới có thể đưa ra quyết định khó

  • OpenAI Cookbook cũng hữu ích. Các phòng thí nghiệm AI khác cũng thường xuyên công bố ví dụ và cookbook trên GitHub và Hugging Face, nên đáng để tiếp tục theo dõi

  • Tác nhân lập trình tạo ra nhiều lỗi ở frontend hơn backend, và thường đưa ra các tính năng hỏng, chưa hoàn chỉnh hoặc gượng gạo hơn nhiều. Có vẻ nguyên nhân là khác biệt về khả năng kiểm chứng giữa hai lĩnh vực, và chỉ bộ test cơ bản là không đủ
    Các cách tiếp cận như gstack của Garry Tan có vẻ phù hợp, nhưng tôi không biết đã đủ chín để áp dụng chưa. Cũng có đánh giá rằng Gemini 3.5 Flash làm frontend tốt hơn Opus hay GPT-5.5; tôi tò mò liệu đó là do năng lực đa phương thức hay hiểu biết về Chrome, và muốn thấy đánh giá từ người dùng thực tế

    • Có thể cũng có lựa chọn kết hợp với tác nhân như Front End Design skill của Claude, nhưng tôi chưa tự dùng thử. Magic Patterns đặc biệt giỏi trong việc tạo prototype ban đầu khi được điều khiển bởi một tác nhân hiểu chức năng và ràng buộc
      Muốn có kết quả sáng tạo thì phải yêu cầu chủ động, nhưng nó tốt cho thiết kế frontend tiêu chuẩn. Tuy nhiên tôi chỉ dùng để thử ý tưởng, không phải để thêm hay sửa tính năng tùy ý
    • Tác nhân xử lý kém các cập nhật trạng thái bất đồng bộ phức tạp vì khó biểu diễn chúng trong context. Ngược lại, chúng khá ổn khi tạo các component phức tạp một cách độc lập hoặc triển khai tính năng ít phụ thuộc lẫn nhau như animation
  • Tôi tưởng đây là cookbook thật để tạo ra các công thức nấu ăn nghe hợp lý và thật sự nấu được bằng LLM, nhưng có vẻ chưa tới mức đó

    • Tôi đã nấu ăn với sự trợ giúp của LLM vài lần mỗi tháng trong hơn một năm, và 9/10 lần đều ổn. Các công thức trung bình nằm trong trọng số mô hình nhìn chung cũng vững, và nó còn rất giỏi thay thế nguyên liệu kiểu “không có nguyên liệu X” hoặc “đổi sang món chay”
      Sau khi nhận công thức, yêu cầu “làm cho ngon hơn” một hai lần rồi xem kết quả cũng khá thú vị
    • Tôi đang học nấu món Ý bằng ChatGPT, và ngoài vài lần thử-sai thì nó hoạt động tốt đến đáng ngạc nhiên
    • Năm nay tôi đã nấu vài lần với Gemini và kết quả tốt hơn mong đợi. Cũng có thể nói “trong tủ đồ ăn có những nguyên liệu này và tôi muốn chế độ ăn keto”, rồi thu hẹp lựa chọn qua đối thoại
    • Tôi cũng đã mong chờ một công cụ lập kế hoạch bữa ăn số
  • Tôi tưởng đây là sản phẩm mới tạo công thức nấu ăn bằng Claude

    • Tôi đang dùng một dự án Claude cho công thức nấu ăn, và nó rất tuyệt trong việc gợi ý thực đơn cũng như điều chỉnh công thức theo nguyên liệu có trong tủ, nên tôi cũng đã mong có sản phẩm như vậy
    • Thực ra cũng có thể dùng cho mục đích đó
  • Thiết kế trước và sau khi áp dụng cookbook đều trông như được làm bằng vibe coding. Tôi không phải nhà thiết kế đủ để chỉ ra chính xác nguyên nhân, nhưng có vẻ phạm vi phong cách Claude dùng được hơi hạn chế
    Có lẽ nếu chỉ định cụ thể hơn các thay đổi cần thiết thì có thể kiềm chế xu hướng này

  • Ít nhất họ đáng ra phải kiểm tra UI một lần. Ngay cả khoảng cách trong bảng đơn giản cũng không căn cho đúng