- Tổng hợp hướng dẫn thực chiến và ví dụ để triển khai ứng dụng Claude, bao quát rộng từ xây dựng agent đến RAG, sử dụng công cụ, đa phương thức và đánh giá
- Các ví dụ về Claude Agent SDK và Managed Agents bao gồm những pattern vận hành như điều phối đa agent, quản lý phiên, triển khai, ứng phó sự cố, phát hiện lỗ hổng và bộ nhớ người dùng
- Cung cấp bộ nhớ và nén ngữ cảnh cho agent chạy dài hạn, gọi công cụ theo lập trình, tìm kiếm công cụ dựa trên embedding và kỹ thuật sub-agent bất đồng bộ
- Có thể xem qua các ví dụ triển khai không chỉ RAG, sinh SQL, knowledge graph, tóm tắt tài liệu, xử lý hình ảnh và giọng nói, mà còn cả đánh giá, chi phí, observability và cơ chế an toàn
- Bao quát triển khai Docker, Modal, Kubernetes, quản lý phiên bản prompt và rollback, phê duyệt của con người, phân tích chi phí; có thể dùng cho toàn bộ phát triển và vận hành production
Đánh giá agent và cơ chế an toàn
- Tái hiện điểm benchmark tìm kiếm agentic của Claude: Tái hiện điểm DeepSearchQA và BrowseComp bằng harness Messages API, sử dụng gọi công cụ theo lập trình, nén phía máy chủ và ngân sách tác vụ
- Fallback và tính phí bộ phân loại của Claude Fable 5: Phát hiện việc bộ phân loại an toàn chặn để chuyển sang Opus 4.8, đồng thời đề cập fallback phía máy chủ hoặc phía client SDK, streaming và thay đổi tính phí mới
- Đánh giá công cụ: Chạy đánh giá agent song song cho các công cụ độc lập với tệp tác vụ đánh giá
- Xây dựng đánh giá: Xây dựng hệ thống đánh giá để đo lường và cải thiện hiệu năng của Claude trên các chỉ số chính
- Tạo dữ liệu kiểm thử tổng hợp cho template prompt: Tạo trường hợp kiểm thử tổng hợp để đánh giá và cải thiện prompt Claude
- Xây dựng bộ lọc kiểm duyệt bằng Claude: Định nghĩa quy tắc và danh mục trong prompt để tạo bộ lọc kiểm duyệt nội dung tùy chỉnh
Pattern đa agent và workflow
- Điều phối đa agent bất đồng bộ: Đề cập cấu trúc messaging và vòng đời của đội N agent cố định trao đổi thông điệp đồng nghiệp trong một hub chung, cùng các sub-agent bất đồng bộ được tạo động
- Đa agent: điều phối đội ngũ chuyên gia: Người điều phối dẫn dắt nhà nghiên cứu tìm kiếm web, người phụ trách đọc tệp và người phụ trách giá dựa trên quy tắc để viết đề xuất bán hàng
- Bao gồm trường
multiagent, sự kiệnthread_createdvàthread_message_received, cùng giới hạn phạm vi công cụ theo vai trò
- Bao gồm trường
- Outcomes: agent tự xác minh công việc của mình: Xây dựng vòng lặp chấm điểm và cải thiện, trong đó tác giả tạo tóm tắt nghiên cứu có trích dẫn, bộ chấm điểm không trạng thái kiểm tra URL và câu trích dẫn rồi chỉnh sửa cho đến khi đạt
- Đề cập các sự kiện
user.define_outcome,span.outcome_evaluation_*và cách viết tiêu chí đánh giá mà bộ chấm điểm có thể thực thi
- Đề cập các sự kiện
- Workflow cơ bản: Cung cấp ba pattern đa LLM đánh đổi chi phí hoặc độ trễ để lấy hiệu năng
- Evaluator-optimizer: Cấu trúc lặp trong đó một LLM tạo kết quả và một LLM khác cung cấp phản hồi đánh giá
- Orchestrator-workers: LLM trung tâm ủy nhiệm tác vụ một cách động và tổng hợp kết quả của các LLM worker
- Dùng Haiku làm sub-agent: Sub-agent Haiku trích xuất báo cáo tài chính và Opus tổng hợp kết quả
Claude Agent SDK
- Agent nghiên cứu một dòng: Xây dựng agent nghiên cứu tự chủ bằng Claude Code SDK và
WebSearch - Agent chánh văn phòng: Tạo hệ thống đa agent bằng sub-agent, hook, kiểu đầu ra và chế độ lập kế hoạch
- Agent observability: Kết nối agent với hệ thống bên ngoài bằng MCP server để xử lý giám sát GitHub và workflow CI
- Agent độ tin cậy trang web: Chẩn đoán và khắc phục sự cố bằng công cụ MCP đọc/ghi, rồi viết báo cáo hậu kiểm
- Di chuyển từ OpenAI Agents SDK: Lấy agent phê duyệt chi phí làm ví dụ để ánh xạ công cụ, guardrail, phiên và handoff sang các thành phần cơ bản của Claude Agent SDK
- Xây dựng trình duyệt phiên: Liệt kê và xem các phiên Agent SDK trên đĩa, đổi tên, gắn thẻ và fork chúng để tạo sidebar mà không cần parser lịch sử hội thoại riêng
- Agent phát hiện lỗ hổng: Lập mô hình đe dọa cho mục tiêu C, tìm lỗi an toàn bộ nhớ bằng công cụ tệp tích hợp rồi phân loại thành báo cáo có cấu trúc
- Hosting agent: Triển khai agent nghiên cứu qua ba bước Docker, Modal và Kubernetes, trong khi giữ nguyên cùng image container và giao diện HTTP
Claude Managed Agents
- Xây dựng agent ghi nhớ người dùng: dùng kho lưu trữ Memory để học và ghi nhớ sở thích của người dùng qua nhiều lần tương tác
- Xây dựng agent ứng phó sự cố SRE bằng Claude Managed Agents: khi có cảnh báo, agent đọc log và runbook, tìm nguyên nhân gốc, mở PR sửa lỗi và chỉ merge sau khi có phê duyệt của con người
- Xây dựng agent phân tích dữ liệu: dùng môi trường sandbox và file mount để chuyển CSV thành báo cáo HTML có biểu đồ tương tác
- Xây dựng bot phân tích dữ liệu trên Slack: khi mention bot kèm CSV, bot tạo báo cáo phân tích trong thread và hỗ trợ trao đổi tiếp trong cùng phiên
- Hướng dẫn Managed Agents: cải thiện bộ test đang thất bại: dùng tạo agent, môi trường, phiên, file mount và vòng lặp sự kiện streaming để sửa ba lỗi trong gói
calc.py - Hướng dẫn Managed Agents: thiết lập production: đề cập thông tin xác thực MCP dựa trên vault, webhook
session.status_idledđể đưa con người vào quy trình mà không cần kết nối dài hạn, và CRUD vòng đời tài nguyên - Hướng dẫn Managed Agents: quản lý phiên bản prompt và rollback: tạo v1 trên server, đánh giá bằng bộ test có gắn nhãn, rồi phát hiện hồi quy ở v2 và cố định phiên ở phiên bản 1
- bao gồm cố định phiên bản cho
agents.update,sessions.createvà vị trí mà cổng kiểm duyệt chuyển tới khi prompt không phải là code
- bao gồm cố định phiên bản cho
Quản lý bộ nhớ và ngữ cảnh
- Kỹ thuật ngữ cảnh: bộ nhớ, nén và loại bỏ công cụ: so sánh thời điểm áp dụng, chi phí và cách kết hợp theo từng chiến lược trong các agent chạy dài
- Nén bộ nhớ phiên: nén ngay bộ nhớ phiên của các cuộc trò chuyện dài bằng background threading và prompt caching
- Tự động nén ngữ cảnh: tự động nén lịch sử hội thoại trong workflow agent dài hạn để quản lý giới hạn ngữ cảnh
- Quản lý bộ nhớ và ngữ cảnh trong Claude Sonnet 4.6: xây dựng agent có bộ nhớ bền vững bằng công cụ bộ nhớ và chỉnh sửa ngữ cảnh của Claude
- Prompt caching suy đoán: chuẩn bị trước cache trong khi người dùng đang soạn truy vấn để giảm thời gian phản hồi token đầu tiên
- Prompt caching trong Claude API: cache và tái sử dụng ngữ cảnh prompt để giảm chi phí và thời gian phản hồi
Sử dụng công cụ và tích hợp bên ngoài
- Gọi công cụ theo cách lập trình: để Claude viết mã gọi công cụ trong môi trường thực thi code nhằm giảm độ trễ và lượng token tiêu thụ
- Tìm kiếm công cụ bằng embedding: mở rộng ứng dụng Claude lên tới hàng nghìn công cụ bằng tìm kiếm động dựa trên embedding ngữ nghĩa
- Gọi công cụ song song trong Claude 3.7 Sonnet: dùng batch tool meta-pattern như một giải pháp vòng tránh để kích hoạt gọi song song
- Chọn công cụ: dùng tham số
tool_choiceđể ép buộc hoặc tự động hóa lựa chọn công cụ của Claude - Công cụ lưu ghi chú kết hợp Pydantic với việc sử dụng công cụ của Anthropic: tạo công cụ an toàn kiểu được xác thực bằng model Pydantic
- Sử dụng công cụ máy tính trong Claude: cung cấp công cụ máy tính để thực hiện phép toán số học và giải bài toán toán học
- Tạo agent dịch vụ khách hàng bằng công cụ phía client: xây dựng chatbot sử dụng các công cụ tra cứu khách hàng và quản lý đơn hàng
- Trích xuất JSON có cấu trúc bằng Claude và sử dụng công cụ: trích xuất dữ liệu JSON có cấu trúc từ nhiều đầu vào
- Sử dụng Wolfram Alpha LLM API làm công cụ trong Claude: tích hợp Wolfram Alpha LLM API cho các truy vấn tính toán và câu trả lời
- Agent bổ sung thông tin tình báo mối đe dọa: điều tra và kiểm chứng chéo các chỉ báo xâm nhập từ nhiều nguồn tình báo mối đe dọa, ánh xạ sang MITRE ATT&CK và tạo báo cáo cho SIEM/SOAR
Tìm kiếm, RAG và xử lý tri thức
- Xây dựng knowledge graph bằng Claude: trích xuất thực thể và quan hệ từ văn bản phi cấu trúc, loại bỏ trùng lặp và hỗ trợ truy vấn đồ thị multi-hop
- Text-to-SQL bằng Claude: chuyển đổi ngôn ngữ tự nhiên thành SQL bằng RAG, quá trình suy luận và kỹ thuật tự cải thiện
- Cải thiện RAG bằng tìm kiếm theo ngữ cảnh: thêm ngữ cảnh vào chunk trước khi embedding và áp dụng prompt caching để tăng độ chính xác của RAG
- Retrieval-Augmented Generation: xây dựng và tối ưu hóa hệ thống RAG bằng lập chỉ mục tóm tắt và reranking
- Phân loại bằng Claude: xây dựng hệ thống phân loại dùng RAG và quá trình suy luận cho các ticket bảo hiểm
- Trích dẫn: cung cấp trích dẫn nguồn chi tiết có thể kiểm chứng cho truy vấn dựa trên tài liệu
- Tóm tắt nội dung trang web bằng Claude 3 Haiku: lấy nội dung từ URL và tóm tắt bằng Claude 3 Haiku
- Tạo truy vấn SQL bằng Claude: cung cấp ngữ cảnh schema cơ sở dữ liệu để sinh SQL từ câu hỏi ngôn ngữ tự nhiên
- Retrieval-Augmented Generation bằng Pinecone: kết nối Claude với cơ sở dữ liệu vector Pinecone để triển khai RAG và tìm kiếm ngữ nghĩa
- Xây dựng hệ thống RAG bằng Claude 3 và MongoDB: xây dựng chatbot Claude·MongoDB dùng tin tức công nghệ làm cơ sở tri thức
- Claude 3 RAG agent và LangChain v1: tạo RAG agent bằng các pattern framework agent đã cập nhật của LangChain v1
- Agent đa tài liệu: xây dựng RAG cho bộ sưu tập tài liệu quy mô lớn bằng DocumentAgents và pattern ReAct
- Pipeline RAG bằng LlamaIndex: tạo pipeline cơ bản cho tìm kiếm tài liệu và hỏi đáp
- RouterQuery engine: dùng LlamaIndex
RouterQueryEngineđể chuyển truy vấn tới các chỉ mục khác nhau - SubQuestionQueryEngine: phân rã truy vấn phức tạp thành các câu hỏi con trên nhiều tài liệu
- ‘Tải lên’ PDF cho Claude qua API: xử lý và tóm tắt tài liệu PDF bằng trích xuất văn bản và mã hóa
- Tìm kiếm Wikipedia lặp lại bằng Claude: notebook legacy cho workflow nghiên cứu tìm kiếm Wikipedia lặp lại bằng Claude 2
Đa phương thức, giọng nói và tài liệu
- Cung cấp công cụ cắt để cải thiện phân tích hình ảnh: phóng to vùng cụ thể trong biểu đồ, tài liệu và sơ đồ để phân tích chi tiết
- Dùng vision và công cụ cùng nhau trong Claude: kết hợp hiểu hình ảnh và công cụ để trích xuất dữ liệu có cấu trúc từ hình ảnh như bảng thành phần dinh dưỡng
- Best practice khi dùng Claude vision: cung cấp kỹ thuật và mẹo để nâng hiệu năng xử lý hình ảnh
- Bắt đầu: truyền hình ảnh cho Claude: truyền hình ảnh vào Claude 3 API để thực hiện phân tích văn bản dựa trên vision
- Chép lại tài liệu bằng Claude: trích xuất và cấu trúc hóa văn bản phi cấu trúc trong hình ảnh và PDF
- Làm việc với biểu đồ, đồ thị và slide deck: trích xuất thông tin từ biểu đồ, đồ thị và bài thuyết trình bằng Claude vision
- Đa phương thức: thực hiện hiểu hình ảnh và suy luận bằng abstraction Anthropic MultiModal LLM của LlamaIndex
- Trợ lý giọng nói độ trễ thấp bằng ElevenLabs: kết hợp chức năng speech-to-text và text-to-speech của ElevenLabs với Claude
- Chép lại âm thanh bằng Deepgram và chuẩn bị câu hỏi phỏng vấn bằng Anthropic: chép lại âm thanh và dùng Claude để tạo câu hỏi phỏng vấn
Phản hồi, suy luận và prompt
- Suy nghĩ mở rộng: sử dụng suy nghĩ mở rộng theo từng bước của Claude cùng với quản lý ngân sách
- Suy nghĩ mở rộng kết hợp sử dụng công cụ: kết hợp suy nghĩ mở rộng và công cụ trong quy trình làm việc nhiều bước
- Prompting cho thẩm mỹ frontend: trình bày cách viết prompt để tạo frontend cá tính, hoàn thiện cao, đồng thời tránh các kiểu thẩm mỹ chung chung
- Tóm tắt bằng Claude: tóm tắt tài liệu pháp lý, bao gồm đánh giá và các kỹ thuật nâng cao
- Lấy mẫu phản hồi Claude vượt quá giới hạn token tối đa: tạo phản hồi dài vượt
max_tokensbằng prefill và viết tiếp message - Metaprompt: tạo prompt khởi đầu cho công việc để giảm vấn đề trang trắng
- Prompting “chế độ JSON” cho Claude: đạt được đầu ra JSON đáng tin cậy bằng kỹ thuật prompt mà không cần lấy mẫu ràng buộc
- Xử lý hàng loạt bằng Message Batches API: xử lý bất đồng bộ lượng lớn yêu cầu và giảm 50% chi phí
Skills và ứng dụng nghiệp vụ
- Claude Skills cho ứng dụng tài chính: xây dựng dashboard tài chính và phân tích danh mục đầu tư bằng Excel, PowerPoint và PDF Skills
- Xây dựng Skills tùy chỉnh cho Claude: tạo, triển khai và quản lý Skills để mở rộng các workflow đặc thù của tổ chức
- Giới thiệu Claude Skills: thực hiện tạo tài liệu, phân tích dữ liệu và tự động hóa workflow bằng Excel, PowerPoint và PDF Skills
- Fine-tune Claude 3 Haiku trên Amazon Bedrock: cung cấp quy trình fine-tune Claude 3 Haiku trên Amazon Bedrock cho các tác vụ tùy chỉnh
- Cookbook Admin API về mức sử dụng và chi phí: truy cập và phân tích dữ liệu mức sử dụng Claude API và chi phí theo cách lập trình thông qua Admin API
Mẫu agent LlamaIndex và đóng góp cộng đồng
- Agent ReAct: xây dựng agent ReAct thực hiện workflow suy luận và hành động dựa trên công cụ bằng LlamaIndex
- Đang nhận đóng góp từ cộng đồng cho các ý tưởng Cookbook mới và cung cấp hướng dẫn đóng góp
1 bình luận
Ý kiến trên Hacker News
Thành thật mà nói, gần như mọi tài liệu hướng dẫn sử dụng AI đều có vẻ vô nghĩa. Cách làm thì có thể hỏi trực tiếp AI, còn nếu là cách tận dụng AI thì hoặc được tích hợp vào harness, hoặc chỉ là tính năng nhỏ nên cứ chờ Anthropic/OpenAI triển khai là được
Những thứ như quy trình tác nhân, quản lý bộ nhớ, kỹ thuật harness cũng phần lớn có cảm giác chỉ để trình diễn
Các kỹ thuật hay framework AI mới nhất cũng bị hấp thụ hoặc thay thế theo chu kỳ 3 tháng, nên có vẻ không đáng đầu tư
.md, làm ô nhiễm contextRốt cuộc phải để LLM tìm kiếm những tài liệu này, nên có lẽ đây là tài liệu dành cho LLM hơn là cho con người
Vì vậy nếu không thật cần, tôi tránh plugin và MCP, dùng prompt đầy đủ, kỹ lưỡng. Nhờ vậy tôi tránh được việc ép LLM dùng các tối ưu hóa đã cũ và cản trở sự tiến bộ của nó
Các ảnh trước/sau trong prompting thẩm mỹ frontend buồn cười đến mức khó tin. Có vẻ không ai kiểm tra xem skill này có thật sự cải thiện thiết kế hay không
Kết quả của prompting thẩm mỹ frontend là trước khi áp dụng thì nhạt nhẽo, sau khi áp dụng thì nhạt nhẽo có thêm gradient
Tôi đang dùng skills của Matt Pocock ở nhà và thấy khá tuyệt. Chúng được thiết kế để người dùng gọi thủ công chứ không phải tự động gọi, nên chỉ vì tồn tại mà không chiếm nhiều context
Thay vì loại lập trình viên khỏi kết quả cuối cùng, chúng khiến người ta suy nghĩ sâu hơn về kết quả. Grill skills giúp làm rõ yêu cầu thực tế, còn prototype skill giúp khám phá những phần cần tự trải nghiệm mới có thể đưa ra quyết định khó
OpenAI Cookbook cũng hữu ích. Các phòng thí nghiệm AI khác cũng thường xuyên công bố ví dụ và cookbook trên GitHub và Hugging Face, nên đáng để tiếp tục theo dõi
Tác nhân lập trình tạo ra nhiều lỗi ở frontend hơn backend, và thường đưa ra các tính năng hỏng, chưa hoàn chỉnh hoặc gượng gạo hơn nhiều. Có vẻ nguyên nhân là khác biệt về khả năng kiểm chứng giữa hai lĩnh vực, và chỉ bộ test cơ bản là không đủ
Các cách tiếp cận như gstack của Garry Tan có vẻ phù hợp, nhưng tôi không biết đã đủ chín để áp dụng chưa. Cũng có đánh giá rằng Gemini 3.5 Flash làm frontend tốt hơn Opus hay GPT-5.5; tôi tò mò liệu đó là do năng lực đa phương thức hay hiểu biết về Chrome, và muốn thấy đánh giá từ người dùng thực tế
Muốn có kết quả sáng tạo thì phải yêu cầu chủ động, nhưng nó tốt cho thiết kế frontend tiêu chuẩn. Tuy nhiên tôi chỉ dùng để thử ý tưởng, không phải để thêm hay sửa tính năng tùy ý
Tôi tưởng đây là cookbook thật để tạo ra các công thức nấu ăn nghe hợp lý và thật sự nấu được bằng LLM, nhưng có vẻ chưa tới mức đó
Sau khi nhận công thức, yêu cầu “làm cho ngon hơn” một hai lần rồi xem kết quả cũng khá thú vị
Tôi tưởng đây là sản phẩm mới tạo công thức nấu ăn bằng Claude
Thiết kế trước và sau khi áp dụng cookbook đều trông như được làm bằng vibe coding. Tôi không phải nhà thiết kế đủ để chỉ ra chính xác nguyên nhân, nhưng có vẻ phạm vi phong cách Claude dùng được hơi hạn chế
Có lẽ nếu chỉ định cụ thể hơn các thay đổi cần thiết thì có thể kiềm chế xu hướng này
Ít nhất họ đáng ra phải kiểm tra UI một lần. Ngay cả khoảng cách trong bảng đơn giản cũng không căn cho đúng