Weave Router - bộ định tuyến mô hình cho agent, chuyển hướng mỗi prompt tới mô hình tối ưu
(github.com/workweave)- Proxy thay thế trực tiếp, gộp Anthropic, OpenAI, Gemini vào một endpoint duy nhất. Tự động chọn mô hình tối ưu cho từng yêu cầu
- Định tuyến mọi prompt tới đúng mô hình trong vòng 50ms, và có thể giảm chi phí 40-70% chỉ bằng cách đổi endpoint
- Đánh giá prompt không bằng cảm tính mà bằng bộ chấm điểm cụm dựa trên on-box embedder, phương pháp dẫn xuất từ Avengers-Pro, đưa ra quyết định định tuyến ở mỗi lượt
- Hỗ trợ đầy đủ API Anthropic Messages, OpenAI Chat Completions, Gemini native, cùng streaming/tool/vision
- Có thể dùng các mô hình OSS như DeepSeek, Kimi, GLM, Qwen, Llama, Mistral thông qua OpenRouter (hoặc endpoint tương thích OpenAI)
- BYOK là mặc định, khóa của nhà cung cấp được mã hóa và lưu cục bộ
- Tích hợp sẵn OTLP trace, cung cấp Observability qua Weave dashboard/Honeycomb/Datadog/Grafana v.v.
- Chạy không cần cài đặt bằng
npx @workweave/router, rồi kết nối ngay với Claude Code, Codex, opencode, Cursor, hỗ trợ chuyển on/off/status- Với Claude Code, kết nối bằng
make install-cc. Cung cấp các lệnh slash/router-off,/router-on,/router-status - Codex: chạy
npx @workweave/router --codexsẽ vá~/.codex/config.toml - opencode: chạy
npx @workweave/router --opencodesẽ đặt provider@ai-sdk/anthropicđi kèm tới endpoint/v1của router, hoạt động không cần sửa đổi nhờ hỗ trợ native Anthropic Messages API - Cursor: hiện vẫn là beta rất sớm nên hiệu năng chưa ổn định; vào Settings → Models → Override OpenAI Base URL và nhập
http://localhost:8080/v1
- Với Claude Code, kết nối bằng
- Elastic License 2.0
4 bình luận
Không biết liệu có gặp vấn đề về cache không nhỉ?
Có lẽ sẽ khó tận dụng lớp cache do các dịch vụ LLM cung cấp.
Nếu tích hợp theo cách dùng API, cache miss có thể khiến chi phí phát sinh khá lớn.
Phần gọi là wldnjs thật thú vị.
Tôi đã chỉnh sửa rồi.