9 điểm bởi xguru 5 ngày trước | 4 bình luận | Chia sẻ qua WhatsApp
  • Proxy thay thế trực tiếp, gộp Anthropic, OpenAI, Gemini vào một endpoint duy nhất. Tự động chọn mô hình tối ưu cho từng yêu cầu
  • Định tuyến mọi prompt tới đúng mô hình trong vòng 50ms, và có thể giảm chi phí 40-70% chỉ bằng cách đổi endpoint
  • Đánh giá prompt không bằng cảm tính mà bằng bộ chấm điểm cụm dựa trên on-box embedder, phương pháp dẫn xuất từ Avengers-Pro, đưa ra quyết định định tuyến ở mỗi lượt
  • Hỗ trợ đầy đủ API Anthropic Messages, OpenAI Chat Completions, Gemini native, cùng streaming/tool/vision
  • Có thể dùng các mô hình OSS như DeepSeek, Kimi, GLM, Qwen, Llama, Mistral thông qua OpenRouter (hoặc endpoint tương thích OpenAI)
  • BYOK là mặc định, khóa của nhà cung cấp được mã hóa và lưu cục bộ
  • Tích hợp sẵn OTLP trace, cung cấp Observability qua Weave dashboard/Honeycomb/Datadog/Grafana v.v.
  • Chạy không cần cài đặt bằng npx @workweave/router, rồi kết nối ngay với Claude Code, Codex, opencode, Cursor, hỗ trợ chuyển on/off/status
    • Với Claude Code, kết nối bằng make install-cc. Cung cấp các lệnh slash /router-off, /router-on, /router-status
    • Codex: chạy npx @workweave/router --codex sẽ vá ~/.codex/config.toml
    • opencode: chạy npx @workweave/router --opencode sẽ đặt provider @ai-sdk/anthropic đi kèm tới endpoint /v1 của router, hoạt động không cần sửa đổi nhờ hỗ trợ native Anthropic Messages API
    • Cursor: hiện vẫn là beta rất sớm nên hiệu năng chưa ổn định; vào Settings → Models → Override OpenAI Base URL và nhập http://localhost:8080/v1
  • Elastic License 2.0

4 bình luận

 

Không biết liệu có gặp vấn đề về cache không nhỉ?

 
shaffr0n 5 ngày trước

Có lẽ sẽ khó tận dụng lớp cache do các dịch vụ LLM cung cấp.
Nếu tích hợp theo cách dùng API, cache miss có thể khiến chi phí phát sinh khá lớn.

 
wizmasia 5 ngày trước

Phần gọi là wldnjs thật thú vị.

 

Tôi đã chỉnh sửa rồi.