Vì tôi không thích phải mở tab Telegram cả ngày chỉ để trò chuyện với agent cục bộ (Hermes/OpenClaw), nên tôi đã tạo một avatar để thay thế vị trí đó. Đây là hai cửa sổ kiểu gọi video luôn hiện trên màn hình (avatar + chat), khiến phản hồi của agent không chỉ được đọc mà còn được "diễn" lại.
-
Avatar không dùng GPU khi chạy. Thay vì suy luận thời gian thực, nó chọn và phát khoảng 30 clip dựng sẵn dựa trên thẻ cảm xúc trong đầu ra của LLM. Với
[working]thì đeo kính và ghi chú, với thẻ[confirm]thì hiện phê duyệt/hủy để hỏi trước các thao tác không thể hoàn tác, còn code/log thì không đọc thành tiếng mà render thành thẻ. GPU được dành trọn cho model. -
Không thay thế agent mà gắn vào bằng connector. Gateway dùng cấu trúc dial-out tới WebSocket cục bộ do ứng dụng mở, nên từ phía agent thì chỉ đơn giản là có thêm một kênh. Menu slash command của agent cũng được nhận nguyên trạng và hiển thị lại.
-
Âm thanh hai chiều: Edge TTS (có thể thay bằng engine cục bộ) + Silero VAD·faster-whisper.
-
Open-core (MIT). Có kèm avatar starter miễn phí nên chỉ cần clone là chạy được ngay. Bản thân avatar đó cũng được tạo hoàn toàn bằng các công cụ cục bộ miễn phí (Animagine XL → HunyuanVideo 1.5 i2v), nên đây cũng là ví dụ chứng minh rằng quy trình làm trong tài liệu thực sự hoạt động.
Điều tôi nhận ra khi làm: mô hình khuếch tán video khó tạo vi biểu cảm bằng prompt hơn tôi nghĩ. Wan 2.2 5B có thể làm nụ cười há miệng lớn, nhưng các cảm xúc thể hiện bằng lông mày như "lo lắng" hay "tức giận" thì lại cho ra gương mặt vô cảm; đổi sang HunyuanVideo 1.5 (8.3B chưng cất theo bước) thì trên cùng card 12GB vừa nhanh hơn vừa thể hiện biểu cảm đúng hơn.
Hiện chỉ có bản build cho Windows và chưa có lip-sync thời gian thực (đây là đánh đổi của cách dựng sẵn).
Chưa có bình luận nào.