3 điểm bởi chessire 3 giờ trước | Chưa có bình luận nào. | Chia sẻ qua WhatsApp

Đây là một pipeline tạo video short-form giới thiệu chó chỉ từ các bản quay bằng điện thoại. Chỉ cần đưa vào nhiều video thô quay bằng điện thoại và một đoạn yêu cầu bằng ngôn ngữ tự nhiên, sau khoảng 4 phút sẽ tạo ra video dọc 9:16 có phụ đề và thuyết minh. Toàn bộ quy trình từ phát hiện đến TTS được thiết kế để chạy cục bộ trên một chiếc MacBook duy nhất.

Video demo

Việc ném video vào LLM để rút ra một bản demo có vẻ thuyết phục không quá khó. Thay vào đó, tôi đặt mục tiêu trả lời hai câu hỏi: ngày mai có thể tạo lại y hệt như vậy hay không, và những gì AI bịa ra có bị trộn lẫn với những gì con người đã thiết lập hay không.

Cấu trúc

  • LLM chỉ diễn giải, còn thực thi thì mang tính quyết định. Gemma (cục bộ) chỉ đảm nhiệm các phán đoán ngữ nghĩa như tên hành động, phân rã yêu cầu biên tập, quan sát cảnh; còn pixel, frame và timing đều do Python/OpenCV/ffmpeg xử lý. Cùng một đầu vào sẽ cho ra cùng một đầu ra.
  • Phát hiện và theo dõi dùng YOLO11 + ByteTrack; tái nhận diện nhiều chó dùng embedding DINOv2 + ảnh mốc từ người nuôi; phân biệt động/tĩnh được giao cho phép đo phần dư ROI sau khi bù chuyển động camera. Những trục mà LLM về mặt cấu trúc không thể nhìn ra, như chuyển động trong một ảnh tĩnh, sẽ không giao cho LLM.
  • TTS được tổng hợp cục bộ bằng Qwen3-TTS (mlx-audio) và kiểm tra bằng cổng CER khứ hồi Whisper.
  • Phụ đề do LLM bịa ra sẽ được tách thành các mệnh đề sự thật rồi đối chiếu với bản ghi quan sát video; nếu không có căn cứ thì sẽ viết lại. Phụ đề do người dùng trực tiếp viết sẽ không bị kiểm tra.

Cách ra quyết định

  • Mọi thay đổi về model và tham số đều được quyết định bằng chấm điểm trên golden set gán nhãn thủ công.
  • Những cải tiến mà tôi tin chắc là đương nhiên sẽ tốt hơn đã bị bác bỏ tới hai lần trong quá trình chấm golden set.

Con số

  • 148 unit test, độ chính xác phân loại hành vi trên M4 là 1.00
  • Rút thời gian tạo từ 8 phút xuống còn 4 phút trên toàn bộ vòng đời đầy đủ.

Giới hạn
Golden set gồm 5~9 video, một miền dữ liệu, do một người phát triển. Đây là sự chặt chẽ của phương pháp luận, không phải sự kiểm chứng về quy mô.

Quá trình phát triển được đăng thành loạt trên blog.
Giấy phép MIT. Hoan nghênh trao đổi về việc áp dụng phương pháp luận này sang các miền khác hoặc các câu hỏi về từng quyết định.

Chưa có bình luận nào.

Chưa có bình luận nào.