Xin chào. Dù đã ghi âm các cuộc họp hay phỏng vấn, khi về sau muốn tìm một câu cần thiết, cuối cùng vẫn phải nghe lại tệp từ đầu — điều này khá bất tiện.
Để giảm bớt vấn đề đó, tôi đã tạo ToText.
Ban đầu tôi nghĩ chỉ cần có chức năng chuyển giọng nói thành văn bản là đủ. Nhưng khi dùng với các tệp thực tế, tôi nhận ra sau khi phiên âm còn nhiều việc phải làm hơn.
Tôi phải sửa tên người hoặc con số, và khi có nhiều người trò chuyện thì cần sắp xếp lại người nói. Để kiểm tra câu chính xác, tôi cũng phải tìm lại đúng vị trí tương ứng trong bản ghi gốc.
Vì vậy, tôi đã làm để trên màn hình kết quả có thể xem tệp gốc cùng với nội dung phiên âm. Mỗi câu đều có dấu thời gian, và khi nhấp vào câu, tệp sẽ phát ngay từ đoạn tương ứng.
Các tính năng hiện được hỗ trợ như sau.
- Tải lên tệp âm thanh/video như MP3, MP4, M4A, MOV, WAV, WebM, v.v.
- Tự động nhận diện ngôn ngữ
- Kết quả phiên âm có thể chỉnh sửa kèm dấu thời gian
- Nhận diện người nói và chỉnh sửa tên người nói
- Tìm kiếm văn bản và phát đoạn tương ứng trong tệp gốc
- Tạo tóm tắt, biên bản họp, chương tự động, mục hành động
- Xuất ra TXT, DOCX, PDF, SRT, VTT, CSV, JSON
Các bản ghi phỏng vấn, podcast, họp có thể xử lý theo luồng MP3 to Transcript, còn webinar, bài giảng và video cuộc họp có thể làm việc trong cùng màn hình chỉnh sửa theo luồng MP4 to Transcript.
Hiện tại, tài khoản mới được cung cấp 3 lượt phiên âm miễn phí mà không cần đăng ký thẻ tín dụng.
Sản phẩm vẫn đang tiếp tục được cải thiện, nên tôi muốn nhận ý kiến về các điểm sau.
- Tính năng cần thiết nhất khi rà soát nội dung phiên âm dài
- Trong số tóm tắt, biên bản họp và phụ đề, đầu ra nào bạn thực sự dùng thường xuyên nhất
- Những phần bất tiện hoặc khó hiểu trong màn hình chỉnh sửa
Rất mong bạn dùng thử trực tiếp và để lại lỗi hoặc ý kiến cải thiện.
1 bình luận
Cả video và bản ghi âm đều được phục vụ qua máy chủ phải không?