Tai nghe AI giúp nghe được giọng nói của một người giữa đám đông
(washington.edu)- Nhóm nghiên cứu của Đại học Washington đã phát triển hệ thống Target Speech Hearing, cho phép đăng ký một người nói chỉ bằng cách nhìn về phía họ trong 3~5 giây khi họ đang nói, rồi nghe giọng nói đó theo thời gian thực ngay cả trong môi trường ồn ào
- Hệ thống hoạt động cùng với micro hai bên của tai nghe thương mại và máy tính nhúng on-board, khi người dùng nhấn nút và hướng về phía người nói thì phần mềm học máy sẽ học mẫu giọng nói
- Sau khi đăng ký, hệ thống tiếp tục bám theo giọng nói đó ngay cả khi người nghe hoặc người nói di chuyển, và người nói càng nói lâu thì dữ liệu huấn luyện càng tăng, giúp cải thiện khả năng tập trung vào người nói mục tiêu
- Trong thử nghiệm với 21 người, những người tham gia đánh giá độ rõ của giọng nói của người đã đăng ký cao gần gấp đôi so với âm thanh không được lọc
- Hiện tại hệ thống chỉ có thể đăng ký một người mỗi lần, và nếu có giọng nói lớn khác trộn vào từ cùng một hướng thì việc đăng ký sẽ khó khăn, nên việc mở rộng sang earbud và máy trợ thính vẫn là bài toán cho tương lai
Cách Target Speech Hearing hoạt động
- Target Speech Hearing của Đại học Washington là một hệ thống AI cho phép người dùng của tai nghe chống ồn chỉ chọn nghe giọng nói của một người cụ thể
- Người dùng đeo tai nghe thương mại có gắn micro, xoay đầu về phía người đang nói rồi nhấn nút
- Sóng âm của người nói mục tiêu phải đến được hai micro trên tai nghe cùng lúc
- Sai số cho phép là 16 độ
- Tai nghe gửi tín hiệu thu được tới máy tính nhúng on-board, và phần mềm học máy sẽ học mẫu giọng nói của người nói mong muốn
- Khi đăng ký hoàn tất, hệ thống sẽ giảm các âm thanh xung quanh và chỉ phát lại giọng nói của người đã đăng ký theo thời gian thực
- Hệ thống tiếp tục bám theo giọng nói đã đăng ký ngay cả khi người nghe và người nói di chuyển
- Nếu người nói tiếp tục nói, dữ liệu huấn luyện sẽ tăng lên, giúp hệ thống tập trung tốt hơn vào người nói mục tiêu
- Nhóm nghiên cứu đã công bố kết quả vào ngày 14 tháng 5 tại ACM CHI Conference on Human Factors in Computing Systems
- Mã của thiết bị proof-of-concept được công bố tại LookOnceToHear
- Hệ thống này hiện vẫn chưa phải sản phẩm thương mại
Kết quả thử nghiệm và các giới hạn hiện tại
- Trong thử nghiệm với 21 người, những người tham gia đánh giá độ rõ của người nói đã đăng ký cao gần gấp đôi so với âm thanh không được lọc
- Nghiên cứu này dựa trên các nghiên cứu trước đây về semantic hearing, nơi người dùng chọn một loại âm thanh muốn nghe và loại bỏ các âm thanh môi trường còn lại
- Hệ thống trước đây hoạt động theo cách chọn một lớp âm thanh cụ thể như tiếng chim hoặc giọng nói
- TSH tập trung không phải vào loại âm thanh mà vào một người nói đã được đăng ký
- Hiện tại TSH chỉ có thể đăng ký một người nói tại một thời điểm
- Nếu có một giọng nói lớn khác phát ra từ cùng hướng với người nói mục tiêu, hệ thống sẽ không thể đăng ký người nói đó
- Nếu người dùng không hài lòng với chất lượng âm thanh, họ có thể chạy lại quy trình đăng ký cho cùng một người nói để cải thiện độ rõ
- Trong tương lai, nhóm nghiên cứu dự định mở rộng hệ thống sang earbud và máy trợ thính
1 bình luận
Các ý kiến trên Hacker News
Nếu kích thước thu nhỏ xuống cỡ nút bịt tai nhỏ thì ngay cả với tư cách một người không bị khiếm thính, tôi cũng muốn dùng
Ít nhất theo chẩn đoán thì họ nói tôi không bị khiếm thính, nhưng giờ tôi cũng bối rối không biết là cách kiểm tra không tốt, hay tôi bình thường còn những người khác chỉ giỏi giả vờ nghe rõ hơn
Với bạn bè hay các buổi gặp mặt thì rốt cuộc cũng hay đến nhà hàng hoặc quán bar ồn ào, và thật bực bội khi không nghe thấy nên nhờ nói lại, nhưng họ lại lặp lại bằng cùng một giọng nhỏ và mình lại không nghe được
Bỏ lỡ những câu đùa hay những lời nói thoáng qua còn khó chịu hơn, thành ra kiểu “mọi người cười vì cái gì vậy, tôi không nghe thấy, nói lại khoảng ba lần được không?”
Nhưng bác sĩ thính học nào tôi đến cũng nói thính lực bình thường, cuối cùng tôi tìm đến vị chuyên gia được cho là giỏi nhất ở một vùng đô thị lớn và đặt lịch sau 1 năm chờ đợi
Sau khi kiểm tra suốt cả ngày, chuyên gia nói có “tin tốt, tin xấu, và tin vừa tốt vừa xấu”; tin tốt là thính lực của tôi rất tốt, ở mức của một đứa trẻ 5 tuổi, còn tin xấu là tôi nghe quá tốt nên không phân biệt được âm thanh
Không phải thính lực của tôi kém đi, mà là khả năng tách âm thanh của não đã giảm; còn tin vừa tốt vừa xấu là cuối cùng thính lực của tôi cũng sẽ suy giảm như mọi người, nên trong vài năm nữa tôi sẽ nghe ở nơi công cộng tốt hơn
Tôi cho rằng một trong những lý do khiến vấn đề này trầm trọng hơn là các nhà thiết kế nhà hàng và không gian công cộng không còn quan tâm đến môi trường âm thanh nữa
Hầu hết các quán bar mở trong 15 năm gần đây đều có sàn xi măng, gần như không tiêu âm, và dường như được thiết kế với giả định rằng nếu tai không ù lên thì không phải là một cuộc vui
Vì đúng nghĩa là không thể duy trì cuộc trò chuyện, nên tôi không còn đến những nơi như vậy nữa
Thay vì giải quyết bằng thiết bị, tôi khuyên nên nhìn thẳng vào vấn đề và xử lý theo cách truyền thống kiểu “tôi chẳng nghe thấy gì cả và chắc các bạn cũng vậy. Việc này thật ngớ ngẩn, ra ngoài thôi”
Những nơi như thế thường được thiết kế để khiến bạn khổ sở nếu không liên tục hét lên hoặc không chai lì với xung quanh
Tôi không hiểu vì sao mọi người lại đến đó rồi còn trả tiền, còn tôi thì chắc có trả tiền tôi cũng không đi
Tôi không muốn thay thế việc tôn trọng giới hạn của nhau bằng thiết bị AI
Bạn có thể để tai mở mà vẫn nghe âm thanh từ headset, và khi cần nghe rõ hơn, chẳng hạn khi gọi điện ở nơi đông người, chỉ cần dùng ngón tay bịt tai lại
Khi đó bên trong tai tạo ra hiệu ứng giống như thùng loa, làm chất âm dẫn truyền xương đầy đặn hơn, đồng thời chặn cả tiếng ồn bên ngoài
Nếu cần chất lượng headphone hoàn chỉnh, bạn có thể đeo nút bịt tai; chúng cũng nhỏ và ít gây chú ý
Không hoàn hảo, nhưng tôi thích việc có thể chuyển mượt mà từ “nghe headset trong khi vẫn để tai mở” sang “chặn âm thanh và nghe headset rất rõ” chỉ bằng ngón tay hoặc nút bịt tai
Nếu gắn thêm micro shotgun ở bên cạnh thì chắc sẽ rất tuyệt. Nếu gọi một micro có góc thu hẹp là như vậy là đúng
https://www.flareaudio.com/pages/earhd
Nếu nhìn thấy môi, dù không biết đọc khẩu hình, điều đó vẫn giúp tôi diễn giải lời nói chính xác hơn nhiều
Mỗi lần tìm hiểu chuyện này, tôi đều gặp các liên hệ với tự kỷ hoặc ADHD, và hồi năm 2008, vì lúc đó chưa được chẩn đoán nên tôi đã phần nào phớt lờ suy nghĩ đó
Hiện giờ tôi đã được chẩn đoán AuDHD
Điều độc giả HN nên biết là máy trợ thính đắt đỏ và tệ đến mức nào
Thử tra giá mà xem, ngay cả máy trợ thính cơ bản ở mức “khuếch đại âm thanh” cũng đắt kinh khủng
Tệ hơn nữa là vì nó can thiệp vào tai, bạn dễ mất khả năng “định hướng” thính giác
Tức là sẽ khó lọc bỏ các cuộc trò chuyện khác, tiếng ồn, v.v.
Một sản phẩm phụ tốt đẹp từ quá trình Facebook đổ hàng tỷ đô la vào một việc có lẽ gần như công cốc để tìm ra AR thực dụng và phổ biến là https://www.projectaria.com/glasses/
Đây là một nền tảng tương đối rẻ để thử nghiệm các thao tác kiểu AR, có theo dõi ánh mắt, mảng micro và camera phía trước, nên có thể khá dễ dàng độ lại thành micro có thể định hướng
Máy trợ thính Phonak của tôi tự động chuyển chương trình ở một mức nào đó, và cũng có thể tinh chỉnh bằng ứng dụng đi kèm
Trong môi trường ồn ào nó vẫn hoạt động được phần nào và tôi vẫn có thể trò chuyện, điều mà với máy trợ thính khoảng 10 năm trước là bất khả thi, nên tôi thật sự biết ơn
Giá một cặp khoảng 2000 đô la, và may mắn là được hệ thống y tế quốc gia chi trả, nên khoảng 5 năm tôi chỉ phải trả 50 đô la một lần. Tất nhiên, đó cũng là tiền thuế của tôi
Tôi hy vọng những tiến bộ “AI” sẽ vượt ra ngoài khuếch đại và lọc đơn giản, để có thể tách, tăng cường hoặc tái tạo giọng nói trong môi trường ồn
Mặt khác, tôi mong trào lưu mở nhạc ngày càng to ở quán cà phê, nhà hàng, quán bar sẽ biến mất. Đó là cơn ác mộng về khả năng tiếp cận, đặc biệt với người khiếm thính, và cả những người khác nữa
0: https://www.socialstyrelsen.se/en/about-us/healthcare-for-vi...
1: https://www.vox.com/2018/4/18/17168504/restaurants-noise-lev...
Một cartel nhỏ đang kiểm soát nguồn cung, nên họ có động cơ chỉ tối đa hóa lợi nhuận thay vì cạnh tranh bằng công nghệ tốt hơn
(0) https://www.thebignewsletter.com/p/silencing-the-competition...
Như vậy bạn mới có thể có được chiếc máy trợ thính phù hợp với mình, rẻ nhất và đáng tin cậy nhất
Nếu không, do mất cảm giác, bạn sẽ bắt đầu gặp vấn đề lọc chú ý như đã nói ở trên
Sau khi thính lực bắt đầu suy giảm, bạn càng tránh việc điều chỉnh thính giác lâu bao nhiêu thì càng cần máy trợ thính phức tạp và đắt tiền hơn để bù lại bấy nhiêu
Bởi vì những máy trợ thính đắt tiền đang xấp xỉ một cách vụng về những việc mà trước khi mất cảm giác, não và vỏ não thính giác từng làm cho bạn
Khoan đã, tôi phải đi đặt lịch kiểm tra thính lực đây
Khi bà còn sống, trong các buổi họp mặt gia đình hoặc nơi công cộng, lúc nói chuyện với bà tôi cũng từng nghĩ có nên thử làm một thứ tương tự không
Tôi đoán lý do chúng đắt là vì quan hệ với các công ty y tế/chăm sóc sức khỏe và chi phí tuân thủ quy định làm đội giá lên
Ví dụ cùng một loại màn hình, nhưng nếu có chứng nhận dùng trong cơ sở y tế thì có thể đắt gấp nhiều lần
Máy trợ thính Widex của tôi rất tuyệt. Trong các tình huống thông thường, chất lượng âm thanh tuyệt vời
Phàn nàn thực sự duy nhất là nó không chống nước hoàn toàn, nên tôi phải lên kế hoạch trước một chút khi ra ngoài vào ngày mưa
Với tư cách là một người khiếm thính, tính năng như thế này thật sự giống như món quà từ trời ban
Tính năng này cần được tích hợp vào máy trợ thính càng sớm càng tốt. Im đi, à không thật ra cứ nói tiếp đi, tôi sẽ trả tiền
Nếu có thể tách riêng giọng của từng người, thì cũng có thể chuyển sang nhận dạng giọng nói để gắn phụ đề cho cuộc trò chuyện thực tế. Điều này hữu ích khi thính lực kém hơn nữa hoặc hoàn toàn không còn nghe được
Tuy nhiên độ trễ khứ hồi lên cloud có thể làm giảm mạnh tính hữu dụng hoặc khiến nó vô dụng, nên thật sự cần thiết bị di động có thể xử lý cục bộ
Sản phẩm đã ngừng bán, nhưng vẫn có thể tìm được hàng tân trang
Kính đeo thông minh khá hứa hẹn cho trường hợp sử dụng bạn nói, vì khi nói chuyện với ai đó, nó tránh được cảm giác cồng kềnh và trông có vẻ bất lịch sự như khi đeo tai nghe
Một dạng phát triển hơn của thứ này có lẽ cũng sẽ khá hữu ích cho chứng ù tai của tôi
Khi một người nói thì dù họ nói nhỏ hoặc ở xa tôi vẫn nghe rõ, nhưng nếu nhiều người nói hoặc có nhạc thì tôi chẳng nghe được gì
Khi ngồi trong một quán bar ồn, gần như không thể nghe người ta đang nói gì ngoài hai người gần nhất
Trò chuyện trong môi trường bình thường thì nhìn chung không vấn đề gì
Vì vậy nếu có tính năng tăng cường lời nói của người tôi đang nhìn thì sẽ rất tuyệt
Apple AirPods đã có tính năng điều chỉnh âm thanh phản ứng theo môi trường và chế độ, và cũng hỗ trợ tăng cường một giọng nói cụ thể nếu đặt điện thoại trước người đang nói
Nếu AirPods hỗ trợ trực tiếp tăng cường giọng nói định hướng như nghiên cứu này thì sẽ giúp ích rất nhiều cho tương tác xã hội ở những nơi ồn ào
Mã nguồn: https://github.com/vb000/LookOnceToHear
Có vẻ khả năng thành công thương mại sẽ lớn hơn theo hướng dùng ngược lại
Hãy tưởng tượng có thể tắt tiếng đúng một người đó đang nói quá to bằng giọng khó chịu ở bữa tiệc
Ở concert, người ta thường đeo nút tai để khỏi hỏng tai; hãy tưởng tượng thay nó bằng tai nghe in-ear lọc bỏ mọi thứ, chỉ giữ lại concert và giọng của gia đình/bạn bè
Âm lượng cũng được điều chỉnh, kiểu như khi vợ/chồng bạn nói thì chỉ giọng đó được đẩy to lên trên các âm thanh khác, còn tiếng đám đông vẫn giữ lại để có không khí nhưng loại bỏ các cuộc trò chuyện thông thường của những người xung quanh
Tôi không phải chuyên gia về machine learning hay AI, nhưng hiểu rằng với công nghệ hiện tại thì chuyện này không phải là bất khả thi
Sẽ có giới hạn về pin và điện năng, nhưng nếu là concert thì một kiểu tai nghe có vòng đeo chạy sau đầu để cố định, rơi cũng không mất, cũng hợp lý
Sẽ cần học “giọng của bạn”, nhưng nếu Alexa làm được trong 10 giây thì app điện thoại cũng có thể làm được
Nếu có bản dưới 200 euro cho rạp chiếu phim thì tôi sẽ mua ngay bây giờ, và có lẽ sẽ quay lại rạp
Người ta đeo tai nghe ở tiệc à?
Nếu có cách lọc những người như vậy ra thì chắc chắn tôi sẽ biết ơn
Trước đây tôi từng làm ở Sonos, rất lâu trước thảm họa cập nhật app hiện tại và trước cả khi ra mắt tai nghe
Trong lần thử phát triển sản phẩm tai nghe đầu tiên rồi bị hủy, chúng tôi từng xem xét một tính năng khái niệm tương tự: cho phép chọn lọc chỉ giọng của một người cụ thể đi qua bằng chipset chống ồn chủ động
Tôi không nhớ chính xác nhóm DSP đã dùng cách tiếp cận nào. Tôi ở gần phần cứng chống ồn chủ động hơn
Nhưng thứ họ thực sự tách được chỉ là giọng của chính người đeo, vì tín hiệu đó mạnh hơn mọi âm thanh khác
Cái này thật sự rất hay. Tôi tò mò không biết còn có thể làm những chuyện thú vị nào khác với tai nghe
Chipset chống ồn chủ động cực kỳ mạnh, và tôi nghĩ năng lực của chúng vẫn còn rất lâu nữa mới được khai thác hết
Vẫn chưa tìm được sản phẩm phù hợp
Khử ồn ở phía người nghe có vẻ đã được giải quyết bằng cách âm và chống ồn chủ động, nhưng sẽ thật tuyệt nếu có một tổ hợp phần cứng/phần mềm tách riêng giọng tôi và chặn tiếng ồn cho người ở đầu bên kia, giúp làm việc từ xa đúng nghĩa
Sản phẩm Sonos nhìn chung có vấn đề với các chức năng cơ bản, ví dụ khi Wi-Fi bị ngắt rồi trở lại thì không kết nối lại được, đặc biệt tệ nếu trong lúc đó kênh Wi-Fi thay đổi
Cách giải quyết “kỹ thuật” là rút phích cắm để khởi động lại, mà còn không làm từ xa được
Ngay cả khi nó đang kết nối Wi-Fi và bạn muốn khởi động lại vì Spotify Connect của Sonos lỗi đến mức vô lý, cũng không thể làm được
Với esp hay một module TI tương tự cũng có thể duy trì kết nối Wi-Fi và luôn tự kết nối lại, vậy mà với các lập trình viên firmware của Sonos, làm điều cơ bản như thế khó đến vậy sao?
Vẫn phụ thuộc vào điều kiện là ở cùng vị trí với người nói mục tiêu không được có âm thanh hay giọng nói cạnh tranh
Mã nguồn mở nằm ở https://github.com/vb000/LookOnceToHear, còn bài báo ở https://arxiv.org/abs/2405.06289
Vì vậy có lẽ nó không hoàn toàn xa vời như nhiều bài khoa học đại chúng khác
Nếu ai đó có thể chạy thử độc lập, tôi muốn nghe kết quả
Tôi khó nghe được ai đó nói trong một căn phòng đông đúc, có vẻ vì tâm trí cứ cố thu nhận mọi âm thanh, nên thứ này có thể thật sự giúp tôi rất nhiều. Tôi đoán có lẽ do ADHD
Nếu có cách giảm mạnh những âm thanh khác ngoài giọng của người đang nói chuyện với tôi thì sẽ thật tuyệt
Hy vọng chỉ là vấn đề thời gian trước khi bản thân AirPods làm được việc này
Tính năng như thế này sẽ là một phước lành với tôi
Trong các bài kiểm tra thính lực nghe tiếng bíp nhỏ thì kết quả ổn, nhưng đặc biệt trong môi trường đông người, tôi gặp khó khăn lớn khi xử lý xem mọi người đang nói gì
Bố tôi cũng gặp vấn đề tương tự
Đây là một tính năng tiềm năng mà tôi không biết là mình cần
Ở nhà tôi luôn đeo tai nghe chống ồn chủ động, và nếu nó tự động cho giọng của bạn đời đi qua thì sẽ cực kỳ hữu ích
Có lẽ không phải bạn đời, nhưng biết đâu…
Việc giọng của bạn đời nghe nhỏ và không lọt vào tai rõ có lẽ là do cách âm thụ động của tai nghe
Hoặc đơn giản là nhạc bạn đang nghe đang che lấp giọng nói
Chống ồn chủ động chỉ chặn được giọng của bạn đời trong trường hợp giọng đó hòa vào tiếng nền với cao độ/âm lượng tương tự, trở thành kiểu tiếng ồn trắng hoặc tiếng ồn màu, và chống ồn chủ động có thể triệt cả khối âm thanh đó