Luận văn thạc sĩ khoa học máy tính sử dụng active learning trong việc lựa chọn dữ liệu gán nhãn cho bài toán speech recognition

Luận văn thạc sĩ khoa học máy tính nghiên cứu sử dụng Active Learning trong việc lựa chọn dữ liệu gán nhãn cho bài toán Speech Recognition.

Chuyên ngành

Khoa Học Máy Tính

Người đăng

Ẩn danh

Thể loại

luận văn thạc sĩ

2021

53
20
0

Phí lưu trữ

30 Point

Tóm tắt

I. Giới thiệu bài toán

Trong bối cảnh công nghệ thông tin và trí tuệ nhân tạo đang phát triển mạnh mẽ, Active Learning đã trở thành một phương pháp quan trọng trong việc lựa chọn dữ liệu cho các bài toán học máy, đặc biệt là trong lĩnh vực nhận diện giọng nói. Bài toán nhận diện giọng nói yêu cầu một lượng lớn dữ liệu gán nhãn để đạt được độ chính xác cao. Việc gán nhãn dữ liệu truyền thống không chỉ tốn thời gian mà còn tiêu tốn ngân sách lớn. Do đó, việc áp dụng phương pháp học chủ động giúp tối ưu hóa quy trình gán nhãn, lựa chọn những mẫu dữ liệu quan trọng nhất cho việc huấn luyện mô hình. Theo thống kê, thị trường gán nhãn dữ liệu đã đạt giá trị hàng tỉ đô la và ngày càng tăng trưởng. Việc tối ưu hóa lựa chọn dữ liệu gán nhãn không chỉ giúp tiết kiệm chi phí mà còn nâng cao chất lượng mô hình học máy. Luận văn này sẽ trình bày chi tiết về việc áp dụng Active Learning trong việc lựa chọn dữ liệu gán nhãn cho bài toán nhận diện giọng nói.

II. Các phương pháp lựa chọn dữ liệu gán nhãn

Trong lĩnh vực nhận diện giọng nói, có hai phương pháp chính để lựa chọn dữ liệu gán nhãn: Active LearningCore-Set Selection. Active Learning là phương pháp mà trong đó mô hình sẽ tự động lựa chọn các mẫu dữ liệu chưa được gán nhãn để gán nhãn tiếp theo. Phương pháp này giúp tiết kiệm thời gian và chi phí gán nhãn bằng cách chỉ gán nhãn những mẫu dữ liệu quan trọng nhất cho mô hình. Ngược lại, Core-Set Selection tìm kiếm một tập con nhỏ nhất có độ chính xác gần giống với toàn bộ tập dữ liệu. Mặc dù phương pháp này có ưu điểm là dễ triển khai, nhưng lại khó khăn trong việc xử lý các mẫu có đặc trưng phức tạp. Active Learning được coi là phương pháp hiệu quả hơn trong việc tối ưu hóa quy trình gán nhãn, đặc biệt trong các bài toán liên quan đến machine learninghọc sâu.

III. Đánh giá chất lượng gán nhãn

Đánh giá chất lượng gán nhãn là một bước quan trọng trong quy trình gán nhãn dữ liệu. Có hai phương pháp chính để đánh giá: phương pháp thủ công và phương pháp tự động. Phương pháp thủ công yêu cầu một nhóm người đánh giá kiểm tra các mẫu dữ liệu đã được gán nhãn, trong khi phương pháp tự động sử dụng các mô hình đã huấn luyện để đánh giá độ chính xác của các mẫu gán nhãn. Việc sử dụng phương pháp tự động giúp tiết kiệm thời gian, nhưng không đảm bảo hoàn toàn tính chính xác. Để đạt được độ chính xác cao trong nhận diện giọng nói, việc đánh giá chất lượng gán nhãn cần phải được thực hiện một cách nghiêm ngặt, đảm bảo rằng các dữ liệu gán nhãn đều đạt tiêu chuẩn và không có lỗi. Điều này sẽ ảnh hưởng trực tiếp đến hiệu suất của mô hình học máy.

IV. Kết quả thực nghiệm

Luận văn đã thực hiện các thí nghiệm trên hai bộ dữ liệu khác nhau để phân tích sự ảnh hưởng của dữ liệu đối với phương pháp học chủ động. Kết quả cho thấy rằng việc lựa chọn dữ liệu gán nhãn có ảnh hưởng lớn đến độ chính xác của mô hình. Các thí nghiệm cũng chỉ ra rằng Active Learning có thể giúp tăng cường hiệu suất của mô hình nhận diện giọng nói bằng cách giảm thiểu số lượng mẫu cần gán nhãn mà vẫn đảm bảo chất lượng. Đặc biệt, việc lựa chọn dữ liệu theo từng tiêu chí âm học và ngôn ngữ đã chứng minh được hiệu quả trong việc tối ưu hóa quy trình gán nhãn. Những kết quả này không chỉ có giá trị trong nghiên cứu mà còn có thể áp dụng thực tiễn trong các hệ thống nhận diện giọng nói hiện nay.

V. Kết luận

Luận văn đã chỉ ra rằng Active Learning là một phương pháp hiệu quả trong việc lựa chọn dữ liệu gán nhãn cho bài toán nhận diện giọng nói. Việc áp dụng phương pháp này không chỉ giúp tiết kiệm chi phí mà còn nâng cao chất lượng dữ liệu gán nhãn. Các kết quả thực nghiệm cho thấy rằng việc lựa chọn dữ liệu gán nhãn một cách thông minh có thể làm tăng độ chính xác của mô hình học máy. Điều này có ý nghĩa quan trọng trong bối cảnh công nghệ thông tin hiện đại, nơi mà yêu cầu về độ chính xác và hiệu quả ngày càng cao. Luận văn khuyến nghị các nhà nghiên cứu và phát triển trong lĩnh vực này nên tiếp tục tìm hiểu và áp dụng Active Learning để tối ưu hóa quy trình gán nhãn dữ liệu.

16/12/2024

Trích đoạn nội dung tài liệu

Chương 1. Giới thiệu bài toán 1. Tổng quan Sự phát triển của các mô hình học máy và trí tuệ nhân tạo ngày cảng trở nên rộng rãi, máy móc ngày càng thay thế cho sức lao động của con người nhiều hơn. Đặc biệt trong những năm gần đây, với sự phát triển của mô hình học sâu đã chứng minh tính hiệu quả trong nhiều bài toán thực tế như: Nhận dạng khuôn mặt, Xử lý tiếng nói, Dịch máy… Đây đều là những bài toán phổ biến, được nhiều tập đoàn công nghệ lớn đầu tư và phát triển.

Ảnh 1 Thị trường gán nhãn dữ liệu Để phát triển những công cụ học máy với độ chính xác cao, hầu hết các mô hình đều yêu cầu từ hàng trăm ngàn đến hàng triệu mẫu dữ liệu học. Ngành công nghiệp gán nhãn chưa bao giờ phổ biến như hiện nay, điều này phản ánh sự dịch chuyển về cơ cấu lao động. Thay vì làm công việc máy móc đang làm, công việc gán nhãn đã và đang tạo việc làm cho rất nhiều lao động. Hiện nay, rất nhiều công ty đã được mở ra để kinh doanh dịch vụ gán nhãn dữ liệu.

Theo như thống kê, thị trường gán nhãn dữ liệu thủ công năm 2019 là 547 triệu USD, và sẽ tăng gấp hơn 4 lần vào năm 2026. Tương tự với việc gán nhãn tự động, tuy nhiên thị trường gán nhãn tự động thấp hơn thủ công do yêu cầu chủ yếu của việc gán nhãn là độ chính xác, điều này phụ thuộc vào con người. 13 Chuyển đổi số được thực hiện cho tất cả các ngành nghê, do đó việc gán nhãn dữ liệu có thể đến từ tất cả lĩnh vực như: Tài chính, Kinh tế, Nông nghiệp, Y tế, Viễn thông, Tự động hóa… Các dữ liệu gán nhãn cũng rất đa dạng, phong phú và có thể được lấy từ nhiều nguồn:  Dữ liệu văn bản  Dữ liệu hình ảnh  Dữ liệu âm thanh  Dữ liệu video  Dữ liệu có cấu trúc (HTML, XML, Excel) Đối với dữ liệu văn bản, ta có nhiều bài toán cần gán nhãn như: Tóm tắt, trích rút thực thể, phân loại văn bản. Đối với dữ liệu về ảnh, ta có các lớp bài toán như phân loại đối tượng, phát hiện đối tượng, phân vùng ảnh.

Đối với dữ liệu tiếng nói, ta có bài toán về nhận dạng tiếng nói, tổng hợp tiếng nói. Ngoài việc cung cấp hệ thống gán nhãn dữ liệu, một số doanh nghiệp còn có thể cung cấp về nhân lực con người. Ảnh 2 Một số loại dữ liệu và các bài toán gán nhãn (Lionbridge AI) Một số nhà cung cấp các công cụ, dịch vụ gán nhãn phổ biến như:  Lionbridge AI 14  Amazon Mechanical Turk  Computer Vision Annotation Tool (CVAT)  SuperAnnotate  Dataturks 1. Quy trình gán nhãn dữ liệu Ảnh 3 Quy trình gán nhãn dữ liệu Để có một hệ thống gán nhãn dữ liệu hoàn chỉnh, ta cần các thành phần sau:  Tài liệu đặc tả sử dụng phần mềm  Tài liệu hướng dẫn nhân viên gán nhãn và đánh giá dữ liệu.

Đối với các loại dữ liệu yêu cầu chuyển môn, cần có tài liệu hướng dẫn cụ thể và chi tiết.  Bộ ngữ liệu: Tập dữ liệu cần để gán nhãn.  Người gán nhãn: Nhân viên thực hiện gán nhãn dữ liệu 15  Đánh giá kết quả gán nhãn dữ liệu: Bước tự động đánh giá kết quả sử dụng mô hình đã huấn luyện sẵn.  Người kiểm tra kết quả: Nhân viên đánh giá, xem xét lại kết quả gán nhãn cuối cùng  Đóng gói và chuyển giao dữ liệu: Đóng gói dữ liệu gán nhãn và chuyển cho khách hàng.

Đây là thành phần thiết yếu cần cho một hệ thống gán nhãn dữ liệu. Tuy nhiên, tùy vào mỗi hệ thống gán nhãn và yêu cầu của bài toán gán nhãn mà ta có thể mở rộng kiến trúc hệ thống gán nhãn này để phù hợp và chi tiết hơn với việc gán nhãn và kiểm soát chất lượng gán nhãn của bài toán. Vấn đề chính trong một hệ thống gán nhãn dữ liệu. Một hệ thống gán nhãn dữ liệu thường gặp 2 vấn đề chính sau đây:  Lựa chọn dữ liệu gán nhãn: bước quan trọng nhất trong hệ thống gán nhãn.

Lựa chọn dữ liệu không những giúp giảm thiểu số lượng mẫu cần gán nhãn, giảm chi phí ngân quỹ gán nhãn mà còn giúp cải thiện chất lượng, thời gian huấn luyện mô hình.  Kiểm tra, đánh giá các dữ liệu đã gán nhãn: Đây là bước quan trọng để đảm bảo lỗi dữ liệu gán nhãn ở mức thấp nhất, tránh ảnh hưởng đến tỉ lệ lỗi của mô hình. Các phương pháp lựa chọn dữ liệu gán nhãn Luận văn tập trung vào việc lựa chọn dữ liệu gán nhãn (cụ thể cho bài toán nhận dạng tiếng nói). Bước lựa chọn dữ liệu gán nhãn là bước quan trọng đối với hầu hết các hệ thống gán nhãn.

Trong doanh nghiệp, việc lựa chọn dữ liệu gán nhãn tốt giúp giảm số lượng thời gian, ngân quỹ đáng kể cho việc làm dữ liệu mà vẫn đảm bảo độ chính xác của hệ thống. Hiện nay, có hai phương pháp chính trong việc lựa chọn dữ liệu:  Phương pháp học chủ động (Active Learning) 16  Phương pháp lựa chọn tập lõi (Core-Set Selection) Phương pháp học chủ động lựa chọn mẫu dữ liệu để gán nhãn từ một hồ dữ liệu chưa được gán nhãn, và lặp đi lặp lại quá trình lựa chọn dữ liệu và huấn luyện mô hình để được tập dữ liệu cho việc gán nhãn. Khác với phương pháp học chủ động, phương pháp lựa chọn tập lõi có thể thực hiện cho cả tập dữ liệu đã gán nhãn và chưa gán nhãn. Mục đích của phương pháp chọn tập lõi là tìm tập con nhỏ nhất có độ chính xác xấp xỉ toàn bộ tập dữ liệu.

Thuật toán thường sử dụng cho phương pháp lựa chọn tập lõi là phương pháp phân cụm k-means hoặc k-median. Sau khi lựa chọn được các tập Core-Set, ta có thể lựa chọn các mẫu theo tỉ lệ nhất định từ mỗi tập Core-Set này. Phương pháp Core-Set là phương pháp đơn giản, chủ yếu dựa vào phân cụm và khó kết hợp đối với tập dữ liệu đã gán nhãn sẵn hoặc mẫu có đặc trưng phức tạp. Ví dụ trong trường hợp nhận dạng tiếng nói, ta có thể phân cụm các mẫu trong tập dữ liệu chưa gán nhãn bằng đặc trưng âm học (MFCC), tuy nhiên sẽ không hiệu quả vì đây là đặc trưng theo thời gian.

Ta có thể thay bằng tìm tập Core-Set cho nhãn các câu được giải mã bằng máy, nhưng phụ thuộc vào độ chính xác của mô hình học và không thể kiểm tra đối với các mẫu đã gán nhãn. Phương pháp học chủ động là phương pháp tốt nhất để lựa chọn các dữ liệu quan trọng cho một hệ thống gán nhãn (hay mô hình học máy), có thể hoạt động trên nhiều bài toán và kiểu dữ liệu. Do đó, trong luận văn này, luận văn sẽ tập trung vào bài toán nhận dạng tiếng nói và việc áp dụng phương pháp học chủ động cho bài toán nhận dạng tiếng nói. Đánh giá chất lượng gán nhãn Để đánh giá chất lượng gán nhãn, ta có thể sử dụng 2 phương pháp tự động hoặc thủ công.

 Phương pháp thủ công: Cần có các nhóm người với vai trò người đánh giá. Nhóm sẽ xem xét các mẫu dữ liệu nhân viên gán nhãn và thực hiện và thực hiện đánh giá, chỉnh sửa lại. 17  Phương pháp tự động: Có nhiều phương pháp đánh giá tự động, tuy nhiên việc đánh giá tự động không đảm bảo được tính chính xác tuyệt đối. o Phương pháp 1 - Sử dụng tập dữ liệu đã gán nhãn: Đưa các dữ liệu này vào tập dữ liệu cần gán nhãn.

Kiểm tra tính chính xác của nhân viên gán nhãn bằng cách đối chiếu với nhãn thực tế. o Phương pháp 2 – So sánh chéo: So sánh nhiều mẫu được thực hiện bởi các nhân viên gán nhãn. So sánh và đối chiếu độ chính xác dựa trên các mẫu dữ liệu này. Mô hình nhận dạng tiếng nói.

Giới thiệu Bài toán nhận dạng tiếng nói là bài toán khó và gần đây rất được chú ý và nghiên cứu bởi cộng đồng. Nhưng thực tế bài toán nhận dạng tiếng nói được các nhà khoa học nghiên cứu từ rất sớm, từ đầu những năm 1950. Bài toán nhận dạng tiếng nói đi từ các bài toán đơn giản như nhận dạng từng chữ số, phát triển đến nhận dạng 26 ký tự trong bảng từ điển Tiếng Anh, và hiện nay là có thể nhận dạng được theo cả từ và câu. Quá trình phát triển của các mô hình nhận dạng tiếng nói [1].

Ảnh 4 Lịch sử phát triển của hệ thống nhận dạng tiếng nói Các mô hình nhận dạng tiếng nói cũng đi từ phương pháp thô sơ đến các phương pháp phức tạp như phương pháp học sâu đầu cuối. Các phương pháp ban đầu của nhận dạng tiếng nói chủ yếu dựa vào phương pháp phân loại đặc trưng âm thanh của các ký tự chữ hoặc số tương ứng. Đến những năm 1980, với sự phát triển của mô hình Markov ẩn (Hidden Markov Model, viết tắt HMM) là mô hình học máy dựa vào thống kê có thể xử lý dữ liệu theo chuỗi thời gian, các hệ thống nhận dạng tiếng nói trở nên phổ biến, được nghiên cứu nhiều hơn và độ chính xác được cải tiến đáng kể. Sau này, với sự phát triển 19 của mạng học sâu và phần cứng GPU, mô hình nhận dạng tiếng nói chuyển dịch dần sang mô hình lai (kết hợp HMM và mạng học sâu) từ đầu những năm 2010.

Từ năm 2013 đến nay, các mô hình học sâu đầu cuối đã bước đầu thay thế các phương pháp lai vì sự tiện lợi và dễ dàng trong việc chuẩn bị dữ liệu, huấn luyện mô hình cũng như khi triển khai thực tế. Ảnh 5 Độ chính xác của Google Voice qua các thời kỳ [2] Độ chính xác của mô hình nhận dạng học máy tăng nhanh từ khoảng từ năm 2013 trở lại đây. Hình trên cho thấy từ năm 2013, google chỉ đạt độ chính xác gần 78%, nhưng đến nay đã đạt độ chính xác tương tự con người với mức 95%. Công nghệ nhận dạng tiếng nói cũng được tìm hiểu và nghiên cứu từ đầu những năm 2014, 2015 bởi các tập đoàn lớn như Viettel, FPT, Zalo, Vingroup, … Việc triển khai hệ thống nhận dạng tiếng nói cho Tiếng Việt gặp nhiều khó khăn hơn tiếng Anh do một số nguyên nhân sau: ● Tiếng Việt có ngữ pháp đa dạng phong phú ● Tiếng Việt là ngôn ngữ từ ghép.

● Tiếng Việt có nhiều phát âm vùng miền… 20 Để phát triển một hệ thống nhận dạng tiếng nói tốt thì yêu cầu từ vài trăm giờ đến vài chục nghìn giờ dữ liệu huấn luyện.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Bài luận văn thạc sĩ với tiêu đề Luận văn thạc sĩ khoa học máy tính sử dụng active learning trong việc lựa chọn dữ liệu gán nhãn cho bài toán speech recognition của tác giả Nguyễn Minh Sơn, dưới sự hướng dẫn của PGS.TS Nguyễn Xuân Hoài, tập trung vào việc áp dụng phương pháp học chủ động (active learning) để cải thiện quá trình lựa chọn dữ liệu gán nhãn trong nhận diện giọng nói. Nghiên cứu này không chỉ mang lại cái nhìn sâu sắc về cách tối ưu hóa dữ liệu cho các mô hình học máy mà còn mở ra hướng đi mới cho việc phát triển công nghệ nhận diện giọng nói tại Việt Nam.

Để mở rộng thêm kiến thức về các ứng dụng công nghệ thông tin trong giáo dục, bạn có thể tham khảo bài viết Luận văn quản lý ứng dụng công nghệ thông tin trong dạy học ở các trường trung học cơ sở huyện hoằng hoá tỉnh thanh hoá theo hướng chuyển đổi số. Bài viết này cũng đề cập đến việc ứng dụng công nghệ trong giáo dục, một lĩnh vực có liên quan mật thiết đến khoa học máy tính.

Ngoài ra, bạn có thể tìm hiểu thêm về các kỹ thuật trong kiểm thử phần mềm qua bài viết Các kỹ thuật trong kiểm thử dòng dữ liệu tĩnh luận văn thạc sĩ kỹ thuật phần mềm. Nghiên cứu này cung cấp những kiến thức bổ ích về kiểm thử phần mềm, một phần quan trọng trong phát triển các ứng dụng công nghệ thông tin.

Những tài liệu này không chỉ giúp bạn mở rộng hiểu biết về các khía cạnh khác nhau của công nghệ thông tin mà còn cung cấp những góc nhìn đa dạng về ứng dụng của nó trong thực tiễn.