Luận văn thạc sĩ: Nghiên cứu nhận dạng tiếng nói trên cơ sở mạng nơron nhân tạo

Luận văn thạc sĩ VNU UET nghiên cứu nhận dạng tiếng nói dựa trên mạng nơron nhân tạo trong lĩnh vực kỹ thuật vô tuyến điện tử và thông tin liên lạc.

Chuyên ngành

Nhận dạng tiếng nói

Người đăng

Ẩn danh

Thể loại

Luận Văn Thạc Sỹ

2005

79
2
0

Phí lưu trữ

30 Point

Mục lục chi tiết

MỞ ĐẦU

1. CHƯƠNG 1: TỔNG QUAN VỀ TIẾNG NÓI VÀ BÀI TOÁN NHẬN DẠNG

1.1. Lịch sử phát triển của nhận dạng tiếng nói

1.2. Tổng quan về bài toán nhận dạng tiếng nói

1.3. Một số hệ thống nhận dạng tiếng nói

1.4. Tổng quan về tiếng nói

1.4.1. Âm thanh và tiếng nói

1.4.2. Cao độ của âm (pitch)

1.4.3. Cường độ (volume) và mức cường độ âm

1.4.4. Độ to của âm

1.4.5. Âm sắc (phonetics)

1.5. Mục tiêu của đề tài

2. CHƯƠNG 2: TIẾNG VIỆT VÀ TRÍCH CHỌN ĐẶC TRƯNG

2.1. Khái quát về tiếng Việt

2.2. Một số đặc điểm của tiếng Việt

2.3. Cấu trúc âm tiết trong tiếng Việt

2.4. Đơn vị cơ bản cho các hệ thống nhận dạng tiếng Việt

2.4.1. Mô hình từ và âm tiết

3. CHƯƠNG 3: TỔNG QUAN VỀ MẠNG NƠRON NHÂN TẠO

3.1. Giới thiệu về mạng nơron

3.2. Mô hình nơron sinh vật

3.3. Các mô hình mạng nơron và luật học

3.4. Các ứng dụng của mạng nơron nhân tạo

4. MẠNG LAN TRUYỀN NGƯỢC NHẬN DẠNG TIẾNG VIỆT

4.1. Phương pháp lan truyền ngược

4.2. Ứng dụng mạng lan truyền ngược cho nhận dạng tiếng Việt

4.3. Mô hình nhận dạng và phân loại mẫu

4.4. Phân tích và đánh giá các tham số của hệ thống nhận dạng

5. CHƯƠNG 5: XÂY DỰNG HỆ THỐNG NHẬN DẠNG

5.1. Kiến trúc hệ thống

5.2. Giao diện chương trình và cách sử dụng

5.3. Kết quả thực nghiệm

5.4. Môi trường phát triển chương trình

Kết luận và định hướng nghiên cứu

Tài liệu tham khảo

Tóm tắt

I. Tổng quan về nghiên cứu nhận dạng tiếng nói bằng mạng nơron nhân tạo

Nghiên cứu về nhận dạng tiếng nói đã trở thành một lĩnh vực quan trọng trong công nghệ thông tin và trí tuệ nhân tạo. Việc áp dụng mạng nơron nhân tạo vào lĩnh vực này đã mở ra nhiều cơ hội mới cho việc phát triển các hệ thống nhận dạng tiếng nói chính xác và hiệu quả hơn. Mạng nơron có khả năng học hỏi từ dữ liệu lớn, giúp cải thiện độ chính xác trong việc nhận diện âm thanh và ngữ nghĩa của lời nói.

1.1. Lịch sử phát triển của nhận dạng tiếng nói

Nhận dạng tiếng nói đã trải qua nhiều giai đoạn phát triển từ những năm 1950. Các hệ thống đầu tiên chỉ có khả năng nhận diện từ đơn âm và phụ thuộc vào người nói. Tuy nhiên, với sự phát triển của công nghệ và học sâu, các hệ thống hiện nay có thể nhận diện được nhiều từ và câu phức tạp hơn.

1.2. Tổng quan về bài toán nhận dạng tiếng nói

Bài toán nhận dạng tiếng nói liên quan đến việc chuyển đổi tín hiệu âm thanh thành văn bản. Quá trình này bao gồm nhiều bước như thu âm, xử lý tín hiệu, và nhận diện từ. Các yếu tố như tốc độ nói, ngữ điệu và môi trường xung quanh đều ảnh hưởng đến độ chính xác của hệ thống.

II. Thách thức trong nghiên cứu nhận dạng tiếng nói tiếng Việt

Việt Nam có những đặc thù riêng về ngôn ngữ, điều này tạo ra nhiều thách thức trong việc phát triển hệ thống nhận dạng tiếng nói. Các yếu tố như thanh điệu, âm tiết và ngữ nghĩa phức tạp của tiếng Việt làm cho việc áp dụng các phương pháp nhận dạng tiếng nói trở nên khó khăn hơn.

2.1. Đặc điểm ngôn ngữ tiếng Việt

Tiếng Việt là ngôn ngữ đơn lập với nhiều thanh điệu khác nhau. Mỗi âm tiết có thể mang nhiều nghĩa khác nhau tùy thuộc vào thanh điệu, điều này làm cho việc nhận diện từ trở nên phức tạp hơn so với các ngôn ngữ khác.

2.2. Các yếu tố ảnh hưởng đến độ chính xác

Các yếu tố như nhiễu từ môi trường, chất lượng thiết bị thu âm và sự khác biệt trong cách phát âm giữa các vùng miền cũng ảnh hưởng lớn đến hiệu quả của hệ thống nhận dạng tiếng nói.

III. Phương pháp sử dụng mạng nơron trong nhận dạng tiếng nói

Mạng nơron nhân tạo đã được chứng minh là một công cụ mạnh mẽ trong việc giải quyết bài toán nhận dạng tiếng nói. Các phương pháp như học sâumạng nơron tích chập đã được áp dụng để cải thiện độ chính xác và khả năng nhận diện của hệ thống.

3.1. Mô hình mạng nơron lan truyền ngược

Mô hình mạng nơron lan truyền ngược là một trong những phương pháp phổ biến nhất trong nhận dạng tiếng nói. Nó cho phép hệ thống học hỏi từ dữ liệu huấn luyện và cải thiện khả năng nhận diện theo thời gian.

3.2. Kỹ thuật trích chọn đặc trưng tín hiệu

Kỹ thuật trích chọn đặc trưng như MFCC (Mel-Frequency Cepstral Coefficients) giúp hệ thống nhận diện các đặc trưng quan trọng của tín hiệu âm thanh, từ đó cải thiện độ chính xác trong việc nhận diện từ và câu.

IV. Ứng dụng thực tiễn của nhận dạng tiếng nói

Hệ thống nhận dạng tiếng nói có nhiều ứng dụng thực tiễn trong đời sống hàng ngày. Từ việc điều khiển thiết bị thông qua giọng nói đến việc chuyển đổi lời nói thành văn bản, các ứng dụng này đang ngày càng trở nên phổ biến.

4.1. Ứng dụng trong công nghệ thông tin

Trong lĩnh vực công nghệ thông tin, nhận dạng tiếng nói được sử dụng để phát triển các ứng dụng như trợ lý ảo, hệ thống tìm kiếm bằng giọng nói và nhiều ứng dụng khác.

4.2. Ứng dụng trong giáo dục

Nhận dạng tiếng nói cũng có thể được áp dụng trong giáo dục, giúp học sinh học ngôn ngữ mới thông qua việc phát âm và nhận diện từ.

V. Kết luận và tương lai của nghiên cứu nhận dạng tiếng nói

Nghiên cứu về nhận dạng tiếng nói bằng mạng nơron nhân tạo đang trên đà phát triển mạnh mẽ. Với sự tiến bộ của công nghệ, các hệ thống này hứa hẹn sẽ ngày càng chính xác và hiệu quả hơn trong tương lai.

5.1. Tương lai của công nghệ nhận dạng tiếng nói

Công nghệ nhận dạng tiếng nói sẽ tiếp tục phát triển với sự hỗ trợ của các kỹ thuật mới trong trí tuệ nhân tạo, mở ra nhiều cơ hội mới cho các ứng dụng trong đời sống.

5.2. Định hướng nghiên cứu tiếp theo

Các nghiên cứu tiếp theo cần tập trung vào việc cải thiện độ chính xác của hệ thống nhận dạng tiếng nói tiếng Việt, đồng thời mở rộng ứng dụng của công nghệ này trong nhiều lĩnh vực khác nhau.

22/07/2025
Luận văn thạc sĩ vnu uet nhận dạng tiếng nói trên cơ sở mạng nơron nhân tạo luận văn ths kỹ thuật vô tuyến điện tử và thông tin liên lạc 2 07 00

Trích đoạn nội dung tài liệu

MỞ ĐẦU Nhận dạng tiếng nói là mong ước của khoa học và con người. Những người máy có thể hiểu được tiếng người nói và thực thi nhiệm vụ. Hiện nay, nhận dạng tiếng nói chưa thực sự đáp ứng đầy đủ các yêu cầu thực tế, song những hệ thống nhận dạng tiếng nói đã có bước phát triển đáng kể. Trên thế giới, một số hệ thống nhận dạng tiếng nói cỡ lớn có độ chính xác tương đối cao.

Các hệ thống này chủ yếu được phát triển trên nền công nghệ hiện đại với những máy tính lớn, những vi mạch xử lý tiếng nói chuyên dụng và sử dụng cơ sở dữ liệu tiếng nói khá hoàn chỉnh, nhưng phần lớn vẫn là xử lý cho tiếng Anh. Ở Việt Nam, việc tìm hiểu, nghiên cứu và phát triển các hệ thống nhận dạng tiếng nói còn đang bước đầu có kết quả. Do có những đặc thù riêng của tiếng Việt, nên việc chọn lựa phương pháp tiếp cận bài toán nhận dạng phù hợp với tiếng Việt là một vấn đề tương đối khó khăn. Những năm gần đây, cũng có khá nhiều đề tài nghiên cứu về nhận dạng tiếng nói tiếng Việt.

Các hệ thống nhận dạng tiếng nói thành công nhất chủ yếu dựa trên khuynh hướng nhận dạng mẫu. Các kỹ thuật nhận dạng mẫu đơn giản như lượng tử hoá véctơ, hiệu chỉnh thời gian động…, đã được áp dụng khá thành công vào các chương trình nhận dạng tiếng nói tiếng Việt phát âm rời rạc với số lượng từ vựng hạn chế. Tuy nhiên, mục tiêu của nhận dạng tiếng nói tự động bằng máy là phải tiến tới hệ thống nhận dạng tiếng nói liên tục, kích thước từ điển lớn, không phụ thuộc vào người nói. Vì vậy, các hệ thống nhận dạng tiếng nói hiện nay thường xây dựng trên cơ sở áp dụng các kỹ thuật nhận dạng mẫu phức tạp hơn, đó là mô hình Markov ẩn và mạng nơron nhân tạo đã cho một số thành công nhất định.

Xuất phát từ nhận thức trên, đề tài luận văn Thạc sỹ của em là tìm hiểu, đưa ra phương pháp và xây dựng một ứng dụng nhận dạng tiếng nói tiếng Việt. Với những khả năng của mạng nơron nhân tạo trong ứng dụng, đã cho nhiều thành công đáng Nhận dạng tiếng nói trên cơ sở mạng nơron nhân tạo LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 2 khích lệ. Vì vậy, em đã chọn mạng nơron làm cơ sở cho việc nghiên cứu nhận dạng tiếng nói tiếng Việt. Nội dung luận văn gồm 5 chương như sau:  Chƣơng 1: Tìm hiểu lịch sử việc nghiên cứu nhận dạng tiếng nói, tổng quan về tiếng nói và nhận dạng tiếng nói.

 Chƣơng 2: Trình bày một số tính chất của tiếng nói như: cơ chế tạo ra tiếng nói, cơ chế thu tiếng nói, các đặc trưng tiếng nói. Ngoài ra, chương này cũng đề cập đến kỹ thuật tính hệ số MFCC, là một phương pháp trích chọn đặc trưng tín hiệu tiếng nói khá phổ biến đã được áp dụng hiệu quả trong các hệ thống nhận dạng.  Chƣơng 3: Tìm hiểu tổng quan về mạng nơron, những khái niệm, cấu trúc, các luật học. Chương này cũng đề cập đến những ứng dụng của mạng nơron trong nhận dạng và phân lớp.

 Chƣơng 4: Nghiên cứu về mạng nơron lan truyền ngược gồm: cấu trúc, phương pháp huấn luyện mạng. Chương này cũng đề cập đến cấu trúc cụ thể của mạng áp dụng cho bài toán nhận dạng tiếng nói tiếng Việt và đồng thời đánh giá các tham số của hệ thống nhận dạng.  Chƣơng 5: Xây dựng hệ thống nhận dạng, giao diện chương trình, các kết quả thực nghiệm. Cuối cùng là kết luận và định hƣớng phát triển của đề tài.

Nhận dạng tiếng nói trên cơ sở mạng nơron nhân tạo LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 3 CHƢƠNG 1 TỔNG QUAN VỀ TIẾNG NÓI VÀ BÀI TOÁN NHẬN DẠNG 1.1 Lịch sử phát triển của nhận dạng tiếng nói Nhận dạng tiếng nói tự động đã phát triển khoảng 40 năm nay. Những nhân tố quan trọng giúp cho sự phát triển của công nghệ nhận dạng này có thể kể đến như sự phát triển của hệ thống phân tích phổ âm thanh (năm 1946) cho phép thể hiện trực quan các tín hiệu âm, lý thuyết tạo âm thanh tiếng nói của người (năm 1948), sự xuất hiện và phát triển mạnh mẽ của các hệ thống máy tính số thương mại đầu tiên trên thế giới (năm 1958). Các hệ thống nhận dạng đầu tiên có khả năng nhận dạng từ rời rạc và phụ thuộc người nói. Để phân tích và nhận dạng các chữ số hoặc các từ đơn âm sử dụng đặc tính trong miền thời gian và các ngân hàng bộ lọc tương tự.

Tương tự như vậy, với phương pháp âm học, hệ thống nhận dạng âm vị phụ thuộc người nói và không phụ thuộc người nói được thiết kế mặc dù mới cho được kết quả rất khiêm tốn. Trong thập kỷ 70, với sự phát triển của các thuật toán phân tích tín hiệu như mô hình dự đoán tuyến tính, so sánh mẫu theo thời gian…công nghệ nhận dạng tiếng nói tiếp tục có những bước phát triển mạnh mẽ. Với các phương pháp này những hệ thống nhận dạng với số lượng từ khá lớn được thiết kế. Trong những năm 60 của thế kỷ 20, nhiều phòng thí nghiệm của nhiều hãng lớn đã được đầu tư nghiên cứu phát triển các hệ thống nhận dạng tiếng nói các ngôn ngữ khác nhau.

Đến đầu những năm 80, khả năng về kỹ thuật đã cho phép các nhà nghiên cứu xây dựng các hệ thống nhận dạng được hàng trăm từ rời rạc. Gần đây công nghệ nhận dạng đã có những bước phát triển vô cùng nhanh chóng.2 Tổng quan về bài toán nhận dạng tiếng nói Nhận dạng tiếng nói là làm cho máy hiểu, nhận biết được ngữ nghĩa của lời nói. Đây là quá trình biến đổi tín hiệu âm thanh thu được qua micro, qua các thiết bị Nhận dạng tiếng nói trên cơ sở mạng nơron nhân tạo LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 4 thu thanh khác… thành một chuổi các từ, sau đó được nhận dạng để sử dụng trong các ứng dụng điều khiển thiết bị, nhập dữ liệu hoặc soạn thảo văn bản bằng lời… hoặc đưa đến một quá trình xử lý ngôn ngữ ở mức cao hơn. Tiếng nói là công cụ truyền đạt thông tin quan trọng của người.

Bình thường, chúng ta không để ý quá trình nhận dạng tiếng nói diễn ra như thế nào? tại sao chúng ta hiểu được các từ, các câu một cách đơn giản như vậy? Trên thực tế, quá trình nhận dạng tiếng nói của người là một quá trình phức tạp. Hiện nay, các nhà nghiên cứu cố gắng tìm hiểu, phân tích và mô phỏng quá trình nhận dạng tiếng nói của người dưới dạng các chương trình máy tính. Nhưng đây là vấn đề rất rộng, có liên quan tới nhiều ngành nghiên cứu như sinh học, hoá học, vật lý. Do vậy, việc mô phỏng tiếng nói cũng gặp nhiều khó khăn.

Chúng ta có thể thấy được một cách trực quan bài toán nhận dạng tiếng nói qua hình 1.1 Mô hình nhận dạng tiếng nói Nhận dạng tiếng nói là quá trình phức tạp bao gồm nhiều khâu biến đổi. Tín hiệu mà người phát ra là tín hiệu tuơng tự, qua quá trình lấy mẫu, lượng tử hoá và mã hoá để thu được các mẫu tín hiệu dạng số (tín hiệu mà máy tính có thể hiểu và xử lý được). Các mẫu tín hiệu này được trích chọn đặc trưng. Những đặc trưng này sẽ là đầu vào cho quá trình nhận dạng.

Sau khi nhận dạng tín hiệu người dùng phát âm, hệ thống sẽ đưa ra kết quả nhận dạng. Tuỳ thuộc vào mô hình ứng dụng mà cho chúng ta các dạng đầu ra khác nhau. Nhận dạng tiếng nói trên cơ sở mạng nơron nhân tạo LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 5 Do tính chất của tiếng nói phụ thuộc vào nhiều yếu tố nên việc thu nhận, phân tích các đặc trưng của tiếng nói là việc không dễ. Ở đây, chúng ta có thể nêu ra một số yếu tố khó khăn cho bài toán nhận dạng tiếng nói:  Khi phát âm, người nói thường nói nhanh, chậm khác nhau.

 Các từ được nói thường dài ngắn khác nhau.  Một người cùng nói một từ, nhưng ở hai lần phát âm khác nhau. Kết quả phân tích khác nhau.  Mỗi người có một chất giọng riêng được thể hiện thông qua độ cao, độ to, cường độ của âm và âm sắc.

 Những yếu tố như nhiễu của môi trường, nhiễu của thiết bị thu…ảnh hưởng không nhỏ tới hiệu quả nhận dạng. Có thể thấy nhận dạng tiếng nói là một lĩnh vực nghiên cứu có nhiều ứng dụng trong thực tế. Các hệ thống nhận dạng góp phần rất lớn trong việc thúc đẩy phát triển nhiều ngành. Tuy là lĩnh vực mang ý nghĩa to lớn đó, nhưng việc phát triển các hệ thống nhận dạng cũng gặp không ít những khó khăn, nhất là ở Việt Nam khi các kết quả nghiên cứu về nhận dạng tiếng Việt chưa nhiều, cũng như cơ sở hạ tầng cho việc nghiên cứu còn ít.3 Một số hệ thống nhận dạng tiếng nói Nhận dạng tiếng nói là vấn đề đã được chia thành hai nhóm riêng biệt dựa trên mục đích sử dụng khác nhau.

 Một nhóm được sử dụng với mục đích điều khiển thiết bị thông qua giọng nói.  Một nhóm sử dụng nhằm xử lý từ tiếng nói sang văn bản. Phân loại các hệ thống nhận dạng tiếng nói sẽ giúp chúng ta có một cái nhìn trực quan hơn về bài toán. Các hệ thống nhận dạng được phân loại như hình vẽ 1.

Có 3 phương pháp phổ biến được sử dụng trong nhận dạng tiếng nói [10]:  Phương pháp âm học - ngữ âm học. Nhận dạng tiếng nói trên cơ sở mạng nơron nhân tạo LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 6  Phương pháp nhận dạng mẫu.  Phương pháp sử dụng các kết quả của lĩnh vực trí tuệ nhân tạo.2 Sơ đồ phân loại các hệ thống nhận dạng tiếng nói 1.4 Tổng quan về tiếng nói 1.1 Âm thanh và tiếng nói Âm thanh thực chất là sự nén và dản một cách tuần hoàn không khí, tạo ra một sóng đàn hồi dọc. Sóng trong không khí truyền đến tai, tác động vào màng nhĩ, làm cho màng nhĩ dao động với cùng tần số (dao động cưỡng bức), có khả năng tạo ra cảm giác âm thanh trong tai khi tần số sóng đạt tới một độ lớn nhất định.

Tai người chỉ có thể cảm nhận được âm thanh trong một khoảng tần số từ 20Hz đến 20000Hz. Những sóng này gọi là sóng âm hay âm thanh. Tiếng nói là âm thanh do người phát ra.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ