Luận văn thạc sĩ các thuật toán phân lớp dữ liệu và ứng dụng xây dựng hệ thống hỏi đáp tự động về một số bệnh thường gặp

Luận văn thạc sĩ kỹ thuật nghiên cứu các thuật toán phân lớp dữ liệu và ứng dụng xây dựng hệ thống hỏi đáp tự động về một số bệnh thường, khảo sát thực trạng, phân tích nguyên

Chuyên ngành

Khoa học máy tính

Người đăng

Ẩn danh

Thể loại

luận văn thạc sĩ

2015

77
1
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI CAM ĐOAN

LỜI CẢM ƠN

DANH MỤC CÁC CHỮ VIẾT TẮT

DANH MỤC BẢNG BIỂU

DANH MỤC CÁC HÌNH

MỞ ĐẦU

Đối tượng và phạm vi nghiên cứu

Phương pháp nghiên cứu

Hướng nghiên cứu của đề tài

Bố cục luận văn

Ý nghĩa khoa học của đề tài

1. CHƯƠNG 1: GIỚI THIỆU VỀ HỆ THỐNG HỎI ĐÁP

1.1. Hệ thống hỏi – đáp tự động

1.1.1. Phân loại các hệ thống hỏi đáp tự động

1.1.1.1. Phân loại theo miền ứng dụng
1.1.1.2. Phân loại theo khả năng trả lời câu hỏi
1.1.1.3. Phân loại theo hướng tiếp cận

1.2. Cơ sở tri thức và máy suy diễn

1.2.1. Cơ sở tri thức

1.2.1.1. Khái niệm hệ cơ sở tri thức
1.2.1.2. Hệ phân loại tri thức
1.2.1.3. Các phương pháp biểu diễn tri thức

1.3. Kiến trúc hệ thống hỏi – đáp

1.3.1. Giao diện người dùng

1.3.2. Phân tích câu hỏi

1.3.3. Tìm kiếm dữ liệu

1.3.4. Rút trích câu trả lời

1.3.5. Xác minh câu trả lời

1.4. Kết chương 1

2. CHƯƠNG 2: KỸ THUẬT PHÂN LỚP DỮ LIỆU TRONG KHAI PHÁ DỮ LIỆU

2.1. Khai phá dữ liệu và phát hiện tri thức

2.1.1. Khai phá luật kết hợp

2.1.2. Phân lớp, phân cụm dữ liệu

2.1.3. Cây quyết định

2.2. Các thuật toán phân lớp dữ liệu phổ biến

2.2.1. Thuật toán cây quyết định ID3

2.2.2. Thuật toán SVM

2.2.3. Thuật toán phân lớp K người láng giềng gần nhất

2.3. Các vấn đề liên quan đến phân lớp dữ liệu

2.3.1. Chuẩn bị dữ liệu cho việc phân lớp

2.3.2. So sánh các mô hình phân lớp

2.3.3. Các phương pháp đánh giá độ chính xác của mô hình phân lớp

2.4. Kết chương 2

3. CHƯƠNG 3: XÂY DỰNG HỆ THỐNG HỎI ĐÁP TỰ ĐỘNG VỀ MỘT SỐ BỆNH THƯỜNG GẶP

3.1. Các loại bệnh thường gặp

3.2. Xây dựng cơ sở luật (KB)

3.3. Xây dựng cơ chế suy diễn để khai thác, tìm câu trả lời

3.4. Thiết kế hệ thống hỏi đáp

3.5. Cài đặt thử nghiệm hệ thống hỏi đáp

3.5.1. Môi trường phát triển hệ thống

3.5.2. Cấu trúc các thành phần để triển khai hệ thống

3.5.3. Cài đặt chương trình

3.5.4. Thử nghiệm hệ thống

3.5.4.1. Chức năng khai phá dữ liệu
3.5.4.2. Giao diện chẩn đoán bệnh
3.5.4.3. Danh mục các triệu chứng bệnh thông thường

KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN

DANH MỤC TÀI LIỆU THAM KHẢO

Tóm tắt

I. Thuật toán phân lớp dữ liệu

Thuật toán phân lớp dữ liệu là một trong những kỹ thuật cốt lõi trong lĩnh vực machine learningphân tích dữ liệu. Các thuật toán này được sử dụng để phân loại dữ liệu thành các nhóm dựa trên các đặc điểm cụ thể. Trong luận văn, các thuật toán như cây quyết định ID3, SVM, và K người láng giềng gần nhất được nghiên cứu và áp dụng để phân loại các bệnh thường gặp. Các thuật toán này giúp xác định các triệu chứng và đưa ra chẩn đoán tự động, hỗ trợ việc xây dựng hệ thống hỏi đáp tự động.

1.1. Cây quyết định ID3

Cây quyết định ID3 là một thuật toán phân lớp dữ liệu dựa trên nguyên lý quy nạp. Nó sử dụng các thuộc tính của dữ liệu để xây dựng cây quyết định, từ đó phân loại dữ liệu thành các nhóm. Trong luận văn, thuật toán này được áp dụng để phân loại các bệnh thường gặp dựa trên các triệu chứng. Cây quyết định giúp hệ thống đưa ra chẩn đoán chính xác và nhanh chóng.

1.2. Thuật toán SVM

Thuật toán SVM (Support Vector Machine) là một phương pháp phân lớp dữ liệu dựa trên việc tìm siêu phẳng tối ưu để phân chia dữ liệu thành các lớp. SVM được sử dụng để phân loại các bệnh thường gặp với độ chính xác cao. Thuật toán này đặc biệt hiệu quả khi làm việc với dữ liệu có số chiều lớn, giúp hệ thống hỏi đáp tự động đưa ra kết quả chẩn đoán chính xác.

II. Hệ thống hỏi đáp tự động

Hệ thống hỏi đáp tự động là một ứng dụng của AI trong y tế, giúp người dùng nhận được câu trả lời tự động dựa trên các câu hỏi được đưa ra. Hệ thống này bao gồm các bước chính như phân tích câu hỏi, tìm kiếm dữ liệu, và rút trích câu trả lời. Trong luận văn, hệ thống hỏi đáp tự động được xây dựng để hỗ trợ chẩn đoán các bệnh thường gặp, giúp người dùng nhận được lời khuyên hữu ích về phòng và điều trị bệnh.

2.1. Phân tích câu hỏi

Phân tích câu hỏi là bước đầu tiên trong quy trình hoạt động của hệ thống hỏi đáp tự động. Bước này giúp xác định loại câu hỏi và các thông tin cần thiết để tìm kiếm câu trả lời. Trong luận văn, các kỹ thuật phân tích cú pháp và ngữ nghĩa được sử dụng để xử lý các câu hỏi về bệnh thường gặp, đảm bảo hệ thống đưa ra câu trả lời chính xác.

2.2. Rút trích câu trả lời

Rút trích câu trả lời là bước cuối cùng trong quy trình hoạt động của hệ thống hỏi đáp tự động. Bước này sử dụng các kỹ thuật xử lý ngôn ngữ tự nhiên để trích xuất câu trả lời từ các tài liệu liên quan. Trong luận văn, các phương pháp như so khớp mẫu và nhận dạng thực thể được áp dụng để đảm bảo câu trả lời chính xác và phù hợp với câu hỏi của người dùng.

III. Ứng dụng AI trong y tế

Ứng dụng AI trong y tế đang ngày càng phổ biến, đặc biệt trong việc xây dựng các hệ thống hỗ trợ chẩn đoán và điều trị bệnh. Trong luận văn, các kỹ thuật machine learningphân loại dữ liệu được áp dụng để xây dựng hệ thống hỏi đáp tự động về các bệnh thường gặp. Hệ thống này giúp người dùng nhận được chẩn đoán và lời khuyên điều trị nhanh chóng, góp phần nâng cao chất lượng chăm sóc sức khỏe.

3.1. Chẩn đoán tự động

Chẩn đoán tự động là một trong những ứng dụng quan trọng của AI trong y tế. Trong luận văn, hệ thống hỏi đáp tự động được xây dựng để chẩn đoán các bệnh thường gặp dựa trên các triệu chứng được cung cấp. Các thuật toán phân lớp dữ liệu giúp hệ thống đưa ra chẩn đoán chính xác và nhanh chóng, hỗ trợ người dùng trong việc phát hiện và điều trị bệnh.

3.2. Hệ thống hỗ trợ y tế

Hệ thống hỗ trợ y tế là một ứng dụng của AI trong việc cải thiện chất lượng chăm sóc sức khỏe. Trong luận văn, hệ thống hỏi đáp tự động được xây dựng để cung cấp thông tin và lời khuyên về các bệnh thường gặp. Hệ thống này giúp người dùng tiếp cận thông tin y tế một cách dễ dàng và nhanh chóng, góp phần nâng cao hiệu quả chăm sóc sức khỏe cộng đồng.

Tóm tắt và mô tả trên trang này được tạo với sự hỗ trợ của AI. Nếu bạn thấy nội dung không chính xác hoặc có vấn đề, vui lòng Báo lỗi nội dung.

01/03/2025
Luận văn thạc sĩ các thuật toán phân lớp dữ liệu và ứng dụng xây dựng hệ thống hỏi đáp tự động về một số bệnh thường gặp

Trích đoạn nội dung tài liệu

Chương 1. Giới thiệu về hệ thống hỏi đáp 1. Hệ thống hỏi – đáp tự động Hệ thống hỏi đáp tự động là một hệ thống tự động trả lời câu hỏi của người dùng dựa trên quá trình tự động nhận diện, phân tích câu hỏi, trên cơ sở kết quả phân tích dữ liệu, hệ thống sẽ tìm kiếm các nội dung có liên quan đến câu hỏi và cuối cùng, hệ thống xử lý các nội dung này để trích chọn câu trả lời. Nghiên cứu về hệ thống hỏi đáp tự động hiện đang thu hút sự quan tâm của rất nhiều các nhà nghiên cứu từ các trường đại học, các viện nghiên cứu và cả các doanh nghiệp lớn trong ngành công nghệ thông tin, có ý nghĩa khoa học lẫn ý nghĩa thực tế.

Một hệ thống hỏi đáp tự động (QA) thường gồm 3 bước chung như sau [7]:  Phân tích câu hỏi (Question Analysis).  Tìm kiếm tài liệu (Document Retrieval).  Lựa chọn câu trả lời (Answer Extraction). Phân tích câu hỏi: Phân tích câu hỏi là pha đầu tiên trong kiến trúc chung của một hệ thống hỏi đáp, có nhiệm vụ tìm ra các thông tin cần thiết làm đầu vào cho quá trình xử lý của các pha sau (trích chọn tài liệu, trích xuất câu trả lời, v.

Vì vậy,việc phân tích câu hỏi có vai trò hết sức quan trọng, ảnh hưởng trực tiếp đến hoạt động của toàn bộ hệ thống. Nếu phân tích câu hỏi không tốt thì sẽ ảnh hưởng lớn đến chất lượng, sự thỏa mãn của người dùng về câu trả lời của hệ thống. Nếu các câu hỏi là độc lập lẫn nhau người ta thường dùng các kỹ thuật phân tích cú pháp và phân loại, giới hạn câu hỏi để xác định loại câu trả lời tương ứng. Tuy nhiên, trên thực tế, người sử dụng đặt các câu hỏi thường liên quan với nhau Số hóa bởi Trung tâm Học liệu – ĐHTN http://www.

Trong trường hợp này, tri thức, phạm vi của câu hỏi trước đó cần được lưu trữ và xử lý; hay nói cách khác các câu hỏi trước đó là cơ sở cho việc xử lý và lựa chọn câu trả lời phù hợp với câu hỏi đang hỏi. Vai trò của quá trình phân tích câu - Tạo ra các câu truy vấn thông tin làm cơ sở đáp ứng cho quá trình tìm kiếm tài liệu liên quan. - Xác định, phân loại câu hỏi giúp cho quá trình lựa chọn câu trả lời xác định đúng loại câu trả lời phù hợp. Tìm kiếm nguồn tài liệu liên quan Vai trò chính của thành phần tìm kiếm tài liệu liên quan là rút trích ra một tập con từ tập tài liệu cha.

Tập tài liệu con này sẽ làm đầu vào cho bộ lựa chọn câu trả lời. Vấn đề chính ở đây là mô hình nào là phù hợp với khối lượng và cấu trúc của văn bản rút trích. Nhiều hướng tiếp cận sử dụng cơ chế sắp xếp các tài liệu đang được rất nhiều nghiên cứu quan tâm và cải tiến [8]. Với hướng tiếp cận này, kết quả trả về là một tập các tài liệu được sắp xếp giảm dần độ liên quan của chúng với câu hỏi đã cho.

Để đánh giá kết quả tìm kiếm, hai thông số được sử dụng là độ chính xác và độ bao phủ. Gaizauskas [7] đã đưa ra nhận định: nếu tăng số lượng các tài liệu tìm kiếm được; tức là làm tăng độ bao phủ nhưng lại làm giảm độ chính xác của quá trình lựa chọn câu trả lời. Vì thế, trong quá trình tìm kiếm cần phải cân đối hai thông số này. Ngoài ra, hướng tiếp cận sử dụng mô hình logic để biểu diễn và rút trích tài liệu cho kết quả tìm kiếm rất khó để đánh giá mức độ liên quan với câu trả lời vì nó xem các thuật ngữ là tách biệt, không có quan hệ với nhau về mặt ngữ nghĩa.

Tài liệu đầu vào của bộ lựa chọn câu trả lời có thể tồn tại ở nhiều cấu trúc khác nhau. Đối với hệ thống hoạt động tốt với số lượng văn bản nhỏ, nếu sử dụng tất cả nội dung của kết quả tìm kiếm thì rõ ràng không phù hợp và có thể cho kết quả không tốt mà lại mất nhiều thời gian xử lý hơn là trả về các đoạn ngắn của tài Số hóa bởi Trung tâm Học liệu – ĐHTN http://www.vn 6 liệu có liên quan [8]. Vì thế, nhiều bài báo đã nghiên cứu việc ngắt đoạn văn bản từ một tài liệu nguyên bản với mục đích có thể nâng cao độ bao phủ mà vẫn giữ được số lượng kết quả tìm kiếm ở mức nhỏ nhất, [5], [6] đề xuất cách thức chọn các đoạn trong tài liệu và sắp xếp chúng; trong khi [4] không dựa trên kích thước cố định của đoạn văn và chỉ chọn đoạn có kích thước nhỏ nhất có chứa các từ khóa của câu hỏi. Lựa chọn câu trả lời: Đầu vào của quá trình này bao gồm hai thành phần:  Tập các tài liệu có liên quan chứa câu trả lời ứng viên.

 Loại câu trả lời mong đợi được trả về trong quá trình phân tích câu hỏi. Dựa trên các tài liệu đầu vào, quá trình lựa chọn câu trả lời sẽ thực hiện các xử lý như: tách câu, gán nhãn, nhận diện tên riêng, v. Việc lựa chọn các kỹ thuật và sự kết hợp các kỹ thuật tùy thuộc vào hướng tiếp cận và phương thức xử lý của từng hệ thống hỏi đáp cụ thể. Hướng tiếp cận sử dụng các mẫu để lựa chọn câu trả lời được rất nhiều bài báo đề xuất [6].

Theo đó, quá trình lựa chọn câu trả lời thường không đi sâu vào xử lý tài liệu mà chỉ so khớp mẫu. Phân loại các hệ thống hỏi đáp tự động Có nhiều cách phân loại hệ thống hỏi đáp dựa trên các tiêu chí khác nhau như: phân loại theo miền ứng dụng, theo việc xử lý trên tài liệu rút trích nhiều hơn; vì thế tốn nhiều thời gian hơn. Phân loại theo miền ứng dụng Hệ thống hỏi đáp miền mở (open domain Question answering): Hệ thống trả lời bất kỳ câu hỏi nào được đưa vào. Khó khăn cho hệ thống miền mở đó chính là việc xây dựng các tri thức nên cho việc trả lời cũng như phân tích câu hỏi, các phương pháp hiện nay thường sử dụng một số các bản thể khái quát hay các mạng Số hóa bởi Trung tâm Học liệu – ĐHTN http://www.vn 7 tri thức như: wikipedia, bách khoa từ điển, v.

Tuy nhiên, dữ liệu cho việc trích rút câu trả lời là phong phú, dễ thu thập. Hệ thống hỏi đáp miền đóng (close domain Question answering): Hệ thống tập trung vào trả lời các câu hỏi liên quan đến một miền cụ thể (giáo dục, y tế, thể thao, v. Xây dựng hệ thống hỏi đáp miền đóng được coi là bài toán dễ hơn so với xây dựng hệ thống hỏi đáp miền mở vì có thể sử dụng các tri thức miền (thường là ontology của miền cụ thể). Hệ thống hỏi đáp Miền đóng Miền mở Dữ liệu có cấu trúc Dữ liệu phi cấu trúc (Text) Web Tập dữ liệu lớn Một văn bản đơn Hình 1.

Xu hướng trong nghiên cứu về Q&A Các nghiên cứu hiện nay về Q&A đang tập trung vào xây dựng hệ thống hỏi đáp trên miền mở, sử dụng nguồn dữ liệu phi cấu trúc (kho văn bản lớn hay dữ liệu web) để tìm câu trả lời. Các nghiên cứu mới và cải tiến những phương pháp cũ để có thể áp dụng cho nguồn dữ liệu web vốn đa dạng, nhiều “nhiễu” và trùng lặp đang rất được quan tâm (Hình 1. Phân loại theo khả năng trả lời câu hỏi Hệ thống có khả năng trả lời các câu hỏi liên quan đến sự vật, hiện tượng,v.v dựa trên việc trích ra câu trả lời có sẵn trong tập tài liệu. Câu trả lời là Số hóa bởi Trung tâm Học liệu – ĐHTN http://www.vn 8 các chuỗi ký tự trong một tài liệu.

Kỹ thuật chính được sử dụng là xử lý chuỗi và từ khóa. Hệ thống có cơ chế lập luận đơn giản: Trích xuất các câu trả lời có sẵn trong tập tài liệu sau đó sử dụng các suy luận để tìm mối liên kết giữa câu trả lời và câu hỏi. Hệ thống sử dụng các nguồn tri thức như bản thể về từng miền cụ thể và bản thể chung. Hệ thống trả lời các câu hỏi yêu cầu khả năng tổng hợp: Các phần của câu trả lời được trích rút từ nhiều tài liệu sau đó được tổng hợp lại thành câu trả lời hoàn chỉnh.

Câu hỏi thường là về danh sách, về cách thức, nguyên nhân, v. Hệ thống có khả năng giao tiếp với người dùng: Trả lời chuỗi các câu hỏi của người dùng về cùng một vấn đề. Ví dụ các câu hỏi của người dùng như: “Giáo sư A sinh năm nào? Ở đâu? Ông ấy đang công tác ở đâu?”. Hệ thống có khả năng lập luận tương tự: Có thể trả lời các câu hỏi có tính chất suy đoán, câu trả lời ẩn trong tập tài liệu.

Hệ thống cần trích ra các luận chứng và sử dụng lập luận tương tự để tìm ra câu trả lời. Phân loại theo hướng tiếp cận Hướng tiếp cận nông: Nhiều phương pháp sử dụng trong Q&A dùng các kĩ thuật dựa trên từ khóa để định vị các câu, đọan văn có khả năng chứa câu trả lời từ các văn bản được trích chọn về. Sau đó giữ lại các câu, đoạn văn có chứa chuỗi ký tự cùng loại với loại câu trả lời mong muốn (ví dụ các câu hỏi về tên người, địa danh, số lượng, v. Hướng tiếp cận sâu: Trong những trường hợp khi mà hướng tiếp cận bề mặt không thể tìm ra câu trả lời, những quá trình xử lý về ngữ pháp, ngữ nghĩa và ngữ cảnh là cần thiết để trích xuất hoặc tạo ra câu trả lời.

Các kĩ thuật thường dùng như nhận dạng thực thể, trích xuất mối quan hệ, loại bỏ nhập nhằng ngữ nghĩa, v. Hệ thống thường sử dụng các nguồn tri thức như Wordnet, bản thể để làm giàu thêm khả năng lập luận thông qua các định nghĩa và mối liên hệ ngữ nghĩa. Các hệ thống hỏi đáp dựa theo mô hình ngôn ngữ thống kê cũng đang ngày càng phổ biến. Số hóa bởi Trung tâm Học liệu – ĐHTN http://www.

Cơ sở tri thức và máy suy diễn 1. Cơ sở tri thức 1. Khái niệm hệ cơ sở tri thức Hệ cơ sở tri thức (CSTT) là chương trình máy tính được thiết kế để mô hình hoá khả năng giải quyết vấn đề của chuyên gia con người. Hệ CSTT là hệ thống dựa trên tri thức, cho phép mô hình hoá các tri thức của chuyên gia, dùng tri thức này để giải quyết vấn đề phức tạp thuộc cùng lĩnh vực.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Tài liệu "Thuật Toán Phân Lớp Dữ Liệu & Ứng Dụng Xây Dựng Hệ Thống Hỏi Đáp Tự Động Về Bệnh Thường Gặp" tập trung vào việc ứng dụng các thuật toán phân lớp dữ liệu để xây dựng hệ thống hỏi đáp tự động, đặc biệt trong lĩnh vực y tế. Tài liệu này cung cấp cái nhìn sâu sắc về cách các thuật toán học máy có thể được sử dụng để phân loại và trả lời các câu hỏi liên quan đến bệnh thường gặp, giúp cải thiện hiệu quả và độ chính xác của hệ thống. Đây là nguồn tài liệu hữu ích cho những ai quan tâm đến việc ứng dụng AI trong y tế và xử lý ngôn ngữ tự nhiên.

Để mở rộng kiến thức về các thuật toán và ứng dụng tương tự, bạn có thể tham khảo Hcmute ứng dụng giải thuật fastica trong tách nguồn mù và trích đặc trưng, tài liệu này đi sâu vào việc sử dụng giải thuật FastICA để tách nguồn và trích xuất đặc trưng. Ngoài ra, Luận văn thạc sĩ tóm tắt văn bản sử dụng các kỹ thuật trong deep learning cung cấp thêm góc nhìn về cách deep learning được áp dụng trong xử lý văn bản. Cuối cùng, Luận văn advanced data mining techniques sẽ giúp bạn hiểu rõ hơn về các kỹ thuật khai thác dữ liệu nâng cao, bổ sung kiến thức cho chủ đề này.