Luận văn tốt nghiệp: Xây dựng bài toán nhận diện sơ đồ với phương pháp thị giác máy tính

Khám phá luận văn tốt nghiệp khoa học máy tính về nhận diện sơ đồ bằng phương pháp thị giác máy. Nâng cao hiểu biết về công nghệ mới.

Trường đại học

Ho Chi Minh University of Technology

Chuyên ngành

Computer Science

Người đăng

Ẩn danh

Thể loại

graduation thesis

2021

62
1
0

Phí lưu trữ

30 Point

Mục lục chi tiết

LỜI MỞ ĐẦU

1. CHƯƠNG 1: INTRODUCTION

1.1. Object detection methods

1.2. Outline

1.3. Objectives

2. CHƯƠNG 2: RELATED WORKS

2.1. Object detection methods

2.1.1. Introduction

2.1.2. Traditional detector

2.1.3. CNN-based Detector

2.1.3.1. CNN-based Two Stages Detection (Region Proposal based)

3. CHƯƠNG 3: [Tiêu đề chương 3 chưa rõ trong fulltext]

4. CHƯƠNG 4: [Tiêu đề chương 4 chưa rõ trong fulltext]

5. CHƯƠNG 5: EXPERIMENTS AND RESULTS

5.1. Perform training and inference without keypoints

5.2. Perform training and inference with keypoints

5.3. Building diagram structure from predictions

TÀI LIỆU THAM KHẢO

Tóm tắt

I. Giới thiệu

Bài toán nhận diện sơ đồ đóng vai trò quan trọng trong việc số hóa các ý tưởng và thông tin được trình bày bằng hình ảnh. Trong bối cảnh hiện đại, việc chuyển đổi các sơ đồ tay vẽ thành định dạng số không chỉ tiết kiệm thời gian mà còn giúp dễ dàng chỉnh sửa và chia sẻ thông tin. Tuy nhiên, việc này thường gặp khó khăn trong việc nhận diện và phân tích hình ảnh. Do đó, nghiên cứu này tập trung vào việc phát triển một hệ thống thị giác máy tính để nhận diện sơ đồ một cách hiệu quả, sử dụng các kỹ thuật như machine learningdeep learning. Một trong những thách thức lớn nhất là xây dựng một mô hình có thể xử lý và phân tích các hình ảnh sơ đồ với độ chính xác cao.

1.1 Tầm quan trọng của bài toán

Bài toán nhận diện sơ đồ không chỉ là một vấn đề kỹ thuật mà còn có ứng dụng rộng rãi trong nhiều lĩnh vực như giáo dục, quản lý dự án và thiết kế. Việc số hóa sơ đồ giúp cải thiện khả năng lưu trữ và truy xuất thông tin, đồng thời tạo điều kiện cho việc chia sẻ ý tưởng giữa các thành viên trong nhóm. Theo thống kê, việc sử dụng sơ đồ giúp tăng cường khả năng ghi nhớ và hiểu biết của người học, từ đó nâng cao hiệu quả công việc.

II. Các phương pháp nhận diện sơ đồ

Bài viết sẽ phân tích các phương pháp hiện có trong lĩnh vực thị giác máy tính, bao gồm cả thuật toán truyền thống và các mô hình dựa trên mạng nơ-ron. Các phương pháp này được chia thành hai loại chính: nhận diện sơ đồ trực tuyến và ngoại tuyến. Nhận diện sơ đồ trực tuyến yêu cầu người dùng vẽ trực tiếp trên thiết bị, trong khi nhận diện ngoại tuyến sử dụng hình ảnh đã chụp. Mỗi phương pháp có ưu điểm và nhược điểm riêng, và việc lựa chọn phương pháp phù hợp sẽ phụ thuộc vào bối cảnh sử dụng.

2.1 Nhận diện sơ đồ trực tuyến

Nhận diện sơ đồ trực tuyến cho phép người dùng vẽ sơ đồ trên các thiết bị cảm ứng. Phương pháp này có độ chính xác cao và khả năng tương tác tốt, tuy nhiên lại yêu cầu thiết bị chuyên dụng. Các thuật toán như HOG và CNN đã được sử dụng để phát hiện và phân tích các hình vẽ trong thời gian thực, giúp người dùng dễ dàng chỉnh sửa và lưu trữ thông tin.

2.2 Nhận diện sơ đồ ngoại tuyến

Nhận diện sơ đồ ngoại tuyến thường được sử dụng trong các tình huống như hội thảo hoặc cuộc họp, nơi mà sơ đồ được vẽ trên bảng trắng hoặc giấy. Phương pháp này sử dụng các hình ảnh đã chụp và áp dụng các kỹ thuật như phân tích hình ảnhxử lý hình ảnh để nhận diện các thành phần trong sơ đồ. Các mô hình như Mask R-CNN đã chứng minh được hiệu quả trong việc phát hiện và phân loại các đối tượng trong sơ đồ với độ chính xác cao.

III. Kết quả và thảo luận

Nghiên cứu đã thực hiện các thử nghiệm để đánh giá hiệu suất của mô hình nhận diện sơ đồ. Kết quả cho thấy mô hình đạt độ chính xác lên đến 90% trong việc nhận diện các thành phần trong sơ đồ. Tuy nhiên, một số hạn chế vẫn tồn tại, bao gồm kích thước tập dữ liệu còn nhỏ và khả năng nhận diện các sơ đồ phức tạp còn hạn chế. Việc mở rộng tập dữ liệu và cải thiện thuật toán sẽ là hướng đi quan trọng trong các nghiên cứu tiếp theo.

3.1 Đánh giá mô hình

Mô hình đã được đánh giá dựa trên các tiêu chí như độ chính xác, tốc độ xử lý và khả năng nhận diện các đối tượng khác nhau. Kết quả cho thấy mô hình hoạt động hiệu quả trong môi trường thử nghiệm, tuy nhiên cần thực hiện thêm các thử nghiệm trong điều kiện thực tế để đánh giá chính xác hơn về khả năng áp dụng của mô hình.

3.2 Hướng phát triển tương lai

Để nâng cao khả năng nhận diện sơ đồ, việc nghiên cứu và phát triển các thuật toán mới như thuật toán học sâu và cải thiện tập dữ liệu sẽ là cần thiết. Ngoài ra, việc tích hợp mô hình vào các ứng dụng thực tế sẽ giúp giải quyết các vấn đề trong việc số hóa và chia sẻ sơ đồ, từ đó nâng cao hiệu quả làm việc trong nhiều lĩnh vực.

09/01/2025

Trích đoạn nội dung tài liệu

VIETNAM NATIONAL UNIVERSITY - HO CHI MINH CITY HO CHI MINH UNIVERSITY OF TECHNOLOGY COMPUTER SCIENCE AND ENGINEERING FACULTY ——————– * ——————— GRADUATION THESIS Building A Diagram Recognition Problem with Machine Vision Approach Council: Computer Science Advisor: Dr. Nguyen Duc Dung Reviewer: Dr. Nguyen An Khuong —o0o— Student: Tran Hoang Thinh 1752516 HO CHI MINH CITY, 08/2021 ĐẠI HỌC QUỐC GIA TP.HCM CỘNG HÒA XÃ HỘI CHỦ NGHĨA VIỆT NAM ---------- Độc lập - Tự do - Hạnh phúc TRƯỜNG ĐẠI HỌC BÁCH KHOA KHOA: KH & KT Máy tính___ NHIỆM VỤ LUẬN ÁN TỐT NGHIỆP BỘ MÔN: KHMT___________ Chú ý: Sinh viên phải dán tờ này vào trang nhất của bản thuyết trình HỌ VÀ TÊN: Trần Hoàng Thịnh ______________________ MSSV: 1752516 _______ HỌ VÀ TÊN: _____________________________________ MSSV: ______________ HỌ VÀ TÊN: _____________________________________ MSSV: ______________ NGÀNH: ___________________________________ LỚP: ______________________ 1. Đầu đề luận án: Building A Diagram Recognition Problem with Machine Vision Approach 2.

Nhiệm vụ đề tài (yêu cầu về nội dung và số liệu ban đầu): - Investigate approaches in diagram recognition problem - Research on machine learning approaches for the problem - Prepare data for the problem. - Propose and implement the diagram recognition system - Evaluate the proposed model 3. Ngày giao nhiệm vụ luận án: 1/3/2021 4. Ngày hoàn thành nhiệm vụ: 30/6/2021 5.

Họ tên giảng viên hướng dẫn: Phần hướng dẫn: 1) Nguyễn Đức Dũng __________________________________________________________ 2) _________________________________________________________________________ 3) _________________________________________________________________________ Nội dung và yêu cầu LVTN đã được thông qua Bộ môn. CHỦ NHIỆM BỘ MÔN GIẢNG VIÊN HƯỚNG DẪN CHÍNH (Ký và ghi rõ họ tên) (Ký và ghi rõ họ tên) PHẦN DÀNH CHO KHOA, BỘ MÔN: Người duyệt (chấm sơ bộ): ________________________ Đơn vị: _______________________________________ Ngày bảo vệ: ___________________________________ Điểm tổng kết: __________________________________ Nơi lưu trữ luận án: ______________________________ TRƯỜNG ĐẠI HỌC BÁCH KHOA CỘNG HÒA XÃ HỘI CHỦ NGHĨA VIỆT NAM KHOA KH & KT MÁY TÍNH Độc lập - Tự do - Hạnh phúc ---------------------------- Ngày 01 tháng 08 năm 2021 PHIẾU CHẤM BẢO VỆ LVTN (Dành cho người hướng dẫn/phản biện) 1. Họ và tên SV: Trần Hoàng Thịnh MSSV: 1752516 Ngành (chuyên ngành): Computer Science 2. Đề tài: Building A Diagram Recognition Problem with Machine Vision Approach 3.

Họ tên người hướng dẫn/phản biện: Nguyễn Đức Dũng 4. Tổng quát về bản thuyết minh: Số trang: Số chương: Số bảng số liệu Số hình vẽ: Số tài liệu tham khảo: Phần mềm tính toán: Hiện vật (sản phẩm) 5. Tổng quát về các bản vẽ: - Số bản vẽ: Bản A1: Bản A2: Khổ khác: - Số bản vẽ vẽ tay Số bản vẽ trên máy tính: 6. Những ưu điểm chính của LVTN: The team has successfully proposed the diagram recognition system.

They built the initial dataset and perform labeling the data for this task. The team has utilized their knowledge in computer vision and machine learning to propose a suitable approach for this problem. The evaluation results are promising. Những thiếu sót chính của LVTN: The dataset they built is still small and the number of components that this model can recognize is also limited.

Even obtained high accuracy, the team has not performed experiments under real conditions, i. image captured with shadows, low contrast, thin sketches, etc. Đề nghị: Được bảo vệ o Bổ sung thêm để bảo vệ o Không được bảo vệ o 9. 3 câu hỏi SV phải trả lời trước Hội đồng: a.

Đánh giá chung (bằng chữ: giỏi, khá, TB): Giỏi Điểm: 9 /10 Ký tên (ghi rõ họ tên) Nguyễn Đức Dũng TRƯỜNG ĐẠI HỌC BÁCH KHOA CỘNG HÒA XÃ HỘI CHỦ NGHĨA VIỆT NAM KHOA KH & KT MÁY TÍNH Độc lập - Tự do - Hạnh phúc ---------------------------- Ngày 1 tháng 8 năm 2021 PHIẾU CHẤM BẢO VỆ LVTN (Dành cho người hướng dẫn/phản biện) 1. Họ và tên SV: Trần Hoàng Thịnh MSSV: 1752516 Ngành (chuyên ngành): Computer Science 2. Đề tài: “Building A Diagram Recognition Problem with Machine Vision Approach” 3. Họ tên người phản biện: Nguyễn An Khương 4.

Tổng quát về bản thuyết minh: Số trang: 35 Số chương: 6 Số bảng số liệu: 4 Số hình vẽ: 18 Số tài liệu tham khảo: 53 Phần mềm tính toán: Hiện vật (sản phẩm) 5. Tổng quát về các bản vẽ: - Số bản vẽ: Bản A1: Bản A2: Khổ khác: - Số bản vẽ vẽ tay Số bản vẽ trên máy tính: 6. Những ưu điểm chính của LVTN:  Thesis topic is interesting and well-choosen. The author clearly understands the problem to be solved and masters the techniques and background knowledge to solve the problem.

 The author proposes three algorithms: Algorithms 2 for improving Non Max Suppression, and Algorithms 3,4 for diagram building.  The thesis uses Mask R-CNN model and its variant, Keypoint R-CNN with some improvements and augmentation to solve offline diagram recognition task with rather high accuracy (~90%) and acceptable performance (< 2s for each diagram). Những thiếu sót chính của LVTN:  The thesis is not well-written and too short.  The contributions of the author are not presented in a clear maner.

Đề nghị: Được bảo vệ  Bổ sung thêm để bảo vệ  Không được bảo vệ  9. Câu hỏi SV phải trả lời trước Hội đồng: a. Is there any commercial or prototype app/software that solve this problem or similar ones? If YES, can you give some comments and remarks on benchmarking your work and those? b. Arrow keypoints seem often coincide with one border of the bounding box, so how should we do to reduce overlap task between arrow keypoint detection and bounding box detection? 10.

Đánh giá chung (bằng chữ: giỏi, khá, TB): Excellent Điểm: 9/10 Ký tên (ghi rõ họ tên) Nguyễn An Khương Declaration We hereby undertake that this is our own research project under the guidance of Dr. Research content and results are truthful and have never been published before. The data used for the analysis and comments are collected by us from many different sources and will be clearly stated in the references. In addition, we also use several reviews and figures of other authors and organizations.

All have citations and origins. If we detect any fraud, we take full responsibility for the content of our graduate in- ternship. Ho Chi Minh City University of Technology is not related to the copyright and copyright infringement caused by us in the implementation process. Best regards, Tran Hoang Thinh Acknowledgments First and foremost, we would like to express our sincere gratitude to our advisor Dr.

Nguyen Duc Dung for the support of our thesis for his patience, enthusiasm, experience, and knowledge. He shared his experience and knowledge which helps us in our research and how to provide a good thesis. We also want to thank Dr. Nguyen An Khuong and Dr.

Le Thanh Sach for their support in reviewing our thesis proposal and thesis. Finally, we would like to show our appreciation to Computer Science Faculty and Ho Chi Minh University of Technology for providing an academic environment for us to become what we are today. Best regards, Tran Hoang Thinh Abstract Diagram has been one of the most effective illustrating tools for demonstrating and sharing ideas and suggestions among others. Besides text and images, drawing flow charts is the best way to give others a clearer path of the plan with the least amount of work.

Nowadays, many meetings require a blackboard so everyone can express their thoughts. This raises a problem with saving these drawings as a reference for future use since taking a picture can not solve the problem of re-editing these ideas and they need to be redrawn to be suitable in professional documents. On the other hand, digitizing the chart requires redrawing the entire diagram using a computer or a special device like drawing boards and digital pens, which cost a lot and are not the most convenient tools to use. Therefore, it is necessary to find a way to convert the current, traditional hand-drawing diagrams into a digital version, simplifying the sharing process between users.

Moreover, the digitizing diagram also helps the user to modify and convert to other forms that satisfy their requirements. This thesis will focus on stating a problem with digitizing diagrams and proposing the solution.1 Object detection methods .3 CNN-based Detector .1 CNN-based Two Stages Detection (Region Proposal based) .2 CNN-based One Stage Detection (Regression/Classification based) .2 Region Proposal Network .3 Non-Maximum Suppression .2 Feature Pyramid Network .3 Region of Interest Align .1 Scope of the thesis .1 Feature map generator .3 Loss function and summary .3 Symbol-Arrow relationship .4 Text-Others relationship. 37 5 Experiments and Results 38 5.1 Perform training and inference without keypoints .2 Perform training and inference with keypoints .3 Building diagram structure from predictions. 46 List of Tables 4.2 Graph building technique experiment.

44 iii List of Figures 3.1 ResNet50 model, from [1] .2 Non-Maximum Suppression, from [2] .3 MaskRCNN model, from [3] .4 Mask Sample, the pink colored pixels are for the object .5 Feature Pyramid Network, from [4] .6 RoIPooling in Faster R-CNN .7 RoIAlign layer used in Mask R-CNN .1 Sample of an entry in DiDi dataset .2 Python code to save a drawing as PNG image .3 A sample with its labels and the JSON label information.4 Sample drawing with bounding boxes .5 Pipeline of the model .6 Feature Pyramid Network with ResNet, from [5] .7 A drawing with its predictions .9 Model fails to detect intersected arrows .10 Example when Euclidean distance does work .11 Sample for Weighted Euclidean .2 Sample prediction with rotated input .3 Loss over iteration of proposed model without keypoints .4 Sample diagram without text .5 Sample diagram with text .6 Loss over iteration of proposed model with keypoints .7 Drawing without predictions at 60% score .8 Example of impossibility in prediction .9 Sample output result. 45 iv List of Algorithms 1 Non-Maximum Suppression. 10 2 DiDi image generation. 20 3 COCO Format Generation.

24 4 Improved Non-Maximum Suppression. 33 6 Weighted Euclidean for Symbol-Arrow relationship .1 Overview Comparing to many decades ago, artificial intelligence (AI) has developed faster than any- one can imagine. Tracing back to the 90s, right after the second “AI Winter” ended, there had been numerous advances where computers successfully achieved milestones that used to be be- lieved as impossible. In 1994, Chinook[6], a checker (English draughts) engine, won the United States tournament by an enormous margin.

It beat the second-best player Don Lafferty while making Marion Tinsley, the best at the time, withdraw in the middle of the game. 1997 on the other hand is the year that would change the history of chess forever when the Deep Blue[7] chess machine from IBM defeated Grandmaster Gary Kasparov with the score of 3½ to 2½. In the same year, Logistello[8] beat the world champion, Takeshi Murakami, with an overwhelm- ing score of six to zero. Nowadays, AI can be seen everywhere in modern life, from work-related examples like email spam filters, virtual assistants to the entertainment industry like recommen- dation systems, chatting, gaming bot, voice and text recognition,.

AlphaZero [9], developed by Google DeepMind, defeated the reigning champion, Stockfish, in a one-side match with the re- sult of 28 wins, 72 draws, and zero losses. Another project, AlphaGo [10], beat the champion, Lee Sedol at 4 - 1, making the history of artificial intelligence the first time a computer had beaten a human in Go. Within the area of computer vision, a subset of artificial intelligence that deals with the science of enabling computers or engines to visualize images, a smaller section deals with the ability to detect objects, for example, humans, animals, furniture, etc. Recently, there have been many applications that can help deal with this task.

Google Lens[11] is an image recognition technology developed by Google, which can detect objects, texts, bar codes, QR codes, math equations,.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Bài luận văn tốt nghiệp mang tiêu đề "Xây dựng bài toán nhận diện sơ đồ với phương pháp thị giác máy tính" của tác giả Trần Hoàng Thịnh, dưới sự hướng dẫn của Dr. Nguyễn Đức Dũng tại Trường Đại học Bách Khoa TP.HCM, đã trình bày một cách chi tiết về việc áp dụng các kỹ thuật thị giác máy tính để nhận diện và phân tích sơ đồ. Bài viết không chỉ cung cấp cái nhìn sâu sắc về các phương pháp công nghệ hiện đại trong lĩnh vực này mà còn mở ra hướng nghiên cứu mới cho những ai quan tâm đến ứng dụng của thị giác máy tính trong các bài toán thực tiễn. Độc giả sẽ thu được nhiều lợi ích từ bài viết này, đặc biệt là những ai đang theo học hoặc làm việc trong lĩnh vực khoa học máy tính và công nghệ thông tin.

Để mở rộng thêm kiến thức và tìm hiểu sâu hơn về các ứng dụng tương tự trong lĩnh vực này, bạn có thể tham khảo các bài viết sau: Ứng Dụng Thuật Toán Nhận Dạng Trong Điểm Danh Học Sinh, nơi trình bày về việc ứng dụng thị giác máy tính trong lĩnh vực giáo dục, hay Ứng Dụng Thị Giác Máy Tính Trong Trích Xuất Số Báo Danh, bài viết này cũng khai thác khía cạnh ứng dụng của thị giác máy tính trong việc quản lý thông tin trong giáo dục. Những tài liệu này sẽ giúp bạn có thêm cái nhìn đa chiều về các ứng dụng của công nghệ trong cuộc sống thực tế.