Chương 1. Tổng quan về xếp hạng để dự đoán gen bệnh. Nội dung Chương trình bày tổng quan về bài toán xếp hạng để dự đoán gen điều khiển mà cũng là gen mục tiêu điều trị ung thư. Tiếp theo là các kiến thức cơ bản về lý thuyết đồ thị và mạng phức hợp.
Cuối cùng, luận án trình bày các nghiên cứu liên quan và đề ra nội dung luận án cần giải quyết; - Chương 2. Mô hình động lực cạnh tranh ngoài trên mạng phức hợp, ứng dụng trong dự đoán gen mục tiêu điều trị ung thư. Nội dung Chương đề xuất một mô hình động lực mạng mới trên các mạng phức hợp, gọi là mô hình động lực học cạnh tranh ngoài. Mô hình thể hiện sự cạnh tranh giữa một tác nhân (đỉnh) trong mạng và một tác nhân đối thủ cạnh tranh bên ngoài mạng.
Cuối cùng, ứng dụng mô hình vào dự đoán gen mục tiêu điều trị ung thư trên 17 mạng bệnh tín hiệu ung thư. Tương tác gián tiếp trong mô hình động lực cạnh tranh ngoài, ứng dụng nâng cao hiệu quả dự đoán gen mục tiêu điều trị ung thư. Nội dung Chương đề xuất một mô hình động lực cạnh tranh ngoài cải tiến, mô hình xem xét tất cả các tương tác trực tiếp và gián tiếp từ các đỉnh đến mỗi đỉnh trong mạng. Ngoài ra, luận án thiết kế thuật toán của mô hình theo hướng tính toán hiệu năng cao để đảm bảo năng lực thực thi trên các mạng quy mô lớn.
Áp dụng dự đoán các gen mục tiêu điều trị ung thư cho nhiều loại ung thư khác nhau. - Kết luận và hướng phát triển. TỔNG QUAN VỀ XẾP HẠNG ĐỂ DỰ ĐOÁN GEN MỤC TIÊU ĐIỀU TRỊ UNG THƯ 1. Bài toán xếp hạng để dự đoán gen bệnh Gen là một đoạn xác định của phân tử axit nuclêic (DNA (Deoxyribonucleic Acid) hoặc RNA (Ribonucleic Acid)) có chức năng di truyền nhất định.
Gen có thể thu nạp các đột biến sinh học nằm trong trình tự của chúng, dẫn đến những đột biến, biến thể. Đột biến gen có thể xuất hiện trong quá trình phiên mã tự nhiên hoặc chịu sự tác động của các yếu tố bên ngoài. Gen bị đột biến có thể gây ra một bệnh nào đó ở người [17]. Thuốc được thiết kế nhắm đến các gen đột biến liên quan đến bệnh, có thể làm nhiễu loạn bản sao hoặc ức chế khả năng đột biến của chúng, từng bước kìm hãm sự tiến triển của bệnh, khôi phục chức năng của gen về trạng thái khỏe mạnh [2, 17].
Việc xác định một gen mà đột biến của nó liên quan đến một bệnh nào đó có ý nghĩa quan trọng trong quy trình phát triển thuốc và điều trị bệnh [13]. Bài toán đặt ra là làm thế nào để giảm bớt thời gian và chi phí, đồng thời vẫn đảm bảo được độ chính xác trong việc dự đoán các gen gây bệnh ?.1: Bức tranh tổng quan dự đoán gen mục tiêu điều trị ung thư trên các mạng sinh học. (a) hướng tiếp cận thống kê, (b) hướng tiếp cận học máy, (c) hướng tiếp cận dựa trên mạng, (d) thực nghiệm lâm sàng. 14 quyết vấn đề đó, cách tiếp cận theo hướng mạng lưới đã được giới thiệu, cách tiếp cận này được tiến hành dựa trên việc quan sát thấy rằng các gen liên quan đến cùng một bệnh hoặc những bệnh tương tự thường có xu hướng nằm gần nhau trong cấu trúc tương tác của mạng sinh học [13].
Cách tiếp cận mạng sử dụng các mô hình tính toán trên mạng để sắp xếp các gen, sao cho các gen có khả năng liên quan nhiều nhất đến bệnh được xếp hạng cao hơn. Sau khi xếp hạng, một nhóm nhỏ các gen (một vài gen) có thứ hạng cao sẽ được kiểm tra bằng thực nghiệm, để khẳng định xem các gen này có phải là gen gây bệnh hay không [18]. Để sử dụng được các kỹ thuật xếp hạng gen theo hướng mạng lưới, cần phải có dữ liệu mạng sinh học và các thuật toán, mô hình tính toán để phân tích. Có nhiều nghiên cứu đã sử dụng các thuật toán, mô hình tính toán xếp hạng các đỉnh trong mạng xã hội ứng dụng trong xếp hạng các mạng sinh học, do tính tương đồng về cấu trúc của mạng sinh học với các mạng xã hội [19].
Các thuật toán xếp hạng gen dựa trên mạng đã được phát triển để khai phá chức năng các phân tử sinh học và các liên kết quan trọng giữa chúng [13]. Các nhà khoa học dữ liệu và tin sinh học thường áp dụng xếp hạng tương tác gen/protein dựa trên bộ gen để phục vụ cho các thực nghiệm tiếp sau. Gần đây, trong nước có một số nhóm nghiên cứu đã có những công bố liên quan đến hướng nghiên cứu này, như nhóm của TS. Trần Tiến Dũng ở Trường Đại học Công nghiệp Hà Nội, với một số công bố về dự đoán gen bệnh và gen chỉ dấu ung thư dựa trên việc xếp hạng đỉnh theo thuộc tính mức độ gần gũi theo thứ bậc [12, 20].
Nhóm nghiên cứu của PGS.TS Lê Đức Hậu ở Trường Đại học Thủy lợi, với một số công bố về dự đoán gen bệnh dựa trên xếp hạng gen theo thuộc tính của đỉnh được xác định bởi thuật toán bước nhảy ngẫu nhiên và bước nhảy ngẫu nhiên có quay lại (RWR), nhóm đã cải tiến phương pháp RWR bằng cách tăng cường trọng số hàng xóm của các gen gây bệnh đã biết [21], hay sử dụng mô hình mạng Boolean Network với thử nghiệm dự đoán được 27 gene có liên quan đến bệnh ung thư vú [18]. Nhóm nghiên cứu của PGS.TS Trần Đăng Hưng và TS. Nguyễn Văn Tỉnh ở Trường Đại học Sư phạm Hà Nội, với một số công bố về dự đoán mối liên quan giữa miRNA và bệnh bằng cách sử dụng thuật toán bước nhảy ngẫu nhiên có quay lại và tích hợp nhiều điểm tương đồng [22], hay sử dụng thuật toán lọc cộng tác và phân bổ nguồn lực trên biểu đồ ba bên miRNA-bệnh-lncRNA [23]. Chi tiết nội dung 15 của hai công bố này cũng đã được thể hiện và bảo vệ thành công trong bản luận án tiến sĩ của TS.
Nguyễn Văn Tỉnh năm 2023 tại Trường Đại học Sư phạm Hà Nội. Các phương pháp xếp hạng gen/protein dựa trên mạng phức hợp nhìn chung đã được chứng minh là có độ chính xác cao, nhờ vào việc tích hợp các mối quan hệ liên kết gen đã được chú thích từ các tập nguồn toàn diện vào cơ sở tri thức, như cơ sở dữ liệu STRING [24] và cơ sở dữ liệu HAPPYI 2. Ví dụ về các ứng dụng xếp hạng gen dựa trên mạng bao gồm khám phá các gen bệnh cho các trật tự di truyền phức tạp của người [26], tìm mục tiêu và định vị lại thuốc [27]. Sau đây, luận án phát biểu bài toán xếp hạng để dự đoán gen mục tiêu điều trị ung thư: - Phát biểu bài toán: Cho một mạng sinh học gồm các gen/protein được cho là có liên quan đến bệnh, các đỉnh biểu thị các gen/protein và các cạnh thể hiện sự tương tác giữa chúng.
Dự đoán các gen/protein (đỉnh) mà đột biến của chúng có liên quan đến sự phát triển một bệnh nào đó ở người và là mục tiêu tác động của thuốc điều trị; - Đầu vào: Cho trước một mạng sinh học G = (V, E), với V là tập đỉnh (các phân tử sinh học như gen/protein) (𝑉 = {𝑣1, 𝑣2 , … , 𝑣𝑛 } E là tập cạnh (tương tác giữa các phần tử sinh học) (𝐸 = {(𝑣𝑖 , 𝑣𝑗 )|𝑣𝑖 , 𝑣𝑗 ∈ 𝑉, 𝑖, 𝑗 = 1,. , 𝑛}); - Đầu ra: Một mối quan hệ S(V, F), trong đó V là tập đỉnh; FR* cho biết khả năng đột biến của gen v gây ra ung thư và là mục tiêu điều trị. Các báo cáo trước đây đã đề cập, xếp hạng theo mức độ thuộc tính gần gũi và thuộc tính gần gũi theo thứ bậc của một đỉnh so với các đỉnh khác trong mạng được sử dụng để xếp hạng các gen bệnh [12, 13]. Trong đó thuộc tính các phép đo này coi là thuộc tính F của quan hệ đầu ra S(V, F).
Cơ sở lý thuyết Cấu trúc mạng sinh học đề cập đến các vấn đề của mối quan hệ phức tạp giữa các thành phần sinh học như gen/protein và các sản phẩm của tế bào. Vì vậy, việc khai phá dữ liệu sinh học có thể được quy về bài toán khai phá dữ liệu trên các mạng phức hợp. Việc này có thể được thực hiện bằng các mô hình tính toán và thuật toán trên mạng. Để làm được điều đó, người ta thường biểu diễn chúng dưới dạng một đồ thị và sử dụng các kỹ thuật tính toán trên đồ thị và mạng phức hợp để giải quyết.
Sau đây luận án trình bày một số kiến thức cơ 16 bản về lý thuyết đồ thị và mạng phức hợp, làm cơ sở cho việc đề xuất các mô hình tính toán và thuật toán cho việc giải quyết bài toán đặt ra. Lý thuyết đồ thị Đồ thị là một công cụ mô hình hóa quan hệ giữa các đối tượng trong một hệ thống, ở đó mỗi đối tượng là một đỉnh và quan hệ giữa chúng được hiểu là cạnh liên kết chúng. Trong phân tích mạng phức hợp, đồ thị được sử dụng để biểu diễn mạng phức hợp, trong đó các đỉnh đại diện cho các đơn vị trong hệ thống và các cạnh đại diện cho các liên kết giữa chúng. Sau đây luận án trình bày một số khái niệm cơ bản về đồ thị: - Đỉnh là các thành phần của hệ thống được biểu diễn bởi các điểm trên đồ thị; - Cạnh là thành phần liên kết giữa các đỉnh được biểu diễn bởi các đường nối trên đồ thị.
Các cạnh có thể được đánh số hoặc không (trọng số cạnh); - Đường đi là một chuỗi các đỉnh kết nối với nhau bởi các cạnh. Đường đi độ dài n từ đỉnh u đến đỉnh v, trong đó n là số nguyên dương. Trên đồ thị vô hướng G = (V, E) là dãy x0, x1,…, xn-1, xn; trong đó u = x0, v = xn, (xi , xi+1) E, i = 0, 1, 2,…, n-1. Đường đi nói trên còn có thể biểu diễn dưới dạng dãy các cạnh: (x0, x1), (x1, x2), …, (xn-1, xn).
Đỉnh u gọi là đỉnh đầu, còn đỉnh v gọi là đỉnh cuối của đường đi. Đường đi có đỉnh đầu trùng với đỉnh cuối (tức là u = v) được gọi là chu trình. Đường đi hay chu trình được gọi là đơn nếu như không có cạnh nào bị lặp lại; - Bậc của đỉnh: Trong lý thuyết đồ thị, bậc của một đỉnh v là số cạnh liên thuộc với v (trong đó, khuyên được tính hai lần). Bậc của v được ký hiệu là deg(v).