Tổng quan nghiên cứu

Ngành nuôi tôm sú (Penaeus monodon) giữ vai trò chiến lược trong cơ cấu kinh tế thủy sản Việt Nam, đóng góp trên 50% tổng giá trị kim ngạch xuất khẩu toàn ngành tôm. Theo thống kê của Hiệp hội Chế biến và Xuất khẩu Thủy sản Việt Nam, kim ngạch xuất khẩu tôm năm 2012 đạt khoảng 2,25 tỷ USD và tăng trưởng mạnh mẽ đạt gần 2,94 tỷ USD trong 9 tháng đầu năm 2014, hướng tới mốc 3,8 tỷ USD vào cuối năm. Diện tích nuôi tôm trên cả nước mở rộng từ 530.000 ha năm 2012 lên 600.000 ha năm 2014 với sản lượng ước tính 270.000 tấn, phục vụ xuất khẩu tới 92 thị trường quốc tế.

Mặc dù có tiềm năng kinh tế vượt trội, ngành sản xuất tôm sú đối mặt với thách thức lớn về dịch bệnh do virus và sự thiếu hụt nguồn giống bản địa có chất lượng di truyền ổn định. Kích thước hệ gen của tôm sú rất lớn với hơn 2 tỷ cặp base, tương đương 2/3 bộ gen người. Việc giải mã toàn bộ hệ gen đòi hỏi kinh phí lên tới hàng chục triệu USD và kéo dài nhiều năm. Do đó, nghiên cứu hệ phiên mã (transcriptome) thông qua giải mã thẻ trình tự biểu hiện và RNA-Seq nổi lên như một giải pháp đột phá, tiết kiệm chi phí để xác định các gen chức năng quan trọng.

Luận văn thạc sĩ chuyên ngành Sinh học thực nghiệm do học viên Nguyễn Thị Minh Thư thực hiện trong giai đoạn 2012 - 2014 tại Viện Sinh thái và Tài nguyên sinh vật phối hợp cùng Viện Công nghệ sinh học thuộc Viện Hàn lâm Khoa học và Công nghệ Việt Nam. Nghiên cứu tập trung vào mô cơ của tôm sú thu thập tại vùng biển Nghệ An thuộc khu vực Bắc Trung Bộ. Mục tiêu cốt lõi của đề tài là xây dựng quy trình tách chiết, tinh sạch mRNA, tổng hợp thư viện cDNA chất lượng cao và giải trình tự hệ phiên mã mô cơ bằng công nghệ thế hệ mới NGS. Kết quả nghiên cứu cung cấp cơ sở dữ liệu phân tử giá trị, hỗ trợ phát hiện các chỉ thị phân tử nhằm nâng cao tỷ lệ sống và tăng trưởng từ 10% đến 15% cho tôm nuôi thương phẩm.

Cơ sở lý thuyết và phương pháp nghiên cứu

Khung lý thuyết áp dụng

Nghiên cứu được xây dựng trên nền tảng lý thuyết hệ phiên mã (Transcriptome Theory) và nguyên lý giải trình tự gen thế hệ mới (Next-Generation Sequencing - NGS). Hệ phiên mã đại diện cho toàn bộ các phân tử RNA hoàn chỉnh được biểu hiện tại một thời điểm xác định trong mô cơ quan, phản ánh chính xác các quá trình sinh lý và biến đổi sinh hóa của cơ thể sinh vật.

Trong nghiên cứu sinh học phân tử giáp xác, tôm sú thuộc bộ Thập túc (Decapoda), có kích thước cơ thể trưởng thành đạt tới 330 mm. Bộ nhiễm sắc thể của loài gồm 44 cặp, trong đó có 40 cặp dạng tâm giữa (metacentric), 1 cặp tâm lệch (submetacentric) và 3 cặp tâm mút (acrocentric). Các khái niệm lý thuyết trung tâm được áp dụng gồm:

  • Axit ribonucleic thông tin trưởng thành (mature mRNA): Phân tử mang mã di truyền đã trải qua quá trình gắn mũ đầu 5', gắn đuôi polyA đầu 3' và cắt bỏ các đoạn intron không mã hóa.
  • DNA bổ sung (cDNA): Chuỗi DNA được tổng hợp nhân tạo từ khuôn mẫu mRNA nhờ enzyme phiên mã ngược (Reverse Transcriptase).
  • Thẻ trình tự biểu hiện (EST) và Contigs: Các đoạn trình tự DNA ngắn từ 200 đến 500 nucleotide và các vùng trình tự nằm kề nhau được ghép nối trong quá trình phân tích tin sinh học.
  • Nguyên lý giải trình tự bằng tổng hợp (Sequencing by Synthesis - SBS): Kỹ thuật sử dụng các nucleotide kết thúc hồi tính có gắn huỳnh quang (Reversible Terminators) trên vi bản Flow Cell của hệ thống Illumina.

Phương pháp nghiên cứu

Cỡ mẫu nghiên cứu gồm 10 cá thể tôm sú khỏe mạnh được thu thập trực tiếp tại vùng biển tự nhiên tỉnh Nghệ An. Phương pháp chọn mẫu là chọn mẫu chủ đích kết hợp sàng lọc nghiêm ngặt các bệnh lý nguy hiểm. Tất cả cá thể tôm đều được kiểm tra và xác nhận âm tính với 5 loại virus gây hại phổ biến gồm WSSV, IHHNV, YHV, MBV và virus gây hội chứng Taura.

Quy trình thực nghiệm và phân tích được triển khai qua các bước:

  1. Tách chiết RNA tổng số: Đồng hóa 100 mg mô cơ trong dung dịch Trizol, ly tâm 12.000 vòng/phút ở 4°C, kết tủa bằng isopropanol và rửa bằng cồn 70%.
  2. Tinh sạch mRNA: Sử dụng bộ kit Dynabeads mRNA DIRECT Micro Kit dựa trên nguyên lý hạt từ tính gắn đoạn dò oligo(dT), xử lý nhiệt ở 70°C trong 2 phút để loại bỏ hoàn toàn rRNA và tạp chất.
  3. Tổng hợp và khuếch đại cDNA: Phân cắt mRNA ở 94°C trong 8 phút, tổng hợp cDNA sợi một và sợi hai, gắn đầu nối adaptor chuyên biệt và khuếch đại 14 chu kỳ PCR bằng Platinum PCR SuperMix High Fidelity.
  4. Đọc trình tự thế hệ mới: Tiến hành trên hệ thống máy Illumina MiSeq với công suất đạt 8 Gb mỗi lần chạy.
  5. Phân tích tin sinh học: Sử dụng phần mềm Cutadapt để loại bỏ trình tự adaptor cùng các đoạn đọc có chỉ số chất lượng Q nhỏ hơn 20 hoặc tỷ lệ base N lớn hơn 2%. Tiếp đó, phần mềm Trinity thực hiện lắp ráp de novo và phần mềm TGICL tiến hành gom cụm để tạo các unigene tối ưu.

Lý do lựa chọn hệ thống Illumina MiSeq kết hợp lắp ráp de novo là vì tôm sú chưa có bản đồ hệ gen chuẩn hoàn chỉnh. Công nghệ này cung cấp chiều dài đọc cặp paired-end ổn định, sai số dưới 2%, khắc phục được hạn chế chi phí đắt đỏ của phương pháp Sanger truyền thống và vấn đề lỗi chuỗi đơn nucleotide lặp lại của các công nghệ bán dẫn thế hệ cũ. Toàn bộ tiến trình nghiên cứu được triển khai xuyên suốt trong khung thời gian 24 tháng.

Kết quả nghiên cứu và thảo luận

Những phát hiện chính

Nghiên cứu đã ghi nhận những phát hiện thực nghiệm quan trọng với độ tin cậy khoa học cao:

Thứ nhất, hàm lượng RNA tổng số tách chiết từ mô cơ của 10 cá thể tôm sú Nghệ An đạt độ đồng đều cao, dao động trong khoảng từ 2152,1 ng đến 2425,9 ng. Tỷ số quang phổ hấp thụ A260/A280 đạt từ 1,85 đến 2,01, chứng minh độ sạch tuyệt đối và không bị nhiễm protein hay hóa chất hữu cơ. Trong đó, mẫu NA9 đạt 2385,8 ng và mẫu NA10 đạt 2425,9 ng đã được chọn lựa thành công cho các bước tinh chế chuyên sâu.

Thứ hai, quá trình tinh sạch bằng hạt từ tính thu được nồng độ mRNA đạt trên 20 ng/µL, tỷ số A260/A280 vượt ngưỡng chuẩn 1,8. Đây là điều kiện kỹ thuật bắt buộc để triển khai phản ứng tổng hợp chuỗi cDNA bổ sung.

Thứ ba, thư viện cDNA từ mô cơ sau khi gắn adaptor và làm giàu qua phản ứng PCR đạt nồng độ 17,1 ng/µL ở mẫu GM4. Phân tích kích thước đoạn gen trên thiết bị Bioanalyzer cho thấy các phân đoạn tập trung chủ yếu trong dải kích thước chuẩn từ 264 đến 500 bp.

Thứ tư, quá trình giải trình tự trên máy Illumina MiSeq đã tạo ra hàng triệu đoạn đọc ngắn với công suất đạt tới 8 Gb. Sau bước tiền xử lý lọc bỏ hơn 98% tạp nhiễu kỹ thuật, dữ liệu được lắp ráp de novo thành công thành hàng nghìn contigs và unigenes đại diện cho các gen chức năng biểu hiện trong mô cơ tôm sú.

Thảo luận kết quả

Kết quả thu nhận hàm lượng RNA tổng số trên 2100 ng và nồng độ cDNA thư viện 17,1 ng/µL khẳng định tính chuẩn xác của quy trình xử lý mẫu mô cơ bằng nitơ lỏng kết hợp tinh chế ái lực hạt từ. Việc kiểm soát phân cắt mRNA ở 94°C trong 8 phút đã tạo ra phổ kích thước cDNA 264 - 500 bp hoàn hảo cho buồng nạp Flow Cell của máy Illumina MiSeq.

Khi so sánh với các nghiên cứu trước đây tại Việt Nam sử dụng máy đọc thế hệ cũ ABI PRISM 3100 theo phương pháp Sanger vốn chỉ thu được vài chục đến hàng trăm đoạn EST đơn lẻ, nghiên cứu này đã tạo ra bước nhảy vọt về dung lượng dữ liệu gấp hơn 10.000 lần. So với các công trình quốc tế tại Thái Lan thu nhận 10.100 clone năm 2006 hay Đài Loan phân tích 256 chỉ thị microsatellite năm 2010, kết quả giải mã hệ phiên mã mô cơ tôm sú Nghệ An bằng công nghệ NGS đã rút ngắn thời gian phân tích từ nhiều tháng xuống còn dưới 48 giờ chạy máy, đồng thời cắt giảm hơn 80% chi phí vận hành.

Dữ liệu nghiên cứu được trình bày một cách trực quan thông qua:

  • Bảng đối chiếu nồng độ quang phổ NanoDrop minh họa sự đồng nhất về hàm lượng RNA tổng số giữa 10 mẫu khảo sát.
  • Biểu đồ phân tích điện di huỳnh quang Bioanalyzer với dạng đỉnh đơn sắc nét thể hiện dải kích thước cDNA tối ưu từ 264 đến 500 bp.
  • Biểu đồ phân bố độ dài contigs và unigenes biểu thị tần suất xuất hiện của các bản phiên mã từ 200 bp đến hơn 2000 bp, hỗ trợ đắc lực cho công tác chú giải chức năng sinh học phân tử sau này.

Đề xuất và khuyến nghị

Dựa trên kết quả giải mã hệ phiên mã mô cơ tôm sú, bốn nhóm giải pháp hành động cụ thể được đề xuất nhằm ứng dụng kết quả vào thực tiễn:

  1. Xây dựng và tích hợp Cơ sở dữ liệu Hệ phiên mã Tôm sú Quốc gia: Viện Công nghệ sinh học phối hợp cùng Viện Sinh thái và Tài nguyên sinh vật số hóa 100% dữ liệu unigene và contig mô cơ đã lắp ráp. Mục tiêu hoàn thiện cổng thông tin tra cứu trực tuyến trong vòng 12 tháng, tạo nền tảng chia sẻ dữ liệu nghiên cứu cho các trường đại học và viện chuyên ngành trên cả nước.

  2. Mở rộng giải trình tự transcriptome trên các mô miễn dịch và cơ quan sinh sản: Nhóm nghiên cứu thuộc các phòng thí nghiệm trọng điểm cần triển khai phân tích hệ phiên mã tế bào máu (hemocyte), tuyến gan tụy và buồng trứng tôm sú trong thời gian 18 đến 24 tháng. Đặt chỉ tiêu nhận diện ít nhất 50 gen ứng viên liên quan trực tiếp đến khả năng kháng virus đốm trắng WSSV và hội chứng hoại tử gan tụy cấp tính.

  3. Phát triển các bộ chỉ thị phân tử microsatellite và SNP đặc hiệu: Viện Nghiên cứu Nuôi trồng Thủy sản 1, 2 và 3 chủ trì ứng dụng các unigene mô cơ để thiết kế các marker phân tử phục vụ chương trình chọn giống tôm bố mẹ. Mục tiêu đến năm thứ hai nâng cao độ chính xác trong chọn lọc tính trạng tăng trưởng nhanh và tăng tỷ lệ chuyển đổi thịt lên từ 15% đến 20%.

  4. Chuyển giao quy trình sàng lọc chất lượng di truyền cho các cơ sở sản xuất giống: Bộ Nông nghiệp và Phát triển nông thôn cùng Hiệp hội VASEP ban hành tiêu chuẩn kỹ thuật kiểm định đàn tôm bố mẹ dựa trên dữ liệu phân tử. Kế hoạch triển khai trong 3 năm nhằm áp dụng quy trình kiểm soát di truyền cho tối thiểu 50% trại giống tập trung tại các tỉnh duyên hải miền Trung như Nghệ An, Khánh Hòa, Ninh Thuận.

Đối tượng nên tham khảo luận văn

Nội dung và dữ liệu thực nghiệm của luận văn mang lại giá trị học thuật và ứng dụng sâu rộng cho bốn nhóm đối tượng chính:

  1. Học viên cao học và nghiên cứu sinh chuyên ngành Sinh học, Công nghệ sinh học và Nuôi trồng thủy sản: Luận văn cung cấp tài liệu tham khảo chuẩn mực về quy trình tách chiết RNA mô khó, kỹ thuật tinh sạch mRNA bằng hạt từ tính Dynabeads và phương pháp xây dựng thư viện cDNA đạt chuẩn giải trình tự NGS.

  2. Các nhà khoa học và chuyên viên tin sinh học (Bioinformatics): Đây là tài liệu thực tế giá trị để tiếp cận quy trình xử lý dữ liệu giải trình tự thô (raw reads), phương pháp lọc chất lượng bằng Cutadapt, kỹ thuật lắp ráp de novo hệ phiên mã sinh vật nhân thực bằng Trinity và quy trình giảm độ dư thừa unigene bằng TGICL.

  3. Chuyên gia di truyền và chọn tạo giống thủy sản tại các viện nghiên cứu: Nguồn dữ liệu EST và các unigene mô cơ là cơ sở dữ liệu nền tảng giúp khai thác các gen quy định cấu trúc sợi cơ, các hormone điều hòa sinh trưởng, phục vụ thiết kế các cặp mồi PCR định danh kiểu gen.

  4. Doanh nghiệp và chủ cơ sở sản xuất giống tôm nước lợ: Nghiên cứu giúp các nhà quản lý kỹ thuật nắm bắt cơ chế biểu hiện gen của đàn tôm bản địa, từ đó xây dựng tiêu chí tuyển chọn nguồn tôm bố mẹ tự nhiên chất lượng cao, hạn chế rủi ro dịch bệnh và nâng cao hiệu quả kinh tế.

Câu hỏi thường gặp

  1. Tại sao nghiên cứu hệ phiên mã mô cơ lại được ưu tiên hơn giải mã toàn bộ hệ gen tôm sú? Hệ gen tôm sú có kích thước khổng lồ với hơn 2 tỷ cặp base, đòi hỏi kinh phí hàng chục triệu USD và kỹ thuật phân tích vô cùng phức tạp. Nghiên cứu hệ phiên mã chỉ tập trung vào các đoạn RNA mã hóa đang hoạt động ở mô cơ, giúp giảm hơn 90% chi phí nhưng vẫn thu được đầy đủ thông tin về các gen điều khiển sinh trưởng và phát triển cơ thịt.

  2. Công nghệ giải trình tự Illumina MiSeq có ưu thế gì vượt trội so với phương pháp Sanger truyền thống? Hệ thống Illumina MiSeq sở hữu công suất giải trình tự đạt 8 Gb mỗi lần chạy với hàng triệu đoạn đọc cặp song song, sai số kiểm soát dưới 2%. Trong khi đó, phương pháp Sanger truyền thống chỉ đọc đơn lẻ từng đoạn gen với chi phí tốn kém gấp hàng trăm lần và thời gian kéo dài nhiều tháng.

  3. Tiêu chuẩn nào quyết định chất lượng RNA tổng số và mRNA đạt chuẩn giải trình tự NGS? Mẫu RNA tổng số phải đạt hàm lượng tối thiểu 1000 ng và tỷ số quang phổ A260/A280 trong khoảng 1,8 đến 2,0. Đối với phân đoạn mRNA tinh sạch qua hạt từ tính, nồng độ dung dịch phải đạt từ 20 ng/µL trở lên nhằm bảo đảm hiệu suất cho phản ứng tổng hợp cDNA phân đoạn từ 264 đến 500 bp.

  4. Phần mềm tin sinh học nào được sử dụng để lắp ráp hệ phiên mã khi chưa có bộ gen tham chiếu? Đề tài sử dụng phần mềm Trinity để thực hiện lắp ráp de novo các đoạn đọc ngắn thành contigs mà không cần bộ gen tham chiếu. Sau đó, phần mềm TGICL được ứng dụng để loại bỏ các đoạn trình tự trùng lặp, giữ lại tập hợp unigenes hoàn chỉnh và đặc trưng nhất của mô cơ.

  5. Dữ liệu hệ phiên mã mô cơ đóng góp thế nào vào chiến lược phát triển tôm sú bền vững tại Việt Nam? Dữ liệu cung cấp danh mục các gen chức năng quy định tốc độ tăng trưởng cơ thể và quá trình chuyển hóa năng lượng. Điều này giúp các nhà khoa học nhanh chóng thiết lập các chỉ thị phân tử phục vụ chọn giống nhân tạo, nâng cao tỷ trọng xuất khẩu tôm sú đạt mốc kỳ vọng trên 3,8 tỷ USD.

Kết luận

  • Đã thiết lập thành công quy trình chuẩn tách chiết RNA tổng số từ mô cơ 10 mẫu tôm sú tự nhiên tại Nghệ An với hàm lượng cao đạt từ 2152,1 ng đến 2425,9 ng, độ tinh sạch A260/A280 đạt chuẩn 1,85 - 2,01.
  • Tinh chế thành công mRNA nồng độ trên 20 ng/µL bằng hạt từ tính Dynabeads và tổng hợp thư viện cDNA chất lượng cao với kích thước phân đoạn tập trung từ 264 đến 500 bp, nồng độ đạt 17,1 ng/µL.
  • Ứng dụng thành công công nghệ giải trình tự thế hệ mới Illumina MiSeq với công suất 8 Gb để giải mã toàn diện hệ phiên mã mô cơ tôm sú bản địa Việt Nam.
  • Chuẩn hóa quy trình phân tích tin sinh học tiền xử lý chất lượng đoạn đọc bằng Cutadapt, lắp ráp de novo bằng Trinity và rút gọn unigene bằng công cụ TGICL.
  • Cung cấp nguồn dữ liệu hệ gen biểu hiện có giá trị khoa học và thực tiễn, tạo tiền đề then chốt cho các chương trình chọn giống phân tử kháng bệnh và tăng trưởng nhanh.

Trong giai đoạn 12 đến 24 tháng tiếp theo, các đơn vị nghiên cứu cần tiếp tục mở rộng giải trình tự transcriptome trên các mô miễn dịch và gan tụy để hoàn thiện bản đồ biểu hiện gen toàn diện. Các nhà khoa học, học viên và doanh nghiệp quan tâm có thể khai thác trực tiếp nguồn tư liệu này để phục vụ công tác nghiên cứu chuyên sâu và ứng dụng vào thực tế nuôi trồng thủy sản.