Giới thiệu dự án

Sự bùng nổ của thị trường thiết bị di động thông minh (smartphone) trong giai đoạn chuyển giao công nghệ thập niên 2010 đã làm thay đổi hoàn toàn phương thức giao tiếp của xã hội. Theo báo cáo nghiên cứu thị trường từ Nielsen, chỉ tính riêng quý 4 năm 2011, lượng smartphone tiêu thụ toàn cầu đạt 472 triệu máy, chiếm 46% tổng lượng điện thoại di động lưu hành. Cùng với sự phát triển của hạ tầng mạng không dây và các nền tảng thoại qua giao thức Internet (VoIP - Voice over Internet Protocol) như Skype (được Microsoft mua lại với giá 8,5 tỷ USD năm 2011), nhu cầu xử lý, biến đổi và bảo mật âm thanh thời gian thực (Real-time Digital Signal Processing - DSP) trên nền tảng di động trở nên cấp thiết.

+-------------------------------------------------------------------------+
|                        HỆ THỐNG XỬ LÝ ÂM THANH                          |
|                                                                         |
|  [Microphone]                                                           |
|       |                                                                 |
|       v                                                                 |
|  +--------------------+      +---------------------------------------+  |
|  | Analog to Digital  | ---> | Transformation Engine                 |  |
|  | (ADC - 8/24/48kHz) |      | - Pitch Shift (Tần số)                |  |
|  +--------------------+      | - Amplitude Modulation (Biên độ)      |  |
|                              | - Window Length Frame Slicing (Cửa sổ)|  |
|                              +---------------------------------------+  |
|                                                  |                      |
|                                                  v                      |
|  [Loa / Skype VoIP] <--- [Digital to Analog] <---+                      |
+-------------------------------------------------------------------------+

Tuy nhiên, vào thời điểm năm 2012, các ứng dụng biến đổi giọng nói trên Apple App Store (chỉ khoảng 5 ứng dụng với 3 triệu lượt tải) đều gặp phải nhiều hạn chế: hiệu ứng nghèo nàn, can thiệp sâu vào xử lý tham số âm thanh đòi hỏi người dùng có kiến thức chuyên ngành phức tạp, và đặc biệt là không thể can thiệp trực tiếp vào luồng đàm thoại thoại hai chiều theo thời gian thực do các rào cản về kiến trúc hệ điều hành và năng lực tính toán phần cứng.

Đồ án / Khóa luận tốt nghiệp chuyên ngành Công nghệ Phần mềm: "Xây dựng hệ thống biến đổi giọng nói trên nền tảng di động – iPhone" của tác giả Nguyễn Văn Hiển (Đại học Công nghệ – Đại học Quốc gia Hà Nội, Mã số: 60 48 10) đã giải quyết bài toán này thông qua phương pháp tiếp cận chuyển đổi trực tiếp tham số sóng âm (Transformation-based Approach), kết hợp phát triển ứng dụng di động trên iOS và plugin can thiệp luồng âm thanh trên giao thức Skype API.

Mục tiêu cụ thể của dự án

  1. Nghiên cứu lý thuyết xử lý tín hiệu âm thanh số: Phân tích đặc trưng vật lý - sinh lý của giọng nói con người (tần số cơ bản $F_0$, biên độ, trường độ, âm sắc, nhiễu trắng) và các kỹ thuật lượng tử hóa tín hiệu âm thanh (PCM, DPCM).
  2. Xây dựng giải thuật biến đổi tham số thời gian thực: Triển khai kỹ thuật biến dịch cao độ (Pitch Shifting) kết hợp điều chỉnh độ rộng khung cửa sổ (Window Length) và điều biên (Amplitude Modulation) với độ trễ xử lý $\le 35\text{ms}$.
  3. Hiện thực hóa 23 bộ tham số âm thanh chuẩn: Cấu hình thành công 17 kiểu biến đổi giọng nói đặc trưng (Nam, Nữ, Trẻ em, Người già, Robot, Loa phát thanh...) và 6 hiệu ứng môi trường âm thanh giả lập (Mưa rơi, Đường phố, Đám đông, Tiếng vỗ tay, Tiếng sóng biển, Còi báo động).
  4. Phát triển ứng dụng iOS đa chức năng: Xây dựng phần mềm hoàn chỉnh trên môi trường iOS (Objective-C/Cocoa Touch) hỗ trợ ghi âm, áp bộ lọc biến đổi, lưu trữ file và nghe lại trực tiếp.
  5. Mở rộng Plugin can thiệp cuộc gọi Skype: Tích hợp bộ thư viện Skype API Wrapper trên môi trường máy tính để thực thi giải thuật biến đổi giọng nói hai chiều trực tiếp trong luồng đàm thoại thoại.

Phân tích và thiết kế giải pháp

Phân tích hiện trạng

Trong bài toán xử lý tiếng nói (Speech Processing), có hai hướng tiếp cận kinh điển để biến đổi đặc tính giọng nói từ đối tượng nguồn (Source) sang đối tượng đích (Target):

Tiêu chí so sánh Tiếp cận theo Tập mẫu (Codebook-based) Tiếp cận theo Biến đổi trực tiếp (Transformation-based)
Cơ chế hoạt động Lưu trữ kho vector mẫu âm thanh khổng lồ; so khớp tín hiệu đầu vào và sinh chuỗi âm thanh tương ứng. Trích xuất các tham số vật lý của khung sóng âm đầu vào, áp dụng hàm biến đổi toán học trực tiếp lên miền tần số/thời gian.
Độ chính xác âm sắc Rất cao với các tập từ vựng hữu hạn đã được ghi nhận. Trung bình - Khá, phụ thuộc vào độ mịn của thuật toán điều chỉnh tần số.
Độ trễ tính toán (Latency) Rất lớn ($\ge 250\text{ms}$) khi không tìm thấy mẫu khớp chính xác, phải nội suy. Rất thấp ($\le 20\text{ms}$ - $35\text{ms}$), đáp ứng hoàn hảo yêu cầu thời gian thực.
Dung lượng bộ nhớ lưu trữ Chiếm dụng hàng trăm Megabytes bộ nhớ RAM/ROM để lưu cơ sở dữ liệu mẫu. Chi phí bộ nhớ cực kỳ nhỏ ($\le 5\text{MB}$ cho toàn bộ cấu hình tham số).
Tính khả thi trên di động (2012) Kém khả thi do năng lực CPU ARM và RAM của smartphone thời kỳ này bị giới hạn. Tối ưu tuyệt đối, phù hợp triển khai trên kiến trúc di động và hệ thống nhúng.

Phân tích MoSCoW định hình tập yêu cầu của hệ thống:

  • Must-Have: Thu âm PCM 16-bit, giải thuật biến dịch cao độ (Pitch Shift), điều chỉnh kích thước khung xử lý (Window Length), xuất file âm thanh sau biến đổi, giao diện trực quan chọn preset.
  • Should-Have: Hòa trộn âm thanh nền môi trường (Audio Mixing/Overlay), hỗ trợ xuất âm thanh tức thì không giật/trễ, tích hợp API Skype cho cuộc gọi trực tiếp.
  • Could-Have: Tùy biến tham số chuyên sâu dạng thanh trượt (Sliders) cho chuyên gia âm thanh, phân tích quang phổ thời gian thực.
  • Won't-Have (Phạm vi giới hạn): Nhận dạng tự động ngữ nghĩa văn bản (Speech-to-Text), can thiệp luồng cuộc gọi mạng viễn thông GSM truyền thống (do chính sách Sandbox bảo mật khép kín của iOS).

Thiết kế hệ thống và Cơ sở Toán học

Biểu diễn tín hiệu tiếng nói dưới dạng số tuân theo định lý lấy mẫu Nyquist-Shannon:

$$\mathbf{f_0 \ge 2 \cdot f_{MAX}}$$

Dải tần số tiếng nói người thông thường nằm trong phạm vi từ $80\text{Hz}$ đến $800\text{Hz}$ đối với tần số cơ bản ($F_0$), trong khi phổ tần số hài âm mở rộng đến $12\text{kHz}$. Do đó:

  • Với chuẩn truyền dẫn thoại cơ bản (Telephone Quality): Tần số giới hạn $f_{MAX} = 3400\text{Hz} \implies f_0 = 8000\text{Hz}$ ($8\text{kHz}$).
  • Với chuẩn phân tích âm thanh chất lượng cao: Tần số lấy mẫu tối ưu được cấu hình ở mức $24\text{kHz}$ đến $48\text{kHz}$, định dạng mẫu chuẩn 16-bit Linear PCM (Pulse Code Modulation) đạt bitrate không nén $768\text{kbps}$.
+--------------------------------------------------------------------------+
|                       KIẾN TRÚC HỆ THỐNG PHÂN LỚP                        |
+--------------------------------------------------------------------------+
|  Presentation Layer:    UIKit / Interface Builder (iOS) | Win32 / WPF UI |
+--------------------------------------------------------------------------+
|  Application Logic:     VoicePresetManager | EnvironmentMixer | Recorder |
+--------------------------------------------------------------------------+
|  Audio Engine (DSP):    TransformationEngine (Pitch, Amplitude, Frame)   |
+--------------------------------------------------------------------------+
|  System / Hardware:     AVFoundation / Core Audio (iOS) | Skype API / OS |
+--------------------------------------------------------------------------+
+--------------------------------------------------------------------------+
|                        SKYPE INTEGRATION PIPELINE                        |
|                                                                          |
|  [User Mic] ---> [Audio Capture] ---> [Skype Plugin / DSP Engine]        |
|                                                  |                       |
|                                       (Pitch/Amplitude Shift)            |
|                                                  |                       |
|                                                  v                       |
|  [Remote Peer] <--- [Skype VoIP Network] <--- [Skype API Message Layer]  |
+--------------------------------------------------------------------------+

Công nghệ sử dụng

  • Nền tảng di động: iOS SDK 4.x/5.x, Objective-C, Xcode IDE, Core Audio Framework, AVFoundation.
  • Nền tảng VoIP Desktop: Win32 API / C++, Skype Desktop SDK / Skype API Wrapper (Message Layer & Transport Layer qua cơ chế IPC với giao thức mã hóa UTF-8).
  • Cơ chế quản lý luồng: Xử lý đệm tín hiệu phân đoạn (Buffer Frame Slicing) thời gian ngắn $20\text{ms}$ giúp giữ vững tính dừng cục bộ (Quasi-stationary property) của chuỗi tín hiệu âm thanh.

Implementation và kết quả

Chi tiết giải thuật và Cấu trúc dữ liệu

Giải thuật xử lý dựa trên việc cấu trúc hóa mỗi khung âm thanh thành một đối tượng dữ liệu tham số độc lập và áp dụng ánh xạ toán học trực tiếp qua ma trận tham số cấu hình:

// Cấu trúc dữ liệu định nghĩa một khung tham số tín hiệu âm thanh
struct Voice {
    int amplitude;       // Biên độ tín hiệu (Quyết định cường độ âm thanh)
    int pitch;           // Tần số dao động cơ bản (Quyết định độ cao trầm)
    int window_length;   // Độ rộng khung cửa sổ lấy mẫu (Window Frame Size)
};

Quy trình giải thuật biến đổi âm thanh thời gian thực (Transformation Algorithm):

// Khởi tạo danh sách tham số chuẩn và luồng tín hiệu
VOICES: List<Voice>;            // Danh sách 17 cấu hình giọng chuẩn
TARGET: Integer;                // Chỉ số hiệu ứng giọng đích được chọn
source_voices: List<Voice>;     // Buffer tín hiệu âm thanh đầu vào
target_voices: List<Voice>;     // Buffer tín hiệu âm thanh đầu ra

// Vòng lặp xử lý liên tục từng đoạn tín hiệu cho đến khi ngắt luồng
Loop Until end of source
    // Bước 1: Trích xuất tín hiệu đầu vào với kích thước cửa sổ chuẩn W = 11
    Input(source_voices, 11);
    
    // Bước 2: Duyệt từng phần tử khung tín hiệu và biến đổi tham số
    For Each source_voice In source_voices
        // Biến đổi cường độ (Amplitude scaling)
        target_voice.amplitude = source_voice.amplitude * VOICES[TARGET].amplitude;
        
        // Biến đổi cao độ (Pitch shifting factor)
        target_voice.pitch = source_voice.pitch * VOICES[TARGET].pitch;
        
        // Điều chỉnh kích thước khung cửa sổ thời gian
        target_voice.window_length = VOICES[TARGET].window_length;
        
        Append(target_voices, target_voice);
    End For
    
    // Bước 3: Đưa khung dữ liệu đã biến đổi sang mạch phát (D/A) hoặc bộ đệm Skype
    Output(target_voices);
End Loop

Kỹ thuật hòa trộn tín hiệu môi trường (Environmental Audio Synthesis) được thực hiện bằng cách cộng đại số tín hiệu tiếng nói $s(t)$ với tín hiệu nhiễu môi trường $n(t)$ đã qua chuẩn hóa biên độ:

$$y(t) = \alpha \cdot s'(t) + \beta \cdot n(t)$$

Trong đó $s'(t)$ là tín hiệu giọng nói đã qua biến dịch tần số, $\alpha$ và $\beta$ là các hệ số trọng số tương quan nhằm đảm bảo tỷ số tín hiệu trên tạp âm (SNR - Signal-to-Noise Ratio) duy trì mức độ nhận dạng rõ ràng của lời thoại.

Thử nghiệm và Đánh giá hiệu năng

Hệ thống được kiểm thử toàn diện trên thiết bị thực tế iPhone 4/4S (iOS 5.0.1) và môi trường máy tính Windows 7 tích hợp Skype client version 5.x.

Đánh giá chất lượng âm thanh (MOS Score) trên thang điểm 5.0:

Giọng Trẻ em      [████████████████████░░░░] 4.2 / 5.0
Giọng Nam Trầm    [███████████████████░░░░░] 4.0 / 5.0
Giọng Nữ Cao      [██████████████████░░░░░░] 3.8 / 5.0
Hiệu ứng Loa Phóng Thanh [█████████████████████░░░] 4.3 / 5.0
Môi trường Hang Động     [████████████████████░░░░] 4.1 / 5.0
Hiệu ứng Giọng nói / Môi trường Hệ số Pitch ($F/F_0$) Độ biến thiên Biên độ Window Length ($W$) Thời gian thực thi ($\text{ms}$) Điểm chất lượng chủ quan (MOS / 5.0)
Giọng gốc (Baseline) 1.00 1.00 11 0.00 5.00
Giọng Nữ $\to$ Nam giới 0.65 1.15 14 18.42 4.05
Giọng Nam $\to$ Nữ giới 1.55 0.90 9 19.10 3.82
Giọng Trẻ em (Kid) 1.85 0.85 8 17.65 4.20
Loa phát thanh (Radio) 1.00 1.45 18 22.30 4.35
Vang trong núi (Echo/Cave) 0.90 Biến thiên 24 31.80 4.10
Môi trường Mưa rơi 1.00 Hòa trộn $\beta=0.35$ 11 24.50 4.40
Môi trường Đường phố 1.00 Hòa trộn $\beta=0.40$ 11 25.10 4.25

Tất cả các hiệu ứng đều có thời gian xử lý dưới ngưỡng trễ cảm nhận của tai người ($<50\text{ms}$), đảm bảo khả năng đàm thoại hai chiều liên tục không xuất hiện hiện tượng vấp tiếng (jitter/choppiness).


Đổi mới và đóng góp

  1. Tối ưu hóa thuật toán DSP cho vi xử lý di động: Đề xuất mô hình kết hợp linh hoạt 3 tham số (Pitch, Amplitude, Window Length) giúp thay thế hoàn toàn các bộ lọc số phức tạp, giảm $65%$ tải tính toán CPU so với các giải thuật dựa trên biến đổi Fourier thời gian ngắn (STFT) đa kênh.
  2. Khắc phục rào cản ứng dụng nghèo nàn trên App Store: Cung cấp hệ thống 17 preset giọng nói và 6 âm thanh nền phong phú, vượt trội so với các ứng dụng thương mại cùng thời kỳ (chỉ có từ 3 đến 5 preset cơ bản).
  3. Mô hình kết nối liên nền tảng qua Skype API Wrapper: Giải quyết triệt để bài toán biến đổi giọng nói trực tiếp trong cuộc gọi thoại VoIP thời gian thực thông qua cơ chế phân tầng truyền thông (Transport Layer) và xử lý thông điệp lệnh (Message Layer UTF-8).
  4. Cơ sở dữ liệu tham số hóa có thể tái sử dụng: Định lượng chính xác bộ tham số vật lý cho từng loại giọng nói đặc trưng, tạo tài liệu tham khảo giá trị cho các nghiên cứu tiếp theo về tổng hợp tiếng nói (Speech Synthesis) và hệ thống hỗ trợ khuyết tật phát âm.
+--------------------------------------------------------------------------+
|                  SO SÁNH CÁC GIẢI PHÁP BIẾN ĐỔI GIỌNG NÓI                |
+--------------------------+-----------------------+-----------------------+
| Tiêu chuẩn kỹ thuật      | Ứng dụng trong Đồ án  | Ứng dụng App Store    |
+--------------------------+-----------------------+-----------------------+
| Số lượng hiệu ứng giọng  | 17 Presets            | 3 - 5 Presets         |
| Hiệu ứng âm thanh nền    | 6 Môi trường          | 0 (Không hỗ trợ)      |
| Độ trễ xử lý (Latency)   | 17.6ms - 31.8ms       | > 80ms (Offline mode) |
| Đàm thoại VoIP trực tiếp | Có (Skype Plugin IPC) | Không (Sandbox chặn)  |
| Chiếm dụng bộ nhớ RAM    | < 12 MB               | ~ 40 MB               |
+--------------------------+-----------------------+-----------------------+

Ứng dụng thực tế và triển khai

Kịch bản sử dụng trong thực tế

  • Bảo mật danh tính và quyền riêng tư: Che giấu đặc tính sinh trắc học giọng nói của người gọi trong các tình huống nhạy cảm (bảo vệ nhân chứng, phản ánh tiêu cực, tổng đài hỗ trợ tâm lý).
  • Hỗ trợ người khiếm thính / Rối loạn thanh quản: Hiệu chỉnh cao độ và khuếch đại dải tần âm thanh giúp bệnh nhân bị tổn thương dây thanh quản tái tạo giọng nói dễ nghe hơn.
  • Giải trí, Game và Nội dung số: Lồng tiếng trực tiếp cho nhân vật hoạt hình, đàm thoại nhập vai trong game online (MMORPG) qua kênh voice chat.
+-------------------------------------------------------------------------+
|                  SƠ ĐỒ TRIỂN KHAI HỆ THỐNG TRÊN IPHONE                  |
|                                                                         |
|  [Thiết bị iPhone 3GS / 4 / 4S] (iOS 4.3+)                              |
|         │                                                               |
|         ├── Native App: Cài đặt trực tiếp qua IPA / Xcode Provisioning  |
|         └── Core DSP: Chạy trực tiếp trên nền tảng ARM Cortex-A8/A9     |
|                                                                         |
|  [Máy tính Trạm Windows XP / 7]                                         |
|         │                                                               |
|         ├── Skype Client 5.x Desktop                                    |
|         └── Skype Voice Plugin: Giao tiếp trực tiếp qua Local IPC       |
+-------------------------------------------------------------------------+

Yêu cầu cấu hình hệ thống

  • Môi trường iOS: Thiết bị iPhone 3GS, iPhone 4, iPhone 4S; Hệ điều hành iOS 4.3 trở lên; Bộ nhớ trống tối thiểu 50MB.
  • Môi trường Desktop (Skype Plugin): Hệ điều hành Windows XP/Vista/7; RAM tối thiểu 512MB; Skype Desktop Client phiên bản 5.x; Microphone và Sound Card hỗ trợ Full-Duplex Audio.

Hạn chế và hướng phát triển

Hạn chế kỹ thuật hiện tại

  • Rào cản Sandbox trên iOS: Cơ chế an ninh của Apple cô lập các ứng dụng trong không gian riêng, ngăn chặn ứng dụng can thiệp trực tiếp vào chip Baseband xử lý cuộc gọi viễn thông thông thường (GSM/CDMA Call).
  • Hiện tượng méo dạng âm sắc (Formant Distortion): Do giải thuật tập trung vào biến dịch tần số tổng thể (Pitch Shift) mà chưa can thiệp sâu vào các đỉnh cộng hưởng âm (Formants $F_1, F_2, F_3$), một số âm biến đổi ở cao độ lớn có thể xuất hiện hiệu ứng giọng "chipmunk" nhẹ.

Hướng phát triển mở rộng

  • Nghiên cứu tích hợp giải thuật phân tích dự báo tuyến tính (LPC - Linear Predictive Coding) và bộ lọc Cepstrum để hiệu chỉnh độc lập cao độ cơ bản ($F_0$) và bao phổ âm sắc (Spectral Envelope).
  • Nâng cấp ứng dụng tương thích với các phiên bản iOS hiện đại bằng kiến trúc Audio Unit v3 Extensions (AUv3).
  • Áp dụng các mô hình học sâu (Deep Learning) như FastSpeech, VITS hoặc RVC (Retrieval-based Voice Conversion) để chuyển đổi giọng nói mang tính tự nhiên tuyệt đối.

Đối tượng hưởng lợi

+-------------------------------------------------------------------------+
|                        CÁC NHÓM ĐỐI TƯỢNG HƯỞNG LỢI                     |
+-------------------------------------------------------------------------+
|  Sinh viên & Nghiên cứu sinh: Tài liệu chuẩn mực về DSP & Audio Framing |
+-------------------------------------------------------------------------+
|  Lập trình viên Mobile / C++: Mã nguồn mẫu Objective-C, Core Audio, IPC |
+-------------------------------------------------------------------------+
|  Doanh nghiệp VoIP & Call Center: Giải pháp ẩn danh & giả lập môi trường|
+-------------------------------------------------------------------------+
  • Sinh viên & Học viên cao học ngành CNTT/Điện tử viễn thông: Cung cấp tài liệu tham khảo chuẩn mực về xử lý tín hiệu số, quy trình lượng tử hóa tín hiệu và kỹ thuật lập trình âm thanh thời gian thực trên nền tảng di động.
  • Kỹ sư phần mềm & Lập trình viên di động: Tiếp cận cấu trúc dự án mẫu kết hợp giữa ngôn ngữ bậc cao (Objective-C) và các giải thuật xử lý mảng tốc độ cao, kỹ thuật giao tiếp liên tiến trình (IPC) với ứng dụng bên thứ ba qua API.
  • Doanh nghiệp phát triển giải pháp thoại & Trung tâm chăm sóc khách hàng: Tham khảo mô hình kiến trúc để xây dựng các giải pháp huấn luyện nhân viên qua các kịch bản cuộc gọi giả lập môi trường hoặc giải pháp bảo mật âm thanh nội bộ.

Câu hỏi thường gặp

1. Yêu cầu kỹ thuật cốt lõi để triển khai hệ thống là gì?

Hệ thống đòi hỏi môi trường biên dịch Xcode 4.x với iOS SDK 4.3/5.0 trên máy tính tính Mac OS X Lion/Snow Leopard. Mã nguồn được viết bằng Objective-C kết hợp thư viện Core Audio Framework để can thiệp tầng thấp vào bộ đệm tín hiệu (Audio Buffer Stream). Đối với thành phần mở rộng Skype, cần cài đặt Windows SDK và Skype Desktop API Wrapper để tạo tiến trình lắng nghe sự kiện cuộc gọi.

2. Giới hạn về độ trễ và khả năng mở rộng thuật toán như thế nào?

Giải thuật đạt độ trễ từ $17.6\text{ms}$ đến $31.8\text{ms}$ trên khung xử lý $20\text{ms}$, hoàn toàn đáp ứng chuẩn ITU-T G.114 về độ trễ truyền thông thoại một chiều ($<150\text{ms}$). Về khả năng mở rộng, hệ thống cho phép định nghĩa thêm hàng trăm cấu hình giọng nói mới đơn giản bằng cách bổ sung vector tham số $(A, P, W)$ vào danh sách VOICES mà không cần biên dịch lại cấu trúc lõi của engine.

3. Tại sao hệ thống không biến đổi trực tiếp cuộc gọi di động GSM trên iPhone?

Kiến trúc an ninh của iOS áp dụng mô hình Sandbox nghiêm ngặt. Phân vùng xử lý sóng viễn thông (Baseband Processor) hoàn toàn tách biệt với phân vùng hệ điều hành của bộ vi xử lý ứng dụng (Application Processor). Apple không mở API cho phép bất kỳ ứng dụng bên thứ ba nào thu âm hay can thiệp luồng dữ liệu thoại GSM trong thời gian thực. Do đó, phương án khả thi nhất là tích hợp thông qua các giao thức VoIP mở như Skype API.

4. Chi phí tính toán và bảo trì hệ thống ở mức nào?

Hệ thống sử dụng giải thuật chuyển đổi trực tiếp tham số (Transformation-based) nên độ phức tạp thuật toán chỉ đạt $O(N)$ theo kích thước khung cửa sổ ($N \approx 11 - 24$ mẫu). Nhờ đó, ứng dụng chỉ chiếm dụng dưới $8%$ năng lực CPU và tiêu thụ ít hơn $12\text{MB}$ RAM, giúp tối ưu thời lượng pin trên thiết bị di động và gần như không phát sinh chi phí duy trì hạ tầng máy chủ xử lý trung gian.

5. Khả năng mở rộng tích hợp với các ứng dụng hiện đại (Discord, Zoom, Teams)?

Mặc dù nguyên bản đồ án sử dụng Skype Desktop API (chuẩn COM/Win32), mô hình kiến trúc xử lý khung đệm Voice hoàn toàn có thể đóng gói thành một Virtual Audio Cable Driver hoặc định dạng Audio Unit Plugin (AUv3). Từ đó, luồng âm thanh đầu ra có thể định tuyến trực tiếp làm Microphone ảo (Virtual Mic) cho bất kỳ phần mềm hội thoại hiện đại nào như Discord, Zoom hay Microsoft Teams.


Kết luận

Luận văn tốt nghiệp "Xây dựng hệ thống biến đổi giọng nói trên nền tảng di động – iPhone" của học viên Nguyễn Văn Hiển đã giải quyết thành công bài toán xử lý âm thanh thời gian thực trên thiết bị di động có tài nguyên tính toán giới hạn. Bằng việc chọn lựa hướng tiếp cận chuyển đổi trực tiếp tham số (Transformation-based) thay vì tập mẫu cồng kềnh, công trình đã tối ưu hóa xuất sắc các chỉ số hiệu năng: độ trễ cực thấp ($<35\text{ms}$), chất lượng âm thanh đạt điểm MOS vượt trội ($>3.8/5.0$), hỗ trợ phong phú 17 kiểu giọng nói và 6 hiệu ứng môi trường thực tế.

Không dừng lại ở một ứng dụng độc lập trên điện thoại iPhone, giải pháp mở rộng qua plugin Skype API đã chứng minh tính ứng dụng cao trong các kịch bản đàm thoại thoại hai chiều thực tế, đặt nền móng kỹ thuật vững chắc cho các nghiên cứu phát triển hệ thống xử lý tín hiệu âm thanh chuyên sâu trên nền tảng di động tại Việt Nam.