\documentclass[12pt,a4paper]{article} \usepackage{fontspec} \usepackage{polyglossia} \setmainlanguage[spelling=modern]{russian} \setotherlanguage{english} \setmainfont{Times New Roman} \setmonfont{Courier New} \usepackage{graphicx} \usepackage{amsmath} \usepackage{amssymb} \usepackage{booktabs} \usepackage{multirow} \usepackage{geometry} \geometry{top=2cm, bottom=2cm, left=2.5cm, right=2cm} \usepackage{setspace} \onehalfspacing \usepackage{hyperref} \usepackage{float} \begin{document} \section{Введение} Цель работы~--- оценка эффективности метода восстановления звуковых сигналов с использованием нейросетевой модели DeepFilterNet3, интегрированной в среду Audacity через OpenVINO. В качестве исходного материала использована запись голоса (VoiceA), к которой был добавлен шум (SNR~1~dB). Восстановление выполнялось алгоритмом DeepFilterNet3. \section{Метрики оценки качества} Для количественной оценки использовались следующие метрики: \begin{itemize} \item \textbf{SNR (Signal-to-Noise Ratio)}~--- отношение мощности сигнала к мощности шума; \item \textbf{Segmental SNR}~--- усреднённый SNR по сегментам 30~ms с клиппированием {[}-10, 35{]}~dB; \item \textbf{LSD (Log-Spectral Distance)}~--- среднеквадратичное логарифмическое спектральное расстояние; \item \textbf{Коэффициент корреляции Пирсона} между сигналами; \item \textbf{RMSE (Root Mean Square Error)}~--- среднеквадратичная ошибка; \item \textbf{Фактор шумоподавления}~--- отношение дисперсии шума до и после обработки. \end{itemize} \section{Результаты} \subsection{Сводная таблица метрик} \begin{table}[H] \centering \caption{Сравнение метрик для зашумлённого и восстановленного сигналов} \label{tab:metrics} \begin{tabular}{lrrr} \toprule Метрика & Шумный & Восстановленный & Улучшение \\ \midrule SNR (dB) & 0.92 & 2.36 & +1.44 \\ Segmental SNR (dB)& $-$1.45 & 1.26 & +2.71 \\ LSD (dB) & 73.78 & 31.34 & $-$42.44 \\ Корреляция & 0.6664 & 0.6633 & $-$0.0031 \\ RMSE & 9202 & 7801 & 15.2\% \\ Шумоподавление (dB)& --- & --- & +1.44 \\ \bottomrule \end{tabular} \end{table} \subsection{Анализ результатов} DeepFilterNet3 демонстрирует следующие результаты: \begin{itemize} \item \textbf{SNR +1.44~dB}: прирост отношения сигнал/шум положительный, однако скромный. Исходный SNR~0.9~dB был крайне низким~--- модель работает в условиях сильного шума. \item \textbf{Segmental SNR +2.71~dB}: посегментный анализ показывает более существенное улучшение на коротких интервалах, что говорит о качественном подавлении шума в паузах. \item \textbf{LSD $-$42.44~dB}: резкое снижение логарифмического спектрального расстояния~--- спектральная форма восстановленного сигнала значительно ближе к оригиналу, чем у шумного. \item \textbf{Корреляция}: практически не изменилась (0.666 против 0.663). Это связано с тем, что шум аддитивный и не разрушает линейную структуру сигнала, а слабое подавление не восстанавливает корреляцию. \item \textbf{RMSE}: снизилась на 15\%~--- амплитудная ошибка уменьшилась. \end{itemize} Ключевое наблюдение: модель эффективно подавляет шум в \textit{спектральной} области (LSD падает в 2.4~раза), но вклад шума в амплитудную ошибку остаётся значительным. Это характерно для DeepFilterNet, которая работает в частотной области. \subsection{Визуализация} На рис.~\ref{fig:analysis} представлен комплексный анализ сигналов. \begin{figure}[H] \centering \includegraphics[width=\textwidth]{analysis_plot.png} \caption{Сравнение исходного, зашумлённого и восстановленного сигналов. Строки: (1)~осциллограммы, (2)~спектрограммы, (3)~усреднённые спектры, (4)~спектрограмма шума, ошибки восстановления и LSD(t).} \label{fig:analysis} \end{figure} \subsection{Спектральный анализ} По спектрограммам (рис.~\ref{fig:analysis}, строка~2) видно: \begin{itemize} \item Шум занимает широкий частотный диапазон (0--8~kHz) и маскирует формантные структуры голоса. \item Восстановленный сигнал имеет более чистую спектральную картину; шумовой фон в паузах подавлен. \item Высокочастотные компоненты (>4~kHz) восстанавливаются хуже~--- часть гармоник теряется. \end{itemize} Спектрограммы остаточной ошибки (строка~4, центр) показывают, что наибольшая ошибка восстановления сосредоточена в области 1--3~kHz, где энергия голоса максимальна~--- модель осторожничает и не подавляет шум в этой области, чтобы не исказить речь. \section{Заключение} DeepFilterNet3 в Audacity (OpenVINO) показал следующие результаты: \begin{itemize} \item Улучшение SNR на +1.44~dB и Segmental SNR на +2.71~dB; \item Значительное снижение спектрального искажения (LSD с 73.8 до 31.3~dB); \item Снижение RMSE на 15\%; \item Корреляция с оригиналом практически не изменилась. \end{itemize} Метод эффективен для подавления широкополосного шума, особенно заметен эффект в паузах между речевыми сегментами. При очень низком исходном SNR ($\sim$1~dB) полное восстановление невозможно, однако модель демонстрирует разумный компромисс между подавлением шума и сохранением речевого сигнала. Для лучших результатов рекомендовано использовать более высокое качество входного сигнала (SNR~5--10~dB) или комбинировать DeepFilterNet с предварительной фильтрацией. \end{document}