110 lines
7.7 KiB
TeX
110 lines
7.7 KiB
TeX
\documentclass[12pt,a4paper]{article}
|
||
\usepackage{fontspec}
|
||
\usepackage{polyglossia}
|
||
\setmainlanguage[spelling=modern]{russian}
|
||
\setotherlanguage{english}
|
||
\setmainfont{Times New Roman}
|
||
\setmonfont{Courier New}
|
||
|
||
\usepackage{graphicx}
|
||
\usepackage{amsmath}
|
||
\usepackage{amssymb}
|
||
\usepackage{booktabs}
|
||
\usepackage{multirow}
|
||
\usepackage{geometry}
|
||
\geometry{top=2cm, bottom=2cm, left=2.5cm, right=2cm}
|
||
\usepackage{setspace}
|
||
\onehalfspacing
|
||
\usepackage{hyperref}
|
||
\usepackage{float}
|
||
|
||
\begin{document}
|
||
|
||
\section{Введение}
|
||
|
||
Цель работы~--- оценка эффективности метода восстановления звуковых сигналов с использованием нейросетевой модели DeepFilterNet3, интегрированной в среду Audacity через OpenVINO. В качестве исходного материала использована запись голоса (VoiceA), к которой был добавлен шум (SNR~1~dB). Восстановление выполнялось алгоритмом DeepFilterNet3.
|
||
|
||
\section{Метрики оценки качества}
|
||
|
||
Для количественной оценки использовались следующие метрики:
|
||
\begin{itemize}
|
||
\item \textbf{SNR (Signal-to-Noise Ratio)}~--- отношение мощности сигнала к мощности шума;
|
||
\item \textbf{Segmental SNR}~--- усреднённый SNR по сегментам 30~ms с клиппированием {[}-10, 35{]}~dB;
|
||
\item \textbf{LSD (Log-Spectral Distance)}~--- среднеквадратичное логарифмическое спектральное расстояние;
|
||
\item \textbf{Коэффициент корреляции Пирсона} между сигналами;
|
||
\item \textbf{RMSE (Root Mean Square Error)}~--- среднеквадратичная ошибка;
|
||
\item \textbf{Фактор шумоподавления}~--- отношение дисперсии шума до и после обработки.
|
||
\end{itemize}
|
||
|
||
\section{Результаты}
|
||
|
||
\subsection{Сводная таблица метрик}
|
||
|
||
\begin{table}[H]
|
||
\centering
|
||
\caption{Сравнение метрик для зашумлённого и восстановленного сигналов}
|
||
\label{tab:metrics}
|
||
\begin{tabular}{lrrr}
|
||
\toprule
|
||
Метрика & Шумный & Восстановленный & Улучшение \\
|
||
\midrule
|
||
SNR (dB) & 0.92 & 2.36 & +1.44 \\
|
||
Segmental SNR (dB)& $-$1.45 & 1.26 & +2.71 \\
|
||
LSD (dB) & 73.78 & 31.34 & $-$42.44 \\
|
||
Корреляция & 0.6664 & 0.6633 & $-$0.0031 \\
|
||
RMSE & 9202 & 7801 & 15.2\% \\
|
||
Шумоподавление (dB)& --- & --- & +1.44 \\
|
||
\bottomrule
|
||
\end{tabular}
|
||
\end{table}
|
||
|
||
\subsection{Анализ результатов}
|
||
|
||
DeepFilterNet3 демонстрирует следующие результаты:
|
||
|
||
\begin{itemize}
|
||
\item \textbf{SNR +1.44~dB}: прирост отношения сигнал/шум положительный, однако скромный. Исходный SNR~0.9~dB был крайне низким~--- модель работает в условиях сильного шума.
|
||
\item \textbf{Segmental SNR +2.71~dB}: посегментный анализ показывает более существенное улучшение на коротких интервалах, что говорит о качественном подавлении шума в паузах.
|
||
\item \textbf{LSD $-$42.44~dB}: резкое снижение логарифмического спектрального расстояния~--- спектральная форма восстановленного сигнала значительно ближе к оригиналу, чем у шумного.
|
||
\item \textbf{Корреляция}: практически не изменилась (0.666 против 0.663). Это связано с тем, что шум аддитивный и не разрушает линейную структуру сигнала, а слабое подавление не восстанавливает корреляцию.
|
||
\item \textbf{RMSE}: снизилась на 15\%~--- амплитудная ошибка уменьшилась.
|
||
\end{itemize}
|
||
|
||
Ключевое наблюдение: модель эффективно подавляет шум в \textit{спектральной} области (LSD падает в 2.4~раза), но вклад шума в амплитудную ошибку остаётся значительным. Это характерно для DeepFilterNet, которая работает в частотной области.
|
||
|
||
\subsection{Визуализация}
|
||
|
||
На рис.~\ref{fig:analysis} представлен комплексный анализ сигналов.
|
||
|
||
\begin{figure}[H]
|
||
\centering
|
||
\includegraphics[width=\textwidth]{analysis_plot.png}
|
||
\caption{Сравнение исходного, зашумлённого и восстановленного сигналов. Строки: (1)~осциллограммы, (2)~спектрограммы, (3)~усреднённые спектры, (4)~спектрограмма шума, ошибки восстановления и LSD(t).}
|
||
\label{fig:analysis}
|
||
\end{figure}
|
||
|
||
\subsection{Спектральный анализ}
|
||
|
||
По спектрограммам (рис.~\ref{fig:analysis}, строка~2) видно:
|
||
\begin{itemize}
|
||
\item Шум занимает широкий частотный диапазон (0--8~kHz) и маскирует формантные структуры голоса.
|
||
\item Восстановленный сигнал имеет более чистую спектральную картину; шумовой фон в паузах подавлен.
|
||
\item Высокочастотные компоненты (>4~kHz) восстанавливаются хуже~--- часть гармоник теряется.
|
||
\end{itemize}
|
||
|
||
Спектрограммы остаточной ошибки (строка~4, центр) показывают, что наибольшая ошибка восстановления сосредоточена в области 1--3~kHz, где энергия голоса максимальна~--- модель осторожничает и не подавляет шум в этой области, чтобы не исказить речь.
|
||
|
||
\section{Заключение}
|
||
|
||
DeepFilterNet3 в Audacity (OpenVINO) показал следующие результаты:
|
||
\begin{itemize}
|
||
\item Улучшение SNR на +1.44~dB и Segmental SNR на +2.71~dB;
|
||
\item Значительное снижение спектрального искажения (LSD с 73.8 до 31.3~dB);
|
||
\item Снижение RMSE на 15\%;
|
||
\item Корреляция с оригиналом практически не изменилась.
|
||
\end{itemize}
|
||
|
||
Метод эффективен для подавления широкополосного шума, особенно заметен эффект в паузах между речевыми сегментами. При очень низком исходном SNR ($\sim$1~dB) полное восстановление невозможно, однако модель демонстрирует разумный компромисс между подавлением шума и сохранением речевого сигнала. Для лучших результатов рекомендовано использовать более высокое качество входного сигнала (SNR~5--10~dB) или комбинировать DeepFilterNet с предварительной фильтрацией.
|
||
|
||
\end{document}
|