Добавить отчёт (tex+pdf) и ipynb с анализом восстановления аудио DeepFilterNet3

This commit is contained in:
2026-06-27 07:11:43 +03:00
commit 7a7e9205ac
3 changed files with 371 additions and 0 deletions
+109
View File
@@ -0,0 +1,109 @@
\documentclass[12pt,a4paper]{article}
\usepackage{fontspec}
\usepackage{polyglossia}
\setmainlanguage[spelling=modern]{russian}
\setotherlanguage{english}
\setmainfont{Times New Roman}
\setmonfont{Courier New}
\usepackage{graphicx}
\usepackage{amsmath}
\usepackage{amssymb}
\usepackage{booktabs}
\usepackage{multirow}
\usepackage{geometry}
\geometry{top=2cm, bottom=2cm, left=2.5cm, right=2cm}
\usepackage{setspace}
\onehalfspacing
\usepackage{hyperref}
\usepackage{float}
\begin{document}
\section{Введение}
Цель работы~--- оценка эффективности метода восстановления звуковых сигналов с использованием нейросетевой модели DeepFilterNet3, интегрированной в среду Audacity через OpenVINO. В качестве исходного материала использована запись голоса (VoiceA), к которой был добавлен шум (SNR~1~dB). Восстановление выполнялось алгоритмом DeepFilterNet3.
\section{Метрики оценки качества}
Для количественной оценки использовались следующие метрики:
\begin{itemize}
\item \textbf{SNR (Signal-to-Noise Ratio)}~--- отношение мощности сигнала к мощности шума;
\item \textbf{Segmental SNR}~--- усреднённый SNR по сегментам 30~ms с клиппированием {[}-10, 35{]}~dB;
\item \textbf{LSD (Log-Spectral Distance)}~--- среднеквадратичное логарифмическое спектральное расстояние;
\item \textbf{Коэффициент корреляции Пирсона} между сигналами;
\item \textbf{RMSE (Root Mean Square Error)}~--- среднеквадратичная ошибка;
\item \textbf{Фактор шумоподавления}~--- отношение дисперсии шума до и после обработки.
\end{itemize}
\section{Результаты}
\subsection{Сводная таблица метрик}
\begin{table}[H]
\centering
\caption{Сравнение метрик для зашумлённого и восстановленного сигналов}
\label{tab:metrics}
\begin{tabular}{lrrr}
\toprule
Метрика & Шумный & Восстановленный & Улучшение \\
\midrule
SNR (dB) & 0.92 & 2.36 & +1.44 \\
Segmental SNR (dB)& $-$1.45 & 1.26 & +2.71 \\
LSD (dB) & 73.78 & 31.34 & $-$42.44 \\
Корреляция & 0.6664 & 0.6633 & $-$0.0031 \\
RMSE & 9202 & 7801 & 15.2\% \\
Шумоподавление (dB)& --- & --- & +1.44 \\
\bottomrule
\end{tabular}
\end{table}
\subsection{Анализ результатов}
DeepFilterNet3 демонстрирует следующие результаты:
\begin{itemize}
\item \textbf{SNR +1.44~dB}: прирост отношения сигнал/шум положительный, однако скромный. Исходный SNR~0.9~dB был крайне низким~--- модель работает в условиях сильного шума.
\item \textbf{Segmental SNR +2.71~dB}: посегментный анализ показывает более существенное улучшение на коротких интервалах, что говорит о качественном подавлении шума в паузах.
\item \textbf{LSD $-$42.44~dB}: резкое снижение логарифмического спектрального расстояния~--- спектральная форма восстановленного сигнала значительно ближе к оригиналу, чем у шумного.
\item \textbf{Корреляция}: практически не изменилась (0.666 против 0.663). Это связано с тем, что шум аддитивный и не разрушает линейную структуру сигнала, а слабое подавление не восстанавливает корреляцию.
\item \textbf{RMSE}: снизилась на 15\%~--- амплитудная ошибка уменьшилась.
\end{itemize}
Ключевое наблюдение: модель эффективно подавляет шум в \textit{спектральной} области (LSD падает в 2.4~раза), но вклад шума в амплитудную ошибку остаётся значительным. Это характерно для DeepFilterNet, которая работает в частотной области.
\subsection{Визуализация}
На рис.~\ref{fig:analysis} представлен комплексный анализ сигналов.
\begin{figure}[H]
\centering
\includegraphics[width=\textwidth]{analysis_plot.png}
\caption{Сравнение исходного, зашумлённого и восстановленного сигналов. Строки: (1)~осциллограммы, (2)~спектрограммы, (3)~усреднённые спектры, (4)~спектрограмма шума, ошибки восстановления и LSD(t).}
\label{fig:analysis}
\end{figure}
\subsection{Спектральный анализ}
По спектрограммам (рис.~\ref{fig:analysis}, строка~2) видно:
\begin{itemize}
\item Шум занимает широкий частотный диапазон (0--8~kHz) и маскирует формантные структуры голоса.
\item Восстановленный сигнал имеет более чистую спектральную картину; шумовой фон в паузах подавлен.
\item Высокочастотные компоненты (>4~kHz) восстанавливаются хуже~--- часть гармоник теряется.
\end{itemize}
Спектрограммы остаточной ошибки (строка~4, центр) показывают, что наибольшая ошибка восстановления сосредоточена в области 1--3~kHz, где энергия голоса максимальна~--- модель осторожничает и не подавляет шум в этой области, чтобы не исказить речь.
\section{Заключение}
DeepFilterNet3 в Audacity (OpenVINO) показал следующие результаты:
\begin{itemize}
\item Улучшение SNR на +1.44~dB и Segmental SNR на +2.71~dB;
\item Значительное снижение спектрального искажения (LSD с 73.8 до 31.3~dB);
\item Снижение RMSE на 15\%;
\item Корреляция с оригиналом практически не изменилась.
\end{itemize}
Метод эффективен для подавления широкополосного шума, особенно заметен эффект в паузах между речевыми сегментами. При очень низком исходном SNR ($\sim$1~dB) полное восстановление невозможно, однако модель демонстрирует разумный компромисс между подавлением шума и сохранением речевого сигнала. Для лучших результатов рекомендовано использовать более высокое качество входного сигнала (SNR~5--10~dB) или комбинировать DeepFilterNet с предварительной фильтрацией.
\end{document}