「BGMが大きく鳴っているカフェで録音した」「iPhoneの録音補正だけでは背景のガサガサ音が消えない」という場合には、深層学習アルゴリズムを用いた音声分離AIの出番です。
現在主流となっている音声分離AIは、膨大な音響データを学習したニューラルネットワークが「人間の声の倍音成分」と「非音声ノイズ(環境音・楽器音)」を数学的に特定し、波形を壊すことなく分離します。Webブラウザ上で完結する無料サービス(例:Vocal Remover、LALAL.AIのプレビュー機能、各種オープンソース系分離エンジン)にボイスメモのオーディオファイル(.m4aや.wav)をドラッグ&ドロップするだけで、数秒から数十秒で声のみを抽出したトラックが生成されます。
かつて必須だったAudacityなどの専門波形編集ソフトによる手動フィルター調整と比較しても、AIによる分離精度は圧倒的であり、位相の乱れによる「音のこもり」も最小限に抑えられます。