在多人同時說話或充滿雜音的環境中,我們常常能透過「看著對方」更容易聽清楚他在說什麼。人工智慧也能做到嗎? 本次活動將展示「影音語音增強(Audio-Visual Speech Enhancement, AVSE)」技術,讓 AI 同時運用人臉影像與聲音資訊,在多人交談、背景雜音,甚至影像模糊、遮擋或影音不同步的情況下,辨識並分離出目標說話者的聲音,再進一步降低雜訊、提升語音清晰度。 透過實際影音展示,帶領大家認識 AI 如何結合「看」與「聽」,讓複雜真實環境中的人聲變得更清楚。
活動訊息
主辦單位
適合對象
參加須知
聯絡人
曹昱
2787-2390
yutsao@as.edu.tw