回上一頁

Podcast
智慧搜尋系統

開發者:楊媛晴 曾子珊 陳妙音 林依婷
指導教授:邱嘉豪 助理教授
東吳大學資料科學系 114 學年度專題(第 5 組)
Podcast 智慧搜尋系統海報
專案介紹
隨著 Podcast 收聽量在近年快速成長,使用者對內容檢索的需求亦日益提升。然而,傳統以關鍵詞為基礎的搜尋方法在處理非結構化音訊資料時受限甚多,多仰賴自動語音辨識(ASR)轉錄文字進行比對,易因轉錄錯誤與語意缺失而降低檢索精確度。

本專案提出一個結合大型語言模型(LLMs)與檢索增強生成(RAG)的 Podcast 智慧搜尋系統,透過語意向量化、語料分群與自我校正機制,強化系統對非結構化語音內容的理解能力。研究團隊從資料收集、前處理、語意生成到輸出前端的各階段進行系統性設計,並以戲劇類 Podcast 為實作範例。

實驗結果顯示:本研究提出之動態去冗分群機制可使平均查詢時間縮短約 19.5%、標準差由 9.07 秒降至 3.97 秒;自我校正迴圈搭配動態去冗使回覆事實性顯著提升(Cohen's d 達 6.17,p < 0.001)。在使用者問卷中(n = 42),本系統三項情境題回覆品質皆顯著優於 Apple Podcast 與 Spotify(p < 0.01)。
主要功能
🎙 音訊語料結構化
透過 OpenAI Whisper 將 Podcast 原始音訊轉換為逐字稿,再以生成式 AI 進行句法與語意修正,提升斷句、語氣連貫與語意完整度。
OpenAI Whisper 語意修正
🧠 語意向量化與檢索
採用 Hugging Face 語意嵌入模型,將修正後的文本片段映射至連續向量空間,並儲存於 FAISS 向量資料庫,支援高維語意相似度檢索。
Hugging Face FAISS
🔍 動態去冗分群機制
以查詢向量與語料中心的相似度動態決定保留比例,並依語意分散度(熵)自動調整 K 值,縮小搜尋空間、提升檢索效率(最佳設定 4 群 × 每群 3 筆)。
K-Means Dynamic Pruning Adaptive Clustering
🔁 自我校正迴圈
以事實性、一致性與切題性三項評分前置檢核 LLM 回覆。低於閾值時觸發知識迴圈與回覆迴圈迭代修正,降低幻覺並提升回覆品質。
Self-Reflection Prompt Engineering
💬 生成式回覆
以 LLM 整合多片段語意資訊產生具摘要性與連貫性的最終回答;提供事實性、一致性與切題性的可控品質保障。
RAG LLMs
🖥 互動式前端介面
以 Gradio 建構互動介面,提供查詢結果呈現、節目資訊瀏覽與個人化 Podcast 參考,降低操作門檻。
Gradio
實驗成效
↓19.5%
平均查詢時間
(18.30s → 14.73s)
↓56.2%
查詢時間標準差
(9.07 → 3.97)
6.17
事實性 Cohen's d
(p < 0.001)
4.84 / 7
使用者滿意度平均
(n = 42,七分量表)
動態去冗分群:查詢時間優化
基線(無剪枝)vs 動態去冗分群(4 群 × 3 筆),含平均與標準差
① 平均查詢時間(秒) 基線 18.30s 動態去冗 14.73s ↓ 19.5% ② 查詢時間標準差(秒・穩定性) 基線 9.07s 動態去冗 3.97s ↓ 56.2% 0 5 10 15 20 秒(s)
基線(無動態剪枝)
動態去冗分群
使用者滿意度與顯著性檢驗
七分量表平均、事實性效應量、顯著性水準與樣本數
4.84 / 7 整體滿意度(七分量表) 三項情境題優於 Apple Podcast / Spotify (p<0.01) 統計顯著性檢驗 事實性效應量(Cohen's d) 6.17 極大效應量 顯著性水準(p-value) < 0.001 高度顯著 使用者樣本數 n = 42
自我校正迴圈搭配動態去冗使回覆事實性顯著提升;資料來源:實驗結果統計檢定(30 頁報告書)
技術架構圖
六大模組系統流程:離線知識庫建構 ✕ 線上查詢處理
📚 離線:知識庫建構 🔍 線上:查詢處理 🎙 Podcast 原始音訊 戲劇類 Podcast 語料 ① OpenAI Whisper ASR 音訊 → 逐字稿轉寫 LLM 語意 / 斷句修正 提升語意連貫度 ② Hugging Face Embedding 文本 → 高維語意向量 🗄 FAISS 向量資料庫 支援高維語意相似度檢索 ⑥ Gradio 使用者查詢 👤 互動式前端介面 查詢向量化 採用相同 Embedding 模型 ③ 動態去冗分群 自適應 K-Means · 最佳 4 群 × 3 筆 向量檢索 ⑤ LLM 生成式回覆(RAG) 融合多片段語意資訊 ④ 自我校正迴圈 事實性 / 一致性 / 切題性 三項評分 ↺ 不達標 回傳結果 三層式系統:資料層 → 檢索層 → 生成層 │ 六大模組標號 ① ~ ⑥
推論主流程
自我校正迴圈
結果回傳
系統採三層式架構:音訊語料結構化 → 語意檢索(向量化 + 動態去冗分群)→ 生成式回答(自我校正迴圈)。完整海報(含原始流程圖與機制圖)可於下方下載。
StarkLab