研究有時候是一場長跑,但偶爾也會有一週讓你看見終點線。本週(2026-05-26 至 2026-06-01), DOF Lab 的 RAG Ultimate 研究平台迎來了 Phase 3 風電 RAG 論文主線的重大收束: 27 組檢索矩陣實驗全部完成,Friedman 統計顯著性確認,RAGAS 生成層評測四項指標齊備, 論文六大章節全文寫畢,期刊格式(LaTeX + DOCX)完整輸出。 這週累計了 42 個 git commit,是今年以來單週密度最高的一次衝刺。
一、27 組檢索矩陣:從策略到實驗設計
風電領域的技術文件有其特殊性:OEM 維修手冊動輒數百頁, 術語密集(功率曲線、風速剖面、狀態估測、預防性維護週期), 且同一問題往往需要橫跨多個章節才能完整回答。 這種文件特性讓「選擇正確的文本切割與檢索策略」對 RAG 系統的表現有決定性影響, 而這正是本研究想要系統性地量化的問題。
實驗設計採用 3 × 3 × 3 的正交矩陣:
- 切割策略(Chunking Strategy):Sentence、Paragraph、Recursive Character
- Chunk Size:256 / 512 / 1024 tokens
- Overlap:0 / 64 / 128 tokens(依比例調整)
每種組合以相同的 Embedding Model(intfloat/multilingual-e5-large) 建立 Qdrant 向量索引,並針對涵蓋四個機型技術手冊的 200 道問題集, 計算 Hit@5 與 MRR@5 兩項檢索層指標。 最終得到一個 27 × 2 的真實數據矩陣(matrix.csv), 作為論文 Results 章節的核心資料來源。
為什麼需要 27 組實驗?
在許多 RAG 研究中,「切割策略」往往是研究者憑直覺選定的超參數, 而非透過系統性實驗確認的選擇。DOF Lab 的立場是: 對於特定領域(尤其是術語密集的工業文件), 不同切割策略的效果差異可能遠超過模型本身的差異。 這 27 組實驗的目的,正是要在統計顯著性層面確認這個假設—— 而 Friedman 非參數檢驗結果(p < 0.05)也確實支持了「策略差異顯著存在」的論點。
二、RAGAS 生成層評測:補上論文最大缺口
檢索層的矩陣實驗確認了「哪種切割策略找得到相關段落」, 但一個 RAG 系統最終的使用者體驗,取決於生成層的品質—— LLM 拿到正確的 context 之後,是否能夠回答得準確、流暢、且忠實於原文? 這是早期草稿版本的最大缺口,也是同行審閱者最容易提問的地方。
本週完成的 RAGAS 評測,以最佳檢索組合(Paragraph + 512 + 64)搭配 4 個機型, 從 200 道問題中均勻抽取 40 道題目, 讓 LLM(Gemini 1.5 Flash)在 Qdrant 向量索引上進行端對端 QA, 並以 RAGAS 框架計算四項指標:
Faithfulness 0.81 代表 LLM 的回答中有 81% 的聲明可以直接從檢索段落中找到對應依據, Answer Relevancy 0.87 則顯示回答對問題的針對性相當高。 Context Precision 與 Recall 在 0.76–0.79 之間, 反映出風電手冊術語密集、段落跨章節的特性對檢索精度確實有壓力, 也是下一步可以進一步提升的空間。
💡 RAGAS 評測的正確使用姿勢
RAGAS 框架的一個常見誤用是把「高分」當成終極目標。 在本研究中,RAGAS 分數的價值在於提供不同策略之間的相對對比基線, 以及確認「最佳檢索組合在生成層是否同樣有效」。 特別值得注意的是,RAGAS 的計算本身也依賴 LLM 評分, 因此研究團隊嚴格區分了「冒煙測試值」(開發期的快速估算) 與「真實 40 題數據」(論文引用的正式結果), 並在最後一個 commit 中明確修正了先前誤入的冒煙測試彙總值, 確保論文引用的數字完全來自真實實驗。
三、論文六大章節完成與研究交接文件
除了實驗資料,本週也完成了論文正文的六大章節撰寫: Abstract、Introduction、Related Work、Methodology、Experimental Results 與 Discussion/Limitations。 Results 章節包含 6 張以 matplotlib 繪製的真實數據圖表, 涵蓋檢索矩陣熱力圖、最佳策略 MRR 分布、RAGAS 四指標雷達圖等視覺化呈現。
論文格式同時輸出為 LaTeX 期刊格式(針對 IEEE Access 投稿規範) 與 Word DOCX(供指導教授審閱與院內共同作者協作), 兩種格式均透過自動化腳本(scripts/format_paper.py)維護一致性, 避免手動同步兩份文件產生的版本漂移。
研究室另外完成了一份 WindRAG 研究交接文件, 清楚列出後續工作 A–E 五項:
- A — 手冊 Proxy Benchmark 完整驗證:4 機型 × 200Q = 800 題, 確認最佳策略在未見機型上的泛化能力
- B — Ablation Study:移除 Re-ranking 與 Hybrid Search, 量化各組件的貢獻度
- C — 期刊投稿前 Related Work 補充:加入 2025–2026 年新發表的 Wind RAG 相關論文
- D — RAGAS 擴充至全量 200Q:目前 40Q 為先行評測, 投稿前需確認規模擴充後的指標穩定性
- E — 使用者研究(optional):邀請實際從事風機運維的工程師進行 A/B 測試
| 論文章節 | 狀態 | 核心內容 |
|---|---|---|
| Abstract | ✅ 完成 | 研究動機、方法摘要、主要發現 |
| Introduction | ✅ 完成 | 風電 O&M 知識挑戰、RAG 技術背景、研究貢獻 |
| Related Work | ✅ 完成(待補充 C) | 工業文件 RAG、風能 AI、RAGAS 評測框架 |
| Methodology | ✅ 完成 | 資料集、實驗設計、3×3×3 矩陣、評測指標定義 |
| Experimental Results | ✅ 完成 | 27 組矩陣、Friedman 統計、RAGAS 四指標、6 張圖表 |
| Discussion / Limitations | ✅ 完成 | 最佳組合分析、泛化限制、未來工作 |
研究室行動項目與本週啟示
✅ 下一步:投稿前的五項準備
論文全稿完成後,正式投稿前仍有幾個關鍵動作需要執行:
- 完成交接文件中的 A(800Q Proxy Benchmark), 確認最佳策略跨機型泛化,避免結論過度依賴特定機型手冊特性
- 決定目標期刊(IEEE Access / Energies / Applied Energy), 並根據投稿規範調整格式(字數上限、References 格式、圖表解析度)
- 完成 Related Work C 項補充,確保引用時效性符合期刊要求
- 邀請共同作者(院內風能領域教師)進行一輪 Peer Review, 重點確認 Methodology 的描述對非 RAG 背景讀者是否足夠清晰
- 確認所有圖表的字型大小、顏色對比符合期刊印刷版本要求
回顧本週的衝刺歷程,有一個面向特別值得記錄: 實驗誠信(research integrity)在 AI 研究中的重要性,遠比表面看起來更微妙。 在最後一個 commit(bdf3e43)中, 研究團隊發現先前整理摘要時誤入了開發期的冒煙測試值(非正式的快速估算數字), 並在論文引用前及時修正,確保所有數字都來自嚴格執行的 40 題正式評測。
這個細節看似微小,但它觸及了 AI 研究可重現性的核心問題: 冒煙測試值的存在是必要的(用來快速確認管線是否暢通), 但它絕對不能被當作論文的引用數字。 在高速衝刺的論文寫作期,區分「快速估算」與「正式結果」的紀律, 往往是研究品質最脆弱的環節之一。 RAG Ultimate 的解法是透過明確的 commit message 標記(fix: 修正先前誤入的冒煙測試值), 讓版本控制本身成為研究誠信的稽核軌跡。
Git 版本控制作為研究誠信的基礎設施
本週的研究歷程再次印證了一個觀點: 對研究型程式碼庫而言,git commit 不只是技術紀錄,更是研究決策的歷史脈絡。 42 個 commit 裡,最有價值的可能不是加了哪個功能, 而是那些明確標記「修正」、「誠實標記未完成」的 commit—— 它們讓整個研究過程在事後可以被完整還原, 而不是只留下一個看不出來路的「最終版本」。 這種實踐對研究室的學生成員尤其重要, 因為養成「commit 即紀錄」的習慣,就是在建立研究工作的基本誠信基礎。
對於有意進入 RAG 研究領域的工程師或研究生, 本週的工作流程提供了一個具體的參考樣板: 先確立完整的實驗矩陣設計(不要邊跑邊改)、 分層建立評測管線(先檢索層再生成層)、 用統計檢驗支撐定量結論(而非只挑選最好看的結果)、 最後保持版本控制的嚴格紀律。 這四個步驟組合起來,就是一份能夠通過同行審閱的研究論文的基本工程底座。
本週其他進展: Z72 SCADA 系統(progress 98%)完成了振動健康橋接模組的單元測試套件, 並在 Phase 3b ADR 中正式採納 FastAPI 作為後端框架; AI Graphic Studio(progress 97%)持續迭代介面; Face Recognition Attendance 系統達到 100% 完成,正式轉入 production 階段。