pdf-to-summary
讀取 PDF 檔案,產出結構化摘要。當用戶說「摘要 PDF」「summarize PDF」「PDF 重點」「讀這份 PDF」時使用。
PDF → 結構化摘要
目標
讀取 PDF 檔案(文字型),提取內容並產出結構化摘要,支援長文件分段處理。
適用範圍
- 文字型 PDF(可選取文字的)
- 技術文件、論文、報告、提案
- 長度不限(自動分段)
不適用
- 掃描型 PDF(純圖片,需要 OCR)→ 提示用戶先轉檔
- 有密碼保護的 PDF
- 主要是表格/圖表的 PDF(摘要效果有限)
流程
Step 0: 檢查 PDF 讀取能力
Claude CLI 內建的 Read tool 可以直接讀取 PDF 檔案。先嘗試直接讀取:
使用 Read tool 讀取 PDF 檔案,指定 pages 參數(如 "1-5")
如果 PDF 太大(>20 頁),需要分段讀取。
Step 1: 快速掃描
先讀取前 3 頁,了解文件結構:
- 文件類型(論文 / 報告 / 提案 / 技術文件 / 其他)
- 總頁數
- 章節結構(如果有目錄)
- 語言
向用戶報告:
PDF 概要:
- 檔案:{filename}
- 頁數:{N} 頁
- 類型:{type}
- 語言:{language}
- 章節:{section_list}
要產出完整摘要嗎?(預計需要讀取 {N} 頁)
Step 2: 分段讀取
按章節或每 10 頁為一段讀取:
Read tool: pages="1-10"
Read tool: pages="11-20"
...
每段讀完提取:
- 關鍵論點
- 重要數據
- 結論/建議
Step 3: 產出結構化摘要
根據文件類型選擇模板:
論文/研究報告
# 摘要:{論文標題}
> 來源:{檔名} | 頁數:{N} | 語言:{lang}
## 核心發現(TL;DR)
{2-3 句話概括最重要的結論}
## 研究問題
{這篇論文要回答什麼問題}
## 方法
{用了什麼方法/資料/模型}
## 關鍵數據
| 指標 | 數值 | 備註 |
|------|------|------|
| ... | ... | ... |
## 結論
{主要結論,帶數字}
## 限制
{作者提到的限制或未解決的問題}
## 與我相關
{這篇論文對用戶的工作可能有什麼啟發}
商業報告/提案
# 摘要:{報告標題}
> 來源:{檔名} | 頁數:{N} | 語言:{lang}
## 核心結論(TL;DR)
{2-3 句話概括}
## 關鍵數據
| 指標 | 數值 | 頁碼 |
|------|------|------|
| ... | ... | p.X |
## 主要建議/行動項目
1. {建議 1}(p.X)
2. {建議 2}(p.X)
## 風險/注意事項
{報告中提到的風險或 caveats}
## 章節摘要
### {章節 1}(p.X-Y)
{2-3 句摘要}
### {章節 2}(p.X-Y)
{2-3 句摘要}
技術文件
# 摘要:{文件標題}
> 來源:{檔名} | 頁數:{N} | 語言:{lang}
## 這是什麼
{一句話說明這份文件的用途}
## 重點速讀
1. {重點 1}
2. {重點 2}
3. {重點 3}
## 架構/流程
{如果有架構圖或流程,用文字描述}
## 關鍵規格
| 項目 | 規格 | 頁碼 |
|------|------|------|
| ... | ... | p.X |
## 注意事項
{文件中強調的限制、前提條件、相容性要求}
Step 4: 頁碼標註
所有摘要中的重要資訊都標註頁碼(p.X),方便用戶回查原文。
Step 5: 輸出
- 展示摘要給用戶
- 詢問是否儲存(預設:
{filename}-summary.md) - 詢問是否需要針對特定章節深入展開
Quality Gates
- TL;DR 在 3 句以內
- 關鍵數據有標註頁碼
- 摘要長度不超過原文的 20%
- 不添加原文沒有的觀點
- 專有名詞保留原文用語
Heuristics
- 論文 → 優先抓 Abstract + Conclusion + Tables
- 報告 → 優先抓 Executive Summary + 數據表格
- 提案 → 優先抓報價、時程、架構圖
-
50 頁的文件 → 先產出章節級摘要,再問用戶要展開哪章
- 中英混合 → 摘要語言跟隨用戶的對話語言
注意事項
- 只支援文字型 PDF(可選取文字的)
- 掃描型 PDF 會提示用戶先做 OCR
- 大型 PDF 分段讀取,每段最多 20 頁
- 不會上傳 PDF 到任何外部服務