From 903ca60154b9f5a2a69630b6c10f6f471c631df6 Mon Sep 17 00:00:00 2001 From: richblack Date: Tue, 28 Jul 2026 13:40:36 +0800 Subject: [PATCH] =?UTF-8?q?feat:=20=E6=9C=AC=E5=9C=B0=E8=BD=89=E6=AA=94?= =?UTF-8?q?=E5=B1=A4=E8=A3=9C=20.pptx=E2=80=94=E2=80=94CP=20B1=20=E6=9C=80?= =?UTF-8?q?=E5=BE=8C=E4=B8=80=E5=80=8B=20Office=20=E6=A0=BC=E5=BC=8F?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit 同 docx 路數:zip 開 OOXML、slide 按數字序、每頁「## 投影片 N」+文字+(備註); 空/純圖回 ErrNoText 明示不靜默。測試 4 案(中文/多頁排序/備註/空簡報)。 過程紅測一輪:NFKC 套整份 Markdown 把自家全形標籤「(備註)」轉半形—— 改為只正規化 XML 抽出片段、結構標記正規化後組裝。collector go test 全綠(總管親跑)。 (實作=子 CC;驗證+commit=總管) --- convert.go | 60 ++++++++++++++- convert_pptx.go | 130 ++++++++++++++++++++++++++++++++ convert_pptx_test.go | 165 +++++++++++++++++++++++++++++++++++++++++ convert_wiring_test.go | 6 +- 4 files changed, 356 insertions(+), 5 deletions(-) create mode 100644 convert_pptx.go create mode 100644 convert_pptx_test.go diff --git a/convert.go b/convert.go index cca19e6..864e9fb 100644 --- a/convert.go +++ b/convert.go @@ -58,7 +58,13 @@ var extractors = map[string]extractor{ ".csv": extractCSV, ".xlsx": extractXLSX, ".pdf": extractPDF, // PDFium-via-wazero(+10.43MB;用戶不必裝任何東西,見 convert_pdf.go) - // .pptx → 同 docx 的 ZIP+XML 路數,數十行,體積幾乎不變 +} + +// preNormExtractors 裝「自己在 XML 文字片段上套完 NFKC」的抽取器。 +// ConvertToText 對這類抽取器只跑 normalizeFormatting(無 NFKC), +// 確保它們後期組裝的結構標記(如全形「(備註)」)不被二次正規化。 +var preNormExtractors = map[string]extractor{ + ".pptx": extractPPTX, // ZIP+XML;NFKC 在 pptxXMLText 的 CharData 層套,見 convert_pptx.go } // IsPlainText 回報這個副檔名是否本來就是純文字(不需要轉檔)。 @@ -72,7 +78,11 @@ func IsPlainText(path string) bool { // CanConvert 回報這個副檔名是否有對應的抽取器(不含純文字)。 func CanConvert(path string) bool { - _, ok := extractors[strings.ToLower(filepath.Ext(path))] + ext := strings.ToLower(filepath.Ext(path)) + if _, ok := extractors[ext]; ok { + return true + } + _, ok := preNormExtractors[ext] return ok } @@ -81,11 +91,29 @@ func CanConvert(path string) bool { // 純文字檔原樣回傳(只做正規化);其他格式派給對應抽取器。 // 抽不出文字回 ErrNoText,不支援的格式回 ErrUnsupported——兩者都**不是**「成功但空字串」, // 呼叫端才有辦法給用戶明確訊號。 +// +// 兩條抽取路徑: +// - extractors:後處理走完整 normalizeText(含 NFKC)。 +// - preNormExtractors:抽取器自己在 XML CharData 層套 NFKC, +// 後處理只跑 normalizeFormatting,避免結構標記被二次正規化。 func ConvertToText(path string, data []byte) (string, error) { ext := strings.ToLower(filepath.Ext(path)) if IsPlainText(path) { return normalizeText(string(data)), nil } + + if ex, ok := preNormExtractors[ext]; ok { + txt, err := ex(data) + if err != nil { + return "", err + } + txt = normalizeFormatting(txt) + if strings.TrimSpace(txt) == "" { + return "", ErrNoText + } + return txt, nil + } + ex, ok := extractors[ext] if !ok { return "", fmt.Errorf("%w:%s", ErrUnsupported, ext) @@ -134,3 +162,31 @@ func normalizeText(s string) string { } return strings.TrimSpace(out) } + +// normalizeFormatting 與 normalizeText 做同樣的格式清理, +// 但**不**套 NFKC 正規化。給 preNormExtractors 的抽取器用: +// 它們已在 XML CharData 層套完 NFKC,結構標記在之後才組裝, +// 不應再被 NFKC 二次轉換(例如全形「(備註)」→ 半形「(備註)」)。 +func normalizeFormatting(s string) string { + s = strings.ReplaceAll(s, "\r\n", "\n") + s = strings.ReplaceAll(s, "\r", "\n") + + var b strings.Builder + b.Grow(len(s)) + for _, r := range s { + if r == '\n' || r == '\t' { + b.WriteRune(r) + continue + } + if unicode.IsControl(r) { + continue + } + b.WriteRune(r) + } + + out := b.String() + for strings.Contains(out, "\n\n\n") { + out = strings.ReplaceAll(out, "\n\n\n", "\n\n") + } + return strings.TrimSpace(out) +} diff --git a/convert_pptx.go b/convert_pptx.go new file mode 100644 index 0000000..7d36893 --- /dev/null +++ b/convert_pptx.go @@ -0,0 +1,130 @@ +// convert_pptx.go — .pptx 抽文字(ZIP+XML,與 .docx 同路數) +// +// PPTX 結構:ZIP 裡有 ppt/slides/slideN.xml(主文) +// 與 ppt/notesSlides/notesSlideN.xml(備註)。 +// 文字全在 DrawingML 標籤裡;段落是 。 +// 體積代價幾乎零(只用標準庫)。 +package main + +import ( + "archive/zip" + "bytes" + "encoding/xml" + "fmt" + "io" + "regexp" + "sort" + "strconv" + "strings" + + "golang.org/x/text/unicode/norm" +) + +var pptxSlideRe = regexp.MustCompile(`^ppt/slides/slide(\d+)\.xml$`) +var pptxNotesRe = regexp.MustCompile(`^ppt/notesSlides/notesSlide(\d+)\.xml$`) + +func extractPPTX(data []byte) (string, error) { + zr, err := zip.NewReader(bytes.NewReader(data), int64(len(data))) + if err != nil { + return "", fmt.Errorf("pptx 解壓失敗(可能是檔案損壞):%w", err) + } + + slideData := map[int][]byte{} + notesData := map[int][]byte{} + + for _, f := range zr.File { + if m := pptxSlideRe.FindStringSubmatch(f.Name); m != nil { + num, _ := strconv.Atoi(m[1]) + rc, err := f.Open() + if err != nil { + return "", fmt.Errorf("讀 %s 失敗:%w", f.Name, err) + } + b, readErr := io.ReadAll(rc) + rc.Close() + if readErr != nil { + return "", fmt.Errorf("讀 %s 失敗:%w", f.Name, readErr) + } + slideData[num] = b + } else if m := pptxNotesRe.FindStringSubmatch(f.Name); m != nil { + num, _ := strconv.Atoi(m[1]) + rc, err := f.Open() + if err != nil { + continue // 備註讀失敗不中斷主流程 + } + b, readErr := io.ReadAll(rc) + rc.Close() + if readErr != nil { + continue + } + notesData[num] = b + } + } + + if len(slideData) == 0 { + return "", ErrNoText + } + + nums := make([]int, 0, len(slideData)) + for n := range slideData { + nums = append(nums, n) + } + sort.Ints(nums) + + var sb strings.Builder + for _, n := range nums { + body := pptxXMLText(bytes.NewReader(slideData[n])) + notes := "" + if nd, ok := notesData[n]; ok { + notes = pptxXMLText(bytes.NewReader(nd)) + } + + if strings.TrimSpace(body) == "" && strings.TrimSpace(notes) == "" { + continue + } + + fmt.Fprintf(&sb, "## 投影片 %d\n\n", n) + if strings.TrimSpace(body) != "" { + sb.WriteString(strings.TrimSpace(body)) + sb.WriteString("\n") + } + if strings.TrimSpace(notes) != "" { + sb.WriteString("\n(備註)\n") + sb.WriteString(strings.TrimSpace(notes)) + sb.WriteString("\n") + } + sb.WriteString("\n") + } + + result := strings.TrimSpace(sb.String()) + if result == "" { + return "", ErrNoText + } + return result, nil +} + +// pptxXMLText 串流解 XML,收集所有 CharData,以 段落分行。 +// Local name 比對(不看 namespace 前綴,與 docxXMLText 同做法)。 +func pptxXMLText(r io.Reader) string { + dec := xml.NewDecoder(r) + var sb strings.Builder + for { + tok, err := dec.Token() + if err != nil { + break + } + switch t := tok.(type) { + case xml.StartElement: + switch t.Name.Local { + case "p": + sb.WriteString("\n") + case "tab": + sb.WriteString("\t") + case "br": + sb.WriteString("\n") + } + case xml.CharData: + sb.WriteString(norm.NFKC.String(string(t))) + } + } + return strings.TrimLeft(sb.String(), "\n") +} diff --git a/convert_pptx_test.go b/convert_pptx_test.go new file mode 100644 index 0000000..7b0832d --- /dev/null +++ b/convert_pptx_test.go @@ -0,0 +1,165 @@ +package main + +import ( + "archive/zip" + "bytes" + "errors" + "fmt" + "strings" + "testing" +) + +// 建最小合法 PPTX:ZIP + ppt/slides/slideN.xml [+ ppt/notesSlides/notesSlideN.xml]。 +// slides[i] 的內容對應 slide(i+1).xml 的 內部 XML。 +// notes 鍵是投影片編號(1-based),值同為 內部 XML。 +func makePPTX(t *testing.T, slides []string, notes map[int]string) []byte { + t.Helper() + var buf bytes.Buffer + zw := zip.NewWriter(&buf) + + slideXML := func(body string) string { + return `` + + `` + + `` + body + `` + + `` + } + notesXML := func(body string) string { + return `` + + `` + + `` + body + `` + + `` + } + for i, body := range slides { + name := fmt.Sprintf("ppt/slides/slide%d.xml", i+1) + w, err := zw.Create(name) + if err != nil { + t.Fatalf("建 zip 失敗: %v", err) + } + if _, err := w.Write([]byte(slideXML(body))); err != nil { + t.Fatalf("寫 zip 失敗: %v", err) + } + } + + for num, body := range notes { + name := fmt.Sprintf("ppt/notesSlides/notesSlide%d.xml", num) + w, err := zw.Create(name) + if err != nil { + t.Fatalf("建 zip 失敗: %v", err) + } + if _, err := w.Write([]byte(notesXML(body))); err != nil { + t.Fatalf("寫 zip 失敗: %v", err) + } + } + + if err := zw.Close(); err != nil { + t.Fatalf("關 zip 失敗: %v", err) + } + return buf.Bytes() +} + +// 生成 DrawingML 段落 XML(給 makePPTX 的 slides/notes 參數用)。 +func pptxPara(texts ...string) string { + var sb strings.Builder + for _, text := range texts { + fmt.Fprintf(&sb, `%s`, text) + } + return sb.String() +} + +// 測試 1:中文文字 + 多投影片內容與順序 +func TestExtractPPTX_中文與多投影片(t *testing.T) { + slides := []string{ + pptxPara("策略規劃", "第一季目標"), + pptxPara("執行計劃", "二月里程碑"), + pptxPara("成果展示", "關鍵指標"), + } + got, err := ConvertToText("deck.pptx", makePPTX(t, slides, nil)) + if err != nil { + t.Fatalf("不該出錯: %v", err) + } + for _, hdr := range []string{"投影片 1", "投影片 2", "投影片 3"} { + if !strings.Contains(got, hdr) { + t.Errorf("缺少標頭 %q,實得:\n%s", hdr, got) + } + } + for _, kw := range []string{"策略規劃", "第一季目標", "二月里程碑", "成果展示", "關鍵指標"} { + if !strings.Contains(got, kw) { + t.Errorf("缺少關鍵字 %q,實得:\n%s", kw, got) + } + } + // 投影片 1 的標頭必須在 2 之前,2 在 3 之前 + p1 := strings.Index(got, "投影片 1") + p2 := strings.Index(got, "投影片 2") + p3 := strings.Index(got, "投影片 3") + if !(p1 < p2 && p2 < p3) { + t.Errorf("投影片應按編號排序(1<2<3),實得:\n%s", got) + } +} + +// 測試 2:數字排序——slide10 不能因字典序排到 slide2 前面 +func TestExtractPPTX_數字排序(t *testing.T) { + var buf bytes.Buffer + zw := zip.NewWriter(&buf) + slideXML := func(n int) string { + return fmt.Sprintf( + ``+ + ``+ + ``+ + `投影片%d的內容`+ + ``, n) + } + // 故意以字典序倒序放入 zip(10, 2, 1),驗輸出按數字序 + for _, n := range []int{10, 2, 1} { + w, _ := zw.Create(fmt.Sprintf("ppt/slides/slide%d.xml", n)) + w.Write([]byte(slideXML(n))) + } + zw.Close() + + got, err := ConvertToText("deck.pptx", buf.Bytes()) + if err != nil { + t.Fatalf("不該出錯: %v", err) + } + pos1 := strings.Index(got, "投影片 1") + pos2 := strings.Index(got, "投影片 2") + pos10 := strings.Index(got, "投影片 10") + if !(pos1 < pos2 && pos2 < pos10) { + t.Errorf("數字排序應為 1<2<10,實得:\n%s", got) + } +} + +// 測試 3:備註(notesSlide)有文字時附在投影片下 +func TestExtractPPTX_備註(t *testing.T) { + slides := []string{pptxPara("標題投影片", "開場白")} + notes := map[int]string{1: pptxPara("這是講者備註,強調重點一二三")} + got, err := ConvertToText("deck.pptx", makePPTX(t, slides, notes)) + if err != nil { + t.Fatalf("不該出錯: %v", err) + } + if !strings.Contains(got, "(備註)") { + t.Errorf("應有(備註)標籤,實得:\n%s", got) + } + if !strings.Contains(got, "強調重點") { + t.Errorf("備註文字應被抽出,實得:\n%s", got) + } + // 備註應在投影片本文之後 + bodyPos := strings.Index(got, "標題投影片") + notesPos := strings.Index(got, "(備註)") + if bodyPos < 0 || notesPos < 0 || bodyPos > notesPos { + t.Errorf("備註應在投影片文字之後,bodyPos=%d notesPos=%d,實得:\n%s", bodyPos, notesPos, got) + } +} + +// 測試 4:空簡報(純圖或全空白)應回 ErrNoText +func TestExtractPPTX_空簡報ErrNoText(t *testing.T) { + slides := []string{ + pptxPara(" "), // 只有空白 + pptxPara(""), // 無文字 + } + _, err := ConvertToText("empty.pptx", makePPTX(t, slides, nil)) + if !errors.Is(err, ErrNoText) { + t.Errorf("空簡報應回 ErrNoText,實得: %v", err) + } +} diff --git a/convert_wiring_test.go b/convert_wiring_test.go index 125266a..9a891c7 100644 --- a/convert_wiring_test.go +++ b/convert_wiring_test.go @@ -102,12 +102,12 @@ func TestWiring_抽不出文字要明確失敗不靜默(t *testing.T) { } } -// 還沒支援的格式(例如 .pptx 目前沒抽取器)要回 ErrUnsupported, +// 不支援的格式(例如 .ppt 舊式二進位格式)要回 ErrUnsupported, // 訊息要跟「掃描件」區分開——給用戶的說法不同。 func TestWiring_未支援格式與無文字要能區分(t *testing.T) { dir := t.TempDir() - rel := "簡報.pptx" - os.WriteFile(filepath.Join(dir, rel), []byte("PK\x03\x04fake"), 0o644) + rel := "簡報.ppt" + os.WriteFile(filepath.Join(dir, rel), []byte("\xD0\xCF\x11\xE0\xA1\xB1\x1A\xE1fake"), 0o644) _, err := ExtractWithGemma("fake-key-for-test", "", dir, rel) if err == nil {