feat: 本地轉檔層補 .pptx——CP B1 最後一個 Office 格式

同 docx 路數:zip 開 OOXML、slide 按數字序、每頁「## 投影片 N」+文字+(備註);
空/純圖回 ErrNoText 明示不靜默。測試 4 案(中文/多頁排序/備註/空簡報)。
過程紅測一輪:NFKC 套整份 Markdown 把自家全形標籤「(備註)」轉半形——
改為只正規化 XML 抽出片段、結構標記正規化後組裝。collector go test 全綠(總管親跑)。
(實作=子 CC;驗證+commit=總管)
This commit is contained in:
2026-07-28 13:40:36 +08:00
parent 9df8d037ca
commit 903ca60154
4 changed files with 356 additions and 5 deletions
+58 -2
View File
@@ -58,7 +58,13 @@ var extractors = map[string]extractor{
".csv": extractCSV,
".xlsx": extractXLSX,
".pdf": extractPDF, // PDFium-via-wazero+10.43MB;用戶不必裝任何東西,見 convert_pdf.go
// .pptx → 同 docx 的 ZIP+XML 路數,數十行,體積幾乎不變
}
// preNormExtractors 裝「自己在 XML 文字片段上套完 NFKC」的抽取器。
// ConvertToText 對這類抽取器只跑 normalizeFormatting(無 NFKC),
// 確保它們後期組裝的結構標記(如全形「(備註)」)不被二次正規化。
var preNormExtractors = map[string]extractor{
".pptx": extractPPTX, // ZIP+XMLNFKC 在 pptxXMLText 的 CharData 層套,見 convert_pptx.go
}
// IsPlainText 回報這個副檔名是否本來就是純文字(不需要轉檔)。
@@ -72,7 +78,11 @@ func IsPlainText(path string) bool {
// CanConvert 回報這個副檔名是否有對應的抽取器(不含純文字)。
func CanConvert(path string) bool {
_, ok := extractors[strings.ToLower(filepath.Ext(path))]
ext := strings.ToLower(filepath.Ext(path))
if _, ok := extractors[ext]; ok {
return true
}
_, ok := preNormExtractors[ext]
return ok
}
@@ -81,11 +91,29 @@ func CanConvert(path string) bool {
// 純文字檔原樣回傳(只做正規化);其他格式派給對應抽取器。
// 抽不出文字回 ErrNoText,不支援的格式回 ErrUnsupported——兩者都**不是**「成功但空字串」,
// 呼叫端才有辦法給用戶明確訊號。
//
// 兩條抽取路徑:
// - extractors:後處理走完整 normalizeText(含 NFKC)。
// - preNormExtractors:抽取器自己在 XML CharData 層套 NFKC
// 後處理只跑 normalizeFormatting,避免結構標記被二次正規化。
func ConvertToText(path string, data []byte) (string, error) {
ext := strings.ToLower(filepath.Ext(path))
if IsPlainText(path) {
return normalizeText(string(data)), nil
}
if ex, ok := preNormExtractors[ext]; ok {
txt, err := ex(data)
if err != nil {
return "", err
}
txt = normalizeFormatting(txt)
if strings.TrimSpace(txt) == "" {
return "", ErrNoText
}
return txt, nil
}
ex, ok := extractors[ext]
if !ok {
return "", fmt.Errorf("%w%s", ErrUnsupported, ext)
@@ -134,3 +162,31 @@ func normalizeText(s string) string {
}
return strings.TrimSpace(out)
}
// normalizeFormatting 與 normalizeText 做同樣的格式清理,
// 但**不**套 NFKC 正規化。給 preNormExtractors 的抽取器用:
// 它們已在 XML CharData 層套完 NFKC,結構標記在之後才組裝,
// 不應再被 NFKC 二次轉換(例如全形「(備註)」→ 半形「(備註)」)。
func normalizeFormatting(s string) string {
s = strings.ReplaceAll(s, "\r\n", "\n")
s = strings.ReplaceAll(s, "\r", "\n")
var b strings.Builder
b.Grow(len(s))
for _, r := range s {
if r == '\n' || r == '\t' {
b.WriteRune(r)
continue
}
if unicode.IsControl(r) {
continue
}
b.WriteRune(r)
}
out := b.String()
for strings.Contains(out, "\n\n\n") {
out = strings.ReplaceAll(out, "\n\n\n", "\n\n")
}
return strings.TrimSpace(out)
}
+130
View File
@@ -0,0 +1,130 @@
// convert_pptx.go — .pptx 抽文字(ZIP+XML,與 .docx 同路數)
//
// PPTX 結構:ZIP 裡有 ppt/slides/slideN.xml(主文)
// 與 ppt/notesSlides/notesSlideN.xml(備註)。
// 文字全在 DrawingML <a:t> 標籤裡;段落是 <a:p>。
// 體積代價幾乎零(只用標準庫)。
package main
import (
"archive/zip"
"bytes"
"encoding/xml"
"fmt"
"io"
"regexp"
"sort"
"strconv"
"strings"
"golang.org/x/text/unicode/norm"
)
var pptxSlideRe = regexp.MustCompile(`^ppt/slides/slide(\d+)\.xml$`)
var pptxNotesRe = regexp.MustCompile(`^ppt/notesSlides/notesSlide(\d+)\.xml$`)
func extractPPTX(data []byte) (string, error) {
zr, err := zip.NewReader(bytes.NewReader(data), int64(len(data)))
if err != nil {
return "", fmt.Errorf("pptx 解壓失敗(可能是檔案損壞):%w", err)
}
slideData := map[int][]byte{}
notesData := map[int][]byte{}
for _, f := range zr.File {
if m := pptxSlideRe.FindStringSubmatch(f.Name); m != nil {
num, _ := strconv.Atoi(m[1])
rc, err := f.Open()
if err != nil {
return "", fmt.Errorf("讀 %s 失敗:%w", f.Name, err)
}
b, readErr := io.ReadAll(rc)
rc.Close()
if readErr != nil {
return "", fmt.Errorf("讀 %s 失敗:%w", f.Name, readErr)
}
slideData[num] = b
} else if m := pptxNotesRe.FindStringSubmatch(f.Name); m != nil {
num, _ := strconv.Atoi(m[1])
rc, err := f.Open()
if err != nil {
continue // 備註讀失敗不中斷主流程
}
b, readErr := io.ReadAll(rc)
rc.Close()
if readErr != nil {
continue
}
notesData[num] = b
}
}
if len(slideData) == 0 {
return "", ErrNoText
}
nums := make([]int, 0, len(slideData))
for n := range slideData {
nums = append(nums, n)
}
sort.Ints(nums)
var sb strings.Builder
for _, n := range nums {
body := pptxXMLText(bytes.NewReader(slideData[n]))
notes := ""
if nd, ok := notesData[n]; ok {
notes = pptxXMLText(bytes.NewReader(nd))
}
if strings.TrimSpace(body) == "" && strings.TrimSpace(notes) == "" {
continue
}
fmt.Fprintf(&sb, "## 投影片 %d\n\n", n)
if strings.TrimSpace(body) != "" {
sb.WriteString(strings.TrimSpace(body))
sb.WriteString("\n")
}
if strings.TrimSpace(notes) != "" {
sb.WriteString("\n(備註)\n")
sb.WriteString(strings.TrimSpace(notes))
sb.WriteString("\n")
}
sb.WriteString("\n")
}
result := strings.TrimSpace(sb.String())
if result == "" {
return "", ErrNoText
}
return result, nil
}
// pptxXMLText 串流解 XML,收集所有 CharData,以 <a:p> 段落分行。
// Local name 比對(不看 namespace 前綴,與 docxXMLText 同做法)。
func pptxXMLText(r io.Reader) string {
dec := xml.NewDecoder(r)
var sb strings.Builder
for {
tok, err := dec.Token()
if err != nil {
break
}
switch t := tok.(type) {
case xml.StartElement:
switch t.Name.Local {
case "p":
sb.WriteString("\n")
case "tab":
sb.WriteString("\t")
case "br":
sb.WriteString("\n")
}
case xml.CharData:
sb.WriteString(norm.NFKC.String(string(t)))
}
}
return strings.TrimLeft(sb.String(), "\n")
}
+165
View File
@@ -0,0 +1,165 @@
package main
import (
"archive/zip"
"bytes"
"errors"
"fmt"
"strings"
"testing"
)
// 建最小合法 PPTXZIP + ppt/slides/slideN.xml [+ ppt/notesSlides/notesSlideN.xml]。
// slides[i] 的內容對應 slide(i+1).xml 的 <p:txBody> 內部 XML。
// notes 鍵是投影片編號(1-based),值同為 <p:txBody> 內部 XML。
func makePPTX(t *testing.T, slides []string, notes map[int]string) []byte {
t.Helper()
var buf bytes.Buffer
zw := zip.NewWriter(&buf)
slideXML := func(body string) string {
return `<?xml version="1.0" encoding="UTF-8"?>` +
`<p:sld xmlns:p="http://schemas.openxmlformats.org/presentationml/2006/main"` +
` xmlns:a="http://schemas.openxmlformats.org/drawingml/2006/main">` +
`<p:cSld><p:spTree><p:sp><p:txBody>` + body + `</p:txBody></p:sp></p:spTree></p:cSld>` +
`</p:sld>`
}
notesXML := func(body string) string {
return `<?xml version="1.0" encoding="UTF-8"?>` +
`<p:notes xmlns:p="http://schemas.openxmlformats.org/presentationml/2006/main"` +
` xmlns:a="http://schemas.openxmlformats.org/drawingml/2006/main">` +
`<p:cSld><p:spTree><p:sp><p:txBody>` + body + `</p:txBody></p:sp></p:spTree></p:cSld>` +
`</p:notes>`
}
for i, body := range slides {
name := fmt.Sprintf("ppt/slides/slide%d.xml", i+1)
w, err := zw.Create(name)
if err != nil {
t.Fatalf("建 zip 失敗: %v", err)
}
if _, err := w.Write([]byte(slideXML(body))); err != nil {
t.Fatalf("寫 zip 失敗: %v", err)
}
}
for num, body := range notes {
name := fmt.Sprintf("ppt/notesSlides/notesSlide%d.xml", num)
w, err := zw.Create(name)
if err != nil {
t.Fatalf("建 zip 失敗: %v", err)
}
if _, err := w.Write([]byte(notesXML(body))); err != nil {
t.Fatalf("寫 zip 失敗: %v", err)
}
}
if err := zw.Close(); err != nil {
t.Fatalf("關 zip 失敗: %v", err)
}
return buf.Bytes()
}
// 生成 DrawingML 段落 XML(給 makePPTX 的 slides/notes 參數用)。
func pptxPara(texts ...string) string {
var sb strings.Builder
for _, text := range texts {
fmt.Fprintf(&sb, `<a:p><a:r><a:t>%s</a:t></a:r></a:p>`, text)
}
return sb.String()
}
// 測試 1:中文文字 + 多投影片內容與順序
func TestExtractPPTX_中文與多投影片(t *testing.T) {
slides := []string{
pptxPara("策略規劃", "第一季目標"),
pptxPara("執行計劃", "二月里程碑"),
pptxPara("成果展示", "關鍵指標"),
}
got, err := ConvertToText("deck.pptx", makePPTX(t, slides, nil))
if err != nil {
t.Fatalf("不該出錯: %v", err)
}
for _, hdr := range []string{"投影片 1", "投影片 2", "投影片 3"} {
if !strings.Contains(got, hdr) {
t.Errorf("缺少標頭 %q,實得:\n%s", hdr, got)
}
}
for _, kw := range []string{"策略規劃", "第一季目標", "二月里程碑", "成果展示", "關鍵指標"} {
if !strings.Contains(got, kw) {
t.Errorf("缺少關鍵字 %q,實得:\n%s", kw, got)
}
}
// 投影片 1 的標頭必須在 2 之前,2 在 3 之前
p1 := strings.Index(got, "投影片 1")
p2 := strings.Index(got, "投影片 2")
p3 := strings.Index(got, "投影片 3")
if !(p1 < p2 && p2 < p3) {
t.Errorf("投影片應按編號排序(1<2<3),實得:\n%s", got)
}
}
// 測試 2:數字排序——slide10 不能因字典序排到 slide2 前面
func TestExtractPPTX_數字排序(t *testing.T) {
var buf bytes.Buffer
zw := zip.NewWriter(&buf)
slideXML := func(n int) string {
return fmt.Sprintf(
`<?xml version="1.0" encoding="UTF-8"?>`+
`<p:sld xmlns:p="http://schemas.openxmlformats.org/presentationml/2006/main"`+
` xmlns:a="http://schemas.openxmlformats.org/drawingml/2006/main">`+
`<p:cSld><p:spTree><p:sp><p:txBody>`+
`<a:p><a:r><a:t>投影片%d的內容</a:t></a:r></a:p>`+
`</p:txBody></p:sp></p:spTree></p:cSld></p:sld>`, n)
}
// 故意以字典序倒序放入 zip(10, 2, 1),驗輸出按數字序
for _, n := range []int{10, 2, 1} {
w, _ := zw.Create(fmt.Sprintf("ppt/slides/slide%d.xml", n))
w.Write([]byte(slideXML(n)))
}
zw.Close()
got, err := ConvertToText("deck.pptx", buf.Bytes())
if err != nil {
t.Fatalf("不該出錯: %v", err)
}
pos1 := strings.Index(got, "投影片 1")
pos2 := strings.Index(got, "投影片 2")
pos10 := strings.Index(got, "投影片 10")
if !(pos1 < pos2 && pos2 < pos10) {
t.Errorf("數字排序應為 1<2<10,實得:\n%s", got)
}
}
// 測試 3:備註(notesSlide)有文字時附在投影片下
func TestExtractPPTX_備註(t *testing.T) {
slides := []string{pptxPara("標題投影片", "開場白")}
notes := map[int]string{1: pptxPara("這是講者備註,強調重點一二三")}
got, err := ConvertToText("deck.pptx", makePPTX(t, slides, notes))
if err != nil {
t.Fatalf("不該出錯: %v", err)
}
if !strings.Contains(got, "(備註)") {
t.Errorf("應有(備註)標籤,實得:\n%s", got)
}
if !strings.Contains(got, "強調重點") {
t.Errorf("備註文字應被抽出,實得:\n%s", got)
}
// 備註應在投影片本文之後
bodyPos := strings.Index(got, "標題投影片")
notesPos := strings.Index(got, "(備註)")
if bodyPos < 0 || notesPos < 0 || bodyPos > notesPos {
t.Errorf("備註應在投影片文字之後,bodyPos=%d notesPos=%d,實得:\n%s", bodyPos, notesPos, got)
}
}
// 測試 4:空簡報(純圖或全空白)應回 ErrNoText
func TestExtractPPTX_空簡報ErrNoText(t *testing.T) {
slides := []string{
pptxPara(" "), // 只有空白
pptxPara(""), // 無文字
}
_, err := ConvertToText("empty.pptx", makePPTX(t, slides, nil))
if !errors.Is(err, ErrNoText) {
t.Errorf("空簡報應回 ErrNoText,實得: %v", err)
}
}
+3 -3
View File
@@ -102,12 +102,12 @@ func TestWiring_抽不出文字要明確失敗不靜默(t *testing.T) {
}
}
// 還沒支援的格式(例如 .pptx 目前沒抽取器)要回 ErrUnsupported
// 支援的格式(例如 .ppt 舊式二進位格式)要回 ErrUnsupported
// 訊息要跟「掃描件」區分開——給用戶的說法不同。
func TestWiring_未支援格式與無文字要能區分(t *testing.T) {
dir := t.TempDir()
rel := "簡報.pptx"
os.WriteFile(filepath.Join(dir, rel), []byte("PK\x03\x04fake"), 0o644)
rel := "簡報.ppt"
os.WriteFile(filepath.Join(dir, rel), []byte("\xD0\xCF\x11\xE0\xA1\xB1\x1A\xE1fake"), 0o644)
_, err := ExtractWithGemma("fake-key-for-test", "", dir, rel)
if err == nil {