feat: 本地轉檔層補 .pptx——CP B1 最後一個 Office 格式
同 docx 路數:zip 開 OOXML、slide 按數字序、每頁「## 投影片 N」+文字+(備註); 空/純圖回 ErrNoText 明示不靜默。測試 4 案(中文/多頁排序/備註/空簡報)。 過程紅測一輪:NFKC 套整份 Markdown 把自家全形標籤「(備註)」轉半形—— 改為只正規化 XML 抽出片段、結構標記正規化後組裝。collector go test 全綠(總管親跑)。 (實作=子 CC;驗證+commit=總管)
This commit is contained in:
+58
-2
@@ -58,7 +58,13 @@ var extractors = map[string]extractor{
|
||||
".csv": extractCSV,
|
||||
".xlsx": extractXLSX,
|
||||
".pdf": extractPDF, // PDFium-via-wazero(+10.43MB;用戶不必裝任何東西,見 convert_pdf.go)
|
||||
// .pptx → 同 docx 的 ZIP+XML 路數,數十行,體積幾乎不變
|
||||
}
|
||||
|
||||
// preNormExtractors 裝「自己在 XML 文字片段上套完 NFKC」的抽取器。
|
||||
// ConvertToText 對這類抽取器只跑 normalizeFormatting(無 NFKC),
|
||||
// 確保它們後期組裝的結構標記(如全形「(備註)」)不被二次正規化。
|
||||
var preNormExtractors = map[string]extractor{
|
||||
".pptx": extractPPTX, // ZIP+XML;NFKC 在 pptxXMLText 的 CharData 層套,見 convert_pptx.go
|
||||
}
|
||||
|
||||
// IsPlainText 回報這個副檔名是否本來就是純文字(不需要轉檔)。
|
||||
@@ -72,7 +78,11 @@ func IsPlainText(path string) bool {
|
||||
|
||||
// CanConvert 回報這個副檔名是否有對應的抽取器(不含純文字)。
|
||||
func CanConvert(path string) bool {
|
||||
_, ok := extractors[strings.ToLower(filepath.Ext(path))]
|
||||
ext := strings.ToLower(filepath.Ext(path))
|
||||
if _, ok := extractors[ext]; ok {
|
||||
return true
|
||||
}
|
||||
_, ok := preNormExtractors[ext]
|
||||
return ok
|
||||
}
|
||||
|
||||
@@ -81,11 +91,29 @@ func CanConvert(path string) bool {
|
||||
// 純文字檔原樣回傳(只做正規化);其他格式派給對應抽取器。
|
||||
// 抽不出文字回 ErrNoText,不支援的格式回 ErrUnsupported——兩者都**不是**「成功但空字串」,
|
||||
// 呼叫端才有辦法給用戶明確訊號。
|
||||
//
|
||||
// 兩條抽取路徑:
|
||||
// - extractors:後處理走完整 normalizeText(含 NFKC)。
|
||||
// - preNormExtractors:抽取器自己在 XML CharData 層套 NFKC,
|
||||
// 後處理只跑 normalizeFormatting,避免結構標記被二次正規化。
|
||||
func ConvertToText(path string, data []byte) (string, error) {
|
||||
ext := strings.ToLower(filepath.Ext(path))
|
||||
if IsPlainText(path) {
|
||||
return normalizeText(string(data)), nil
|
||||
}
|
||||
|
||||
if ex, ok := preNormExtractors[ext]; ok {
|
||||
txt, err := ex(data)
|
||||
if err != nil {
|
||||
return "", err
|
||||
}
|
||||
txt = normalizeFormatting(txt)
|
||||
if strings.TrimSpace(txt) == "" {
|
||||
return "", ErrNoText
|
||||
}
|
||||
return txt, nil
|
||||
}
|
||||
|
||||
ex, ok := extractors[ext]
|
||||
if !ok {
|
||||
return "", fmt.Errorf("%w:%s", ErrUnsupported, ext)
|
||||
@@ -134,3 +162,31 @@ func normalizeText(s string) string {
|
||||
}
|
||||
return strings.TrimSpace(out)
|
||||
}
|
||||
|
||||
// normalizeFormatting 與 normalizeText 做同樣的格式清理,
|
||||
// 但**不**套 NFKC 正規化。給 preNormExtractors 的抽取器用:
|
||||
// 它們已在 XML CharData 層套完 NFKC,結構標記在之後才組裝,
|
||||
// 不應再被 NFKC 二次轉換(例如全形「(備註)」→ 半形「(備註)」)。
|
||||
func normalizeFormatting(s string) string {
|
||||
s = strings.ReplaceAll(s, "\r\n", "\n")
|
||||
s = strings.ReplaceAll(s, "\r", "\n")
|
||||
|
||||
var b strings.Builder
|
||||
b.Grow(len(s))
|
||||
for _, r := range s {
|
||||
if r == '\n' || r == '\t' {
|
||||
b.WriteRune(r)
|
||||
continue
|
||||
}
|
||||
if unicode.IsControl(r) {
|
||||
continue
|
||||
}
|
||||
b.WriteRune(r)
|
||||
}
|
||||
|
||||
out := b.String()
|
||||
for strings.Contains(out, "\n\n\n") {
|
||||
out = strings.ReplaceAll(out, "\n\n\n", "\n\n")
|
||||
}
|
||||
return strings.TrimSpace(out)
|
||||
}
|
||||
|
||||
+130
@@ -0,0 +1,130 @@
|
||||
// convert_pptx.go — .pptx 抽文字(ZIP+XML,與 .docx 同路數)
|
||||
//
|
||||
// PPTX 結構:ZIP 裡有 ppt/slides/slideN.xml(主文)
|
||||
// 與 ppt/notesSlides/notesSlideN.xml(備註)。
|
||||
// 文字全在 DrawingML <a:t> 標籤裡;段落是 <a:p>。
|
||||
// 體積代價幾乎零(只用標準庫)。
|
||||
package main
|
||||
|
||||
import (
|
||||
"archive/zip"
|
||||
"bytes"
|
||||
"encoding/xml"
|
||||
"fmt"
|
||||
"io"
|
||||
"regexp"
|
||||
"sort"
|
||||
"strconv"
|
||||
"strings"
|
||||
|
||||
"golang.org/x/text/unicode/norm"
|
||||
)
|
||||
|
||||
var pptxSlideRe = regexp.MustCompile(`^ppt/slides/slide(\d+)\.xml$`)
|
||||
var pptxNotesRe = regexp.MustCompile(`^ppt/notesSlides/notesSlide(\d+)\.xml$`)
|
||||
|
||||
func extractPPTX(data []byte) (string, error) {
|
||||
zr, err := zip.NewReader(bytes.NewReader(data), int64(len(data)))
|
||||
if err != nil {
|
||||
return "", fmt.Errorf("pptx 解壓失敗(可能是檔案損壞):%w", err)
|
||||
}
|
||||
|
||||
slideData := map[int][]byte{}
|
||||
notesData := map[int][]byte{}
|
||||
|
||||
for _, f := range zr.File {
|
||||
if m := pptxSlideRe.FindStringSubmatch(f.Name); m != nil {
|
||||
num, _ := strconv.Atoi(m[1])
|
||||
rc, err := f.Open()
|
||||
if err != nil {
|
||||
return "", fmt.Errorf("讀 %s 失敗:%w", f.Name, err)
|
||||
}
|
||||
b, readErr := io.ReadAll(rc)
|
||||
rc.Close()
|
||||
if readErr != nil {
|
||||
return "", fmt.Errorf("讀 %s 失敗:%w", f.Name, readErr)
|
||||
}
|
||||
slideData[num] = b
|
||||
} else if m := pptxNotesRe.FindStringSubmatch(f.Name); m != nil {
|
||||
num, _ := strconv.Atoi(m[1])
|
||||
rc, err := f.Open()
|
||||
if err != nil {
|
||||
continue // 備註讀失敗不中斷主流程
|
||||
}
|
||||
b, readErr := io.ReadAll(rc)
|
||||
rc.Close()
|
||||
if readErr != nil {
|
||||
continue
|
||||
}
|
||||
notesData[num] = b
|
||||
}
|
||||
}
|
||||
|
||||
if len(slideData) == 0 {
|
||||
return "", ErrNoText
|
||||
}
|
||||
|
||||
nums := make([]int, 0, len(slideData))
|
||||
for n := range slideData {
|
||||
nums = append(nums, n)
|
||||
}
|
||||
sort.Ints(nums)
|
||||
|
||||
var sb strings.Builder
|
||||
for _, n := range nums {
|
||||
body := pptxXMLText(bytes.NewReader(slideData[n]))
|
||||
notes := ""
|
||||
if nd, ok := notesData[n]; ok {
|
||||
notes = pptxXMLText(bytes.NewReader(nd))
|
||||
}
|
||||
|
||||
if strings.TrimSpace(body) == "" && strings.TrimSpace(notes) == "" {
|
||||
continue
|
||||
}
|
||||
|
||||
fmt.Fprintf(&sb, "## 投影片 %d\n\n", n)
|
||||
if strings.TrimSpace(body) != "" {
|
||||
sb.WriteString(strings.TrimSpace(body))
|
||||
sb.WriteString("\n")
|
||||
}
|
||||
if strings.TrimSpace(notes) != "" {
|
||||
sb.WriteString("\n(備註)\n")
|
||||
sb.WriteString(strings.TrimSpace(notes))
|
||||
sb.WriteString("\n")
|
||||
}
|
||||
sb.WriteString("\n")
|
||||
}
|
||||
|
||||
result := strings.TrimSpace(sb.String())
|
||||
if result == "" {
|
||||
return "", ErrNoText
|
||||
}
|
||||
return result, nil
|
||||
}
|
||||
|
||||
// pptxXMLText 串流解 XML,收集所有 CharData,以 <a:p> 段落分行。
|
||||
// Local name 比對(不看 namespace 前綴,與 docxXMLText 同做法)。
|
||||
func pptxXMLText(r io.Reader) string {
|
||||
dec := xml.NewDecoder(r)
|
||||
var sb strings.Builder
|
||||
for {
|
||||
tok, err := dec.Token()
|
||||
if err != nil {
|
||||
break
|
||||
}
|
||||
switch t := tok.(type) {
|
||||
case xml.StartElement:
|
||||
switch t.Name.Local {
|
||||
case "p":
|
||||
sb.WriteString("\n")
|
||||
case "tab":
|
||||
sb.WriteString("\t")
|
||||
case "br":
|
||||
sb.WriteString("\n")
|
||||
}
|
||||
case xml.CharData:
|
||||
sb.WriteString(norm.NFKC.String(string(t)))
|
||||
}
|
||||
}
|
||||
return strings.TrimLeft(sb.String(), "\n")
|
||||
}
|
||||
@@ -0,0 +1,165 @@
|
||||
package main
|
||||
|
||||
import (
|
||||
"archive/zip"
|
||||
"bytes"
|
||||
"errors"
|
||||
"fmt"
|
||||
"strings"
|
||||
"testing"
|
||||
)
|
||||
|
||||
// 建最小合法 PPTX:ZIP + ppt/slides/slideN.xml [+ ppt/notesSlides/notesSlideN.xml]。
|
||||
// slides[i] 的內容對應 slide(i+1).xml 的 <p:txBody> 內部 XML。
|
||||
// notes 鍵是投影片編號(1-based),值同為 <p:txBody> 內部 XML。
|
||||
func makePPTX(t *testing.T, slides []string, notes map[int]string) []byte {
|
||||
t.Helper()
|
||||
var buf bytes.Buffer
|
||||
zw := zip.NewWriter(&buf)
|
||||
|
||||
slideXML := func(body string) string {
|
||||
return `<?xml version="1.0" encoding="UTF-8"?>` +
|
||||
`<p:sld xmlns:p="http://schemas.openxmlformats.org/presentationml/2006/main"` +
|
||||
` xmlns:a="http://schemas.openxmlformats.org/drawingml/2006/main">` +
|
||||
`<p:cSld><p:spTree><p:sp><p:txBody>` + body + `</p:txBody></p:sp></p:spTree></p:cSld>` +
|
||||
`</p:sld>`
|
||||
}
|
||||
notesXML := func(body string) string {
|
||||
return `<?xml version="1.0" encoding="UTF-8"?>` +
|
||||
`<p:notes xmlns:p="http://schemas.openxmlformats.org/presentationml/2006/main"` +
|
||||
` xmlns:a="http://schemas.openxmlformats.org/drawingml/2006/main">` +
|
||||
`<p:cSld><p:spTree><p:sp><p:txBody>` + body + `</p:txBody></p:sp></p:spTree></p:cSld>` +
|
||||
`</p:notes>`
|
||||
}
|
||||
for i, body := range slides {
|
||||
name := fmt.Sprintf("ppt/slides/slide%d.xml", i+1)
|
||||
w, err := zw.Create(name)
|
||||
if err != nil {
|
||||
t.Fatalf("建 zip 失敗: %v", err)
|
||||
}
|
||||
if _, err := w.Write([]byte(slideXML(body))); err != nil {
|
||||
t.Fatalf("寫 zip 失敗: %v", err)
|
||||
}
|
||||
}
|
||||
|
||||
for num, body := range notes {
|
||||
name := fmt.Sprintf("ppt/notesSlides/notesSlide%d.xml", num)
|
||||
w, err := zw.Create(name)
|
||||
if err != nil {
|
||||
t.Fatalf("建 zip 失敗: %v", err)
|
||||
}
|
||||
if _, err := w.Write([]byte(notesXML(body))); err != nil {
|
||||
t.Fatalf("寫 zip 失敗: %v", err)
|
||||
}
|
||||
}
|
||||
|
||||
if err := zw.Close(); err != nil {
|
||||
t.Fatalf("關 zip 失敗: %v", err)
|
||||
}
|
||||
return buf.Bytes()
|
||||
}
|
||||
|
||||
// 生成 DrawingML 段落 XML(給 makePPTX 的 slides/notes 參數用)。
|
||||
func pptxPara(texts ...string) string {
|
||||
var sb strings.Builder
|
||||
for _, text := range texts {
|
||||
fmt.Fprintf(&sb, `<a:p><a:r><a:t>%s</a:t></a:r></a:p>`, text)
|
||||
}
|
||||
return sb.String()
|
||||
}
|
||||
|
||||
// 測試 1:中文文字 + 多投影片內容與順序
|
||||
func TestExtractPPTX_中文與多投影片(t *testing.T) {
|
||||
slides := []string{
|
||||
pptxPara("策略規劃", "第一季目標"),
|
||||
pptxPara("執行計劃", "二月里程碑"),
|
||||
pptxPara("成果展示", "關鍵指標"),
|
||||
}
|
||||
got, err := ConvertToText("deck.pptx", makePPTX(t, slides, nil))
|
||||
if err != nil {
|
||||
t.Fatalf("不該出錯: %v", err)
|
||||
}
|
||||
for _, hdr := range []string{"投影片 1", "投影片 2", "投影片 3"} {
|
||||
if !strings.Contains(got, hdr) {
|
||||
t.Errorf("缺少標頭 %q,實得:\n%s", hdr, got)
|
||||
}
|
||||
}
|
||||
for _, kw := range []string{"策略規劃", "第一季目標", "二月里程碑", "成果展示", "關鍵指標"} {
|
||||
if !strings.Contains(got, kw) {
|
||||
t.Errorf("缺少關鍵字 %q,實得:\n%s", kw, got)
|
||||
}
|
||||
}
|
||||
// 投影片 1 的標頭必須在 2 之前,2 在 3 之前
|
||||
p1 := strings.Index(got, "投影片 1")
|
||||
p2 := strings.Index(got, "投影片 2")
|
||||
p3 := strings.Index(got, "投影片 3")
|
||||
if !(p1 < p2 && p2 < p3) {
|
||||
t.Errorf("投影片應按編號排序(1<2<3),實得:\n%s", got)
|
||||
}
|
||||
}
|
||||
|
||||
// 測試 2:數字排序——slide10 不能因字典序排到 slide2 前面
|
||||
func TestExtractPPTX_數字排序(t *testing.T) {
|
||||
var buf bytes.Buffer
|
||||
zw := zip.NewWriter(&buf)
|
||||
slideXML := func(n int) string {
|
||||
return fmt.Sprintf(
|
||||
`<?xml version="1.0" encoding="UTF-8"?>`+
|
||||
`<p:sld xmlns:p="http://schemas.openxmlformats.org/presentationml/2006/main"`+
|
||||
` xmlns:a="http://schemas.openxmlformats.org/drawingml/2006/main">`+
|
||||
`<p:cSld><p:spTree><p:sp><p:txBody>`+
|
||||
`<a:p><a:r><a:t>投影片%d的內容</a:t></a:r></a:p>`+
|
||||
`</p:txBody></p:sp></p:spTree></p:cSld></p:sld>`, n)
|
||||
}
|
||||
// 故意以字典序倒序放入 zip(10, 2, 1),驗輸出按數字序
|
||||
for _, n := range []int{10, 2, 1} {
|
||||
w, _ := zw.Create(fmt.Sprintf("ppt/slides/slide%d.xml", n))
|
||||
w.Write([]byte(slideXML(n)))
|
||||
}
|
||||
zw.Close()
|
||||
|
||||
got, err := ConvertToText("deck.pptx", buf.Bytes())
|
||||
if err != nil {
|
||||
t.Fatalf("不該出錯: %v", err)
|
||||
}
|
||||
pos1 := strings.Index(got, "投影片 1")
|
||||
pos2 := strings.Index(got, "投影片 2")
|
||||
pos10 := strings.Index(got, "投影片 10")
|
||||
if !(pos1 < pos2 && pos2 < pos10) {
|
||||
t.Errorf("數字排序應為 1<2<10,實得:\n%s", got)
|
||||
}
|
||||
}
|
||||
|
||||
// 測試 3:備註(notesSlide)有文字時附在投影片下
|
||||
func TestExtractPPTX_備註(t *testing.T) {
|
||||
slides := []string{pptxPara("標題投影片", "開場白")}
|
||||
notes := map[int]string{1: pptxPara("這是講者備註,強調重點一二三")}
|
||||
got, err := ConvertToText("deck.pptx", makePPTX(t, slides, notes))
|
||||
if err != nil {
|
||||
t.Fatalf("不該出錯: %v", err)
|
||||
}
|
||||
if !strings.Contains(got, "(備註)") {
|
||||
t.Errorf("應有(備註)標籤,實得:\n%s", got)
|
||||
}
|
||||
if !strings.Contains(got, "強調重點") {
|
||||
t.Errorf("備註文字應被抽出,實得:\n%s", got)
|
||||
}
|
||||
// 備註應在投影片本文之後
|
||||
bodyPos := strings.Index(got, "標題投影片")
|
||||
notesPos := strings.Index(got, "(備註)")
|
||||
if bodyPos < 0 || notesPos < 0 || bodyPos > notesPos {
|
||||
t.Errorf("備註應在投影片文字之後,bodyPos=%d notesPos=%d,實得:\n%s", bodyPos, notesPos, got)
|
||||
}
|
||||
}
|
||||
|
||||
// 測試 4:空簡報(純圖或全空白)應回 ErrNoText
|
||||
func TestExtractPPTX_空簡報ErrNoText(t *testing.T) {
|
||||
slides := []string{
|
||||
pptxPara(" "), // 只有空白
|
||||
pptxPara(""), // 無文字
|
||||
}
|
||||
_, err := ConvertToText("empty.pptx", makePPTX(t, slides, nil))
|
||||
if !errors.Is(err, ErrNoText) {
|
||||
t.Errorf("空簡報應回 ErrNoText,實得: %v", err)
|
||||
}
|
||||
}
|
||||
@@ -102,12 +102,12 @@ func TestWiring_抽不出文字要明確失敗不靜默(t *testing.T) {
|
||||
}
|
||||
}
|
||||
|
||||
// 還沒支援的格式(例如 .pptx 目前沒抽取器)要回 ErrUnsupported,
|
||||
// 不支援的格式(例如 .ppt 舊式二進位格式)要回 ErrUnsupported,
|
||||
// 訊息要跟「掃描件」區分開——給用戶的說法不同。
|
||||
func TestWiring_未支援格式與無文字要能區分(t *testing.T) {
|
||||
dir := t.TempDir()
|
||||
rel := "簡報.pptx"
|
||||
os.WriteFile(filepath.Join(dir, rel), []byte("PK\x03\x04fake"), 0o644)
|
||||
rel := "簡報.ppt"
|
||||
os.WriteFile(filepath.Join(dir, rel), []byte("\xD0\xCF\x11\xE0\xA1\xB1\x1A\xE1fake"), 0o644)
|
||||
|
||||
_, err := ExtractWithGemma("fake-key-for-test", "", dir, rel)
|
||||
if err == nil {
|
||||
|
||||
Reference in New Issue
Block a user