Files
Leo 4d3a6a09a6 v0.18.9:collector 併進同一支執行檔——磁碟上不再攤出第二支 exe
leo 08-06 裁決:「不要兩支,寫成一支檔案」。

## 為什麼
v0.18.7-8 的「單一 exe」其實是**一支包著另一支**:collector.exe 被 go:embed
進 Arcrun.exe,執行時攤到 ~/.arcrun-rag/bin/ 再跑。
那正是防毒軟體眼中的 dropper 特徵 —— 封測者實撞
`Trojan:Win32/Sabsik.FL.A!ml`,檔案當場被隔離、自動刪除。

⚠️ 誠實界定:`!ml` 結尾=**機器學習判定**,Sabsik 是最常見的通用誤判家族,
   主因是「未簽章+下載次數少」,**不是**特別指向 dropper 行為。
   所以本次改動**不保證**解除誤判——真正的解是上架 MS Store(微軟簽章)。
   但「執行時把第二支 PE 寫到磁碟再執行」本來就該拿掉,這是對的方向且順手變小。

## 怎麼做
- `collector/` 39 個檔 `package main` → `package collector`,`main()` → 匯出的 `Run(args) int`
- 新增 `collector/cmd/collector/`(薄殼 CLI,讓單獨跑 collector 這條路仍可用)
- App 直接 import 該套件;`main()` 第一件事就判 `--collector`,是的話走 `collector.Run` 不碰 GUI
- `supervisor` 加 `ArgPrefix`,App 把 `BinPath` 指向 `os.Executable()` 自己
- 刪掉 `bundled_collector_{windows,other}.go`(embed + 攤檔那套)
- 三支打包腳本不再編/複製第二支;版本注入同時打到兩個 package
- build-win.sh 的機械閘改成**直接問它**:`--collector --version` 回得出版本才放行
  (舊閘是比大小,只能證明「有 embed」,證明不了「分派是對的」)

## 驗(真機實跑)
· `.app/Contents/MacOS/` 只有 **一個** 執行檔(原本兩個)
· 跑起來兩個行程是**同一個 exe**:
    …/MacOS/arcrun-app
    …/MacOS/arcrun-app --collector direct --config …
· `~/.arcrun-rag/bin` **不存在**(沒有任何東西被攤出來)
· 端到端:丟檔進看守資料夾 → collector.log `"status":"ingested","http_status":200`
· `lsappinfo` 仍是 `type="UIElement"`、`Version="0.18.9"`
· collector 39 檔測試全過;app 測試過;go vet 全綠;mac + windows 交叉編譯皆過
· 單檔 26MB → 22MB(不再夾帶第二份完整程式)
2026-08-06 16:00:47 +08:00

131 lines
3.1 KiB
Go

// convert_pptx.go — .pptx 抽文字(ZIP+XML,與 .docx 同路數)
//
// PPTX 結構:ZIP 裡有 ppt/slides/slideN.xml(主文)
// 與 ppt/notesSlides/notesSlideN.xml(備註)。
// 文字全在 DrawingML <a:t> 標籤裡;段落是 <a:p>。
// 體積代價幾乎零(只用標準庫)。
package collector
import (
"archive/zip"
"bytes"
"encoding/xml"
"fmt"
"io"
"regexp"
"sort"
"strconv"
"strings"
"golang.org/x/text/unicode/norm"
)
var pptxSlideRe = regexp.MustCompile(`^ppt/slides/slide(\d+)\.xml$`)
var pptxNotesRe = regexp.MustCompile(`^ppt/notesSlides/notesSlide(\d+)\.xml$`)
func extractPPTX(data []byte) (string, error) {
zr, err := zip.NewReader(bytes.NewReader(data), int64(len(data)))
if err != nil {
return "", fmt.Errorf("pptx 解壓失敗(可能是檔案損壞):%w", err)
}
slideData := map[int][]byte{}
notesData := map[int][]byte{}
for _, f := range zr.File {
if m := pptxSlideRe.FindStringSubmatch(f.Name); m != nil {
num, _ := strconv.Atoi(m[1])
rc, err := f.Open()
if err != nil {
return "", fmt.Errorf("讀 %s 失敗:%w", f.Name, err)
}
b, readErr := io.ReadAll(rc)
rc.Close()
if readErr != nil {
return "", fmt.Errorf("讀 %s 失敗:%w", f.Name, readErr)
}
slideData[num] = b
} else if m := pptxNotesRe.FindStringSubmatch(f.Name); m != nil {
num, _ := strconv.Atoi(m[1])
rc, err := f.Open()
if err != nil {
continue // 備註讀失敗不中斷主流程
}
b, readErr := io.ReadAll(rc)
rc.Close()
if readErr != nil {
continue
}
notesData[num] = b
}
}
if len(slideData) == 0 {
return "", ErrNoText
}
nums := make([]int, 0, len(slideData))
for n := range slideData {
nums = append(nums, n)
}
sort.Ints(nums)
var sb strings.Builder
for _, n := range nums {
body := pptxXMLText(bytes.NewReader(slideData[n]))
notes := ""
if nd, ok := notesData[n]; ok {
notes = pptxXMLText(bytes.NewReader(nd))
}
if strings.TrimSpace(body) == "" && strings.TrimSpace(notes) == "" {
continue
}
fmt.Fprintf(&sb, "## 投影片 %d\n\n", n)
if strings.TrimSpace(body) != "" {
sb.WriteString(strings.TrimSpace(body))
sb.WriteString("\n")
}
if strings.TrimSpace(notes) != "" {
sb.WriteString("\n(備註)\n")
sb.WriteString(strings.TrimSpace(notes))
sb.WriteString("\n")
}
sb.WriteString("\n")
}
result := strings.TrimSpace(sb.String())
if result == "" {
return "", ErrNoText
}
return result, nil
}
// pptxXMLText 串流解 XML,收集所有 CharData,以 <a:p> 段落分行。
// Local name 比對(不看 namespace 前綴,與 docxXMLText 同做法)。
func pptxXMLText(r io.Reader) string {
dec := xml.NewDecoder(r)
var sb strings.Builder
for {
tok, err := dec.Token()
if err != nil {
break
}
switch t := tok.(type) {
case xml.StartElement:
switch t.Name.Local {
case "p":
sb.WriteString("\n")
case "tab":
sb.WriteString("\t")
case "br":
sb.WriteString("\n")
}
case xml.CharData:
sb.WriteString(norm.NFKC.String(string(t)))
}
}
return strings.TrimLeft(sb.String(), "\n")
}