來源

我為什麼存

  • 想快速把網站內容抓下來,轉成乾淨 Markdown,方便做 RAG/知識庫/自動化 Agent。

重點(先記住)

  • 走 Python +(可選)CLI 的方式,把網頁抽成 Markdown。
  • 適合先抓「docs / 文章」類型內容,做自己的資料庫。
  • 風險:ToS/robots、反爬驗證、著作權與個資。

快速上手(抄就能跑)

TEXT
 pip install -U crawl4ai crawl4ai-setup crawl4ai-doctor 

(來自官方 README 的 Quick Start,後續細節以官方為準)

TEXT
 python -m playwright install --with-deps chromium 

如遇到瀏覽器依賴:

TODO(下次補)

  • 在 Windows 上實測抓一個 docs 網站,輸出 markdown 並存到 學習素材/(YYYY/MM)
  • 做一個「抓取 -> 分類 -> 寫入 Private Atlas」的小流程(配合本 知識庫 的 待整理流程)

相關