來源
- 官網/GitHub:
https://github.com/unclecode/crawl4ai
我為什麼存
- 想快速把網站內容抓下來,轉成乾淨 Markdown,方便做 RAG/知識庫/自動化 Agent。
重點(先記住)
- 走 Python +(可選)CLI 的方式,把網頁抽成 Markdown。
- 適合先抓「docs / 文章」類型內容,做自己的資料庫。
- 風險:ToS/robots、反爬驗證、著作權與個資。
快速上手(抄就能跑)
pip install -U crawl4ai crawl4ai-setup crawl4ai-doctor (來自官方 README 的 Quick Start,後續細節以官方為準)
python -m playwright install --with-deps chromium 如遇到瀏覽器依賴:
TODO(下次補)
- 在 Windows 上實測抓一個 docs 網站,輸出 markdown 並存到
學習素材/(YYYY/MM)
- 做一個「抓取 -> 分類 -> 寫入 Private Atlas」的小流程(配合本 知識庫 的 待整理流程)
留言
暫時未有公開留言。
登入後可以留言。