開源信息採集工具 MediaCrawler:一套命令獲取小紅書、抖音、B站等 7 個平台
整理版優先睇
大家好,我是 Immerse專注分享 AI 玩法、獨立開發與AI 出海的 AGI 實踐者,更多幹貨歡迎關注公眾號 #沉浸式AI 或訪問 yaolifeng.comMediaCrawler 把小紅書、抖音、快手、B 站、微博、貼吧和知乎的公開信息採集放進了同一個項目。它支持關鍵詞搜索、指定內容、評論與二級評論、創作者主頁等模式,數據可以保存為 CSV、JSON、JSONL、Excel、SQLite 或 MySQL。項目基於 Playwright 管理瀏覽器登錄態,並在保留登錄狀態的瀏覽器環境中獲取請求需要的參數。下面用 uv 和 Chrome CDP 跑通一個最小的小紅書關鍵詞采集流程,再補充詳情模式、WebUI 和常見問題。開始前要保留項目原本的邊界:所有內容只用於學習和研究,禁止商業用途、大規模採集、非法使用或侵犯他人合法權益。實際操作還要遵守目標平台規則、適用法律和數據授權範圍。項目地址:NanmiCoder/MediaCrawler準備運行環境素材當前給出的要求是 Node.js 16 或更高版本、最新版 Chrome 144 或更高版本,以及 uv。安裝完成後,用下面兩條命令檢查環境:uv --versionnode --version兩條命令都應該輸出版本號。默認的 CDP 模式會連接電腦上已有的 Chrome,不需要額外安裝 Playwright 瀏覽器驅動。在 Chrome 地址欄打開 chrome://inspect/#remote-debugging,勾選 Allow remote debugging for this browser instance。頁面出現下面這行內容,說明遠程調試已經就緒:Server running at: 127.0.0.1:9222運行採集程序後,Chrome 可能彈出確認對話框,需要在 60 秒內點擊接受。沒有看到 127.0.0.1:9222 時,不要急着運行主程序,先把遠程調試狀態處理好。安裝項目依賴把倉庫下載到本地後,在終端執行:git clone https://github.com/NanmiCoder/MediaCrawler.gitcd MediaCrawleruv syncuv sync 會按照項目配置同步 Python 版本與依賴。命令正常結束、沒有依賴解析錯誤,就可以進入配置步驟。想改用標準 Playwright 模式,可以在 config/base_config.py 中設置:ENABLE_CDP_MODE = False這種模式還要安裝瀏覽器驅動:uv run playwright install跑通關鍵詞采集打開 config/base_config.py,按照文件裏的中文註釋設置關鍵詞、數據保存方式和採集範圍。建議只填少量、明確授權的測試內容,不要一開始就擴大數量。保存配置後執行:uv run main.py --platform xhs --lt qrcode --type searchxhs 表示小紅書,qrcode 表示二維碼登錄,search 表示從配置文件讀取關鍵詞並採集匹配內容。程序顯示二維碼後,用對應 App 掃碼完成登錄。登錄成功後,終端會繼續輸出運行日誌。確認沒有登錄或依賴錯誤,並在配置的數據保存目標中看到內容與評論記錄,才算最小流程跑通;只看到程序啓動不算完成驗證。改成指定內容採集已經有明確的帖子 ID 時,在 config/base_config.py 填寫對應列表,把命令末尾改為 detail:uv run main.py --platform xhs --lt qrcode --type detail項目默認沒有開啓評論採集。確實需要評論並且具備合法授權時,把配置項改為:ENABLE_GET_COMMENTS = True其他平台的參數以程序幫助為準:uv run main.py --help不要照搬小紅書參數去猜其他平台。先從幫助信息確認平台標識、登錄方式和採集類型,再做小範圍驗證。用 WebUI 管理參數不想一直改配置文件,可以同時啓動 API 和前端開發服務器:# 終端 1uv run uvicorn api.main:app --port 8080 --reload# 終端 2cd webuinpm installnpm run dev瀏覽器訪問 http://localhost:5173/,可以可視化設置平台、登錄方式和採集類型,並查看運行狀態、日誌、數據預覽與導出。MediaCrawler WebUI 界面頁面首次打開會調用 /api/env/check 檢測環境。檢測失敗時,先確認 8080 端口的 API 服務正在運行;“跳過檢測”只能臨時進入界面,不能修復缺失的後端或依賴。想讓 API 服務直接提供 WebUI 靜態資源,需要構建前端:cd webuinpm installnpm run buildcd ..uv run uvicorn api.main:app --port 8080 --reload構建產物會寫入 api/webui/,服務啓動後訪問 http://localhost:8080。幾個容易卡住的地方CDP 模式連接失敗時,檢查 Chrome 版本、遠程調試開關和 127.0.0.1:9222,也要留意運行後出現的確認對話框。標準 Playwright 模式報瀏覽器缺失時,執行 uv run playwright install。這條命令在默認 CDP 模式下不是必需步驟。原生 venv 方案依賴 Python 與 requirements.txt 的兼容性,素材使用 Python 3.11,並明確把該方案標為不推薦。沒有特殊原因時,優先使用 uv sync。採集結果為空時,按登錄狀態、關鍵詞或 ID 配置、平台參數、評論開關和保存方式逐項檢查。任何模式都應先用少量授權數據驗證,確認輸出結構符合預期,再決定是否繼續。
大家好,我是 Immerse專注分享 AI 玩法、獨立開發與AI 出海的 AGI 實踐者,更多幹貨歡迎關注公眾號 #沉浸式AI 或訪問 yaolifeng.comMediaCrawler 把小紅書、抖音、快手、B 站、微博、貼吧和知乎的公開信息採集放進了同一個項目。它支持關鍵詞搜索、指定內容、評論與二級評論、創作者主頁等模式,數據可以保存為 CSV、JSON、JSONL、Excel、SQLite 或 MySQL。
項目基於 Playwright 管理瀏覽器登錄態,並在保留登錄狀態的瀏覽器環境中獲取請求需要的參數。下面用 uv 和 Chrome CDP 跑通一個最小的小紅書關鍵詞採集流程,再補充詳情模式、WebUI 和常見問題。開始前要保留項目原本的邊界:所有內容只用於學習和研究,禁止商業用途、大規模採集、非法使用或侵犯他人合法權益。
實際操作還要遵守目標平台規則、適用法律和數據授權範圍。項目地址:NanmiCoder/MediaCrawler準備運行環境素材當前給出的要求是 Node.js 16 或更高版本、最新版 Chrome 144 或更高版本,同埋 uv。安裝完成後,用下面兩條命令檢查環境:uv --versionnode --version兩條命令都應該輸出版本號。默認的 CDP 模式會連接電腦上已有的 Chrome,不需要額外安裝 Playwright 瀏覽器驅動。在 Chrome 地址欄打開 chrome…
- 開源信息採集工具 MediaCrawler:一套命令獲取小紅書、抖音…
- 開源信息採集工具 MediaCrawler:一套命令獲取小紅書、抖音…
- 開源信息採集工具 MediaCrawler:一套命令獲取小紅書、抖音…
- 開源信息採集工具 MediaCrawler:一套命令獲取小紅書、抖音…
- 開源信息採集工具 MediaCrawler:一套命令獲取小紅書、抖音…
可記低 Workflow
大家好,我是 Immerse專注分享 AI 玩法、獨立開發與AI 出海的 AGI 實踐者,更多幹貨歡迎關注公眾號 #沉浸式AI 或訪問 yaolifeng.comMediaCrawler 把小紅書、抖音、快手、B 站、微博、貼吧和知乎的公開…
整理版
大家好,我是 Immerse專注分享 AI 玩法、獨立開發與AI 出海的 AGI 實踐者,更多幹貨歡迎關注公眾號 #沉浸式AI 或訪問 yaolifeng.comMediaCrawler 把小紅書、抖音、快手、B 站、微博、貼吧和知乎的公開信息採集放進了同一個項目。它支持關鍵詞搜索、指定內容、評論與二級評論、創作者主頁等模式,數據可以保存為 CSV、JSON、JSONL、Excel、SQLite 或 MySQL。項目基於 Playwright 管理瀏覽器登錄態,並在保留登錄狀態的瀏覽器環境中獲取請求需要的參數。下面用 uv 和 Chrome CDP 跑通一個最小的小紅書關鍵詞採集流程,再補充詳情模式、WebUI 和常見問題。開始前要保留項目原本的邊界:所有內容只用於學習和研究,禁止商業用途、大規模採集、非法使用或侵犯他人合法權益。實際操作還要遵守目標平台規則、適用法律和數據授權範圍。項目地址:NanmiCoder/MediaCrawler準備運行環境素材當前給出的要求是 Node.js 16 或更高版本、最新版 Chrome 144 或更高版本,同埋 uv。安裝完成後,用下面兩條命令檢查環境:uv --versionnode --version兩條命令都應該輸出版本號。默認的 CDP 模式會連接電腦上已有的 Chrome,不需要額外安裝 Playwright 瀏覽器驅動。在 Chrome 地址欄打開 chrome://inspect/#remote-debugging,勾選 Allow remote debugging for this browser instance。頁面出現下面這行內容,說明遠程調試已經就緒:Server running at: 127.0.0.1:9222運行採集程序後,Chrome 可能彈出確認對話框,需要在 60 秒內點擊接受。沒有看到 127.0.0.1:9222 時,不要急着運行主程序,先把遠程調試狀態處理好。安裝項目依賴把倉庫下載到本地後,在終端執行:git clone https://github.com/NanmiCoder/MediaCrawler.gitcd MediaCrawleruv syncuv sync 會按照項目配置同步 Python 版本與依賴。命令正常結束、沒有依賴解析錯誤,就可以進入配置步驟。想改用標準 Playwright 模式,可以在 config/base_config.py 中設置:ENABLE_CDP_MODE = False這種模式還要安裝瀏覽器驅動:uv run playwright install跑通關鍵詞採集打開 config/base_config.py,按照文件裏的中文註釋設置關鍵詞、數據保存方式和採集範圍。建議只填少量、明確授權的測試內容,不要一開始就擴大數量。保存配置後執行:uv run main.py --platform xhs --lt qrcode --type searchxhs 表示小紅書,qrcode 表示二維碼登錄,search 表示從配置文件讀取關鍵詞並採集匹配內容。程序顯示二維碼後,用對應 App 掃碼完成登錄。登錄成功後,終端會繼續輸出運行日誌。確認沒有登錄或依賴錯誤,並在配置的數據保存目標中看到內容與評論記錄,才算最小流程跑通;只看到程序啓動不算完成驗證。改成指定內容採集已經有明確的帖子 ID 時,在 config/base_config.py 填寫對應列表,把命令末尾改為 detail:uv run main.py --platform xhs --lt qrcode --type detail項目默認沒有開啓評論採集。確實需要評論並且具備合法授權時,把配置項改為:ENABLE_GET_COMMENTS = True其他平台的參數以程序幫助為準:uv run main.py --help不要照搬小紅書參數去猜其他平台。先從幫助信息確認平台標識、登錄方式和採集類型,再做小範圍驗證。用 WebUI 管理參數不想一直改配置文件,可以同時啓動 API 和前端開發服務器:# 終端 1uv run uvicorn api.main:app --port 8080 --reload# 終端 2cd webuinpm installnpm run dev瀏覽器訪問 http://localhost:5173/,可以可視化設置平台、登錄方式和採集類型,並查看運行狀態、日誌、數據預覽與導出。MediaCrawler WebUI 界面頁面首次打開會調用 /api/env/check 檢測環境。檢測失敗時,先確認 8080 端口的 API 服務正在運行;“跳過檢測”只能臨時進入界面,不能修復缺失的後端或依賴。想讓 API 服務直接提供 WebUI 靜態資源,需要構建前端:cd webuinpm installnpm run buildcd ..uv run uvicorn api.main:app --port 8080 --reload構建產物會寫入 api/webui/,服務啓動後訪問 http://localhost:8080。幾個容易卡住的地方CDP 模式連接失敗時,檢查 Chrome 版本、遠程調試開關和 127.0.0.1:9222,也要留意運行後出現的確認對話框。標準 Playwright 模式報瀏覽器缺失時,執行 uv run playwright install。這條命令在默認 CDP 模式下不是必需步驟。原生 venv 方案依賴 Python 與 requirements.txt 的兼容性,素材使用 Python 3.11,並明確把該方案標為不推薦。沒有特殊原因時,優先使用 uv sync。採集結果為空時,按登錄狀態、關鍵詞或 ID 配置、平台參數、評論開關和保存方式逐項檢查。任何模式都應先用少量授權數據驗證,確認輸出結構符合預期,再決定是否繼續。
大家好,我係 Immerse
專注分享 AI 玩法、獨立開發與AI 出海嘅 AGI 實踐者,更多乾貨歡迎關注公眾號 #沉浸式AI 或訪問 yaolifeng.com
MediaCrawler 將小紅書、抖音、快手、B站、微博、貼吧同知乎嘅公開資訊採集放埋同一個項目入面。佢支援關鍵字搜尋、指定內容、評論同二級評論、創作者主頁等模式,數據可以儲存做 CSV、JSON、JSONL、Excel、SQLite 或 MySQL。
項目基於 Playwright 管理瀏覽器登入狀態,並喺保留登入狀態嘅瀏覽器環境中攞到請求所需嘅參數。跟住落嚟用 uv 同 Chrome CDP 行通一個最小嘅小紅書關鍵詞採集流程,再補充詳情模式、WebUI 同常見問題。
開始之前要保留呢個項目原本嘅界線:所有內容只可以用嚟學習同研究,禁止商業用途、大規模採集、非法使用或者侵犯他人合法權益。
實際操作仲要遵守目標平台規則、適用法律同數據授權範圍。
項目地址:NanmiCoder/MediaCrawler
準備執行環境
項目而家要求 Node.js 16 或以上版本、最新版 Chrome 144 或以上版本,同埋 uv。安裝完成之後,用下面兩條命令檢查環境:
uv --version
node --version
兩條命令都應該輸出版本號。預設嘅 CDP 模式會連接電腦上已經有嘅 Chrome,唔使額外安裝 Playwright 瀏覽器驅動。
喺 Chrome 網址欄打開 chrome://inspect/#remote-debugging,勾選 Allow remote debugging for this browser instance。頁面出現下面呢行內容,就代表遠端除錯已經準備好:
Server running at: 127.0.0.1:9222
執行採集程式之後,Chrome 可能會彈出確認對話框,需要喺 60 秒內撳接受。
冇睇到 127.0.0.1:9222 嘅時候,唔好急住執行主程式,先將遠端除錯狀態處理好。
安裝項目依賴
將倉庫下載到本地之後,喺終端機執行:
git clone https://github.com/NanmiCoder/MediaCrawler.git
cd MediaCrawler
uv sync
uv sync 會按照項目配置同步 Python 版本同依賴。命令正常結束、冇依賴解析錯誤,就可以進入配置步驟。
如果想改用標準 Playwright 模式,可以喺 config/base_config.py 入面設定:
ENABLE_CDP_MODE = False
呢種模式仲要安裝瀏覽器驅動:
uv run playwright install
行通關鍵詞採集
打開 config/base_config.py,跟住按照檔案入面嘅中文註釋設定關鍵詞、數據儲存方式同採集範圍。建議只填少量、有明確授權嘅測試內容,唔好一開始就擴大數量。
儲存配置之後執行:
uv run main.py --platform xhs --lt qrcode --type search
xhs 代表小紅書,qrcode 代表二維碼登入,search 代表由配置文件讀取關鍵詞並採集匹配嘅內容。程式顯示二維碼之後,用相應 App 掃碼完成登入。
登入成功之後,終端會繼續輸出執行日誌。確認冇登入或者依賴錯誤,而且喺配置嘅數據儲存目標中睇到內容同評論記錄,先至算最小流程行通;淨係睇到程式啟動唔算完成驗證。
改成指定內容採集
如果已經有明確嘅帖子 ID,喺 config/base_config.py 填寫相應列表,將命令尾段改為 detail:
uv run main.py --platform xhs --lt qrcode --type detail
項目預設冇開啟評論採集。如果確實需要評論而且具備合法授權,就將配置項改為:
ENABLE_GET_COMMENTS = True
其他平台嘅參數以程式說明為準:
uv run main.py --help
唔好照搬小紅書參數去估其他平台。要先由程式說明確認平台標識、登入方式同採集類型,再進行小範圍驗證。
用 WebUI 嚟管理參數
唔想成日改配置文件,可以同時啟動 API 同前端開發伺服器:
# 終端 1
uv run uvicorn api.main:app --port 8080 --reload
# 終端 2
cd webui
npm install
npm run dev
用瀏覽器訪問 http://localhost:5173/,可以可視化設定平台、登入方式同採集類型,仲可以睇執行狀態、日誌、資料預覽同匯出。

頁面第一次開啟會調用 /api/env/check 偵測環境。偵測失敗時,先確認 8080 連接埠嘅 API 服務正在運行;「跳過偵測」只可以臨時進入介面,並唔可以修復缺失嘅後端或者依賴。
想令 API 服務直接提供 WebUI 靜態資源,就需要構建前端:
cd webui
npm install
npm run build
cd ..
uv run uvicorn api.main:app --port 8080 --reload
構建成果會寫入 api/webui/,服務啟動之後訪問 http://localhost:8080。
幾個容易卡住嘅地方
CDP 模式連接失敗時,檢查 Chrome 版本、遠端除錯開關同 127.0.0.1:9222,都要留意執行之後出現嘅確認對話框。
標準 Playwright 模式報瀏覽器缺失時,執行 uv run playwright install。呢條命令喺預設 CDP 模式下唔係必需步驟。
原生 venv 方案依賴 Python 同 requirements.txt 嘅兼容性,項目使用 Python 3.11,並明確標示該方案為不推薦。冇特殊原因時,優先使用 uv sync。
採集結果係空嘅時候,就按登入狀態、關鍵詞或 ID 配置、平台參數、評論開關同儲存方式逐項檢查。任何模式都應該先用少量授權數據驗證,確認輸出結構符合預期,再決定係咪繼續。
大家好,我是 Immerse
專注分享 AI 玩法、獨立開發與AI 出海的 AGI 實踐者,更多幹貨歡迎關注公眾號 #沉浸式AI 或訪問 yaolifeng.com
MediaCrawler 把小紅書、抖音、快手、B 站、微博、貼吧和知乎的公開信息採集放進了同一個項目。它支持關鍵詞搜索、指定內容、評論與二級評論、創作者主頁等模式,數據可以保存為 CSV、JSON、JSONL、Excel、SQLite 或 MySQL。
項目基於 Playwright 管理瀏覽器登錄態,並在保留登錄狀態的瀏覽器環境中獲取請求需要的參數。下面用 uv 和 Chrome CDP 跑通一個最小的小紅書關鍵詞采集流程,再補充詳情模式、WebUI 和常見問題。
開始前要保留項目原本的邊界:所有內容只用於學習和研究,禁止商業用途、大規模採集、非法使用或侵犯他人合法權益。
實際操作還要遵守目標平台規則、適用法律和數據授權範圍。
項目地址:NanmiCoder/MediaCrawler
準備運行環境
素材當前給出的要求是 Node.js 16 或更高版本、最新版 Chrome 144 或更高版本,以及 uv。安裝完成後,用下面兩條命令檢查環境:
uv --version
node --version
兩條命令都應該輸出版本號。默認的 CDP 模式會連接電腦上已有的 Chrome,不需要額外安裝 Playwright 瀏覽器驅動。
在 Chrome 地址欄打開 chrome://inspect/#remote-debugging,勾選 Allow remote debugging for this browser instance。頁面出現下面這行內容,說明遠程調試已經就緒:
Server running at: 127.0.0.1:9222
運行採集程序後,Chrome 可能彈出確認對話框,需要在 60 秒內點擊接受。
沒有看到 127.0.0.1:9222 時,不要急着運行主程序,先把遠程調試狀態處理好。
安裝項目依賴
把倉庫下載到本地後,在終端執行:
git clone https://github.com/NanmiCoder/MediaCrawler.git
cd MediaCrawler
uv sync
uv sync 會按照項目配置同步 Python 版本與依賴。命令正常結束、沒有依賴解析錯誤,就可以進入配置步驟。
想改用標準 Playwright 模式,可以在 config/base_config.py 中設置:
ENABLE_CDP_MODE = False
這種模式還要安裝瀏覽器驅動:
uv run playwright install
跑通關鍵詞采集
打開 config/base_config.py,按照文件裏的中文註釋設置關鍵詞、數據保存方式和採集範圍。建議只填少量、明確授權的測試內容,不要一開始就擴大數量。
保存配置後執行:
uv run main.py --platform xhs --lt qrcode --type search
xhs 表示小紅書,qrcode 表示二維碼登錄,search 表示從配置文件讀取關鍵詞並採集匹配內容。程序顯示二維碼後,用對應 App 掃碼完成登錄。
登錄成功後,終端會繼續輸出運行日誌。確認沒有登錄或依賴錯誤,並在配置的數據保存目標中看到內容與評論記錄,才算最小流程跑通;只看到程序啓動不算完成驗證。
改成指定內容採集
已經有明確的帖子 ID 時,在 config/base_config.py 填寫對應列表,把命令末尾改為 detail:
uv run main.py --platform xhs --lt qrcode --type detail
項目默認沒有開啓評論採集。確實需要評論並且具備合法授權時,把配置項改為:
ENABLE_GET_COMMENTS = True
其他平台的參數以程序幫助為準:
uv run main.py --help
不要照搬小紅書參數去猜其他平台。先從幫助信息確認平台標識、登錄方式和採集類型,再做小範圍驗證。
用 WebUI 管理參數
不想一直改配置文件,可以同時啓動 API 和前端開發服務器:
# 終端 1
uv run uvicorn api.main:app --port 8080 --reload
# 終端 2
cd webui
npm install
npm run dev
瀏覽器訪問 http://localhost:5173/,可以可視化設置平台、登錄方式和採集類型,並查看運行狀態、日誌、數據預覽與導出。

頁面首次打開會調用 /api/env/check 檢測環境。檢測失敗時,先確認 8080 端口的 API 服務正在運行;“跳過檢測”只能臨時進入界面,不能修復缺失的後端或依賴。
想讓 API 服務直接提供 WebUI 靜態資源,需要構建前端:
cd webui
npm install
npm run build
cd ..
uv run uvicorn api.main:app --port 8080 --reload
構建產物會寫入 api/webui/,服務啓動後訪問 http://localhost:8080。
幾個容易卡住的地方
CDP 模式連接失敗時,檢查 Chrome 版本、遠程調試開關和 127.0.0.1:9222,也要留意運行後出現的確認對話框。
標準 Playwright 模式報瀏覽器缺失時,執行 uv run playwright install。這條命令在默認 CDP 模式下不是必需步驟。
原生 venv 方案依賴 Python 與 requirements.txt 的兼容性,素材使用 Python 3.11,並明確把該方案標為不推薦。沒有特殊原因時,優先使用 uv sync。
採集結果為空時,按登錄狀態、關鍵詞或 ID 配置、平台參數、評論開關和保存方式逐項檢查。任何模式都應先用少量授權數據驗證,確認輸出結構符合預期,再決定是否繼續。