Octoparse
用視覺化流程從網頁擷取資料並自動匯出
🤔 勉強可以
單一網站能刻,通用爬蟲不值得重造
月費(約)
未知
一年省下
—
自己刻要多久
好幾天
幾個人做得出來
兩個人
分類
🤖 自動化
價格為約略值,以官網為準。Standard 入門方案價格會依月繳、年繳與促銷變動,無法保守確認固定月費;
護城河
判決理由
針對固定網站,Playwright 加 CSS/XPath 選擇器就能刻出點擊、翻頁、登入、擷取表格與 CSV 匯出的流程。難的是做成通用工具:視覺化選取器、JavaScript 動態頁、代理與驗證碼處理、排程重試、欄位變更提醒,以及大量任務的穩定執行。自用只爬一兩個網站時,自己刻很划算。
為什麼大家還是付錢
付費買的是不用為每個網站除錯的視覺化介面、雲端排程、代理資源與失敗重試。流程固定、執行量不高的人,沒必要照單全收。
建置 prompt
複製下面這段,丟給你的 AI coding 工具,讓它替你刻一個自用版。
目標:做一個本機優先的網頁資料擷取工具,讓我為固定網站建立可重跑的爬蟲流程並匯出資料。
技術棧建議:Python Playwright + SQLite + FastAPI,前端使用原生 HTML/CSS/JavaScript,資料匯出使用 CSV 與 JSON。
需求:
- 輸入網址後開啟可互動的瀏覽器預覽,支援點擊、輸入文字與等待元素
- 以 CSS 選擇器或 XPath 定義單筆欄位,支援文字、連結、圖片網址與 HTML 屬性
- 支援從清單頁擷取多筆資料,設定下一頁按鈕或網址分頁規則
- 可建立多步驟流程,包含開啟網址、點擊、填表、等待、擷取與翻頁
- 支援等待固定時間、等待元素出現與頁面載入完成
- 支援登入流程,將敏感欄位以本機環境變數或加密設定保存
- 將流程與欄位設定保存到 SQLite,可複製、編輯、停用與刪除
- 執行任務時顯示目前頁數、成功筆數、失敗步驟與錯誤訊息
- 單一任務支援手動執行、定時執行、逾時、中斷後重試與結果去重
- 提供資料預覽、欄位型別轉換、空值處理與自訂固定欄位
- 可匯出目前結果與歷史執行結果為 CSV、JSON、SQLite 檔案
- 針對 robots.txt、網站條款、請求間隔與同時執行數提供明確設定
明確不做(out of scope):通用代理池、驗證碼繞過、破解登入或付費牆、雲端多租戶、團隊權限、瀏覽器擴充功能與大規模分散式爬蟲。
README 要求:說明本機安裝、Playwright 瀏覽器安裝、建立流程的範例、選擇器除錯方式、排程設定、資料位置、匯出格式與合法使用注意事項。
「用 Claude Code 開啟」複製的是 claude "<prompt>",貼進終端機即可;
Codex、Cursor、Copilot 等工具直接用左邊的複製鈕貼進對話框。
免費 / 開源替代
- Scrapy 開源
成熟的 Python 爬蟲框架,適合結構化資料與大量頁面。 - Crawlee 開源
支援 Playwright 與多種爬蟲策略,適合自行組流程。 - Apify 免費增值
提供雲端爬蟲執行環境與現成 Actors,免費額度有限。
替代品由 AI 依公開資訊列出,尚未逐一連線驗證(unverified),請自行確認是否仍在維護。
這個判決會隨模型進步翻盤:今天的「勉強可以」很可能半年後變成「可以刻」。
判決依 rubric v1.0.0 於 2026-08-31 生成。