firecrawl-crawlмассовое извлечение сайтов
firecrawl/cli
Массовое извлечение структурированного контента с целых сайтов или разделов через Firecrawl: URLs, markdown, метаданные в одном запросе.
Установка
npx -y skills add firecrawl/cli --skill firecrawl-crawl --agent claude-codeFirecrawl Crawl
Массовое извлечение контента со всего сайта или его раздела. Используйте, когда нужно обойти сайт, извлечь все страницы из раздела документации, или сказано «обойди», «получи все страницы», «извлеки всё из /docs».
Когда использовать
- Нужен контент со многих страниц сайта (например, все
/docs/) - Нужно извлечь целый раздел сайта
- Шаг 4 в паттерне эскалации: search → scrape → map → crawl → interact
Быстрый старт
# Обход раздела docs
firecrawl crawl "<url>" --include-paths /docs --limit 50 --wait -o .firecrawl/crawl.json
# Полный обход с ограничением глубины
firecrawl crawl "<url>" --max-depth 3 --wait --progress -o .firecrawl/crawl.json
# Проверить статус запущенного crawl
firecrawl crawl <job-id>
Параметры
| Параметр | Описание |
|---|---|
--wait | Ждать завершения crawl перед возвратом |
--progress | Показывать прогресс во время ожидания |
--limit <n> | Максимальное число страниц для обхода |
--max-depth <n> | Максимальная глубина следования по ссылкам |
--include-paths <paths> | Обходить только URL, соответствующие этим путям |
--exclude-paths <paths> | Пропускать URL, соответствующие этим путям |
--delay <ms> | Задержка между запросами |
--max-concurrency <n> | Максимальное число параллельных воркеров |
--pretty | Красивый вывод JSON |
-o, --output <path> | Путь к файлу вывода |
Советы
- Всегда используйте
--wait, когда результаты нужны сразу. Без него crawl возвращает job ID для асинхронного опроса. - Используйте
--include-pathsдля ограничения обхода — не обходите весь сайт, когда нужен только один раздел. - Crawl потребляет кредиты за каждую страницу. Проверьте
firecrawl credit-usageперед большими обходами.
Из того же репозитория
firecrawl — автономный веб-скрапинг
firecrawl/cli
Автономный скрапинг для сложных задач: описываете что нужно — не пишете ломкие скраперы. Работает с JS-рендеренными сайтами там, где другие дают сбой.
firecrawl-scrape — чистый markdown из любого URL
firecrawl/cli
Извлекает чистый LLM-оптимизированный markdown с любого URL через Firecrawl: статические страницы и JS-рендеренные SPA.
firecrawl-search — веб-поиск с извлечением контента
firecrawl/cli
Веб-поиск с опциональным извлечением полного содержания страниц: структурированный JSON вместо простых сниппетов.
firecrawl-agent — AI-агент для сложных сайтов
firecrawl/cli
Firecrawl агент автономно навигирует по сложным многостраничным сайтам и извлекает структурированные данные JSON по заданной схеме.
firecrawl-map — карта всех URL сайта
firecrawl/cli
Находит и перечисляет все URL сайта через Firecrawl с опциональным поиском для поиска конкретных страниц на больших ресурсах.
firecrawl-download — скачивание сайта в локальные файлы
firecrawl/cli
Маппирует и скрапит целые сайты в организованные локальные директории: markdown, ссылки и скриншоты в нескольких форматах.
