Главная · Скиллы · firecrawl-crawl

firecrawl-crawlмассовое извлечение сайтов

firecrawl/cli

Массовое извлечение структурированного контента с целых сайтов или разделов через Firecrawl: URLs, markdown, метаданные в одном запросе.

Установка

npx -y skills add firecrawl/cli --skill firecrawl-crawl --agent claude-code

Firecrawl Crawl

Массовое извлечение контента со всего сайта или его раздела. Используйте, когда нужно обойти сайт, извлечь все страницы из раздела документации, или сказано «обойди», «получи все страницы», «извлеки всё из /docs».

Когда использовать

  • Нужен контент со многих страниц сайта (например, все /docs/)
  • Нужно извлечь целый раздел сайта
  • Шаг 4 в паттерне эскалации: search → scrape → map → crawl → interact

Быстрый старт

# Обход раздела docs
firecrawl crawl "<url>" --include-paths /docs --limit 50 --wait -o .firecrawl/crawl.json

# Полный обход с ограничением глубины
firecrawl crawl "<url>" --max-depth 3 --wait --progress -o .firecrawl/crawl.json

# Проверить статус запущенного crawl
firecrawl crawl <job-id>

Параметры

ПараметрОписание
--waitЖдать завершения crawl перед возвратом
--progressПоказывать прогресс во время ожидания
--limit <n>Максимальное число страниц для обхода
--max-depth <n>Максимальная глубина следования по ссылкам
--include-paths <paths>Обходить только URL, соответствующие этим путям
--exclude-paths <paths>Пропускать URL, соответствующие этим путям
--delay <ms>Задержка между запросами
--max-concurrency <n>Максимальное число параллельных воркеров
--prettyКрасивый вывод JSON
-o, --output <path>Путь к файлу вывода

Советы

  • Всегда используйте --wait, когда результаты нужны сразу. Без него crawl возвращает job ID для асинхронного опроса.
  • Используйте --include-paths для ограничения обхода — не обходите весь сайт, когда нужен только один раздел.
  • Crawl потребляет кредиты за каждую страницу. Проверьте firecrawl credit-usage перед большими обходами.

Из того же репозитория

firecrawlавтономный веб-скрапинг
firecrawl/cli
Автономный скрапинг для сложных задач: описываете что нужно — не пишете ломкие скраперы. Работает с JS-рендеренными сайтами там, где другие дают сбой.
42866k установок
firecrawl-scrapeчистый markdown из любого URL
firecrawl/cli
Извлекает чистый LLM-оптимизированный markdown с любого URL через Firecrawl: статические страницы и JS-рендеренные SPA.
42851k установок
firecrawl-searchвеб-поиск с извлечением контента
firecrawl/cli
Веб-поиск с опциональным извлечением полного содержания страниц: структурированный JSON вместо простых сниппетов.
42850.9k установок
firecrawl-agentAI-агент для сложных сайтов
firecrawl/cli
Firecrawl агент автономно навигирует по сложным многостраничным сайтам и извлекает структурированные данные JSON по заданной схеме.
42850k установок
firecrawl-mapкарта всех URL сайта
firecrawl/cli
Находит и перечисляет все URL сайта через Firecrawl с опциональным поиском для поиска конкретных страниц на больших ресурсах.
42849.7k установок
firecrawl-downloadскачивание сайта в локальные файлы
firecrawl/cli
Маппирует и скрапит целые сайты в организованные локальные директории: markdown, ссылки и скриншоты в нескольких форматах.
42849.6k установок