firecrawl-scrapeчистый markdown из любого URL
firecrawl/cli
Извлекает чистый LLM-оптимизированный markdown с любого URL через Firecrawl: статические страницы и JS-рендеренные SPA.
Установка
npx -y skills add firecrawl/cli --skill firecrawl-scrape --agent claude-codeFirecrawl Scrape
Извлечение чистого markdown из любого URL, включая JavaScript-рендеренные SPA. Используйте этот скилл, когда пользователь указывает URL и хочет получить его содержимое, говорит «скрапь», «скачай», «извлеки», «получи страницу». Обрабатывает JS-рендеренные страницы и несколько параллельных URL. Используйте вместо WebFetch для любого извлечения контента веб-страниц.
Когда использовать
- Есть конкретный URL и нужно его содержимое
- Страница статическая или JS-рендеренная (SPA)
- Шаг 2 в паттерне эскалации воркфлоу: search → scrape → map → crawl → interact
Быстрый старт
# Базовое извлечение markdown
firecrawl scrape "<url>" -o .firecrawl/page.md
# Только основной контент, без nav/footer
firecrawl scrape "<url>" --only-main-content -o .firecrawl/page.md
# Подождать JS-рендеринга, затем скрапить
firecrawl scrape "<url>" --wait-for 3000 -o .firecrawl/page.md
# Несколько URL (каждый сохраняется в .firecrawl/)
firecrawl scrape https://example.com https://example.com/blog https://example.com/docs
# Получить markdown и ссылки вместе
firecrawl scrape "<url>" --format markdown,links -o .firecrawl/page.json
# Задать вопрос о странице
firecrawl scrape "https://example.com/pricing" --query "What is the enterprise plan price?"
Параметры
| Параметр | Описание |
|---|---|
-f, --format <formats> | Форматы вывода: markdown, html, rawHtml, links, screenshot, json |
-Q, --query <prompt> | Задать вопрос о содержимом страницы (5 кредитов) |
-H | Включить HTTP-заголовки в вывод |
--only-main-content | Убрать nav, footer, sidebar — только основной контент |
--wait-for <ms> | Ждать JS-рендеринга перед скрапингом |
--include-tags <tags> | Включить только эти HTML-теги |
--exclude-tags <tags> | Исключить эти HTML-теги |
--redact-pii | Скрыть персональные данные в выводе |
-o, --output <path> | Путь к файлу вывода |
Советы
- Предпочитайте обычный scrape вместо
--query. Сохраните в файл, затем используйтеgrep,headили читайте markdown напрямую. Используйте--queryтолько для одного конкретного ответа без сохранения страницы (стоит 5 дополнительных кредитов). - Сначала пробуйте scrape, затем interact. Scrape справляется со статическими и JS-рендеренными SPA. Переходите к
interactтолько когда нужны клики, заполнение форм, пагинация. - Несколько URL скрапятся параллельно — проверьте
firecrawl --statusдля вашего лимита параллельности. - Один формат — вывод сырого контента. Несколько форматов (
--format markdown,links) — вывод JSON. - Всегда обрамляйте URL кавычками — shell интерпретирует
?и&как спецсимволы. - Соглашение по именованию:
.firecrawl/{site}-{path}.md
Из того же репозитория
firecrawl — автономный веб-скрапинг
firecrawl/cli
Автономный скрапинг для сложных задач: описываете что нужно — не пишете ломкие скраперы. Работает с JS-рендеренными сайтами там, где другие дают сбой.
firecrawl-search — веб-поиск с извлечением контента
firecrawl/cli
Веб-поиск с опциональным извлечением полного содержания страниц: структурированный JSON вместо простых сниппетов.
firecrawl-agent — AI-агент для сложных сайтов
firecrawl/cli
Firecrawl агент автономно навигирует по сложным многостраничным сайтам и извлекает структурированные данные JSON по заданной схеме.
firecrawl-crawl — массовое извлечение сайтов
firecrawl/cli
Массовое извлечение структурированного контента с целых сайтов или разделов через Firecrawl: URLs, markdown, метаданные в одном запросе.
firecrawl-map — карта всех URL сайта
firecrawl/cli
Находит и перечисляет все URL сайта через Firecrawl с опциональным поиском для поиска конкретных страниц на больших ресурсах.
firecrawl-download — скачивание сайта в локальные файлы
firecrawl/cli
Маппирует и скрапит целые сайты в организованные локальные директории: markdown, ссылки и скриншоты в нескольких форматах.
