firecrawl-parseпарсинг Firecrawl CLI
firecrawl/cli
Парсинг Firecrawl.
Установка
npx -y skills add firecrawl/cli --skill firecrawl-parse --agent claude-codeFirecrawl Parse
Конвертация локального документа в чистый Markdown на диске. Поддерживаемые форматы: PDF, DOCX, DOC, ODT, RTF, XLSX, XLS, HTML/HTM/XHTML. Используйте при запросах: «разобрать этот PDF», «конвертировать документ», «прочитать файл», «извлечь текст из», а также когда передан локальный путь к файлу (не URL).
Когда использовать
- Есть файл на диске (не URL), нужен его текст в Markdown
- Пользователь прислал PDF/DOCX и просит рассказать содержимое или сделать резюме
- Для URL-источников использовать
scrapeвместо этого скилла
Быстрый старт
Всегда сохранять в .firecrawl/ с флагом -o — разобранные документы могут весить сотни КБ и засорить контекст при выводе в stdout. Добавить .firecrawl/ в .gitignore.
mkdir -p .firecrawl
# Файл → Markdown
firecrawl parse ./paper.pdf -o .firecrawl/paper.md
# С AI-резюме
firecrawl parse ./paper.pdf -S -o .firecrawl/paper-summary.md
# Ответ на вопрос по документу
firecrawl parse ./paper.pdf -p "Какова основная гипотеза?" -o .firecrawl/answer.md
# XLSX → Markdown
firecrawl parse ./data.xlsx -o .firecrawl/data.md
Опции
| Флаг | Описание |
|---|---|
-o <path> | Путь для сохранения файла (обязательно) |
-S | Сгенерировать AI-резюме документа |
-p "<вопрос>" | Ответить на вопрос по содержимому документа |
--format | Формат вывода (по умолчанию: markdown) |
Рабочий процесс
- Убедиться что путь к файлу локальный (не URL)
- Создать директорию
.firecrawl/если её нет - Запустить
firecrawl parseс флагом-o - Прочитать сохранённый
.mdфайл для ответа пользователю
Требования
Firecrawl CLI: npm install -g firecrawl или через npx firecrawl. Требует API-ключ Firecrawl (переменная FIRECRAWL_API_KEY).
Из того же репозитория
firecrawl — автономный веб-скрапинг
firecrawl/cli
Автономный скрапинг для сложных задач: описываете что нужно — не пишете ломкие скраперы. Работает с JS-рендеренными сайтами там, где другие дают сбой.
firecrawl-scrape — чистый markdown из любого URL
firecrawl/cli
Извлекает чистый LLM-оптимизированный markdown с любого URL через Firecrawl: статические страницы и JS-рендеренные SPA.
firecrawl-search — веб-поиск с извлечением контента
firecrawl/cli
Веб-поиск с опциональным извлечением полного содержания страниц: структурированный JSON вместо простых сниппетов.
firecrawl-agent — AI-агент для сложных сайтов
firecrawl/cli
Firecrawl агент автономно навигирует по сложным многостраничным сайтам и извлекает структурированные данные JSON по заданной схеме.
firecrawl-crawl — массовое извлечение сайтов
firecrawl/cli
Массовое извлечение структурированного контента с целых сайтов или разделов через Firecrawl: URLs, markdown, метаданные в одном запросе.
firecrawl-map — карта всех URL сайта
firecrawl/cli
Находит и перечисляет все URL сайта через Firecrawl с опциональным поиском для поиска конкретных страниц на больших ресурсах.
