Главная · Скиллы · baoyu-url-to-markdown

baoyu-url-to-markdownURL страница Markdown конвертер baoyu

jimliu/baoyu-skills

Конвертация URL страниц в Markdown через baoyu.

Установка

npx -y skills add jimliu/baoyu-skills --skill baoyu-url-to-markdown --agent claude-code

URL to Markdown

Загрузка любого URL через CLI baoyu-fetch (Chrome CDP + адаптеры под конкретные сайты) и конвертация в чистый markdown. Встроенные адаптеры для X/Twitter, YouTube транскриптов, тредов Hacker News, и универсальный парсер через Defuddle. Поддерживает авторизованные страницы через интерактивный режим ожидания. Используйте при запросах: «сохранить страницу как markdown», «fetch URL».

Настройка CLI

Исходный код CLI vendored в {baseDir}/scripts/lib. Зависимости в scripts/package.json.

  1. Определить {baseDir} — директория SKILL.md
  2. Разрешить ${BUN}: установлен bun → использовать; иначе предложить установить Bun
  3. Если {baseDir}/scripts/node_modules не существует: ${BUN} install --cwd {baseDir}/scripts
  4. ${READER} = {baseDir}/scripts/baoyu-fetch

Настройки (EXTEND.md)

Пути поиска (первый найденный):

  1. .baoyu-skills/baoyu-url-to-markdown/EXTEND.md
  2. ${XDG_CONFIG_HOME:-$HOME/.config}/baoyu-skills/baoyu-url-to-markdown/EXTEND.md
  3. $HOME/.baoyu-skills/baoyu-url-to-markdown/EXTEND.md

Не найден → обязательно запустить первоначальную настройку через AskUserQuestion. Никогда не создавать EXTEND.md с тихими значениями по умолчанию.

Первоначальная настройка (3 вопроса)

  • Медиа: «Спрашивать каждый раз» / «Всегда скачивать» / «Никогда не скачивать»
  • Директория вывода: url-to-markdown (рекомендуется) / другой путь
  • Сохранение настроек: User (~/.baoyu-skills/) / Project (.baoyu-skills/)

Основные команды

# Базовая загрузка
${READER} "https://example.com/article" --output article.md

# X/Twitter пост или тред
${READER} "https://x.com/user/status/12345" --output tweet.md

# YouTube транскрипт
${READER} "https://youtube.com/watch?v=xxxxx" --output transcript.md

# Hacker News тред
${READER} "https://news.ycombinator.com/item?id=12345" --output hn.md

# С сохранением медиа
${READER} "https://example.com" --download-media --output page.md

# Список URL из файла
${READER} --batch urls.txt --output-dir ./saved/

Режимы ожидания (авторизованный контент)

# Ждать ручного входа (CAPTCHA, login)
${READER} "https://paid-site.com/article" --wait-for-login

# Ждать определённого элемента
${READER} "https://spa-site.com/page" --wait-for-selector ".article-body"

# Таймаут
${READER} "https://slow-site.com" --timeout 30000

Поддерживаемые платформы

ПлатформаАдаптерЧто извлекается
X/TwitterВстроенныйПост, тред, цитаты, медиа
YouTubeВстроенныйТранскрипт, метаданные, описание
Hacker NewsВстроенныйТред комментариев полностью
Все остальныеDefuddle (universal)Основной контент, очищенный от рекламы

Структура вывода

url-to-markdown/
└── example.com/
    ├── article-title.md
    ├── another-page.md
    └── imgs/
        └── image-1.jpg

Из того же репозитория