Главная · Тег
Обучение с подкреплением
Обучение с подкреплением в экосистеме Claude Code: 7 инструментов — 6 скиллов, 1 плагин. Популярные: Stable-Baselines3 K-Dense научный, PufferLib K-Dense, Stable-Baselines3 Claude шаблоны. У каждого — описание на русском, команда установки и ссылка на исходники.
stable-baselines3 — Stable-Baselines3 K-Dense научный
k-dense-ai/scientific-agent-skills
Stable-Baselines3 для RL.
pufferlib — PufferLib K-Dense
k-dense-ai/scientific-agent-skills
PufferLib для RL.
stable-baselines3 — Stable-Baselines3 Claude шаблоны
davila7/claude-code-templates
Stable-Baselines3 Claude.
pufferlib — PufferLib Claude шаблоны
davila7/claude-code-templates
PufferLib для RL.
rl-reward — награда RL AgentScope OpenJudge
agentscope-ai/openjudge
Функция награды для обучения с подкреплением.
AgentDB Learning Plugins — RL плагины для AgentDB агентов
spencermarx/open-code-review
Полный набор reinforcement learning плагинов для AgentDB: 9 алгоритмов от Q-learning до policy gradient для обучающихся агентов.
babushkai/jitrl-skill — JIT RL
babushkai/jitrl-skill
Скилл JIT RL для Claude Code.