Главная · Тег
Eval
Eval в экосистеме Claude Code: 7 инструментов — 5 скиллов, 2 MCP-сервера. Популярные: петли самокритики AI выходных данных, методология оценки ADK агентов, оптимизация промптов production Arize. У каждого — описание на русском, команда установки и ссылка на исходники.
agentic-evalOfficial — петли самокритики AI выходных данных
github/awesome-copilot
Реализует self-critique loops: Claude генерирует вывод, оценивает по критериям, итерирует.
adk-eval-guide — методология оценки ADK агентов
google/adk-docs
Методология оценки Google ADK агентов: метрики, тест-кейсы и паттерны улучшения качества ответов.
arize-prompt-optimizationOfficial — оптимизация промптов production Arize
github/awesome-copilot
Тянет промпты из production трейсов, коррелирует с eval scores для оптимизации.
behavioral-evals — поведенческие оценки LLM Gemini eval
google-gemini/gemini-cli
Поведенческие оценки LLM через Gemini CLI eval фреймворк.
advanced-evaluation — eval пайплайны для LLM
flora131/atomic
Паттерны построения eval пайплайнов для LLM выходных данных: тест-кейсы, метрики и инфраструктура.
Ai Eval — оценка AI
io.github.lazymac2x/ai-eval
MCP-сервер оценки AI.
Mcp Eval Runner — запуск оценок
dbsectrainer/mcp-eval-runner
MCP-сервер запуска оценок (eval).