Superpowers Evals: Лаборатория поведенческой оценки для агентов программирования
📦 Superpowers Evals — это лаборатория поведенческой оценки для агентов программирования, таких как Claude, Codex и Gemini. Этот инструмент проводит оценку в соответствии с критериями сценариев, используя QA-агент для проверки соблюдения рабочих процессов. Лаборатория предлагает два режима выполнения: статические проверки, безопасные для общественного CI, и живые оценки, которые запускают агентов с широкими правами выполнения. Это не просто стандартный набор тестов, а глубокий анализ поведения агентов в реальных условиях.
Источник:
github.com