Coder Eval: оценка и бенчмаркинг AI агентов кодирования
📦 Coder Eval — это фреймворк для оценки и бенчмаркинга AI кодирующих агентов, который использует декларативные YAML задачи и песочницы для тестирования их навыков. Он позволяет проводить A/B эксперименты, устанавливать CI гейты и проверять, как агенты, такие как Claude Code и OpenAI Codex, справляются с реальными заданиями. Основное преимущество — возможность настраивать задачи и критерии оценки под свои нужды, что делает его идеальным инструментом для разработчиков и исследователей в области AI.
Источник:
github.com