Назад к ленте

Program-Bench — Новые бенчмарки для оценки ИИ в программной инженерии

Program-Bench — Новые бенчмарки для оценки ИИ в программной инженерии
🧪 Открываются новые горизонты в тестировании ИИ для программирования! Бенчмарки, такие как Program-Bench и SRE-Bench, ставят перед агентами уникальные задачи. Например, в Program-Bench требуется создать полноценный код, основываясь только на скомпилированном бинарном файле и документации, без доступа к декомпиляторам. В SRE-Bench агенты должны определить функциональность бинарника без его исходного кода. Эти испытания показывают, насколько глубоки возможности моделей, таких как GPT-6 Astra с 5.5% в Program-Bench и 88% в SRE-Bench. Научные изыскания продолжаются, и это только начало! Узнать больше можно на Program-Bench и SRE-Bench.
Источник: www.reddit.com

Похожие проекты