InferBench тестирует LLM на понимание приоритетов пользователя
🛠 В новой работе исследователи протестировали 12 моделей LLM, включая MiMo V2.6 Pro и GPT-6 Astra, на их способности понимать приоритеты пользователей. В 2.8k разговоров с симулированными пользователями, модели смогли выбрать лучший вариант в 89% случаев, когда приоритеты были ясны. MiMo V2.6 Pro почти достиг уровня GPT-6 Astra, продемонстрировав 75% точности. Хотя некоторые модели, как Astra, задавали уточняющие вопросы, другие, к примеру Grok 4.6, не справились так эффективно. Полный отчет доступен здесь.
Источник:
www.reddit.com