Назад к ленте

Qwen3.8-Flash-Next на MLX-serve с поддержкой 1м контекста

Qwen3.8-Flash-Next на MLX-serve с поддержкой 1м контекста
🛠 1 миллион токенов за одну генерацию — это стало возможным благодаря Qwen3.8-Flash-Next в MLX-serve! Инструмент демонстрирует впечатляющую производительность, достигая 40 токенов в секунду для текстов и 75 токенов для кода. Благодаря 8-битной квантизации и высокому качеству модели, он отлично справляется с долгими контекстами, как показано в видео. Однако для работы с полным контекстом в 1м потребуется около 117ГБ оперативной памяти. Будьте готовы к некоторым ошибкам и не стесняйтесь сообщать о них. Узнать больше можно на GitHub, а веса модели доступны на Hugging Face.
Источник: www.reddit.com

Похожие проекты