SiliconLLM — CPU-native LLM архитектура с производительностью 100+ токенов в секунду
🛠 113-130 токенов в секунду на модели с 10B параметрами! Это результат работы над архитектурой, оптимизированной для работы с ограничениями памяти CPU. Несмотря на впечатляющую производительность на Ryzen 5 3600X без GPU, качество весов модели оставляет желать лучшего. Чтобы проверить, как масштабируется качество, автор решил обучить языковую модель, но столкнулся с трудностями при адаптации существующего LLM в новый формат. Если интересно, загляните в репозиторий проекта: SiliconLLM.
Источник:
www.reddit.com