#siliconllm

1 публикаций
CPU-native LLM архитектура с производительностью 100+ токенов в секунду

CPU-native LLM архитектура с производительностью 100+ токенов в секунду

🛠 113-130 токенов в секунду на модели с 10B параметрами! Это результат работы над архитектурой, оптимизированной для раб...