DeepSeek представила мультимодальну модель V4.1 Flash із 552 млрд параметрів та контекстом до 1 млн токенів. Нова архітектура активує 8 млрд параметрів під час обробки вхідних даних і 16 млрд під час генерування відповіді. Модель використовує вчетверо менше HBM і увосьмеро менше SSD для зберігання KV-кешу порівняно з V4 Flash. V4.1 Flash уже доступна через API та опублікована на Hugging Face за ліцензією MIT. https://channeltech.space/ai/deepseek-v4-1-flash/
DeepSeek представила мультимодальну модель V4.1 Flash із 552 млрд параметрів та контекстом до 1 млн токенів. Нова архітектура активує 8 млрд параметрів під час обробки вхідних даних і 16 млрд під час генерування відповіді. Модель використовує вчетверо менше HBM і увосьмеро менше SSD для зберігання KV-кешу порівняно з V4 Flash. V4.1 Flash уже доступна через API та опублікована на Hugging Face за ліцензією MIT. https://channeltech.space/ai/deepseek-v4-1-flash/
78views
1
Shares