DeepSeek представила мультимодальну модель V4.1 Flash із 552 млрд параметрів та контекстом до 1 млн токенів. Нова архітектура активує 8 млрд параметрів під час обробки вхідних даних і 16 млрд під час генерування відповіді. Модель використовує вчетверо менше HBM і увосьмеро менше SSD для зберігання KV-кешу порівняно з V4 Flash. V4.1 Flash уже доступна через API та опублікована на Hugging Face за ліцензією MIT. https://channeltech.space/ai/deepseek-v4-1-flash/
DeepSeek представила мультимодальну модель V4.1 Flash із 552 млрд параметрів та контекстом до 1 млн токенів. Нова архітектура активує 8 млрд параметрів під час обробки вхідних даних і 16 млрд під час генерування відповіді. Модель використовує вчетверо менше HBM і увосьмеро менше SSD для зберігання KV-кешу порівняно з V4 Flash. V4.1 Flash уже доступна через API та опублікована на Hugging Face за ліцензією MIT. https://channeltech.space/ai/deepseek-v4-1-flash/
CHANNELTECH.SPACE
DeepSeek представила V4.1 Flash із 552 млрд параметрів – Channel Tech
DeepSeek випустила мультимодальну V4.1 Flash із 552 млрд параметрів, контекстом на 1 млн токенів і вчетверо меншим HBM-кешем.
1
78views 1 Shares