Неделя DeepSeek: одна модель вместо двух ярусов, ядра вместо блога и гигаватт на Huawei
深度求索的一周:一个模型取代两级、内核先于博客、华为的一吉瓦
За одну неделю DeepSeek сделала три вещи, которые в лентах шли порознь: 10 сентября выпустила модель V4.1-Flash и объявила, что старшая V4-Pro будет перенаправляться в неё; 8–10 сентября выложила на GitHub три новых репозитория с ядрами, о которых блог не сказал ни слова; и, по данным Bloomberg от 4 сентября, готовит заказ 160 тысяч чипов Huawei Ascend под ЦОД мощностью около гигаватта во Внутренней Монголии. Читать эти новости стоит вместе: они про то, как компания убирает из своей экономики всё лишнее — второй ярус моделей, зависимость от чужих компиляторов и, насколько получится, чужое железо.
Одна модель вместо двух ярусов
Формально V4.1-Flash — «младшая» модель. По карточке на Hugging Face это MoE на 552 миллиарда параметров (1 общий и 384 маршрутизируемых эксперта, активируется 6 на токен), но устроена она необычно: причинный энкодер-декодер, 20 слоёв энкодера и 20 декодера, где на обработку входа тратится 8 миллиардов активных параметров, а на генерацию — 16. Контекст — до миллиона токенов, изображения обрабатываются нативно, лицензия MIT. Заявленный эффект архитектуры — KV-кэш занимает в четыре раза меньше памяти ускорителя и в восемь раз меньше места на SSD, чем у предыдущего поколения.
Главное — не в архитектуре, а в том, что DeepSeek с ней сделала. В API модель живёт под именем
deepseek-flash, старые V4-Flash и V4-Flash-Vision-Exp снимаются с обслуживания, а с
04:00 UTC 14 сентября запросы к deepseek-v4-pro перенаправляются в V4.1-Flash — по её
ценам. То есть флагманский ярус не «понижен в цене», а упразднён: компания утверждает, что
младшая модель обгоняет V4-Pro по её же тестам, и не видит смысла держать два прайс-листа.
Для всех, у кого в коде зашито имя старой модели, 14 сентября — дата, когда ответы молча сменят
генератор.
| Что | V4.1-Flash, по карточке модели |
|---|---|
| Параметры | 552 млрд всего · 8 млрд активных на входе, 16 млрд на выходе |
| Архитектура | причинный энкодер-декодер 20 + 20 слоёв, MoE 1 + 384 эксперта |
| Контекст | до 1 000 000 токенов; текст и изображения |
| Тесты (instruct, максимальное усилие) | Terminal-Bench 2.1 — 90,6 · DeepSWE v1.1 — 74,2 · GSM8K — 93,0 · HumanEval — 79,4 · MMMU-Pro — 56,5 |
| Лицензия и доступ | MIT, веса на Hugging Face; API — deepseek-flash |
Ядра вместо блога
Пресс-релиз молчит о том, что в те же дни появилось в организации deepseek-ai на GitHub. 8 сентября — DeepJIT, «лёгкая библиотека JIT-компиляции ядер для xPU»; 9 сентября — DeepSelect, TopK-ядра для разреженного внимания DSA и сэмплеров, MIT; 10 сентября — deepseek-recipe, пока без описания, но уже с сотнями звёзд. Параллельно их агентная обвязка deepseek-harness («всё — плагин», вышла 13 августа и набрала более 220 тысяч звёзд) дошла до кандидатов в релиз 0.1.5.
Слово «xPU» в описании DeepJIT — не оговорка. Это библиотека, которая компилирует ядра под любой ускоритель, а не под CUDA. Вместе с новостью о Huawei (ниже) она читается как часть одного плана: если инференс переезжает на чужое железо, компилятор ядер должен быть свой. Мы уже писали, что у китайских лабораторий инструменты выходят мимо блогов, и что следить надо за обоими каналами; эта неделя — чистый пример: три репозитория и ноль строк в новостях.
Гигаватт на Huawei — для инференса, не для обучения
По Bloomberg (4 сентября, пересказ TechNode 7 сентября), DeepSeek планирует заказать не менее 160 тысяч чипов Huawei Ascend 950DT для ЦОД мощностью около 1 ГВт в Уланчабе (Внутренняя Монголия, ~350 км от Пекина, дешёвая энергия и холодный климат). Важная деталь: чипы Huawei пойдут на инференс — обслуживание запросов пользователей, — а обучение новых моделей остаётся на уже имеющемся оборудовании Nvidia. Ascend 950DT ещё не вышел (ожидается в четвёртом квартале 2026 года), а выпуск Huawei в 2026 году ограничен дефицитом памяти; частичный запуск площадки называют на конец 2027 — начало 2028 года. Это заявленные планы, а не работающий ЦОД.
Логика та же, что и в двух предыдущих разделах. Инференс — это где лежит масса запросов и где KV-кэш в четыре раза меньше превращается в деньги; там и хочется уйти на своё железо. Обучение — редкое и дорогое, его пока держат на проверенном. Архитектура, которая экономит память, компилятор ядер под «xPU» и заказ чипов под инференс — три части одной сборки.
На полях: регулятор охлаждает гуманоидов
Пока DeepSeek строит, соседний сектор тормозят. После дебюта Unitree на STAR Market 19 августа (цена размещения 150,8 юаня, закрытие первого дня 845, затем откат ниже 500) The Information сообщила, что китайский регулятор рынка ценных бумаг ужесточил одобрение IPO гуманоидных стартапов; по данным других изданий, CSRC даёт банкам и компаниям неформальные «оконные указания»: показывать повторяющуюся выручку и прибыльность, а не демо. В очереди на листинг называют AgiBot (Гонконг; по SCMP — крупнейший поставщик гуманоидов первого полугодия, 44 % мирового рынка) и Galbot. Мы разбирали IPO Unitree три недели назад; тогда вопрос был «сколько стоит тело», теперь — «сколько оно зарабатывает».
Что из этого следует практику
Первое. Если вы вызываете модели DeepSeek по API, проверьте свои ответы после 14 сентября: под старыми именами будет отвечать другая модель. Это не поломка, но качество и стиль ответов могут сдвинуться, а в логах это никак не отметится.
Второе. Смотрите GitHub-организацию, а не только новости: три ядерных репозитория за неделю говорят о направлении компании больше, чем пресс-релиз о модели. И третье — ставка «инференс на своём, обучение на чужом» пока план; о том, работает ли Ascend 950DT в масштабе, мы узнаем не раньше конца 2027 года.
⚠️ Расхождения источников: рассылка AINews (12.09) описывает V4.1-Flash как «763B-P8B-D16B»; в релизе DeepSeek и карточке модели — 552 млрд параметров при тех же 8 и 16 активных, мы приводим цифры первоисточника. Заказ чипов Huawei известен только по сообщению Bloomberg; комментариев DeepSeek и Huawei нет. Ужесточение IPO гуманоидов — по The Information и пересказам, официального документа CSRC не опубликовано.