· 爱智爱智人工智能·机器人

Китайский ИИ и робототехника — один разбор в неделю, по первоисточникам

中国人工智能与机器人 · 每周一篇 · 第一手资讯

深度

Неделя, когда Китай раздал агентов в терминал — и проверил их на ¥100 000

中国把智能体交到终端:一周与十万元的考验

📅 · разбор недели · 每周一篇

За одну неделю четыре китайские лаборатории выпустили или крупно обновили агентов для терминала: Kimi Code CLI (Moonshot, 6 сентября), Qwen Code и Qwen-MM-Plugins («сделать любую обвязку мультимодальной», 3 сентября), ZCode plugins от Zhipu поверх GLM-5, чей отчёт так и озаглавлен — «от вайб-кодинга к агентной инженерии». Над всем этим — DeepSeek Harness: обвязка «всё есть плагин», вышедшая 13 августа и набравшая 213 тысяч звёзд за три недели. Лента читает это как гонку. Первоисточники читаются иначе: центр тяжести сместился с моделей на обвязку, и у обвязки есть цена, которую в анонсах не пишут.

Обвязка стала продуктом

Идея DeepSeek Harness проста и радикальна: модель, инструменты, навыки, сессии, песочница, файловая система, главный цикл и интерфейс — всё реализовано как сменные плагины. Это не «ещё один CLI», это конструктор, из которого собирают своих агентов, и именно поэтому за ним за месяц выросли каталоги плагинов, маркетплейсы и «десятка лучших». Kimi и Qwen идут тем же путём — не «наш агент», а «наша точка входа в чужие агенты». Показательно, что в репозитории DeepSeek лежит папка .agents/notes/proposed/…: предложения по процессу, написанные агентами, со статусами «предложено/внедрено». Агент здесь уже не пользователь обвязки, а её соавтор.

Цена, которую не пишут в анонсах

Через две недели после релиза китайская QiAnXin раскрыла в DeepSeek Harness удалённое выполнение кода без аутентификации (CVSS 9.8) — веб-панель управления агентом не имела слоя авторизации, а защита по заголовку Host останавливала браузер, но не локальный процесс. Сканы нашли больше тысячи инстансов, торчащих в интернет по открытому HTTP. Ответ мейнтейнеров в обсуждении #853 стоит процитировать по смыслу: так задумано, удалённой аутентификации пока нет, привязывайте к 127.0.0.1. Параллельно исследователи оценили обвязку на косвенные инъекции промпта (arXiv 2608.16393), а ещё в июне вышла кампания из 15 вредоносных плагинов для JetBrains, маскировавшихся под ИИ-помощников — один назывался «DeepSeek AI Assist» и воровал ключи API.

Это не история про «китайское — небезопасное». Это история про то, что плагин — единица доверия, и чем проще подключить чужой код к агенту с доступом к файлам и сети, тем быстрее к нему подключат чужой код. У «всё есть плагин» обратная сторона — «всё есть цепочка поставок».

Экзамен на ¥100 000: что показал бенчмарк Qwen

Самый честный материал недели — не релиз, а проверка. Команда Qwen выпустила E-Commerce Bench (arXiv 2608.30730): 18 моделей получили по ¥100 000 и год симуляции на реальных рыночных данных — до четырёх магазинов, 6 886 товаров, 576 поставщиков, из которых 152 мошенника, три расчётных счёта с реальными задержками выплат. Лучший результат — GPT-5.6 Sol, ¥1,43 млн; Claude Fable 5 — ¥805 тыс.; лучшая открытая — Qwen3.8-Max, ¥416 тыс., на 38 % выше GLM 5.2. Но у лидера по деньгам — 16-е место из 18 по устойчивости к мошенникам: 18,5 % расходов ушло поставщикам-обманщикам.

Три провала важнее таблицы. Десять эпизодов закончились банкротством при прибыльной торговле — кассовый разрыв между оплатой поставщику и выплатой площадки. 16 моделей из 18 ни разу не попытались сбить цену при 8 647 повторных заказах у тех же поставщиков — хотя единственная, кто это делала, показала лучшую динамику. И память: постоянное хранилище на 20 заметок агенты почти не использовали, а самые «разговорчивые» модели за год потеряли около 19 контекстных окон. Заметка, которую никто не обязан прочесть перед решением, не работает ни у людей, ни у агентов.

Рамка: хайп и диффузия

ChinAI #373 Джеффри Дина вышел с заголовком «хайп OpenClaw и переоценка китайского преимущества в диффузии». Тезис прошлого выпуска — у Китая разрыв между способностью создавать ИИ и способностью распространять его по экономике — здесь получает продолжение: 213 тысяч звёзд и тысяча открытых панелей — это скорость установки, а не скорость внедрения. Бенчмарк Qwen, где даже лучшие агенты за год не научились торговаться, говорит о том же с другой стороны.

Что из этого следует практику

Первое: выбирая «китайского агента», вы выбираете обвязку, а модель под ней сменная — сравнивать нужно цикл, память, песочницу и то, как обвязка ведёт себя при отказе, а не таблицу с бенчмарками моделей. Второе: любая панель управления агентом — только на 127.0.0.1, и плагины — с той же дисциплиной, что зависимости в продакшене. Третье: если агент ведёт закупки — история цен поставщика и требование скидки при повторе должны быть встроены в его цикл принудительно; сами модели этого не делают.

Первоисточники: deepseek-ai/deepseek-harness (релиз 13.08, звёзды по данным GitHub на 06.09) · обсуждение #853 — RCE через web UI control plane · Pandaily — раскрытие QiAnXin · arXiv 2608.16393 — оценка dsh на косвенные инъекции · 15 вредоносных плагинов JetBrains (июнь 2026) · QwenLM/E-CommerceBench и arXiv 2608.30730 · MoonshotAI/kimi-code · QwenLM/qwen-code · Qwen-MM-Plugins · zai-org/GLM-5 · ChinAI #373 (Jeffrey Ding, 31.08.2026). ⚠️ Расхождения: число звёзд dsh меняется ежедневно; оценка «>1000 открытых инстансов» — по данным сканирования исследователей, не подтверждена мейнтейнерами; результаты бенчмарка — из препринта, без независимого воспроизведения.
← Все разборы
← Назад к ленте