GigaChat с открытыми весами и агент Krea: нейродайджест недели - LostGant
Пишу о Ai, технологиях, разработке и личном. Делаю приложения.
Новости

GigaChat с открытыми весами и агент Krea: нейродайджест недели

0 10

За неделю вышло несколько заметных релизов: открытые веса большой MoE-модели, редактор речи по текстовым инструкциям и агент для генерации контента в одном интерфейсе. Рядом — два сюжета, которые касаются не самих моделей, а экономики: кому достаются вычисления и почему лидеры отрасли просят замедлиться. Разбираю по порядку.

GigaChat 3.5 Reasoning: 432B параметров в открытом доступе

Открытые веса такого масштаба — история про серверы, а не ноутбуки
Открытые веса такого масштаба — история про серверы, а не ноутбуки

Сбер открыл веса модели GigaChat 3.5 Reasoning. Это MoE-архитектура (mixture of experts, «смесь экспертов»): на каждом шаге в работе участвует не весь объём параметров, а только часть. Маркировка 432B-A28B описывает общий размер модели и число активных параметров — общих заметно больше, чем задействуется на один токен.

Интересен не только масштаб, но и схема обучения. Шесть экспертов обучали по отдельности через online RL — обучение с подкреплением, при котором модель дообучается в процессе, а не на раз и навсегда зафиксированном наборе данных. После этого экспертов объединили в одну модель.

С практической точки зрения это уже не новость «для галочки». Открытые веса такого класса означают возможность квантовать модель, дообучать её под свои задачи и встраивать в собственные пайплайны без привязки к чужому API. Обратная сторона тоже очевидна: 432B параметров дома не запустишь, это по-прежнему инфраструктурная история про серверы.

Astra и Blender: когда модель не рисует, а работает в инструменте

Показали два примера видео, которые модель Astra делает через Blender — открытый 3D-редактор с Python-API. Смысл в том, что модель не генерирует картинку попиксельно, а собирает сцену и управляет инструментом.

Это принципиально другой путь, чем у видеогенераторов вроде Sora: вместо «угадывания» пикселей — команды в реальном софте. Для вайбкодинга логика знакомая: мы давно привыкли, что LLM не выдаёт финальный результат, а пишет код, который этот результат создаёт. Здесь то же самое, только вместо репозитория — 3D-сцена.

ChatGPT Images 2.5, AuK и Krea Agents

AuK меняет в записи слова, голос и эмоции по текстовой инструкции
AuK меняет в записи слова, голос и эмоции по текстовой инструкции

В генеративном контенте — сразу три обновления.

  • ChatGPT Images 2.5 — более точечные правки и меньше искажений при последовательном редактировании. В варианте Flare модель примерно в 1,9 раза быстрее Sunburst, но уступает ему по качеству.
  • AuK от Tencent — открытый генератор и редактор речи по текстовым инструкциям. Позволяет менять в записи слова, голос и эмоции; выложены веса и ноды для ComfyUI.
  • Krea Agents — агент для генерации контента, который объединяет в одном интерфейсе файловую систему, скиллы и модели.

Последовательное редактирование — давняя боль генеративных картинок: каждый следующий шаг накапливает артефакты, и изображение «плывёт». Если искажения действительно удалось заметно снизить, это важнее очередного прироста разрешения. Открытый редактор речи — прямой мостик к дубляжу и озвучке, но одновременно ещё один инструмент, который удешевляет подделку голоса.

Krea Agents показывает другой тренд: агент перестаёт быть просто чатом и становится рабочим местом — с файлами, инструментами и моделями под рукой.

Кому достаются вычисления

Кто конечный пользователь вычислительных мощностей
Кто конечный пользователь вычислительных мощностей

Epoch оценили, кто является конечным пользователем вычислительных мощностей. Вопрос звучит скучно, но отвечает на главное: кто реально оплачивает инференс и где сосредоточена нагрузка.

Для практика это ориентир. Если основной объём вычислений уходит в конкретный сегмент — потребительские продукты, API, обучение или внутренние исследования, — то именно там появляются деньги, оптимизации и вся инфраструктурная гонка.

Амодеи призывает притормозить

Дарио Амодеи призвал замедлить развитие моделей. Логичный вопрос: кому выгодны такие призывы и при чём здесь конкуренция.

Моё мнение: у разговоров о «паузе» всегда есть вторая сторона. Компания, которая уже в лидерах, от ограничений почти не страдает — барьеры входа растут для тех, кто догоняет. Это не отменяет содержательной части дискуссии о рисках, но игнорировать экономику призыва наивно: замедление тоже работает как конкурентное оружие.

Выводы

  • Открытые веса MoE-модели на 432B параметров — сигнал, что крупные игроки готовы отдавать сообществу модели уровня «сервер, а не ноутбук».
  • Astra в Blender — пример сдвига от генерации пикселей к генерации действий в реальных инструментах.
  • В генеративном контенте решает не размер, а управляемость: точечные правки, редактирование речи по инструкции, агентные интерфейсы.
  • Оценка распределения вычислений и призывы к «паузе» — это уже не про технологии, а про то, кто получит преимущество.
  • Практический вывод для вайбкодинга: агентные обвязки и доступные веса дают больше, чем очередной прирост в бенчмарках.

Мои соцсети:
🌐 Сайт · ✈️ Telegram · 🟣 MAX · 🔵 Дзен

Оставить комментарий

Чтобы оставить комментарий, войдите через VK ID.