Tencent открыла AuK: универсальная модель для работы с голосом - LostGant
Пишу о Ai, технологиях, разработке и личном. Делаю приложения.
Новости

Tencent открыла AuK: универсальная модель для работы с голосом

0 11

Tencent открыла исходный код и веса AuK — универсальной модели для генерации и редактирования голоса. 1,5 млрд параметров, лицензия MIT, интеграция с ComfyUI и возможность локального запуска. Главное, что стоит отметить сразу: это не только синтез речи, но и полноценное редактирование уже существующего аудио — по обычным текстовым командам.

Что умеет AuK

AuK закрывает задачи, под которые раньше брали несколько сервисов
AuK закрывает задачи, под которые раньше брали несколько сервисов

Набор возможностей шире, чем у типичной TTS-модели (Text-to-Speech, синтез речи из текста). AuK закрывает сразу несколько сценариев, которые раньше приходилось собирать из разных сервисов:

  • клонирование голоса по примеру звучания;
  • озвучивание текста по описанию — голос задаётся словами, а не образцом;
  • замена слов в уже готовой записи с сохранением исходного голоса;
  • переписывание текста песни с сохранением мелодии и голоса исполнителя;
  • изменение эмоции, тембра, скорости и высоты голоса;
  • удаление акцента;
  • добавление или удаление смеха и дыхания;
  • превращение речи в шёпот;
  • очистка от шумов;
  • разделение нескольких говорящих в одном файле.

Последний пункт — фактически разделение источников звука, задача, за которую обычно отвечают отдельные инструменты. То, что она идёт в одном списке с клонированием голоса, показывает: авторы целились не в нишу, а в универсальный аудиоредактор.

Все задачи управляются текстовыми командами

Отдельная деталь, которая мне кажется самой важной с точки зрения практики: ни для одной из задач не нужен интерфейс с ползунками и переключателями. Всё задаётся инструкцией на естественном языке — примерно так же, как сейчас формулируется запрос к языковой модели или к агенту в редакторе кода.

Для обучения авторы собрали около 1,95 млн часов аудио и 3,03 млрд пар «инструкция + звук». Именно такой объём пар и объясняет, почему модель понимает команды вроде «убери акцент» или «добавь смех» — она училась не на чистых записях, а на связке описания и результата.

Для тех, кто работает в вайбкодинге, логика знакомая: вместо освоения сложного UI ты формулируешь намерение словами и итеративно правишь результат. Похоже, этот паттерн окончательно переходит из разработки в креативные инструменты.

AuK-Flash: результат за четыре шага

AuK-Flash генерирует результат за 4 шага — примерно в 4,5 раза быстрее
AuK-Flash генерирует результат за 4 шага — примерно в 4,5 раза быстрее

Вместе с основной моделью выпустили облегчённую версию — AuK-Flash. Она генерирует результат всего за 4 шага и работает примерно в 4,5 раза быстрее основной версии. Разница в скорости здесь не косметическая: для живых сценариев — озвучки диалогов в игре, интерактивных ассистентов, быстрых правок в пайплайне — задержка важнее идеального качества на выходе.

MIT и локальный запуск

Код и веса под MIT: модель можно запустить локально
Код и веса под MIT: модель можно запустить локально

Код и веса уже опубликованы под лицензией MIT — то есть без ограничений на коммерческое использование. Плюс есть готовая интеграция с ComfyUI и возможность запустить модель локально.

Это сильно меняет расклад. Проприетарные голосовые API удобны, но каждый вызов стоит денег, а аудио уходит на чужие серверы. Локальный запуск с открытой лицензией снимает оба ограничения: данные не покидают твою машину, а стоимость генерации сводится к электричеству и железу. Для проектов, где нужно озвучивать тысячи реплик или работать с чувствительными записями, это принципиально другой уровень свободы.

Что это значит на практике

Голосовые модели до сих пор жили в двух режимах: либо качественный, но закрытый API, либо открытые решения с ограниченным набором задач. AuK ломает эту схему — под MIT уходит модель, которая и генерирует, и редактирует, и делает это по текстовому описанию.

Осторожность тоже уместна. Открытый клонировщик голоса — это инструмент двойного назначения, и лицензия MIT никак не регулирует, как его применят. Ответственность здесь целиком на разработчике, который встраивает модель в продукт: согласие на использование голоса, маркировка синтетики, отказ от подделок чужих записей.

Технически же планка поднята. Если ты делаешь подкасты, игры, обучающие курсы или просто автоматизируешь озвучку, теперь имеет смысл сравнить свой текущий стек с одним открытым решением, а не платить за три сервиса сразу.

Выводы

  • AuK — открытая модель Tencent на 1,5 млрд параметров, которая объединяет генерацию речи и редактирование готового аудио.
  • Управление идёт текстовыми командами: клонирование, смена эмоции и тембра, удаление акцента, шёпот, чистка шумов, разделение говорящих, переписывание песни с сохранением мелодии.
  • Обучение заняло около 1,95 млн часов аудио и 3,03 млрд пар «инструкция + звук».
  • AuK-Flash выдаёт результат за 4 шага и примерно в 4,5 раза быстрее основной версии — вариант для задач, где важна задержка.
  • Лицензия MIT, интеграция с ComfyUI и локальный запуск убирают зависимость от платных API и позволяют держать аудио внутри своей инфраструктуры.

Мои соцсети:
🌐 Сайт · ✈️ Telegram · 🟣 MAX · 🔵 Дзен

Оставить комментарий

Чтобы оставить комментарий, войдите через VK ID.