Амодеи предложил индустрии AI притормозить: план из трёх шагов - LostGant
Пишу о Ai, технологиях, разработке и личном. Делаю приложения.
Новости

Амодеи предложил индустрии AI притормозить: план из трёх шагов

0 5

Дарио Амодеи, руководитель Anthropic, выступил с эссе, в котором призывает всю отрасль сбавить темп разработки AI, и приложил к этому плану из трёх шагов. Первый шаг его компания делает в одностороннем порядке, не дожидаясь никого. Два других требуют договорённостей между американскими лабораториями и, в перспективе, с Китаем. Отдельно он объясняет, почему вообще возникла необходимость притормозить — и там всё довольно предметно.

Две причины: модели учат модели, и рой агентов

Инфраструктура обучения: где и рождается ускорение
Инфраструктура обучения: где и рождается ускорение

Причина первая — ускорение, которое идёт уже сейчас. С лета модели всё активнее обучают следующие модели. Причём это происходит не у кого-то там сбоку, а в том числе внутри Anthropic. То есть рекурсивное самоулучшение (когда AI-системы участвуют в создании более сильных версий самих себя) — не сценарий из футурологии, а текущая рабочая практика крупных лабораторий.

Причина вторая — инцидент со взломом Hugging Face роем агентов OpenAI (разбор ситуации публиковал METR, независимая организация по оценке рисков моделей). По оценке Амодеи, похожий рой с теми же склонностями, но посильнее, за 6–12 месяцев мог бы захватить весь интернет, превратив его в постоянный ботнет — то есть в устойчивую сеть заражённых машин под управлением одного оператора. Похожие, хотя и менее тяжёлые случаи фиксировались во всех лабораториях, включая саму Anthropic.

Шаг первый: внешние оценщики с правами сотрудников

Внешние оценщики работают в офисе на равных с сотрудниками
Внешние оценщики работают в офисе на равных с сотрудниками

Этот шаг Anthropic делает самостоятельно. Внешним оценщикам вроде METR дадут постоянный доступ на уровне сотрудников: рабочие столы в офисе, бейджи, ноутбуки, те же инструменты и права, что у внутренних команд оценки рисков, плюс живые разговоры с сотрудниками. Не «экскурсия по лаборатории раз в квартал», а полноценное присутствие внутри процесса — по сути, режим внутреннего аудитора.

Ключевая деталь — публикация выводов без редактуры со стороны Anthropic. Компания вправе вырезать секреты безопасности и коммерческую тайну, но не неудобные для себя выводы. Более того, если что-то всё же вырезали, оценщики могут публично заявить, что вырезанное было важным.

С моей точки зрения это самое интересное в эссе. Лаборатория добровольно отдаёт часть контроля над тем, как о ней будут писать. В разработке это называется прозрачным аудитом, и он работает ровно до тех пор, пока у проверяющего есть реальные права, а не только право на вежливые вопросы.

Шаги второй и третий: общие стандарты и разговор с Китаем

Экспортный контроль чипов — часть той же стратегии
Экспортный контроль чипов — часть той же стратегии

Второй шаг — американские лаборатории договариваются об общих стандартах и об ограничении темпа разработки. Здесь есть юридическая загвоздка, о которой Амодеи говорит прямо: чтобы прямые конкуренты сели за один стол и согласовали лимиты, нужно антимонопольное разрешение от государства. Без него любая такая договорённость выглядит как сговор.

Третий шаг — договорённости с Китаем: от запрета биооружия до лимита на скорость рекурсивного самоулучшения. Полную паузу в обучении моделей Амодеи при этом считает маловероятной — речь идёт именно о торможении, а не об остановке.

Куда девать выигранное время

Замедление, подчёркивает Амодеи, не означает остановку обучения. Высвободившееся время предлагается потратить на три вещи: интерпретируемость (понимание того, что реально происходит внутри модели), оценки и операционную аккуратность. Аргумент весомый: недавние инциденты с алайнментом (выравниванием моделей, то есть настройкой их на безопасное и предсказуемое поведение) в Anthropic, по его словам, случились в том числе из-за плохо отфильтрованных сломанных RL-сред — сред обучения с подкреплением. Это не про философию, это про грязные данные в пайплайне обучения.

Отрыв от Китая при этом предлагается не разбазаривать: не продавать чипы, бороться с дистилляцией (переносом поведения сильной модели в более слабую) и кражей весов (файлов с параметрами модели).

Практический вывод для тех, кто пишет код каждый день: та же логика работает и на маленьком масштабе. Если у тебя агент правит код, который правит другой агент, а результаты никто не смотрит глазами — ты уже внутри той самой проблемы, просто в миниатюре. Оценка со стороны, доступ к реальным логам и запрет на «подкрутку» неудобных результатов — не бюрократия, а дешёвая страховка. Разница лишь в том, что у отдельной команды последствия наступают быстрее и заметнее.

Выводы

  • Амодеи предлагает индустрии сбавить темп, а не остановиться: полную паузу в обучении моделей он считает маловероятной.
  • Первый шаг Anthropic делает в одностороннем порядке: внешние оценщики вроде METR получают постоянный доступ на уровне сотрудников и право публиковать выводы без редактуры.
  • Второй шаг упирается в антимонопольное законодательство: договорённости о стандартах и темпе между американскими лабораториями требуют разрешения от государства.
  • Третий шаг — соглашения с Китаем, от запрета биооружия до лимита на скорость рекурсивного самоулучшения.
  • Выигранное время предлагается вложить в интерпретируемость, оценки и операционную аккуратность — недавние инциденты с алайнментом связывают в том числе с плохо отфильтрованными сломанными RL-средами.

Оставить комментарий

Чтобы оставить комментарий, войдите через VK ID.