ИИ учится не на интернете, а на окружающем мире - LostGant
Пишу о Ai, технологиях, разработке и личном. Делаю приложения.
Новости

ИИ учится не на интернете, а на окружающем мире

0 10

Разговор о том, что «интернет закончился и данных для обучения почти не осталось», звучит всё чаще. И это в целом справедливо: качественного текста и картинок в открытом вебе конечное количество, и крупные модели уже упираются в его пределы. Но тупик здесь виден только с одной стороны.

«Интернет закончился» — что на самом деле кончается

Когда говорят об исчерпании данных, речь идёт о конкретном типе данных — о тексте и изображениях, которые можно собрать краулером (программой, которая обходит сайты и забирает содержимое) из открытого веба. Этот источник действительно ограничен: он физически конечен, заметная его часть закрыта лицензиями и платными стенами, а что-то просто никогда не оцифровывали.

Но данные — это не только то, что кто-то уже выложил в сеть. Это ещё и то, что происходит в физическом мире каждую секунду. Вот тут и начинается самое интересное.

Мир вокруг как следующий датасет

Данные из реального мира ИИ собирает через камеры, сенсоры и роботов
Данные из реального мира ИИ собирает через камеры, сенсоры и роботов

Андрей Себрант сформулировал мысль, которая звучит почти как афоризм: интернет не закончился — просто дальше ИИ будет обучаться на мире, который вокруг нас. Простая фраза, а за ней смена всей логики сбора данных.

До сих пор модель училась на том, что человечество уже описало словами и картинками. Следующий шаг — учиться на том, что ещё не описано: на движении, на физике, на взаимодействии с предметами, на поведении людей и машин в реальной среде. Для этого нужны другие источники: камеры, микрофоны, сенсоры, роботы. Такой ИИ получает не текст о мире, а сам мир — напрямую, в ощущениях.

Именно поэтому всё громче звучат темы embodied AI (ИИ, встроенного в физическое тело) и мировых моделей — внутренних представлений о том, как устроена реальность и что произойдёт после того или иного действия.

Что это меняет для практиков

Разработчику всё чаще придётся моделировать живую среду, а не только текст
Разработчику всё чаще придётся моделировать живую среду, а не только текст

Для тех, кто пишет код и собирает продукты с помощью ИИ, этот сдвиг означает как минимум три вещи.

  • Данные перестают быть бесплатными по умолчанию. Запустить краулер и собрать корпус из веба дёшево. Поставить тысячу роботов и собрать физический опыт — дорого и медленно. Порог входа в обучение на реальном мире куда выше.
  • Вырастет цена мультимодальности. Модели, которые работают не только с текстом, но и с видео, звуком, сенсорными потоками, оказываются ближе к «миру» и потому ценнее.
  • Появится новая инфраструктура. Сборщики данных о мире — от носимой электроники до симуляторов — станут отдельной индустрией.

В вайбкодинге это отзовётся сменой вопросов. Раньше мы спрашивали у модели «что про это написано», теперь всё чаще придётся думать о среде: как поведёт себя код, продукт или интерфейс в живых условиях, а не в описании.

Где заканчивается красота идеи

Сбор данных из мира дороже и медленнее обычного веб-скрейпинга
Сбор данных из мира дороже и медленнее обычного веб-скрейпинга

Мысль мне нравится, но принимать её за готовый ответ не стоит. Обучение на мире — задача на порядки сложнее веб-скрейпинга. Данные из реальности шумные, их трудно размечать, они затрагивают приватность людей и требуют физических устройств. К тому же мир меняется быстрее, чем его успевают оцифровать.

Поэтому тезис стоит читать не как «интернет больше не нужен», а как «одного интернета уже мало». Текстовый веб остаётся фундаментом, но поверх него придётся надстраивать то, что мы пока умеем собирать плохо — живой опыт взаимодействия с реальностью.

Выводы

  • Данные из открытого интернета конечны, и это ограничение уже ощущается при обучении больших моделей.
  • Следующий крупный источник данных — физический мир: сенсоры, видео, роботы, взаимодействия, а не только текст.
  • За этим стоят embodied AI и мировые модели — способность ИИ представлять реальность и последствия своих действий.
  • Сбор таких данных дороже, медленнее и сложнее с точки зрения приватности, чем веб-скрейпинг.
  • Для практиков это значит: интернет не отменяется, но перестаёт быть единственным источником — и это меняет приоритеты в продуктах и инструментах.

Мои соцсети:
🌐 Сайт · ✈️ Telegram · 🟣 MAX · 🔵 Дзен

Оставить комментарий

Чтобы оставить комментарий, войдите через VK ID.