Разговор о том, что «интернет закончился и данных для обучения почти не осталось», звучит всё чаще. И это в целом справедливо: качественного текста и картинок в открытом вебе конечное количество, и крупные модели уже упираются в его пределы. Но тупик здесь виден только с одной стороны.
«Интернет закончился» — что на самом деле кончается
Когда говорят об исчерпании данных, речь идёт о конкретном типе данных — о тексте и изображениях, которые можно собрать краулером (программой, которая обходит сайты и забирает содержимое) из открытого веба. Этот источник действительно ограничен: он физически конечен, заметная его часть закрыта лицензиями и платными стенами, а что-то просто никогда не оцифровывали.
Но данные — это не только то, что кто-то уже выложил в сеть. Это ещё и то, что происходит в физическом мире каждую секунду. Вот тут и начинается самое интересное.
Мир вокруг как следующий датасет

Андрей Себрант сформулировал мысль, которая звучит почти как афоризм: интернет не закончился — просто дальше ИИ будет обучаться на мире, который вокруг нас. Простая фраза, а за ней смена всей логики сбора данных.
До сих пор модель училась на том, что человечество уже описало словами и картинками. Следующий шаг — учиться на том, что ещё не описано: на движении, на физике, на взаимодействии с предметами, на поведении людей и машин в реальной среде. Для этого нужны другие источники: камеры, микрофоны, сенсоры, роботы. Такой ИИ получает не текст о мире, а сам мир — напрямую, в ощущениях.
Именно поэтому всё громче звучат темы embodied AI (ИИ, встроенного в физическое тело) и мировых моделей — внутренних представлений о том, как устроена реальность и что произойдёт после того или иного действия.
Что это меняет для практиков

Для тех, кто пишет код и собирает продукты с помощью ИИ, этот сдвиг означает как минимум три вещи.
- Данные перестают быть бесплатными по умолчанию. Запустить краулер и собрать корпус из веба дёшево. Поставить тысячу роботов и собрать физический опыт — дорого и медленно. Порог входа в обучение на реальном мире куда выше.
- Вырастет цена мультимодальности. Модели, которые работают не только с текстом, но и с видео, звуком, сенсорными потоками, оказываются ближе к «миру» и потому ценнее.
- Появится новая инфраструктура. Сборщики данных о мире — от носимой электроники до симуляторов — станут отдельной индустрией.
В вайбкодинге это отзовётся сменой вопросов. Раньше мы спрашивали у модели «что про это написано», теперь всё чаще придётся думать о среде: как поведёт себя код, продукт или интерфейс в живых условиях, а не в описании.
Где заканчивается красота идеи

Мысль мне нравится, но принимать её за готовый ответ не стоит. Обучение на мире — задача на порядки сложнее веб-скрейпинга. Данные из реальности шумные, их трудно размечать, они затрагивают приватность людей и требуют физических устройств. К тому же мир меняется быстрее, чем его успевают оцифровать.
Поэтому тезис стоит читать не как «интернет больше не нужен», а как «одного интернета уже мало». Текстовый веб остаётся фундаментом, но поверх него придётся надстраивать то, что мы пока умеем собирать плохо — живой опыт взаимодействия с реальностью.
Выводы
- Данные из открытого интернета конечны, и это ограничение уже ощущается при обучении больших моделей.
- Следующий крупный источник данных — физический мир: сенсоры, видео, роботы, взаимодействия, а не только текст.
- За этим стоят embodied AI и мировые модели — способность ИИ представлять реальность и последствия своих действий.
- Сбор таких данных дороже, медленнее и сложнее с точки зрения приватности, чем веб-скрейпинг.
- Для практиков это значит: интернет не отменяется, но перестаёт быть единственным источником — и это меняет приоритеты в продуктах и инструментах.