Яндекс ищет старшего LLM-разработчика в сервис «Нейроюрист». Опыт работы — от двух лет, работать можно удалённо. Задачи охватывают почти весь прикладной стек современного AI: RAG-пайплайны, LLM-агентов, дообучение моделей и продакшен-эксплуатацию. По такой вакансии хорошо видно, что сегодня реально требуют от senior-специалиста в LLM, — и это не «умею писать промпты».
Что за роль и чем предстоит заниматься
Речь о позиции старшего LLM-разработчика в продуктовой команде «Нейроюриста» — сервиса на стыке больших языковых моделей и юридической предметной области. Формально требований немного: больше двух лет в ML/NLP/LLM-проектах и удалённый формат. Но список задач говорит о многом: он собран так, будто описывает полный цикл жизни LLM-продукта — от качества ответа до задержки на проде.
Сразу оговорюсь: зарплатных вилок и деталей о команде в объявлении нет, поэтому оценивать буду только по содержанию работы. А оно показательное.
RAG как инженерная дисциплина, а не «прикрутили векторную базу»

Первая группа задач — улучшение LLM- и RAG-пайплайнов. RAG (retrieval-augmented generation) — это генерация ответа с опорой на поиск по внешним данным: модель не отвечает «из головы», а сначала достаёт релевантные фрагменты из базы знаний.
Важная деталь: в вакансии прямо сказано, что оптимизировать нужно каждый компонент RAG по отдельности. А это уже не про «подключить векторное хранилище», а про нормальную инженерию:
- embedder — модель, которая превращает текст в вектор для поиска; от неё зависит, найдётся ли нужный документ вообще;
- reranker — модель, которая переранжирует найденные фрагменты и вытаскивает наверх действительно нужные;
- промпт-инжиниринг — сборка контекста и инструкций для генерации;
- подтверждённость генерации (groundedness) — насколько ответ реально опирается на источники, а не додуман моделью.
Для юридической сферы последний пункт — не абстракция, а вопрос доверия к продукту. Здесь галлюцинация стоит дорого, и именно поэтому в требованиях нет ни слова про «креативность» — зато есть про подтверждённость.
Агенты: от демо к продакшену

Второй блок — проектировать, разрабатывать и внедрять LLM-агентов, а также оценивать их работу в сложных сценариях. Расшифровка в самой вакансии: анализ задачи пользователя, планирование и выбор подходящих инструментов на каждой итерации исполнения плана.
Ключевое слово тут — «оценивать». Собрать агента, который красиво рассуждает в демо, сегодня может почти любой, кто умеет работать с API. Сложность начинается там, где нужно измерять, стал ли агент лучше после очередного изменения: сколько шагов он делает, сколько стоит один запуск, как часто выбирает не тот инструмент и что происходит, когда план разваливается на середине. Без такой оценки любые правки — гадание. Для меня это главный водораздел между вайбкодингом и продуктовой разработкой: прототип можно навайбкодить за вечер, а вот цикл измерения вокруг агента — это уже работа.
Дообучение и RL: не только промптами
Третий блок — дообучение LLM/ML-моделей, включая дообучение с подкреплением (reinforcement learning — обучение модели на сигнале обратной связи, а не только на размеченных примерах). Заниматься этим предстоит совместно с командами базовых технологий Яндекса.
Это заметный сигнал: компания готова вкладываться в изменение самих моделей под задачу, а не только в обвязку вокруг готового API. Для кандидата это редкая возможность поработать и с прикладным слоем, и с тренировкой моделей — обычно такие вещи разнесены по разным командам и почти не пересекаются.
Что ждут от кандидата
Пожелания к соискателю выглядят так:
- Больше двух лет работы в ML/NLP/LLM-проектах, включая продакшен-системы.
- Уверенный Python.
- Практический опыт с LLM и RAG.
- Интерес к агентам — прямо указан отдельным пунктом.
- Готовность внедрять модели в рантайм, поддерживать их и автоматизировать сопутствующие процессы.
Обрати внимание: в требованиях нет ни списка фреймворков, ни конкретных библиотек, ни «знания LangChain». Их и не может быть — стек в этой области меняется быстрее, чем люди успевают проходить курсы. Зато есть устойчивые вещи: продакшен-опыт, код и умение доводить модель до работы в реальной системе. Это ровно то, что не устаревает при смене очередного хайпового инструмента.
Продакшен важнее бенчмарков

Отдельный пункт, который часто недооценивают, — масштабирование продакшен-решений: latency (задержка ответа), scalability (способность выдерживать нагрузку) и monitoring моделей.
Это самая недооценённая часть LLM-разработки. Модель, которая отвечает идеально, но за двадцать секунд и падает под нагрузкой, продуктом не станет. Monitoring моделей — вообще тема, о которой вспоминают позже всех: качество ответов на проде дрейфует, данные меняются, и без постоянных замеров команда узнаёт о деградации от пользователей, а не от метрик. Если ты умеешь не только экспериментировать в ноутбуке, но и держать сервис под нагрузкой, ты уже отличаешься от большинства соискателей на такие позиции.
Выводы
- Яндекс ищет старшего LLM-разработчика в «Нейроюрист»: опыт от двух лет, возможна удалённая работа.
- Спектр задач — весь прикладной цикл: оптимизация компонентов RAG (embedder, reranker, промпты, подтверждённость генерации), создание и оценка LLM-агентов, дообучение моделей вплоть до RL, масштабирование на проде.
- В требованиях нет конкретных фреймворков — ценятся Python, продакшен-опыт и готовность поддерживать модели в рантайме. Это устойчивые навыки, а не знания очередной библиотеки.
- Отдельный акцент на latency, scalability и monitoring: умение довести модель до работающего сервиса сегодня весит больше, чем красивые демо и результаты на бенчмарках.
- Для практиков вайбкодинга это хороший ориентир: прототип на агентах — быстрый вход, но рост начинается там, где появляются метрики, оценка и продакшен-ограничения.