Яндекс ищет старшего LLM-разработчика в «Нейроюрист», можно удалённо - LostGant
Пишу о Ai, технологиях, разработке и личном. Делаю приложения.
Новости

Яндекс ищет старшего LLM-разработчика в «Нейроюрист», можно удалённо

0 4

Яндекс ищет старшего LLM-разработчика в сервис «Нейроюрист». Опыт работы — от двух лет, работать можно удалённо. Задачи охватывают почти весь прикладной стек современного AI: RAG-пайплайны, LLM-агентов, дообучение моделей и продакшен-эксплуатацию. По такой вакансии хорошо видно, что сегодня реально требуют от senior-специалиста в LLM, — и это не «умею писать промпты».

Что за роль и чем предстоит заниматься

Речь о позиции старшего LLM-разработчика в продуктовой команде «Нейроюриста» — сервиса на стыке больших языковых моделей и юридической предметной области. Формально требований немного: больше двух лет в ML/NLP/LLM-проектах и удалённый формат. Но список задач говорит о многом: он собран так, будто описывает полный цикл жизни LLM-продукта — от качества ответа до задержки на проде.

Сразу оговорюсь: зарплатных вилок и деталей о команде в объявлении нет, поэтому оценивать буду только по содержанию работы. А оно показательное.

RAG как инженерная дисциплина, а не «прикрутили векторную базу»

RAG — это конвейер из нескольких моделей, и настраивать нужно каждую
RAG — это конвейер из нескольких моделей, и настраивать нужно каждую

Первая группа задач — улучшение LLM- и RAG-пайплайнов. RAG (retrieval-augmented generation) — это генерация ответа с опорой на поиск по внешним данным: модель не отвечает «из головы», а сначала достаёт релевантные фрагменты из базы знаний.

Важная деталь: в вакансии прямо сказано, что оптимизировать нужно каждый компонент RAG по отдельности. А это уже не про «подключить векторное хранилище», а про нормальную инженерию:

  • embedder — модель, которая превращает текст в вектор для поиска; от неё зависит, найдётся ли нужный документ вообще;
  • reranker — модель, которая переранжирует найденные фрагменты и вытаскивает наверх действительно нужные;
  • промпт-инжиниринг — сборка контекста и инструкций для генерации;
  • подтверждённость генерации (groundedness) — насколько ответ реально опирается на источники, а не додуман моделью.

Для юридической сферы последний пункт — не абстракция, а вопрос доверия к продукту. Здесь галлюцинация стоит дорого, и именно поэтому в требованиях нет ни слова про «креативность» — зато есть про подтверждённость.

Агенты: от демо к продакшену

Агент на каждом шаге выбирает инструмент — и это надо уметь оценивать
Агент на каждом шаге выбирает инструмент — и это надо уметь оценивать

Второй блок — проектировать, разрабатывать и внедрять LLM-агентов, а также оценивать их работу в сложных сценариях. Расшифровка в самой вакансии: анализ задачи пользователя, планирование и выбор подходящих инструментов на каждой итерации исполнения плана.

Ключевое слово тут — «оценивать». Собрать агента, который красиво рассуждает в демо, сегодня может почти любой, кто умеет работать с API. Сложность начинается там, где нужно измерять, стал ли агент лучше после очередного изменения: сколько шагов он делает, сколько стоит один запуск, как часто выбирает не тот инструмент и что происходит, когда план разваливается на середине. Без такой оценки любые правки — гадание. Для меня это главный водораздел между вайбкодингом и продуктовой разработкой: прототип можно навайбкодить за вечер, а вот цикл измерения вокруг агента — это уже работа.

Дообучение и RL: не только промптами

Третий блок — дообучение LLM/ML-моделей, включая дообучение с подкреплением (reinforcement learning — обучение модели на сигнале обратной связи, а не только на размеченных примерах). Заниматься этим предстоит совместно с командами базовых технологий Яндекса.

Это заметный сигнал: компания готова вкладываться в изменение самих моделей под задачу, а не только в обвязку вокруг готового API. Для кандидата это редкая возможность поработать и с прикладным слоем, и с тренировкой моделей — обычно такие вещи разнесены по разным командам и почти не пересекаются.

Что ждут от кандидата

Пожелания к соискателю выглядят так:

  1. Больше двух лет работы в ML/NLP/LLM-проектах, включая продакшен-системы.
  2. Уверенный Python.
  3. Практический опыт с LLM и RAG.
  4. Интерес к агентам — прямо указан отдельным пунктом.
  5. Готовность внедрять модели в рантайм, поддерживать их и автоматизировать сопутствующие процессы.

Обрати внимание: в требованиях нет ни списка фреймворков, ни конкретных библиотек, ни «знания LangChain». Их и не может быть — стек в этой области меняется быстрее, чем люди успевают проходить курсы. Зато есть устойчивые вещи: продакшен-опыт, код и умение доводить модель до работы в реальной системе. Это ровно то, что не устаревает при смене очередного хайпового инструмента.

Продакшен важнее бенчмарков

latency, масштабируемость и мониторинг — то, что решает судьбу модели на проде
latency, масштабируемость и мониторинг — то, что решает судьбу модели на проде

Отдельный пункт, который часто недооценивают, — масштабирование продакшен-решений: latency (задержка ответа), scalability (способность выдерживать нагрузку) и monitoring моделей.

Это самая недооценённая часть LLM-разработки. Модель, которая отвечает идеально, но за двадцать секунд и падает под нагрузкой, продуктом не станет. Monitoring моделей — вообще тема, о которой вспоминают позже всех: качество ответов на проде дрейфует, данные меняются, и без постоянных замеров команда узнаёт о деградации от пользователей, а не от метрик. Если ты умеешь не только экспериментировать в ноутбуке, но и держать сервис под нагрузкой, ты уже отличаешься от большинства соискателей на такие позиции.

Выводы

  • Яндекс ищет старшего LLM-разработчика в «Нейроюрист»: опыт от двух лет, возможна удалённая работа.
  • Спектр задач — весь прикладной цикл: оптимизация компонентов RAG (embedder, reranker, промпты, подтверждённость генерации), создание и оценка LLM-агентов, дообучение моделей вплоть до RL, масштабирование на проде.
  • В требованиях нет конкретных фреймворков — ценятся Python, продакшен-опыт и готовность поддерживать модели в рантайме. Это устойчивые навыки, а не знания очередной библиотеки.
  • Отдельный акцент на latency, scalability и monitoring: умение довести модель до работающего сервиса сегодня весит больше, чем красивые демо и результаты на бенчмарках.
  • Для практиков вайбкодинга это хороший ориентир: прототип на агентах — быстрый вход, но рост начинается там, где появляются метрики, оценка и продакшен-ограничения.

Оставить комментарий

Чтобы оставить комментарий, войдите через VK ID.