AI Agent Reliability Engineer / Harness Engineer Agentic AI

22 Августа

от 100 000 руб.

Партнерские Вакансии

Город:

Астана

Занятость:

Полная занятость

Компания "Копылов Евгений Анатольевич"

О продукте и стеке

Мы создаём B2B-платформу автономных ИИ-агентов для рынка США. Агенты ведут многошаговые рабочие процессы с несколькими участниками — со сроками, документами и перепиской — и выполняют действия во внешних системах: электронная почта, CRM, календари, документы. Ключевые действия проходят через подтверждение человеком.​​​​​

Стек платформы: Python, FastAPI, PostgreSQL, Redis, MCP. Используем managed-модели Anthropic, OpenAI и Google через API.

У направления оценки уже есть наработки и накопленная база знаний. Ваша задача — подключиться и развить их в полноценную систему: архитектура оценочного harness, выбор инструментов и стандартов за вами. Результат вашей работы — измеримое качество агентов и возможность выпускать изменения без неконтролируемых регрессий.

Граница со смежной ролью: вы владеете инфраструктурой оценки — оценочным harness, тестовыми средами, release gates. Содержание доменных ролей агентов — знания, правила решений, обучающие наборы — зона Agent Knowledge Engineer, который работает внутри оценочного harness.


Что предстоит делать

Строить систему оценки качества агентов. Измеримые критерии успешного выполнения, эталонные наборы данных, сценарные тесты и автоматизированные evals для многошаговых процессов.
Разбирать поведение агентов. Анализировать execution traces, tool calls, контекст и результаты; находить причины ошибок и деградации. Превращать отдельные сбои в воспроизводимые тесты и системные улучшения.
Защищать продукт от регрессий. Regression suites и release gates для изменений моделей, промптов, инструментов и оркестрации. Сравнение версий по качеству, стоимости, latency и устойчивости.
Проектировать границы безопасного поведения. Разрешённые действия, схемы и контракты инструментов, проверки входов и выходов, approval gates, fallback- и escalation-механизмы.
Проверять устойчивость к атакам. Red teaming: prompt injection, подмена контекста, ошибочные tool calls, зацикливание, превышение полномочий.
Повышать надёжность в production. Трассировка, мониторинг качества, алерты, расследование инцидентов; retry, timeout, idempotency, восстановление. Метрики: task success rate, доля вмешательств человека, критические ошибки, latency, стоимость.
Развивать общий harness платформы. Переиспользуемые компоненты и стандарты, ускоряющие безопасный запуск новых агентов и сценариев.


Первые 90 дней

Разобрать существующие наработки и довести их до первой полной версии системы evals: критерии успеха для текущих сценариев, эталонные наборы, автоматический прогон.

Встроить regression suite и release gates в CI: изменения промптов, инструментов и моделей не выходят без сравнения версий по качеству, стоимости и latency.

Настроить трассировку и наблюдаемость production-агентов: execution traces, tool calls, алерты по деградации качества.


Обязательные требования

По каждому пункту на интервью спросим детали и артефакты.

  • Production-код на Python: тестируемые backend-системы, pytest, Docker, CI (GitHub Actions или аналог).
  • Лично проектировали и строили систему оценки недетерминированной системы: автоматизированные evals, сценарные тесты, эталонные наборы. Использование готового чужого harness'а без проектирования собственного не засчитывается.
  • Практический опыт LLM-приложений или агентов: tool calling, оркестрация многошаговых сценариев, анализ логов и трасс, воспроизведение сложных сбоев.
  • Статистическая грамотность: размеры выборок, дисперсия, значимость различий между версиями недетерминированной системы. Без этого evals превращаются в театр — спросим об этом отдельно.
  • Понимание рисков production AI: prompt injection, некорректное использование инструментов, избыточные полномочия, зацикливание, неконтролируемый рост стоимости.
  • Английский B1 или выше.


Будет преимуществом

  • Опыт с Langfuse, LangSmith, Arize Phoenix, OpenAI Evals, DeepEval, Ragas или аналогами.
  • LLM-as-a-judge пайплайны с проверкой качества самой оценки.
  • Red teaming LLM-систем, AI security, построение guardrails.
  • Симуляторы, генераторы тестовых данных, собственные evaluators.
  • OpenTelemetry и инженерные практики надёжности: observability, graceful degradation, incident analysis.


Условия

  • Полная занятость, удалённая работа. Синхронное окно команды: с 10:00–11:00 до 20:00–21:00 МСК.
  • Возможность определять стандарты качества и надёжности агентной платформы.
  • Высокая самостоятельность в выборе подходов и инструментов; оценка по результату.

Как откликнуться

Вместо стандартного сопроводительного письма:

  • Разберите одну AI- или backend-систему, надёжность которой вы повысили: как работала, за что отвечали лично вы, что реализовали, как изменились качество и стабильность. Приложите верифицируемые артефакты: GitHub, пример спроектированного eval-набора или evaluator'а, технические статьи.
  • Ответьте на вопрос: как вы построите еvаlдля многошагового агента, у которого успех задачи не сводится к сравнению вывода с эталоном? Как проверите, что LLM-as-judge оценивает верно?
  • Опишите, что в этом проекте не получилось и почему.

Отклики из общих формулировок без верифицируемых артефактов не рассматриваются.

Похожие вакансии

17 Августа

DevOps Engineer (Oracle / OCI)

Астана

Компания "Andersen" Andersen is hiring a DevOps Engineer (Oracle/OCI) for a project developing AI-powered customer service solutions and...

Отправить резюме подробнее

16 Августа

Full Stack Test Engineer Trainee

Астана

Компания "Andersen" International company Andersen, one of the leaders in the outsource production market, is recruiting for Full-stack QA...

Отправить резюме подробнее

16 Августа

Senior Python Engineer (Cheminformatics / Drug Discovery)

Астана

Компания "Epam Kazakhstan (Эпам Казахстан),ТОО" Погрузитесь в уникальную возможность работать на стыке химии, науки о данных и машинного...

Отправить резюме подробнее

16 Августа

ML/AI Engineer

Астана

Компания "Andersen" Andersen is hiring an ML/AI Engineer for a project developing AI-powered digital assistants, intelligent automation...

Отправить резюме подробнее

20 Августа

Data Engineer (Middle+)

Астана

Компания "МЕЧТА, ТМ (Мечта Маркет, ТОО)" ДОБРЫЙ ДЕНЬ, УВАЖАЕМЫЙ КАНДИДАТ! На сегодняшний день мы, Команда Мечты, ищем Middle Data Engineer /...

Отправить резюме подробнее

Вакансия размещена в отрасли

Информационные технологии / IT / Интернет: