Компания "Копылов Евгений Анатольевич"
Мы создаём B2B-платформу автономных ИИ-агентов для рынка США. Агенты ведут многошаговые рабочие процессы с несколькими участниками — со сроками, документами и перепиской — и выполняют действия во внешних системах: электронная почта, CRM, календари, документы. Ключевые действия проходят через подтверждение человеком.
Стек платформы: Python, FastAPI, PostgreSQL, Redis, MCP. Используем managed-модели Anthropic, OpenAI и Google через API.
У направления оценки уже есть наработки и накопленная база знаний. Ваша задача — подключиться и развить их в полноценную систему: архитектура оценочного harness, выбор инструментов и стандартов за вами. Результат вашей работы — измеримое качество агентов и возможность выпускать изменения без неконтролируемых регрессий.
Граница со смежной ролью: вы владеете инфраструктурой оценки — оценочным harness, тестовыми средами, release gates. Содержание доменных ролей агентов — знания, правила решений, обучающие наборы — зона Agent Knowledge Engineer, который работает внутри оценочного harness.
Строить систему оценки качества агентов. Измеримые критерии успешного выполнения, эталонные наборы данных, сценарные тесты и автоматизированные evals для многошаговых процессов.
Разбирать поведение агентов. Анализировать execution traces, tool calls, контекст и результаты; находить причины ошибок и деградации. Превращать отдельные сбои в воспроизводимые тесты и системные улучшения.
Защищать продукт от регрессий. Regression suites и release gates для изменений моделей, промптов, инструментов и оркестрации. Сравнение версий по качеству, стоимости, latency и устойчивости.
Проектировать границы безопасного поведения. Разрешённые действия, схемы и контракты инструментов, проверки входов и выходов, approval gates, fallback- и escalation-механизмы.
Проверять устойчивость к атакам. Red teaming: prompt injection, подмена контекста, ошибочные tool calls, зацикливание, превышение полномочий.
Повышать надёжность в production. Трассировка, мониторинг качества, алерты, расследование инцидентов; retry, timeout, idempotency, восстановление. Метрики: task success rate, доля вмешательств человека, критические ошибки, latency, стоимость.
Развивать общий harness платформы. Переиспользуемые компоненты и стандарты, ускоряющие безопасный запуск новых агентов и сценариев.
Разобрать существующие наработки и довести их до первой полной версии системы evals: критерии успеха для текущих сценариев, эталонные наборы, автоматический прогон.
Встроить regression suite и release gates в CI: изменения промптов, инструментов и моделей не выходят без сравнения версий по качеству, стоимости и latency.
Настроить трассировку и наблюдаемость production-агентов: execution traces, tool calls, алерты по деградации качества.
По каждому пункту на интервью спросим детали и артефакты.
Вместо стандартного сопроводительного письма:
Отклики из общих формулировок без верифицируемых артефактов не рассматриваются.
17 Августа
DevOps Engineer (Oracle / OCI)
Астана
Компания "Andersen" Andersen is hiring a DevOps Engineer (Oracle/OCI) for a project developing AI-powered customer service solutions and...
16 Августа
Full Stack Test Engineer Trainee
Астана
Компания "Andersen" International company Andersen, one of the leaders in the outsource production market, is recruiting for Full-stack QA...
16 Августа
Senior Python Engineer (Cheminformatics / Drug Discovery)
Астана
Компания "Epam Kazakhstan (Эпам Казахстан),ТОО" Погрузитесь в уникальную возможность работать на стыке химии, науки о данных и машинного...
16 Августа
Астана
Компания "Andersen" Andersen is hiring an ML/AI Engineer for a project developing AI-powered digital assistants, intelligent automation...
20 Августа
Астана
Компания "МЕЧТА, ТМ (Мечта Маркет, ТОО)" ДОБРЫЙ ДЕНЬ, УВАЖАЕМЫЙ КАНДИДАТ! На сегодняшний день мы, Команда Мечты, ищем Middle Data Engineer /...