Компания "Копылов Евгений Анатольевич"
Мы создаём B2B-платформу автономных ИИ-агентов для рынка США. Агенты ведут многошаговые рабочие процессы с несколькими участниками — со сроками, документами и перепиской — и выполняют действия во внешних системах: электронная почта, CRM, календари, документы. Ключевые действия проходят через подтверждение человеком.
Стек платформы: Python, FastAPI, PostgreSQL, Redis, MCP. Используем managed-модели Anthropic, OpenAI и Google через API.
У направления оценки уже есть наработки и накопленная база знаний. Ваша задача — подключиться и развить их в полноценную систему: архитектура оценочного harness, выбор инструментов и стандартов за вами. Результат вашей работы — измеримое качество агентов и возможность выпускать изменения без неконтролируемых регрессий.
Граница со смежной ролью: вы владеете инфраструктурой оценки — оценочным harness, тестовыми средами, release gates. Содержание доменных ролей агентов — знания, правила решений, обучающие наборы — зона Agent Knowledge Engineer, который работает внутри оценочного harness.
Строить систему оценки качества агентов. Измеримые критерии успешного выполнения, эталонные наборы данных, сценарные тесты и автоматизированные evals для многошаговых процессов.
Разбирать поведение агентов. Анализировать execution traces, tool calls, контекст и результаты; находить причины ошибок и деградации. Превращать отдельные сбои в воспроизводимые тесты и системные улучшения.
Защищать продукт от регрессий. Regression suites и release gates для изменений моделей, промптов, инструментов и оркестрации. Сравнение версий по качеству, стоимости, latency и устойчивости.
Проектировать границы безопасного поведения. Разрешённые действия, схемы и контракты инструментов, проверки входов и выходов, approval gates, fallback- и escalation-механизмы.
Проверять устойчивость к атакам. Red teaming: prompt injection, подмена контекста, ошибочные tool calls, зацикливание, превышение полномочий.
Повышать надёжность в production. Трассировка, мониторинг качества, алерты, расследование инцидентов; retry, timeout, idempotency, восстановление. Метрики: task success rate, доля вмешательств человека, критические ошибки, latency, стоимость.
Развивать общий harness платформы. Переиспользуемые компоненты и стандарты, ускоряющие безопасный запуск новых агентов и сценариев.
Разобрать существующие наработки и довести их до первой полной версии системы evals: критерии успеха для текущих сценариев, эталонные наборы, автоматический прогон.
Встроить regression suite и release gates в CI: изменения промптов, инструментов и моделей не выходят без сравнения версий по качеству, стоимости и latency.
Настроить трассировку и наблюдаемость production-агентов: execution traces, tool calls, алерты по деградации качества.
По каждому пункту на интервью спросим детали и артефакты.
Вместо стандартного сопроводительного письма:
Отклики из общих формулировок без верифицируемых артефактов не рассматриваются.
19 Августа
QA engineer (middle)( UNITEL LLC )
Ташкент
Компания "UNITEL LLC" Обязанности: Анализировать требования и спецификации, участвовать в планировании и grooming. Подготавливать...
18 Августа
Ташкент
Компания "VENKON" Venkon Group это ИТ-компания с десятками продуктов и тысячами клиентов. В их поддержке и обслуживании много рутинных...
20 Августа
Software Systems Engineer / Architect
Ташкент
Компания "Itransition" We’re looking for a professional to design and shape complex software-based systems, working at the intersection of...
18 Августа
Ташкент
Компания "UNITEL LLC" Мы ожидаем от вас: Опыт разработки ML-решений от 2 лет. Глубокие знания в области: линейной алгебры, теории...
15 Августа
Ташкент
Компания "«MY FREIGHTER» LLC" Компания MY FREIGHTER является одной из самых быстрорастущих компаний по грузовым авиаперевозкам в Узбекистане и...