Контракт | Удалённо, по всему миру | $100–$200/час в зависимости от опыта и локации | 10–20 ч/нед
Подробнее в этом видео на Loom: https://www.loom.com/share/b0d1b0bf24c44ae8b95dca84b9db60e5
Ищем опытного инженера-разработчика (уровень SR+) для оценки качества взаимодействий с современными coding-агентами, такими как OpenAI Codex и Claude Code.
Это не классическая инженерная роль. Вы не будете писать production-код. Вы будете оценивать то, что сложнее: думает ли модель как сильный инженер.
Вы будете оценивать поведение AI coding-агентов в реальных сценариях, с фокусом на:
• Имеет ли ответ смысл
• Полезны ли преамбула и рассуждения
• Отражает ли результат сильную инженерную суждательность
• Ощущается ли взаимодействие правильным для опытного разработчика
Речь об инженерном вкусе. Синтаксическая корректность — лёгкая часть.
• Оценивать сгенерированные AI coding-взаимодействия от начала до конца
• Судить, полезны ли результаты, верны ли они на высоком уровне и совпадают ли с тем, как думал бы сильный инженер
• Оценивать качество объяснений и рассуждений, а не только кода
• Различать уровни качества ответа (чем отличается оценка 2 от 4)
• Давать чёткую, аргументированную письменную обратную связь: что сработало, что нет, что показалось странным или вводящим в заблуждение
• Помогать определять, как выглядит «отлично» при работе с инструментами вроде Cursor, Codex и Claude Code
Нам нужны инженеры, которые могут ответить на вопросы вроде:
• Похоже ли это на то, что реально сказал бы сильный инженер?
• Помогает ли это объяснение или оно лишь технически верно?
• Ведёт ли модель пользователя хорошо или просто вываливает результат?
• Укрепит ли такое взаимодействие доверие или подорвёт его?
Вы должны уметь делать субъективные, но строгие суждения и ясно их объяснять.
• Инженер уровня Senior, Staff или Principal (или эквивалентный опыт)
• Сильный бэкграунд в TypeScript/JavaScript или Python
• Практический опыт хотя бы с одним из OpenAI Codex, Claude Code или Cursor
• Глубокое знакомство с современными AI-assisted dev workflow
• Умение оценивать код без запуска и без разбора каждой строки
• Сильный письменный и устный английский (B2 и выше). Вы будете писать развёрнутую обратную связь и записывать короткие видеообъяснения — это обязательное требование
• Комфортно давать прямую, аргументированную обратную связь
• Высокая планка того, как выглядит хорошая инженерия
• Опыт prompt design или evaluation workflow
• Опыт менторства senior-инженеров или формирования инженерных стандартов
• Ставка: $100–$200/час в зависимости от опыта и локации
• Часы: 10–20 часов в неделю, гибкий график
• Срок: на постоянной основе. Проекты длятся от примерно двух недель до нескольких месяцев; новые предлагаем тем оценщикам, кто хорошо справляется
• Старт: как только вы пройдёте take-home и в проекте освободится место
• Процесс: одно take-home задание на оценку с записанным разбором в Loom. Без собеседования
Будьте осторожны: если работодатель просит войти через Google, iCloud или Госуслуги, прислать код или пароль, запустить ПО или перевести деньги — это мошенники.