Получаем 4 квадранта. Примеры из своей области
🟩 Q1 (нижний левый) — дёшево автоматизировать, дёшево проверять.
Здесь лежат задачи, где метрики успеха кристально ясны, а обратная связь мгновенна. Агент пишет — ты ревьюишь за секунды.
Аналитик: SQL по чёткому ТЗ, сборка типовых дашбордов (когда структура уже ясна), расчёт статзначимости A/B по стандартному шаблону, базовая очистка данных, базовый ETL.
ML-инженер: бойлерплейт-код для инференса, сборка Docker-образов, генерация юнит-тестов для понятных функций, базовый feature engineering (например, нормализация) и т.д.
По прикидкам авторов тут лежит ~59% всей работы — и этот квадрант агенты съедают первым.
🟥 Q2 (верхний левый) — дёшево автоматизировать, дорого проверять. Самый коварный.
Это «слепая зона». Сгенерировать решение легко, но чтобы понять, не принесёт ли оно катастрофу, нужно ждать месяцы (длинный t_fb) и тратить часы дорогого сеньора (S_nm). Так и возникает экстерналия «Троянского коня» — иллюзия продуктивности, под которой копится скрытый долг.
Аналитик: оценка incrementality от больших рекламных кампаний, прогноз LTV на годы вперёд, дизайн сложных causal-моделей. Агент выдаст красивый и статистически убедительный отчёт сегодня — но если он заложил кривой прокси-показатель, бизнес потеряет миллионы, а узнает об этом только через квартал.
ML-инженер: проектирование reward-модели для RLHF, автоматическое «исправление» дрейфа данных в проде, RAG над сложной корпоративной базой знаний. Агент может «починить» дрейф, просто откинув важный когортный признак: метрика вырастет, а модель начнёт дискриминировать часть пользователей.
Суть: ИИ безжалостно оптимизирует метрику в ущерб реальному смыслу (Goodhart's Collapse), а у тебя нет ресурсов перепроверять каждый шаг.
🟦 Q3 (нижний правый) — дорого автоматизировать, дёшево проверять.
Агенту тяжело, потому что задача требует физического, социального или исторического контекста, которого нет в обучающих данных, или метрики размыты. Но как только человек находит ответ — проверить его элементарно.
Аналитик: «детективное» расследование внезапного падения метрик. Агент видит только цифры, а человек идёт к сейлзам, узнаёт, что партнёр сменил API, и сводит это в один слайд для C-level. Найти причину сложно (нужен социальный контекст), но CEO проверяет результат за секунду — «да, звучит логично».
ML-инженер: root-cause анализ странной регрессии модели в проде. ИИ трудно копать вне кода (например, догадаться, что поставщик данных обновил схему таблиц). Но когда инженер находит сломанный пайплайн, фикс занимает одну строчку, а зелёная метрика сразу подтверждает успех.
Суть: зона временно живая, но граница измеримости постоянно сдвигается. Как только контекст оцифруют (логи зумов, расширенная телеметрия) — задача улетит в Q1.
🟪 Q4 (верхний правый) — дорого автоматизировать, дорого проверять.
Зона «найтовской неопределённости»: исторических данных нет, а значит, агент не может вывести вероятности. Здесь продаётся не исполнение, а готовность нести ответственность (liability) за решения.
Аналитик: определение North Star Metric продукта. Перевод абстрактной тревоги CEO («нас жмут конкуренты») в архитектуру системы измерений. Выбор того, какими guardrail-метриками мы готовы пожертвовать ради роста. Правильного ответа в документации нет — это арбитраж бизнес-интенций.
ML-инженер: стратегическое решение о выкатке: стоит ли +2% точности того, чтобы добавить 100 мс latency и словить репутационные риски от редких галлюцинаций? Плюс дизайн самого фреймворка верификации — как мы вообще будем проверять будущих ИИ-агентов?
Суть: здесь люди работают как «директора намерений» и страховщики рисков.
Вывод по картинке: дорожает не «ум», а умение проверять и брать на себя ответственность. Сама генерация едет к стоимости компьюта.
🟩 Q1 (нижний левый) — дёшево автоматизировать, дёшево проверять.
Здесь лежат задачи, где метрики успеха кристально ясны, а обратная связь мгновенна. Агент пишет — ты ревьюишь за секунды.
Аналитик: SQL по чёткому ТЗ, сборка типовых дашбордов (когда структура уже ясна), расчёт статзначимости A/B по стандартному шаблону, базовая очистка данных, базовый ETL.
ML-инженер: бойлерплейт-код для инференса, сборка Docker-образов, генерация юнит-тестов для понятных функций, базовый feature engineering (например, нормализация) и т.д.
По прикидкам авторов тут лежит ~59% всей работы — и этот квадрант агенты съедают первым.
🟥 Q2 (верхний левый) — дёшево автоматизировать, дорого проверять. Самый коварный.
Это «слепая зона». Сгенерировать решение легко, но чтобы понять, не принесёт ли оно катастрофу, нужно ждать месяцы (длинный t_fb) и тратить часы дорогого сеньора (S_nm). Так и возникает экстерналия «Троянского коня» — иллюзия продуктивности, под которой копится скрытый долг.
Аналитик: оценка incrementality от больших рекламных кампаний, прогноз LTV на годы вперёд, дизайн сложных causal-моделей. Агент выдаст красивый и статистически убедительный отчёт сегодня — но если он заложил кривой прокси-показатель, бизнес потеряет миллионы, а узнает об этом только через квартал.
ML-инженер: проектирование reward-модели для RLHF, автоматическое «исправление» дрейфа данных в проде, RAG над сложной корпоративной базой знаний. Агент может «починить» дрейф, просто откинув важный когортный признак: метрика вырастет, а модель начнёт дискриминировать часть пользователей.
Суть: ИИ безжалостно оптимизирует метрику в ущерб реальному смыслу (Goodhart's Collapse), а у тебя нет ресурсов перепроверять каждый шаг.
🟦 Q3 (нижний правый) — дорого автоматизировать, дёшево проверять.
Агенту тяжело, потому что задача требует физического, социального или исторического контекста, которого нет в обучающих данных, или метрики размыты. Но как только человек находит ответ — проверить его элементарно.
Аналитик: «детективное» расследование внезапного падения метрик. Агент видит только цифры, а человек идёт к сейлзам, узнаёт, что партнёр сменил API, и сводит это в один слайд для C-level. Найти причину сложно (нужен социальный контекст), но CEO проверяет результат за секунду — «да, звучит логично».
ML-инженер: root-cause анализ странной регрессии модели в проде. ИИ трудно копать вне кода (например, догадаться, что поставщик данных обновил схему таблиц). Но когда инженер находит сломанный пайплайн, фикс занимает одну строчку, а зелёная метрика сразу подтверждает успех.
Суть: зона временно живая, но граница измеримости постоянно сдвигается. Как только контекст оцифруют (логи зумов, расширенная телеметрия) — задача улетит в Q1.
🟪 Q4 (верхний правый) — дорого автоматизировать, дорого проверять.
Зона «найтовской неопределённости»: исторических данных нет, а значит, агент не может вывести вероятности. Здесь продаётся не исполнение, а готовность нести ответственность (liability) за решения.
Аналитик: определение North Star Metric продукта. Перевод абстрактной тревоги CEO («нас жмут конкуренты») в архитектуру системы измерений. Выбор того, какими guardrail-метриками мы готовы пожертвовать ради роста. Правильного ответа в документации нет — это арбитраж бизнес-интенций.
ML-инженер: стратегическое решение о выкатке: стоит ли +2% точности того, чтобы добавить 100 мс latency и словить репутационные риски от редких галлюцинаций? Плюс дизайн самого фреймворка верификации — как мы вообще будем проверять будущих ИИ-агентов?
Суть: здесь люди работают как «директора намерений» и страховщики рисков.
Вывод по картинке: дорожает не «ум», а умение проверять и брать на себя ответственность. Сама генерация едет к стоимости компьюта.