AI-агенты · Разбор
Человек не исчезает из контура: чему 250 000 реальных диалогов научили нас о работе с ИИ
Исследование почти 250 тысяч реальных диалогов показывает, как критичность задачи меняет человеческий контроль, обучение и способы исправления ошибок при работе с ИИ.
Что изучали авторы
Исследователи Stanford University проанализировали 249 834 реальных диалога пользователей Claude.ai. Их интересовали три вещи: какие задачи люди передают ИИ, сколько контроля сохраняют за собой и где взаимодействие человека с моделью начинает давать сбои.
Это не лабораторный эксперимент, а крупномасштабное наблюдательное исследование реального использования чат-ассистента. Поэтому оно особенно интересно как карта практики, но его проценты не следует автоматически переносить на все AI-платформы и агентные системы.
ИИ уже используют для серьёзной работы
Авторы разделили задачи на четыре уровня критичности: легко обратимые, операционные, значимые и высокорисковые. По их оценке, 44% классифицированных задач относились к consequential, ещё 12% — к high-stakes. Иными словами, 56% задач достигали значимого или высокого уровня последствий.
Особенно много критичных задач оказалось в юридической, финансовой, деловой и карьерной сферах. Это важный сдвиг: AI-ассистент уже давно используется не только для черновиков и бытовых вопросов, но и для работы, где ошибка может иметь реальные последствия.
Чем выше риск, тем активнее человек
По мере роста критичности задачи меняется и поведение пользователя. Разговоры становятся длиннее, запросы — точнее, а результат чаще перерабатывается.
Средняя длина диалога почти удваивалась между низко- и высококритичными задачами: примерно с 6,5 до 12,4 хода.
Авторы выделили несколько режимов работы с ответом ИИ: прямое использование, попытку понять, адаптацию, критику и отказ от результата. Наиболее распространённым оказался режим адаптации: пользователи значительно перерабатывали первоначальный ответ под свой контекст. Доля прямого использования снижалась по мере роста ставки.
Практический вывод прост: ценность ИИ часто рождается не в первом ответе, а в цикле «ответ → проверка → критика → уточнение → переработка».
Основной режим — человек ведёт, ИИ помогает
Для оценки человеческого контроля авторы использовали Human Agency Scale — шкалу от полной автономии ИИ до полного человеческого контроля.
Самый заметный результат: 72% разговоров относились к режиму «human leads, AI assists». Полностью или почти полностью автономные сценарии составляли значительно меньшую долю.
Это важный аргумент в пользу augmentation — усиления человеческих возможностей — вместо безусловной автоматизации.
Для простых и обратимых задач можно позволить системе больше автономии. Для медицины, права, финансов, публичных материалов и production-систем разумнее сохранять human-in-the-loop.
ИИ часто становится преподавателем
В 67% оцениваемых разговоров модель выполняла обучающую функцию: объясняла, демонстрировала шаги, приводила примеры или сочетала несколько методов.
Причём такое обучение происходило далеко не только в учебных задачах. Значительная доля приходилась на здоровье, программирование, бизнес, юридические и финансовые вопросы, AI и data.
Отсюда следует важный принцип для AI-ассистентов: полезная система должна уметь не только выдавать результат, но и объяснять логику, ограничения и способ проверки.
Почти половина разговоров содержит friction
Friction авторы называют любое затруднение, которое замедляет движение к цели: недопонимание, нехватку контекста, неверный ответ, неудачную интерпретацию или цикл уточнений.
Такие ситуации обнаружены примерно в 49,7% анализируемых разговоров.
Интересно распределение источников: часть проблем возникала со стороны пользователя, часть — со стороны модели, но наиболее частым оказался каскад взаимных ошибок. Недостаточно точный запрос приводил к неверной интерпретации, затем к слабому ответу и дальнейшему расхождению.
Для архитектуры AI-систем это аргумент в пользу валидации, контрольных точек и явного уточнения контекста.
Friction бывает продуктивным
Не всякое затруднение — провал. В сложных задачах спор, коррекция и уточнение могут улучшить итоговый результат.
Авторы показали, что пользователи активно пытались исправлять сбои в 78,7% разговоров с friction. Среди особенно продуктивных стратегий — оспаривание рассуждения модели, просьба упростить ответ и прямое исправление фактической ошибки.
Это меняет взгляд на хороший интерфейс. Полезный AI-ассистент не обязан быть безусловно «гладким». Иногда он должен остановиться и сказать: данных недостаточно, условие противоречиво, факт нужно проверить или перед действием требуется подтверждение.
Что это означает для архитектуры AI-систем
Из исследования хорошо выводится рабочая схема:
**Пользователь → предложение ИИ → проверка → корректировка → подтверждение человеком → выполнение.**
А не:
**Пользователь → ИИ → автоматическое выполнение.**
Особенно это важно там, где действие трудно отменить или оно влияет на других людей.
Для практических систем отсюда следуют пять правил:
1. Уровень автономии должен зависеть от критичности задачи. 2. В сложных задачах нужна декомпозиция и промежуточные контрольные точки. 3. Модель должна показывать ограничения и просить недостающий контекст. 4. Пользователь должен иметь простой способ оспорить, исправить и перепроверить ответ. 5. Публичные, медицинские, юридические и финансовые действия требуют человеческого подтверждения.
Ограничения исследования
Результаты нужно читать аккуратно. Корпус относится только к Claude.ai и не включает Claude Code и Claude Cowork. Это значит, что выводы описывают прежде всего чат-взаимодействие, а не полноценные агентные workflow.
Кроме того, разметка разговоров выполнялась автоматизированной системой Anthropic Insights. Авторы сами отмечают ограничения агрегированных данных и невозможность напрямую проводить разговорный качественный анализ на исходных Claude-диалогах.
Особенно важен методологический нюанс: при первоначальной проверке facet-разметки на небольшой выборке точность составляла 56%, после чего промпты классификации итеративно дорабатывались. Поэтому точные проценты разумнее воспринимать как оценки внутри используемой аналитической методики, а не как универсальные константы человеческого поведения.
Вывод
Главный вывод исследования не в том, что ИИ становится самостоятельнее человека. Наоборот: чем значимее задача, тем важнее человеческий контроль, критика и способность корректировать модель.
Похоже, один из ключевых навыков ближайших лет — не просто «уметь пользоваться ИИ», а уметь правильно сотрудничать с ним: ставить задачу, проверять вывод, спорить, уточнять, замечать ошибки и принимать финальное решение.
Человек не исчезает из контура. В хорошей системе он становится его управляющим звеном.
Источники
Обновление: Исследование и основные цифры проверены по оригинальной работе и публичной карточке alphaXiv 27 сентября 2026 года.
