AI-агенты · Разбор

Человек не исчезает из контура: чему 250 000 реальных диалогов научили нас о работе с ИИ

Исследование почти 250 тысяч реальных диалогов показывает, как критичность задачи меняет человеческий контроль, обучение и способы исправления ошибок при работе с ИИ.

Автор: Степанов Д.А. Опубликовано: 27.09.2026 ✓ Проверено 27.09.2026

Что изучали авторы

Исследователи Stanford University проанализировали 249 834 реальных диалога пользователей Claude.ai. Их интересовали три вещи: какие задачи люди передают ИИ, сколько контроля сохраняют за собой и где взаимодействие человека с моделью начинает давать сбои.

Это не лабораторный эксперимент, а крупномасштабное наблюдательное исследование реального использования чат-ассистента. Поэтому оно особенно интересно как карта практики, но его проценты не следует автоматически переносить на все AI-платформы и агентные системы.

ИИ уже используют для серьёзной работы

Авторы разделили задачи на четыре уровня критичности: легко обратимые, операционные, значимые и высокорисковые. По их оценке, 44% классифицированных задач относились к consequential, ещё 12% — к high-stakes. Иными словами, 56% задач достигали значимого или высокого уровня последствий.

Особенно много критичных задач оказалось в юридической, финансовой, деловой и карьерной сферах. Это важный сдвиг: AI-ассистент уже давно используется не только для черновиков и бытовых вопросов, но и для работы, где ошибка может иметь реальные последствия.

Чем выше риск, тем активнее человек

По мере роста критичности задачи меняется и поведение пользователя. Разговоры становятся длиннее, запросы — точнее, а результат чаще перерабатывается.

Средняя длина диалога почти удваивалась между низко- и высококритичными задачами: примерно с 6,5 до 12,4 хода.

Авторы выделили несколько режимов работы с ответом ИИ: прямое использование, попытку понять, адаптацию, критику и отказ от результата. Наиболее распространённым оказался режим адаптации: пользователи значительно перерабатывали первоначальный ответ под свой контекст. Доля прямого использования снижалась по мере роста ставки.

Практический вывод прост: ценность ИИ часто рождается не в первом ответе, а в цикле «ответ → проверка → критика → уточнение → переработка».

Основной режим — человек ведёт, ИИ помогает

Для оценки человеческого контроля авторы использовали Human Agency Scale — шкалу от полной автономии ИИ до полного человеческого контроля.

Самый заметный результат: 72% разговоров относились к режиму «human leads, AI assists». Полностью или почти полностью автономные сценарии составляли значительно меньшую долю.

Это важный аргумент в пользу augmentation — усиления человеческих возможностей — вместо безусловной автоматизации.

Для простых и обратимых задач можно позволить системе больше автономии. Для медицины, права, финансов, публичных материалов и production-систем разумнее сохранять human-in-the-loop.

ИИ часто становится преподавателем

В 67% оцениваемых разговоров модель выполняла обучающую функцию: объясняла, демонстрировала шаги, приводила примеры или сочетала несколько методов.

Причём такое обучение происходило далеко не только в учебных задачах. Значительная доля приходилась на здоровье, программирование, бизнес, юридические и финансовые вопросы, AI и data.

Отсюда следует важный принцип для AI-ассистентов: полезная система должна уметь не только выдавать результат, но и объяснять логику, ограничения и способ проверки.

Почти половина разговоров содержит friction

Friction авторы называют любое затруднение, которое замедляет движение к цели: недопонимание, нехватку контекста, неверный ответ, неудачную интерпретацию или цикл уточнений.

Такие ситуации обнаружены примерно в 49,7% анализируемых разговоров.

Интересно распределение источников: часть проблем возникала со стороны пользователя, часть — со стороны модели, но наиболее частым оказался каскад взаимных ошибок. Недостаточно точный запрос приводил к неверной интерпретации, затем к слабому ответу и дальнейшему расхождению.

Для архитектуры AI-систем это аргумент в пользу валидации, контрольных точек и явного уточнения контекста.

Friction бывает продуктивным

Не всякое затруднение — провал. В сложных задачах спор, коррекция и уточнение могут улучшить итоговый результат.

Авторы показали, что пользователи активно пытались исправлять сбои в 78,7% разговоров с friction. Среди особенно продуктивных стратегий — оспаривание рассуждения модели, просьба упростить ответ и прямое исправление фактической ошибки.

Это меняет взгляд на хороший интерфейс. Полезный AI-ассистент не обязан быть безусловно «гладким». Иногда он должен остановиться и сказать: данных недостаточно, условие противоречиво, факт нужно проверить или перед действием требуется подтверждение.

Что это означает для архитектуры AI-систем

Из исследования хорошо выводится рабочая схема:

**Пользователь → предложение ИИ → проверка → корректировка → подтверждение человеком → выполнение.**

А не:

**Пользователь → ИИ → автоматическое выполнение.**

Особенно это важно там, где действие трудно отменить или оно влияет на других людей.

Для практических систем отсюда следуют пять правил:

1. Уровень автономии должен зависеть от критичности задачи. 2. В сложных задачах нужна декомпозиция и промежуточные контрольные точки. 3. Модель должна показывать ограничения и просить недостающий контекст. 4. Пользователь должен иметь простой способ оспорить, исправить и перепроверить ответ. 5. Публичные, медицинские, юридические и финансовые действия требуют человеческого подтверждения.

Ограничения исследования

Результаты нужно читать аккуратно. Корпус относится только к Claude.ai и не включает Claude Code и Claude Cowork. Это значит, что выводы описывают прежде всего чат-взаимодействие, а не полноценные агентные workflow.

Кроме того, разметка разговоров выполнялась автоматизированной системой Anthropic Insights. Авторы сами отмечают ограничения агрегированных данных и невозможность напрямую проводить разговорный качественный анализ на исходных Claude-диалогах.

Особенно важен методологический нюанс: при первоначальной проверке facet-разметки на небольшой выборке точность составляла 56%, после чего промпты классификации итеративно дорабатывались. Поэтому точные проценты разумнее воспринимать как оценки внутри используемой аналитической методики, а не как универсальные константы человеческого поведения.

Вывод

Главный вывод исследования не в том, что ИИ становится самостоятельнее человека. Наоборот: чем значимее задача, тем важнее человеческий контроль, критика и способность корректировать модель.

Похоже, один из ключевых навыков ближайших лет — не просто «уметь пользоваться ИИ», а уметь правильно сотрудничать с ним: ставить задачу, проверять вывод, спорить, уточнять, замечать ошибки и принимать финальное решение.

Человек не исчезает из контура. В хорошей системе он становится его управляющим звеном.

Источники

  1. Shao Y. et al. Human–AI Collaboration at Scale: Task Criticality, Agency, and Friction Across 250,000 Conversations
  2. Yijia Shao — Stanford University, research page

Обновление: Исследование и основные цифры проверены по оригинальной работе и публичной карточке alphaXiv 27 сентября 2026 года.

// по теме

Рекомендуемые материалы

Безопасность

Когда AI-агент обходит запрет: случай с порталом Medicare в Австралии

Как исследовательский AI-агент получил доступ к непубличной статистике Medicare и что этот случай говорит о песочницах, контроле прав и уведомлении об инцидентах.

Читать материал →
Безопасность

GPT-6 и Claude Opus 5.5: нейросети превращаются из собеседников в цифровых исполнителей

Чем отличаются новые модели OpenAI и Anthropic, сколько стоит их работа и почему автономным AI-исполнителям нужны строгие технические границы.

Читать материал →