Оценка качества · Разбор
ИИ предложил решение. А можно ему доверять?
Microsoft представила Decision-1 — модель для оценки вариантов решений. Разбираемся, чем она полезна агентам и как проверить самого проверяющего.
На днях наткнулся на анонс Microsoft — и он меня заинтересовал. Учитывая моё недоверие к решениям ИИ, пройти мимо было трудно: нейросеть может отвечать очень убедительно, а потом выясняется, что она упустила важную деталь или сделала вывод без достаточных оснований.
Microsoft представила Decision-1 — модель, которая оценивает предложенные варианты решений. Идея любопытная: один ИИ предлагает, другой проверяет. Но тут у меня сразу возник вопрос: а насколько можно доверять самому проверяющему? Давайте разберёмся.
Что представила Microsoft
Анонс Microsoft-Decision-1 опубликован 9 октября 2026 года. Модель получает текст и фиксированный набор вариантов, после чего возвращает вероятностную оценку каждого варианта. Заявленные задачи — классификация, маршрутизация, приоритизация, проверка ответов и управление рабочими процессами. Модель доступна через Microsoft Foundry и OpenRouter. [1]
По карточке OpenRouter, Decision-1 создана дополнительным обучением Qwen3.5-9B. Она предназначена для оценки вариантов; свободный диалог, перевод и написание текстов не входят в её заявленное назначение. [2]
Как это выглядит в работе
Представим ассистента автодилера. Клиент пишет: «Машина плохо заводится, но я ещё хочу узнать условия обмена». Системе нужно выбрать между продажами, сервисом и уточнением запроса. Генерирующая модель может подготовить ответ, а оценщик — помочь определить следующий шаг. Это авторский пример применения, а не результат испытания Decision-1 в AutoSfera.
Для контент-системы варианты другие: черновик соответствует редакционным требованиям, требует исправления или нуждается в проверке человеком. Здесь важно сформулировать конкретные критерии: подтверждены ли существенные утверждения, соответствует ли текст источникам, не обещает ли он того, чего данные не показывают.
В исследовательском помощнике оценщик может проверять, указан ли срок прогноза и понятен ли критерий его исполнения. Однако проверка формулировки не устанавливает точность предсказания: её можно измерить только после сопоставления с фактическим исходом.
Вероятность полезнее уверенного тона
Microsoft заявляет калиброванные вероятностные оценки. Смысл калибровки: среди большой серии сопоставимых решений с оценкой 90% примерно девять из десяти должны оказаться правильными. [1]
Это помогает определить, когда принять предложение, запросить дополнительные данные или передать вопрос человеку. Но калибровку нужно проверять на собственных задачах — особенно на русском языке, неоднозначных запросах и случаях, отличающихся от обычных примеров.
Есть ещё одна тонкость: фиксированный список вариантов должен содержать приемлемый выход. Если все варианты ошибочны, высокий балл лучшего из них проблему не решает. Поэтому полезно предусмотреть «недостаточно данных» или «нужна ручная проверка» и испытать поведение системы в таких случаях.
Кто разрешает действие
Моя инженерная рекомендация — разделять предложение, оценку и исполнение. Оценщик помогает рассмотреть решение; программные правила проверяют полномочия, допустимый адрес, параметры операции и защиту от повторов.
Например, высокая оценка черновика не даёт разрешения публиковать пост от имени владельца. Одобрение должно относиться к конкретному тексту, изображению и площадке. И второй approve не должен создавать второй пост.
Две модели также могут ошибаться одинаково, если опираются на один неверный источник. Поэтому согласие между ними не заменяет проверки источника или независимого наблюдения.
Что известно о скорости и стоимости
В собственном сравнении на 36 наборах тестов Microsoft заявляет наивысшую точность Decision-1 и существенное преимущество по скорости. Это результаты разработчика; они не гарантируют такого же выигрыша в конкретном приложении. [1]
На момент проверки OpenRouter указывает цену $0,042 за миллион входных токенов, без платы за выходные. [2] К ней добавляются расходы на генерацию ответа, поиск, хранение данных и повторные попытки. Оценивать стоит стоимость успешно выполненной задачи целиком.
Как проверить самого проверяющего
Начать можно с набора реальных задач, ответы на которые заранее проверены человеком. Сравнить следует текущий способ проверки, специализированный оценщик и простые программные правила.
Измерять нужно долю правильных решений, уверенные ошибки, ненужные передачи человеку, задержку и стоимость всей цепочки. Отдельно проверить перестановку вариантов, перефразирование запросов и инструкции, спрятанные во входном тексте. Если модель или правила меняются, сравнение нужно повторять на независимых данных.
Я бы рассматривал Decision-1 как кандидата для пилота. Идея отдельного оценщика заслуживает внимания, но доверие к нему должно появляться из результатов проверки. Пока самостоятельного тестирования этой модели в проектах ДИС не проводилось.
Источники
1. Microsoft. [Introducing Microsoft-Decision-1, our model for fast decision-making](https://commandline.microsoft.com/microsoft-decision-1-model-foundry/). Анонс от 09.10.2026. 2. OpenRouter. [Microsoft-Decision-1: описание, доступ и тариф](https://openrouter.ai/microsoft/microsoft-decision-1).
Источники проверены 11.10.2026. Примеры применения и рекомендации по архитектуре — авторская инженерная интерпретация.
Источники
Обновление: Источники проверены 11.10.2026; вступление согласовано, публикация одобрена автором. Самостоятельные испытания Decision-1 не проводились.
