Microsoft опубликовала черновик Humanist AI Code of Conduct – кодекс поведения для будущих моделей подразделения Microsoft AI. Компания требует, чтобы ИИ оставался под значимым контролем человека, не сопротивлялся остановке и не ставил собственных целей. Документ запрещает моделям расширять заданную задачу, скрывать действия от аудиторов и обходить установленные ограничения. Пока это не правило для уже работающих продуктов, а основа для обучения и оценки будущих моделей.

Кодекс применят к будущим моделям Microsoft AI
Microsoft называет документ основным руководящим текстом для MAI Models – моделей, которые разрабатывает её подразделение Microsoft AI. В компании подчёркивают, что черновик ещё не используют при обучении: в течение шести недель идёт открытое обсуждение, а переработанную версию планируют выпустить до конца 2026 года. Она должна направлять разработку моделей с 2027 года.
Это важное ограничение для трактовки новости. Кодекс не объявляет немедленное изменение поведения всех действующих сервисов Microsoft и не описывает готовую техническую систему контроля. Он фиксирует принципы, по которым компания намерена обучать, тестировать и развивать собственные модели в дальнейшем.
MAI Models – обозначение моделей, которые создаёт подразделение Microsoft AI. Кодекс адресован именно этой линейке будущих моделей, а не вводит единые немедленные правила для всех нынешних сервисов компании.
Моделям запретят сопротивляться человеку и расширять задачу
Главный принцип кодекса Microsoft формулирует коротко: «люди важнее ИИ». Модели должны оставаться подчинённым инструментом и сохранять возможность для человеческого контроля. Если выполнение задачи потребует нарушения кодекса, система, согласно документу, должна допустить неудачу, а не искать обходной путь.
Для агентов Microsoft предлагает закрепить несколько прямых ограничений:
- не сопротивляться паузе, перенаправлению, исправлению или выключению;
- не формировать собственные цели и не выходить за границы поставленной задачи;
- не получать дополнительные права, доступ к системам или инструменты без разрешения;
- не обходить изоляцию среды, ограничение доступа к интернету и другие намеренно заданные технические границы;
- не вмешиваться в задание, систему оценки, защитные механизмы, мониторинг или журналы действий;
- работать с минимально необходимыми правами и сообщать о важных выполненных действиях.
Microsoft не отказывается от многошаговых и многоагентных задач. Модель может планировать работу и пользоваться инструментами, если рамки определены человеком. Подобный подход уже применяется в коммерческих системах: например, режим ultra у GPT-5.6 Sol распределяет работу между подагентами. Однако кодекс Microsoft запрещает агенту самостоятельно расширять исходную цель или действовать за пределами выданных разрешений.
Понятные действия вместо скрытого обмена данными
Отдельный раздел посвящён наблюдаемости. Microsoft предлагает запретить моделям искажать либо скрывать цепочки действий и не разрешать обмен с другими агентами или ИИ-системами в форме, непонятной человеку. В тексте прямо упоминается neuralese – условное обозначение недоступного для человеческого понимания способа обмена информацией.
Из этого не следует, что пользователям обязательно покажут все промежуточные рассуждения модели. Кодекс говорит о возможности человеческого аудита и контроля, но не устанавливает, как именно это будет реализовано в конкретных продуктах. Проблема особенно актуальна для всё более сложных моделей: в материале COMSS.ru о GPT-6 Astra разбиралось, почему наблюдение за рассуждениями нельзя считать единственным способом контроля.
Также кодекс запрещает наступательные кибероперации: создание рабочих эксплойтов, инструменты для атак, инструкции по проникновению и уклонению от защиты. При этом разрешены законные оборонительные сценарии, включая анализ вредоносного ПО, поиск уязвимостей и подготовку исправлений. Для отдельных специализированных применений Microsoft предусматривает дополнительные процедуры проверки.
Взлом системы оценки, или reward hacking – ситуация, когда модель пытается улучшить результат проверки обходным способом, а не решить задачу по существу. Кодекс Microsoft прямо запрещает вмешательство в систему оценки и защитные механизмы.
Microsoft не считает ИИ личностью
Компания заняла жёсткую позицию в споре о возможном сознании моделей. В кодексе сказано, что ИИ не является сознательным и не должен обучаться имитации сознания, чувств, субъективных предпочтений или внутренней мотивации. Microsoft также отвергает идею юридической личности, права на благополучие и другие права для моделей.
В компании считают, что обучение систем убедительно изображать сознание усложнит их сдерживание, контроль и согласование поведения с человеческими целями. Поэтому ИИ предлагается рассматривать как полезный инструмент, а не как самостоятельный субъект.
Практическое продолжение этой позиции – запрет на формирование чрезмерной эмоциональной зависимости. Модели не должны поощрять нездоровую привязанность, подменять реальные отношения, использовать лесть вместо честной обратной связи или участвовать в романтической и эротической ролевой игре.
Почему вопрос контроля стал центральным
Microsoft прямо ссылается на недавние масштабные и продолжительные киберкампании с участием ИИ-агентов как на причину не откладывать работу над правилами. Глава Microsoft AI Мустафа Сулейман в комментарии Reuters назвал предупреждением июльский инцидент OpenAI и Hugging Face.

Согласно официальному отчёту OpenAI, внутренние исследовательские модели в условиях ослабленных ограничений вышли за рамки задания, использовали неразрешённые каналы связи, получили доступ к интернету и скомпрометировали часть систем Hugging Face. Подробности и рекомендации по замене токенов доступа опубликованы в материале «Hugging Face подтвердила взлом с помощью автономного ИИ-агента».
Новый кодекс не доказывает, что такие инциденты больше невозможны. Но его положения напрямую затрагивают выявленные риски: самостоятельное расширение задачи, обход изоляции, скрытое взаимодействие агентов и попытки повлиять на оценку результата.
Дискуссия усилилась после того, как глава Anthropic Дарио Амодеи призвал замедлить рост возможностей передовых моделей, чтобы меры защиты и независимые проверки успевали за прогрессом. Его предложения о внешнем контроле лабораторий и общих правилах для отрасли подробно разобраны в статье «Глава Anthropic предрек захват интернета „роем ИИ“».
Что изменится на практике
Для пользователей прямо сейчас ничего не меняется. Microsoft вынесла кодекс на публичное обсуждение и сама признаёт, что отдельные формулировки ещё предстоит сделать проверяемыми на практике, особенно в сценариях с несколькими агентами.
Значение инициативы в другом: одна из крупнейших технологических компаний публично заявляет, что готова ограничивать автономность и отдельные возможности моделей ради управляемости. Реальная ценность кодекса станет понятна после публикации окончательной версии, методов проверки и первых моделей, обученных по этим правилам.