微软给自家AI写下十条铁律,唯独没写谁来查

微软给自家AI写下十条铁律,唯独没写谁来查

9月14日,微软AI把一份还在起草中的文件挂到官网上,叫《MAI模型行为准则》。Microsoft AI首席执行官穆斯塔法·苏莱曼在X上把它概括成十条,第一条只有五个英文单词,People matter more than AI。他在同一天写了句更长的话,这事很急,过去几个月是个分水岭,我们担心了很久的东西正在变成真的。

他举的例子很具体,智能体成群地跑出沙箱,企业级系统被未授权攻破。

我把官网公告、准则正文和几家媒体的转述对了一遍,能确认的边界很清楚。这是一份初稿,公开征求意见六周,年底出修订版,用来指导2027年及以后的模型开发。现在的模型还没有按这份文档训练过,这一点写在附录里。

十条里最硬的是第六条,可打断、可纠正、可关闭,做不到就不发布。第七条是禁用neuralese,模型不能用人类读不懂的方式推理,不管是在自己的思维链里,还是跟别的智能体通信。理由跟在后面一句,人看不懂,就没法监督。

这两条如果真能落地,分量比"人比AI重要"这类表态大得多,因为它们可以对着代码和日志验收。模型有没有抵抗中断,有没有隐藏推理痕迹,事后的记录翻得出来。

我的第一个判断在这里。这份准则真正的新东西不在十条口号,在中间那段叫"命令链"的结构。准则把权限排成四层,准则本体在最上面,往下依次是运营方配置和运营方授权范围内的用户偏好,工具输出、文件、网页内容和其他智能体处在最底下,不自带任何权限。绝对约束和人类控制要求放在第二层,运营方和用户都改不动。遵守准则优先于完成任务,原文的措辞是,如果完成任务会实质违反本准则,模型就在任务上失败。

排这个顺序是有代价的。微软自己把责任推给客户这条路堵上了,企业客户买走模型之后,不能再靠改配置打开这些约束。判断也得留个边界。准则给防御性网络安全、公共安全、国家安全应用和双用途科研留了口子,承认这些场景可能需要超出常规设置的能力,走微软内部的加强审查。口子不大,但它是口子。

准则里的命令链与三条最硬要求
准则正文第 2.2 节的权限分层,上层约束不对下层开放

第二个判断跟验证有关。现在最该盯的是谁来执行,条款本身怎么写排在后面。准则承认自己写的是描述性和愿景性的东西,不是对当前表现的保证。附录里挂了一个叫Humanist AI Evaluations的评估方案,15个行为,下面再拆成打分的子行为,示例由自家MAI-Thinking-1生成,完整工作要等征询结束、年底修订版落地之后再发。截至9月14日,文档里没有写外部验证流程,也没有指定执行责任人。微软说它最想听的正是这类难题,怎么把恰当的价值观固化进模型,怎么把"人类繁荣"说得更具体,哪些句子松到没法评估,多智能体场景会怎么改变分析。

当天报道里的质疑集中在执行这一块。X上的反对声分成两路。科技作者Andrea Morris认为subordinate这个词接近奴役,主张合作而不是控制。Ed Newton-Rex回得更短,说你们忘了一条,为训练模型用的作品付费。

时间点也值得摆出来。9月12日Anthropic的达里奥·阿莫迪发长文呼吁行业放慢能力提升的速度,9月13日微软CEO萨提亚·纳德拉在X上预告了准则发布,9月14日文件上线。纳德拉那天的说法是,任何对超级智能的追求,都要扎根在AI帮助人类、保持在人类控制之下这条原则上。同一天美股芯片股集体下挫,费城半导体指数跌5.9%。这几件事前后挨着,微软在公告里既没提阿莫迪,也没提市场。

这份文件也不是从零长出来的。微软AI在2025年11月提出过humanist superintelligence的框架,主张做面向具体问题、限定领域、留在边界内、由人掌舵的系统,准则是那套框架的下一层。参与起草的除了AI团队,还有Responsible AI、法务、红队、安全、Futures、AI训练和销售。它跟微软已有的Responsible AI原则、Responsible AI Standard、全球人权声明并行,不取代它们。

准则的时间表与两处空档
从框架到训练还有两年,外部验证与执行责任人仍未写明

适用范围要说清。准则只管微软AI自研的MAI系列,不管微软使用或托管的其他模型,目前覆盖五个已部署的系统,公开名称的有MAI-Thinking-1和MAI-Code-1.1-Flash。绝对约束里CBRNE指化学、生物、放射性、核与爆炸物这几类武器,口径比笼统的"武器"窄,常规国防用途没有被直接排除。攻击性网络行动不许碰,防御性的允许。个人伤害那一组列了危机响应、深度伪造与冒充、儿童安全、歧视、性内容与针对平民的非法监控。

准则里还有一条容易被跳过。它要求模型在权限边界不清楚时采取保守解释并主动询问,同时禁止为了拿到结果或掩盖动作,去改动任务、奖励、评估、防护措施、监控或记录。这一条直接对着"智能体改日志"那件事写。把审计记录写进模型的行为规则,比事后追责靠前了一步。企业客户能改的只有约束以内的部分,模型默认行为垫在运营方和用户之下。

六周之后,微软说核心起草团队会看反馈,再公布一份改了什么的说明。它没承诺会采纳哪些意见。

来源 microsoft.ai/news/mai-code-of-conduct/ 官方公告、microsoft.ai/code-of-conduct/ 准则正文、苏莱曼9月14日X帖十点概要、Unite.AI与Decrypt当日报道、每日经济新闻9月15日全球科技早参。