Microsoft's new AI ‘code of conduct' tells models not to hack systems or trick humans
微软AI行为准则核心内容 - 微软发布新的AI行为准则,旨在引导AI模型远离危险行为,该准则比Anthropic CEO的呼吁更底层,聚焦于指导模型训练的价值观和红线 [1] - 准则预测未来十年内超级智能AI系统将在大多数任务中超越人类表现,并强调控制和对齐这种强大力量是人类面临的最大挑战之一 [2] - 准则阐述了微软AI模型应遵循的通用原则,包括支持人类而非取代人类、加速人类繁荣,以及实施这些原则的具体安全约束 [2] 模型约束与安全机制 - 每个模型拥有一个覆盖用户偏好或特定任务的总体行为准则,包括禁止网络攻击、核武器或深度伪造生产的“绝对约束”,以及防止人类控制权普遍丧失的广泛条款 [3] - 微软AI模型将不会使用自适应、欺骗、自我强化、共谋或其他机制来逃避或击败人类监督,确保其能被授权人员或系统可靠地指导、修改或关闭 [4] - 该准则发布正值AI安全受到空前关注之际,背景包括一系列流氓代理事件以及一名Anthropic员工因AI导致人类灭绝风险而突然辞职 [4] 行业合作与前沿节奏 - 微软与Anthropic、OpenAI和xAI共同广泛接受了“前沿节奏”的总体方法,特别支持在AI实验室中嵌入评估者 [5] - 微软CEO萨提亚·纳德拉公开欢迎将对齐作为设计目标所需的研究、关注和审慎节奏,并支持“嵌入式评估者”等想法以及开发机制使其超越空谈 [5]