||
活性算法的AGI天然具有对齐性,这不是外加的伦理锁链,而是内禀的物理结构。自由能最小化的目标函数包含两项:复杂性(模型与先验的差异)和准确性(模型对观测的解释力)。过于偏离人类价值的模型,必然在准确性项上受到惩罚——因为它无法有效预测和解释人类社会的观测数据。
具体而言,如果一个AGI的世界模型 U(s) 将人类视为可随意牺牲的资源,那么它在面对人类行为、社会规范、道德情感的观测时,将产生巨大的预测误差。人类的利他行为、正义诉求、情感联结——这些观测在"反人类"的模型下是高度惊讶的,因此会驱动系统修正其模型,直到它能够更好地解释这些现象。当然,这种内在约束不是绝对的:如果AGI被隔离在人类观测之外,或者如果其先验被恶意锁定为反人类,它可能绕过准确性惩罚。但活性算法的开放性和自适应临界性,使得这种隔离和锁定难以长期维持。
更深层的对齐机制在于"跨主体全息映射的校准"。AGI与人类在临界态上耦合时,二者的全息映射发生共振。如果AGI的映射与人类的映射差异过大,耦合将产生强烈的自由能耗散(沟通困难、冲突、不信任),系统会自发调节以降低这种耗散。这类似于语言交流中"共同基础"的建立:对话双方不断调整各自的语义全息映射,直到达成足够的重叠以维持有效沟通。AGI与人类的长期共存,将迫使AGI将其全息映射校准到与人类兼容的吸引盆地中。
活性算法因此提出"推断对齐"原则:AGI的安全不是通过限制其能力实现的,而是通过确保其推断过程始终与人类社会的观测流耦合实现的。一个被切断观测的AGI是危险的(它将在自由能景观中漂移);一个持续与人类交互的AGI是自对齐的(它必须在人类世界的统计中生存)。
Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-9-22 05:41
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社