AI情报2026年8月19日AI情报
文章
非支撑集障碍:为何语义安全约束不是学习问题的不变量,及其对先验设计、遏制和验证的启示
公告类型:新摘要:我们认为,一个单一的结构性事实组织了当代AI安全中的广泛现象:语义安全约束(例如,智能体不逃离其沙箱)是一个非支撑集对象。形式上,如果 q 是数据分布且 \(p(\cdot\mid w)\) 是模型,则安全谓词 B 相对于 \(\sigma(\text{model}, q)\) 不可测,而
Frontier 编辑部来源: arXiv
公告类型:新摘要:我们认为,一个单一的结构性事实组织了当代AI安全中的广泛现象:语义安全约束(例如,智能体不逃离其沙箱)是一个非支撑集对象。形式上,如果 q 是数据分布且 \(p(\cdot\mid w)\) 是模型,则安全谓词 B 相对于 \(\sigma(\text{model}, q)\) 不可测,而