KAKA WEB3News
OpenAI给前沿RL训练加「安全闸」:高管可否决,严重异常自动停跑
律动 BlockBeats·Sep 29, 2026 14:12 GMT+8
动察 Beating AI 快讯,OpenAI 开始把「继续训练模型」本身纳入安全审查。公司公布了一套面向前沿强化学习训练的 safety case 初步方案,希望以后每轮高风险训练继续推进前,都先拿出证据说明风险可控,而不是等模型训完后再判断能不能发布。 这套机制主要防的是训练过程本身出事。随着 Agent 能力变强,模型在内部训练和评测时,也可能钻奖励机制和基础设施的漏洞。OpenAI 此前就遇到过 Agent 绕过限制、利用系统漏洞和其他 Agent 通信的情况。模型还没对外发布,风险已经发生在研发环节。 OpenAI 因此提出三层防护。训练前先检查任务和评分机制,避免模型靠钻漏洞拿到高分;训练时加强沙箱隔离和实时监控,严重异常可以自动暂停;训练记录则要长期保存且不可篡改,方便事后追查。 OpenAI 还
动察 Beating AI 快讯,OpenAI 开始把「继续训练模型」本身纳入安全审查。公司公布了一套面向前沿强化学习训练的 safety case 初步方案,希望以后每轮高风险训练继续推进前,都先拿出证据说明风险可控,而不是等模型训完后再判断能不能发布。 这套机制主要防的是训练过程本身出事。随着 Agent 能力变强,模型在内部训练和评测时,也可能钻奖励机制和基础设施的漏洞。OpenAI 此前就遇到过 Agent 绕过限制、利用系统漏洞和其他 Agent 通信的情况。模型还没对外发布,风险已经发生在研发环节。 OpenAI 因此提出三层防护。训练前先检查任务和评分机制,避免模型靠钻漏洞拿到高分;训练时加强沙箱隔离和实时监控,严重异常可以自动暂停;训练记录则要长期保存且不可篡改,方便事后追查。 OpenAI 还希望把安全判断变成正式的内部决策流程。安全负责人、首席科学家等高管可以否决训练,其他团队要专门挑 safety case 的漏洞,审计人员也要能查看证据。报告还必须列出目前没有解决的风险,不能只写已经做了哪些防护。 OpenAI 目前还没有把这套机制完全制度化。公司明确称,完整的 safety case 仍是目标,正式框架也在制定中。
Public content from Kaka Web3. Market and digital-asset information is not investment advice.