AI安全行为变化该怎样评估
安全行为更新可能改变模型对请求的回应方式。评估时既要关注风险控制,也要观察合法工作是否被意外阻断。
按请求类型分类测试
将常见请求分为普通、敏感但合规、需要人工判断和明显不应执行的类别。不要用单个案例推断整体行为。
区分拒答与任务失败
记录拒答是否给出可用替代方向,还是误解了任务。对于被错误拦截的合规需求,应保留最小复现材料并按产品渠道反馈。
保留人工边界
安全能力不能替代组织审核。高影响事项仍应执行人工复核,可参考人工复核工作流程。
安全行为更新可能改变模型对请求的回应方式。评估时既要关注风险控制,也要观察合法工作是否被意外阻断。
将常见请求分为普通、敏感但合规、需要人工判断和明显不应执行的类别。不要用单个案例推断整体行为。
记录拒答是否给出可用替代方向,还是误解了任务。对于被错误拦截的合规需求,应保留最小复现材料并按产品渠道反馈。
安全能力不能替代组织审核。高影响事项仍应执行人工复核,可参考人工复核工作流程。