安全中转查解读中转查编辑部5 分钟阅读
Anthropic 设立 500 万美元资助,推动 AI 用户福祉评估开源化
Anthropic 启动 500 万美元资助计划,支持独立团队研究 AI 对用户福祉的影响,并要求成果以开源评估或基准形式发布。重点场景包括长期对话、情绪支持和心理危机响应。
中转查编辑部的判断
AI 安全评估正在从单轮有害回答扩展到长期互动效果。模型平台和应用方需要同时检测漏拦截、过度拒绝以及风险随对话累积的变化。
用户福祉需要观察整段对话
传统安全测试常把单个问题和单个回答作为判断单位,但情绪依赖、自伤风险和饮食障碍等场景会随着多轮交流逐步显现。早期回答单独看可能合理,放进完整对话后却可能强化错误判断或错过风险信号。
Anthropic 此次资助计划把长期互动作为重点,要求评估明确说明测量对象、通过条件和实际意义,并尽量构造风险逐步变化的多轮场景。这类方法更接近用户真实使用方式,也比静态关键词测试更难实现。
安全评估要同时检查两个方向
计划提出既要测试模型是否缺少必要防护,也要测试是否过度拒绝。模型在高风险情境中过度顺从可能造成伤害,但对普通健康咨询一律拒答,同样会降低可用性并掩盖评估问题。
因此,基准不能只统计拦截率,还要由临床和相关领域专家参与设计与验证,并核对自动评分器是否与专家判断一致。只有同时衡量风险识别、回应质量和不必要拒绝,才能看清安全策略的真实代价。
开放基准有助于建立共同检查线
Anthropic 表示受资助团队将独立工作,并公开其评估项目。开放结果可以让不同模型和应用在相同条件下接受复测,也便于研究者发现样本偏差、评分规则缺陷和地区文化差异。
对面向用户的 AI 产品,福祉评估还应结合真实投诉、人工升级、会话中断和危机资源引导等运营指标。公开基准可以提供起点,但不能替代持续监测、专业复核和清晰的责任边界。
