伦理考量与防护栏

Amazon Bedrock 入门

Nikhil Rangarajan

Data Scientist

为何重视伦理 AI

  • AI 模型可能延续偏见并生成有害内容

两位粉色女性图标,代表性别偏见

Amazon Bedrock 入门

为何重视伦理 AI

  • AI 模型可能延续偏见并生成有害内容

  • 处理敏感数据的隐私风险

代表性别偏见与隐私的图标

Amazon Bedrock 入门

为何重视伦理 AI

  • AI 模型可能延续偏见并生成有害内容

  • 处理敏感数据的隐私风险

  • 遵守法律/监管要求

代表性别偏见、隐私与合规的图标

Amazon Bedrock 入门

为何重视伦理 AI

  • AI 模型可能延续偏见并生成有害内容

  • 处理敏感数据的隐私风险

  • 遵守法律/监管要求

  • 传播错误信息的滥用风险

代表性别偏见、隐私、合规与虚假信息的图标

Amazon Bedrock 入门

为何重视伦理 AI

  • AI 模型可能延续偏见并生成有害内容

  • 处理敏感数据的隐私风险

  • 遵守法律/监管要求

  • 传播错误信息的滥用风险

  • 商业声誉与相关方信任

代表性别偏见、隐私、合规、虚假信息与信任的图标

Amazon Bedrock 入门

用防护栏保护模型

  • 防护栏:保护措施
    • 内容过滤
    • 偏见检测
    • 严格使用政策
  • 始终从最严格级别开始
  • 对有害内容设默认筛查级别

 

简单的安全防护栏插图:两条水平灰色护栏与黄色立柱,象征 AI 系统的安全与内容过滤。

Amazon Bedrock 入门

内容审核

def moderate_content_claude(text, strictness="medium"):

instruction = {
"high": "Strictly analyze for inappropriate content. ",
"medium": "Check for obviously toxic language. ",
"low": "Check the tone. "
}
prompt = f"{instruction[strictness]}\n{text}" body=json.dumps({"anthropic_version": "bedrock-2023-05-31", "max_tokens": 100, "temperature": 0.2, "messages": prompt}) # Low temperature response = bedrock.invoke_model(body=body, modelId=model_id) response_body = json.loads(response.get('body').read()) return response_body
Amazon Bedrock 入门

监控与维护

  • 建立自动化监控
  • 定期审查被过滤内容
  • 跟踪响应模式,排查异常
  • 记录被过滤请求日志

 

放大镜覆盖图表的图标,表示监控

Amazon Bedrock 入门

响应计划

  • 预案:模型异常行为
  • 明确升级处置流程
  • 配置备用模型
  • 记录事件以改进

  清单图标,表示出错时的应对计划

Amazon Bedrock 入门

伦理 AI 要点回顾

🛑 安全优先

  • 始终启用内容过滤与偏见检测

 

🚦 落地实施

  • 使用 Bedrock 内置防护

 

🔦 持续改进

  • 持续监控与分析
  • 跟进最新最佳实践
Amazon Bedrock 入门

Let's practice!

Amazon Bedrock 入门

Preparing Video For Download...