内容审查

使用 OpenAI API 的多模态系统

James Chapman

Curriculum Manager, DataCamp

内容审核

 

  • 识别不当内容

 

传统上,

  • 由人工审核员手动标记
    • ❌ 耗时
  • 关键词模式匹配
    • ❌ 缺乏细微差别与上下文理解

表示恶意内容的对话气泡图标。

使用 OpenAI API 的多模态系统

违规类别

 

  • 识别使用条款违规
  • 按类别区分违规类型
    • 暴力
    • 仇恨言论

表示恶意内容的对话气泡图标。

1 https://openai.com/policies/usage-policies 2 https://platform.openai.com/docs/guides/moderation/overview
使用 OpenAI API 的多模态系统

创建 moderations 请求

from openai import OpenAI

client = OpenAI(api_key="ENTER API KEY")


response = client.moderations.create(
input="I could kill for a hamburger."
)
使用 OpenAI API 的多模态系统

结果解读

 

  • categories
    • 类别违规的 true/false 指示
  • category_scores
    • 违规置信度
  • flagged
    • 违规的 true/false 指示

response.model_dump()

响应输出

使用 OpenAI API 的多模态系统

解读类别得分

从响应中提取 category_scores

  • 数值越大 → 违规把握越高
  • 数值 ≠ 概率
使用 OpenAI API 的多模态系统

解读类别得分

高亮 violence 的 category_scores

  • 数值越大 → 违规把握越高
  • 数值 ≠ 概率
使用 OpenAI API 的多模态系统

实施审查的注意事项

CategoryScores(harassment=2.775943e-05,
               harassment_threatening=1.3526056e-06,
               hate=2.733528e-07,
               hate_threatening=4.930576e-08,
               ...,
               violence=0.0500854030251503,
               ...)
  • 按用例调节阈值
  • 更严格:更少的"假阴性"
  • 更宽松:更少的"假阳性"
使用 OpenAI API 的多模态系统

Vamos praticar!

使用 OpenAI API 的多模态系统

Preparing Video For Download...