一次 AIGC 图片筛选流程的实验记录
实验:用多模态模型给生成图片做初筛,比较「整体评分」和「分项否决」两种提示词策略的准确率差异。
背景
一个生成式图片流程每天产出几百张候选图,人工初筛成本太高。实验目标:用多模态模型做第一道筛选,把人只看通过率约 30% 的候选。
实验设置
样本:连续三天的人工标注结果共 612 张(通过 214 / 淘汰 398)作为基准。模型对每张图给出 pass 或 reject 加一句理由,与人工结论对比。
比较两种提示词策略:
# 策略 A:整体评分
请为这张图的可用性打分(0-10),7 分以上视为通过。
# 策略 B:分项否决
依次检查以下五项,任一项不通过即整体淘汰:
1. 主体是否完整无裁切
2. 是否存在多余肢体或物体
3. 文字区域是否可读
4. 风格是否与参考一致
5. 构图是否留出标题空间
结果
| 策略 | 准确率 | 误放(该杀没杀) | 误杀(该放没放) |
|---|---|---|---|
| A 整体评分 | 71% | 19% | 10% |
| B 分项否决 | 84% | 8% | 8% |
策略 B 明显更好,而且错误结构更均衡。直觉解释:整体评分让模型把「好看」和「可用」混为一谈,而分项检查强迫它逐项调用具体标准——这和人类评审时「先过 checklist 再谈感觉」是同一个道理。
让模型打模糊的分数,它给出的往往是模糊的自信。
结论与后续
- 采用策略 B 上线初筛,人只看模型通过的 35% 候选,成本下降约六成;
- 后续实验方向:把五项检查拆成五次独立调用再投票,看是否能进一步压低误放率;
- 所有误杀样本已回流到评估集,下一步验证提示词改动时直接复用。