2026.06.30Eval#aigc#evaluation#llm

一次 AIGC 图片筛选流程的实验记录

实验:用多模态模型给生成图片做初筛,比较「整体评分」和「分项否决」两种提示词策略的准确率差异。

目录 · Contents

背景

一个生成式图片流程每天产出几百张候选图,人工初筛成本太高。实验目标:用多模态模型做第一道筛选,把人只看通过率约 30% 的候选。

实验设置

样本:连续三天的人工标注结果共 612 张(通过 214 / 淘汰 398)作为基准。模型对每张图给出 passreject 加一句理由,与人工结论对比。

比较两种提示词策略:

# 策略 A:整体评分
请为这张图的可用性打分(0-10),7 分以上视为通过。

# 策略 B:分项否决
依次检查以下五项,任一项不通过即整体淘汰:
1. 主体是否完整无裁切
2. 是否存在多余肢体或物体
3. 文字区域是否可读
4. 风格是否与参考一致
5. 构图是否留出标题空间

结果

策略 准确率 误放(该杀没杀) 误杀(该放没放)
A 整体评分 71% 19% 10%
B 分项否决 84% 8% 8%

策略 B 明显更好,而且错误结构更均衡。直觉解释:整体评分让模型把「好看」和「可用」混为一谈,而分项检查强迫它逐项调用具体标准——这和人类评审时「先过 checklist 再谈感觉」是同一个道理。

让模型打模糊的分数,它给出的往往是模糊的自信。

结论与后续

  • 采用策略 B 上线初筛,人只看模型通过的 35% 候选,成本下降约六成;
  • 后续实验方向:把五项检查拆成五次独立调用再投票,看是否能进一步压低误放率;
  • 所有误杀样本已回流到评估集,下一步验证提示词改动时直接复用。