组队
ai-based-picture-tag-generation
2025

基于 AI 的图片 tag 生成

二次元蒸鹅心!哦我也是二次元啊,那没事了~

人工智能数据科学自主迭代

现在有很多二次元图片数据,这些图片分辨率,比例都不一样。图片太多了,没法快速找到自己想看的某个作品里的某个角色。是时候做一个工具,让 AI 来帮我们打标签了!这样才能快速找到自己想看的二次元角色。

本题任务

  • 设计一个基于 AI 的图片 tag 生成工具,要求能够对输入的二次元图片进行分析,并生成角色的标签(tag)。
  • 该工具需要具有自主迭代功能,不断获取互联网上的图片信息自主迭代,无需手动多次处理。

示例

输入:

plaintext
a.png, b.jpg, c.webp
// 其它

输出(可自行调整):

jsonc
{
  "a.png": ["可可"],
  "b.jpg": ["维什戴尔", "特蕾西娅"],
  "c.webp": ["漂泊者(女)", "奥古斯塔", "尤诺"],
  // 其它
}

思考

  • 如何处理图片中多个角色的情况?如何确定主次角色?
  • 当遇到训练集中未见过的新角色时,系统应该如何应对?
  • 自主迭代过程中如何避免错误标签的传播和模型退化?

提示和要求

  1. 可以从二次元图片网站获取图片-角色tag数据,例如 https://safebooru.donmai.us/
  2. 先从少量角色开始验证方案可行性;
  3. 可以尝试使用 huggingface 上的图像识别模型,或者自行训练模型,但无论什么模型都得设计自主迭代方案。

附加题

  1. 思考并给出使用 embedding 模型,微调图生文模型,多模态大语言模型等技术方案的优缺点;
  2. 如果不仅要识别角色,还要识别作品名、画风、场景等多元标签,系统架构如何设计?
出题人:邺余