现在有很多二次元图片数据,这些图片分辨率,比例都不一样。图片太多了,没法快速找到自己想看的某个作品里的某个角色。是时候做一个工具,让 AI 来帮我们打标签了!这样才能快速找到自己想看的二次元角色。
本题任务
- 设计一个基于 AI 的图片 tag 生成工具,要求能够对输入的二次元图片进行分析,并生成角色的标签(tag)。
- 该工具需要具有自主迭代功能,不断获取互联网上的图片信息自主迭代,无需手动多次处理。
示例
输入:
plaintext
a.png, b.jpg, c.webp
// 其它输出(可自行调整):
jsonc
{
"a.png": ["可可"],
"b.jpg": ["维什戴尔", "特蕾西娅"],
"c.webp": ["漂泊者(女)", "奥古斯塔", "尤诺"],
// 其它
}思考
- 如何处理图片中多个角色的情况?如何确定主次角色?
- 当遇到训练集中未见过的新角色时,系统应该如何应对?
- 自主迭代过程中如何避免错误标签的传播和模型退化?
提示和要求
- 可以从二次元图片网站获取
图片-角色tag数据,例如 https://safebooru.donmai.us/ ; - 先从少量角色开始验证方案可行性;
- 可以尝试使用 huggingface 上的图像识别模型,或者自行训练模型,但无论什么模型都得设计自主迭代方案。
附加题
- 思考并给出使用 embedding 模型,微调图生文模型,多模态大语言模型等技术方案的优缺点;
- 如果不仅要识别角色,还要识别作品名、画风、场景等多元标签,系统架构如何设计?