我现在做了一个千牛的聊天留存工具,方案是 yolo + ocr + 简单算法来实现的。
标注的事,第一次干,也搜了一圈,最后手动的,一共 10 张图,眼都要标注瞎了。 现在设计的是 标注按照一组聊天区域 [用户名+时间+内容] ,这是四个标注区域。
因为素材太少,模型效果不太好,有时候时间或者发送人会识别不到,有时候是 yolo 识别的时间或者发送人区域有偏差,ocr 最后只能识别到一部分。
现在准备搞 50 张图,训练一次试试,想问问有没有可以自动标注的工具,实现如图这种标注逻辑?
我现在做了一个千牛的聊天留存工具,方案是 yolo + ocr + 简单算法来实现的。
标注的事,第一次干,也搜了一圈,最后手动的,一共 10 张图,眼都要标注瞎了。 现在设计的是 标注按照一组聊天区域 [用户名+时间+内容] ,这是四个标注区域。
因为素材太少,模型效果不太好,有时候时间或者发送人会识别不到,有时候是 yolo 识别的时间或者发送人区域有偏差,ocr 最后只能识别到一部分。
现在准备搞 50 张图,训练一次试试,想问问有没有可以自动标注的工具,实现如图这种标注逻辑?
1
simo OP |
2
afirefish 15h 22m ago
先训练一个小模型,然后用这个小模型去标注
|
3
afirefish 15h 22m ago
但是这个应该用不着 yolo 吧,直接 OCR 就能全搞了
|
4
jonty 15h 17m ago
直接写一个吧,这种程度的活就是一个 goal 的事
|
5
street000 15h 12m ago via Android
感觉三楼说的有道理,直接定位头像然后 OCR 就能完成了
|
6
NikoXu 15h 0m ago
LocateAnything
|
7
simo OP @afirefish
@street000 这个方案主要是为了省点 token ,用视觉模型来做肯定没问题。我当时想的是,需要知道一条消息(发送人、时间、内容),ocr 的话,识别内容没问题,但是识别出来发送人、时间不一定是一组,担心发送人识别成多个坐标多个内容,时间也是一样的担心。所以用 yolo 先分组,如果一组消息被截断(上下滚动条位置),那就滚动或者有新消息的时候,下一轮也能捕获到(不考虑在一个轮询内海量消息有一部分丢失的问题)。 你们说的纯 ocr 方案也考虑过,但不确定 ocr 识别内容的拆分逻辑在应对不同机器不同账号不同聊天对象是不是一致。 ![]() 比如图片这个,不知道用户名是识别成 想念你 + 64644133 还是一个完整的,还是想 + 念你 64 + 644133 时间那个也是一样的担心。内容区域的文本更容易出现这个情况 |
8
Muniesa 14h 50m ago
找个视觉能力强的大模型直接输出各个框的坐标和标签,50 张也花不了多少 token
|
11
simo OP @moooooooo 标注的话大模型效果不知道效果如何,你之前场景大概是哪种的标注?方便截图+马赛克看下么?
如果是实现方案,用 ocr ,然后大模型总结,可以;视觉模型也可以。我这就是为了省点钱,才定的 yolo + ocr |
12
barantt01 14h 23m ago
没太理解 直接获取网页元素不可以吗? 还是说你拿到的就是只有图片?
|
16
rockycc 7h 45m ago
可以试试 grounding dino
|