纸笔准备好了吗?visAware 的字幕识别是这样的
当然,视频中的硬字幕,可以利用 OCR 识别并读出来!但是,你是怎么找到字幕位置的呢?
当然,你可以向左向右,微调,再微调,下三分之一,上三分之一,再,然后呢,还是继续,微调……
搬好小板凳,拿好小本本。 拒绝“手动挡”,visAware 是这么做的:
- 采集画面,交给支持视觉的大语言模型。
- 要求结构化返回是否有字幕:如果有,提供定位点坐标;如果没有,则描述画面。
- 划定参考点,裁剪并校准字幕区域。
- 锁定后持续识别,涉及到去重、过滤等步骤。
以下是一个Demo:展示了识别无字幕画面给出具体提示,有字幕画面精准定位,并支持区分不同语言。
AI 就是需要在这些小的场景发挥作用,它可能很小,小到主流应用场景完全 cover 不到! 在 Coding 越来越容易的今天,珍贵的是什么,我认为是有趣的想法,是持续维护,是开源和协作,,如果,你受到了启发,不要闷声发大财,visAware 和 NVDA 都是开源项目,若现在的你没有条件做贡献,至少可以保护开源项目。