Chat GPT也能看视频了?开源神器让AI真正理解画面

admin 商品展示 24

编辑 | 林芯

刚刚, 有一个开源项目, 它的名字叫做claude-real-video, 这个项目, 宣称能够让任何大语言模型, 都进行‘观看’视频这样的行为。

Chat GPT也能看视频了?开源神器让AI真正理解画面-第2张图片-开云手机入口官网下载-开云app官方最新下载--V3.6.9

这项项目没开展新视频模型的训练工作, 也不存在复杂的视觉推理框架, 其star数量提升速率极为迅速!

Chat GPT也能看视频了?开源神器让AI真正理解画面-第3张图片-开云手机入口官网下载-开云app官方最新下载--V3.6.9

AI于分析YouTube视频之际, 难道真的是将那视频给完整地“看”了一回吗?

对于时长为几十分钟的视频来讲, 要是将每一帧都传送给模型的话, 不但 Token 成本会极其高昂,并且还会远远超过模型所能处理的上下文长度了。

所以, 不管是 Claude, 还是 GPT, 又或者是 Gemini, 当面临一个视频链接之时, 它们更为倚仗的是视频字幕, 而非对画面的切实理解。

也就是说,模型听到了声音,却没有真正看到画面。

那么这个项目是怎么做到的?

核心思路:不是抽帧更多开云app官方最新下载地址,而是抽帧更聪明

claude-real-video的思路并非复杂, 它并未尝试让Claude播放视频, 而是在本地先行完成一次“视频理解预处理”。

先是, 凭借yt-dlp或者本地文件获取视频源, 接着, 运用ffmpeg进行场景检测,且提取关键帧, 还要对图片去重, 与此同时, 利用Whisper或者视频自带字幕生成文字转录。而后, 打包成为包含关键帧图片的frames/, 还有转录文本的transcript.txt, 以及清单文件的MANIFEST.txt这三样东西。

最终, 将这些各类文件一并交付给Claude、GPT以及Gemini , 请注意: 此三者并非直接对视频进行读取操作, 而是于同一上下文环境里, 借助并同时读取视频内容中的字幕、有关每组场景被精确抓取的关键帧对应图片以及针对每张图片所匹配的时间轴详细信息来达成后续工作!

这样一来,它获得的信息远比单纯依赖字幕丰富得多。

拆解项目五大亮点,每一步都在省 Token

最大的亮点:不是每秒截图,而是“按场景提帧”

那种传统的视频抽帧法子大抵是固定频率来着, 像每秒抽一张这种情况, 要是一个PPT页面停驻了30秒, 那就会获取到30张近乎全然一样的图片, 然而如此这般既耗费Token, 而且还不具备任何价值。

claude-real-video 所运用的是, Scene Detection(场景检测)。

只有当画面真正发生变化时开云真人app,开云真人app地址,才保存新的关键帧。

于主页, 存有一案例, 此案例为同样时长是58秒的视频片段, 该视频片段固定1fps采样率, 此采样率下等于58帧。claude - real - video保留了实际不同的26帧, 而grid对这些帧进行处理, 将它们打包成3个联系表。其token数量更少, 然而却并未遗漏任何信息。

Chat GPT也能看视频了?开源神器让AI真正理解画面-第5张图片-开云手机入口官网下载-开云app官方最新下载--V3.6.9

第二个亮点:自动删除重复图片

模型没必要反复去阅读那相同的画面 , 所以呢 , 项目还加进了图片去重的机制 , 这个机制是通过滑动窗口去比较相邻图片的相似度 , 然后只保留真正发生了变化的内容。

比如说, 有一百张图片, 最终大概只会留下三十张。就Claude而言, 理解的效果几乎没什么改变, 然而Token的消耗却大幅地降低了。

第三个亮点:让画面和字幕真正对应起来

项目会生成一个 MANIFEST 文件, 将每一张关键帧对应的时间戳与每一段字幕的时间戳进行关联, 如此一来, 模型面对的便不再是一堆散乱的图片, 而是能够清楚知晓“某句话说出口的时候, 画面上正好是哪一张图”。

第四个亮点:关键帧并不等于视频

新版本新增了一个很聪明的设计:“关键帧并不等于视频。”

Chat GPT也能看视频了?开源神器让AI真正理解画面-第6张图片-开云手机入口官网下载-开云app官方最新下载--V3.6.9

因为单独的一张图片仅仅能够呈现某一个特定的时刻, 众多的动作, 那些动画, 还有 UI 的变化, 全都出现在延续下来的连续好几帧的中间位置。

于是, 项目迅速又推出来了崭新的 Grid 功能, 它能够将连续的 9 张关键帧拼接成一张图片 , 以此让模型一次性读取到一段连贯的画面序列, 而非零零散散的静态截图。这般做还有一个额外的益处 , 原本前面所提及的 26 张关键帧 , 能够进一步被压缩成 3 张图 , Token 消耗又降低了一些。

Chat GPT也能看视频了?开源神器让AI真正理解画面-第7张图片-开云手机入口官网下载-开云app官方最新下载--V3.6.9

第五个亮点:不只是总结视频,而是带着目标去分析

当前处于0.3.0版本当中, 增添了一个全新参数why, 能够于命令行里直接面向工具传达‘你为什么要看这段视频’这般内容, 例如:

crv "https://youtu.be/..." --why "find the pricing strategy" --kb ~/notes

此外, 还有一个与之匹配的kb参数, 它能够将分析得出的结果, 保存至你自身的知识库, 也就是notes文件夹里面, 而且是以日期来进行命名的, 如此一来, 结果便不会因为crv-out目录遭到清理, 从而随之消失了。

免费版之外,还有一个付费的 crv Pro

另外还有一点, claude-real-video开源免费的这一部分所做的事情, 是“让模型能够看到视频”, 这具体而言, 就是像之前所说的那样, 进行场景抽帧, 进行去重操作, 进行拼图工作, 进行时间轴对齐。项目主页还在推行一款需一次性付费(19美元)的crv Pro, 其主打“使模型能够看懂视频”。它能识别镜头运镜方式(像是固定机位、摇镜、推拉、手持)。它可以统计剪辑节奏。它还会生成一份画面之外的“感知时间轴”, 用以记录仅靠看画面无法推断出的信息, 像手势、表情、语气变化、情绪、非语音的声音事件。另外还会配备一份面向短视频创作者的分析报告等。

Chat GPT也能看视频了?开源神器让AI真正理解画面-第8张图片-开云手机入口官网下载-开云app官方最新下载--V3.6.9

网友:应该去掉项目名字里的Claude!

对于这个开源工具开云app在线入口,网友的评论大多分两种。

一种是赞同项目的思路:

“这看起来很酷,但是应该去掉名字里的Claude。”

“我认为这比单纯的 LLM 相关应用更有用。”

也有网友对这个项目的一些技术方面提出疑问:

我所拥有的运用ffmpeg场景检测的经验表明其处于不稳定的状态, 它存在着有时能够发挥作用的情况, 然而绝对不是那种可靠的, 是一种虽偶尔好用但可靠性差别的存在。

Chat GPT也能看视频了?开源神器让AI真正理解画面-第9张图片-开云手机入口官网下载-开云app官方最新下载--V3.6.9

写在最后

过去,我们总希望等待模型原生支持更长的视频输入。

而这个项目提供了另一种路线:不是升级模型,而是升级上下文。

原本被提前组织成最适合理解形式的信息, 被模型接收了。未来, 不管是视频、网页、代码仓库, 还是长文档, 有可能我们都无需等待模型“原生支持”。

只要可以将信息构建成模型颇为容易理解的上下文, 同样能够取得接近原生能力的成效。

标签: AI视频理解 开源项目 场景检测 关键帧提取 上下文组织

发布评论 0条评论)

还木有评论哦,快来抢沙发吧~