
视频多到看不完让 video-analyzer 替你把每个画面读成文字报告【免费下载链接】video-analyzerAnalyze videos using LLMs, Computer Vision and Automatic Speech Recognition项目地址: https://gitcode.com/gh_mirrors/vi/video-analyzer说实话你是不是也有这样的时刻收藏夹里躺着几十个下次一定看的视频网盘里存着讲了三小时的技术分享会议软件里沉淀着一堆没人回看的录像——你心里清楚这些内容有价值可就是没时间一帧一帧刷完。面对这种视频分析困境大多数人选择继续囤积少数人选择快进而今天我要安利的开源项目video-analyzer给出了第三种答案把看视频这件事直接外包给 AI。它调用视觉大模型如 Llama 3.2 Vision逐帧解读画面再用 Whisper 模型转录音频最终产出一份完整的文字分析报告。一句话概括它的价值让视频从只能看变成可以搜、可以读、可以提炼。 拆开看看一台看、听、想三段式的分析机器如果你以为它只是简单抽几帧丢给大模型那就太小看它了。video-analyzer 的内部其实是一条精密流水线官方架构图把它讲得很清楚整条链路分成三个阶段各司其职环环相扣。第一段先看和听——关键帧提取与音频转录视频本质上是连续画面的高速播放逐帧分析的成本高到离谱所以第一段的核心任务是采样用 OpenCV 智能挑选信息量最大的关键帧——画面变化越大、越能代表场景转折的帧越容易被选中而不是机械地每隔几秒截一张。与此同时音频被送入 OpenAI Whisper 模型做转录生成带时间戳的逐字稿。值得称赞的是它还内置了音频质量检测某段录音太糊、置信度低于阈值时系统会主动标记而不是硬着头皮瞎猜。这些参数都集中在video_analyzer/config/default_config.json中比如frames.per_minute控制每分钟采样频率audio.quality_threshold控制质量门槛想调敏感度随时改。第二段让大模型逐帧阅读接下来关键帧被送入视觉大模型。这里有个非常聪明的设计分析每一帧时模型不是孤立地看而是会收到之前所有帧的描述作为上下文——就像一个人边看视频边做笔记每翻一页都知道前面讲了什么从而保证叙事的连贯性杜绝上一帧说红衣服、这一帧说蓝衣服的乌龙。这段逻辑由video_analyzer/prompts/frame_analysis/frame_analysis.txt驱动prompt 明确要求模型区分场景变化动作细节新出现的信息和与前帧的连续性产出的不是干巴巴的标签而是有逻辑的观察笔记。第三段串珠成线输出完整故事所有帧的笔记连同转录文本汇总后进入最后的视频重建环节。此刻模型像一位看完素材的剪辑师把零散观察整合成连贯的视频描述开头发生了什么、中间经历了哪些转折、结尾定格在哪里。对应模板是video_analyzer/prompts/frame_analysis/describe.txt两份 prompt 都可以按你的需求自由改写。 五分钟跑通你的第一次分析上手门槛比你想象的低。先拿到源码并安装git clone https://gitcode.com/gh_mirrors/vi/video-analyzer cd video-analyzer python3 -m venv .venv source .venv/bin/activate pip install .然后根据你的设备状况二选一即可路线 A完全本地运行新手首选只需安装 Ollama 并拉取视觉模型全程不需要 API Key隐私也最安全ollama pull llama3.2-vision video-analyzer demo_video.mp4路线 B云端 API 跑追求速度与规模机器配置一般或要批量处理视频时可以接入任意 OpenAI 兼容接口甚至能用免费的视觉模型video-analyzer demo_video.mp4 --client openai_api \ --api-key 你的密钥 --api-url https://openrouter.ai/api/v1补一个硬件参考本地跑视觉大模型建议至少 16GB 内存32GB 更稳有 12GB 显存的 GPU 或 32GB 内存的 Apple 芯片会从容很多。 一份 JSON装下整个视频的灵魂分析完成后output/analysis.json就是你的全部成果包含四层内容技术元数据用的什么模型、抽了多少帧、音频语言是什么方便追溯复现转录文本带时间戳的对话逐字稿可直接当字幕或检索索引逐帧分析每个关键帧的观察笔记时间轴上的每个节点都有据可查视频总描述最终的连贯总结也就是你读完整个视频的浓缩版。翻一翻项目自带的示例docs/sample_analysis.json你会发现逐帧笔记细致到人物左手叉腰、右手自然下垂最终总结甚至会交代地面铺着木屑、主角始终背对镜头、值得关注的是她何时会从桶里拿起东西。这种颗粒度足够支撑你去搜索、引用、二次加工。️ 进阶玩法从能用到好用跑通基础流程后下面三个技巧能让体验再上一个台阶① 用配置代替反复敲参数命令行参数、用户配置、默认配置形成三级级联优先级从高到低。把常用设置写进config/config.json之后每次只需一句video-analyzer video.mp4。② 断点续跑节省算力流程分三阶段用--start-stage 2可以从帧分析阶段直接开工——帧已抽好、只改了 prompt 时完全不必重跑第一阶段。③ 让 prompt 自动进化觉得默认输出风格不对味试试配套工具video-analyzer-tune。它基于 DSPy 的 MIPROv2 优化器你先手动把几份输出改成理想答案它会自动反推出更优的 prompt 指令并生成新文件替换后主程序不受任何影响等于给分析引擎装了个自动调参的大脑。️ 新手最容易踩的三个坑忘了装 FFmpeg音频转录强依赖它九成报错都源于此务必提前装好本地跑视频卡到怀疑人生别硬扛用--max-frames 30限制帧数或干脆换云端路线长视频一把梭先用--duration 60处理前 60 秒验证效果确认满意再全量跑避免浪费算力。写在最后回到开头的场景那些囤积的视频其实不缺价值缺的只是一个替你看的人。video-analyzer 用视觉大模型加语音识别这对组合把数小时的人工观看压缩成几分钟的自动分析让每段视频都能沉淀为可检索、可提炼、可复用的文字资产。别让收藏夹继续吃灰了——找一段你早就想看却没时间的视频跑一次让 AI 把精华替你讲出来。【免费下载链接】video-analyzerAnalyze videos using LLMs, Computer Vision and Automatic Speech Recognition项目地址: https://gitcode.com/gh_mirrors/vi/video-analyzer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考