Show HN:我在24小时内用RTX 4090和本地ML模型索引了37小时的视频
继之前在M1 Max上运行桌面应用后,作者这次使用搭载NVIDIA RTX 4090(24GB显存)的Docker自托管版本,在24小时内完成了37小时视频的索引处理。内容包括长篇播客、编程教程、屏幕录制及GoPro户外拍摄等复杂场景。相比M1 Max,NVIDIA处理速度明显更快——最长一段3小时12分的直播视频仅用1小时52分完成索引(分析4612帧)。
背景速读
- 作者是一位独立开发者,正在展示他自建的个人视频索引项目,能自动对大量本地视频进行人脸识别、文字提取、场景分析等,生成可搜索的元数据。
- 前一篇 HN 帖子(30 天前)用了 Mac M1 Max,这次改用 Docker 容器 + NVIDIA RTX 4090 显卡(24GB 显存)自托管版本,对比两种硬件的处理速度。
- 测试数据包括 37 小时的视频:播客对谈(多张人脸)、编程教程(屏幕文字)、录屏和 GoPro 户外运动镜头——覆盖了常见的视频分析难点。
- 最长的一支 3 小时 12 分钟的直播视频,只用 1 小时 52 分钟就完成了索引(分析了 4612 帧),说明本地大模型+消费级显卡已能高效处理数小时的视频内容。
- 这个项目反映的趋势:过去这类视频索引依赖云端 API(如 Google Video Intelligence API),成本高且隐私受限;现在消费级硬件(RTX 4090 ≈ 1600 美元)加上开源 ML 模型,个人开发者可以在本地完成类似工作。他还在 GitHub 上分享了完整的 JSON 处理结果供社区参考。