我不看视频了,交给agent看
昨天刷 GitHub 的时候,我看到一个挺有意思的项目,叫 `claude-video`。
它做的事情很直接:给 Claude 一个视频链接或者本地文件,然后直接问它视频里发生了什么。
比如:/watch 30 秒附近发生了什么?
或者把一段产品录屏丢进去:/watch 这个录屏里的 bug 出现在哪一步?
它不是只读取标题,然后根据标题硬猜;也不只是抓一份字幕,让 Claude 把字幕重新总结一遍。它会同时准备字幕、音频、关键画面和时间戳,再把这些材料交给 Claude。
对用户来说,体感很简单:Claude 终于能看视频了。
但严格来说,Claude 并没有突然长出一个原生的视频大脑。
`claude-video` 真正做的,是把视频翻译成 Agent 已经能够处理的上下文。
它怎么让 Claude “看见”视频
你给它一个视频 URL 或者本地路径后,它会先判断视频里有哪些材料可用。
如果是公开视频链接,它会先用 `yt-dlp` 检查字幕。能直接拿到人工字幕或自动字幕时,就优先使用字幕,因为这样速度快,也不需要额外的转录费用。
如果没有字幕,它会提取音频,再调用 Whisper 转录。目前项目优先支持 Groq 的 `whisper-large-v3`,也可以使用 OpenAI 的 `whisper-1`。没有配置 API key 也不影响看画面,只是没有字幕的视频会退化成纯画面分析。
与此同时,`ffmpeg` 会从视频里提取关键画面。每张图片都带着对应的时间戳,Claude 读取这些图片后,就能把画面与同一时间附近的台词对上。
所以当你问“30 秒发生了什么”,它不是凭整段字幕猜答案,而是可以去看 30 秒附近的画面,再结合那一刻的台词回答。
这套流程里,每个零件都不新鲜:
- `yt-dlp` 负责拿到视频和字幕;
- `ffmpeg` 负责处理音频、抽取画面;
- Whisper 负责给没有字幕的视频转录;
- Claude 负责读字幕、看图片、理解问题并给出判断。
有价值的是,它把这些零件接成了一条完整工作流。以前需要人手动完成的“看视频、暂停、截图、记时间点、整理台词”,现在由 Agent 自己完成。
如果你使用 Claude Code,可以直接添加项目的 marketplace,再安装 `watch` 插件:
/plugin marketplace add bradautomates/claude-video
/plugin install watch
@claude-video
如果你使用 Codex、Cursor、Copilot、Gemini CLI,或者其他支持 Agent Skills 的工具,可以运行:
npx skills add bradautomates/claude-video -g
`-g` 表示安装到当前用户,所有项目都可以使用;去掉 `-g`,则只安装到当前项目。
第一次运行时,工具会检查 `ffmpeg` 和 `yt-dlp`。macOS 可以通过 Homebrew 自动安装;Linux 和 Windows 会给出对应的安装命令。Whisper 的 API key 不是必需项,只有在视频没有字幕、又需要分析语音时才会用到。
以前使用 AI 的默认方式是:人先找到资料,把资料整理成合适的格式,再交给模型。
`claude-video` 展示的是另一种工作方式:Agent 自己去获取材料,自己判断该用字幕还是转录,自己抽取画面,自己控制 token,最后带着整理好的上下文回来跟你讨论。
它并没有发明新的模型能力,只是把现有工具接在了一起。
但产品体验的变化,很多时候就发生在这里。