youtube-learn - 基于信念考古学与多模态视觉的视频分析
通过多模态帧提取和逐字稿分析,深入解析视频演讲者的底层世界观与核心信念。
标签
更新于: 2026-09-20能力
典型输入
典型输出
该技能可以做什么
- 下载视频音频与画面帧
- 提取并转录视频语音
- 检索演讲者背景与特征
- 剖析演讲者核心世界观
- 对比已有知识库条目
- 生成结构化本地分析文档
输入
- 视频 URL
- 已有知识索引文件
输出
- 视频分析 Markdown 报告
- 视频逐字稿文本文件
- 演讲者个人档案文件
- 世界观 Markdown 文档
- 截取的视频静态帧图像
- 更新后的全局索引地图文件
要求
- ffmpeg 命令行工具
- yt-dlp Python 依赖包
- youtube-transcript-api Python 依赖包
- Python 运行环境
- KYMA、GROQ 或 GEMINI API 密钥
