ml-cluster - 自动发现数据中的自然分组并生成描述标签
使用无监督聚类算法发现数据集中的自然分组,并为每个分组生成通俗易懂的语言描述与标签。
标签
更新于: 2026-09-19该技能可以做什么
- 检查运行环境并加载数据集
- 生成文本或数值数据特征表示
- 使用 UMAP 降低特征维度
- 使用无监督算法执行数据聚类
- 生成通俗语言的聚类标签
- 展示格式化的数据聚类结果摘要
- 保存与恢复运行检查点
输入
- 数据文件或文本目录路径
- 可选的自然语言聚类目标
输出
- 格式化的聚类结果展示
- 检查点目录中的 checkpoint 文件
- 共享缓存中的嵌入向量表示
要求
- 带 uv 运行环境的 Python 3
- pandas 依赖包
- scikit-learn 依赖包
- 用于生成标签的 LLM 访问权限
- 可选的 sentence-transformers 依赖包
- 可选的 umap-learn 依赖包
- 可选的 hdbscan 依赖包
