LogoClawIndex
案例技能关于
LogoClawIndex

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。

带有该标签的 Skills:评估

浏览带有该标签的技能列表。

  • evaluation - 构建智能体系统的评估框架。
    评估智能体系统上下文工程LLM裁判

    ★ 1 · 更新于 2026-09-24

    构建智能体系统评估框架,用于系统测试智能体性能、验证上下文工程选择及度量长期改进。

    ⚙ 构建智能体系统评估框架⚙ 系统测试智能体性能⚙ 验证上下文工程选择
  • agent-orchestration-improve-agent - 优化现有 Agent 性能与提示词质量的工作流
    agent优化提示词工程ab测试性能分析

    ★ 0 · 更新于 2026-09-23

    通过性能分析、提示词工程与持续迭代,系统化提升现有 Agent 的表现。

    ⚙ 分析 Agent 性能数据⚙ 分类系统失效模式⚙ 优化提示词与少样本示例
  • math-modeling-skill - 数学建模竞赛专家
    数学建模国赛优化预测

    ★ 105 · 更新于 2026-09-23

    基于139篇全国大学生数学建模竞赛优秀论文提取的决策模式,分析并解决数学建模竞赛问题。

    ⚙ 分解建模问题与依赖关系⚙ 按数学结构分类子问题⚙ 检索结构相似的历史案例
  • langsmith-observability - 大语言模型应用的链路追踪、评估与监控平台
    可观测性链路追踪模型评估系统监控

    ★ 602 · 更新于 2026-09-21

    针对大语言模型应用提供执行链路追踪、模型输出数据集评估、生产指标监控与反馈管理功能。

    ⚙ 追踪大语言模型应用调用⚙ 对比数据集评估模型输出⚙ 监控生产系统运行指标
  • orchestration-report - 针对已完成 Bean 的编排质量与遥测指标生成评估报告。
    编排报告遥测指标

    ★ 1 · 更新于 2026-09-20

    汇总近期已完成 Bean 的编排遥测数据并生成 Markdown 报告,用以评估编排机制是否有效。

    ⚙ 识别候选 Done 状态 Bean⚙ 解析编排遥测数据字段⚙ 计算编排质量聚合指标
  • workflow-debate - 基于多视角 AI 辩论的思想与方案评估框架
    辩论委员会评估多智能体

    ★ 602 · 更新于 2026-09-19

    通过多个专业 AI 顾问之间的结构化对抗辩论与交叉质询,对提案、计划或决策进行深度评估。

    ⚙ 解析运行参数与评估主题⚙ 创建专业 AI 顾问角色⚙ 收集独立的初始观点陈述
  • validate-run - 并行验证 Agent 运行目录中的所有检查点。
    测试验证检查点子Agent

    ★ 200 · 更新于 2026-09-19

    通过派生测试验证 Agent 并行验证 Agent 运行目录下的检查点并生成核查汇总报告。

    ⚙ 查找运行目录中的检查点⚙ 并行启动测试验证 Agent⚙ 收集测试验证 Agent 报告
  • nemotron-nano3 - Nemotron 3 Nano 问答与知识库
    nemotron-3-nano知识库模型架构模型评估

    ★ 0 · 更新于 2026-09-18

    解答有关 Nemotron 3 Nano 模型架构、训练数据、公开配方、评估、量化和部署的事实性问题。

    ⚙ 回答模型架构问题⚙ 检索训练数据细节⚙ 对比论文与开源配方
  • nemotron-nano3 - Nemotron 3 Nano 模型事实与技术规格参考台
    nemotron-nano3知识库模型架构评估

    ★ 2,074 · 更新于 2026-09-18

    提供关于 Nemotron 3 Nano 架构、训练数据、配方、评估、量化和部署的事实性信息。

    ⚙ 回答模型架构相关问题⚙ 提供训练数据详细信息⚙ 对比论文主张与开源配方
  • skill-anything - 自动为软件、API 与 CLI 工具生成 Agent 技能
    技能生成自动化多平台Agent技能

    ★ 470 · 更新于 2026-09-18

    SkillAnything 通过七阶段流程,实现目标分析、架构设计、代码实现、测试评估、描述优化与多平台技能打包。

    ⚙ 分析软件与 API 目标⚙ 设计技能架构⚙ 生成技能文件与脚本
  • evaluate-presets - 使用脚本系统化测试 Ralph 帽组预设。
    测试评估预设ralph

    ★ 17 · 更新于 2026-09-18

    通过运行测试脚本评估 Ralph 帽组预设,记录指标并验证帽路由性能。

    ⚙ 评估单个预设⚙ 评估所有预设⚙ 提取会话指标
  • priorart - 检查先验技术并评估项目创意的独特性
    先验技术搜索调研构想评估

    ★ 9 · 更新于 2026-09-17

    检索代码仓库、发布平台与学术文献,提供带定位符的先验技术图景与构建结论。

    ⚙ 读取已检查意图日志⚙ 重述项目构想⚙ 生成多视角检索术语
  • eval-harness - 基于评估驱动开发原则的 Codex 会话评估框架。
    评估驱动开发codex测试评估自动化测试

    ★ 0 · 更新于 2026-09-17

    为 Codex 会话提供正式评估框架,通过代码、模型及人工评分器定义、运行并报告评估指标。

    ⚙ 定义能力与回归评估⚙ 执行基于代码的评分器⚙ 执行基于模型的评分器
  • curate-scanner-evaluation-corpus - 构建与维护扫描器评估语料库
    基准测试评估真值数据扫描器

    ★ 0 · 更新于 2026-09-16

    挑选并固定第三方仓库,确定标注范围,准备人工复核工作包,维护真值数据集并裁决标签变更。

    ⚙ 筛选具有覆盖度的候选仓库⚙ 定义详尽的标注范围与规则⚙ 准备人工复核工作包
  • research-task - 使用组合式工作流规划执行研究任务
    研究工作流规划任务执行质量评估

    ★ 64 · 更新于 2026-09-16

    通过任务表征、组合策略规划、多源检索执行及质量自我评估来完成研究任务。

    ⚙ 表征研究任务维度⚙ 查询工作流数据库⚙ 选择研究策略原型
  • ai-assisted-performance-review - 公平评估 AI 辅助工作背景下的员工绩效与贡献
    绩效评估AI辅助工作管理校准

    ★ 1,361 · 更新于 2026-09-16

    区分人类与 AI 工具的贡献,提供重塑后的评估标准、团队校准规则及沟通话术。

    ⚙ 分析评估标准信号归因⚙ 围绕人类核心能力重构标准⚙ 制定混合采纳团队校准规则
  • sisyphus-design - 高质量系统与架构设计技能
    设计架构文档系统设计

    ★ 32 · 更新于 2026-09-16

    通过需求调研、发散分析及多轮迭代评估,生成结构化的系统与架构设计文档。

    ⚙ 使用调研子 Agent 调查需求⚙ 针对关键路径生成发散方案⚙ 向用户展示设计权衡方案
  • sgo - 语义梯度优化
    优化评估LLM画像

    ★ 76 · 更新于 2026-09-16

    使用 LLM 和反事实探针针对评估者群体优化指定实体。

    ⚙ 下载画像数据集⚙ 构建实体文档⚙ 过滤画像数据
  • agentic-eval - Agent 评估模式
    评估反思评估器优化器LLM裁判

    ★ 0 · 更新于 2026-09-16

    提供用于评估和改进 AI Agent 输出的模式与技术。

    ⚙ 实现自我批判与反思循环⚙ 构建评估器-优化器管道⚙ 创建测试驱动的代码重构工作流
  • eval-harness - 面向 Claude Code 会话的正式评估框架。
    评估测试EDDclaude-code

    ★ 602 · 更新于 2026-09-15

    实现评估驱动开发,为 Claude Code 会话定义、运行和汇报能力及回归评估。

    ⚙ 定义能力与回归评估⚙ 运行确定性代码评分器⚙ 运行模型输出评分器

Scroll to load more