★ 1 · 更新于 2026-09-24
构建智能体系统评估框架,用于系统测试智能体性能、验证上下文工程选择及度量长期改进。
浏览带有该标签的技能列表。
★ 1 · 更新于 2026-09-24
构建智能体系统评估框架,用于系统测试智能体性能、验证上下文工程选择及度量长期改进。
★ 0 · 更新于 2026-09-23
通过性能分析、提示词工程与持续迭代,系统化提升现有 Agent 的表现。
★ 105 · 更新于 2026-09-23
基于139篇全国大学生数学建模竞赛优秀论文提取的决策模式,分析并解决数学建模竞赛问题。
★ 602 · 更新于 2026-09-21
针对大语言模型应用提供执行链路追踪、模型输出数据集评估、生产指标监控与反馈管理功能。
★ 1 · 更新于 2026-09-20
汇总近期已完成 Bean 的编排遥测数据并生成 Markdown 报告,用以评估编排机制是否有效。
★ 602 · 更新于 2026-09-19
通过多个专业 AI 顾问之间的结构化对抗辩论与交叉质询,对提案、计划或决策进行深度评估。
★ 200 · 更新于 2026-09-19
通过派生测试验证 Agent 并行验证 Agent 运行目录下的检查点并生成核查汇总报告。
★ 0 · 更新于 2026-09-18
解答有关 Nemotron 3 Nano 模型架构、训练数据、公开配方、评估、量化和部署的事实性问题。
★ 2,074 · 更新于 2026-09-18
提供关于 Nemotron 3 Nano 架构、训练数据、配方、评估、量化和部署的事实性信息。
★ 470 · 更新于 2026-09-18
SkillAnything 通过七阶段流程,实现目标分析、架构设计、代码实现、测试评估、描述优化与多平台技能打包。
★ 17 · 更新于 2026-09-18
通过运行测试脚本评估 Ralph 帽组预设,记录指标并验证帽路由性能。
★ 9 · 更新于 2026-09-17
检索代码仓库、发布平台与学术文献,提供带定位符的先验技术图景与构建结论。
★ 0 · 更新于 2026-09-17
为 Codex 会话提供正式评估框架,通过代码、模型及人工评分器定义、运行并报告评估指标。
★ 0 · 更新于 2026-09-16
挑选并固定第三方仓库,确定标注范围,准备人工复核工作包,维护真值数据集并裁决标签变更。
★ 64 · 更新于 2026-09-16
通过任务表征、组合策略规划、多源检索执行及质量自我评估来完成研究任务。
★ 1,361 · 更新于 2026-09-16
区分人类与 AI 工具的贡献,提供重塑后的评估标准、团队校准规则及沟通话术。
★ 32 · 更新于 2026-09-16
通过需求调研、发散分析及多轮迭代评估,生成结构化的系统与架构设计文档。
★ 76 · 更新于 2026-09-16
使用 LLM 和反事实探针针对评估者群体优化指定实体。
★ 0 · 更新于 2026-09-16
提供用于评估和改进 AI Agent 输出的模式与技术。
★ 602 · 更新于 2026-09-15
实现评估驱动开发,为 Claude Code 会话定义、运行和汇报能力及回归评估。
Scroll to load more