★ 26 · 更新于 2026-09-17
生成多分支结构化对比计划与链接证据的报告,且不进行评分或确定胜者。
浏览带有该标签的技能列表。
★ 26 · 更新于 2026-09-17
生成多分支结构化对比计划与链接证据的报告,且不进行评分或确定胜者。
★ 0 · 更新于 2026-09-16
挑选并固定第三方仓库,确定标注范围,准备人工复核工作包,维护真值数据集并裁决标签变更。
★ 24 · 更新于 2026-09-14
将验证过的基准研究产物转化为用于短视频制作的事实立足型营销简报、概念候选、Hook库和测试计划。
★ 3 · 更新于 2026-09-13
通过测量片段级掩码准确率与主体级隐私泄漏评估文本匿名化方法,并衡量文本实用性。
★ 1 · 更新于 2026-09-13
通过追踪驱动的实验和失败分类,改进 AI Agent、检索系统、基准测试框架或工作流。
★ 4 · 更新于 2026-09-13
运行 Criterion 0.5 基准测试,对比已保存的基线,并解析 estimates.json 文件检测性能退化。
★ 3 · 更新于 2026-09-13
评估视觉语言模型在专家级、基于生态学的查询上的文本到图像检索能力。
★ 0 · 更新于 2026-09-11
测量 Web、API 及构建性能指标,保存性能基线,并对比代码变更前后的数据。
★ 12 · 更新于 2026-09-11
基于 do-memory-cli 记录、重放并基准测试真实 Agent 会话。
★ 0 · 更新于 2026-09-10
编写包含指标、分片清单、源校验和、有效性检查及偏差的可复现 PHM 基准测试报告。
★ 1 · 更新于 2026-09-09
使用 Rust 二进制文件或 Python 脚本计算 Codex 与 Claude SSE 日志的 Token 总量及估算成本。
★ 52 · 更新于 2026-06-15
通过红狐API查询抖音账号数据及相似账号推荐
★ 3,468 · 更新于 2026-06-15
运行基准测试、捕获 Tracy 分析数据并优化 Isaac Sim 工作负载
★ 156 · 更新于 2026-05-28
具有锦标赛选择的自主代码进化改进循环控制器
★ 602 · 更新于 2026-05-28
运行WaveCap-SDR测试工具,自动执行参数扫描和验证
★ 0 · 更新于 2026-05-09
查询机器学习模型排行榜和基准(包括 MTEB 和 HuggingFace)的指导
★ 816 · 更新于 2026-03-25
评估扫描结果以符合14个安全框架,生成SBOM和合规报告
★ 0 · 更新于 2026-03-22
自动化本地 CockroachDB 性能检查,执行 DDL 并生成诊断报告
★ 57 · 更新于 2026-03-09
从Codex和Claude SSE日志计算token总数和估算成本
★ 0 · 更新于 2026-02-24
运行 harbor 命令并管理智能体评估任务
Scroll to load more