Skip to main content
这页集中回答四类问题:评估系统是什么、环境怎么准备、报告怎么读、证据怎么进入发布。

基础概念

comet eval 会在真实任务上运行 Skill,并输出可复查的发布前证据。 它验证的是“这个 Skill 能否作为产品能力稳定交付”,不是只看某次运行是否碰巧成功。 pytest、task registry、profile 和报告生成都由 harness 封装,不需要你手工拼参数。 详见评估系统概览。
comet eval 评估 Skill 的产品能力,并输出可追溯报告。 它可以读取 comet/eval.yaml(常见于 /comet-any 生成包),也能直接评估本地 Skill 目录。 没有 manifest 时,普通运行会生成并缓存 2–4 个任务。 --quick 才会固定为 generic-skill-smoke。 comet skill check 只检查某次 Run 是否缺 artifact 或状态,不执行模型任务,也不产出发布证据(读取 comet/checks.yaml)。 发布 readiness 需要完整包的 comet eval 证据。 详见Runtime check。
不需要。 日常使用只要判断入口:--manifest 还是 --skill-path。 底层运行细节由 harness 处理。 详见Eval harness。
创建期评估(comet eval,读本地 Skill 目录或 comet/eval.yaml)和运行期检查(comet skill check,读 comet/checks.yaml)。前者是发布证据,后者是 Run 完成度检查。详见评估系统概览 · 两套评估系统。

环境准备

需要 uv、Python 3.11+、Docker、选定的 Agent CLI 以及对应的模型凭证。核心 Comet 运行时不需要这些,只有 comet eval 需要。完整准备步骤见评估快速上手 · 你要准备什么。
这类情况多数由环境未就绪导致,样本会被直接跳过。 常见原因是 Docker 未启动、模型凭证缺失、或选定 Agent CLI 不可用。 这类样本会标记为跳过,而不是失败。 建议先做环境自检再重跑。
macOS/Linux:curl -LsSf https://astral.sh/uv/install.sh | sh。Windows PowerShell:powershell -ExecutionPolicy ByPass -c "irm https://astral.sh/uv/install.ps1 | iex"。uv 会自动管理 Python 版本和 eval/.venv。
Eval harness is missing at ... 表示 npm 包中的随包 eval/ 不完整,或 --project 指向了错误仓库。重新安装 @rpamis/comet 或修正项目路径。uv is not installed or not in PATH 表示 harness 已找到,只需要安装或修复 uv。npm 大多数用户不需要另外 clone Comet 仓库。
export ANTHROPIC_API_KEY=sk-ant-...,或在用户级 %USERPROFILE%\.comet\eval\\.env / ~/.comet/eval/.env 里配置(comet eval 会自动加载)。用代理型凭证(BigModel / OpenRouter)时用 ANTHROPIC_AUTH_TOKEN。

两种入口

评估任意本地 Skill 目录用 --skill-path(传目录即可,没有 manifest 时普通运行会生成任务),这是默认入口。需要固定冒烟时显式加 --quick。评估 /comet-any 生成的完整包(带 comet/eval.yaml)用 --manifest,跑完整 profile 任务集,结果才是发布证据。要进入发布 readiness 必须用完整包 manifest。两者互斥。
不需要。/comet-any 生成的 <current-bundle-hash> 会在 collect/run 前解析为当前 Bundle draft hash,并写入临时 manifest。源 Bundle 和源 comet/eval.yaml 不会被修改。只有 manifest 已离开原 Bundle、找不到 bundle.yaml 或 draft 无法加载时才会报错。
--quick 配合 --skill-path 使用,明确选中 generic-skill-smoke task。普通传目录运行时会根据 Skill 快照生成并缓存 2–4 个任务。--quick 是低成本冒烟,不等于发布前完整证据,准备发布时仍需走完整包 manifest 路径。
collect 只做发现与预检查(manifest、task、路径),不触发真实模型调用,成本最低。 run 才会执行完整评估。 先 collect 可以先排掉配置和路径问题,避免浪费评估资源。 详见快速上手。
authoring-skill(11 维 rubric,auto_user 下 maxTurns=8 次外层往返)用于 /comet-any 生成的 Skill,检查生成包完整性、resolved-skills 证据、Engine 契约、workflow 路由一致性、authoring lanes、review gate 等。generic(7 维 rubric,默认单轮)用于通用 Skill 冒烟。详见评估系统概览 · Profile。

报告与失败

CLI 会打印 Report path,常见路径是 .comet/eval/runs/<experiment-id>/summary.html。请以本次输出中的 Experiment 与 Report path 为准。详见读取评估报告。
先看报告里的 failure attribution(失败归因)。 harness 多半是环境、依赖或路径问题。 workflow 代表 Skill 流程未达到预期。 task 代表任务定义或 fixture 有问题。 model 代表模型行为或工具调用不稳定。 归因会直接决定下一步该改环境、改任务还是改 Skill。 详见读取评估报告。
检查路径是否正确:本地 Skill 目录要含 SKILL.md,comet/eval.yaml 要指向真实存在的文件。如果不在 Comet 仓库根目录,加 --project <dir> 指向正确根目录。
model 归因说明模型行为或工具使用不稳定,重跑多数情况下有效。如果反复失败,考虑降低 Skill 对非确定行为的依赖。
算通过。Rubric 是信息性评分([RUBRIC] 行和 RubricAvg),不直接决定通过与否。通过条件由校验器和 required skill 调用决定。Rubric 分低是诊断信号,可以用来调整 Skill,但不影响发布门禁。

发布证据

Eval 通过只是条件之一。/comet-any 或后端会把 eval 证据纳入 readiness:没有证据、失败、对应旧 hash 都不能 publish。通过且 hash 匹配才能进入 review/publish。详见评估系统概览。
说明 Skill 在上次评估后被修改了(draft hash 变了),旧评估结果不再有效。需要重新跑 comet eval ... --html 生成绑定当前 hash 的证据。
不要。/comet-any 会通过 Bundle 后端记录结构化证据。手工编辑 Bundle 状态或内部 JSON 会破坏 hash 绑定和 readiness 校验。
不能。--skill-path --quick 只是早期冒烟,覆盖范围有限。发布前必须通过 /comet-any 生成 comet/eval.yaml,再用 --manifest 跑完整评估。
最后修改于 2026年9月4日