Skip to main content
关于 comet eval 评估系统、环境准备、报告解读和发布证据的常见问题。

基础概念

comet eval 通过共享 eval harness 执行真实模型任务,验证一个 Skill 作为产品能力能不能通过评估,产出发布前证据。它封装了 pytest、task registry、profile、报告生成,你不需要手工拼参数。详见评估系统概览
comet eval 评估 Skill 的产品能力,产出可复查的评估报告。它可以读 comet/eval.yaml/comet-any 生成的完整包),也可以直接吃任意本地 Skill 目录;没有 manifest 时普通运行会生成并缓存 2–4 个任务,--quick 才是固定的 generic-skill-smoke 冒烟。comet skill check 检查某次 Skill 运行是否缺 artifact 或状态,不执行模型任务,不产出发布证据(读 comet/checks.yaml)。发布 readiness 需要完整包的 comet eval 证据。详见Runtime check
不需要。comet eval 封装了底层细节,你只需要知道用 --manifest 还是 --skill-path。底层细节由 harness 处理。详见Eval harness
创建期评估(comet eval,读本地 Skill 目录或 comet/eval.yaml)和运行期检查(comet skill check,读 comet/checks.yaml)。前者是发布证据,后者是 Run 完成度检查。详见评估系统概览 · 两套评估系统

环境准备

需要 uv、Python 3.11+、Docker、选定的 Agent CLI 以及对应的模型凭证。核心 Comet 运行时不需要这些,只有 comet eval 需要。完整准备步骤见评估快速上手 · 运行前你需要准备什么
几乎肯定是环境没准备好:Docker 没起、模型凭证缺失、或选定的 Agent CLI 不可用。harness 在这些情况下会跳过而不是失败。先确认环境就绪。
macOS/Linux:curl -LsSf https://astral.sh/uv/install.sh | sh。Windows PowerShell:powershell -ExecutionPolicy ByPass -c "irm https://astral.sh/uv/install.ps1 | iex"uv 会自动管理 Python 版本和 eval/.venv
Eval harness is missing at ... 表示 npm 包中的随包 eval/ 不完整,或 --project 指向了错误仓库;重新安装 @rpamis/comet 或修正项目路径。uv is not installed or not in PATH 表示 harness 已找到,只需要安装或修复 uv。npm 用户通常不需要另行 clone Comet 仓库。
export ANTHROPIC_API_KEY=sk-ant-...,或在用户级 %USERPROFILE%\\.comet\\eval\\.env / ~/.comet/eval/.env 里配置(comet eval 会自动加载)。用代理型凭证(BigModel / OpenRouter)时用 ANTHROPIC_AUTH_TOKEN

两种入口

评估任意本地 Skill 目录用 --skill-path(传目录即可,没有 manifest 时普通运行会生成任务),这是默认入口。需要固定冒烟时显式加 --quick。评估 /comet-any 生成的完整包(带 comet/eval.yaml)用 --manifest,跑完整 profile 任务集,结果才是发布证据。要进入发布 readiness 必须用完整包 manifest。两者互斥。
不需要。/comet-any 生成的 <current-bundle-hash> 会在 collect/run 前解析为当前 Bundle draft hash,并写入临时 manifest;源 Bundle 和源 comet/eval.yaml 不会被修改。只有 manifest 已离开原 Bundle、找不到 bundle.yaml 或 draft 无法加载时才会报错。
--quick 配合 --skill-path 使用,明确选中 generic-skill-smoke task。普通传目录运行时会根据 Skill 快照生成并缓存 2–4 个任务;--quick 是低成本冒烟,不等于发布前完整证据,准备发布时仍需走完整包 manifest 路径。
collect 只做发现预检查(验证 manifest、task、路径),不消耗模型调用,成本最低,适合刚生成完 Skill 后排错。run 才执行真实评估。先 collect 能快速发现配置问题,避免浪费模型调用。详见快速上手
authoring-skill(11 维 rubric,auto_usermaxTurns=8 次外层往返)用于 /comet-any 生成的 Skill,检查生成包完整性、resolved-skills 证据、Engine 契约、workflow 路由一致性、authoring lanes、review gate 等。generic(7 维 rubric,默认单轮)用于通用 Skill 冒烟。详见评估系统概览 · Profile 体系

报告与失败

CLI 输出会打印 Report path,通常是 .comet/eval/runs/<experiment-id>/summary.html。请以本次输出的实际 ExperimentReport path 为准。详见读取评估报告
看报告里的 failure attribution(失败归因)。harness 说明环境/依赖/路径问题,workflow 说明 Skill 流程没达预期,task 说明任务定义/fixture 问题,model 说明模型行为不稳定。归因决定你该改什么。详见读取评估报告
检查路径是否正确:本地 Skill 目录要含 SKILL.mdcomet/eval.yaml 要指向真实存在的文件。如果不在 Comet 仓库根目录,加 --project <dir> 指向正确根目录。
model 归因说明模型行为或工具使用不稳定,重跑通常有效。如果反复失败,考虑降低 Skill 对非确定行为的依赖。
算通过。Rubric 是信息性评分([RUBRIC] 行和 RubricAvg),不直接决定通过与否。真正的通过/失败由校验器和 required skill 调用决定。Rubric 分低是诊断信号,可以用来优化 Skill 但不影响发布门禁。

发布证据

Eval 通过只是条件之一。/comet-any 或后端会把 eval 证据纳入 readiness:没有证据、失败、对应旧 hash 都不能 publish。通过且 hash 匹配才能进入 review/publish。详见评估系统概览
说明 Skill 在上次评估后被修改了(draft hash 变了),旧评估结果不再有效。需要重新跑 comet eval ... --html 生成绑定当前 hash 的证据。
不要。/comet-any 会通过 Bundle 后端记录结构化证据。手工编辑 Bundle 状态或内部 JSON 会破坏 hash 绑定和 readiness 校验。
不能。--skill-path --quick 只是早期冒烟,覆盖范围有限。发布前必须通过 /comet-any 生成 comet/eval.yaml,再用 --manifest 跑完整评估。
最后修改于 2026年8月13日