单人
skill-rsi

Skill 评测与优化

“俺寻思行吧”

AgentSkill评测BenchmarkLLM-as-a-Judge可复现

Coding Agent 已经进入“人人可以扩展”的阶段。Claude Code、Codex、Pi Agent 等工具都支持以 Skill、Prompt 片段、工具集或者子 Agent 的形式给 Agent 增加能力,社区里每天都有新的 Skill 被发布,团队内部也在不停地写各类 Skill。

但一个尴尬的事实是:写一个 Skill 只需要十分钟,判断它到底有没有用却几乎没有人做。大部分 Skill 的“有效性”来自“俺寻思”,来自几次成功的截图,或者来自“加上以后好像没那么容易出错了”。同时,模型的不同/模型升级对 Skill 的有效性也存在影响,模型升级以后 Skill 是否还有效?应该修改/优化还是直接弃用?一个 Skill 提升了成功率,是不是同时让 Token 消耗翻了三倍?这些问题目前并没有一个可靠的方式来进行回答。

任务要求

本题希望你设计并实现一套针对 Skill 的评测与优化系统:选定一个 Skill,给定一组任务,能够以可复现的方式运行“加载”与“不加载”这个 Skill 以及它的不同版本,记录完整的执行过程,产出可以互相比较的评测报告,回答“这个 Skill 到底有没有用,有多大用,代价是什么”;并进一步利用评测中发现的问题,定位 Skill 在哪里失效,有依据地修改它,再用评测验证修改是否有效。注意,选择一个过于简单、几乎不可能失效的 Skill 会让后面的归因和优化无从下手。

Skill 和评测的领域自选,被评测的 Skill 可以是自己编写的,也可以来自社区,但需要收敛到一个具体方向,例如某一类编程任务、某一类运维操作、某一类文档处理或者数据分析任务。过程中请至少构建 3 个任务,其中大部分任务应当具有可以自动判定的正确标准,例如测试用例、期望输出或者可校验的最终状态。少量只能主观判断的任务可以保留。你的 Skill 应该在主流的 Harness(Claude Code、Codex、Pi Agent、dsh 等)和主流模型上都可以正常使用。

技术选型不限,建议流程包括自动化运行、对照实验、任务级下钻、失效归因、修改与再验证,同时需要尽量避免过拟合到特定任务,并增加消融实验(判断没有 Skill 会差多少)。

注意,在完成这个评测时,增加 Agent 的可观测性,记录整个 Agent Loop 的 Trace,方便后续人或 Agent 对其进行分析。


附录:参考资料

出题人:PEScn