📦 deps(thirdparty): update snapshots
This commit is contained in:
@@ -179,6 +179,26 @@ graph TD
|
||||
|
||||
差距不在于 Claude *能不能*发现问题——而在于它能否*每一次都稳定地*发现,并附上可溯源的证据和可落地的对策。
|
||||
|
||||
### 可复现基准
|
||||
|
||||
上表是示意性的。下面这些数字**确定、可在本地复算**:
|
||||
|
||||
**parser 保真度** —— SARIF 输出与 CI 闸门都依赖于正确解析模型的 Markdown 报告。在一个**冻结的 30 份真实模型报告语料**上(覆盖全部六种 mode,`evals/benchmark-corpus.json`),每份都配有**独立评分**的发现清单(由另一遍模型评分、并经人工抽查),实际发布的 parser 跑分如下——执行 `npm run benchmark`:
|
||||
|
||||
| 指标(n = 30,冻结语料) | 结果 |
|
||||
|---|:---:|
|
||||
| 严重度计数精确吻合(parser vs 人工标注真值) | 30 / 30 |
|
||||
| 风险码 precision / recall | 100% / 100%(56 个 finding-level 码,0 假阳 / 0 假阴) |
|
||||
| 产出合法 SARIF 2.1.0 | 30 / 30 |
|
||||
|
||||
由于 parser 是确定性的、语料是冻结的,`npm run benchmark` 对任何人都给出相同结果,`npm test` 也将其作为回归守卫。该语料**有意**包含 9 份假阳性 / tradeoff 报告(例如一个*看起来像*循环依赖、实则是端口与适配器的设计),它们必须保持干净。
|
||||
|
||||
**打分确定性** —— 给定一组固定发现(2 Critical / 3 Warning / 1 Suggestion),三个 strictness 预设产出的分数与其 `common.md` 表的预测分毫不差:strict **34**、balanced **54**、legacy-friendly **74**——且只有 `legacy-friendly` 会优先列出前三高杠杆修复。
|
||||
|
||||
**模型质量** —— 模型能否在真实代码上找到*正确的*风险,由 **57 场景 eval 套件**(`evals/evals.json`)衡量:`npm run evals`(结构校验)与 `npm run evals:live`(实测,需 `ANTHROPIC_API_KEY`)。
|
||||
|
||||
> 范围与诚实说明:parser 数字是确定性的、可精确复算;strictness 与 eval 套件的数字是对模型的单次实测,会有轻微跑动差异。parser 基准衡量的是报告解析保真度(工具是否读出了报告里写的每条发现),而非某条发现"是否正确"。严重度计数吻合是完全独立的信号;风险码一致性还反映了 parser 与 grader 共用同一套权威 name→code 映射。
|
||||
|
||||
## 横向对比
|
||||
|
||||
| | brooks-lint | ESLint / Pylint | GitHub Copilot Review | 原生 Claude |
|
||||
@@ -432,6 +452,8 @@ $brooks-sweep # Codex CLI
|
||||
```yaml
|
||||
version: 1
|
||||
|
||||
strictness: balanced # strict | balanced(默认)| legacy-friendly——对遗留代码更宽松的打分
|
||||
|
||||
disable:
|
||||
- T5 # 跳过覆盖率指标检查——我们不强制覆盖率
|
||||
|
||||
@@ -441,6 +463,9 @@ severity:
|
||||
ignore:
|
||||
- "**/*.generated.*"
|
||||
- "**/vendor/**"
|
||||
|
||||
# custom_risks: # 定义项目专属 Cx 风险码——见 skills/_shared/custom-risks-guide.md
|
||||
# suppress: # 按风险码 + 路径下调特定诊断(如已接受的遗留债务)
|
||||
```
|
||||
|
||||
可复制 [`.brooks-lint.example.yaml`](.brooks-lint.example.yaml) 作为起点。
|
||||
@@ -448,10 +473,13 @@ ignore:
|
||||
|
||||
| 设置 | 说明 |
|
||||
|---------|-------------|
|
||||
| `strictness` | 打分预设:`strict`、`balanced`(默认)或 `legacy-friendly`(更轻的扣分,并优先列出高杠杆修复项) |
|
||||
| `disable` | 要跳过的风险码(`R1`–`R6`、`T1`–`T6`) |
|
||||
| `severity` | 覆盖严重度等级(`critical` / `warning` / `suggestion`) |
|
||||
| `ignore` | 要排除的文件 glob 模式 |
|
||||
| `focus` | 只评估这些风险码(不能与 `disable` 同时使用) |
|
||||
| `custom_risks` | 定义项目专属风险码(`C1`、`C2`……)——见 [`custom-risks-guide.md`](skills/_shared/custom-risks-guide.md) |
|
||||
| `suppress` | 按风险码 + 路径下调特定诊断的严重度(可带 `expires:` 过期日期) |
|
||||
|
||||
---
|
||||
|
||||
@@ -540,11 +568,24 @@ jobs:
|
||||
|
||||
该 Action 会把审查结果作为 PR 评论发布,并可在健康分跌破阈值时让检查失败。若仓库中提交了 `.brooks-lint-history.json`,评论还会包含趋势变化(如 "85 → 82(−3),近 3 次运行")。
|
||||
|
||||
**质量闸门与 Code Scanning。** 除 `fail-below` 外,该 Action 还提供:
|
||||
|
||||
```yaml
|
||||
with:
|
||||
mode: review
|
||||
anthropic-api-key: ${{ secrets.ANTHROPIC_API_KEY }}
|
||||
fail-on: critical # 出现任何 Critical 即失败(none | warning | critical)
|
||||
fail-on-regression: true # 健康分较上次运行下降则失败
|
||||
sarif-file: brooks-lint.sarif # 同时把诊断上传到 GitHub Code Scanning
|
||||
```
|
||||
|
||||
`fail-on-regression` 读取 `.brooks-lint-history.json`,因此提交该文件即可强制"无新增回归"。设置 `sarif-file` 会让诊断直接显示在 PR 的 **Files changed** 标签页,并需要 job 具备 `security-events: write` 权限。
|
||||
|
||||
**成本:** 每次 PR 运行约 $0.05–0.15,取决于 diff 大小和模型。建议仅在 `pull_request` 事件上运行。
|
||||
|
||||
## 路线图
|
||||
|
||||
> **当前状态(v1.0):** 12 本书地基,6 类生产衰退风险(R1–R6)+ 6 类测试衰退风险(T1–T6),5 个技能——PR 审查、架构审查、技术债、测试质量、健康仪表盘。下方较早的条目记录的是历史里程碑,而非当前功能集。
|
||||
> **当前状态(v1.3):** 12 本书地基,6 类生产衰退风险(R1–R6)+ 6 类测试衰退风险(T1–T6),6 个技能——PR 审查、架构审查、技术债、测试质量、健康仪表盘、全量扫描。下方较早的条目记录的是历史里程碑,而非当前功能集。
|
||||
|
||||
- [x] **v0.2**:插件基础设施(`.claude-plugin/`、钩子、斜杠命令)
|
||||
- [x] **v0.3**:八个 Brooks 维度、文档完整度评分
|
||||
@@ -555,6 +596,9 @@ jobs:
|
||||
- [x] **v0.8**:带命名空间命令的独立技能架构
|
||||
- [x] **v0.9**:步骤校验、自动 diff 范围、`/brooks-health` 仪表盘、趋势追踪、分诊模式、`--fix` 对策、上手报告、GitHub Action
|
||||
- [x] **v1.0**:评测自动化(`run-evals-live.mjs`)、自定义风险扩展(`Cx` 码)
|
||||
- [x] **v1.1**:全量扫描技能(`brooks-sweep`)——跨维度统一分析 + 自动修复
|
||||
- [x] **v1.2**:自主化 sweep 管线、`npm run bump` 版本传播
|
||||
- [x] **v1.3**:Codex 市场元数据、多平台一键安装脚本、双语 README + 落地页
|
||||
|
||||
想出一份力?现在最有价值的贡献是新的评测用例和更好的衰退风险症状模式。见 [CONTRIBUTING.md](CONTRIBUTING.md)。
|
||||
|
||||
|
||||
Reference in New Issue
Block a user