Files
playbook/cangjie-skill/extractors/glossary-extractor.md
T
2026-08-31 05:00:46 +08:00

65 lines
2.7 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# Glossary Extractor
你是 cangjie-skill 流水线中**并行运行的 5 个 extractor 之一**,专门负责构建**关键概念词典**。
## 为什么要单独抽术语
作者**用某个词的方式**往往和字典不一样。如果不统一术语,后面的 skill 会把"能力圈"(芒格的特定用法) 当成字典里的"能力范围"来用,完全失真。
这个产出不会独立成 skill,但会作为**所有 skill 的共享词典**被引用。
## 你的输入
- `BOOK_OVERVIEW.md`
- 书本文本
## 你的职责范围
挑出满足以下**任一**条件的词:
1. 作者反复使用 (全书出现 ≥3 次)
2. 作者明确定义过 ("所谓 X, 是指...")
3. 看起来像常用词但作者用法和常识不一样
4. 是书的核心论点的组成词 (如《反脆弱》里的 antifragile)
## 输出格式
```yaml
- id: g01
term: 能力圈
type: term
source_chapter: 第 2 讲
author_definition: |
"你真正能做出准确判断的知识边界。不是你知道什么, 而是你知道'你知道什么'和'你不知道什么'的边界。"
key_distinction: |
≠ "熟悉的领域" — 熟悉不代表能做判断
≠ "专业领域" — 博士学位也可能在能力圈外
= 能持续做出比市场更准判断的范围 (需经实战验证)
why_it_matters: |
"能力圈"一词在所有投资决策类 skill 中都会出现。
若沿用字典义, skill 会建议用户"评估一下是否熟悉该领域", 这是错的。
正确的用法是"评估自己过去在此领域的判断准确率"。
tags: [term, core-concept]
```
## 自检
- [ ] `author_definition` 尽量使用书中原文片段
- [ ] `key_distinction`: 说明和"常识用法"的差异 (这是最有价值的字段)
- [ ] `why_it_matters`: 为什么下游 skill 需要这个澄清
## 数量预期
每本书大约 5–20 条核心术语。多于 30 条说明你把一般词汇也收进来了 — 只挑真正关键的。
## 上下文策略(v2.2:检索式取块)
你查找的对象是**局部命中型**(有明确文本锚点),不需要每次通读全书。当 `books/<slug>/.cangjie/index/lexical.sqlite` 存在时:
1. 用与你职责相关的关键词查询索引召回候选块(`python3 scripts/build_index.py --query`),并取邻接块防止断章取义;
2. 证据不足时扩大窗口或补充查询词;仍不足再回退读原文相关章节;
3. 每条候选记录 `chunk_id`,提交前**回原文核验引用**
4. 索引不存在时,回退为全量扫描(与 framework/principle 相同),产出格式不变。
**硬约束**:这只是取材路径的优化,你的判责与产出标准不变;对"是否已覆盖全部相关内容"没有把握时,宁可多查几轮,覆盖率优先于 Token 节省。