Files

68 lines
4.4 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 中医入门资料库
> 建库日期: 2026-09-07
> 数据源: MinerU OCR 扫描转换(繁体影印本 → Markdown)
## 一、书籍信息
《中医入门》,秦伯未著作体例,全书分四章:
| 章 | 内容 | 收录内容 |
|----|------|----------|
| 第一章 理论之部 | 中医特点、基本学说、生理、病因 | 整体观念、辨症论治、阴阳五行、经络、预防、五脏六腑、十二经脉、气血精津液、三因 |
| 第二章 法则之部 | 辨症、诊法、治法 | 表里寒热虚实、六经三焦、望闻问切、二十八脉、正治反治、标本、八法、常用治法 |
| 第三章 方剂之部 | 方制、基本方剂和处方 | 君臣佐使、七方、剂型、通治方、脉案处方示例 |
| 第四章 药物之部 | 采集炮制、药性、使用 | 采集炮制、气味效能、扶正祛邪类、归经、配伍禁忌、用量 |
定位(用户定级 2026-09-08):**重要理论基础**。中医入门级理论教材,权威性高于普通科普读物,属系统学习类资料,作为资料库体系的理论层基石。可与健康管理师教材、中华药膳全书、大医网四库交叉关联。
## 二、目录结构与数据谱系
```
中医入门资料库/
├── README.md ← 本文件(数据谱系总览)
├── 01_来源数据/
│ └── 中医入门_MinerU_OCR_2026-09-07.md ← MinerU OCR 原始输出(繁简混杂,224,843 字节,1,829 行)
├── 02_加工数据/
│ ├── 中医入门.md ← 清洗成品(全文简体,224,415 字节)
│ ├── 理论依据库.json ← 应用调用层:八法/治法72/七方/效能15/药组42/示例方40/脉27/用药安全(原文+行号溯源)
│ └── OCR文本清洗报告.md ← 清洗规则表(39+8+12 处错字修正 + 传/傅辨析等,可复用)
├── 03_关联融合/
│ ├── 大医网-中医入门_理论锚点反向标注.json ← 大医网2000实体→本书理论锚点反向标注(243药材+69方剂实质锚点)
│ └── 关联融合总览.json ← 本目录清单与统计
├── 04_分析报告/
├── 初步分析报告.md ← 全书结构与内容要素分析(2026-09-08)
├── 理论依据调用指南.md ← 应用层调用说明(接口用法/依据分级)
├── 人工核对清单.md ← A/B/C 三级核对清单(行号定位)
└── 手工核验复检报告.md ← 用户手工核验后的复检报告(定稿确认)
```
### 数据谱系
```
纸质影印本(繁体竖排)
└─ MinerU OCR 扫描转换 ──→ 01_来源数据/中医入门_MinerU_OCR_2026-09-07.md
└─ OCR 清洗(繁转简 + 错字修正 + 结构重建)──→ 02_加工数据/中医入门.md
└─ 理论锚点反向标注 ──→ 03_关联融合/大医网-中医入门_理论锚点反向标注.json
└─ 分析报告 ──→ 04_分析报告/
```
## 三、清洗质量摘要
详见 02_加工数据/OCR文本清洗报告.md:
- 全文繁转简(OpenCC t2s),转换后繁体残留 0
- OCR 形近错字修正 39 处(逐处上下文核对)
- 傅→传 63 处("相傅"宰相义 1 处保留)
- 辩/辯→辨 统一
- 标题层级重建 58 个(章 ## / 节 ### / 小节 ####)
- MinerU CDN 页面截图引用移除 2 处
- **如实保留**:17 处页边界截断(OCR 逐页丢句,源文件信息缺失);"雷福亭曾说"引文出处存疑未臆改
## 四、后续可扩展方向
1. 交叉关联:与健康管理师教材(治未病/体质)、中华药膳全书(药性/配伍)、大医网四库(方剂/药材/穴位/疾病)建交叉索引 → 03_关联融合
2. 主题分析:如"八法与常用治法对照""二十八脉主症速查"等专题提炼 → 04_分析报告
3. 内容补全:获取完整版本补齐 17 处页边界截断句
4. **理论书群扩展**(用户规划 2026-09-08):将逐步增加理论书籍,与本书共同构成"理论依据层"——新书按六步管线接入(OCR入库→清洗定稿→用户定级→初步分析→依据提取→API多书源扩展),流程见 tcm-data-analysis 技能 references/theory-book-onboarding.md;theory_api.py 预留多书源改造(结果标注书源、冲突按定级排序)