中医大模型 · 数据集
中医大模型数据集
面向中医大模型训练与评测的公开数据集:指令微调、医案问答、方剂、古籍语料与基准评测集。
TCM-RobustSDT
中医临床推理LLM鲁棒性基准数据集(Figshare)
HSQ-TD(健身气功指令微调数据集)
健身气功养生领域首个指令微调数据集,57,843条指令基于官方教材与专业文献蒸馏(ScienceDB)
OASIS (KIOM)
韩国韩医学研究院的传统医学文献与资源门户,可检索韩医论文与本草资料
Korean Medicine Embedding Dataset
从韩医术语与本体构造的query–positive–negatives(约11.3万对),用于BGE-M3等检索微调
KNApSAcK KAMPO
奈良先端大整理的汉方公开库(约1581处方、278生药),生命科学数据库档案可下载
webMedQA
从健康咨询网站收集的中文非事实型医问(约6.3万问,1正4负答案),早期中文医疗QA常用源
IMCS-21
约4116场儿科在线问诊,带实体/意图/症状/报告标注,后接入CBLUE四任务
CBLUE
中文生物医学NLU总榜(NER/关系/诊断归一化/分类等),PromptCBLUE的源任务集;天池有提交入口
CMeKG
覆盖疾病、药物、症状等的中文医学KG,本草/华驼和ChatGLM-Med的指令数据主要来源;原门户不稳,核验走工具仓
MedDialog
大规模医患对话(中文约110万场),中文医疗多轮问诊微调的常用源数据
cMedQA2
中文医疗论坛问答(约10.8万问/20万答),扁鹊语料和后续SFT常把它当作源数据
cMedQA
从中文健康社区抓取的问答匹配集(仓库表:约 5.4 万问 / 10.2 万答,非商用研究);论文 DOI 与 README 对得上,后续版本见 cMedQA2
ChiMed (Qilin)
Qilin-Med发布的约3GB中文医疗语料(CPT/SFT/DPO),与预训练集ChiMed 2.0不是同一资源
DISC-Med-SFT
复旦DISC配套的约47万条医疗对话SFT(图谱三元组+真实问诊重构),不含偏好数据
PromptCBLUE
把CBLUE的16项中文医疗NLP任务改写成生成式指令,CCKS-2023评测任务,中文医疗LLM早期统一榜之一
Huatuo-26M
目前最大的开源中文医疗QA(约2600万对),含百科/图谱/问诊;精简版Huatuo-Lite常被拿来SFT或RAG
CMExam
源自国家医学考试的中文医考题(约6.8万),带多维标注,常被中文医疗/中医LLM当知识回忆对照
CMB
中大深圳FreedomIntelligence的中文医疗综合基准:CMB-Exam约28万题+CMB-Clin复杂病案,中医论文里最常见的西医/综合对照榜
TM-MC
韩国韩医学研究院从文献抽取的东北亚药材–化合物库;2015初版约536种药材,2024的2.0扩到约3.4万化合物;官网当前超时
CVDHD
面向心血管病的本草化合物三维结构、靶点与通路库,用于虚拟筛选与网络药理;原北大站点当前超时
TCMGeneDIT
从文献挖掘中药、基因、疾病、功效与成分关联,并接入通路与PPI;官网tcm.lifescience.ntu.edu.tw已无法解析
TCM-Mesh
草药–化合物–基因–疾病网络与毒副作用记录(约6235味药);官网当前403,核验走开放论文
TCMAnalyzer
中山大学RCDD的方剂/药材/成分网络分析与骨架检索服务(约1493方、618味药);官网rcdd.org.cn当前超时
SuperTCM
Charité团队整合药典与多源数据的中药–物种–成分–靶点–通路–疾病库(约6516味药);官网tcm.charite.de已无法解析
CMAUP
BIDD的有用植物(含中药)多靶点活性、通路与疾病景观库,2024版扩展功能与关联信息,站点可下载
DCABM-TCM
文献挖掘的方剂/草药入血原型与代谢物及其检测条件(约1816个有结构入血成分)
ITCM
整合多方剂/药材/成分/靶点,并提供496个中药成分的1488条药理转录谱;成分表达数据另见Synapse
TCMBank
可下载的大规模中药–成分–靶点–疾病关系库,含文献自动抽取后人工核对的持续更新模块
YaTCM
约1813首方、6220味药、4.7万天然产物及靶点/通路分析工具;南开官网当前403,核验走开放论文
CEMTDD
以新疆维吾尔/哈萨克等民族药为主的草药–化合物–靶点–疾病库(约621草药);原域名cemtdd.com已改作他用,核验走PMC论文
TCMIO
面向免疫肿瘤的中药/方剂–成分–靶点–通路库,提供浏览、下载与REST API
LTM-TCM
整合十四个权威库与临床/古籍记录的症状–方剂–植物–成分–靶点平台(约4.8万方);官网cloud.tasly.com域名已无法解析,核验走论文DOI
HIT 2.0
人工审核的草药成分–靶点活性对(约1237成分/2208靶点),覆盖2000–2020文献;门户可打开,分析后端端口当前不通
TCM Database@Taiwan
453味药材中约2万个分离化合物的2D/3D结构库,面向虚拟筛选;原站tcm.cmu.edu.tw已不可达,核验走PLOS论文页
BATMAN-TCM 2.0
已知与预测的中药成分–靶蛋白相互作用库,2.0大幅扩充TTI覆盖并支持由靶反查成分
SymMap 2.0
草药–中医症状–西医症状–成分–靶点–疾病整合库,2.0按新版药典扩草药/证候并开放关系表下载
HERB 2.0
整合临床试验、荟萃分析、高通量实验与文献的中药证据库,并提供实体关系知识图谱
ETCM 2.0
收录古代方剂、中成药、药材与成分,并提供成分靶点与多尺度网络;v1站点仍在,现行入口为ETCM2
TCM-ID
新加坡BIDD维护的方剂–药材–成分–靶点库,含药典/经典方与CFDA批准方;与TCMID 2.0不是同一资源
TCMID 2.0
上海团队的方剂–草药–成分–靶点整合库(与NUS的TCM-ID不是同一库);官网megabionet已不可达,公开核验走Zenodo摘录与NAR论文
TCMSP
草药–成分–靶点–疾病网络与ADME参数平台,现行公开站为TCMSP 2.3,提供草药/分子/靶点关系表下载
TCM-QG
约 5000 篇中医文本、1.3 万问答对,用来补知识库和自动提问(CC BY-SA 4.0)
TCM-PD
Yao 等 TKDE 2018 处方主题模型配套数据:原始 98334 首、预处理 33765 首(症状–中药 ID);CKCEST 版权、仅研究使用。PresRecST 的 prescript_1195.csv 即此集复现表
TCM-Lung
河南中医药大学一附院肺系病案处理后 14948 条,仓库公开 4484 条编码(症状/证候/治法/处方 ID);全名需邮件申请。与 TCMNSCLC 不是同一份数据
TCM-SD
首个大规模公开中医辨证文本基准(54152 条真实病历、148 证,CC BY-NC-SA 4.0);仓库写明完整数据在 TCM_SD_with_knowledge,天池 dataId=139034
TCM-NER
1997 篇中药说明书、13 类实体共 59803 个标注,用来自动构建用药知识图谱(CC BY-SA 4.0)
TCM_KG
ChatMed 知识图谱
TCM-MKG
TCM-MKG 中医药多维知识图谱
LingShu(灵枢知识图谱)
北交大等症状中心中西医桥接图谱(导出约1733万实体、3947万关系,含三元组+上下文四元组),门户提供可视化、推理与有据问答
OpenTCM-KG
OpenTCM 妇科古籍知识图谱(约 4.8 万实体 / 15.2 万关系)
TCMNSCLC
真实世界医案全标注(辨证/治法/汤药/中成药)的中医推理数据集
ChP-TCM
基于《中国药典》一部构建的KnowledgeQA与PrescriptionWriting指令数据
Traditional-Chinese-Medicine-Dataset-SFT
高质量中医 SFT 数据集
TCMChat-dataset-600k
TCMChat-dataset-600k 中药知识问答与推荐指令数据
TCM-Instruction-Tuning-ShizhenGPT
ShizhenGPT 多模态指令微调数据(文本/视觉/语音/ECG 等,论文 Table 3 合计约 31.1 万条)
ShenNong_TCM_Dataset
中医药指令数据集 ShenNong_TCM_Dataset
MedChatZH
MedChatZH 中医问诊数据集
ChatMed_Consult_Dataset
中文医疗在线问诊数据集 ChatMed_Consult_Dataset(50w+在线问诊+ChatGPT回复)
CMtMedQA
CMtMedQA 仲景真实多轮医患对话(约 7 万条)
Baize-TCM-Corpus-V3
约15.7万条中医QA,覆盖理论、中药、方剂、诊断、针灸与临床
neijing-sft-v1.2
杏核配套约2009条内经相关指令数据,含thinking/output字段
TCM-Text-Exams
TCM-Text-Exams 近年中医执业/考研真题文本基准
Medical-LLMs-Chinese-Exam
医疗大模型中文考试评估
ZhongJing-OMNI
ZhongJing-OMNI 中医多模态评测(含舌诊)
TCMEval-SDT
中医辨证思维评测基准,含 300 例证候诊断案例(来源网络、古籍与医院病案),元数据遵循 FAIR 原则(Scientific Data 2025)
TCMBench
面向中医领域的综合性大模型评测基准 TCMBench(arXiv 2024)
TCM-Vision-Benchmark
TCM-Vision-Benchmark 中医视觉评测(药材识别/望诊等,约 7k 题)
TCM-Tongue
6719张标准化舌象、20类病理多标签公开数据集,含检测基线
TCM-Ladder
中医多模态问答评测基准 TCM-Ladder,面向真实世界任务综合评估中医多模态大模型(arXiv 2025)
TCM-Eval
TCM-Eval 动态可扩展中医评测基准
TCM-BEST4SDT
TCM-BEST4SDT 辨证论治病例评测基准
TCM-5CEval
TCM-5CEval 五维中医深度评测
TCM-3CEval
TCM-3CEval 核心知识·经典理解·临床决策三轴评测
MTCMB
中医多任务评测基准 MTCMB 数据,覆盖知识、推理与安全维度,12 子集约 7100 样本(arXiv 2025)
HWTCMBench
HWTCMBench 中医能力评测集
TCMEval-PA
328道处方规范性与合理性选择题,面向中药处方安全审核评测
TCM-AQA61
针灸(A)与推拿(T)各 61 名受试者的第一人称+第三人称同步视频,两位中医师标注分类与连续指标;配套跨视角多模态评估框架 CME-AQA
LingLan
LingLan(灵兰秘典)大规模多任务中医评测基准 (2026)
ChiMed 2.0
ChiMed 2.0 中文医疗预训练数据集(覆盖中医语料)
classical-tcm-canon
中医经典全文数字化语料:内经、难经、伤寒论、金匮要略及温病经典
Traditional-Chinese-Medicine-Dataset-Pretrain
非网络来源高质量中医预训练数据集(约 1GB),含临床案例、名家典籍、医学百科等,99% 简体中文
TCM-Pretrain-Data-ShizhenGPT
ShizhenGPT 中医预训练语料(论文报告共 15B+ tokens:Stage1 文本 11.92B 含 6.3B 中医语料,Stage2 多模态约 3.6B)
TCM-Ancient-Books
中医药古籍文本语料合集,收录近 700 项古籍文本
awesome_Chinese_medical_NLP
中文医学 NLP 公开资源整理:术语集、语料库、词向量、预训练模型、知识图谱、NER、QA 等(含 CBLUE 挑战榜)
CPM中成药数据集
RAG-CPMF配套的持续更新大规模中成药公开数据