Computers in Biology and Medicine 2024

MedChatZH

基于 Baichuan-7B、在中医典籍与医学指令对话上继续训练的中文医疗问诊大模型,面向临床问答场景中的中医式提问与表述。

Yang Tan, Zhixing Zhang, Mingchen Li, Fei Pan, Hao Duan, Zijie Huang, Hua Deng, Zhuohang Yu, Chen Yang, Guoyang Shen, Peng Qi, Chengyuan Yue, Yuxian Liu, Liang Hong, Huiqun Yu, Guisheng Fan, Yun Tang

MedChatZH:中医与中文医疗问诊大模型概览
MedChatZH 以 Baichuan-7B 为基座,结合中医文献与大规模医学指令数据,适配中文临床对话。

方法

通用中文大模型往往难以把握中医术语、辨证式推理与面向患者的问诊语气。 MedChatZH 从 Baichuan-7B 出发,在中医书籍语料与精选医学指令对话上继续训练,使模型能在对话场景中回答包括中医导向在内的中文医学问题。

权重、推理脚本与简易网页界面随 GitHub 仓库 一并开源;7B 检查点托管于 Hugging Face

数据规模

从约 700 万原始对话中清洗得到两套指令数据包,发布于 Hugging Face Datasets

  • 76.4 万条高质量医学指令对话
  • 200 万条医学 / 通用混合对话,覆盖更广的对话能力

再辅以中医典籍文本,同时提供领域知识与指令遵循能力,支撑问诊式生成。

使用说明

  • 快速对话:scripts/dialog.sh(生成参数见 src/dialog.py
  • 批量 / 脚本推理:scripts/inference.sh
  • 本地网页界面:scripts/interface.sh

仅供科研使用。模型、数据及其衍生版本仅限研究用途,不得用于商业或其他有害场景。 输出可能存在事实错误,不能替代专业医疗建议;项目对使用后果不承担责任。

相关资源目录见 TCM AI

引用

若使用 MedChatZH,请引用:

@article{tan2024medchatzh,
  title={MedChatZH: A tuning LLM for traditional Chinese medicine consultations},
  author={Tan, Yang and Zhang, Zhixing and Li, Mingchen and Pan, Fei and Duan, Hao and Huang, Zijie and Deng, Hua and Yu, Zhuohang and Yang, Chen and Shen, Guoyang and Qi, Peng and Yue, Chengyuan and Liu, Yuxian and Hong, Liang and Yu, Huiqun and Fan, Guisheng and Tang, Yun},
  journal={Computers in Biology and Medicine},
  volume={172},
  pages={108290},
  year={2024},
  publisher={Elsevier},
  doi={10.1016/j.compbiomed.2024.108290}
}