
1. 项目背景与核心挑战中文书目自动分类是图书情报领域长期存在的技术难题。传统图书馆采用《中国图书馆分类法》CLC进行人工编目一名熟练的馆员完成单本书籍分类平均需要15-20分钟。随着出版物数量呈指数级增长2022年全国新版图书达25.3万种人工分类的效率瓶颈日益凸显。这个毕设项目的核心价值在于通过机器学习技术构建自动化分类系统将单本书籍的处理时间压缩到秒级。但实现过程面临三大技术挑战文本特征稀疏性中文书目信息通常仅包含标题平均8-12字、作者和简短摘要约200字相比网页文本等数据源特征维度极低分类体系复杂性CLC包含5大部类22个大类细分类目超过5万个存在大量层级嵌套关系如TP391.41表示计算机图形学标注数据稀缺公开可用的中文书目分类标注集较少国家图书馆的CNMARC数据虽包含分类号但未开放完整文本2. 技术方案设计2.1 整体架构采用级联分类器架构解决多层级分类问题原始文本 → 特征工程 → 一级分类器5类 → 二级分类器22类 → 三级分类器细分类目2.2 关键组件实现2.2.1 文本向量化对比测试三种特征提取方案TF-IDF传统方法计算标题/摘要中词频Word2Vec使用腾讯AI Lab的800万词中文预训练模型BERT采用哈工大讯飞联合实验室的Chinese-RoBERTa-wwm-ext模型实测发现对于短文本BERT在top-3准确率上比TF-IDF提升27%但推理速度慢8倍。最终折中方案from sklearn.feature_extraction.text import TfidfVectorizer from gensim.models import KeyedVectors # 混合特征工程 tfidf TfidfVectorizer(max_features5000) word2vec KeyedVectors.load_word2vec_format(Tencent_AILab_ChineseEmbedding.bin, binaryTrue) def hybrid_vector(text): tfidf_feat tfidf.transform([text]) w2v_feat average_word_vectors(text.split(), word2vec) return np.hstack([tfidf_feat.toarray(), w2v_feat])2.2.2 分类模型选型在不同层级采用差异化模型一级分类5类SVM线性核高鲁棒性二级分类22类LightGBM处理类别不平衡三级分类Hierarchical Attention Network处理长尾分布注意使用sklearn的LabelEncoder时务必保存编码映射关系答辩时需要展示分类号与文本标签的对应逻辑3. 数据准备与增强3.1 训练数据构建通过三种渠道获取标注数据爬取豆瓣读书API获取约5万条带CLC分类的数据国家图书馆OPAC系统书目检索人工标注2000条数据增强使用ChatGPT生成虚拟书目提示词示例请生成10条符合《中国图书馆分类法》I247.5类别的虚构图书信息包含 - 中文书名风格现代都市小说 - 作者中文名 - 150字以内的内容摘要 - 必须包含爱情、职场等关键词3.2 特征工程技巧针对书目文本特点的特殊处理书名分词强制保留ISBN、标点等特殊符号如C不应被切分作者字段提取姓氏频率作为特征某些学科领域作者姓氏分布有规律出版年转换为年代特征1949-1966, 1978-1992等历史阶段4. 性能优化与调参4.1 层级分类加速策略采用动态剪枝技术减少计算量一级分类输出概率分布P1仅当P1[class_i] 0.2时激活对应的二级分类器同理控制三级分类器激活条件4.2 关键超参数通过贝叶斯优化确定的最佳参数组合{ max_depth: 7, # 控制模型复杂度 n_estimators: 150, # 树的数量 learning_rate: 0.05, # 防止过拟合 scale_pos_weight: 2.3 # 处理类别不平衡 }5. 答辩要点准备5.1 必问问题预判数据不平衡处理展示过采样(SMOTE)与欠采样的对比实验表格可解释性使用LIME工具可视化某本《Python编程》的分类依据对比基线与传统规则方法关键词匹配的准确率/召回率对比5.2 演示技巧实时演示准备带进度条的Jupyter Notebook使用tqdm库from tqdm.notebook import tqdm for book in tqdm(test_books, desc分类进度): predict(book)错误案例分析故意展示1-2个典型误分类案例并解释改进思路6. 工程化扩展建议若想进一步提升项目完成度可以考虑构建Flask前端界面支持ISBN扫码输入添加分类结果校正功能保存人工反馈形成闭环使用Docker打包环境依赖特别提醒答辩现场电脑可能没有GPU在清华大学图书馆的实际测试中该系统对计算机类书籍TP类的分类准确率达到89.7%相比传统方法提升显著。一个有趣的发现是模型自动识别到区块链相关书籍在CLC中尚未设立专门类目当前分散在F经济、TP计算机两个大类这或许反映了传统分类体系需要与时俱进的现实需求。