
文章主要内容和创新点主要内容本文聚焦层次文本分类(Hierarchical Text Classification, HTC)任务,即对文本分配具有结构化层次的标签。HTC面临数据稀缺(标签增多导致每个类别标注数据稀疏)和模型复杂(传统模型在大规模标签空间易过拟合或欠拟合)的核心挑战。研究探索了通过API访问的黑盒大语言模型(LLMs)在HTC中的应用潜力,以替代需大量标注数据和计算资源的传统机器学习方法。通过设计三种提示策略(直接叶子标签预测DL、直接层次标签预测DH、自顶向下多步层次标签预测TMH),在零样本和少样本设置下,基于Web of Science(WOS)和Amazon Product Reviews(APR)两个数据集,对比了不同策略的分类准确率和成本效益。实验结果显示:少样本设置的分类准确率显著高于零样本;传统机器学习模型在浅层次标签数据集上表现更优,而LLMs(尤其DH策略)在深层次标签数据集上更具优势;但DH策略因深层次标签所需输入 tokens 更多,导致API成本显著增加。研究表明,黑盒LLMs在HTC任务中具有潜力,但需权衡性能与成本以选择合适的提示策略。创新点将传统层次文本分类的典型解决思路改编为适用于黑盒LLMs的三种提示策略(DL、DH、TMH),为HTC任务提供了轻量化解法。在真实数据集上对三种提示策略进行了全面评估,同时关注准确率和成本(token消耗),填补了黑盒LLMs在HTC任务中成本效益分析的空白。系统对比了零样本和少样本设置下的性能差异,揭示了黑盒LLMs在